BaseRT é um tempo de execução de inferência LLM nativo do Metal, construído do zero para Apple Silicon, que oferece o melhor rendimento de preenchimento e decodificação da categoria, sendo fornecido como um CLI, API C e ligações multi-idioma com serviço compatível com OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

Informações do Produto

Atualizado:Jul 21, 2026

O que é BaseRT

BaseRT é um tempo de execução de inferência de IA construído especificamente para executar grandes modelos de linguagem no Apple Silicon. Ao contrário de muitos tempos de execução que se baseiam em frameworks de ML de propósito geral, o BaseRT é escrito diretamente contra a API Metal GPU da Apple e evita intencionalmente dependências de MLX, PyTorch, CoreML ou outras camadas intermediárias. Ele é distribuído como uma cadeia de ferramentas fácil de instalar (CLI mais uma API C estável) com ligações para linguagens como Python, Node, Rust e Swift, permitindo tanto o uso local (puxar e conversar com modelos) quanto casos de uso de implantação (servir uma API compatível com OpenAI).

Principais Recursos do BaseRT

BaseRT é um tempo de execução de inferência LLM de alto desempenho para Apple Silicon, construído diretamente na API Metal GPU da Apple (sem MLX, PyTorch, CoreML ou outros frameworks intermediários). Ele se concentra em maximizar o throughput e diminuir a sobrecarga através de fusão de kernel específica do chip, otimizações cientes de memória unificada e lógica de despacho personalizada, alcançando o melhor desempenho de decodificação e preenchimento em comparação com tempos de execução locais comuns da Apple. O BaseRT é fornecido como um CLI mais uma API C estável com "language bindings", e pode rapidamente puxar modelos do Hugging Face, executar chat local ou servir uma API HTTP compatível com OpenAI para aplicativos e agentes—mantendo a inferência privada e no dispositivo.
Tempo de execução Metal nativo (sem framework): Implementado diretamente contra a API Metal da Apple para evitar a sobrecarga de abstração de MLX/PyTorch/CoreML e melhor corresponder ao modelo de execução do Metal e à topologia de memória unificada do Apple Silicon.
Melhor throughput da categoria no Apple Silicon: Benchmarkado como mais rápido que MLX e llama.cpp, com ganhos relatados de até ~33% na decodificação e grandes melhorias no preenchimento (especialmente forte em prompts longos e cargas de trabalho estilo MoE).
Descritor de arquitetura para famílias de modelos: Codifica diferenças arquitetônicas (ativações, variantes de normalização, convenções de atenção/posicionais, especificidades de roteamento MoE) em um descritor compacto em vez de "hard-coding" muitas ramificações no loop de inferência.
Amplo suporte à quantização: Suporta múltiplos formatos de quantização (desde quantização de baixo bit até FP16), permitindo que os usuários equilibrem qualidade, memória e velocidade em dispositivos Apple da série M.
Fluxo de trabalho CLI amigável ao desenvolvedor: Instale com um único script, puxe modelos do Hugging Face e converta para um formato de tempo de execução, então execute comandos de chat ou serviço com configuração mínima.
Serviço local compatível com OpenAI + "bindings": Executa um servidor HTTP compatível com OpenAI para chat/conclusões e fornece uma API C estável com "bindings" (por exemplo, Python/Node/Rust/Swift) para incorporação em aplicativos e ferramentas.

Casos de Uso do BaseRT

Assistentes privados no dispositivo para empresas: Execute assistentes de chat internos localmente no Apple Silicon (sem dados saindo do dispositivo), útil para ambientes regulamentados e documentos sensíveis.
Agentes de codificação locais e ferramentas de desenvolvedor: Sirva um modelo local e aponte agentes de codificação/IDEs para o endpoint compatível com OpenAI para obter ajuda de código rápida e de baixa latência sem chaves de API na nuvem.
Inferência de borda para aplicativos offline ou de baixa latência: Implante recursos LLM em laptops/tablets em trabalho de campo, saúde ou cenários de viagem onde a conectividade é limitada e a latência importa.
Prototipagem e avaliação de produtos em Macs: Teste rapidamente vários modelos abertos e quantizações via CLI (puxar/conversar/servir) para comparar UX, latência e custo antes de se comprometer com a implantação na nuvem.
Capacidades LLM incorporadas em aplicativos macOS/iOS: Use a API C e os "language bindings" para integrar a inferência LLM local em aplicativos nativos que precisam de desempenho e privacidade previsíveis.

Vantagens

Alto desempenho no Apple Silicon (notavelmente forte throughput de decodificação e preenchimento em comparação com tempos de execução locais comuns).
A abordagem Metal sem framework reduz a sobrecarga e melhora o potencial de otimização específica do hardware.
Empacotamento conveniente: CLI + servidor compatível com OpenAI + API C estável com múltiplos "language bindings".

Desvantagens

Focado em Apple Silicon/Metal (não é um tempo de execução de inferência multiplataforma geral).
Algumas abordagens concorrentes podem aproveitar o Apple Neural Engine via MPSGraph para certas cargas de trabalho, enquanto o caminho do BaseRT é descrito como focado em GPU (pelo menos em comparações atuais).
Requer conversão de modelo para um formato específico de tempo de execução (por exemplo, puxado/convertido para um formato BaseRT) em vez de executar "checkpoints" arbitrários diretamente.

Como Usar o BaseRT

1) Instale o BaseRT (CLI + engine): No macOS Apple Silicon, instale o BaseRT em seu PATH executando: curl -LsSf https://basecompute.co/install.sh | sh Após a instalação, confirme se o comando `basert` está disponível (por exemplo, execute `basert --help`).
2) Puxe um modelo do Hugging Face (e converta para o formato .base): Use o CLI do BaseRT para baixar um modelo suportado do Hugging Face e convertê-lo para o formato otimizado `.base` do BaseRT: basert pull Qwen/Qwen3-4B (Substitua por qualquer ID de modelo suportado.)
3) Converse com um modelo local a partir do terminal: Inicie uma sessão de chat interativa com um modelo que você puxou: basert chat Qwen/Qwen3-4B Isso executa o modelo localmente em sua máquina.
4) Sirva uma API HTTP compatível com OpenAI localmente: Execute o BaseRT como um servidor local que expõe endpoints compatíveis com OpenAI: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 Use a chave de API impressa/selecionada ao chamar o servidor a partir de clientes.
5) (Opcional) Execute um agente de codificação contra seu servidor BaseRT local: Sirva um modelo e conecte um agente de codificação local para que as solicitações permaneçam no dispositivo: # Sirva um modelo basert serve basecompute/gemma-4-E4B-it # Instale o plugin coding-agent pi install git:github.com/basecompute/pi-basert # Execute o agente pi

Perguntas Frequentes do BaseRT

BaseRT é um tempo de execução de inferência de IA da Base Compute projetado para executar grandes modelos de linguagem de forma eficiente no Apple Silicon. Ele é escrito diretamente contra a API Metal da Apple (não construído em MLX, PyTorch, CoreML ou outros frameworks intermediários) e é posicionado como "o tempo de execução de inferência LLM mais rápido para Apple Silicon."

Ferramentas de IA Mais Recentes Semelhantes a BaseRT

Athena AI
Athena AI
O Athena AI é uma plataforma versátil alimentada por IA que oferece assistência de estudo personalizada, soluções de negócios e coaching de vida por meio de recursos como análise de documentos, geração de questionários, flashcards e capacidades de chat interativo.
Aguru AI
Aguru AI
Aguru AI é uma solução de software local que fornece ferramentas abrangentes de monitoramento, segurança e otimização para aplicações baseadas em LLM, com recursos como rastreamento de comportamento, detecção de anomalias e otimização de desempenho.
GOAT AI
GOAT AI
GOAT AI é uma plataforma alimentada por IA que fornece capacidades de resumo com um clique para vários tipos de conteúdo, incluindo artigos de notícias, trabalhos de pesquisa e vídeos, enquanto também oferece orquestração avançada de agentes de IA para tarefas específicas de domínio.
GiGOS
GiGOS
O GiGOS é uma plataforma de IA que fornece acesso a múltiplos modelos de linguagem avançados como Gemini, GPT-4, Claude e Grok com uma interface intuitiva para os usuários interagirem e compararem diferentes modelos de IA.