
BaseRT
BaseRT é um tempo de execução de inferência LLM nativo do Metal, construído do zero para Apple Silicon, que oferece o melhor rendimento de preenchimento e decodificação da categoria, sendo fornecido como um CLI, API C e ligações multi-idioma com serviço compatível com OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Informações do Produto
Atualizado:Jul 21, 2026
O que é BaseRT
BaseRT é um tempo de execução de inferência de IA construído especificamente para executar grandes modelos de linguagem no Apple Silicon. Ao contrário de muitos tempos de execução que se baseiam em frameworks de ML de propósito geral, o BaseRT é escrito diretamente contra a API Metal GPU da Apple e evita intencionalmente dependências de MLX, PyTorch, CoreML ou outras camadas intermediárias. Ele é distribuído como uma cadeia de ferramentas fácil de instalar (CLI mais uma API C estável) com ligações para linguagens como Python, Node, Rust e Swift, permitindo tanto o uso local (puxar e conversar com modelos) quanto casos de uso de implantação (servir uma API compatível com OpenAI).
Principais Recursos do BaseRT
BaseRT é um tempo de execução de inferência LLM de alto desempenho para Apple Silicon, construído diretamente na API Metal GPU da Apple (sem MLX, PyTorch, CoreML ou outros frameworks intermediários). Ele se concentra em maximizar o throughput e diminuir a sobrecarga através de fusão de kernel específica do chip, otimizações cientes de memória unificada e lógica de despacho personalizada, alcançando o melhor desempenho de decodificação e preenchimento em comparação com tempos de execução locais comuns da Apple. O BaseRT é fornecido como um CLI mais uma API C estável com "language bindings", e pode rapidamente puxar modelos do Hugging Face, executar chat local ou servir uma API HTTP compatível com OpenAI para aplicativos e agentes—mantendo a inferência privada e no dispositivo.
Tempo de execução Metal nativo (sem framework): Implementado diretamente contra a API Metal da Apple para evitar a sobrecarga de abstração de MLX/PyTorch/CoreML e melhor corresponder ao modelo de execução do Metal e à topologia de memória unificada do Apple Silicon.
Melhor throughput da categoria no Apple Silicon: Benchmarkado como mais rápido que MLX e llama.cpp, com ganhos relatados de até ~33% na decodificação e grandes melhorias no preenchimento (especialmente forte em prompts longos e cargas de trabalho estilo MoE).
Descritor de arquitetura para famílias de modelos: Codifica diferenças arquitetônicas (ativações, variantes de normalização, convenções de atenção/posicionais, especificidades de roteamento MoE) em um descritor compacto em vez de "hard-coding" muitas ramificações no loop de inferência.
Amplo suporte à quantização: Suporta múltiplos formatos de quantização (desde quantização de baixo bit até FP16), permitindo que os usuários equilibrem qualidade, memória e velocidade em dispositivos Apple da série M.
Fluxo de trabalho CLI amigável ao desenvolvedor: Instale com um único script, puxe modelos do Hugging Face e converta para um formato de tempo de execução, então execute comandos de chat ou serviço com configuração mínima.
Serviço local compatível com OpenAI + "bindings": Executa um servidor HTTP compatível com OpenAI para chat/conclusões e fornece uma API C estável com "bindings" (por exemplo, Python/Node/Rust/Swift) para incorporação em aplicativos e ferramentas.
Casos de Uso do BaseRT
Assistentes privados no dispositivo para empresas: Execute assistentes de chat internos localmente no Apple Silicon (sem dados saindo do dispositivo), útil para ambientes regulamentados e documentos sensíveis.
Agentes de codificação locais e ferramentas de desenvolvedor: Sirva um modelo local e aponte agentes de codificação/IDEs para o endpoint compatível com OpenAI para obter ajuda de código rápida e de baixa latência sem chaves de API na nuvem.
Inferência de borda para aplicativos offline ou de baixa latência: Implante recursos LLM em laptops/tablets em trabalho de campo, saúde ou cenários de viagem onde a conectividade é limitada e a latência importa.
Prototipagem e avaliação de produtos em Macs: Teste rapidamente vários modelos abertos e quantizações via CLI (puxar/conversar/servir) para comparar UX, latência e custo antes de se comprometer com a implantação na nuvem.
Capacidades LLM incorporadas em aplicativos macOS/iOS: Use a API C e os "language bindings" para integrar a inferência LLM local em aplicativos nativos que precisam de desempenho e privacidade previsíveis.
Vantagens
Alto desempenho no Apple Silicon (notavelmente forte throughput de decodificação e preenchimento em comparação com tempos de execução locais comuns).
A abordagem Metal sem framework reduz a sobrecarga e melhora o potencial de otimização específica do hardware.
Empacotamento conveniente: CLI + servidor compatível com OpenAI + API C estável com múltiplos "language bindings".
Desvantagens
Focado em Apple Silicon/Metal (não é um tempo de execução de inferência multiplataforma geral).
Algumas abordagens concorrentes podem aproveitar o Apple Neural Engine via MPSGraph para certas cargas de trabalho, enquanto o caminho do BaseRT é descrito como focado em GPU (pelo menos em comparações atuais).
Requer conversão de modelo para um formato específico de tempo de execução (por exemplo, puxado/convertido para um formato BaseRT) em vez de executar "checkpoints" arbitrários diretamente.
Como Usar o BaseRT
1) Instale o BaseRT (CLI + engine): No macOS Apple Silicon, instale o BaseRT em seu PATH executando:
curl -LsSf https://basecompute.co/install.sh | sh
Após a instalação, confirme se o comando `basert` está disponível (por exemplo, execute `basert --help`).
2) Puxe um modelo do Hugging Face (e converta para o formato .base): Use o CLI do BaseRT para baixar um modelo suportado do Hugging Face e convertê-lo para o formato otimizado `.base` do BaseRT:
basert pull Qwen/Qwen3-4B
(Substitua por qualquer ID de modelo suportado.)
3) Converse com um modelo local a partir do terminal: Inicie uma sessão de chat interativa com um modelo que você puxou:
basert chat Qwen/Qwen3-4B
Isso executa o modelo localmente em sua máquina.
4) Sirva uma API HTTP compatível com OpenAI localmente: Execute o BaseRT como um servidor local que expõe endpoints compatíveis com OpenAI:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Use a chave de API impressa/selecionada ao chamar o servidor a partir de clientes.
5) (Opcional) Execute um agente de codificação contra seu servidor BaseRT local: Sirva um modelo e conecte um agente de codificação local para que as solicitações permaneçam no dispositivo:
# Sirva um modelo
basert serve basecompute/gemma-4-E4B-it
# Instale o plugin coding-agent
pi install git:github.com/basecompute/pi-basert
# Execute o agente
pi
Perguntas Frequentes do BaseRT
BaseRT é um tempo de execução de inferência de IA da Base Compute projetado para executar grandes modelos de linguagem de forma eficiente no Apple Silicon. Ele é escrito diretamente contra a API Metal da Apple (não construído em MLX, PyTorch, CoreML ou outros frameworks intermediários) e é posicionado como "o tempo de execução de inferência LLM mais rápido para Apple Silicon."
Artigos Populares

Atoms: Uma Plataforma de IA Multiagente Que Transforma Ideias em Produtos Prontos para Lançamento
May 22, 2026

Nano Banana SBTI: O Que É, Como Funciona e Como Usá-lo em 2026
Apr 15, 2026

Análise do Atoms — O Construtor de Produtos de IA Redefinindo a Criação Digital em 2026
Apr 10, 2026

Kilo Claw: Como Implementar e Usar um Verdadeiro Agente de IA "Faça Você Mesmo" (Atualização de 2026)
Apr 3, 2026







