
BaseRT
BaseRT è un runtime di inferenza LLM nativo Metal, costruito da zero, per Apple Silicon che offre il miglior throughput di prefill e decodifica della categoria, fornito come CLI, API C e binding multi-linguaggio con serving compatibile con OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Informazioni sul Prodotto
Aggiornato:Jul 21, 2026
Cos'è BaseRT
BaseRT è un runtime di inferenza AI costruito specificamente per eseguire modelli linguistici di grandi dimensioni su Apple Silicon. A differenza di molti runtime che si basano su framework ML generici, BaseRT è scritto direttamente sull'API Metal GPU di Apple e intenzionalmente evita dipendenze da MLX, PyTorch, CoreML o altri livelli intermedi. È distribuito come una toolchain facile da installare (CLI più un'API C stabile) con binding per linguaggi come Python, Node, Rust e Swift, consentendo sia l'uso locale (pull e chat con i modelli) che casi d'uso di deployment (servire un'API compatibile con OpenAI).
Caratteristiche principali di BaseRT
BaseRT è un runtime di inferenza LLM ad alte prestazioni per Apple Silicon, costruito direttamente sull'API Metal GPU di Apple (senza MLX, PyTorch, CoreML o altri framework intermedi). Si concentra sulla massimizzazione del throughput e sulla riduzione dell'overhead tramite la fusione del kernel specifica per il chip, ottimizzazioni consapevoli della memoria unificata e logica di dispatch personalizzata, raggiungendo le migliori prestazioni di decodifica e prefill rispetto ai comuni runtime locali di Apple. BaseRT viene fornito come CLI più un'API C stabile con binding di linguaggio e può rapidamente scaricare modelli da Hugging Face, eseguire chat locali o servire un'API HTTP compatibile con OpenAI per app e agenti, mantenendo l'inferenza privata e sul dispositivo.
Runtime Metal nativo (senza framework): Implementato direttamente sull'API Metal di Apple per evitare l'overhead di astrazione da MLX/PyTorch/CoreML e per adattarsi meglio al modello di esecuzione di Metal e alla topologia di memoria unificata di Apple Silicon.
Throughput migliore della categoria su Apple Silicon: Benchmarkato come più veloce di MLX e llama.cpp, con guadagni riportati fino al ~33% sulla decodifica e grandi miglioramenti sul prefill (particolarmente forte su prompt lunghi e carichi di lavoro in stile MoE).
Descrittore di architettura per famiglie di modelli: Codifica le differenze architettoniche (attivazioni, varianti di normalizzazione, convenzioni di attenzione/posizionali, specifiche di routing MoE) in un descrittore compatto piuttosto che codificare molte ramificazioni nel ciclo di inferenza.
Ampio supporto alla quantizzazione: Supporta più formati di quantizzazione (dalla quantizzazione a basso bit fino a FP16), consentendo agli utenti di bilanciare qualità, memoria e velocità su tutti i dispositivi Apple della serie M.
Flusso di lavoro CLI user-friendly per gli sviluppatori: Installa con un singolo script, scarica modelli da Hugging Face e convertili in un formato runtime, quindi esegui comandi di chat o di servizio con una configurazione minima.
Servizio locale compatibile con OpenAI + binding: Esegue un server HTTP compatibile con OpenAI per chat/completamenti e fornisce un'API C stabile con binding (ad esempio, Python/Node/Rust/Swift) per l'incorporamento in app e strumenti.
Casi d'uso di BaseRT
Assistenti privati su dispositivo per le aziende: Esegui assistenti di chat interni localmente su Apple Silicon (nessun dato che lascia il dispositivo), utile per ambienti regolamentati e documenti sensibili.
Agenti di codifica locali e strumenti per sviluppatori: Servi un modello locale e indirizza agenti di codifica/IDE all'endpoint compatibile con OpenAI per ottenere un aiuto rapido e a bassa latenza senza chiavi API cloud.
Inferenza edge per app offline o a bassa latenza: Distribuisci funzionalità LLM su laptop/tablet in scenari di lavoro sul campo, sanità o viaggio in cui la connettività è limitata e la latenza è importante.
Prototipazione e valutazione del prodotto su Mac: Testa rapidamente più modelli aperti e quantizzazioni tramite CLI (pull/chat/serve) per confrontare UX, latenza e costi prima di impegnarti nella distribuzione cloud.
Funzionalità LLM incorporate nelle app macOS/iOS: Usa l'API C e i binding di linguaggio per integrare l'inferenza LLM locale in applicazioni native che necessitano di prestazioni e privacy prevedibili.
Vantaggi
Alte prestazioni su Apple Silicon (notevolmente forte throughput di decodifica e prefill rispetto ai comuni runtime locali).
L'approccio Metal senza framework riduce l'overhead e migliora il potenziale di ottimizzazione specifico dell'hardware.
Packaging conveniente: CLI + server compatibile con OpenAI + API C stabile con binding per più linguaggi.
Svantaggi
Focalizzato su Apple Silicon/Metal (non un runtime di inferenza multipiattaforma generale).
Alcuni approcci concorrenti potrebbero sfruttare l'Apple Neural Engine tramite MPSGraph per determinati carichi di lavoro, mentre il percorso di BaseRT è descritto come focalizzato sulla GPU (almeno nei confronti attuali).
Richiede la conversione del modello in un formato specifico del runtime (ad esempio, scaricato/convertito in un formato BaseRT) anziché l'esecuzione diretta di checkpoint arbitrari.
Come usare BaseRT
1) Installa BaseRT (CLI + motore): Su macOS Apple Silicon, installa BaseRT nel tuo PATH eseguendo:
curl -LsSf https://basecompute.co/install.sh | sh
Dopo l'installazione, conferma che il comando `basert` sia disponibile (ad esempio, esegui `basert --help`).
2) Scarica un modello da Hugging Face (e convertilo nel formato .base): Usa la CLI di BaseRT per scaricare un modello supportato da Hugging Face e convertirlo nel formato ottimizzato `.base` di BaseRT:
basert pull Qwen/Qwen3-4B
(Sostituisci con qualsiasi ID modello supportato.)
3) Chatta con un modello locale dal terminale: Avvia una sessione di chat interattiva con un modello che hai scaricato:
basert chat Qwen/Qwen3-4B
Questo esegue il modello localmente sulla tua macchina.
4) Servi un'API HTTP compatibile con OpenAI localmente: Esegui BaseRT come server locale che espone endpoint compatibili con OpenAI:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Usa la chiave API stampata/selezionata quando chiami il server dai client.
5) (Opzionale) Esegui un agente di codifica sul tuo server BaseRT locale: Servi un modello e connetti un agente di codifica locale in modo che le richieste rimangano sul dispositivo:
# Servi un modello
basert serve basecompute/gemma-4-E4B-it
# Installa il plugin coding-agent
pi install git:github.com/basecompute/pi-basert
# Esegui l'agente
pi
FAQ di BaseRT
BaseRT è un runtime di inferenza AI di Base Compute progettato per eseguire in modo efficiente modelli linguistici di grandi dimensioni su Apple Silicon. È scritto direttamente sull'API Metal di Apple (non basato su MLX, PyTorch, CoreML o altri framework intermedi) ed è posizionato come "il runtime di inferenza LLM più veloce per Apple Silicon".
Articoli Popolari

Atoms: Una Piattaforma AI Multi-Agente Che Trasforma le Idee in Prodotti Pronti al Lancio
May 22, 2026

Nano Banana SBTI: Cos'è, come funziona e come usarlo nel 2026
Apr 15, 2026

Recensione di Atoms — Il builder di prodotti AI che ridefinisce la creazione digitale nel 2026
Apr 10, 2026

Kilo Claw: Come Distribuire e Utilizzare un Vero Agente AI "Fai-da-Te" (Aggiornamento 2026)
Apr 3, 2026







