BaseRT è un runtime di inferenza LLM nativo Metal, costruito da zero, per Apple Silicon che offre il miglior throughput di prefill e decodifica della categoria, fornito come CLI, API C e binding multi-linguaggio con serving compatibile con OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

Informazioni sul Prodotto

Aggiornato:Jul 21, 2026

Cos'è BaseRT

BaseRT è un runtime di inferenza AI costruito specificamente per eseguire modelli linguistici di grandi dimensioni su Apple Silicon. A differenza di molti runtime che si basano su framework ML generici, BaseRT è scritto direttamente sull'API Metal GPU di Apple e intenzionalmente evita dipendenze da MLX, PyTorch, CoreML o altri livelli intermedi. È distribuito come una toolchain facile da installare (CLI più un'API C stabile) con binding per linguaggi come Python, Node, Rust e Swift, consentendo sia l'uso locale (pull e chat con i modelli) che casi d'uso di deployment (servire un'API compatibile con OpenAI).

Caratteristiche principali di BaseRT

BaseRT è un runtime di inferenza LLM ad alte prestazioni per Apple Silicon, costruito direttamente sull'API Metal GPU di Apple (senza MLX, PyTorch, CoreML o altri framework intermedi). Si concentra sulla massimizzazione del throughput e sulla riduzione dell'overhead tramite la fusione del kernel specifica per il chip, ottimizzazioni consapevoli della memoria unificata e logica di dispatch personalizzata, raggiungendo le migliori prestazioni di decodifica e prefill rispetto ai comuni runtime locali di Apple. BaseRT viene fornito come CLI più un'API C stabile con binding di linguaggio e può rapidamente scaricare modelli da Hugging Face, eseguire chat locali o servire un'API HTTP compatibile con OpenAI per app e agenti, mantenendo l'inferenza privata e sul dispositivo.
Runtime Metal nativo (senza framework): Implementato direttamente sull'API Metal di Apple per evitare l'overhead di astrazione da MLX/PyTorch/CoreML e per adattarsi meglio al modello di esecuzione di Metal e alla topologia di memoria unificata di Apple Silicon.
Throughput migliore della categoria su Apple Silicon: Benchmarkato come più veloce di MLX e llama.cpp, con guadagni riportati fino al ~33% sulla decodifica e grandi miglioramenti sul prefill (particolarmente forte su prompt lunghi e carichi di lavoro in stile MoE).
Descrittore di architettura per famiglie di modelli: Codifica le differenze architettoniche (attivazioni, varianti di normalizzazione, convenzioni di attenzione/posizionali, specifiche di routing MoE) in un descrittore compatto piuttosto che codificare molte ramificazioni nel ciclo di inferenza.
Ampio supporto alla quantizzazione: Supporta più formati di quantizzazione (dalla quantizzazione a basso bit fino a FP16), consentendo agli utenti di bilanciare qualità, memoria e velocità su tutti i dispositivi Apple della serie M.
Flusso di lavoro CLI user-friendly per gli sviluppatori: Installa con un singolo script, scarica modelli da Hugging Face e convertili in un formato runtime, quindi esegui comandi di chat o di servizio con una configurazione minima.
Servizio locale compatibile con OpenAI + binding: Esegue un server HTTP compatibile con OpenAI per chat/completamenti e fornisce un'API C stabile con binding (ad esempio, Python/Node/Rust/Swift) per l'incorporamento in app e strumenti.

Casi d'uso di BaseRT

Assistenti privati su dispositivo per le aziende: Esegui assistenti di chat interni localmente su Apple Silicon (nessun dato che lascia il dispositivo), utile per ambienti regolamentati e documenti sensibili.
Agenti di codifica locali e strumenti per sviluppatori: Servi un modello locale e indirizza agenti di codifica/IDE all'endpoint compatibile con OpenAI per ottenere un aiuto rapido e a bassa latenza senza chiavi API cloud.
Inferenza edge per app offline o a bassa latenza: Distribuisci funzionalità LLM su laptop/tablet in scenari di lavoro sul campo, sanità o viaggio in cui la connettività è limitata e la latenza è importante.
Prototipazione e valutazione del prodotto su Mac: Testa rapidamente più modelli aperti e quantizzazioni tramite CLI (pull/chat/serve) per confrontare UX, latenza e costi prima di impegnarti nella distribuzione cloud.
Funzionalità LLM incorporate nelle app macOS/iOS: Usa l'API C e i binding di linguaggio per integrare l'inferenza LLM locale in applicazioni native che necessitano di prestazioni e privacy prevedibili.

Vantaggi

Alte prestazioni su Apple Silicon (notevolmente forte throughput di decodifica e prefill rispetto ai comuni runtime locali).
L'approccio Metal senza framework riduce l'overhead e migliora il potenziale di ottimizzazione specifico dell'hardware.
Packaging conveniente: CLI + server compatibile con OpenAI + API C stabile con binding per più linguaggi.

Svantaggi

Focalizzato su Apple Silicon/Metal (non un runtime di inferenza multipiattaforma generale).
Alcuni approcci concorrenti potrebbero sfruttare l'Apple Neural Engine tramite MPSGraph per determinati carichi di lavoro, mentre il percorso di BaseRT è descritto come focalizzato sulla GPU (almeno nei confronti attuali).
Richiede la conversione del modello in un formato specifico del runtime (ad esempio, scaricato/convertito in un formato BaseRT) anziché l'esecuzione diretta di checkpoint arbitrari.

Come usare BaseRT

1) Installa BaseRT (CLI + motore): Su macOS Apple Silicon, installa BaseRT nel tuo PATH eseguendo: curl -LsSf https://basecompute.co/install.sh | sh Dopo l'installazione, conferma che il comando `basert` sia disponibile (ad esempio, esegui `basert --help`).
2) Scarica un modello da Hugging Face (e convertilo nel formato .base): Usa la CLI di BaseRT per scaricare un modello supportato da Hugging Face e convertirlo nel formato ottimizzato `.base` di BaseRT: basert pull Qwen/Qwen3-4B (Sostituisci con qualsiasi ID modello supportato.)
3) Chatta con un modello locale dal terminale: Avvia una sessione di chat interattiva con un modello che hai scaricato: basert chat Qwen/Qwen3-4B Questo esegue il modello localmente sulla tua macchina.
4) Servi un'API HTTP compatibile con OpenAI localmente: Esegui BaseRT come server locale che espone endpoint compatibili con OpenAI: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 Usa la chiave API stampata/selezionata quando chiami il server dai client.
5) (Opzionale) Esegui un agente di codifica sul tuo server BaseRT locale: Servi un modello e connetti un agente di codifica locale in modo che le richieste rimangano sul dispositivo: # Servi un modello basert serve basecompute/gemma-4-E4B-it # Installa il plugin coding-agent pi install git:github.com/basecompute/pi-basert # Esegui l'agente pi

FAQ di BaseRT

BaseRT è un runtime di inferenza AI di Base Compute progettato per eseguire in modo efficiente modelli linguistici di grandi dimensioni su Apple Silicon. È scritto direttamente sull'API Metal di Apple (non basato su MLX, PyTorch, CoreML o altri framework intermedi) ed è posizionato come "il runtime di inferenza LLM più veloce per Apple Silicon".

Ultimi Strumenti AI Simili a BaseRT

Athena AI
Athena AI
Athena AI is a versatile AI-powered platform offering personalized study assistance, business solutions, and life coaching through features like document analysis, quiz generation, flashcards, and interactive chat capabilities.
Aguru AI
Aguru AI
Aguru AI è una soluzione software on-premises che fornisce strumenti completi di monitoraggio, sicurezza e ottimizzazione per applicazioni basate su LLM con funzionalità come tracciamento del comportamento, rilevamento delle anomalie e ottimizzazione delle prestazioni.
GOAT AI
GOAT AI
GOAT AI è una piattaforma potenziata dall'AI che fornisce capacità di sintesi con un clic per vari tipi di contenuto, tra cui articoli di notizie, documenti di ricerca e video, offrendo anche un'orchestrazione avanzata degli agenti AI per compiti specifici del dominio.
GiGOS
GiGOS
GiGOS è una piattaforma di IA che fornisce accesso a più modelli di linguaggio avanzati come Gemini, GPT-4, Claude e Grok con un'interfaccia intuitiva per gli utenti per interagire e confrontare diversi modelli di IA.