
BaseRT
BaseRT ist eine von Grund auf neu entwickelte, native Metal LLM-Inferenz-Laufzeitumgebung für Apple Silicon, die erstklassigen Prefill- und Decode-Durchsatz liefert und als CLI, C-API und mehrsprachige Bindungen mit OpenAI-kompatibler Bereitstellung ausgeliefert wird.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Produktinformationen
Aktualisiert:Jul 21, 2026
Was ist BaseRT
BaseRT ist eine KI-Inferenz-Laufzeitumgebung, die speziell für die Ausführung großer Sprachmodelle auf Apple Silicon entwickelt wurde. Im Gegensatz zu vielen Laufzeitumgebungen, die auf allgemeinen ML-Frameworks aufsetzen, ist BaseRT direkt auf Apples Metal GPU API geschrieben und vermeidet bewusst Abhängigkeiten von MLX, PyTorch, CoreML oder anderen Zwischenschichten. Es wird als einfach zu installierende Toolchain (CLI plus eine stabile C-API) mit Bindungen für Sprachen wie Python, Node, Rust und Swift vertrieben, was sowohl die lokale Nutzung (Modelle ziehen und chatten) als auch Bereitstellungsszenarien (Bereitstellung einer OpenAI-kompatiblen API) ermöglicht.
Hauptfunktionen von BaseRT
BaseRT ist eine hochleistungsfähige LLM-Inferenzlaufzeit für Apple Silicon, die direkt auf Apples Metal GPU API aufbaut (kein MLX, PyTorch, CoreML oder andere Zwischen-Frameworks). Es konzentriert sich auf die Maximierung des Durchsatzes und die Senkung des Overheads durch chipspezifische Kernel-Fusion, Unified-Memory-optimierte Optimierungen und benutzerdefinierte Dispatch-Logik, wodurch eine erstklassige Dekodierungs- und Vorfüllleistung im Vergleich zu gängigen Apple-lokalen Laufzeiten erzielt wird. BaseRT wird als CLI plus einer stabilen C-API mit Sprachbindungen ausgeliefert und kann Modelle schnell von Hugging Face abrufen, lokalen Chat ausführen oder eine OpenAI-kompatible HTTP-API für Apps und Agenten bereitstellen – wodurch die Inferenz privat und auf dem Gerät bleibt.
Native Metal-Laufzeit (Framework-frei): Direkt gegen Apples Metal API implementiert, um Abstraktions-Overhead von MLX/PyTorch/CoreML zu vermeiden und besser zum Ausführungsmodell von Metal und der Unified-Memory-Topologie von Apple Silicon zu passen.
Erstklassiger Durchsatz auf Apple Silicon: Als schneller als MLX und llama.cpp bewertet, mit gemeldeten Zuwächsen von bis zu ~33% bei der Dekodierung und großen Verbesserungen bei der Vorfüllung (besonders stark bei langen Prompts und MoE-ähnlichen Workloads).
Architekturdeskriptor für Modellfamilien: Kodiert architektonische Unterschiede (Aktivierungen, Normalisierungsvarianten, Aufmerksamkeits-/Positionskonventionen, MoE-Routing-Spezifika) in einem kompakten Deskriptor, anstatt viele Verzweigungen in der Inferenzschleife fest zu kodieren.
Breite Quantisierungsunterstützung: Unterstützt mehrere Quantisierungsformate (von Low-Bit-Quantisierung bis FP16), wodurch Benutzer Qualität, Speicher und Geschwindigkeit auf Apple M-Serien-Geräten abwägen können.
Entwicklerfreundlicher CLI-Workflow: Installation mit einem einzigen Skript, Abrufen von Modellen von Hugging Face und Konvertierung in ein Laufzeitformat, dann Ausführen von Chat- oder Serving-Befehlen mit minimalem Setup.
OpenAI-kompatibles lokales Serving + Bindungen: Betreibt einen OpenAI-kompatiblen HTTP-Server für Chat/Completions und bietet eine stabile C-API mit Bindungen (z.B. Python/Node/Rust/Swift) zur Einbettung in Apps und Tools.
Anwendungsfälle von BaseRT
Private On-Device-Assistenten für Unternehmen: Führen Sie interne Chat-Assistenten lokal auf Apple Silicon aus (keine Daten verlassen das Gerät), nützlich für regulierte Umgebungen und sensible Dokumente.
Lokale Codierungsagenten und Entwickler-Tools: Stellen Sie ein lokales Modell bereit und richten Sie Codierungsagenten/IDEs auf den OpenAI-kompatiblen Endpunkt, um schnelle, latenzarme Code-Hilfe ohne Cloud-API-Schlüssel zu erhalten.
Edge-Inferenz für Offline- oder latenzarme Apps: Stellen Sie LLM-Funktionen auf Laptops/Tablets in der Feldarbeit, im Gesundheitswesen oder auf Reisen bereit, wo die Konnektivität begrenzt ist und die Latenz wichtig ist.
Produkt-Prototyping und -Evaluierung auf Macs: Testen Sie schnell mehrere offene Modelle und Quantisierungen über CLI (pull/chat/serve), um UX, Latenz und Kosten zu bewerten, bevor Sie sich für eine Cloud-Bereitstellung entscheiden.
Eingebettete LLM-Funktionen in macOS-/iOS-Apps: Verwenden Sie die C-API und Sprachbindungen, um lokale LLM-Inferenz in native Anwendungen zu integrieren, die eine vorhersehbare Leistung und Datenschutz benötigen.
Vorteile
Hohe Leistung auf Apple Silicon (insbesondere starker Dekodierungs- und Vorfüll-Durchsatz im Vergleich zu gängigen lokalen Laufzeiten).
Framework-freier Metal-Ansatz reduziert den Overhead und verbessert das Potenzial für hardwarespezifische Optimierungen.
Bequeme Verpackung: CLI + OpenAI-kompatibler Server + stabile C-API mit mehreren Sprachbindungen.
Nachteile
Apple Silicon/Metal-fokussiert (keine allgemeine plattformübergreifende Inferenzlaufzeit).
Einige konkurrierende Ansätze könnten den Apple Neural Engine über MPSGraph für bestimmte Workloads nutzen, während der Pfad von BaseRT als GPU-fokussiert beschrieben wird (zumindest in aktuellen Vergleichen).
Erfordert die Modellkonvertierung in ein laufzeitspezifisches Format (z.B. Abruf/Konvertierung in ein BaseRT-Format) anstatt beliebige Checkpoints direkt auszuführen.
Wie verwendet man BaseRT
1) BaseRT installieren (CLI + Engine): Installieren Sie BaseRT auf Apple Silicon macOS in Ihrem PATH, indem Sie Folgendes ausführen:
curl -LsSf https://basecompute.co/install.sh | sh
Bestätigen Sie nach der Installation, dass der Befehl `basert` verfügbar ist (z.B. `basert --help` ausführen).
2) Ein Modell von Hugging Face herunterladen (und in das .base-Format konvertieren): Verwenden Sie die BaseRT CLI, um ein unterstütztes Modell von Hugging Face herunterzuladen und in BaseRTs optimiertes `.base`-Format zu konvertieren:
basert pull Qwen/Qwen3-4B
(Ersetzen Sie dies durch eine beliebige unterstützte Modell-ID.)
3) Mit einem lokalen Modell vom Terminal aus chatten: Starten Sie eine interaktive Chat-Sitzung mit einem von Ihnen heruntergeladenen Modell:
basert chat Qwen/Qwen3-4B
Dies führt das Modell lokal auf Ihrem Computer aus.
4) Eine OpenAI-kompatible HTTP-API lokal bereitstellen: Führen Sie BaseRT als lokalen Server aus, der OpenAI-kompatible Endpunkte bereitstellt:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Verwenden Sie den angezeigten/ausgewählten API-Schlüssel, wenn Sie den Server von Clients aus aufrufen.
5) (Optional) Einen Coding-Agenten gegen Ihren lokalen BaseRT-Server ausführen: Stellen Sie ein Modell bereit und verbinden Sie einen lokalen Coding-Agenten, damit Anfragen auf dem Gerät bleiben:
# Ein Modell bereitstellen
basert serve basecompute/gemma-4-E4B-it
# Das coding-agent Plugin installieren
pi install git:github.com/basecompute/pi-basert
# Den Agenten ausführen
pi
BaseRT FAQs
BaseRT ist eine KI-Inferenz-Laufzeitumgebung von Base Compute, die darauf ausgelegt ist, große Sprachmodelle effizient auf Apple Silicon auszuführen. Es wurde direkt auf Apples Metal API geschrieben (nicht auf MLX, PyTorch, CoreML oder anderen Zwischen-Frameworks) und wird als „die schnellste LLM-Inferenz-Laufzeitumgebung für Apple Silicon“ positioniert.
Beliebte Artikel

Atoms: Eine Multi-Agenten-KI-Plattform, die Ideen in startbereite Produkte verwandelt
May 22, 2026

Nano Banana SBTI: Was es ist, wie es funktioniert und wie man es im Jahr 2026 einsetzt
Apr 15, 2026

Atoms Review – Der KI-Produkt-Builder, der die digitale Erstellung im Jahr 2026 neu definiert
Apr 10, 2026

Kilo Claw: Wie man einen echten "Do-It-For-You" KI-Agenten bereitstellt und verwendet (2026 Update)
Apr 3, 2026







