
BaseRT
BaseRT est un moteur d'inférence LLM Metal natif, entièrement repensé pour Apple Silicon, qui offre le meilleur débit de préremplissage et de décodage de sa catégorie tout en étant livré sous forme de CLI, d'API C et de liaisons multilingues avec un service compatible OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Informations sur le produit
Mis à jour:Jul 21, 2026
Qu'est-ce que BaseRT
BaseRT est un moteur d'inférence d'IA conçu spécifiquement pour exécuter de grands modèles linguistiques sur Apple Silicon. Contrairement à de nombreux moteurs qui reposent sur des frameworks ML à usage général, BaseRT est écrit directement sur l'API GPU Metal d'Apple et évite intentionnellement les dépendances à MLX, PyTorch, CoreML ou d'autres couches intermédiaires. Il est distribué sous forme de chaîne d'outils facile à installer (CLI plus une API C stable) avec des liaisons pour des langages tels que Python, Node, Rust et Swift, permettant à la fois une utilisation locale (télécharger et discuter avec des modèles) et des cas d'utilisation de déploiement (servir une API compatible OpenAI).
Caractéristiques principales de BaseRT
BaseRT est un moteur d'inférence LLM haute performance pour Apple Silicon, construit directement sur l'API GPU Metal d'Apple (sans MLX, PyTorch, CoreML ou d'autres frameworks intermédiaires). Il vise à maximiser le débit et à réduire la surcharge grâce à la fusion de noyaux spécifiques à la puce, aux optimisations tenant compte de la mémoire unifiée et à une logique de répartition personnalisée, atteignant les meilleures performances de décodage et de préremplissage par rapport aux moteurs d'exécution locaux Apple courants. BaseRT est livré sous forme de CLI et d'une API C stable avec des liaisons linguistiques, et peut rapidement extraire des modèles de Hugging Face, exécuter un chat local ou servir une API HTTP compatible OpenAI pour les applications et les agents, en gardant l'inférence privée et sur l'appareil.
Moteur d'exécution Metal natif (sans framework): Implémenté directement sur l'API Metal d'Apple pour éviter la surcharge d'abstraction de MLX/PyTorch/CoreML et mieux correspondre au modèle d'exécution de Metal et à la topologie de mémoire unifiée d'Apple Silicon.
Débit de premier ordre sur Apple Silicon: Évalué comme plus rapide que MLX et llama.cpp, avec des gains signalés allant jusqu'à ~33% sur le décodage et de grandes améliorations sur le préremplissage (particulièrement fort sur les invites longues et les charges de travail de style MoE).
Descripteur d'architecture pour les familles de modèles: Encode les différences architecturales (activations, variantes de normalisation, conventions d'attention/positionnement, spécificités de routage MoE) dans un descripteur compact plutôt que de coder en dur de nombreuses branches dans la boucle d'inférence.
Prise en charge étendue de la quantification: Prend en charge plusieurs formats de quantification (de la quantification à faible bit jusqu'à FP16), permettant aux utilisateurs de trouver un compromis entre qualité, mémoire et vitesse sur les appareils Apple de la série M.
Flux de travail CLI convivial pour les développeurs: Installez avec un seul script, extrayez les modèles de Hugging Face et convertissez-les dans un format d'exécution, puis exécutez les commandes de chat ou de service avec une configuration minimale.
Serveur local compatible OpenAI + liaisons: Exécute un serveur HTTP compatible OpenAI pour le chat/les complétions et fournit une API C stable avec des liaisons (par exemple, Python/Node/Rust/Swift) pour l'intégration dans des applications et des outils.
Cas d'utilisation de BaseRT
Assistants privés sur appareil pour les entreprises: Exécutez des assistants de chat internes localement sur Apple Silicon (aucune donnée ne quitte l'appareil), utile pour les environnements réglementés et les documents sensibles.
Agents de codage locaux et outils de développement: Servez un modèle local et dirigez les agents de codage/IDE vers le point de terminaison compatible OpenAI pour obtenir une aide rapide et à faible latence sans clés d'API cloud.
Inférence Edge pour les applications hors ligne ou à faible latence: Déployez des fonctionnalités LLM sur des ordinateurs portables/tablettes dans des scénarios de travail sur le terrain, de soins de santé ou de voyage où la connectivité est limitée et la latence est importante.
Prototypage et évaluation de produits sur Mac: Testez rapidement plusieurs modèles ouverts et quantifications via CLI (pull/chat/serve) pour évaluer l'UX, la latence et le coût avant de s'engager dans un déploiement cloud.
Capacités LLM intégrées dans les applications macOS/iOS: Utilisez l'API C et les liaisons linguistiques pour intégrer l'inférence LLM locale dans des applications natives qui nécessitent des performances prévisibles et une confidentialité.
Avantages
Hautes performances sur Apple Silicon (notamment un débit de décodage et de préremplissage élevé par rapport aux moteurs d'exécution locaux courants).
L'approche Metal sans framework réduit la surcharge et améliore le potentiel d'optimisation spécifique au matériel.
Conditionnement pratique : CLI + serveur compatible OpenAI + API C stable avec plusieurs liaisons linguistiques.
Inconvénients
Axé sur Apple Silicon/Metal (pas un moteur d'inférence multiplateforme général).
Certaines approches concurrentes peuvent exploiter l'Apple Neural Engine via MPSGraph pour certaines charges de travail, tandis que le chemin de BaseRT est décrit comme étant axé sur le GPU (du moins dans les comparaisons actuelles).
Nécessite la conversion du modèle dans un format spécifique au moteur d'exécution (par exemple, extrait/converti dans un format BaseRT) plutôt que d'exécuter directement des points de contrôle arbitraires.
Comment utiliser BaseRT
1) Installer BaseRT (CLI + moteur): Sur macOS Apple Silicon, installez BaseRT sur votre PATH en exécutant :
curl -LsSf https://basecompute.co/install.sh | sh
Après l'installation, confirmez que la commande `basert` est disponible (par exemple, exécutez `basert --help`).
2) Télécharger un modèle depuis Hugging Face (et le convertir au format .base): Utilisez l'interface CLI de BaseRT pour télécharger un modèle pris en charge depuis Hugging Face et le convertir au format optimisé `.base` de BaseRT :
basert pull Qwen/Qwen3-4B
(Remplacez par n'importe quel ID de modèle pris en charge.)
3) Discuter avec un modèle local depuis le terminal: Démarrez une session de discussion interactive avec un modèle que vous avez téléchargé :
basert chat Qwen/Qwen3-4B
Ceci exécute le modèle localement sur votre machine.
4) Servir une API HTTP compatible OpenAI localement: Exécutez BaseRT comme un serveur local qui expose des points de terminaison compatibles OpenAI :
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Utilisez la clé API affichée/sélectionnée lors de l'appel du serveur depuis les clients.
5) (Facultatif) Exécuter un agent de codage contre votre serveur BaseRT local: Servez un modèle et connectez un agent de codage local afin que les requêtes restent sur l'appareil :
# Servir un modèle
basert serve basecompute/gemma-4-E4B-it
# Installer le plugin coding-agent
pi install git:github.com/basecompute/pi-basert
# Exécuter l'agent
pi
FAQ de BaseRT
BaseRT est un moteur d'inférence d'IA de Base Compute conçu pour exécuter efficacement de grands modèles linguistiques sur Apple Silicon. Il est écrit directement contre l'API Metal d'Apple (non basé sur MLX, PyTorch, CoreML ou d'autres frameworks intermédiaires) et est présenté comme "le moteur d'inférence LLM le plus rapide pour Apple Silicon".
Articles populaires

Atoms : Une plateforme d'IA multi-agents qui transforme les idées en produits prêts à être lancés
May 22, 2026

Nano Banana SBTI : Qu'est-ce que c'est, comment ça marche et comment l'utiliser en 2026
Apr 15, 2026

Atoms : L'outil de création de produits IA qui redéfinit la création numérique en 2026
Apr 10, 2026

Kilo Claw : Comment déployer et utiliser un véritable agent d'IA "Faites-le pour vous" (Mise à jour 2026)
Apr 3, 2026







