BaseRT es un tiempo de ejecución de inferencia LLM nativo de Metal, creado desde cero para Apple Silicon, que ofrece el mejor rendimiento de prellenado y decodificación de su clase, al tiempo que se distribuye como una CLI, una API C y enlaces en varios idiomas con servicio compatible con OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

Información del Producto

Actualizado:21/07/2026

¿Qué es BaseRT?

BaseRT es un tiempo de ejecución de inferencia de IA creado específicamente para ejecutar grandes modelos de lenguaje en Apple Silicon. A diferencia de muchos tiempos de ejecución que se basan en marcos de ML de propósito general, BaseRT está escrito directamente contra la API de GPU Metal de Apple y evita intencionalmente las dependencias de MLX, PyTorch, CoreML u otras capas intermedias. Se distribuye como una cadena de herramientas fácil de instalar (CLI más una API C estable) con enlaces para lenguajes como Python, Node, Rust y Swift, lo que permite tanto el uso local (obtener y chatear con modelos) como los casos de uso de implementación (servir una API compatible con OpenAI).

Características Principales de BaseRT

BaseRT es un tiempo de ejecución de inferencia LLM de alto rendimiento para Apple Silicon, construido directamente sobre la API Metal de Apple (sin MLX, PyTorch, CoreML u otros frameworks intermedios). Se enfoca en maximizar el rendimiento y reducir la sobrecarga a través de la fusión de kernels específicos del chip, optimizaciones conscientes de la memoria unificada y lógica de despacho personalizada, logrando el mejor rendimiento de decodificación y prellenado en comparación con los tiempos de ejecución locales comunes de Apple. BaseRT se distribuye como una CLI más una API C estable con enlaces de lenguaje, y puede extraer rápidamente modelos de Hugging Face, ejecutar chat local o servir una API HTTP compatible con OpenAI para aplicaciones y agentes, manteniendo la inferencia privada y en el dispositivo.
Tiempo de ejecución nativo de Metal (sin framework): Implementado directamente contra la API Metal de Apple para evitar la sobrecarga de abstracción de MLX/PyTorch/CoreML y para adaptarse mejor al modelo de ejecución de Metal y a la topología de memoria unificada de Apple Silicon.
El mejor rendimiento de su clase en Apple Silicon: Se ha comprobado que es más rápido que MLX y llama.cpp, con ganancias reportadas de hasta ~33% en decodificación y grandes mejoras en el prellenado (especialmente fuerte en prompts largos y cargas de trabajo de estilo MoE).
Descriptor de arquitectura para familias de modelos: Codifica las diferencias arquitectónicas (activaciones, variantes de normalización, convenciones de atención/posicionales, especificidades de enrutamiento MoE) en un descriptor compacto en lugar de codificar muchas ramas en el bucle de inferencia.
Amplio soporte de cuantificación: Soporta múltiples formatos de cuantificación (desde cuantificación de bajo bit hasta FP16), lo que permite a los usuarios equilibrar la calidad, la memoria y la velocidad en los dispositivos Apple de la serie M.
Flujo de trabajo CLI amigable para desarrolladores: Instale con un solo script, extraiga modelos de Hugging Face y conviértalos a un formato de tiempo de ejecución, luego ejecute comandos de chat o servicio con una configuración mínima.
Servicio local compatible con OpenAI + enlaces: Ejecuta un servidor HTTP compatible con OpenAI para chat/completions y proporciona una API C estable con enlaces (por ejemplo, Python/Node/Rust/Swift) para incrustar en aplicaciones y herramientas.

Casos de Uso de BaseRT

Asistentes privados en el dispositivo para empresas: Ejecute asistentes de chat internos localmente en Apple Silicon (sin que los datos salgan del dispositivo), útil para entornos regulados y documentos sensibles.
Agentes de codificación locales y herramientas para desarrolladores: Sirva un modelo local y dirija agentes de codificación/IDEs al punto final compatible con OpenAI para obtener ayuda de código rápida y de baja latencia sin claves de API en la nube.
Inferencia en el borde para aplicaciones sin conexión o de baja latencia: Implemente funciones LLM en computadoras portátiles/tabletas en escenarios de trabajo de campo, atención médica o viajes donde la conectividad es limitada y la latencia importa.
Prototipos y evaluación de productos en Macs: Pruebe rápidamente múltiples modelos abiertos y cuantificaciones a través de la CLI (pull/chat/serve) para comparar la UX, la latencia y el costo antes de comprometerse con la implementación en la nube.
Capacidades LLM incrustadas en aplicaciones macOS/iOS: Utilice la API C y los enlaces de lenguaje para integrar la inferencia LLM local en aplicaciones nativas que necesitan un rendimiento y una privacidad predecibles.

Ventajas

Alto rendimiento en Apple Silicon (notablemente fuerte rendimiento de decodificación y prellenado en comparación con los tiempos de ejecución locales comunes).
El enfoque de Metal sin framework reduce la sobrecarga y mejora el potencial de optimización específico del hardware.
Empaquetado conveniente: CLI + servidor compatible con OpenAI + API C estable con múltiples enlaces de lenguaje.

Desventajas

Enfocado en Apple Silicon/Metal (no es un tiempo de ejecución de inferencia multiplataforma general).
Algunos enfoques de la competencia pueden aprovechar el Apple Neural Engine a través de MPSGraph para ciertas cargas de trabajo, mientras que la ruta de BaseRT se describe como enfocada en la GPU (al menos en comparaciones actuales).
Requiere la conversión del modelo a un formato específico del tiempo de ejecución (por ejemplo, extraído/convertido a un formato BaseRT) en lugar de ejecutar puntos de control arbitrarios directamente.

Cómo Usar BaseRT

1) Instalar BaseRT (CLI + motor): En Apple Silicon macOS, instale BaseRT en su PATH ejecutando: curl -LsSf https://basecompute.co/install.sh | sh Después de la instalación, confirme que el comando `basert` esté disponible (por ejemplo, ejecute `basert --help`).
2) Obtener un modelo de Hugging Face (y convertirlo al formato .base): Use la CLI de BaseRT para descargar un modelo compatible de Hugging Face y convertirlo al formato `.base` optimizado de BaseRT: basert pull Qwen/Qwen3-4B (Reemplace con cualquier ID de modelo compatible.)
3) Chatear con un modelo local desde la terminal: Inicie una sesión de chat interactiva con un modelo que haya obtenido: basert chat Qwen/Qwen3-4B Esto ejecuta el modelo localmente en su máquina.
4) Servir una API HTTP compatible con OpenAI localmente: Ejecute BaseRT como un servidor local que expone puntos finales compatibles con OpenAI: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 Use la clave API impresa/seleccionada al llamar al servidor desde los clientes.
5) (Opcional) Ejecutar un agente de codificación contra su servidor BaseRT local: Sirva un modelo y conecte un agente de codificación local para que las solicitudes permanezcan en el dispositivo: # Servir un modelo basert serve basecompute/gemma-4-E4B-it # Instalar el complemento coding-agent pi install git:github.com/basecompute/pi-basert # Ejecutar el agente pi

Preguntas Frecuentes de BaseRT

BaseRT es un tiempo de ejecución de inferencia de IA de Base Compute diseñado para ejecutar modelos de lenguaje grandes de manera eficiente en Apple Silicon. Está escrito directamente contra la API Metal de Apple (no está construido sobre MLX, PyTorch, CoreML u otros marcos intermedios) y se posiciona como "el tiempo de ejecución de inferencia LLM más rápido para Apple Silicon".

Últimas herramientas de IA similares a BaseRT

Athena AI
Athena AI
Athena AI es una plataforma versátil impulsada por IA que ofrece asistencia de estudio personalizada, soluciones comerciales y coaching de vida a través de características como análisis de documentos, generación de cuestionarios, tarjetas de memoria y capacidades de chat interactivas.
Aguru AI
Aguru AI
Aguru AI es una solución de software local que proporciona herramientas integrales de monitoreo, seguridad y optimización para aplicaciones basadas en LLM con características como seguimiento de comportamiento, detección de anomalías y optimización del rendimiento.
GOAT AI
GOAT AI
GOAT AI es una plataforma impulsada por IA que proporciona capacidades de resumen con un clic para varios tipos de contenido, incluidos artículos de noticias, documentos de investigación y videos, mientras que también ofrece orquestación avanzada de agentes de IA para tareas específicas del dominio.
GiGOS
GiGOS
GiGOS es una plataforma de IA que proporciona acceso a múltiples modelos de lenguaje avanzados como Gemini, GPT-4, Claude y Grok, con una interfaz intuitiva para que los usuarios interactúen y comparen diferentes modelos de IA.