
BaseRT
BaseRT — это с нуля разработанная, нативная среда выполнения вывода LLM на Metal для Apple Silicon, которая обеспечивает лучшую в своем классе пропускную способность предварительной загрузки и декодирования, поставляясь в виде CLI, C API и многоязычных привязок с совместимым с OpenAI обслуживанием.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Информация о продукте
Обновлено:21/07/2026
Что такое BaseRT
BaseRT — это среда выполнения ИИ-вывода, разработанная специально для запуска больших языковых моделей на Apple Silicon. В отличие от многих сред выполнения, которые работают поверх универсальных ML-фреймворков, BaseRT написан непосредственно на основе Apple Metal GPU API и намеренно избегает зависимостей от MLX, PyTorch, CoreML или других промежуточных слоев. Он распространяется как простой в установке набор инструментов (CLI плюс стабильный C API) с привязками для таких языков, как Python, Node, Rust и Swift, что позволяет использовать его как локально (загрузка и чат с моделями), так и для развертывания (предоставление API, совместимого с OpenAI).
Ключевые особенности BaseRT
BaseRT – это высокопроизводительная среда выполнения вывода LLM для Apple Silicon, построенная непосредственно на Apple Metal GPU API (без MLX, PyTorch, CoreML или других промежуточных фреймворков). Она ориентирована на максимизацию пропускной способности и снижение накладных расходов за счет слияния ядер, специфичных для чипа, оптимизаций, учитывающих унифицированную память, и пользовательской логики диспетчеризации, достигая лучшей в своем классе производительности декодирования и предварительного заполнения по сравнению с распространенными локальными средами выполнения Apple. BaseRT поставляется в виде CLI плюс стабильный C API с привязками к языкам и может быстро загружать модели из Hugging Face, запускать локальный чат или обслуживать HTTP API, совместимый с OpenAI, для приложений и агентов, сохраняя вывод конфиденциальным и на устройстве.
Нативная среда выполнения Metal (без фреймворков): Реализовано непосредственно на Apple Metal API, чтобы избежать накладных расходов на абстракцию от MLX/PyTorch/CoreML и лучше соответствовать модели выполнения Metal и унифицированной топологии памяти Apple Silicon.
Лучшая в своем классе пропускная способность на Apple Silicon: Показатели производительности быстрее, чем у MLX и llama.cpp, с заявленным приростом до ~33% при декодировании и значительными улучшениями при предварительном заполнении (особенно сильными для длинных подсказок и рабочих нагрузок в стиле MoE).
Дескриптор архитектуры для семейств моделей: Кодирует архитектурные различия (активации, варианты нормализации, соглашения о внимании/позиционировании, особенности маршрутизации MoE) в компактном дескрипторе, а не жестко кодирует множество ветвей в цикле вывода.
Широкая поддержка квантования: Поддерживает несколько форматов квантования (от низкобитового квантования до FP16), позволяя пользователям балансировать качество, память и скорость на устройствах Apple M-серии.
Удобный для разработчиков рабочий процесс CLI: Установите с помощью одного скрипта, загрузите модели из Hugging Face и преобразуйте в формат среды выполнения, затем запустите команды чата или обслуживания с минимальной настройкой.
Локальное обслуживание, совместимое с OpenAI + привязки: Запускает HTTP-сервер, совместимый с OpenAI, для чата/завершений и предоставляет стабильный C API с привязками (например, Python/Node/Rust/Swift) для встраивания в приложения и инструменты.
Варианты использования BaseRT
Частные ассистенты на устройстве для предприятий: Запускайте внутренних чат-ассистентов локально на Apple Silicon (без утечки данных с устройства), что полезно для регулируемых сред и конфиденциальных документов.
Локальные агенты кодирования и инструменты разработчика: Разверните локальную модель и направьте агентов кодирования/IDE на конечную точку, совместимую с OpenAI, чтобы получить быструю помощь в кодировании с низкой задержкой без ключей API облака.
Вывод на периферии для автономных приложений или приложений с низкой задержкой: Развертывайте функции LLM на ноутбуках/планшетах в полевых условиях, здравоохранении или путешествиях, где подключение ограничено, а задержка имеет значение.
Прототипирование и оценка продукта на Mac: Быстро тестируйте несколько открытых моделей и квантований через CLI (pull/chat/serve) для оценки UX, задержки и стоимости перед развертыванием в облаке.
Встроенные возможности LLM в приложениях macOS/iOS: Используйте C API и привязки к языкам для интеграции локального вывода LLM в нативные приложения, которым требуется предсказуемая производительность и конфиденциальность.
Преимущества
Высокая производительность на Apple Silicon (заметно высокая пропускная способность декодирования и предварительного заполнения по сравнению с распространенными локальными средами выполнения).
Подход Metal без фреймворков снижает накладные расходы и улучшает потенциал оптимизации, специфичной для оборудования.
Удобная упаковка: CLI + сервер, совместимый с OpenAI + стабильный C API с несколькими привязками к языкам.
Недостатки
Ориентирован на Apple Silicon/Metal (не является общей кроссплатформенной средой выполнения вывода).
Некоторые конкурирующие подходы могут использовать Apple Neural Engine через MPSGraph для определенных рабочих нагрузок, в то время как путь BaseRT описывается как ориентированный на GPU (по крайней мере, в текущих сравнениях).
Требует преобразования модели в формат, специфичный для среды выполнения (например, загрузка/преобразование в формат BaseRT), вместо прямого запуска произвольных контрольных точек.
Как использовать BaseRT
1) Установите BaseRT (CLI + движок): На Apple Silicon macOS установите BaseRT в ваш PATH, выполнив:
curl -LsSf https://basecompute.co/install.sh | sh
После установки убедитесь, что команда `basert` доступна (например, выполните `basert --help`).
2) Загрузите модель из Hugging Face (и преобразуйте в формат .base): Используйте BaseRT CLI для загрузки поддерживаемой модели из Hugging Face и преобразования ее в оптимизированный формат BaseRT `.base`:
basert pull Qwen/Qwen3-4B
(Замените на любой поддерживаемый ID модели.)
3) Общайтесь с локальной моделью из терминала: Начните интерактивную сессию чата с загруженной моделью:
basert chat Qwen/Qwen3-4B
Это запускает модель локально на вашей машине.
4) Запустите локальный HTTP API, совместимый с OpenAI: Запустите BaseRT как локальный сервер, который предоставляет конечные точки, совместимые с OpenAI:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Используйте выведенный/выбранный ключ API при вызове сервера из клиентов.
5) (Необязательно) Запустите кодирующего агента на вашем локальном сервере BaseRT: Запустите модель и подключите локального кодирующего агента, чтобы запросы оставались на устройстве:
# Запустите модель
basert serve basecompute/gemma-4-E4B-it
# Установите плагин coding-agent
pi install git:github.com/basecompute/pi-basert
# Запустите агента
pi
Часто задаваемые вопросы о BaseRT
BaseRT — это среда выполнения ИИ-выводов от Base Compute, разработанная для эффективного запуска больших языковых моделей на Apple Silicon. Она написана непосредственно на основе Apple Metal API (не построена на MLX, PyTorch, CoreML или других промежуточных фреймворках) и позиционируется как «самая быстрая среда выполнения выводов LLM для Apple Silicon».
Популярные статьи

Atoms: Мультиагентная ИИ-платформа, которая превращает идеи в готовые к запуску продукты
May 22, 2026

Nano Banana SBTI: Что это такое, как это работает и как это использовать в 2026 году
Apr 15, 2026

Обзор Atoms — AI Product Builder, переопределяющий цифровое творчество в 2026 году
Apr 10, 2026

Kilo Claw: Как развернуть и использовать настоящего AI-агента "Сделай-Это-За-Вас" (Обновление 2026)
Apr 3, 2026







