BaseRT — это с нуля разработанная, нативная среда выполнения вывода LLM на Metal для Apple Silicon, которая обеспечивает лучшую в своем классе пропускную способность предварительной загрузки и декодирования, поставляясь в виде CLI, C API и многоязычных привязок с совместимым с OpenAI обслуживанием.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

Информация о продукте

Обновлено:21/07/2026

Что такое BaseRT

BaseRT — это среда выполнения ИИ-вывода, разработанная специально для запуска больших языковых моделей на Apple Silicon. В отличие от многих сред выполнения, которые работают поверх универсальных ML-фреймворков, BaseRT написан непосредственно на основе Apple Metal GPU API и намеренно избегает зависимостей от MLX, PyTorch, CoreML или других промежуточных слоев. Он распространяется как простой в установке набор инструментов (CLI плюс стабильный C API) с привязками для таких языков, как Python, Node, Rust и Swift, что позволяет использовать его как локально (загрузка и чат с моделями), так и для развертывания (предоставление API, совместимого с OpenAI).

Ключевые особенности BaseRT

BaseRT – это высокопроизводительная среда выполнения вывода LLM для Apple Silicon, построенная непосредственно на Apple Metal GPU API (без MLX, PyTorch, CoreML или других промежуточных фреймворков). Она ориентирована на максимизацию пропускной способности и снижение накладных расходов за счет слияния ядер, специфичных для чипа, оптимизаций, учитывающих унифицированную память, и пользовательской логики диспетчеризации, достигая лучшей в своем классе производительности декодирования и предварительного заполнения по сравнению с распространенными локальными средами выполнения Apple. BaseRT поставляется в виде CLI плюс стабильный C API с привязками к языкам и может быстро загружать модели из Hugging Face, запускать локальный чат или обслуживать HTTP API, совместимый с OpenAI, для приложений и агентов, сохраняя вывод конфиденциальным и на устройстве.
Нативная среда выполнения Metal (без фреймворков): Реализовано непосредственно на Apple Metal API, чтобы избежать накладных расходов на абстракцию от MLX/PyTorch/CoreML и лучше соответствовать модели выполнения Metal и унифицированной топологии памяти Apple Silicon.
Лучшая в своем классе пропускная способность на Apple Silicon: Показатели производительности быстрее, чем у MLX и llama.cpp, с заявленным приростом до ~33% при декодировании и значительными улучшениями при предварительном заполнении (особенно сильными для длинных подсказок и рабочих нагрузок в стиле MoE).
Дескриптор архитектуры для семейств моделей: Кодирует архитектурные различия (активации, варианты нормализации, соглашения о внимании/позиционировании, особенности маршрутизации MoE) в компактном дескрипторе, а не жестко кодирует множество ветвей в цикле вывода.
Широкая поддержка квантования: Поддерживает несколько форматов квантования (от низкобитового квантования до FP16), позволяя пользователям балансировать качество, память и скорость на устройствах Apple M-серии.
Удобный для разработчиков рабочий процесс CLI: Установите с помощью одного скрипта, загрузите модели из Hugging Face и преобразуйте в формат среды выполнения, затем запустите команды чата или обслуживания с минимальной настройкой.
Локальное обслуживание, совместимое с OpenAI + привязки: Запускает HTTP-сервер, совместимый с OpenAI, для чата/завершений и предоставляет стабильный C API с привязками (например, Python/Node/Rust/Swift) для встраивания в приложения и инструменты.

Варианты использования BaseRT

Частные ассистенты на устройстве для предприятий: Запускайте внутренних чат-ассистентов локально на Apple Silicon (без утечки данных с устройства), что полезно для регулируемых сред и конфиденциальных документов.
Локальные агенты кодирования и инструменты разработчика: Разверните локальную модель и направьте агентов кодирования/IDE на конечную точку, совместимую с OpenAI, чтобы получить быструю помощь в кодировании с низкой задержкой без ключей API облака.
Вывод на периферии для автономных приложений или приложений с низкой задержкой: Развертывайте функции LLM на ноутбуках/планшетах в полевых условиях, здравоохранении или путешествиях, где подключение ограничено, а задержка имеет значение.
Прототипирование и оценка продукта на Mac: Быстро тестируйте несколько открытых моделей и квантований через CLI (pull/chat/serve) для оценки UX, задержки и стоимости перед развертыванием в облаке.
Встроенные возможности LLM в приложениях macOS/iOS: Используйте C API и привязки к языкам для интеграции локального вывода LLM в нативные приложения, которым требуется предсказуемая производительность и конфиденциальность.

Преимущества

Высокая производительность на Apple Silicon (заметно высокая пропускная способность декодирования и предварительного заполнения по сравнению с распространенными локальными средами выполнения).
Подход Metal без фреймворков снижает накладные расходы и улучшает потенциал оптимизации, специфичной для оборудования.
Удобная упаковка: CLI + сервер, совместимый с OpenAI + стабильный C API с несколькими привязками к языкам.

Недостатки

Ориентирован на Apple Silicon/Metal (не является общей кроссплатформенной средой выполнения вывода).
Некоторые конкурирующие подходы могут использовать Apple Neural Engine через MPSGraph для определенных рабочих нагрузок, в то время как путь BaseRT описывается как ориентированный на GPU (по крайней мере, в текущих сравнениях).
Требует преобразования модели в формат, специфичный для среды выполнения (например, загрузка/преобразование в формат BaseRT), вместо прямого запуска произвольных контрольных точек.

Как использовать BaseRT

1) Установите BaseRT (CLI + движок): На Apple Silicon macOS установите BaseRT в ваш PATH, выполнив: curl -LsSf https://basecompute.co/install.sh | sh После установки убедитесь, что команда `basert` доступна (например, выполните `basert --help`).
2) Загрузите модель из Hugging Face (и преобразуйте в формат .base): Используйте BaseRT CLI для загрузки поддерживаемой модели из Hugging Face и преобразования ее в оптимизированный формат BaseRT `.base`: basert pull Qwen/Qwen3-4B (Замените на любой поддерживаемый ID модели.)
3) Общайтесь с локальной моделью из терминала: Начните интерактивную сессию чата с загруженной моделью: basert chat Qwen/Qwen3-4B Это запускает модель локально на вашей машине.
4) Запустите локальный HTTP API, совместимый с OpenAI: Запустите BaseRT как локальный сервер, который предоставляет конечные точки, совместимые с OpenAI: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 Используйте выведенный/выбранный ключ API при вызове сервера из клиентов.
5) (Необязательно) Запустите кодирующего агента на вашем локальном сервере BaseRT: Запустите модель и подключите локального кодирующего агента, чтобы запросы оставались на устройстве: # Запустите модель basert serve basecompute/gemma-4-E4B-it # Установите плагин coding-agent pi install git:github.com/basecompute/pi-basert # Запустите агента pi

Часто задаваемые вопросы о BaseRT

BaseRT — это среда выполнения ИИ-выводов от Base Compute, разработанная для эффективного запуска больших языковых моделей на Apple Silicon. Она написана непосредственно на основе Apple Metal API (не построена на MLX, PyTorch, CoreML или других промежуточных фреймворках) и позиционируется как «самая быстрая среда выполнения выводов LLM для Apple Silicon».

Последние ИИ-инструменты, похожие на BaseRT

Athena AI
Athena AI
Athena AI — это универсальная ИИ-платформа, предлагающая персонализированную учебную поддержку, бизнес-решения и коучинг по жизни через функции анализа документов, генерации тестов, карточек и интерактивного чата.
Aguru AI
Aguru AI
Aguru AI — это локальное программное решение, которое предоставляет комплексные инструменты для мониторинга, защиты и оптимизации приложений на основе LLM, включая функции отслеживания поведения, обнаружения аномалий и оптимизации производительности.
GOAT AI
GOAT AI
GOAT AI — это платформа, управляемая AI, которая предоставляет возможности однократного суммирования для различных типов контента, включая новостные статьи, исследовательские работы и видео, а также предлагает продвинутую оркестрацию AI-агентов для задач, специфичных для определенной области.
GiGOS
GiGOS
GiGOS - это AI платформа, которая предоставляет доступ к нескольким продвинутым языковым моделям, таким как Gemini, GPT-4, Claude и Grok, с интуитивно понятным интерфейсом для пользователей, чтобы взаимодействовать и сравнивать различные AI модели.