BaseRT 是一个从零开始构建的、原生的 Metal LLM 推理运行时,专为 Apple Silicon 设计,提供一流的预填充和解码吞吐量,并以 CLI、C API 和多语言绑定的形式发布,支持与 OpenAI 兼容的服务。
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

产品信息

更新于:2026年07月21日

什么是 BaseRT

BaseRT 是一个专门为在 Apple Silicon 上运行大型语言模型而构建的 AI 推理运行时。与许多基于通用 ML 框架的运行时不同,BaseRT 直接针对 Apple 的 Metal GPU API 编写,并有意避免依赖 MLX、PyTorch、CoreML 或其他中间层。它作为一个易于安装的工具链(CLI 加稳定的 C API)分发,并提供 Python、Node、Rust 和 Swift 等语言的绑定,支持本地使用(拉取模型并与之聊天)和部署用例(提供与 OpenAI 兼容的 API)。

BaseRT 的主要功能

BaseRT 是一个高性能 LLM 推理运行时,专为 Apple Silicon 设计,直接基于 Apple 的 Metal GPU API 构建(不依赖 MLX、PyTorch、CoreML 或其他中间框架)。它通过芯片特定的内核融合、统一内存感知优化和自定义调度逻辑,专注于最大化吞吐量和降低开销,与常见的 Apple 本地运行时相比,实现了同类最佳的解码和预填充性能。BaseRT 以命令行界面 (CLI) 和带有语言绑定的稳定 C API 形式发布,可以快速从 Hugging Face 拉取模型,运行本地聊天,或为应用程序和代理提供兼容 OpenAI 的 HTTP API 服务,从而确保推理的私密性和设备本地化。
原生 Metal 运行时(无框架): 直接针对 Apple 的 Metal API 实现,以避免 MLX/PyTorch/CoreML 带来的抽象开销,并更好地匹配 Metal 的执行模型和 Apple Silicon 的统一内存拓扑。
Apple Silicon 上同类最佳的吞吐量: 基准测试显示比 MLX 和 llama.cpp 更快,解码性能提升高达约 33%,预填充性能也有显著提升(尤其在长提示和 MoE 风格工作负载上表现强劲)。
模型家族的架构描述符: 以紧凑的描述符编码架构差异(激活函数、归一化变体、注意力/位置约定、MoE 路由细节),而不是在推理循环中硬编码许多分支。
广泛的量化支持: 支持多种量化格式(从低位量化到 FP16),使用户能够在 Apple M 系列设备上权衡质量、内存和速度。
开发者友好的 CLI 工作流程: 通过单个脚本安装,从 Hugging Face 拉取模型并转换为运行时格式,然后以最少的设置运行聊天或服务命令。
兼容 OpenAI 的本地服务 + 绑定: 运行兼容 OpenAI 的 HTTP 服务器用于聊天/补全,并提供带有绑定(例如 Python/Node/Rust/Swift)的稳定 C API,以便嵌入到应用程序和工具中。

BaseRT 的使用场景

企业内部的设备本地助手: 在 Apple Silicon 上本地运行内部聊天助手(数据不离开设备),适用于受监管环境和敏感文档。
本地编码代理和开发工具: 提供本地模型服务,并将编码代理/IDE 指向兼容 OpenAI 的端点,以获得快速、低延迟的代码帮助,无需云 API 密钥。
离线或低延迟应用的边缘推理: 在连接受限且延迟敏感的现场工作、医疗保健或旅行场景中,在笔记本电脑/平板电脑上部署 LLM 功能。
Mac 上的产品原型设计和评估: 通过 CLI(拉取/聊天/服务)快速测试多个开放模型和量化,以在承诺云部署之前,对用户体验、延迟和成本进行基准测试。
macOS/iOS 应用中嵌入 LLM 功能: 使用 C API 和语言绑定将本地 LLM 推理集成到需要可预测性能和隐私的本机应用程序中。

优点

在 Apple Silicon 上表现出色(与常见的本地运行时相比,解码和预填充吞吐量尤其强劲)。
无框架的 Metal 方法减少了开销,并提高了硬件特定优化的潜力。
便捷的打包:CLI + 兼容 OpenAI 的服务器 + 带有多种语言绑定的稳定 C API。

缺点

专注于 Apple Silicon/Metal(不是通用的跨平台推理运行时)。
某些竞争方法可能通过 MPSGraph 利用 Apple 神经网络引擎处理某些工作负载,而 BaseRT 的路径被描述为专注于 GPU(至少在当前的比较中)。
需要将模型转换为运行时特定格式(例如,拉取/转换为 BaseRT 格式),而不是直接运行任意检查点。

如何使用 BaseRT

1) 安装 BaseRT(CLI + 引擎): 在 Apple Silicon macOS 上,通过运行以下命令将 BaseRT 安装到您的 PATH 中: curl -LsSf https://basecompute.co/install.sh | sh 安装后,确认 `basert` 命令可用(例如,运行 `basert --help`)。
2) 从 Hugging Face 拉取模型(并转换为 .base 格式): 使用 BaseRT CLI 从 Hugging Face 下载受支持的模型,并将其转换为 BaseRT 优化的 `.base` 格式: basert pull Qwen/Qwen3-4B (替换为任何受支持的模型 ID。)
3) 从终端与本地模型聊天: 与您拉取的模型开始交互式聊天会话: basert chat Qwen/Qwen3-4B 这将在您的机器上本地运行模型。
4) 在本地提供与 OpenAI 兼容的 HTTP API: 将 BaseRT 作为本地服务器运行,暴露与 OpenAI 兼容的端点: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 从客户端调用服务器时,请使用打印/选择的 API 密钥。
5) (可选) 针对您的本地 BaseRT 服务器运行编码代理: 提供一个模型并连接一个本地编码代理,以便请求保留在设备上: # 提供一个模型 basert serve basecompute/gemma-4-E4B-it # 安装编码代理插件 pi install git:github.com/basecompute/pi-basert # 运行代理 pi

BaseRT 常见问题

BaseRT 是 Base Compute 推出的一款 AI 推理运行时,旨在 Apple Silicon 上高效运行大型语言模型。它直接基于 Apple 的 Metal API 编写(并非基于 MLX、PyTorch、CoreML 或其他中间框架),并被定位为“Apple Silicon 上最快的 LLM 推理运行时”。

与 BaseRT 类似的最新 AI 工具

Athena AI
Athena AI
Athena AI 是一个多功能的 AI 驱动平台,通过文档分析、测验生成、闪卡和互动聊天功能提供个性化学习辅助、商业解决方案和生活指导。
Aguru AI
Aguru AI
Aguru AI 是一个本地软件解决方案,为基于 LLM 的应用程序提供全面的监控、安全和优化工具,包括行为跟踪、异常检测和性能优化等功能。
GOAT AI
GOAT AI
GOAT AI 是一个 AI 驱动的平台,提供一键摘要功能,适用于新闻文章、研究论文和视频等各种内容类型,同时提供针对特定领域任务的高级 AI 代理编排。
GiGOS
GiGOS
GiGOS是一个AI平台,提供访问多个高级语言模型(如Gemini、GPT-4、Claude和Grok)的权限,并通过直观的界面让用户与不同的AI模型互动和比较。