
BaseRT
BaseRT 是一个从零开始构建的、原生的 Metal LLM 推理运行时,专为 Apple Silicon 设计,提供一流的预填充和解码吞吐量,并以 CLI、C API 和多语言绑定的形式发布,支持与 OpenAI 兼容的服务。
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

产品信息
更新于:2026年07月21日
什么是 BaseRT
BaseRT 是一个专门为在 Apple Silicon 上运行大型语言模型而构建的 AI 推理运行时。与许多基于通用 ML 框架的运行时不同,BaseRT 直接针对 Apple 的 Metal GPU API 编写,并有意避免依赖 MLX、PyTorch、CoreML 或其他中间层。它作为一个易于安装的工具链(CLI 加稳定的 C API)分发,并提供 Python、Node、Rust 和 Swift 等语言的绑定,支持本地使用(拉取模型并与之聊天)和部署用例(提供与 OpenAI 兼容的 API)。
BaseRT 的主要功能
BaseRT 是一个高性能 LLM 推理运行时,专为 Apple Silicon 设计,直接基于 Apple 的 Metal GPU API 构建(不依赖 MLX、PyTorch、CoreML 或其他中间框架)。它通过芯片特定的内核融合、统一内存感知优化和自定义调度逻辑,专注于最大化吞吐量和降低开销,与常见的 Apple 本地运行时相比,实现了同类最佳的解码和预填充性能。BaseRT 以命令行界面 (CLI) 和带有语言绑定的稳定 C API 形式发布,可以快速从 Hugging Face 拉取模型,运行本地聊天,或为应用程序和代理提供兼容 OpenAI 的 HTTP API 服务,从而确保推理的私密性和设备本地化。
原生 Metal 运行时(无框架): 直接针对 Apple 的 Metal API 实现,以避免 MLX/PyTorch/CoreML 带来的抽象开销,并更好地匹配 Metal 的执行模型和 Apple Silicon 的统一内存拓扑。
Apple Silicon 上同类最佳的吞吐量: 基准测试显示比 MLX 和 llama.cpp 更快,解码性能提升高达约 33%,预填充性能也有显著提升(尤其在长提示和 MoE 风格工作负载上表现强劲)。
模型家族的架构描述符: 以紧凑的描述符编码架构差异(激活函数、归一化变体、注意力/位置约定、MoE 路由细节),而不是在推理循环中硬编码许多分支。
广泛的量化支持: 支持多种量化格式(从低位量化到 FP16),使用户能够在 Apple M 系列设备上权衡质量、内存和速度。
开发者友好的 CLI 工作流程: 通过单个脚本安装,从 Hugging Face 拉取模型并转换为运行时格式,然后以最少的设置运行聊天或服务命令。
兼容 OpenAI 的本地服务 + 绑定: 运行兼容 OpenAI 的 HTTP 服务器用于聊天/补全,并提供带有绑定(例如 Python/Node/Rust/Swift)的稳定 C API,以便嵌入到应用程序和工具中。
BaseRT 的使用场景
企业内部的设备本地助手: 在 Apple Silicon 上本地运行内部聊天助手(数据不离开设备),适用于受监管环境和敏感文档。
本地编码代理和开发工具: 提供本地模型服务,并将编码代理/IDE 指向兼容 OpenAI 的端点,以获得快速、低延迟的代码帮助,无需云 API 密钥。
离线或低延迟应用的边缘推理: 在连接受限且延迟敏感的现场工作、医疗保健或旅行场景中,在笔记本电脑/平板电脑上部署 LLM 功能。
Mac 上的产品原型设计和评估: 通过 CLI(拉取/聊天/服务)快速测试多个开放模型和量化,以在承诺云部署之前,对用户体验、延迟和成本进行基准测试。
macOS/iOS 应用中嵌入 LLM 功能: 使用 C API 和语言绑定将本地 LLM 推理集成到需要可预测性能和隐私的本机应用程序中。
优点
在 Apple Silicon 上表现出色(与常见的本地运行时相比,解码和预填充吞吐量尤其强劲)。
无框架的 Metal 方法减少了开销,并提高了硬件特定优化的潜力。
便捷的打包:CLI + 兼容 OpenAI 的服务器 + 带有多种语言绑定的稳定 C API。
缺点
专注于 Apple Silicon/Metal(不是通用的跨平台推理运行时)。
某些竞争方法可能通过 MPSGraph 利用 Apple 神经网络引擎处理某些工作负载,而 BaseRT 的路径被描述为专注于 GPU(至少在当前的比较中)。
需要将模型转换为运行时特定格式(例如,拉取/转换为 BaseRT 格式),而不是直接运行任意检查点。
如何使用 BaseRT
1) 安装 BaseRT(CLI + 引擎): 在 Apple Silicon macOS 上,通过运行以下命令将 BaseRT 安装到您的 PATH 中:
curl -LsSf https://basecompute.co/install.sh | sh
安装后,确认 `basert` 命令可用(例如,运行 `basert --help`)。
2) 从 Hugging Face 拉取模型(并转换为 .base 格式): 使用 BaseRT CLI 从 Hugging Face 下载受支持的模型,并将其转换为 BaseRT 优化的 `.base` 格式:
basert pull Qwen/Qwen3-4B
(替换为任何受支持的模型 ID。)
3) 从终端与本地模型聊天: 与您拉取的模型开始交互式聊天会话:
basert chat Qwen/Qwen3-4B
这将在您的机器上本地运行模型。
4) 在本地提供与 OpenAI 兼容的 HTTP API: 将 BaseRT 作为本地服务器运行,暴露与 OpenAI 兼容的端点:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
从客户端调用服务器时,请使用打印/选择的 API 密钥。
5) (可选) 针对您的本地 BaseRT 服务器运行编码代理: 提供一个模型并连接一个本地编码代理,以便请求保留在设备上:
# 提供一个模型
basert serve basecompute/gemma-4-E4B-it
# 安装编码代理插件
pi install git:github.com/basecompute/pi-basert
# 运行代理
pi
BaseRT 常见问题
BaseRT 是 Base Compute 推出的一款 AI 推理运行时,旨在 Apple Silicon 上高效运行大型语言模型。它直接基于 Apple 的 Metal API 编写(并非基于 MLX、PyTorch、CoreML 或其他中间框架),并被定位为“Apple Silicon 上最快的 LLM 推理运行时”。











