
BaseRT
BaseRT 是一個從零開始構建的、原生的 Metal LLM 推斷運行時,專為 Apple Silicon 設計,提供一流的預填充和解碼吞吐量,同時以 CLI、C API 和多語言綁定形式發布,並支援 OpenAI 相容的服務。
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

產品資訊
更新時間:2026年07月21日
什麼是 BaseRT
BaseRT 是一個專為在 Apple Silicon 上運行大型語言模型而構建的 AI 推斷運行時。與許多基於通用 ML 框架的運行時不同,BaseRT 直接針對 Apple 的 Metal GPU API 編寫,並有意避免依賴 MLX、PyTorch、CoreML 或其他中間層。它作為一個易於安裝的工具鏈(CLI 和穩定的 C API)分發,並提供 Python、Node、Rust 和 Swift 等語言的綁定,支援本地使用(拉取模型和聊天)和部署用例(提供 OpenAI 相容的 API)。
BaseRT 的主要功能
BaseRT 是一個專為 Apple Silicon 設計的高效能 LLM 推理運行時,直接基於 Apple 的 Metal GPU API 構建(沒有 MLX、PyTorch、CoreML 或其他中間框架)。它專注於透過晶片特定的核心融合、統一記憶體感知優化和自訂調度邏輯來最大化吞吐量並降低開銷,相較於常見的 Apple 本地運行時,實現了同類最佳的解碼和預填充效能。BaseRT 以 CLI 和帶有語言綁定的穩定 C API 形式發布,可以快速從 Hugging Face 拉取模型、運行本地聊天或為應用程式和代理提供與 OpenAI 相容的 HTTP API,從而保持推理的私密性和設備內執行。
原生 Metal 運行時(無框架): 直接針對 Apple 的 Metal API 實施,以避免 MLX/PyTorch/CoreML 的抽象開銷,並更好地匹配 Metal 的執行模型和 Apple Silicon 的統一記憶體拓撲。
Apple Silicon 上的同類最佳吞吐量: 基準測試顯示比 MLX 和 llama.cpp 更快,解碼效能提升高達約 33%,預填充效能也有顯著提升(在長提示和 MoE 樣式工作負載上尤其強勁)。
模型家族的架構描述符: 以緊湊的描述符編碼架構差異(激活、歸一化變體、注意力/位置約定、MoE 路由細節),而不是在推理循環中硬編碼許多分支。
廣泛的量化支持: 支持多種量化格式(從低位量化到 FP16),使用戶能夠在 Apple M 系列設備上權衡品質、記憶體和速度。
開發者友好的 CLI 工作流程: 透過單一腳本安裝,從 Hugging Face 拉取模型並轉換為運行時格式,然後以最少的設置運行聊天或服務命令。
與 OpenAI 相容的本地服務 + 綁定: 運行與 OpenAI 相容的 HTTP 伺服器用於聊天/完成,並提供帶有綁定(例如 Python/Node/Rust/Swift)的穩定 C API,用於嵌入到應用程式和工具中。
BaseRT 的使用案例
企業專用的設備內助理: 在 Apple Silicon 上本地運行內部聊天助理(數據不離開設備),適用於受監管的環境和敏感文件。
本地編碼代理和開發者工具: 提供本地模型並將編碼代理/IDE 指向與 OpenAI 相容的端點,以獲得快速、低延遲的程式碼協助,無需雲端 API 金鑰。
離線或低延遲應用程式的邊緣推理: 在連接受限且延遲至關重要的現場工作、醫療保健或旅行場景中,在筆記型電腦/平板電腦上部署 LLM 功能。
Mac 上的產品原型設計和評估: 透過 CLI(拉取/聊天/服務)快速測試多個開放模型和量化,以在承諾雲端部署之前基準測試使用者體驗、延遲和成本。
macOS/iOS 應用程式中的嵌入式 LLM 功能: 使用 C API 和語言綁定將本地 LLM 推理整合到需要可預測效能和隱私的原生應用程式中。
優點
在 Apple Silicon 上表現出色(相較於常見的本地運行時,解碼和預填充吞吐量特別強勁)。
無框架的 Metal 方法減少了開銷並提高了硬體特定優化的潛力。
便捷的打包:CLI + 與 OpenAI 相容的伺服器 + 帶有多種語言綁定的穩定 C API。
缺點
專注於 Apple Silicon/Metal(不是通用的跨平台推理運行時)。
某些競爭方法可能會透過 MPSGraph 利用 Apple 神經引擎處理某些工作負載,而 BaseRT 的路徑被描述為專注於 GPU(至少在目前的比較中是如此)。
需要將模型轉換為運行時特定的格式(例如,拉取/轉換為 BaseRT 格式),而不是直接運行任意檢查點。
如何使用 BaseRT
1) 安裝 BaseRT (CLI + 引擎): 在 Apple Silicon macOS 上,通過運行以下命令將 BaseRT 安裝到您的 PATH 中:
curl -LsSf https://basecompute.co/install.sh | sh
安裝後,確認 `basert` 命令可用(例如,運行 `basert --help`)。
2) 從 Hugging Face 拉取模型(並轉換為 .base 格式): 使用 BaseRT CLI 從 Hugging Face 下載支援的模型,並將其轉換為 BaseRT 優化的 `.base` 格式:
basert pull Qwen/Qwen3-4B
(替換為任何支援的模型 ID。)
3) 從終端與本地模型聊天: 啟動與您拉取模型互動的聊天會話:
basert chat Qwen/Qwen3-4B
這會在您的機器上本地運行模型。
4) 在本地提供 OpenAI 相容的 HTTP API: 將 BaseRT 作為本地伺服器運行,公開 OpenAI 相容的端點:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
從客戶端呼叫伺服器時使用列印/選擇的 API 金鑰。
5) (可選) 針對您的本地 BaseRT 伺服器運行編碼代理: 提供模型並連接本地編碼代理,以便請求保留在設備上:
# 提供模型
basert serve basecompute/gemma-4-E4B-it
# 安裝編碼代理插件
pi install git:github.com/basecompute/pi-basert
# 運行代理
pi
BaseRT 常見問題
BaseRT 是 Base Compute 推出的人工智慧推論運行時,旨在 Apple Silicon 上高效運行大型語言模型。它直接針對 Apple 的 Metal API 編寫(並非基於 MLX、PyTorch、CoreML 或其他中間框架),並被定位為「Apple Silicon 上最快的 LLM 推論運行時」。











