BaseRT 是一個從零開始構建的、原生的 Metal LLM 推斷運行時,專為 Apple Silicon 設計,提供一流的預填充和解碼吞吐量,同時以 CLI、C API 和多語言綁定形式發布,並支援 OpenAI 相容的服務。
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

產品資訊

更新時間:2026年07月21日

什麼是 BaseRT

BaseRT 是一個專為在 Apple Silicon 上運行大型語言模型而構建的 AI 推斷運行時。與許多基於通用 ML 框架的運行時不同,BaseRT 直接針對 Apple 的 Metal GPU API 編寫,並有意避免依賴 MLX、PyTorch、CoreML 或其他中間層。它作為一個易於安裝的工具鏈(CLI 和穩定的 C API)分發,並提供 Python、Node、Rust 和 Swift 等語言的綁定,支援本地使用(拉取模型和聊天)和部署用例(提供 OpenAI 相容的 API)。

BaseRT 的主要功能

BaseRT 是一個專為 Apple Silicon 設計的高效能 LLM 推理運行時,直接基於 Apple 的 Metal GPU API 構建(沒有 MLX、PyTorch、CoreML 或其他中間框架)。它專注於透過晶片特定的核心融合、統一記憶體感知優化和自訂調度邏輯來最大化吞吐量並降低開銷,相較於常見的 Apple 本地運行時,實現了同類最佳的解碼和預填充效能。BaseRT 以 CLI 和帶有語言綁定的穩定 C API 形式發布,可以快速從 Hugging Face 拉取模型、運行本地聊天或為應用程式和代理提供與 OpenAI 相容的 HTTP API,從而保持推理的私密性和設備內執行。
原生 Metal 運行時(無框架): 直接針對 Apple 的 Metal API 實施,以避免 MLX/PyTorch/CoreML 的抽象開銷,並更好地匹配 Metal 的執行模型和 Apple Silicon 的統一記憶體拓撲。
Apple Silicon 上的同類最佳吞吐量: 基準測試顯示比 MLX 和 llama.cpp 更快,解碼效能提升高達約 33%,預填充效能也有顯著提升(在長提示和 MoE 樣式工作負載上尤其強勁)。
模型家族的架構描述符: 以緊湊的描述符編碼架構差異(激活、歸一化變體、注意力/位置約定、MoE 路由細節),而不是在推理循環中硬編碼許多分支。
廣泛的量化支持: 支持多種量化格式(從低位量化到 FP16),使用戶能夠在 Apple M 系列設備上權衡品質、記憶體和速度。
開發者友好的 CLI 工作流程: 透過單一腳本安裝,從 Hugging Face 拉取模型並轉換為運行時格式,然後以最少的設置運行聊天或服務命令。
與 OpenAI 相容的本地服務 + 綁定: 運行與 OpenAI 相容的 HTTP 伺服器用於聊天/完成,並提供帶有綁定(例如 Python/Node/Rust/Swift)的穩定 C API,用於嵌入到應用程式和工具中。

BaseRT 的使用案例

企業專用的設備內助理: 在 Apple Silicon 上本地運行內部聊天助理(數據不離開設備),適用於受監管的環境和敏感文件。
本地編碼代理和開發者工具: 提供本地模型並將編碼代理/IDE 指向與 OpenAI 相容的端點,以獲得快速、低延遲的程式碼協助,無需雲端 API 金鑰。
離線或低延遲應用程式的邊緣推理: 在連接受限且延遲至關重要的現場工作、醫療保健或旅行場景中,在筆記型電腦/平板電腦上部署 LLM 功能。
Mac 上的產品原型設計和評估: 透過 CLI(拉取/聊天/服務)快速測試多個開放模型和量化,以在承諾雲端部署之前基準測試使用者體驗、延遲和成本。
macOS/iOS 應用程式中的嵌入式 LLM 功能: 使用 C API 和語言綁定將本地 LLM 推理整合到需要可預測效能和隱私的原生應用程式中。

優點

在 Apple Silicon 上表現出色(相較於常見的本地運行時,解碼和預填充吞吐量特別強勁)。
無框架的 Metal 方法減少了開銷並提高了硬體特定優化的潛力。
便捷的打包:CLI + 與 OpenAI 相容的伺服器 + 帶有多種語言綁定的穩定 C API。

缺點

專注於 Apple Silicon/Metal(不是通用的跨平台推理運行時)。
某些競爭方法可能會透過 MPSGraph 利用 Apple 神經引擎處理某些工作負載,而 BaseRT 的路徑被描述為專注於 GPU(至少在目前的比較中是如此)。
需要將模型轉換為運行時特定的格式(例如,拉取/轉換為 BaseRT 格式),而不是直接運行任意檢查點。

如何使用 BaseRT

1) 安裝 BaseRT (CLI + 引擎): 在 Apple Silicon macOS 上,通過運行以下命令將 BaseRT 安裝到您的 PATH 中: curl -LsSf https://basecompute.co/install.sh | sh 安裝後,確認 `basert` 命令可用(例如,運行 `basert --help`)。
2) 從 Hugging Face 拉取模型(並轉換為 .base 格式): 使用 BaseRT CLI 從 Hugging Face 下載支援的模型,並將其轉換為 BaseRT 優化的 `.base` 格式: basert pull Qwen/Qwen3-4B (替換為任何支援的模型 ID。)
3) 從終端與本地模型聊天: 啟動與您拉取模型互動的聊天會話: basert chat Qwen/Qwen3-4B 這會在您的機器上本地運行模型。
4) 在本地提供 OpenAI 相容的 HTTP API: 將 BaseRT 作為本地伺服器運行,公開 OpenAI 相容的端點: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 從客戶端呼叫伺服器時使用列印/選擇的 API 金鑰。
5) (可選) 針對您的本地 BaseRT 伺服器運行編碼代理: 提供模型並連接本地編碼代理,以便請求保留在設備上: # 提供模型 basert serve basecompute/gemma-4-E4B-it # 安裝編碼代理插件 pi install git:github.com/basecompute/pi-basert # 運行代理 pi

BaseRT 常見問題

BaseRT 是 Base Compute 推出的人工智慧推論運行時,旨在 Apple Silicon 上高效運行大型語言模型。它直接針對 Apple 的 Metal API 編寫(並非基於 MLX、PyTorch、CoreML 或其他中間框架),並被定位為「Apple Silicon 上最快的 LLM 推論運行時」。

与 BaseRT 类似的最新 AI 工具

Athena AI
Athena AI
Athena AI 是一個多功能的 AI 驅動平台,通過文檔分析、測驗生成、閃卡和互動聊天功能,提供個性化的學習協助、商業解決方案和生活輔導。
Aguru AI
Aguru AI
Aguru AI 是一個本地部署的軟件解決方案,為基於 LLM 的應用提供全面的監控、安全和優化工具,包括行為跟蹤、異常檢測和性能優化等功能。
GOAT AI
GOAT AI
GOAT AI 是一個 AI 驅動的平台,提供一鍵摘要功能,適用於新聞文章、研究論文和視頻等多種內容類型,同時還提供先進的 AI 代理編排,用於特定領域的任務。
GiGOS
GiGOS
GiGOS 是一個 AI 平台,提供多個先進的語言模型,如 Gemini、GPT-4、Claude 和 Grok,並通過直觀的界面讓用戶與不同的 AI 模型互動和比較。