BaseRTは、Apple Silicon向けのゼロから構築されたネイティブMetal LLM推論ランタイムであり、CLI、C API、およびOpenAI互換のサービスを備えた多言語バインディングとして提供されながら、クラス最高のプリフィルとデコードスループットを実現します。
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

製品情報

更新日:2026年07月21日

BaseRTとは

BaseRTは、Apple Silicon上で大規模言語モデルを実行するために特別に構築されたAI推論ランタイムです。汎用MLフレームワークの上に構築されている多くのランタイムとは異なり、BaseRTはAppleのMetal GPU APIに直接記述されており、MLX、PyTorch、CoreML、その他の仲介レイヤーへの依存を意図的に避けています。これは、Python、Node、Rust、Swiftなどの言語用のバインディングを備えた、インストールが簡単なツールチェーン(CLIと安定したC API)として配布されており、ローカルでの使用(モデルのプルとチャット)とデプロイメントのユースケース(OpenAI互換APIの提供)の両方を可能にします。

BaseRTの主な機能

BaseRTは、AppleのMetal GPU API上に直接構築された(MLX、PyTorch、CoreML、その他のM中間フレームワークなし)Apple Silicon向けの高性能LLM推論ランタイムです。チップ固有のカーネル融合、統合メモリを意識した最適化、カスタムディスパッチロジックにより、スループットを最大化し、オーバーヘッドを削減することに重点を置いており、一般的なAppleローカルランタイムと比較して、クラス最高のデコードおよびプリフィルパフォーマンスを実現します。BaseRTは、CLIと言語バインディングを備えた安定したC APIとして提供され、Hugging Faceからモデルを迅速にプルしたり、ローカルチャットを実行したり、アプリやエージェント向けにOpenAI互換のHTTP APIを提供したりできます。これにより、推論をプライベートかつオンデバイスで保持します。
ネイティブMetalランタイム(フレームワークフリー): AppleのMetal APIに直接実装されており、MLX/PyTorch/CoreMLからの抽象化オーバーヘッドを回避し、Metalの実行モデルとApple Siliconの統合メモリトポロジにより良く適合します。
Apple Siliconでのクラス最高のスループット: MLXおよびllama.cppよりも高速であることがベンチマークで示されており、デコードで最大約33%の向上、プリフィルで大幅な改善が報告されています(特に長いプロンプトやMoEスタイルのワークロードで強力です)。
モデルファミリーのアーキテクチャ記述子: 推論ループで多くの分岐をハードコーディングするのではなく、アーキテクチャの違い(アクティベーション、正規化バリアント、アテンション/位置の慣例、MoEルーティングの specifics)をコンパクトな記述子にエンコードします。
幅広い量子化サポート: 複数の量子化形式(低ビット量子化からFP16まで)をサポートしており、ユーザーはApple Mシリーズデバイス全体で品質、メモリ、速度のトレードオフを行うことができます。
開発者に優しいCLIワークフロー: 単一のスクリプトでインストールし、Hugging Faceからモデルをプルしてランタイム形式に変換し、最小限のセットアップでチャットまたはサービスコマンドを実行します。
OpenAI互換のローカルサービス + バインディング: チャット/補完用のOpenAI互換HTTPサーバーを実行し、アプリやツールに組み込むためのバインディング(例:Python/Node/Rust/Swift)を備えた安定したC APIを提供します。

BaseRTのユースケース

企業向けプライベートオンデバイスアシスタント: Apple Silicon上で内部チャットアシスタントをローカルで実行します(データはデバイスから離れません)。規制された環境や機密文書に役立ちます。
ローカルコーディングエージェントと開発者ツール: ローカルモデルを提供し、OpenAI互換のエンドポイントにコーディングエージェント/IDEを接続して、クラウドAPIキーなしで高速かつ低遅延のコードヘルプを得ます。
オフラインまたは低遅延アプリ向けエッジ推論: 接続が制限され、遅延が重要な現場作業、医療、旅行のシナリオで、LLM機能をラップトップ/タブレットに展開します。
Macでの製品プロトタイピングと評価: CLI(プル/チャット/提供)を介して複数のオープンモデルと量子化を迅速にテストし、クラウド展開を決定する前にUX、遅延、コストをベンチマークします。
macOS/iOSアプリへのLLM機能の組み込み: C APIと言語バインディングを使用して、予測可能なパフォーマンスとプライバシーを必要とするネイティブアプリケーションにローカルLLM推論を統合します。

メリット

Apple Siliconでの高性能(一般的なローカルランタイムと比較して、特に強力なデコードおよびプリフィルスループット)。
フレームワークフリーのMetalアプローチにより、オーバーヘッドが削減され、ハードウェア固有の最適化の可能性が向上します。
便利なパッケージング:CLI + OpenAI互換サーバー + 複数の言語バインディングを備えた安定したC API。

デメリット

Apple Silicon/Metalに特化(一般的なクロスプラットフォーム推論ランタイムではありません)。
一部の競合アプローチは、特定のワークロードでMPSGraphを介してApple Neural Engineを利用する可能性がありますが、BaseRTのパスはGPUに特化していると説明されています(少なくとも現在の比較では)。
任意のチェックポイントを直接実行するのではなく、モデルをランタイム固有の形式に変換する必要があります(例:BaseRT形式にプル/変換)。

BaseRTの使い方

1) BaseRTをインストールする(CLI + エンジン): Apple Silicon macOSで、以下のコマンドを実行してBaseRTをPATHにインストールします。 curl -LsSf https://basecompute.co/install.sh | sh インストール後、`basert`コマンドが利用可能であることを確認します(例:`basert --help`を実行)。
2) Hugging Faceからモデルをプルする(そして.base形式に変換する): BaseRT CLIを使用して、Hugging Faceからサポートされているモデルをダウンロードし、BaseRTの最適化された`.base`形式に変換します。 basert pull Qwen/Qwen3-4B (サポートされている任意のモデルIDに置き換えてください。)
3) ターミナルからローカルモデルとチャットする: プルしたモデルとの対話型チャットセッションを開始します。 basert chat Qwen/Qwen3-4B これは、お使いのマシンでモデルをローカルに実行します。
4) OpenAI互換のHTTP APIをローカルで提供する: OpenAI互換のエンドポイントを公開するローカルサーバーとしてBaseRTを実行します。 basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 クライアントからサーバーを呼び出すときに、表示/選択されたAPIキーを使用します。
5) (オプション) ローカルのBaseRTサーバーに対してコーディングエージェントを実行する: モデルを提供し、ローカルのコーディングエージェントを接続して、リクエストがデバイス内に留まるようにします。 # モデルを提供する basert serve basecompute/gemma-4-E4B-it # コーディングエージェントプラグインをインストールする pi install git:github.com/basecompute/pi-basert # エージェントを実行する pi

BaseRTのよくある質問

BaseRTは、Apple Silicon上で大規模言語モデルを効率的に実行するために設計されたBase ComputeのAI推論ランタイムです。AppleのMetal APIに直接記述されており(MLX、PyTorch、CoreML、その他の_中間_フレームワーク上には構築されていません)、"Apple Silicon向けの最速LLM推論ランタイム"と位置付けられています。

BaseRTに類似した最新のAIツール

Athena AI
Athena AI
Athena AIは、ドキュメント分析、クイズ生成、フラッシュカード、インタラクティブチャット機能などを通じて、個別化された学習支援、ビジネスソリューション、ライフコーチングを提供する多用途のAI駆動プラットフォームです
Aguru AI
Aguru AI
Aguru AIは、行動追跡、異常検出、パフォーマンス最適化などの機能を備えたLLMベースのアプリケーションの包括的な監視、セキュリティ、および最適化ツールを提供するオンプレミスソフトウェアソリューションです。
GOAT AI
GOAT AI
GOAT AIは、ニュース記事、研究論文、動画などのさまざまなコンテンツタイプに対してワンクリック要約機能を提供するAI駆動のプラットフォームであり、ドメイン特有のタスクのための高度なAIエージェントオーケストレーションも提供しています。
GiGOS
GiGOS
GiGOSは、Gemini、GPT-4、Claude、Grokなどの複数の高度な言語モデルにアクセスできるAIプラットフォームで、ユーザーが異なるAIモデルと対話し、比較するための直感的なインターフェースを提供します