
BaseRT
BaseRT adalah runtime inferensi LLM Metal asli yang dibuat dari awal untuk Apple Silicon yang memberikan prefill dan decode throughput terbaik di kelasnya sambil dikirimkan sebagai CLI, API C, dan binding multi-bahasa dengan serving yang kompatibel dengan OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

Informasi Produk
Diperbarui:Jul 21, 2026
Apa itu BaseRT
BaseRT adalah runtime inferensi AI yang dibangun khusus untuk menjalankan model bahasa besar pada Apple Silicon. Tidak seperti banyak runtime yang berada di atas kerangka kerja ML tujuan umum, BaseRT ditulis langsung terhadap API GPU Metal Apple dan sengaja menghindari ketergantungan pada MLX, PyTorch, CoreML, atau lapisan perantara lainnya. Ini didistribusikan sebagai toolchain yang mudah diinstal (CLI ditambah API C yang stabil) dengan binding untuk bahasa seperti Python, Node, Rust, dan Swift, memungkinkan penggunaan lokal (pull dan chat dengan model) dan kasus penggunaan deployment (melayani API yang kompatibel dengan OpenAI).
Fitur Utama BaseRT
BaseRT adalah runtime inferensi LLM berperforma tinggi untuk Apple Silicon yang dibangun langsung di atas API GPU Metal Apple (tanpa MLX, PyTorch, CoreML, atau kerangka kerja perantara lainnya). Ini berfokus pada memaksimalkan throughput dan menurunkan overhead melalui fusi kernel khusus chip, optimasi yang sadar memori terpadu, dan logika pengiriman khusus, mencapai kinerja decode dan prefill terbaik di kelasnya dibandingkan dengan runtime lokal Apple yang umum. BaseRT dikirimkan sebagai CLI ditambah API C stabil dengan ikatan bahasa, dan dapat dengan cepat menarik model dari Hugging Face, menjalankan obrolan lokal, atau menyajikan API HTTP yang kompatibel dengan OpenAI untuk aplikasi dan agen—menjaga inferensi tetap pribadi dan di perangkat.
Runtime Metal asli (bebas kerangka kerja): Diimplementasikan langsung terhadap API Metal Apple untuk menghindari overhead abstraksi dari MLX/PyTorch/CoreML dan lebih cocok dengan model eksekusi Metal dan topologi memori terpadu Apple Silicon.
Throughput terbaik di kelasnya pada Apple Silicon: Diukur lebih cepat dari MLX dan llama.cpp, dengan peningkatan yang dilaporkan hingga ~33% pada decode dan peningkatan besar pada prefill (terutama kuat pada prompt panjang dan beban kerja gaya MoE).
Deskriptor arsitektur untuk keluarga model: Mengkodekan perbedaan arsitektur (aktivasi, varian normalisasi, konvensi perhatian/posisi, spesifik routing MoE) dalam deskriptor ringkas daripada mengkodekan banyak cabang dalam loop inferensi.
Dukungan kuantisasi luas: Mendukung beberapa format kuantisasi (dari kuantisasi bit rendah hingga FP16), memungkinkan pengguna untuk menukar kualitas, memori, dan kecepatan di seluruh perangkat Apple M-series.
Alur kerja CLI yang ramah pengembang: Instal dengan satu skrip, tarik model dari Hugging Face dan konversi ke format runtime, lalu jalankan perintah obrolan atau penyajian dengan pengaturan minimal.
Penyajian lokal yang kompatibel dengan OpenAI + ikatan: Menjalankan server HTTP yang kompatibel dengan OpenAI untuk obrolan/penyelesaian dan menyediakan API C stabil dengan ikatan (misalnya, Python/Node/Rust/Swift) untuk disematkan ke dalam aplikasi dan alat.
Kasus Penggunaan BaseRT
Asisten pribadi di perangkat untuk perusahaan: Jalankan asisten obrolan internal secara lokal di Apple Silicon (tanpa data meninggalkan perangkat), berguna untuk lingkungan yang diatur dan dokumen sensitif.
Agen pengkodean lokal dan alat pengembang: Sajikan model lokal dan arahkan agen pengkodean/IDE ke titik akhir yang kompatibel dengan OpenAI untuk mendapatkan bantuan kode yang cepat dan latensi rendah tanpa kunci API cloud.
Inferensi tepi untuk aplikasi offline atau latensi rendah: Terapkan fitur LLM pada laptop/tablet dalam pekerjaan lapangan, perawatan kesehatan, atau skenario perjalanan di mana konektivitas terbatas dan latensi menjadi masalah.
Prototyping dan evaluasi produk di Mac: Uji cepat beberapa model terbuka dan kuantisasi melalui CLI (pull/chat/serve) untuk mengukur UX, latensi, dan biaya sebelum berkomitmen pada penerapan cloud.
Kemampuan LLM tertanam dalam aplikasi macOS/iOS: Gunakan API C dan ikatan bahasa untuk mengintegrasikan inferensi LLM lokal ke dalam aplikasi asli yang membutuhkan kinerja dan privasi yang dapat diprediksi.
Kelebihan
Kinerja tinggi pada Apple Silicon (throughput decode dan prefill yang sangat kuat dibandingkan dengan runtime lokal umum).
Pendekatan Metal bebas kerangka kerja mengurangi overhead dan meningkatkan potensi optimasi khusus perangkat keras.
Pengemasan yang nyaman: CLI + server yang kompatibel dengan OpenAI + API C stabil dengan beberapa ikatan bahasa.
Kekurangan
Fokus pada Apple Silicon/Metal (bukan runtime inferensi lintas platform umum).
Beberapa pendekatan yang bersaing mungkin memanfaatkan Apple Neural Engine melalui MPSGraph untuk beban kerja tertentu, sementara jalur BaseRT digambarkan sebagai fokus GPU (setidaknya dalam perbandingan saat ini).
Membutuhkan konversi model ke format khusus runtime (misalnya, ditarik/dikonversi ke format BaseRT) daripada menjalankan checkpoint arbitrer secara langsung.
Cara Menggunakan BaseRT
1) Instal BaseRT (CLI + engine): Pada Apple Silicon macOS, instal BaseRT ke PATH Anda dengan menjalankan:
curl -LsSf https://basecompute.co/install.sh | sh
Setelah instalasi, konfirmasikan bahwa perintah `basert` tersedia (misalnya, jalankan `basert --help`).
2) Tarik model dari Hugging Face (dan konversi ke format .base): Gunakan CLI BaseRT untuk mengunduh model yang didukung dari Hugging Face dan mengonversinya ke format `.base` yang dioptimalkan oleh BaseRT:
basert pull Qwen/Qwen3-4B
(Ganti dengan ID model yang didukung.)
3) Mengobrol dengan model lokal dari terminal: Mulai sesi obrolan interaktif dengan model yang Anda tarik:
basert chat Qwen/Qwen3-4B
Ini menjalankan model secara lokal di mesin Anda.
4) Sajikan API HTTP yang kompatibel dengan OpenAI secara lokal: Jalankan BaseRT sebagai server lokal yang mengekspos endpoint yang kompatibel dengan OpenAI:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
Gunakan kunci API yang dicetak/dipilih saat memanggil server dari klien.
5) (Opsional) Jalankan agen pengkodean terhadap server BaseRT lokal Anda: Sajikan model dan hubungkan agen pengkodean lokal sehingga permintaan tetap berada di perangkat:
# Sajikan model
basert serve basecompute/gemma-4-E4B-it
# Instal plugin coding-agent
pi install git:github.com/basecompute/pi-basert
# Jalankan agen
pi
FAQ BaseRT
BaseRT adalah runtime inferensi AI dari Base Compute yang dirancang untuk menjalankan model bahasa besar secara efisien di Apple Silicon. Ini ditulis langsung menggunakan API Metal Apple (tidak dibangun di atas MLX, PyTorch, CoreML, atau kerangka kerja perantara lainnya) dan diposisikan sebagai "runtime inferensi LLM tercepat untuk Apple Silicon."
Artikel Populer

Atoms: Platform AI Multi-Agen yang Mengubah Ide menjadi Produk Siap Diluncurkan
May 22, 2026

Nano Banana SBTI: Apa Itu, Bagaimana Cara Kerjanya, dan Cara Menggunakannya di Tahun 2026
Apr 15, 2026

Ulasan Atoms — Pembuat Produk AI yang Mendefinisikan Ulang Kreasi Digital di Tahun 2026
Apr 10, 2026

Kilo Claw: Cara Menerapkan dan Menggunakan Agen AI "Lakukan-Untuk-Anda" Sejati (Pembaruan 2026)
Apr 3, 2026







