BaseRT là một thời gian chạy suy luận LLM Metal gốc, được xây dựng từ đầu cho Apple Silicon, mang lại thông lượng điền trước và giải mã tốt nhất trong phân khúc, đồng thời được phân phối dưới dạng CLI, API C và các ràng buộc đa ngôn ngữ với khả năng phục vụ tương thích với OpenAI.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure
BaseRT

Thông tin Sản phẩm

Đã cập nhật:Jul 21, 2026

BaseRT là gì

BaseRT là một thời gian chạy suy luận AI được xây dựng đặc biệt để chạy các mô hình ngôn ngữ lớn trên Apple Silicon. Không giống như nhiều thời gian chạy nằm trên các khung ML đa năng, BaseRT được viết trực tiếp dựa trên API GPU Metal của Apple và cố tình tránh các phụ thuộc vào MLX, PyTorch, CoreML hoặc các lớp trung gian khác. Nó được phân phối dưới dạng một chuỗi công cụ dễ cài đặt (CLI cộng với API C ổn định) với các ràng buộc cho các ngôn ngữ như Python, Node, Rust và Swift, cho phép cả việc sử dụng cục bộ (kéo và trò chuyện với các mô hình) và các trường hợp sử dụng triển khai (phục vụ API tương thích với OpenAI).

Các Tính năng Chính của BaseRT

BaseRT là một thời gian chạy suy luận LLM hiệu suất cao dành cho Apple Silicon được xây dựng trực tiếp trên API GPU Metal của Apple (không có MLX, PyTorch, CoreML hoặc các framework trung gian khác). Nó tập trung vào việc tối đa hóa thông lượng và giảm chi phí thông qua hợp nhất kernel dành riêng cho chip, tối ưu hóa nhận biết bộ nhớ hợp nhất và logic điều phối tùy chỉnh, đạt được hiệu suất giải mã và điền trước tốt nhất so với các thời gian chạy cục bộ phổ biến của Apple. BaseRT được phân phối dưới dạng CLI cộng với API C ổn định với các ràng buộc ngôn ngữ, và có thể nhanh chóng kéo các mô hình từ Hugging Face, chạy trò chuyện cục bộ hoặc phục vụ API HTTP tương thích OpenAI cho các ứng dụng và tác nhân—giữ suy luận riêng tư và trên thiết bị.
Thời gian chạy Metal gốc (không framework): Được triển khai trực tiếp dựa trên API Metal của Apple để tránh chi phí trừu tượng từ MLX/PyTorch/CoreML và phù hợp hơn với mô hình thực thi của Metal và cấu trúc bộ nhớ hợp nhất của Apple Silicon.
Thông lượng tốt nhất trên Apple Silicon: Được đánh giá là nhanh hơn MLX và llama.cpp, với mức tăng được báo cáo lên đến ~33% khi giải mã và cải thiện đáng kể khi điền trước (đặc biệt mạnh mẽ trên các lời nhắc dài và khối lượng công việc kiểu MoE).
Mô tả kiến trúc cho các họ mô hình: Mã hóa các khác biệt kiến trúc (kích hoạt, các biến thể chuẩn hóa, quy ước chú ý/vị trí, chi tiết định tuyến MoE) trong một mô tả nhỏ gọn thay vì mã hóa cứng nhiều nhánh trong vòng lặp suy luận.
Hỗ trợ lượng tử hóa rộng rãi: Hỗ trợ nhiều định dạng lượng tử hóa (từ lượng tử hóa bit thấp đến FP16), cho phép người dùng đánh đổi chất lượng, bộ nhớ và tốc độ trên các thiết bị Apple M-series.
Quy trình làm việc CLI thân thiện với nhà phát triển: Cài đặt bằng một tập lệnh duy nhất, kéo các mô hình từ Hugging Face và chuyển đổi sang định dạng thời gian chạy, sau đó chạy các lệnh trò chuyện hoặc phục vụ với thiết lập tối thiểu.
Phục vụ cục bộ tương thích OpenAI + ràng buộc: Chạy một máy chủ HTTP tương thích OpenAI cho trò chuyện/hoàn thành và cung cấp API C ổn định với các ràng buộc (ví dụ: Python/Node/Rust/Swift) để nhúng vào các ứng dụng và công cụ.

Các Trường hợp Sử dụng của BaseRT

Trợ lý trên thiết bị riêng tư cho doanh nghiệp: Chạy trợ lý trò chuyện nội bộ cục bộ trên Apple Silicon (không có dữ liệu rời khỏi thiết bị), hữu ích cho các môi trường được quy định và các tài liệu nhạy cảm.
Các tác nhân mã hóa cục bộ và công cụ phát triển: Phục vụ một mô hình cục bộ và trỏ các tác nhân mã hóa/IDE vào điểm cuối tương thích OpenAI để nhận trợ giúp mã nhanh, độ trễ thấp mà không cần khóa API đám mây.
Suy luận biên cho các ứng dụng ngoại tuyến hoặc độ trễ thấp: Triển khai các tính năng LLM trên máy tính xách tay/máy tính bảng trong công việc thực địa, chăm sóc sức khỏe hoặc các tình huống du lịch nơi kết nối bị hạn chế và độ trễ là quan trọng.
Tạo mẫu sản phẩm và đánh giá trên máy Mac: Nhanh chóng kiểm tra nhiều mô hình mở và lượng tử hóa thông qua CLI (kéo/trò chuyện/phục vụ) để đánh giá UX, độ trễ và chi phí trước khi cam kết triển khai đám mây.
Khả năng LLM nhúng trong ứng dụng macOS/iOS: Sử dụng API C và các ràng buộc ngôn ngữ để tích hợp suy luận LLM cục bộ vào các ứng dụng gốc cần hiệu suất và quyền riêng tư có thể dự đoán được.

Ưu điểm

Hiệu suất cao trên Apple Silicon (đặc biệt mạnh mẽ về thông lượng giải mã và điền trước so với các thời gian chạy cục bộ phổ biến).
Phương pháp Metal không framework giúp giảm chi phí và cải thiện tiềm năng tối ưu hóa dành riêng cho phần cứng.
Đóng gói tiện lợi: CLI + máy chủ tương thích OpenAI + API C ổn định với nhiều ràng buộc ngôn ngữ.

Nhược điểm

Tập trung vào Apple Silicon/Metal (không phải thời gian chạy suy luận đa nền tảng chung).
Một số phương pháp cạnh tranh có thể tận dụng Apple Neural Engine thông qua MPSGraph cho một số khối lượng công việc nhất định, trong khi đường dẫn của BaseRT được mô tả là tập trung vào GPU (ít nhất là trong các so sánh hiện tại).
Yêu cầu chuyển đổi mô hình sang định dạng dành riêng cho thời gian chạy (ví dụ: được kéo/chuyển đổi sang định dạng BaseRT) thay vì chạy trực tiếp các điểm kiểm tra tùy ý.

Cách Sử dụng BaseRT

1) Cài đặt BaseRT (CLI + engine): Trên Apple Silicon macOS, cài đặt BaseRT vào PATH của bạn bằng cách chạy: curl -LsSf https://basecompute.co/install.sh | sh Sau khi cài đặt, xác nhận lệnh `basert` có sẵn (ví dụ: chạy `basert --help`).
2) Kéo một mô hình từ Hugging Face (và chuyển đổi sang định dạng .base): Sử dụng CLI của BaseRT để tải xuống một mô hình được hỗ trợ từ Hugging Face và chuyển đổi nó sang định dạng `.base` được tối ưu hóa của BaseRT: basert pull Qwen/Qwen3-4B (Thay thế bằng bất kỳ ID mô hình được hỗ trợ nào.)
3) Trò chuyện với một mô hình cục bộ từ terminal: Bắt đầu một phiên trò chuyện tương tác với một mô hình bạn đã kéo: basert chat Qwen/Qwen3-4B Điều này chạy mô hình cục bộ trên máy của bạn.
4) Phục vụ một API HTTP tương thích với OpenAI cục bộ: Chạy BaseRT như một máy chủ cục bộ cung cấp các điểm cuối tương thích với OpenAI: basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080 Sử dụng khóa API đã in/được chọn khi gọi máy chủ từ các máy khách.
5) (Tùy chọn) Chạy một tác nhân mã hóa chống lại máy chủ BaseRT cục bộ của bạn: Phục vụ một mô hình và kết nối một tác nhân mã hóa cục bộ để các yêu cầu vẫn nằm trên thiết bị: # Phục vụ một mô hình basert serve basecompute/gemma-4-E4B-it # Cài đặt plugin tác nhân mã hóa pi install git:github.com/basecompute/pi-basert # Chạy tác nhân pi

Câu hỏi Thường gặp về BaseRT

BaseRT là một thời gian chạy suy luận AI từ Base Compute được thiết kế để chạy các mô hình ngôn ngữ lớn một cách hiệu quả trên Apple Silicon. Nó được viết trực tiếp dựa trên API Metal của Apple (không được xây dựng trên MLX, PyTorch, CoreML hoặc các framework trung gian khác) và được định vị là “thời gian chạy suy luận LLM nhanh nhất cho Apple Silicon.”

Công cụ AI Mới nhất Tương tự BaseRT

Athena AI
Athena AI
Athena AI là một nền tảng đa năng được hỗ trợ bởi AI cung cấp hỗ trợ học tập cá nhân hóa, giải pháp kinh doanh và huấn luyện cuộc sống thông qua các tính năng như phân tích tài liệu, tạo bài kiểm tra, thẻ ghi nhớ và khả năng trò chuyện tương tác.
Aguru AI
Aguru AI
Aguru AI là một giải pháp phần mềm tại chỗ cung cấp các công cụ giám sát, bảo mật và tối ưu hóa toàn diện cho các ứng dụng dựa trên LLM với các tính năng như theo dõi hành vi, phát hiện bất thường và tối ưu hóa hiệu suất.
GOAT AI
GOAT AI
GOAT AI là một nền tảng được hỗ trợ bởi AI cung cấp khả năng tóm tắt một cú nhấp chuột cho nhiều loại nội dung bao gồm bài báo, tài liệu nghiên cứu và video, đồng thời cũng cung cấp khả năng điều phối đại lý AI tiên tiến cho các nhiệm vụ cụ thể theo miền.
GiGOS
GiGOS
GiGOS là một nền tảng AI cung cấp quyền truy cập vào nhiều mô hình ngôn ngữ tiên tiến như Gemini, GPT-4, Claude và Grok với giao diện trực quan để người dùng tương tác và so sánh các mô hình AI khác nhau.