
BaseRT
BaseRT는 Apple Silicon용으로 처음부터 개발된 네이티브 Metal LLM 추론 런타임으로, CLI, C API 및 OpenAI 호환 서비스를 제공하는 다국어 바인딩으로 제공되면서 동급 최고의 사전 채우기 및 디코딩 처리량을 제공합니다.
https://www.basecompute.co/getbasert?ref=producthunt&utm_source=aipure

제품 정보
업데이트됨:Jul 21, 2026
BaseRT이란?
BaseRT는 Apple Silicon에서 대규모 언어 모델을 실행하기 위해 특별히 구축된 AI 추론 런타임입니다. 범용 ML 프레임워크 위에 구축된 많은 런타임과 달리, BaseRT는 Apple의 Metal GPU API를 직접 사용하여 작성되었으며 MLX, PyTorch, CoreML 또는 기타 중간 계층에 대한 종속성을 의도적으로 피합니다. Python, Node, Rust, Swift와 같은 언어용 바인딩과 함께 설치하기 쉬운 도구 체인(CLI + 안정적인 C API)으로 배포되어 로컬 사용(모델 풀 및 채팅) 및 배포 사용 사례(OpenAI 호환 API 제공)를 모두 지원합니다.
BaseRT의 주요 기능
BaseRT는 Apple의 Metal GPU API를 직접 기반으로 구축된(MLX, PyTorch, CoreML 또는 기타 중간 프레임워크 없음) Apple Silicon용 고성능 LLM 추론 런타임입니다. 이 런타임은 칩별 커널 융합, 통합 메모리 인식 최적화 및 사용자 지정 디스패치 로직을 통해 처리량을 최대화하고 오버헤드를 줄이는 데 중점을 두어 일반적인 Apple 로컬 런타임에 비해 동급 최고의 디코딩 및 사전 채우기 성능을 달성합니다. BaseRT는 CLI와 언어 바인딩이 포함된 안정적인 C API로 제공되며, Hugging Face에서 모델을 빠르게 가져오거나 로컬 채팅을 실행하거나 앱 및 에이전트를 위한 OpenAI 호환 HTTP API를 제공하여 추론을 비공개로 온디바이스에서 유지할 수 있습니다.
네이티브 Metal 런타임(프레임워크 없음): MLX/PyTorch/CoreML의 추상화 오버헤드를 피하고 Metal의 실행 모델 및 Apple Silicon의 통합 메모리 토폴로지에 더 잘 맞도록 Apple의 Metal API에 직접 구현되었습니다.
Apple Silicon에서 동급 최고의 처리량: MLX 및 llama.cpp보다 빠르다고 벤치마킹되었으며, 디코딩에서 최대 ~33%의 향상과 사전 채우기에서 큰 개선(특히 긴 프롬프트 및 MoE 스타일 워크로드에서 강력함)이 보고되었습니다.
모델 제품군을 위한 아키텍처 설명자: 추론 루프에 많은 분기를 하드 코딩하는 대신 아키텍처 차이(활성화, 정규화 변형, 주의/위치 규칙, MoE 라우팅 세부 사항)를 압축된 설명자로 인코딩합니다.
광범위한 양자화 지원: 여러 양자화 형식(저비트 양자화부터 FP16까지)을 지원하여 사용자가 Apple M 시리즈 장치에서 품질, 메모리 및 속도를 절충할 수 있도록 합니다.
개발자 친화적인 CLI 워크플로: 단일 스크립트로 설치하고, Hugging Face에서 모델을 가져와 런타임 형식으로 변환한 다음, 최소한의 설정으로 채팅 또는 서비스 명령을 실행합니다.
OpenAI 호환 로컬 서비스 + 바인딩: 채팅/완성을 위한 OpenAI 호환 HTTP 서버를 실행하고 앱 및 도구에 내장하기 위한 바인딩(예: Python/Node/Rust/Swift)이 포함된 안정적인 C API를 제공합니다.
BaseRT의 사용 사례
기업을 위한 비공개 온디바이스 비서: 규제 환경 및 민감한 문서에 유용한 내부 채팅 비서를 Apple Silicon에서 로컬로 실행합니다(데이터가 장치를 벗어나지 않음).
로컬 코딩 에이전트 및 개발자 도구: 로컬 모델을 제공하고 OpenAI 호환 엔드포인트에 코딩 에이전트/IDE를 연결하여 클라우드 API 키 없이 빠르고 짧은 지연 시간의 코드 도움을 받습니다.
오프라인 또는 짧은 지연 시간 앱을 위한 엣지 추론: 연결이 제한되고 지연 시간이 중요한 현장 작업, 의료 또는 여행 시나리오에서 노트북/태블릿에 LLM 기능을 배포합니다.
Mac에서의 제품 프로토타이핑 및 평가: 클라우드 배포를 결정하기 전에 CLI(가져오기/채팅/제공)를 통해 여러 오픈 모델 및 양자화를 빠르게 테스트하여 UX, 지연 시간 및 비용을 벤치마킹합니다.
macOS/iOS 앱에 내장된 LLM 기능: 예측 가능한 성능과 개인 정보 보호가 필요한 기본 애플리케이션에 로컬 LLM 추론을 통합하기 위해 C API 및 언어 바인딩을 사용합니다.
장점
Apple Silicon에서 고성능(일반적인 로컬 런타임에 비해 특히 강력한 디코딩 및 사전 채우기 처리량).
프레임워크 없는 Metal 접근 방식은 오버헤드를 줄이고 하드웨어별 최적화 잠재력을 향상시킵니다.
편리한 패키징: CLI + OpenAI 호환 서버 + 여러 언어 바인딩이 포함된 안정적인 C API.
단점
Apple Silicon/Metal 중심(일반적인 교차 플랫폼 추론 런타임 아님).
일부 경쟁 접근 방식은 특정 워크로드에 대해 MPSGraph를 통해 Apple Neural Engine을 활용할 수 있지만, BaseRT의 경로는 GPU 중심이라고 설명됩니다(적어도 현재 비교에서는).
임의의 체크포인트를 직접 실행하는 대신 모델을 런타임별 형식(예: BaseRT 형식으로 가져오거나 변환)으로 변환해야 합니다.
BaseRT 사용 방법
1) BaseRT 설치 (CLI + 엔진): Apple Silicon macOS에서 다음을 실행하여 BaseRT를 PATH에 설치합니다:
curl -LsSf https://basecompute.co/install.sh | sh
설치 후 `basert` 명령이 사용 가능한지 확인합니다 (예: `basert --help` 실행).
2) Hugging Face에서 모델 가져오기 (및 .base 형식으로 변환): BaseRT CLI를 사용하여 Hugging Face에서 지원되는 모델을 다운로드하고 BaseRT의 최적화된 `.base` 형식으로 변환합니다:
basert pull Qwen/Qwen3-4B
(지원되는 모델 ID로 대체하십시오.)
3) 터미널에서 로컬 모델과 채팅: 가져온 모델과 대화형 채팅 세션을 시작합니다:
basert chat Qwen/Qwen3-4B
이것은 모델을 로컬 머신에서 실행합니다.
4) OpenAI 호환 HTTP API를 로컬에서 제공: BaseRT를 OpenAI 호환 엔드포인트를 노출하는 로컬 서버로 실행합니다:
basert serve Qwen/Qwen3-4B --api-key "$(uuidgen)" --port 8080
클라이언트에서 서버를 호출할 때 인쇄되거나 선택된 API 키를 사용하십시오.
5) (선택 사항) 로컬 BaseRT 서버에 대해 코딩 에이전트 실행: 모델을 제공하고 로컬 코딩 에이전트를 연결하여 요청이 장치에 유지되도록 합니다:
# 모델 제공
basert serve basecompute/gemma-4-E4B-it
# 코딩 에이전트 플러그인 설치
pi install git:github.com/basecompute/pi-basert
# 에이전트 실행
pi
BaseRT 자주 묻는 질문
BaseRT는 Apple Silicon에서 대규모 언어 모델을 효율적으로 실행하도록 설계된 Base Compute의 AI 추론 런타임입니다. Apple의 Metal API를 직접 사용하여 작성되었으며(MLX, PyTorch, CoreML 또는 기타 중간 프레임워크를 기반으로 구축되지 않음) “Apple Silicon을 위한 가장 빠른 LLM 추론 런타임”으로 포지셔닝되어 있습니다.











