
Soup CLI
Soup CLI là một ngăn xếp hậu huấn luyện mã nguồn mở, ưu tiên CLI, tự động kiểm tra dữ liệu của bạn, chọn phương pháp huấn luyện, tạo cấu hình, đưa ra các đánh giá, kiểm soát mọi điểm kiểm tra và có thể truyền tải + lượng tử hóa NF4 các lớp cơ sở đã đóng băng để ngay cả các tinh chỉnh 8B cũng có thể chạy trên GPU ~4 GB.
https://trysoup.dev/?ref=producthunt&utm_source=aipure

Thông tin Sản phẩm
Đã cập nhật:Aug 11, 2026
Soup CLI là gì
Soup CLI là một công cụ dòng lệnh miễn phí, được cấp phép Apache-2.0, biến quá trình hậu huấn luyện LLM (SFT và căn chỉnh ưu tiên) thành một quy trình làm việc duy nhất, có thể tái tạo: quyết định chạy, huấn luyện, đánh giá và triển khai. Thay vì bắt bạn phải điều chỉnh thủ công vô số cài đặt YAML, Soup tập trung vào "quy tắc, không phải tìm kiếm", tự động chọn các giá trị mặc định hợp lý (ví dụ: thiết lập tác vụ, lượng tử hóa, tốc độ học, số epoch, kích thước lô, bộ tối ưu hóa/lập lịch) và xác thực dữ liệu của bạn trước khi huấn luyện. Nó tích hợp với các công cụ hệ sinh thái phổ biến (Hugging Face, Unsloth, DeepSpeed, MLX, W&B, đường dẫn xuất vLLM/Ollama/llama.cpp) trong khi vẫn có khả năng hoạt động ngoại tuyến và tránh bị khóa nhà cung cấp.
Các Tính năng Chính của Soup CLI
Soup CLI là một bộ công cụ hậu huấn luyện mã nguồn mở, ưu tiên CLI, biến việc tinh chỉnh và căn chỉnh LLM thành một quy trình làm việc một lệnh: nó kiểm tra trước và "chỉnh sửa" tập dữ liệu của bạn, chọn phương pháp huấn luyện phù hợp, tự động viết cấu hình bằng các quy tắc (không phải tìm kiếm siêu tham số), lấy các đánh giá từ dữ liệu của riêng bạn và kiểm soát các điểm kiểm tra bằng phán quyết xuất xưởng/không xuất xưởng. Khả năng nổi bật của nó là truyền tải lớp chính xác: nó có thể giữ mô hình cơ sở đóng băng trong RAM CPU hoặc NVMe và truyền nó vào VRAM từng lớp một trong khi lượng tử hóa thành 4 bit (ví dụ: NF4), cho phép LoRA SFT và các phương pháp ưu tiên (DPO/ORPO/SimPO/KTO) trên các GPU rất nhỏ (đã báo cáo: Llama-3.1-8B trên GPU laptop 4 GB). Nó cũng tích hợp với các công cụ hệ sinh thái ML phổ biến để thu thập dấu vết sản xuất, đánh giá, xuất và phục vụ.
Quy trình làm việc hậu huấn luyện một lệnh: Chạy vòng lặp từ đầu đến cuối (kiểm tra dữ liệu → lựa chọn phương pháp → tạo cấu hình → huấn luyện → đánh giá → lưu trữ có kiểm soát) từ một CLI duy nhất, giảm thiểu việc kết nối thủ công giữa các công cụ.
Tự động cấu hình dựa trên quy tắc (ít rắc rối cấu hình hơn): Tự động viết cấu hình huấn luyện và chọn các giá trị mặc định chính (tác vụ, lượng tử hóa, tốc độ học, số epoch, kích thước lô/bộ tối ưu hóa/bộ lập lịch/mô-đun mục tiêu) bằng cách sử dụng các quy tắc tích hợp thay vì yêu cầu tìm kiếm tham số.
Truyền tải lớp chính xác + lượng tử hóa 4 bit: Truyền tải mô hình cơ sở đóng băng từ RAM CPU/NVMe vào VRAM từng lớp một trên một luồng CUDA chuyên dụng và lượng tử hóa thành 4 bit (ví dụ: NF4), giới hạn VRAM cao nhất bởi một lớp duy nhất và cho phép huấn luyện các mô hình lớn hơn trên các GPU nhỏ.
Hỗ trợ nhiều phương pháp hậu huấn luyện: Cung cấp tinh chỉnh có giám sát (SFT) và các phương pháp ưu tiên/căn chỉnh bao gồm DPO, ORPO, SimPO và KTO (cũng hỗ trợ truyền tải cho các phương pháp này).
Đánh giá và kiểm soát lưu trữ gắn liền với dữ liệu của bạn: Lấy các đánh giá từ tập dữ liệu của riêng bạn và kiểm soát mọi lần lưu bằng một phán quyết "XUẤT XƯỞNG hoặc KHÔNG XUẤT XƯỞNG" duy nhất, nhằm ngăn chặn việc lưu/phát hành mù quáng các điểm kiểm tra bị suy giảm.
Di chuyển + tích hợp hệ sinh thái: Bao gồm `soup migrate` để chuyển đổi các cấu hình hiện có từ các ngăn xếp tinh chỉnh khác (ví dụ: LLaMA-Factory, Axolotl, Unsloth) và tích hợp với các công cụ phổ biến để tăng tốc huấn luyện, theo dõi, xuất và phục vụ (ví dụ: Unsloth, DeepSpeed, W&B, vLLM, Ollama, llama.cpp, ONNX, TensorRT).
Các Trường hợp Sử dụng của Soup CLI
Tinh chỉnh trên thiết bị cho các ứng dụng biên: Các nhóm xây dựng trợ lý phải chạy cục bộ (riêng tư/ngoại tuyến) có thể tinh chỉnh mô hình lớp 8B trên phần cứng hạn chế bằng cách sử dụng truyền tải + lượng tử hóa 4 bit, sau đó xuất/phục vụ thông qua các thời gian chạy cục bộ.
Trợ lý hỗ trợ khách hàng và kiến thức doanh nghiệp: Tinh chỉnh và căn chỉnh một mô hình cơ sở trên các bản ghi Q&A và trò chuyện nội bộ, sử dụng kiểm tra trước dữ liệu và lưu trữ có kiểm soát để giảm thiểu sự thoái lui trước khi triển khai cho bộ phận trợ giúp hoặc các công cụ trò chuyện nội bộ.
Lặp lại sản phẩm từ dấu vết sản xuất: Thu thập nhật ký/dấu vết từ các nền tảng quan sát và LLM (ví dụ: xuất Langfuse/LangSmith/Helicone/OpenTelemetry) để tạo dữ liệu huấn luyện, chạy tối ưu hóa SFT hoặc ưu tiên và đánh giá các cải tiến trong một quy trình CLI có thể lặp lại.
Các phòng thí nghiệm học thuật và các nhóm nhỏ với ngân sách GPU hạn chế: Các nhà nghiên cứu có thể chạy các thử nghiệm tinh chỉnh/căn chỉnh có thể tái tạo trên các GPU khiêm tốn mà không cần cơ sở hạ tầng đa GPU, trong khi vẫn sử dụng các luồng đánh giá và xuất tiêu chuẩn.
Các ngành công nghiệp được quản lý cần quy trình làm việc ngoại tuyến: Các nhóm y tế/tài chính/khu vực công có thể giữ dữ liệu cục bộ, chạy huấn luyện và đánh giá ngoại tuyến, và sử dụng kiểm soát xuất xưởng/không xuất xưởng rõ ràng để hỗ trợ các quy trình phát hành nội bộ.
Đóng gói triển khai mô hình cho các thời gian chạy khác nhau: Sau khi huấn luyện, các nhóm có thể nhắm mục tiêu các ngăn xếp phục vụ khác nhau (phát triển cục bộ với Ollama, thông lượng cao với vLLM/SGLang, biên với llama.cpp/GGUF, hoặc các ngăn xếp suy luận thông qua ONNX/TensorRT) từ cùng một quy trình làm việc dự án.
Ưu điểm
Cho phép tinh chỉnh các LLM lớn hơn trên các GPU rất nhỏ thông qua truyền tải lớp chính xác và lượng tử hóa 4 bit (ví dụ: 8B trên 4 GB đã báo cáo).
Tự động hóa dựa trên quy tắc, ưu tiên CLI giảm gánh nặng cấu hình và tăng tốc độ lặp lại (tự động cấu hình + lựa chọn phương pháp + kiểm tra trước).
Quy trình làm việc từ đầu đến cuối bao gồm đánh giá và lưu điểm kiểm tra có kiểm soát, khuyến khích phát hành an toàn hơn.
Tích hợp hệ sinh thái rộng rãi và di chuyển cấu hình làm giảm chi phí chuyển đổi từ các công cụ khác.
Nhược điểm
Truyền tải lớp được gắn nhãn BETA rõ ràng với các hạn chế đã nêu (ví dụ: trọng tâm transformers/text/plain LoRA), vì vậy các trường hợp biên có thể cần thận trọng.
Truyền tải giới hạn trọng số nhưng không phải tất cả các trình điều khiển bộ nhớ (ví dụ: logits/vocab có thể chiếm ưu thế VRAM), vì vậy một số khối lượng công việc vẫn có thể không phù hợp trên các GPU nhỏ.
Các vấn đề về tính đúng đắn lịch sử đã được tiết lộ (ví dụ: bộ điều hợp được truyền tải trước đó không hoạt động bên ngoài đường dẫn truyền tải; lỗi gradient NF4 trên 32B trước khi sửa lỗi), cho thấy người dùng nên ghim phiên bản và xác thực kết quả.
Các tuyên bố về hiệu suất cho một số tổn thất ưu tiên không được đánh giá đầy đủ trong các nguồn được cung cấp, vì vậy kỳ vọng về thông lượng có thể cần đo lường cục bộ.
Cách Sử dụng Soup CLI
1) Cài đặt Soup CLI (lõi nhẹ): Cài đặt công cụ CLI cốt lõi + cấu hình + dữ liệu (không có ngăn xếp PyTorch):
pip install soup-cli
Sử dụng cái này nếu bạn chỉ muốn khởi tạo dự án, quản lý cấu hình hoặc chạy công cụ dữ liệu mà không cần phụ thuộc vào huấn luyện.
2) Cài đặt Soup với hỗ trợ huấn luyện (được khuyến nghị để tinh chỉnh): Cài đặt Soup cộng với ngăn xếp huấn luyện (torch, transformers, peft, trl, datasets, v.v.):
pip install "soup-cli[train]"
Đây là cài đặt điển hình cho các quy trình làm việc huấn luyện SFT và ưu tiên.
3) (Tùy chọn) Cài đặt gói tính năng đầy đủ: Nếu bạn muốn huấn luyện + phục vụ + UI + công cụ dữ liệu trong một lần cài đặt:
pip install "soup-cli[all]"
4) (Tùy chọn) Cài đặt phiên bản phát triển mới nhất từ GitHub: Nếu bạn muốn những thay đổi mới nhất (có thể kém ổn định hơn):
pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) Khởi tạo một dự án mới từ một mẫu: Tạo một dự án/cấu hình khởi đầu bằng cách sử dụng một mẫu tích hợp (ví dụ: chat):
soup init --template chat
Điều này thiết lập một cấu trúc có thể chạy được để bạn có thể huấn luyện với cấu hình thủ công tối thiểu.
6) Chuẩn bị dữ liệu huấn luyện của bạn (chỉ Soup đến tập dữ liệu của bạn): Đặt tập dữ liệu của bạn cục bộ (thường là JSONL). Trong cấu hình Soup, bạn sẽ tham chiếu các đường dẫn như:
train: ./data/train.jsonl
Soup hỗ trợ các định dạng tập dữ liệu như dữ liệu kiểu Alpaca (như được hiển thị trong các nguồn).
7) Cấu hình chạy (ví dụ cấu hình thủ công): Bạn có thể cung cấp một cấu hình chỉ định mô hình cơ sở, tác vụ/giai đoạn, cài đặt LoRA, lượng tử hóa và thư mục đầu ra. Các trường ví dụ được hiển thị trong các nguồn bao gồm:
- base/model_name_or_path: meta-llama/Llama-3.1-8B (hoặc -Instruct)
- task/stage: sft
- finetuning_type: lora
- lora_rank (r), lora_alpha, lora_dropout, lora_target
- cutoff_len
- learning_rate, epochs
- quantization_bit: 4
- output_dir
Soup cũng có thể tự động phát hiện/chọn nhiều cài đặt (bộ tối ưu hóa, bộ lập lịch, mô-đun mục tiêu, kích thước lô) tùy thuộc vào quy trình làm việc.
8) Huấn luyện trong một lệnh: Chạy huấn luyện từ dự án/cấu hình đã khởi tạo của bạn:
soup train
Theo các nguồn, Soup thực hiện kiểm tra trước khi chạy trên dữ liệu, chọn/đưa ra các cài đặt huấn luyện thông qua các quy tắc (không phải tìm kiếm siêu tham số thủ công), đưa ra các đánh giá từ dữ liệu của riêng bạn và kiểm soát việc lưu trữ.
9) Sử dụng lượng tử hóa 4-bit để tinh chỉnh VRAM thấp (ví dụ): Để giảm mức sử dụng VRAM, hãy cấu hình lượng tử hóa 4-bit (ví dụ: quantization_bit: 4). Các nguồn mô tả việc truyền tải mô hình cơ sở đã đóng băng từng lớp từ RAM CPU hoặc NVMe và lượng tử hóa sang NF4 để một mô hình 8B có thể tinh chỉnh trên GPU 4 GB.
10) Chạy các phương pháp ưu tiên/căn chỉnh (DPO/ORPO/SimPO/KTO) khi cần: Soup hỗ trợ các phương pháp căn chỉnh bao gồm DPO, ORPO, SimPO và KTO, và các nguồn cho biết chúng cũng có thể chạy với cùng một phương pháp truyền tải lớp khi mô hình lớn hơn VRAM GPU.
11) Di chuyển từ một công cụ tinh chỉnh khác (chuyển đổi cấu hình): Nếu bạn đã có cấu hình từ các công cụ khác, hãy sử dụng:
soup migrate
Các nguồn cho biết điều này chuyển đổi các cấu hình hiện có (ví dụ: từ LLaMA-Factory, Axolotl, Unsloth) mà không cần viết lại, sau đó bạn có thể huấn luyện bình thường.
12) Nạp dấu vết/nhật ký sản xuất cho dữ liệu huấn luyện ngoại tuyến (tùy chọn): Để xây dựng tập dữ liệu từ các nhật ký/xuất hiện có sẵn, hãy sử dụng mẫu lệnh nạp được hiển thị trong các nguồn:
soup ingest --source <vendor> --logs <export.jsonl>
Các nguồn được hỗ trợ được đề cập bao gồm Langfuse, LangSmith, Helicone, OpenPipe, OpenTelemetry và OpenAI Stored Completions.
Câu hỏi Thường gặp về Soup CLI
Soup CLI là một bộ công cụ hậu huấn luyện mã nguồn mở (Apache-2.0) miễn phí, ưu tiên CLI, bao gồm toàn bộ vòng lặp: nó xác thực và "chỉnh sửa" dữ liệu của bạn trước khi chạy, chọn phương pháp huấn luyện, tự động viết cấu hình huấn luyện (bao gồm tác vụ, lượng tử hóa, tốc độ học và số epoch từ các quy tắc thay vì tìm kiếm siêu tham số), suy ra các đánh giá từ dữ liệu của riêng bạn, kiểm soát mọi lần lưu và có thể tự sửa lỗi "reward hacking" trong quá trình chạy thay vì chỉ dừng lại. Nó cũng tích hợp với các công cụ ML phổ biến (Hugging Face, Ollama, vLLM, DeepSpeed, Unsloth, ONNX/TensorRT, W&B, v.v.).
Video Soup CLI
Bài viết phổ biến

Atoms: Nền tảng AI đa tác nhân biến ý tưởng thành sản phẩm sẵn sàng ra mắt
May 22, 2026

Nano Banana SBTI: Nó là gì, Cách thức hoạt động và Cách sử dụng nó vào năm 2026
Apr 15, 2026

Đánh giá Atoms — Trình tạo sản phẩm AI định nghĩa lại việc tạo nội dung số vào năm 2026
Apr 10, 2026

Kilo Claw: Cách Triển Khai và Sử Dụng AI Agent "Làm-Thay-Bạn" Thực Sự (Cập Nhật 2026)
Apr 3, 2026







