
Soup CLI
Soup CLI 是一個開源的、CLI 優先的訓練後堆棧,它會自動診斷您的數據,選擇訓練方法,生成配置,派生評估,門控每個檢查點,並且可以流式傳輸 + NF4 量化凍結的基礎層,因此即使 8B 微調也可以在約 4 GB GPU 上運行。
https://trysoup.dev/?ref=producthunt&utm_source=aipure

產品資訊
更新時間:2026年08月11日
什麼是 Soup CLI
Soup CLI 是一個免費的、Apache-2.0 許可的命令行工具,它將 LLM 訓練後處理(SFT 和偏好對齊)轉變為一個單一的、可重現的工作流程:決定運行、訓練、評估和發布。Soup 不會讓您手動調整無休止的 YAML 旋鈕,而是專注於「規則,而非搜索」,自動選擇合理的默認值(例如,任務設置、量化、學習率、epochs、批次大小、優化器/調度器)並在訓練前驗證您的數據。它與常見的生態系統工具(Hugging Face、Unsloth、DeepSpeed、MLX、W&B、vLLM/Ollama/llama.cpp 導出路徑)集成,同時保持離線能力並避免供應商鎖定。
Soup CLI 的主要功能
Soup CLI 是一個開源的、CLI 優先的後訓練工具包,它將 LLM 微調和對齊轉變為一鍵式工作流程:它會預檢並「修復」您的資料集,選擇適當的訓練方法,使用規則(而非超參數搜尋)自動編寫配置,從您的資料中推導評估,並透過發布/不發布的判斷來把關檢查點。其旗艦功能是精確層流式傳輸:它可以將凍結的基礎模型保留在 CPU RAM 或 NVMe 中,並一次一個層地將其流式傳輸到 VRAM 中,同時量化為 4 位元(例如 NF4),從而在非常小的 GPU 上實現 LoRA SFT 和偏好方法(DPO/ORPO/SimPO/KTO)(據報導:在 4 GB 筆記型電腦 GPU 上運行 Llama-3.1-8B)。它還與常見的 ML 生態系統工具整合,用於擷取生產追蹤、評估、匯出和服務。
一鍵式後訓練工作流程: 從單一 CLI 運行端到端循環(資料檢查 → 方法選擇 → 配置生成 → 訓練 → 評估 → 門控儲存),減少工具間的手動連接。
基於規則的自動配置(減少配置地獄): 使用內建規則自動編寫訓練配置並選擇關鍵預設值(任務、量化、學習率、時期、批次大小/優化器/排程器/目標模組),而不是需要參數搜尋。
精確層流式傳輸 + 4 位元量化: 在專用的 CUDA 流上將凍結的基礎模型從 CPU RAM/NVMe 逐層流式傳輸到 VRAM 中,並量化為 4 位元(例如 NF4),將峰值 VRAM 限制在單一層,並允許在小型 GPU 上訓練更大的模型。
支援多種後訓練方法: 提供監督式微調(SFT)和偏好/對齊方法,包括 DPO、ORPO、SimPO 和 KTO(這些方法也支援流式傳輸)。
與您的資料相關的評估和儲存門控: 從您的資料集中推導評估,並為每次儲存提供單一的「發布或不發布」判斷,旨在防止盲目儲存/發布退化的檢查點。
遷移 + 生態系統整合: 包括 `soup migrate` 以轉換來自其他微調堆疊(例如 LLaMA-Factory、Axolotl、Unsloth)的現有配置,並與常見的工具整合,用於訓練加速、追蹤、匯出和服務(例如 Unsloth、DeepSpeed、W&B、vLLM、Ollama、llama.cpp、ONNX、TensorRT)。
Soup CLI 的使用案例
邊緣應用程式的設備端微調: 開發必須在本地運行(隱私/離線)的助理的團隊,可以使用流式傳輸 + 4 位元量化在受限硬體上微調 8B 級模型,然後透過本地運行時匯出/服務。
客戶支援和企業知識助理: 使用資料預檢和門控儲存,在內部問答和聊天記錄上微調和對齊基礎模型,以減少部署到服務台或內部聊天工具之前的退化。
從生產追蹤中進行產品迭代: 從可觀察性和 LLM 平台(例如 Langfuse/LangSmith/Helicone/OpenTelemetry 匯出)擷取日誌/追蹤以創建訓練資料,運行 SFT 或偏好優化,並在可重複的 CLI 管道中評估改進。
學術實驗室和 GPU 預算有限的小團隊: 研究人員可以在適度的 GPU 上運行可重現的微調/對齊實驗,而無需多 GPU 基礎設施,同時仍使用標準評估流程和匯出。
需要離線工作流程的受監管行業: 醫療保健/金融/公共部門團隊可以將資料保留在本地,離線運行訓練和評估,並使用明確的發布/不發布門控來支援內部發布流程。
針對不同運行時的模型部署打包: 訓練後,團隊可以從相同的專案工作流程中針對不同的服務堆疊(使用 Ollama 的本地開發、使用 vLLM/SGLang 的高吞吐量、使用 llama.cpp/GGUF 的邊緣或透過 ONNX/TensorRT 的推斷堆疊)。
優點
透過精確層流式傳輸和 4 位元量化,可以在非常小的 GPU 上微調更大的 LLM(據報導,8B 在 4 GB 上)。
CLI 優先、基於規則的自動化減少了配置負擔並加速了迭代(自動配置 + 方法選擇 + 預檢)。
端到端工作流程包括評估和門控檢查點儲存,鼓勵更安全的發布。
廣泛的生態系統整合和配置遷移降低了從其他工具切換的成本。
缺點
層流式傳輸明確標記為 BETA,並有聲明限制(例如,transformers/text/plain LoRA 焦點),因此邊緣情況可能需要謹慎。
流式傳輸限制了權重,但不是所有記憶體驅動程式(例如,logits/vocab 可能佔用 VRAM 的主導地位),因此某些工作負載可能仍然不適合小型 GPU。
披露了歷史正確性問題(例如,先前流式傳輸的適配器在流式傳輸路徑之外無操作;32B 以上的 NF4 梯度缺陷在修復前),這表明使用者應固定版本並驗證結果。
提供的來源中未完全基準測試某些偏好損失的性能聲明,因此吞吐量預期可能需要本地測量。
如何使用 Soup CLI
1) 安裝 Soup CLI(輕量級核心): 安裝核心 CLI + 配置 + 數據工具(無 PyTorch 堆棧):
pip install soup-cli
如果您只想初始化項目、管理配置或運行數據工具而無需訓練依賴項,請使用此選項。
2) 安裝帶有訓練支持的 Soup(推薦用於微調): 安裝 Soup 以及訓練堆棧(torch、transformers、peft、trl、datasets 等):
pip install "soup-cli[train]"
這是 SFT 和偏好訓練工作流程的典型安裝。
3) (可選) 安裝完整功能包: 如果您想在一次安裝中獲得訓練 + 服務 + UI + 數據工具:
pip install "soup-cli[all]"
4) (可選) 從 GitHub 安裝最新的開發版本: 如果您想要最新的更改(可能不太穩定):
pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) 從模板初始化新項目: 使用內置模板(例如:chat)創建一個入門項目/配置:
soup init --template chat
這會設置一個可運行的結構,以便您可以在最少的手動配置下進行訓練。
6) 準備您的訓練數據(將 Soup 指向您的數據集): 將您的數據集本地放置(通常是 JSONL)。在 Soup 配置中,您將引用路徑,例如:
train: ./data/train.jsonl
Soup 支持 Alpaca 風格的數據集格式(如來源所示)。
7) 配置運行(手動配置示例): 您可以提供一個配置,指定基礎模型、任務/階段、LoRA 設置、量化和輸出目錄。來源中顯示的示例字段包括:
- base/model_name_or_path: meta-llama/Llama-3.1-8B (或 -Instruct)
- task/stage: sft
- finetuning_type: lora
- lora_rank (r), lora_alpha, lora_dropout, lora_target
- cutoff_len
- learning_rate, epochs
- quantization_bit: 4
- output_dir
Soup 還可以根據工作流程自動檢測/選擇許多設置(優化器、調度器、目標模塊、批次大小)。
8) 一條命令進行訓練: 從您初始化的項目/配置運行訓練:
soup train
根據來源,Soup 會對數據執行預檢,通過規則(而非手動超參數搜索)選擇/派生訓練設置,從您自己的數據中派生評估,並門控保存。
9) 使用 4 位量化進行低 VRAM 微調(示例): 為了減少 VRAM 使用,請配置 4 位量化(例如,quantization_bit: 4)。來源描述了從 CPU RAM 或 NVMe 逐層流式傳輸凍結的基礎模型並量化為 NF4,以便 8B 模型可以在 4 GB GPU 上進行微調。
10) 需要時運行偏好/對齊方法 (DPO/ORPO/SimPO/KTO): Soup 支持 DPO、ORPO、SimPO 和 KTO 等對齊方法,並且來源指出當模型大於 GPU VRAM 時,這些方法也可以使用相同的層流式傳輸方法運行。
11) 從另一個微調工具遷移(配置轉換): 如果您已經有其他工具的配置,請使用:
soup migrate
來源指出這會轉換現有配置(例如,來自 LLaMA-Factory、Axolotl、Unsloth)而無需重寫,然後您可以正常訓練。
12) 攝取生產追蹤/日誌以用於離線訓練數據(可選): 要從現有日誌/導出構建數據集,請使用來源中顯示的攝取命令模式:
soup ingest --source <vendor> --logs <export.jsonl>
提到的支持來源包括 Langfuse、LangSmith、Helicone、OpenPipe、OpenTelemetry 和 OpenAI Stored Completions。
Soup CLI 常見問題
Soup CLI 是一個免費、開源 (Apache-2.0) 的 CLI 優先訓練後工具鏈,涵蓋了整個循環:它在預飛行階段驗證並「修復」您的數據,選擇訓練方法,自動編寫訓練配置(包括任務、量化、學習率和基於規則而非超參數搜索的 epoch),從您自己的數據中推導評估,把控每一次保存,並能在運行中途自我糾正獎勵駭客行為,而不是僅僅停止。它還與常見的機器學習工具(Hugging Face、Ollama、vLLM、DeepSpeed、Unsloth、ONNX/TensorRT、W&B 等)整合。











