
Soup CLI
Soup CLI 是一个开源的、CLI 优先的后训练堆栈,它会自动诊断您的数据,选择训练方法,生成配置,派生评估,门控每个检查点,并且可以流式传输+NF4 量化冻结的基础层,因此即使 8B 微调也可以在约 4 GB GPU 上运行。
https://trysoup.dev/?ref=producthunt&utm_source=aipure

产品信息
更新于:2026年08月11日
什么是 Soup CLI
Soup CLI 是一个免费的、采用 Apache-2.0 许可的命令行工具,它将 LLM 后训练(SFT 和偏好对齐)转化为一个单一的、可重现的工作流程:决定运行、训练、评估和发布。Soup 不会强迫您手动调整无休止的 YAML 参数,而是专注于“规则而非搜索”,自动选择合理的默认值(例如,任务设置、量化、学习率、epochs、批处理大小、优化器/调度器),并在训练前验证您的数据。它与常见的生态系统工具(Hugging Face、Unsloth、DeepSpeed、MLX、W&B、vLLM/Ollama/llama.cpp 导出路径)集成,同时保持离线可用并避免供应商锁定。
Soup CLI 的主要功能
Soup CLI 是一个开源的、CLI 优先的后训练工具包,它将 LLM 微调和对齐转化为一键式工作流程:它预检并“诊断”您的数据集,选择合适的训练方法,使用规则(而非超参数搜索)自动编写配置,从您自己的数据中导出评估,并使用发布/不发布决策来门控检查点。其旗舰功能是精确层流式传输:它可以将冻结的基础模型保存在 CPU RAM 或 NVMe 中,并一次一层地将其流式传输到 VRAM 中,同时量化为 4 位(例如 NF4),从而使 LoRA SFT 和偏好方法(DPO/ORPO/SimPO/KTO)能够在非常小的 GPU 上运行(据报道:在 4 GB 笔记本电脑 GPU 上运行 Llama-3.1-8B)。它还与常见的 ML 生态系统工具集成,用于摄取生产跟踪、评估、导出和部署。
一键式后训练工作流程: 从单个 CLI 运行端到端循环(数据检查 → 方法选择 → 配置生成 → 训练 → 评估 → 门控保存),减少了跨工具的手动连接。
基于规则的自动配置(减少配置地狱): 使用内置规则自动编写训练配置并选择关键默认值(任务、量化、学习率、epochs、批处理大小/优化器/调度器/目标模块),而无需参数搜索。
精确层流式传输 + 4 位量化: 将冻结的基础模型从 CPU RAM/NVMe 逐层流式传输到专用 CUDA 流中的 VRAM,并量化为 4 位(例如 NF4),将峰值 VRAM 限制为单层,并支持在小型 GPU 上训练更大的模型。
支持多种后训练方法: 提供监督微调 (SFT) 和偏好/对齐方法,包括 DPO、ORPO、SimPO 和 KTO(也支持这些方法的流式传输)。
与您的数据相关的评估和保存门控: 从您自己的数据集中导出评估,并为每次保存提供一个“发布或不发布”的单一决策,旨在防止盲目保存/发布降级的检查点。
迁移 + 生态系统集成: 包括 `soup migrate` 以转换来自其他微调堆栈(例如 LLaMA-Factory、Axolotl、Unsloth)的现有配置,并与用于训练加速、跟踪、导出和部署的常见工具(例如 Unsloth、DeepSpeed、W&B、vLLM、Ollama、llama.cpp、ONNX、TensorRT)集成。
Soup CLI 的使用场景
边缘应用程序的设备端微调: 构建必须在本地运行(隐私/离线)的助手的团队可以使用流式传输 + 4 位量化在受限硬件上微调 8B 级别的模型,然后通过本地运行时导出/部署。
客户支持和企业知识助手: 在内部问答和聊天记录上微调和对齐基础模型,使用数据预检和门控保存,以减少部署到服务台或内部聊天工具之前的回归。
从生产跟踪中进行产品迭代: 从可观测性和 LLM 平台(例如 Langfuse/LangSmith/Helicone/OpenTelemetry 导出)摄取日志/跟踪,以创建训练数据,运行 SFT 或偏好优化,并在可重复的 CLI 管道中评估改进。
GPU 预算有限的学术实验室和小型团队: 研究人员可以在适度的 GPU 上运行可重现的微调/对齐实验,而无需多 GPU 基础设施,同时仍使用标准评估流程和导出。
需要离线工作流程的受监管行业: 医疗保健/金融/公共部门团队可以保持数据本地化,离线运行训练和评估,并使用明确的发布/不发布门控来支持内部发布流程。
用于各种运行时的模型部署打包: 训练后,团队可以从同一个项目工作流程中针对不同的服务堆栈(使用 Ollama 进行本地开发,使用 vLLM/SGLang 进行高吞吐量,使用 llama.cpp/GGUF 进行边缘,或通过 ONNX/TensorRT 进行推理堆栈)。
优点
通过精确层流式传输和 4 位量化,可以在非常小的 GPU 上微调更大的 LLM(据报道,4 GB 上可运行 8B)。
CLI 优先、基于规则的自动化减少了配置负担并加快了迭代(自动配置 + 方法选择 + 预检)。
端到端工作流程包括评估和门控检查点保存,鼓励更安全的发布。
广泛的生态系统集成和配置迁移降低了从其他工具切换的成本。
缺点
层流式传输明确标记为 BETA,并有明确的限制(例如,transformers/text/plain LoRA 焦点),因此边缘情况可能需要谨慎。
流式传输限制了权重,但并非所有内存驱动因素(例如,logits/vocab 可以主导 VRAM),因此某些工作负载可能仍然无法在小型 GPU 上运行。
披露了历史正确性问题(例如,以前流式传输的适配器在流式传输路径之外无效;32B 以上的 NF4 梯度缺陷在修复之前),这表明用户应该固定版本并验证结果。
提供的来源中没有完全基准测试某些偏好损失的性能声明,因此吞吐量预期可能需要本地测量。
如何使用 Soup CLI
1) 安装 Soup CLI(轻量级核心): 安装核心 CLI + 配置 + 数据工具(不含 PyTorch 堆栈):
pip install soup-cli
如果您只想初始化项目、管理配置或运行数据工具而无需训练依赖项,请使用此选项。
2) 安装支持训练的 Soup(推荐用于微调): 安装 Soup 以及训练堆栈(torch、transformers、peft、trl、datasets 等):
pip install "soup-cli[train]"
这是 SFT 和偏好训练工作流程的典型安装方式。
3) (可选) 安装完整功能包: 如果您想一次性安装训练 + 服务 + UI + 数据工具:
pip install "soup-cli[all]"
4) (可选) 从 GitHub 安装最新的开发版本: 如果您想要最新的更改(可能不太稳定):
pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) 从模板初始化新项目: 使用内置模板创建启动项目/配置(例如:chat):
soup init --template chat
这会设置一个可运行的结构,以便您可以通过最少的手动配置进行训练。
6) 准备您的训练数据(将 Soup 指向您的数据集): 将您的数据集本地放置(通常是 JSONL)。在 Soup 配置中,您将引用如下路径:
train: ./data/train.jsonl
Soup 支持 Alpaca 风格的数据集格式(如来源所示)。
7) 配置运行(手动配置示例): 您可以提供一个配置,指定基础模型、任务/阶段、LoRA 设置、量化和输出目录。来源中显示的示例字段包括:
- base/model_name_or_path: meta-llama/Llama-3.1-8B (或 -Instruct)
- task/stage: sft
- finetuning_type: lora
- lora_rank (r), lora_alpha, lora_dropout, lora_target
- cutoff_len
- learning_rate, epochs
- quantization_bit: 4
- output_dir
Soup 还可以根据工作流程自动检测/选择许多设置(优化器、调度器、目标模块、批处理大小)。
8) 一条命令进行训练: 从您已初始化的项目/配置运行训练:
soup train
根据来源,Soup 会对数据执行预检,通过规则(而非手动超参数搜索)选择/派生训练设置,从您自己的数据派生评估,并门控保存。
9) 使用 4 位量化进行低显存微调(示例): 为了减少显存使用,配置 4 位量化(例如,quantization_bit: 4)。来源描述了从 CPU RAM 或 NVMe 逐层流式传输冻结的基础模型,并量化为 NF4,以便 8B 模型可以在 4 GB GPU 上进行微调。
10) 需要时运行偏好/对齐方法(DPO/ORPO/SimPO/KTO): Soup 支持包括 DPO、ORPO、SimPO 和 KTO 在内的对齐方法,来源指出当模型大于 GPU 显存时,这些方法也可以使用相同的层流式传输方法运行。
11) 从其他微调工具迁移(配置转换): 如果您已经有其他工具的配置,请使用:
soup migrate
来源指出这会转换现有配置(例如,来自 LLaMA-Factory、Axolotl、Unsloth)而无需重写,然后您可以正常训练。
12) 摄取生产跟踪/日志以获取离线训练数据(可选): 要从现有日志/导出构建数据集,请使用来源中显示的摄取命令模式:
soup ingest --source <vendor> --logs <export.jsonl>
提及的受支持来源包括 Langfuse、LangSmith、Helicone、OpenPipe、OpenTelemetry 和 OpenAI Stored Completions。
Soup CLI 常见问题
Soup CLI 是一个免费、开源 (Apache-2.0) 的 CLI 优先的后训练工具链,它涵盖了完整的流程:它在预飞行阶段验证并“修复”您的数据,选择训练方法,自动编写训练配置(包括任务、量化、学习率和基于规则而非超参数搜索的 epoch),从您自己的数据中推导评估,对每次保存进行门控,并且可以在运行中途自我纠正奖励作弊,而不是仅仅停止。它还与常见的机器学习工具(Hugging Face、Ollama、vLLM、DeepSpeed、Unsloth、ONNX/TensorRT、W&B 等)集成。











