Soup CLIは、オープンソースのCLIファーストの後処理スタックであり、データを自動的に診断し、トレーニングメソッドを選択し、設定を生成し、評価を導出し、すべてのチェックポイントをゲートし、フリーズされたベースレイヤーをストリーム+NF4量子化できるため、8Bのファインチューニングでも約4GBのGPUで実行できます。
https://trysoup.dev/?ref=producthunt&utm_source=aipure
Soup CLI

製品情報

更新日:2026年08月11日

Soup CLIとは

Soup CLI は、LLMの後処理(SFTと選好アライメント)を単一の再現可能なワークフローに変える、無料のApache-2.0ライセンスのコマンドラインツールです。実行を決定し、トレーニングし、評価し、出荷します。Soupは、無限のYAMLノブを手動で調整させるのではなく、「検索ではなくルール」に焦点を当て、適切なデフォルト(タスク設定、量子化、学習率、エポック、バッチサイズ、オプティマイザー/スケジューラーなど)を自動的に選択し、トレーニング前にデータを検証します。一般的なエコシステムツール(Hugging Face、Unsloth、DeepSpeed、MLX、W&B、vLLM/Ollama/llama.cppエクスポートパス)と統合しながら、オフライン対応を維持し、ベンダーロックインを回避します。

Soup CLIの主な機能

Soup CLIは、LLMのファインチューニングとアライメントをワンコマンドのワークフローに変える、オープンソースでCLIファーストのトレーニング後ツールキットです。データセットの事前チェックと「修正」、適切なトレーニング方法の選択、ルール(ハイパーパラメータ検索ではない)を使用した設定の自動作成、独自のデータからの評価の導出、そして出荷/非出荷の判断によるチェックポイントのゲートを行います。その主要な機能は、正確なレイヤーストリーミングです。凍結されたベースモデルをCPU RAMまたはNVMeに保持し、4ビット(例:NF4)に量子化しながらVRAMに一度に1層ずつストリーミングすることで、非常に小さなGPU(報告されている例:4GBのラップトップGPUでLlama-3.1-8B)でもLoRA SFTおよび選好メソッド(DPO/ORPO/SimPO/KTO)を可能にします。また、本番トレースの取り込み、評価、エクスポート、およびサービス提供のための一般的なMLエコシステムツールとも統合されています。
ワンコマンドのトレーニング後ワークフロー: 単一のCLIからエンドツーエンドのループ(データチェック → メソッド選択 → 設定生成 → トレーニング → 評価 → ゲート付き保存)を実行し、ツール間の手動での接続を減らします。
ルールベースの自動設定(設定地獄の軽減): パラメータ検索を必要とせず、組み込みのルールを使用して、トレーニング設定を自動的に作成し、主要なデフォルト(タスク、量子化、学習率、エポック、バッチサイズ/オプティマイザ/スケジューラ/ターゲットモジュール)を選択します。
正確なレイヤーストリーミング + 4ビット量子化: 凍結されたベースモデルをCPU RAM/NVMeからVRAMに専用のCUDAストリームでレイヤーごとにストリーミングし、4ビット(例:NF4)に量子化することで、ピークVRAMを単一レイヤーに制限し、小さなGPUでより大きなモデルのトレーニングを可能にします。
複数のトレーニング後メソッドをサポート: 教師ありファインチューニング(SFT)と、DPO、ORPO、SimPO、KTOを含む選好/アライメントメソッドを提供します(これらのメソッドのストリーミングサポートも含む)。
データに紐づく評価と保存ゲート: 独自のデータセットから評価を導出し、すべての保存を単一の「出荷または非出荷」の判断でゲートし、劣化し​​たチェックポイントを盲目的に保存/リリースするのを防ぐことを目指します。
移行 + エコシステム統合: 他のファインチューニングスタック(例:LLaMA-Factory、Axolotl、Unsloth)からの既存の設定を変換するための`soup migrate`を含み、トレーニング高速化、追跡、エクスポート、およびサービス提供のための一般的なツール(例:Unsloth、DeepSpeed、W&B、vLLM、Ollama、llama.cpp、ONNX、TensorRT)と統合します。

Soup CLIのユースケース

エッジアプリ向けオンデバイスファインチューニング: ローカルで実行する必要があるアシスタント(プライバシー/オフライン)を構築するチームは、ストリーミングと4ビット量子化を使用して、制約のあるハードウェアで8Bクラスのモデルをファインチューニングし、ローカルランタイムを介してエクスポート/提供できます。
顧客サポートおよび企業ナレッジアシスタント: ヘルプデスクや社内チャットツールへの展開前に、データ事前チェックとゲート付き保存を使用して、回帰を減らすために、社内Q&Aとチャットのトランスクリプトでベースモデルをファインチューニングおよびアライメントします。
本番トレースからの製品イテレーション: オブザーバビリティおよびLLMプラットフォーム(例:Langfuse/LangSmith/Helicone/OpenTelemetryエクスポート)からのログ/トレースを取り込み、トレーニングデータを作成し、SFTまたは選好最適化を実行し、再現可能なCLIパイプラインで改善を評価します。
限られたGPU予算を持つ学術研究室および小規模チーム: 研究者は、マルチGPUインフラストラクチャを必要とせずに、標準的な評価フローとエクスポートを使用しながら、控えめなGPUで再現可能なファインチューニング/アライメント実験を実行できます。
オフラインワークフローを必要とする規制産業: 医療/金融/公共部門のチームは、データをローカルに保持し、トレーニングと評価をオフラインで実行し、明示的な出荷/非出荷のゲートを使用して内部リリースプロセスをサポートできます。
多様なランタイム向けモデル展開パッケージング: トレーニング後、チームは同じプロジェクトワークフローから、異なるサービススタック(Ollamaを使用したローカル開発、vLLM/SGLangを使用した高スループット、llama.cpp/GGUFを使用したエッジ、またはONNX/TensorRTを介した推論スタック)をターゲットにできます。

メリット

正確なレイヤーストリーミングと4ビット量子化により、非常に小さなGPUでより大きなLLMのファインチューニングを可能にします(例:4GBで8Bが報告されています)。
CLIファーストのルールベースの自動化により、設定の負担が軽減され、反復が高速化されます(自動設定 + メソッド選択 + 事前チェック)。
エンドツーエンドのワークフローには、評価とゲート付きチェックポイント保存が含まれており、より安全なリリースを促進します。
幅広いエコシステム統合と設定移行により、他のツールからの切り替えコストが削減されます。

デメリット

レイヤーストリーミングは明示的にBETAと表示されており、制限事項(例:transformers/text/plain LoRAに焦点)が記載されているため、エッジケースには注意が必要な場合があります。
ストリーミングは重みを制限しますが、すべてのメモリドライバ(例:ロジット/語彙がVRAMを支配する可能性)を制限するわけではないため、一部のワークロードは小さなGPUにはまだ収まらない可能性があります。
過去の正確性の問題が公開されました(例:以前のストリーミングアダプタがストリーミングパス外で機能しない、32Bを超えるNF4勾配の欠陥が修正前)。これは、ユーザーがバージョンを固定し、結果を検証する必要があることを示唆しています。
一部の選好損失のパフォーマンスに関する主張は、提供された情報源では完全にベンチマークされていなかったため、スループットの期待値はローカルでの測定が必要な場合があります。

Soup CLIの使い方

1) Soup CLIをインストールする(軽量コア): コアCLI + 設定 + データツールをインストールします(PyTorchスタックなし): pip install soup-cli プロジェクトの初期化、設定の管理、トレーニング依存関係なしでのデータツールの実行のみを行う場合は、これを使用してください。
2) トレーニングサポート付きでSoupをインストールする(ファインチューニングに推奨): Soupとトレーニングスタック(torch、transformers、peft、trl、datasetsなど)をインストールします: pip install "soup-cli[train]" これは、SFTおよび選好トレーニングワークフローの一般的なインストールです。
3) (オプション) フル機能バンドルをインストールする: トレーニング + サービス + UI + データツールを1つのインストールで利用したい場合: pip install "soup-cli[all]"
4) (オプション) GitHubから最新の開発バージョンをインストールする: 最新の変更が必要な場合(安定性が低い可能性があります): pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) テンプレートから新しいプロジェクトを初期化する: 組み込みテンプレート(例:チャット)を使用してスタータープロジェクト/設定を作成します: soup init --template chat これにより、最小限の手動設定でトレーニングできる実行可能な構造が設定されます。
6) トレーニングデータを準備する(Soupをデータセットにポイントする): データセットをローカルに配置します(一般的にはJSONL)。Soupの設定では、次のようなパスを参照します: train: ./data/train.jsonl Soupは、Alpacaスタイルのデータなどのデータセット形式をサポートしています(ソースに示されているように)。
7) 実行を設定する(手動設定の例): ベースモデル、タスク/ステージ、LoRA設定、量子化、出力ディレクトリを指定する設定を提供できます。ソースに示されている例のフィールドは次のとおりです: - base/model_name_or_path: meta-llama/Llama-3.1-8B (または -Instruct) - task/stage: sft - finetuning_type: lora - lora_rank (r), lora_alpha, lora_dropout, lora_target - cutoff_len - learning_rate, epochs - quantization_bit: 4 - output_dir Soupは、ワークフローに応じて、多くの設定(オプティマイザー、スケジューラー、ターゲットモジュール、バッチサイズ)を自動検出/選択することもできます。
8) 1つのコマンドでトレーニングする: 初期化されたプロジェクト/設定からトレーニングを実行します: soup train ソースによると、Soupはデータの事前フライトチェックを実行し、ルール(手動のハイパーパラメータ検索ではない)を介してトレーニング設定を選択/導出し、独自のデータから評価を導出し、保存をゲートします。
9) 低VRAMファインチューニングに4ビット量子化を使用する(例): VRAM使用量を削減するには、4ビット量子化(例:quantization_bit: 4)を設定します。ソースでは、フリーズされたベースモデルをCPU RAMまたはNVMeからレイヤーごとにストリーミングし、NF4に量子化することで、8Bモデルを4GB GPUでファインチューニングできると説明されています。
10) 必要に応じて選好/アライメントメソッド(DPO/ORPO/SimPO/KTO)を実行する: Soupは、DPO、ORPO、SimPO、KTOを含むアライメントメソッドをサポートしており、ソースによると、モデルがGPU VRAMよりも大きい場合でも、これらのメソッドは同じレイヤーストリーミングアプローチで実行できます。
11) 他のファインチューニングツールから移行する(設定変換): 他のツールからの設定がすでにある場合は、次を使用します: soup migrate ソースによると、これにより既存の設定(例:LLaMA-Factory、Axolotl、Unslothから)を書き換えずに変換し、通常どおりトレーニングできます。
12) オフライン学習データのために本番トレース/ログを取り込む(オプション): 既存のログ/エクスポートからデータセットを構築するには、ソースに示されている取り込みコマンドパターンを使用します: soup ingest --source <vendor> --logs <export.jsonl> サポートされているソースとして、Langfuse、LangSmith、Helicone、OpenPipe、OpenTelemetry、およびOpenAI Stored Completionsが挙げられています。

Soup CLIのよくある質問

Soup CLIは、無料のオープンソース(Apache-2.0)CLIファーストのポストトレーニングツールチェーンで、データの前処理、トレーニング方法の選択、トレーニング設定の自動書き込み(タスク、量子化、学習率、エポックをハイパーパラメータ探索ではなくルールから決定)、独自のデータからの評価導出、すべての保存のゲート、および報酬ハッキングの実行中の自己修正(停止するだけでなく)といった全ループをカバーします。また、一般的なMLツール(Hugging Face、Ollama、vLLM、DeepSpeed、Unsloth、ONNX/TensorRT、W&Bなど)とも統合されています。

Soup CLIに類似した最新のAIツール

Gait
Gait
Gaitは、AI支援コード生成とバージョン管理を統合するコラボレーションツールであり、チームがAI生成コードのコンテキストを効率的に追跡、理解、共有できるようにします
invoices.dev
invoices.dev
invoices.devは、開発者のGitコミットから直接請求書を生成する自動請求プラットフォームで、GitHub、Slack、Linear、Googleサービスとの統合機能を備えています。
EasyRFP
EasyRFP
EasyRFPは、RFP(提案依頼)の応答を効率化し、深層学習技術を通じてリアルタイムのフィールド表現型を可能にするAI駆動のエッジコンピューティングツールキットです
Cart.ai
Cart.ai
Cart.aiは、コーディング、顧客関係管理、ビデオ編集、eコマースの設定、カスタムAI開発を含む包括的なビジネス自動化ソリューションを提供するAI駆動のサービスプラットフォームで、24時間365日のサポートがあります