Soup CLI è uno stack di post-training open-source, CLI-first, che analizza automaticamente i tuoi dati, sceglie un metodo di training, genera configurazioni, deriva valutazioni, condiziona ogni checkpoint e può effettuare lo streaming + quantizzazione NF4 dei layer base congelati in modo che anche i fine-tuning 8B possano essere eseguiti su GPU da ~4 GB.
https://trysoup.dev/?ref=producthunt&utm_source=aipure
Soup CLI

Informazioni sul Prodotto

Aggiornato:Aug 11, 2026

Cos'è Soup CLI

Soup CLI è uno strumento a riga di comando gratuito, con licenza Apache-2.0, che trasforma il post-training LLM (SFT e allineamento delle preferenze) in un unico flusso di lavoro riproducibile: decidi l'esecuzione, addestra, valuta e spedisci. Invece di farti configurare manualmente infinite impostazioni YAML, Soup si concentra su "regole, non ricerca", selezionando automaticamente impostazioni predefinite sensate (es. configurazione del task, quantizzazione, tasso di apprendimento, epoche, dimensionamento del batch, ottimizzatore/scheduler) e validando i tuoi dati prima dell'addestramento. Si integra con strumenti comuni dell'ecosistema (Hugging Face, Unsloth, DeepSpeed, MLX, W&B, percorsi di esportazione vLLM/Ollama/llama.cpp) pur rimanendo utilizzabile offline ed evitando il vendor lock-in.

Caratteristiche principali di Soup CLI

Soup CLI è un toolkit post-addestramento open source, CLI-first, che trasforma il fine-tuning e l'allineamento di LLM in un flusso di lavoro a un solo comando: pre-analizza e "medica" il tuo dataset, seleziona un metodo di addestramento appropriato, scrive automaticamente una configurazione usando regole (non una ricerca di iperparametri), deriva le valutazioni dai tuoi dati e blocca i checkpoint con un verdetto di spedizione/non spedizione. La sua capacità di punta è lo streaming esatto dei layer: può mantenere il modello base congelato nella RAM della CPU o NVMe e trasmetterlo in VRAM un layer alla volta mentre quantizza a 4 bit (es. NF4), abilitando LoRA SFT e metodi di preferenza (DPO/ORPO/SimPO/KTO) su GPU molto piccole (riportato: Llama-3.1-8B su una GPU per laptop da 4 GB). Si integra anche con strumenti comuni dell'ecosistema ML per l'ingestione di tracce di produzione, la valutazione, l'esportazione e il serving.
Flusso di lavoro post-addestramento a un solo comando: Esegue il ciclo end-to-end (controlli dati → selezione metodo → generazione configurazione → addestramento → valutazione → salvataggi controllati) da una singola CLI, riducendo il cablaggio manuale tra gli strumenti.
Configurazione automatica basata su regole (meno "inferno" di configurazione): Scrive automaticamente le configurazioni di addestramento e sceglie i valori predefiniti chiave (task, quantizzazione, learning rate, epoche, dimensionamento del batch/ottimizzatore/scheduler/moduli target) utilizzando regole integrate anziché richiedere ricerche di parametri.
Streaming esatto dei layer + quantizzazione a 4 bit: Trasmette il modello base congelato dalla RAM della CPU/NVMe in VRAM layer per layer su un flusso CUDA dedicato e quantizza a 4 bit (es. NF4), limitando il picco di VRAM a un singolo layer e consentendo l'addestramento di modelli più grandi su GPU piccole.
Supporta più metodi post-addestramento: Fornisce fine-tuning supervisionato (SFT) e metodi di preferenza/allineamento inclusi DPO, ORPO, SimPO e KTO (con supporto streaming anche per questi metodi).
Valutazione e gating di salvataggio legati ai tuoi dati: Deriva le valutazioni dal tuo dataset e blocca ogni salvataggio con un unico verdetto "SPEDISCI o NON SPEDISCI", con l'obiettivo di prevenire il salvataggio/rilascio cieco di checkpoint degradati.
Migrazione + integrazioni con l'ecosistema: Include `soup migrate` per convertire le configurazioni esistenti da altri stack di fine-tuning (es. LLaMA-Factory, Axolotl, Unsloth) e si integra con strumenti comuni per l'accelerazione dell'addestramento, il tracciamento, l'esportazione e il serving (es. Unsloth, DeepSpeed, W&B, vLLM, Ollama, llama.cpp, ONNX, TensorRT).

Casi d'uso di Soup CLI

Fine-tuning on-device per app edge: I team che creano assistenti che devono essere eseguiti localmente (privacy/offline) possono effettuare il fine-tuning di un modello di classe 8B su hardware vincolato utilizzando lo streaming + la quantizzazione a 4 bit, quindi esportare/servire tramite runtime locali.
Assistenti per il supporto clienti e la conoscenza aziendale: Effettuare il fine-tuning e l'allineamento di un modello base su Q&A interni e trascrizioni di chat, utilizzando controlli preliminari dei dati e salvataggi controllati per ridurre le regressioni prima della distribuzione a helpdesk o strumenti di chat interni.
Iterazione del prodotto da tracce di produzione: Ingerire log/tracce da piattaforme di osservabilità e LLM (es. esportazioni Langfuse/LangSmith/Helicone/OpenTelemetry) per creare dati di addestramento, eseguire SFT o ottimizzazione delle preferenze e valutare i miglioramenti in una pipeline CLI ripetibile.
Laboratori accademici e piccoli team con budget GPU limitati: I ricercatori possono eseguire esperimenti riproducibili di fine-tuning/allineamento su GPU modeste senza la necessità di un'infrastruttura multi-GPU, pur utilizzando flussi di valutazione ed esportazioni standard.
Settori regolamentati che necessitano di flussi di lavoro offline: I team del settore sanitario/finanziario/pubblico possono mantenere i dati locali, eseguire l'addestramento e la valutazione offline e utilizzare un gating esplicito di spedizione/non spedizione per supportare i processi di rilascio interni.
Packaging per la distribuzione di modelli per vari runtime: Dopo l'addestramento, i team possono scegliere diversi stack di serving (sviluppo locale con Ollama, throughput elevato con vLLM/SGLang, edge con llama.cpp/GGUF o stack di inferenza tramite ONNX/TensorRT) dallo stesso flusso di lavoro del progetto.

Vantaggi

Consente il fine-tuning di LLM più grandi su GPU molto piccole tramite streaming esatto dei layer e quantizzazione a 4 bit (es. 8B su 4 GB riportato).
L'automazione CLI-first e basata su regole riduce l'onere di configurazione e accelera l'iterazione (configurazione automatica + selezione del metodo + pre-analisi).
Il flusso di lavoro end-to-end include la valutazione e il salvataggio controllato dei checkpoint, incoraggiando rilasci più sicuri.
L'ampia integrazione con l'ecosistema e la migrazione della configurazione riducono i costi di passaggio da altri strumenti.

Svantaggi

Lo streaming dei layer è esplicitamente etichettato come BETA con limitazioni dichiarate (es. focus su transformers/text/plain LoRA), quindi i casi limite potrebbero richiedere cautela.
Lo streaming limita i pesi ma non tutti i driver di memoria (es. logits/vocab possono dominare la VRAM), quindi alcuni carichi di lavoro potrebbero comunque non adattarsi a GPU piccole.
Sono stati divulgati problemi di correttezza storica (es. precedente adattatore in streaming no-op al di fuori del percorso di streaming; difetto del gradiente NF4 sopra 32B pre-correzione), suggerendo agli utenti di bloccare le versioni e convalidare i risultati.
Le affermazioni sulle prestazioni per alcune perdite di preferenza non sono state completamente benchmarkate nelle fonti fornite, quindi le aspettative di throughput potrebbero richiedere una misurazione locale.

Come usare Soup CLI

1) Installa Soup CLI (core leggero): Installa gli strumenti core della CLI + configurazione + dati (senza stack PyTorch): pip install soup-cli Usalo se vuoi solo inizializzare progetti, gestire configurazioni o eseguire strumenti dati senza dipendenze di training.
2) Installa Soup con supporto per il training (consigliato per il fine-tuning): Installa Soup più lo stack di training (torch, transformers, peft, trl, datasets, ecc.): pip install "soup-cli[train]" Questa è l'installazione tipica per i flussi di lavoro di training SFT e delle preferenze.
3) (Opzionale) Installa il bundle completo di funzionalità: Se vuoi train + serve + UI + strumenti dati in un'unica installazione: pip install "soup-cli[all]"
4) (Opzionale) Installa l'ultima versione di sviluppo da GitHub: Se vuoi le modifiche più recenti (potrebbero essere meno stabili): pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) Inizializza un nuovo progetto da un template: Crea un progetto/configurazione iniziale usando un template integrato (esempio: chat): soup init --template chat Questo imposta una struttura eseguibile in modo da poter addestrare con una configurazione manuale minima.
6) Prepara i tuoi dati di training (indica a Soup il tuo dataset): Posiziona il tuo dataset localmente (comunemente JSONL). In una configurazione Soup, farai riferimento a percorsi come: train: ./data/train.jsonl Soup supporta formati di dataset come i dati in stile Alpaca (come mostrato nelle fonti).
7) Configura l'esecuzione (esempio di configurazione manuale): Puoi fornire una configurazione che specifica il modello base, il task/fase, le impostazioni LoRA, la quantizzazione e la directory di output. I campi di esempio mostrati nelle fonti includono: - base/model_name_or_path: meta-llama/Llama-3.1-8B (o -Instruct) - task/stage: sft - finetuning_type: lora - lora_rank (r), lora_alpha, lora_dropout, lora_target - cutoff_len - learning_rate, epochs - quantization_bit: 4 - output_dir Soup può anche rilevare/scegliere automaticamente molte impostazioni (ottimizzatore, scheduler, moduli target, dimensione del batch) a seconda del flusso di lavoro.
8) Addestra con un unico comando: Esegui l'addestramento dal tuo progetto/configurazione inizializzato: soup train Secondo le fonti, Soup esegue controlli pre-volo sui dati, seleziona/deriva le impostazioni di training tramite regole (non ricerca manuale di iperparametri), deriva le valutazioni dai tuoi dati e condiziona i salvataggi.
9) Usa la quantizzazione a 4 bit per il fine-tuning a basso VRAM (esempio): Per ridurre l'utilizzo di VRAM, configura la quantizzazione a 4 bit (es. quantization_bit: 4). Le fonti descrivono lo streaming del modello base congelato strato per strato dalla RAM della CPU o NVMe e la quantizzazione a NF4 in modo che un modello 8B possa essere sottoposto a fine-tuning su una GPU da 4 GB.
10) Esegui metodi di preferenza/allineamento (DPO/ORPO/SimPO/KTO) quando necessario: Soup supporta metodi di allineamento inclusi DPO, ORPO, SimPO e KTO, e le fonti affermano che questi possono essere eseguiti anche con lo stesso approccio di layer-streaming quando il modello è più grande della VRAM della GPU.
11) Migra da un altro strumento di fine-tuning (conversione della configurazione): Se hai già configurazioni da altri strumenti, usa: soup migrate Le fonti affermano che questo converte le configurazioni esistenti (es. da LLaMA-Factory, Axolotl, Unsloth) senza riscrivere, quindi puoi addestrare normalmente.
12) Ingerisci tracce/log di produzione per dati di training offline (opzionale): Per costruire dataset da log/esportazioni esistenti, usa il modello di comando ingest mostrato nelle fonti: soup ingest --source <vendor> --logs <export.jsonl> Le fonti supportate menzionate includono Langfuse, LangSmith, Helicone, OpenPipe, OpenTelemetry e OpenAI Stored Completions.

FAQ di Soup CLI

Soup CLI è una toolchain post-training CLI-first gratuita e open-source (Apache-2.0) che copre l'intero ciclo: convalida e "cura" i tuoi dati prima del volo, sceglie un metodo di training, scrive automaticamente la configurazione di training (inclusi task, quantizzazione, learning rate ed epoche da regole anziché ricerca di iperparametri), deriva le valutazioni dai tuoi dati, blocca ogni salvataggio e può auto-correggere l'"reward hacking" a metà esecuzione invece di limitarsi a fermarsi. Si integra anche con i comuni strumenti ML (Hugging Face, Ollama, vLLM, DeepSpeed, Unsloth, ONNX/TensorRT, W&B, ecc.).

Ultimi Strumenti AI Simili a Soup CLI

Gait
Gait
Gait è uno strumento di collaborazione che integra la generazione di codice assistita dall'IA con il controllo delle versioni, consentendo ai team di tracciare, comprendere e condividere il contesto del codice generato dall'IA in modo efficiente.
invoices.dev
invoices.dev
invoices.dev è una piattaforma di fatturazione automatizzata che genera fatture direttamente dai commit Git dei programmatori, con capacità di integrazione per i servizi GitHub, Slack, Linear e Google.
EasyRFP
EasyRFP
EasyRFP è un toolkit di edge computing alimentato da AI che semplifica le risposte alle RFP (Richiesta di Proposta) e consente la fenotipizzazione sul campo in tempo reale attraverso la tecnologia di deep learning.
Cart.ai
Cart.ai
Cart.ai è una piattaforma di servizi alimentata dall'IA che fornisce soluzioni complete di automazione aziendale, tra cui codifica, gestione delle relazioni con i clienti, editing video, configurazione e-commerce e sviluppo di AI personalizzata con supporto 24/7.