
Soup CLI
O Soup CLI é uma pilha de pós-treinamento de código aberto, CLI-first, que auto-diagnostica seus dados, escolhe um método de treinamento, gera configurações, deriva avaliações, condiciona cada checkpoint e pode transmitir + quantizar NF4 camadas base congeladas para que até mesmo ajustes finos de 8B possam ser executados em GPUs de ~4 GB.
https://trysoup.dev/?ref=producthunt&utm_source=aipure

Informações do Produto
Atualizado:Aug 11, 2026
O que é Soup CLI
O Soup CLI é uma ferramenta de linha de comando gratuita, licenciada sob Apache-2.0, que transforma o pós-treinamento de LLM (SFT e alinhamento de preferência) em um fluxo de trabalho único e reproduzível: decida a execução, treine, avalie e envie. Em vez de fazer você ajustar manualmente infinitos parâmetros YAML, o Soup foca em "regras, não pesquisa", selecionando automaticamente padrões sensatos (por exemplo, configuração de tarefa, quantização, taxa de aprendizado, épocas, dimensionamento de lote, otimizador/agendador) e validando seus dados antes do treinamento. Ele se integra com ferramentas comuns do ecossistema (Hugging Face, Unsloth, DeepSpeed, MLX, W&B, caminhos de exportação vLLM/Ollama/llama.cpp) enquanto permanece capaz de funcionar offline e evita o aprisionamento tecnológico.
Principais Recursos do Soup CLI
Soup CLI é um kit de ferramentas de pós-treinamento de código aberto e focado em CLI que transforma o ajuste fino e o alinhamento de LLMs em um fluxo de trabalho de um único comando: ele pré-verifica e "conserta" seu conjunto de dados, seleciona um método de treinamento apropriado, escreve automaticamente uma configuração usando regras (não pesquisa de hiperparâmetros), deriva avaliações de seus próprios dados e controla os pontos de verificação com um veredito de "enviar/não enviar". Sua capacidade principal é o streaming exato de camadas: ele pode manter o modelo base congelado na RAM da CPU ou NVMe e transmiti-lo para a VRAM uma camada por vez enquanto quantifica para 4 bits (por exemplo, NF4), permitindo LoRA SFT e métodos de preferência (DPO/ORPO/SimPO/KTO) em GPUs muito pequenas (relatado: Llama-3.1-8B em uma GPU de laptop de 4 GB). Ele também se integra com ferramentas comuns do ecossistema de ML para ingestão de rastreamentos de produção, avaliação, exportação e serviço.
Fluxo de trabalho de pós-treinamento de um comando: Executa o ciclo completo (verificações de dados → seleção de método → geração de configuração → treinamento → avaliação → salvamentos controlados) a partir de uma única CLI, reduzindo a fiação manual entre as ferramentas.
Configuração automática baseada em regras (menos inferno de configuração): Escreve automaticamente configurações de treinamento e escolhe padrões chave (tarefa, quantização, taxa de aprendizado, épocas, dimensionamento de lote/otimizador/agendador/módulos de destino) usando regras incorporadas em vez de exigir pesquisas de parâmetros.
Streaming exato de camadas + quantização de 4 bits: Transmite o modelo base congelado da RAM da CPU/NVMe para a VRAM camada por camada em um fluxo CUDA dedicado e quantifica para 4 bits (por exemplo, NF4), limitando o pico de VRAM a uma única camada e permitindo o treinamento de modelos maiores em GPUs pequenas.
Suporta múltiplos métodos de pós-treinamento: Fornece ajuste fino supervisionado (SFT) e métodos de preferência/alinhamento, incluindo DPO, ORPO, SimPO e KTO (com suporte a streaming para esses métodos também).
Avaliação e controle de salvamento vinculados aos seus dados: Deriva avaliações de seu próprio conjunto de dados e controla cada salvamento com um único veredito de "ENVIAR ou NÃO ENVIAR", visando evitar salvar/liberar cegamente pontos de verificação degradados.
Migração + integrações de ecossistema: Inclui `soup migrate` para converter configurações existentes de outras pilhas de ajuste fino (por exemplo, LLaMA-Factory, Axolotl, Unsloth) e se integra com ferramentas comuns para aceleração de treinamento, rastreamento, exportação e serviço (por exemplo, Unsloth, DeepSpeed, W&B, vLLM, Ollama, llama.cpp, ONNX, TensorRT).
Casos de Uso do Soup CLI
Ajuste fino no dispositivo para aplicativos de borda: Equipes que desenvolvem assistentes que devem ser executados localmente (privacidade/offline) podem ajustar um modelo de classe 8B em hardware restrito usando streaming + quantização de 4 bits, e então exportar/servir via runtimes locais.
Assistentes de suporte ao cliente e conhecimento empresarial: Ajuste fino e alinhe um modelo base em Q&A interno e transcrições de bate-papo, usando verificações de pré-voo de dados e salvamentos controlados para reduzir regressões antes da implantação em ferramentas de helpdesk ou bate-papo interno.
Iteração de produto a partir de rastreamentos de produção: Ingira logs/rastreamentos de plataformas de observabilidade e LLM (por exemplo, exportações Langfuse/LangSmith/Helicone/OpenTelemetry) para criar dados de treinamento, executar SFT ou otimização de preferência e avaliar melhorias em um pipeline CLI repetível.
Laboratórios acadêmicos e pequenas equipes com orçamentos limitados de GPU: Pesquisadores podem executar experimentos reproduzíveis de ajuste fino/alinhamento em GPUs modestas sem a necessidade de infraestrutura multi-GPU, enquanto ainda usam fluxos de avaliação e exportações padrão.
Indústrias regulamentadas que precisam de fluxos de trabalho offline: Equipes de saúde/finanças/setor público podem manter os dados locais, executar treinamento e avaliação offline e usar o controle explícito de "enviar/não enviar" para apoiar os processos de lançamento internos.
Empacotamento de implantação de modelo para diversos runtimes: Após o treinamento, as equipes podem direcionar diferentes pilhas de serviço (desenvolvimento local com Ollama, alta taxa de transferência com vLLM/SGLang, borda com llama.cpp/GGUF ou pilhas de inferência via ONNX/TensorRT) a partir do mesmo fluxo de trabalho do projeto.
Vantagens
Permite o ajuste fino de LLMs maiores em GPUs muito pequenas via streaming exato de camadas e quantização de 4 bits (por exemplo, 8B em 4 GB relatado).
A automação baseada em regras e focada em CLI reduz a carga de configuração e acelera a iteração (configuração automática + seleção de método + pré-verificação).
O fluxo de trabalho de ponta a ponta inclui avaliação e salvamento de pontos de verificação controlados, incentivando lançamentos mais seguros.
A ampla integração do ecossistema e a migração de configuração reduzem os custos de troca de outras ferramentas.
Desvantagens
O streaming de camadas é explicitamente rotulado como BETA com limitações declaradas (por exemplo, foco em transformers/texto/LoRA simples), então casos extremos podem exigir cautela.
O streaming limita os pesos, mas nem todos os drivers de memória (por exemplo, logits/vocabulário podem dominar a VRAM), então algumas cargas de trabalho ainda podem não caber em GPUs pequenas.
Problemas históricos de correção foram divulgados (por exemplo, adaptador transmitido anterior sem operação fora do caminho de streaming; defeito de gradiente NF4 acima de 32B pré-correção), sugerindo que os usuários devem fixar as versões e validar os resultados.
As alegações de desempenho para algumas perdas de preferência não foram totalmente testadas nas fontes fornecidas, então as expectativas de taxa de transferência podem precisar de medição local.
Como Usar o Soup CLI
1) Instale o Soup CLI (núcleo leve): Instale as ferramentas principais da CLI + configuração + dados (sem pilha PyTorch):
pip install soup-cli
Use isso se você quiser apenas inicializar projetos, gerenciar configurações ou executar ferramentas de dados sem dependências de treinamento.
2) Instale o Soup com suporte a treinamento (recomendado para ajuste fino): Instale o Soup mais a pilha de treinamento (torch, transformers, peft, trl, datasets, etc.):
pip install "soup-cli[train]"
Esta é a instalação típica para fluxos de trabalho de treinamento SFT e de preferência.
3) (Opcional) Instale o pacote completo de recursos: Se você quiser treinar + servir + UI + ferramentas de dados em uma única instalação:
pip install "soup-cli[all]"
4) (Opcional) Instale a versão de desenvolvimento mais recente do GitHub: Se você quiser as mudanças mais recentes (pode ser menos estável):
pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) Inicialize um novo projeto a partir de um modelo: Crie um projeto/configuração inicial usando um modelo integrado (exemplo: chat):
soup init --template chat
Isso configura uma estrutura executável para que você possa treinar com configuração manual mínima.
6) Prepare seus dados de treinamento (aponte o Soup para seu conjunto de dados): Coloque seu conjunto de dados localmente (comumente JSONL). Em uma configuração do Soup, você fará referência a caminhos como:
train: ./data/train.jsonl
O Soup suporta formatos de conjunto de dados como dados no estilo Alpaca (conforme mostrado nas fontes).
7) Configure a execução (exemplo de configuração manual): Você pode fornecer uma configuração que especifica o modelo base, tarefa/estágio, configurações LoRA, quantização e diretório de saída. Os campos de exemplo mostrados nas fontes incluem:
- base/model_name_or_path: meta-llama/Llama-3.1-8B (ou -Instruct)
- task/stage: sft
- finetuning_type: lora
- lora_rank (r), lora_alpha, lora_dropout, lora_target
- cutoff_len
- learning_rate, epochs
- quantization_bit: 4
- output_dir
O Soup também pode detectar/escolher automaticamente muitas configurações (otimizador, agendador, módulos de destino, tamanho do lote) dependendo do fluxo de trabalho.
8) Treine em um único comando: Execute o treinamento a partir do seu projeto/configuração inicializado:
soup train
De acordo com as fontes, o Soup executa verificações pré-voo nos dados, seleciona/deriva configurações de treinamento por meio de regras (não pesquisa manual de hiperparâmetros), deriva avaliações de seus próprios dados e condiciona os salvamentos.
9) Use quantização de 4 bits para ajuste fino com pouca VRAM (exemplo): Para reduzir o uso de VRAM, configure a quantização de 4 bits (por exemplo, quantization_bit: 4). As fontes descrevem o streaming do modelo base congelado camada por camada da RAM da CPU ou NVMe e a quantização para NF4 para que um modelo de 8B possa ser ajustado em uma GPU de 4 GB.
10) Execute métodos de preferência/alinhamento (DPO/ORPO/SimPO/KTO) quando necessário: O Soup suporta métodos de alinhamento, incluindo DPO, ORPO, SimPO e KTO, e as fontes afirmam que estes também podem ser executados com a mesma abordagem de streaming de camadas quando o modelo é maior que a VRAM da GPU.
11) Migre de outra ferramenta de ajuste fino (conversão de configuração): Se você já possui configurações de outras ferramentas, use:
soup migrate
As fontes afirmam que isso converte configurações existentes (por exemplo, de LLaMA-Factory, Axolotl, Unsloth) sem reescrever, então você pode treinar normalmente.
12) Ingerir rastreamentos/logs de produção para dados de treinamento offline (opcional): Para construir conjuntos de dados a partir de logs/exportações existentes, use o padrão de comando de ingestão mostrado nas fontes:
soup ingest --source <vendor> --logs <export.jsonl>
As fontes suportadas mencionadas incluem Langfuse, LangSmith, Helicone, OpenPipe, OpenTelemetry e OpenAI Stored Completions.
Perguntas Frequentes do Soup CLI
Soup CLI é uma ferramenta de pós-treinamento CLI-first gratuita e de código aberto (Apache-2.0) que cobre todo o ciclo: ela valida e "ajusta" seus dados pré-voo, escolhe um método de treinamento, escreve a configuração de treinamento automaticamente (incluindo tarefa, quantização, taxa de aprendizado e épocas a partir de regras em vez de busca de hiperparâmetros), deriva avaliações de seus próprios dados, controla cada salvamento e pode autocorrigir a manipulação de recompensas durante a execução, em vez de apenas parar. Ela também se integra com ferramentas de ML comuns (Hugging Face, Ollama, vLLM, DeepSpeed, Unsloth, ONNX/TensorRT, W&B, etc.).
Vídeo do Soup CLI
Artigos Populares

Atoms: Uma Plataforma de IA Multiagente Que Transforma Ideias em Produtos Prontos para Lançamento
May 22, 2026

Nano Banana SBTI: O Que É, Como Funciona e Como Usá-lo em 2026
Apr 15, 2026

Análise do Atoms — O Construtor de Produtos de IA Redefinindo a Criação Digital em 2026
Apr 10, 2026

Kilo Claw: Como Implementar e Usar um Verdadeiro Agente de IA "Faça Você Mesmo" (Atualização de 2026)
Apr 3, 2026







