Soup CLI es una pila de post-entrenamiento de código abierto, primero en CLI, que diagnostica automáticamente tus datos, elige un método de entrenamiento, genera configuraciones, deriva evaluaciones, protege cada punto de control y puede transmitir + cuantificar NF4 capas base congeladas para que incluso los ajustes finos de 8B puedan ejecutarse en GPUs de ~4 GB.
https://trysoup.dev/?ref=producthunt&utm_source=aipure
Soup CLI

Información del Producto

Actualizado:11/08/2026

¿Qué es Soup CLI?

Soup CLI es una herramienta de línea de comandos gratuita, con licencia Apache-2.0, que convierte el post-entrenamiento de LLM (SFT y alineación de preferencias) en un flujo de trabajo único y reproducible: decide la ejecución, entrena, evalúa y envía. En lugar de hacerte ajustar manualmente un sinfín de parámetros YAML, Soup se centra en "reglas, no búsqueda", seleccionando automáticamente valores predeterminados sensatos (por ejemplo, configuración de tareas, cuantificación, tasa de aprendizaje, épocas, tamaño de lote, optimizador/planificador) y validando tus datos antes del entrenamiento. Se integra con herramientas comunes del ecosistema (Hugging Face, Unsloth, DeepSpeed, MLX, W&B, rutas de exportación vLLM/Ollama/llama.cpp) mientras se mantiene capaz de funcionar sin conexión y evita el bloqueo del proveedor.

Características Principales de Soup CLI

Soup CLI es un kit de herramientas de post-entrenamiento de código abierto, "CLI-first", que convierte el ajuste fino y la alineación de LLM en un flujo de trabajo de un solo comando: "pre-vuela" y "doctora" su conjunto de datos, selecciona un método de entrenamiento apropiado, "auto-escribe" una configuración usando reglas (no búsqueda de hiperparámetros), deriva evaluaciones de sus propios datos y "cierra" los puntos de control con un veredicto de envío/no envío. Su capacidad insignia es la transmisión exacta de capas: puede mantener el modelo base congelado en la RAM de la CPU o NVMe y transmitirlo a la VRAM una capa a la vez mientras cuantifica a 4 bits (por ejemplo, NF4), lo que permite métodos LoRA SFT y de preferencia (DPO/ORPO/SimPO/KTO) en GPU muy pequeñas (reportado: Llama-3.1-8B en una GPU de laptop de 4 GB). También se integra con herramientas comunes del ecosistema de ML para la ingesta de trazas de producción, evaluación, exportación y servicio.
Flujo de trabajo de post-entrenamiento de un solo comando: Ejecuta el ciclo de principio a fin (verificaciones de datos → selección de método → generación de configuración → entrenamiento → evaluación → guardados "cerrados") desde una única CLI, reduciendo el cableado manual entre herramientas.
Configuración automática basada en reglas (menos "infierno" de configuración): Escribe automáticamente configuraciones de entrenamiento y elige valores predeterminados clave (tarea, cuantificación, tasa de aprendizaje, épocas, tamaño de lote/optimizador/planificador/módulos objetivo) utilizando reglas incorporadas en lugar de requerir búsquedas de parámetros.
Transmisión exacta de capas + cuantificación de 4 bits: Transmite el modelo base congelado desde la RAM de la CPU/NVMe a la VRAM capa por capa en un flujo CUDA dedicado y cuantifica a 4 bits (por ejemplo, NF4), limitando el pico de VRAM a una sola capa y permitiendo el entrenamiento de modelos más grandes en GPU pequeñas.
Soporta múltiples métodos de post-entrenamiento: Proporciona ajuste fino supervisado (SFT) y métodos de preferencia/alineación que incluyen DPO, ORPO, SimPO y KTO (con soporte de transmisión también para estos métodos).
Evaluación y "cierre" de guardado vinculados a sus datos: Deriva evaluaciones de su propio conjunto de datos y "cierra" cada guardado con un único veredicto de "ENVIAR o NO ENVIAR", con el objetivo de evitar guardar/lanzar ciegamente puntos de control degradados.
Migración + integraciones del ecosistema: Incluye `soup migrate` para convertir configuraciones existentes de otros "stacks" de ajuste fino (por ejemplo, LLaMA-Factory, Axolotl, Unsloth) y se integra con herramientas comunes para la aceleración de entrenamiento, seguimiento, exportación y servicio (por ejemplo, Unsloth, DeepSpeed, W&B, vLLM, Ollama, llama.cpp, ONNX, TensorRT).

Casos de Uso de Soup CLI

Ajuste fino en el dispositivo para aplicaciones "edge": Los equipos que construyen asistentes que deben ejecutarse localmente (privacidad/sin conexión) pueden ajustar un modelo de clase 8B en hardware restringido utilizando transmisión + cuantificación de 4 bits, luego exportar/servir a través de tiempos de ejecución locales.
Asistentes de atención al cliente y conocimiento empresarial: Ajuste fino y alinee un modelo base en preguntas y respuestas internas y transcripciones de chat, utilizando verificaciones previas de datos y guardados "cerrados" para reducir las regresiones antes de la implementación en herramientas de mesa de ayuda o chat interno.
Iteración de productos a partir de trazas de producción: Ingiera registros/trazas de plataformas de observabilidad y LLM (por ejemplo, exportaciones de Langfuse/LangSmith/Helicone/OpenTelemetry) para crear datos de entrenamiento, ejecutar SFT u optimización de preferencias, y evaluar mejoras en un pipeline CLI repetible.
Laboratorios académicos y equipos pequeños con presupuestos limitados de GPU: Los investigadores pueden ejecutar experimentos reproducibles de ajuste fino/alineación en GPU modestas sin necesidad de infraestructura multi-GPU, mientras siguen utilizando flujos de evaluación y exportaciones estándar.
Industrias reguladas que necesitan flujos de trabajo sin conexión: Los equipos de atención médica/finanzas/sector público pueden mantener los datos localmente, ejecutar el entrenamiento y la evaluación sin conexión, y usar un "cierre" explícito de envío/no envío para respaldar los procesos de lanzamiento internos.
Empaquetado de implementación de modelos para diversos tiempos de ejecución: Después del entrenamiento, los equipos pueden apuntar a diferentes "stacks" de servicio (desarrollo local con Ollama, alto rendimiento con vLLM/SGLang, "edge" con llama.cpp/GGUF, o "stacks" de inferencia a través de ONNX/TensorRT) desde el mismo flujo de trabajo del proyecto.

Ventajas

Permite el ajuste fino de LLM más grandes en GPU muy pequeñas a través de la transmisión exacta de capas y la cuantificación de 4 bits (por ejemplo, 8B en 4 GB reportado).
La automatización basada en reglas y "CLI-first" reduce la carga de configuración y acelera la iteración (configuración automática + selección de método + "pre-vuelo").
El flujo de trabajo de principio a fin incluye evaluación y guardado de puntos de control "cerrados", lo que fomenta lanzamientos más seguros.
La amplia integración del ecosistema y la migración de configuración reducen los costos de cambio de otras herramientas.

Desventajas

La transmisión de capas está explícitamente etiquetada como BETA con limitaciones declaradas (por ejemplo, enfoque en transformadores/texto/LoRA simple), por lo que los casos extremos pueden requerir precaución.
La transmisión limita los pesos, pero no todos los controladores de memoria (por ejemplo, los logits/vocabulario pueden dominar la VRAM), por lo que algunas cargas de trabajo aún pueden no caber en GPU pequeñas.
Se divulgaron problemas históricos de corrección (por ejemplo, el adaptador transmitido previamente no funcionaba fuera de la ruta de transmisión; defecto de gradiente NF4 por encima de 32B antes de la corrección), lo que sugiere que los usuarios deben fijar las versiones y validar los resultados.
Las afirmaciones de rendimiento para algunas pérdidas de preferencia no se compararon completamente en las fuentes proporcionadas, por lo que las expectativas de rendimiento pueden requerir una medición local.

Cómo Usar Soup CLI

1) Instalar Soup CLI (núcleo ligero): Instala las herramientas principales de CLI + configuración + datos (sin pila PyTorch): pip install soup-cli Usa esto si solo quieres inicializar proyectos, gestionar configuraciones o ejecutar herramientas de datos sin dependencias de entrenamiento.
2) Instalar Soup con soporte de entrenamiento (recomendado para ajuste fino): Instala Soup más la pila de entrenamiento (torch, transformers, peft, trl, datasets, etc.): pip install "soup-cli[train]" Esta es la instalación típica para flujos de trabajo de SFT y entrenamiento de preferencias.
3) (Opcional) Instalar el paquete completo de características: Si quieres entrenar + servir + UI + herramientas de datos en una sola instalación: pip install "soup-cli[all]"
4) (Opcional) Instalar la última versión de desarrollo desde GitHub: Si quieres los cambios más recientes (puede ser menos estable): pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) Inicializar un nuevo proyecto a partir de una plantilla: Crea un proyecto/configuración de inicio usando una plantilla incorporada (ejemplo: chat): soup init --template chat Esto configura una estructura ejecutable para que puedas entrenar con una configuración manual mínima.
6) Prepara tus datos de entrenamiento (apunta Soup a tu conjunto de datos): Coloca tu conjunto de datos localmente (comúnmente JSONL). En una configuración de Soup, harás referencia a rutas como: train: ./data/train.jsonl Soup admite formatos de conjunto de datos como los datos estilo Alpaca (como se muestra en las fuentes).
7) Configurar la ejecución (ejemplo de configuración manual): Puedes proporcionar una configuración que especifique el modelo base, la tarea/etapa, la configuración de LoRA, la cuantificación y el directorio de salida. Los campos de ejemplo que se muestran en las fuentes incluyen: - base/model_name_or_path: meta-llama/Llama-3.1-8B (o -Instruct) - task/stage: sft - finetuning_type: lora - lora_rank (r), lora_alpha, lora_dropout, lora_target - cutoff_len - learning_rate, epochs - quantization_bit: 4 - output_dir Soup también puede detectar/elegir automáticamente muchas configuraciones (optimizador, planificador, módulos objetivo, tamaño de lote) dependiendo del flujo de trabajo.
8) Entrenar en un solo comando: Ejecuta el entrenamiento desde tu proyecto/configuración inicializado: soup train Según las fuentes, Soup realiza comprobaciones previas al vuelo de los datos, selecciona/deriva la configuración de entrenamiento mediante reglas (no búsqueda manual de hiperparámetros), deriva evaluaciones de tus propios datos y protege los guardados.
9) Usar cuantificación de 4 bits para ajuste fino con poca VRAM (ejemplo): Para reducir el uso de VRAM, configura la cuantificación de 4 bits (por ejemplo, quantization_bit: 4). Las fuentes describen la transmisión del modelo base congelado capa por capa desde la RAM de la CPU o NVMe y la cuantificación a NF4 para que un modelo de 8B pueda ajustarse en una GPU de 4 GB.
10) Ejecutar métodos de preferencia/alineación (DPO/ORPO/SimPO/KTO) cuando sea necesario: Soup admite métodos de alineación que incluyen DPO, ORPO, SimPO y KTO, y las fuentes afirman que estos también pueden ejecutarse con el mismo enfoque de transmisión por capas cuando el modelo es más grande que la VRAM de la GPU.
11) Migrar desde otra herramienta de ajuste fino (conversión de configuración): Si ya tienes configuraciones de otras herramientas, usa: soup migrate Las fuentes afirman que esto convierte las configuraciones existentes (por ejemplo, de LLaMA-Factory, Axolotl, Unsloth) sin reescribir, luego puedes entrenar normalmente.
12) Ingerir trazas/registros de producción para datos de entrenamiento sin conexión (opcional): Para construir conjuntos de datos a partir de registros/exportaciones existentes, usa el patrón de comando de ingesta que se muestra en las fuentes: soup ingest --source <vendor> --logs <export.jsonl> Las fuentes admitidas mencionadas incluyen Langfuse, LangSmith, Helicone, OpenPipe, OpenTelemetry y OpenAI Stored Completions.

Preguntas Frecuentes de Soup CLI

Soup CLI es una herramienta de post-entrenamiento CLI-first gratuita y de código abierto (Apache-2.0) que cubre el ciclo completo: valida y "doctora" tus datos antes del vuelo, elige un método de entrenamiento, escribe la configuración de entrenamiento automáticamente (incluyendo tarea, cuantificación, tasa de aprendizaje y épocas a partir de reglas en lugar de búsqueda de hiperparámetros), deriva evaluaciones de tus propios datos, protege cada guardado y puede autocorregir el "reward hacking" a mitad de la ejecución en lugar de solo detenerse. También se integra con herramientas de ML comunes (Hugging Face, Ollama, vLLM, DeepSpeed, Unsloth, ONNX/TensorRT, W&B, etc.).

Últimas herramientas de IA similares a Soup CLI

Gait
Gait
Gait es una herramienta de colaboración que integra la generación de código asistido por IA con el control de versiones, permitiendo a los equipos rastrear, entender y compartir el contexto del código generado por IA de manera eficiente.
invoices.dev
invoices.dev
invoices.dev es una plataforma de facturación automatizada que genera facturas directamente de los commits de Git de los desarrolladores, con capacidades de integración para GitHub, Slack, Linear y servicios de Google.
EasyRFP
EasyRFP
EasyRFP es un kit de herramientas de computación en el borde impulsado por IA que agiliza las respuestas a RFP (Solicitud de Propuesta) y permite el fenotipado de campo en tiempo real a través de tecnología de aprendizaje profundo.
Cart.ai
Cart.ai
Cart.ai es una plataforma de servicios impulsada por IA que proporciona soluciones integrales de automatización empresarial, incluyendo codificación, gestión de relaciones con clientes, edición de video, configuración de comercio electrónico y desarrollo de IA personalizada con soporte 24/7.