
Soup CLI
Soup CLI는 데이터를 자동으로 진단하고, 교육 방법을 선택하고, 구성을 생성하고, 평가를 파생하고, 모든 체크포인트를 게이트하며, 고정된 기본 레이어를 스트리밍+NF4-양자화할 수 있는 오픈 소스 CLI 우선 후처리 스택이므로 8B 미세 조정도 ~4GB GPU에서 실행할 수 있습니다.
https://trysoup.dev/?ref=producthunt&utm_source=aipure

제품 정보
업데이트됨:Aug 11, 2026
Soup CLI이란?
Soup CLI는 LLM 후처리 교육(SFT 및 선호도 정렬)을 단일의 재현 가능한 워크플로로 전환하는 무료 Apache-2.0 라이선스 명령줄 도구입니다. 실행 결정, 교육, 평가 및 배송을 수행합니다. 끝없는 YAML 노브를 수동으로 조정하게 하는 대신, Soup는 "검색이 아닌 규칙"에 중점을 두어 합리적인 기본값(예: 작업 설정, 양자화, 학습률, 에포크, 배치 크기 조정, 옵티마이저/스케줄러)을 자동으로 선택하고 교육 전에 데이터를 검증합니다. 오프라인 기능을 유지하고 공급업체 종속을 피하면서 일반적인 생태계 도구(Hugging Face, Unsloth, DeepSpeed, MLX, W&B, vLLM/Ollama/llama.cpp 내보내기 경로)와 통합됩니다.
Soup CLI의 주요 기능
Soup CLI는 오픈 소스 CLI 우선 학습 후 툴킷으로, LLM 미세 조정 및 정렬을 단일 명령 워크플로우로 전환합니다. 데이터셋을 사전 검사하고 '치료'하며, 적절한 학습 방법을 선택하고, 규칙(하이퍼파라미터 검색 아님)을 사용하여 구성을 자동 작성하고, 자체 데이터에서 평가를 도출하며, ship/don't-ship 판정으로 체크포인트를 게이트합니다. 주요 기능은 정확한 레이어 스트리밍입니다. 즉, 고정된 기본 모델을 CPU RAM 또는 NVMe에 유지하고 4비트(예: NF4)로 양자화하면서 한 번에 한 레이어씩 VRAM으로 스트리밍하여 매우 작은 GPU(보고된 바에 따르면 4GB 노트북 GPU에서 Llama-3.1-8B)에서도 LoRA SFT 및 선호 방법(DPO/ORPO/SimPO/KTO)을 사용할 수 있도록 합니다. 또한 프로덕션 추적 수집, 평가, 내보내기 및 서비스를 위한 일반적인 ML 생태계 도구와 통합됩니다.
단일 명령 학습 후 워크플로우: 단일 CLI에서 엔드투엔드 루프(데이터 검사 → 방법 선택 → 구성 생성 → 학습 → 평가 → 게이트된 저장)를 실행하여 도구 간 수동 연결을 줄입니다.
규칙 기반 자동 구성 (구성 지옥 감소): 매개변수 검색을 요구하는 대신 내장된 규칙을 사용하여 학습 구성을 자동으로 작성하고 주요 기본값(작업, 양자화, 학습률, 에포크, 배치 크기/옵티마이저/스케줄러/대상 모듈)을 선택합니다.
정확한 레이어 스트리밍 + 4비트 양자화: 전용 CUDA 스트림에서 CPU RAM/NVMe에서 VRAM으로 고정된 기본 모델을 레이어별로 스트리밍하고 4비트(예: NF4)로 양자화하여 피크 VRAM을 단일 레이어로 제한하고 작은 GPU에서 더 큰 모델을 학습할 수 있도록 합니다.
다양한 학습 후 방법 지원: 지도 미세 조정(SFT) 및 DPO, ORPO, SimPO, KTO를 포함한 선호/정렬 방법(이러한 방법에 대한 스트리밍 지원 포함)을 제공합니다.
데이터에 연결된 평가 및 저장 게이팅: 자체 데이터셋에서 평가를 도출하고 모든 저장을 단일 'SHIP 또는 DON'T-SHIP' 판정으로 게이트하여 손상된 체크포인트를 맹목적으로 저장/릴리스하는 것을 방지하는 것을 목표로 합니다.
마이그레이션 + 생태계 통합: 다른 미세 조정 스택(예: LLaMA-Factory, Axolotl, Unsloth)의 기존 구성을 변환하는 `soup migrate`를 포함하며, 학습 가속화, 추적, 내보내기 및 서비스를 위한 일반적인 도구(예: Unsloth, DeepSpeed, W&B, vLLM, Ollama, llama.cpp, ONNX, TensorRT)와 통합됩니다.
Soup CLI의 사용 사례
엣지 앱을 위한 온디바이스 미세 조정: 로컬에서 실행되어야 하는(개인 정보 보호/오프라인) 어시스턴트를 구축하는 팀은 스트리밍 + 4비트 양자화를 사용하여 제한된 하드웨어에서 8B급 모델을 미세 조정한 다음, 로컬 런타임을 통해 내보내고 서비스할 수 있습니다.
고객 지원 및 기업 지식 어시스턴트: 데이터 사전 검사 및 게이트된 저장을 사용하여 내부 Q&A 및 채팅 기록을 기반으로 기본 모델을 미세 조정하고 정렬하여 헬프데스크 또는 내부 채팅 도구에 배포하기 전에 회귀를 줄입니다.
프로덕션 추적을 통한 제품 반복: 관찰 가능성 및 LLM 플랫폼(예: Langfuse/LangSmith/Helicone/OpenTelemetry 내보내기)에서 로그/추적을 수집하여 학습 데이터를 생성하고, SFT 또는 선호도 최적화를 실행하며, 반복 가능한 CLI 파이프라인에서 개선 사항을 평가합니다.
제한된 GPU 예산을 가진 학술 연구실 및 소규모 팀: 연구원들은 다중 GPU 인프라 없이도 적당한 GPU에서 재현 가능한 미세 조정/정렬 실험을 실행할 수 있으며, 표준 평가 흐름 및 내보내기를 계속 사용할 수 있습니다.
오프라인 워크플로우가 필요한 규제 산업: 의료/금융/공공 부문 팀은 데이터를 로컬에 유지하고, 오프라인에서 학습 및 평가를 실행하며, 명시적인 ship/don't-ship 게이팅을 사용하여 내부 릴리스 프로세스를 지원할 수 있습니다.
다양한 런타임을 위한 모델 배포 패키징: 학습 후 팀은 동일한 프로젝트 워크플로우에서 다양한 서비스 스택(Ollama를 사용한 로컬 개발, vLLM/SGLang을 사용한 고처리량, llama.cpp/GGUF를 사용한 엣지 또는 ONNX/TensorRT를 통한 추론 스택)을 대상으로 할 수 있습니다.
장점
정확한 레이어 스트리밍 및 4비트 양자화를 통해 매우 작은 GPU에서 더 큰 LLM을 미세 조정할 수 있습니다(예: 4GB에서 8B 보고됨).
CLI 우선, 규칙 기반 자동화는 구성 부담을 줄이고 반복 속도를 높입니다(자동 구성 + 방법 선택 + 사전 검사).
엔드투엔드 워크플로우에는 평가 및 게이트된 체크포인트 저장이 포함되어 더 안전한 릴리스를 장려합니다.
광범위한 생태계 통합 및 구성 마이그레이션은 다른 도구에서 전환하는 비용을 낮춥니다.
단점
레이어 스트리밍은 명시적으로 BETA로 표시되어 있으며 제한 사항(예: 트랜스포머/텍스트/일반 LoRA 집중)이 명시되어 있으므로 엣지 케이스에는 주의가 필요할 수 있습니다.
스트리밍은 가중치를 제한하지만 모든 메모리 드라이버(예: 로짓/어휘가 VRAM을 지배할 수 있음)를 제한하지 않으므로 일부 워크로드는 여전히 작은 GPU에 맞지 않을 수 있습니다.
과거 정확성 문제가 공개되었습니다(예: 스트리밍 경로 외부의 이전 스트리밍 어댑터 no-op; 32B 이상 NF4 기울기 결함 수정 전). 이는 사용자가 버전을 고정하고 결과를 검증해야 함을 시사합니다.
일부 선호 손실에 대한 성능 주장은 제공된 소스에서 완전히 벤치마킹되지 않았으므로 처리량 기대치는 로컬 측정이 필요할 수 있습니다.
Soup CLI 사용 방법
1) Soup CLI 설치 (경량 코어): 핵심 CLI + 구성 + 데이터 도구 설치 (PyTorch 스택 없음):
pip install soup-cli
교육 종속성 없이 프로젝트를 초기화하거나 구성을 관리하거나 데이터 도구를 실행하려는 경우 이 방법을 사용하십시오.
2) 교육 지원을 통해 Soup 설치 (미세 조정을 위해 권장): Soup와 교육 스택 (torch, transformers, peft, trl, datasets 등) 설치:
pip install "soup-cli[train]"
이것은 SFT 및 선호도 교육 워크플로를 위한 일반적인 설치입니다.
3) (선택 사항) 전체 기능 번들 설치: 단일 설치로 교육 + 서비스 + UI + 데이터 도구를 원한다면:
pip install "soup-cli[all]"
4) (선택 사항) GitHub에서 최신 개발 버전 설치: 최신 변경 사항을 원한다면 (안정성이 떨어질 수 있음):
pip install git+https://github.com/MakazhanAlpamys/Soup.git
5) 템플릿에서 새 프로젝트 초기화: 내장 템플릿 (예: chat)을 사용하여 시작 프로젝트/구성 생성:
soup init --template chat
이렇게 하면 최소한의 수동 구성으로 교육할 수 있는 실행 가능한 구조가 설정됩니다.
6) 교육 데이터 준비 (Soup를 데이터셋에 연결): 데이터셋을 로컬에 배치합니다 (일반적으로 JSONL). Soup 구성에서 다음과 같은 경로를 참조합니다:
train: ./data/train.jsonl
Soup는 Alpaca 스타일 데이터와 같은 데이터셋 형식을 지원합니다 (소스에 표시된 대로).
7) 실행 구성 (수동 구성 예시): 기본 모델, 작업/단계, LoRA 설정, 양자화 및 출력 디렉토리를 지정하는 구성을 제공할 수 있습니다. 소스에 표시된 예시 필드는 다음과 같습니다:
- base/model_name_or_path: meta-llama/Llama-3.1-8B (또는 -Instruct)
- task/stage: sft
- finetuning_type: lora
- lora_rank (r), lora_alpha, lora_dropout, lora_target
- cutoff_len
- learning_rate, epochs
- quantization_bit: 4
- output_dir
Soup는 워크플로에 따라 많은 설정 (옵티마이저, 스케줄러, 대상 모듈, 배치 크기)을 자동으로 감지/선택할 수도 있습니다.
8) 한 번의 명령으로 교육: 초기화된 프로젝트/구성에서 교육 실행:
soup train
소스에 따르면 Soup는 데이터에 대한 사전 비행 검사를 수행하고, 규칙을 통해 교육 설정을 선택/파생하며 (수동 하이퍼파라미터 검색 아님), 자체 데이터에서 평가를 파생하고, 저장을 게이트합니다.
9) 낮은 VRAM 미세 조정을 위해 4비트 양자화 사용 (예시): VRAM 사용량을 줄이려면 4비트 양자화 (예: quantization_bit: 4)를 구성하십시오. 소스에서는 CPU RAM 또는 NVMe에서 고정된 기본 모델 레이어를 레이어별로 스트리밍하고 NF4로 양자화하여 8B 모델이 4GB GPU에서 미세 조정할 수 있도록 설명합니다.
10) 필요할 때 선호도/정렬 방법 (DPO/ORPO/SimPO/KTO) 실행: Soup는 DPO, ORPO, SimPO 및 KTO를 포함한 정렬 방법을 지원하며, 소스에서는 모델이 GPU VRAM보다 클 때 동일한 레이어 스트리밍 접근 방식으로도 실행할 수 있다고 명시합니다.
11) 다른 미세 조정 도구에서 마이그레이션 (구성 변환): 다른 도구의 구성이 이미 있는 경우 다음을 사용하십시오:
soup migrate
소스에서는 이것이 다시 작성하지 않고 기존 구성 (예: LLaMA-Factory, Axolotl, Unsloth)을 변환한 다음 정상적으로 교육할 수 있다고 명시합니다.
12) 오프라인 교육 데이터를 위한 프로덕션 추적/로그 수집 (선택 사항): 기존 로그/내보내기에서 데이터셋을 구축하려면 소스에 표시된 수집 명령 패턴을 사용하십시오:
soup ingest --source <vendor> --logs <export.jsonl>
언급된 지원 소스에는 Langfuse, LangSmith, Helicone, OpenPipe, OpenTelemetry 및 OpenAI Stored Completions가 포함됩니다.
Soup CLI 자주 묻는 질문
Soup CLI는 무료 오픈 소스(Apache-2.0) CLI 우선 사후 훈련 도구 체인으로, 전체 루프를 다룹니다. 데이터 사전 검증 및 "수정", 훈련 방법 선택, 훈련 구성 자동 작성(하이퍼파라미터 검색 대신 규칙에 따른 작업, 양자화, 학습률 및 에포크 포함), 자체 데이터에서 평가 도출, 모든 저장 게이트, 그리고 중단만 하는 대신 실행 중에 보상 해킹을 자체 수정할 수 있습니다. 또한 일반적인 ML 도구(Hugging Face, Ollama, vLLM, DeepSpeed, Unsloth, ONNX/TensorRT, W&B 등)와 통합됩니다.











