
Freesolo Flash
Freesolo Flash 是一個代理驅動的訓練後套件,它透過快速的自訂核心訓練和單一固定報價加上預先的預計到達時間 (ETA),提供一個具有導出權重的生產就緒小型模型。
https://freesolo.co/?ref=producthunt&utm_source=aipure

產品資訊
更新時間:2026年07月27日
什麼是 Freesolo Flash
Freesolo Flash 是一個訓練後解決方案,旨在由 Claude Code、Cursor 和 Codex 等編碼代理操作,協助工程師將現有的訓練迴圈轉變為可部署的專門模型。它專注於使常見的訓練後工作流程(例如監督式微調 (SFT) 和 GRPO 等強化學習方法)能夠端到端完成,因此輸出不僅僅是實驗結果,而是一個您可以發布的模型。Flash 針對小型、小於 10B 參數的模型,用於低延遲、高容量(「萬億令牌」)的生產用例,並強調您的資料、您的模型和您的權重仍然屬於您,權重會導出回您的儲存庫。
Freesolo Flash 的主要功能
Freesolo Flash 是一種託管的後訓練服務(SFT 和 RL/GRPO,加上在策略蒸餾),旨在由 Claude Code/Cursor/Codex 等編碼代理驅動:您編寫一個簡短的配置並運行一個命令,即可在託管基礎設施上微調一個小型模型,獲得固定的預付報價和預計完成時間,並收到一個可部署在與 OpenAI 相容的端點後方的生產就緒結果,無需託管。Flash 強調透過自動化核心優化實現高吞吐量、成本可預測性(無按代幣計費),以及輸出的所有權/可移植性(例如,將適配器權重導出到您的儲存庫)。
代理驅動的工作流程: 旨在由編碼代理操作;工程師提供一個簡短的配置,並透過單一命令觸發訓練,以獲得可部署的模型。
託管的端到端訓練 + 服務: 在託管基礎設施上運行微調,並透過與 OpenAI 相容的端點提供生成的模型服務——無需在本地託管任何內容。
預先固定報價和預計完成時間: 在執行前返回一個預先運行的報價和估計完成時間,避免按代幣計費和 GPU 小時的不確定性。
多種後訓練方法: 支援監督式微調(提示/答案對)、透過 GRPO 進行強化學習,以及在策略蒸餾,其中託管教師逐代幣評分,將較小的模型拉向較強的模型。
透過核心搜尋實現高吞吐量訓練: 將核心工程視為一個搜尋問題,透過自動研究循環不斷優化排列,以最大化訓練吞吐量。
可部署的工件和權重導出: 產生生產就緒的輸出(例如,自訂 LoRA 適配器),並可以將權重/適配器導出回您的儲存庫以進行版本控制和重用。
Freesolo Flash 的使用案例
客戶支援自動化: 根據歷史支援記錄和政策微調一個小型、快速的模型,以提高合規性、減少延遲並降低每個請求的成本,相對於前沿模型。
企業文件標記和路由: 訓練小於 10B 的模型,以毫秒級的延遲和可預測的支出,高容量地分類、標記和路由文件(法律、金融、人力資源)。
電子商務產品標準化和屬性提取: 專門化一個輕量級模型,用於提取屬性、標準化目錄數據,並為數百萬個常規產品攝取呼叫強制執行格式規則。
搜尋和檢索增強助手: 調整一個緊湊型模型,用於查詢重寫、意圖分類或摘要生成,以提高搜尋品質,同時保持大規模推理的低成本。
將前沿工作流程蒸餾到小型模型中: 當較大的模型已經表現良好時,使用在策略蒸餾:託管教師會對較小模型的輸出進行評分,減少手動編寫標籤或設計獎勵的需求。
優點
端到端託管工作流程(訓練 + 部署 + 聊天),帶有與 OpenAI 相容的端點,最大限度地減少操作開銷。
在運行前提供固定報價和預計完成時間的可預測定價,避免按代幣/GPU 小時的意外費用。
支援多種後訓練策略(SFT、RL/GRPO、在策略蒸餾),以滿足不同的數據可用性和優化需求。
透過核心優化強調吞吐量,旨在為小型模型實現更快、更便宜的訓練運行。
缺點
需要使用 Freesolo 的託管平台和身份驗證(Freesolo API 金鑰),這對於嚴格的內部部署或氣隙環境可能是一個限制。
最適合小型模型專業化;需要大型模型完全微調或高度自訂基礎設施控制的團隊可能會覺得不太適合。
在策略蒸餾依賴於託管教師模型(例如,預設為 GLM 5.2),這對於需要特定教師或完全離線評分的團隊可能是一個限制。
如何使用 Freesolo Flash
1) 取得存取權限 + 安裝工具: 在 https://freesolo.co 建立帳戶並取得 Freesolo API 金鑰。為您的平台安裝 Freesolo Flash 訓練套件/CLI(CLI 被描述為用於排隊 Freesolo 後端訓練工作的輕量級客戶端)。
2) 準備訓練儲存庫(或從現有的程式碼/資料儲存庫開始): Flash 旨在由編碼代理(Claude Code、Cursor、Codex 等)驅動。將您的代理指向 Flash 訓練套件和您的原始儲存庫(或新儲存庫),其中將包含您的資料集和環境程式碼。
3) 定義您的任務資料(SFT 提示/答案對): 對於監督式微調 (SFT),建立一個提示/答案對的資料集(例如,JSONL)。使用公共 SDK 介面在本地載入和驗證它:`from freesolo.datasets import load_dataset` 然後 `dataset = load_dataset("support.jsonl")` 並檢查 `len(dataset.examples)`。
4) (可選但建議) 定義評估/評分環境: 建立一個 Python 環境模組,公開 `load_environment()` 並返回 `EnvironmentSingleTurn` 或 `EnvironmentMultiTurn`。使用公共 SDK 介面在本地載入它:`from freesolo.environments import load_environment` 然後 `environment = load_environment("freesolo/environment.py:load_environment")`。單輪環境透過 `start_episode()` 建立情節;多輪環境擁有自己的 `start_episode()`,並應在其中包含任何特定於任務的初始系統訊息。
5) 選擇訓練方法:SFT vs RL vs on-policy distillation: 根據您能提供的內容進行選擇:(a) 當您已經有提示/答案範例時選擇 SFT;(b) 當您可以使用獎勵/環境對輸出進行評分但無法手寫完美答案時選擇 RL(例如 GRPO);(c) 當較大的教師模型可以逐個令牌地評分您的模型完成情況時選擇 on-policy distillation(GLM 5.2 被提及為預設的託管教師),因此您不需要答案或獎勵函數。
6) 為 Flash 編寫一個簡短的 TOML 配置: 建立一個 TOML 配置,選擇 (1) 支援的基礎模型,(2) 任務/訓練模式(SFT、RL/GRPO 或 distillation),以及 (3) 指向您的資料集和/或環境模組的指標。Flash 在基礎模型之上訓練一個 LoRA 適配器(小型附加權重)。
7) 執行單個 Flash 命令以開始訓練: 執行 Flash CLI 命令,該命令使用您的 TOML 配置排隊託管訓練作業。在任何內容運行之前,Flash 會返回一個固定報價和一個預計到達時間 (ETA);確認後繼續(文件將其描述為:它會列印報價和 ETA,然後您說「開始」)。
8) (可選) 在最終訓練之前使用代理驅動的優化器迴圈: 如果使用 Freesolo 代理工作流程,請運行基於儲存庫的迴圈:`draft` 從原始儲存庫建立初始訓練合約(返回 `targetRepoUrl`),然後 `optimize` 生成儲存庫級別的訓練文件並運行有界策略發現實驗(具有並發和時間限制),然後 `training` 運行優化器選擇的 SFT/RL 腳本/配置組合。
9) 監控作業進度和完成情況: 使用 CLI 輪詢工作流程來監控作業:`poll` 列出最近的組織作業,並可以監控選定的作業直到完成。當作業完成時,它會列印一個簡短的摘要,包括作業 ID、儲存庫、提交和更改的文件;完整詳細資訊可在 Freesolo 網路平台 https://freesolo.co 上取得。
10) 檢索您的輸出(LoRA 適配器 + 導出的權重): 訓練完成後,您將獲得一個可部署的結果:生成 LoRA 適配器,並以標準格式將權重導出到您的儲存庫,以便您可以在任何地方下載和提供它們。
11) 使用託管服務部署(可選): 運行 `flash deploy` 以向託管服務註冊適配器。部署後,您可以使用您的 Freesolo 金鑰透過 `flash chat` 或任何與 OpenAI 相容的客戶端呼叫模型(Flash 在與 OpenAI 相容的端點後面提供服務;無需託管任何內容)。
12) 隨著生產資料的演變,廉價地迭代和重新訓練: Flash 旨在對生產資料進行重複的訓練後處理(特別是對於小於 10B 的模型)。透過更新您的資料集/環境、調整 TOML 配置、重新運行作業以獲取新的預先報價/ETA,以及重新部署更新的適配器來進行迭代。
Freesolo Flash 常見問題
Freesolo Flash 是一個代理原生的後訓練套件,旨在由編碼代理(例如 Claude Code、Cursor、Codex)驅動,以運行 SFT 和 RL 等後訓練工作流程,並返回一個已完成、可部署的模型,其權重會導出回您的儲存庫。











