
Freesolo Flash
Freesolo Flash 是一个代理驱动的后训练包,它通过快速自定义内核训练和单一固定报价加预先预计到达时间,提供了一个带有导出权重的生产就绪小型模型。
https://freesolo.co/?ref=producthunt&utm_source=aipure

产品信息
更新于:2026年07月27日
什么是 Freesolo Flash
Freesolo Flash 是一种后训练解决方案,旨在由 Claude Code、Cursor 和 Codex 等编码代理操作,帮助工程师将现有训练循环转化为可部署的专用模型。它专注于使常见的后训练工作流程(例如监督微调 (SFT) 和 GRPO 等强化学习方法)端到端完成,因此输出不仅仅是实验结果,而是您可以发布的模型。Flash 定位在小型、低于 10B 参数的模型,用于低延迟、高吞吐量(“万亿 token”)的生产用例,并强调您的数据、您的模型和您的权重仍然属于您,权重会导出回您的存储库。
Freesolo Flash 的主要功能
Freesolo Flash 是一项托管的后训练服务(SFT 和 RL/GRPO,加上在策略蒸馏),旨在由编码代理(如 Claude Code/Cursor/Codex)驱动:您编写一个简短的配置并运行一个命令,即可在托管基础设施上微调小型模型,获得固定的前期报价和预计完成时间,并获得可部署在兼容 OpenAI 的端点后面的生产就绪结果,无需托管。Flash 通过自动化内核优化、成本可预测性(无按令牌计费)以及输出的所有权/可移植性(例如,将适配器权重导出到您的仓库)来强调高吞吐量。
代理驱动的工作流: 旨在由编码代理操作;工程师提供一个简短的配置,并通过一个命令触发训练以获得可部署的模型。
托管的端到端训练 + 服务: 在托管基础设施上运行微调,并通过兼容 OpenAI 的端点提供结果模型——无需在本地托管任何内容。
固定的前期报价和预计完成时间: 在执行前返回一个预运行价格报价和估计完成时间,避免按令牌计费和 GPU 小时不确定性。
多种后训练方法: 支持监督微调(提示/答案对)、通过 GRPO 进行强化学习,以及在策略蒸馏,其中托管教师逐令牌评分,以使小型模型趋向于更强的模型。
通过内核搜索实现高吞吐量训练: 将内核工程视为一个搜索问题,通过自动研究循环持续优化排列,以最大化训练吞吐量。
可部署的工件和权重导出: 生成生产就绪的输出(例如,自定义 LoRA 适配器),并将权重/适配器导出回您的仓库以进行版本控制和重用。
Freesolo Flash 的使用场景
客户支持自动化: 根据历史支持记录和策略微调一个小型、快速的模型,以提高依从性、降低延迟并降低每个请求的成本,优于前沿模型。
企业文档标记和路由: 训练小于 10B 的模型,以毫秒级延迟和可预测的支出高批量分类、标记和路由文档(法律、金融、人力资源)。
电子商务产品规范化和属性提取: 专门化一个轻量级模型,用于提取属性、规范化目录数据,并为数百万次常规产品摄取调用强制执行格式规则。
搜索和检索增强助手: 调整一个紧凑模型,用于查询重写、意图分类或片段生成,以提高搜索质量,同时在大规模下保持推理成本低廉。
将前沿工作流提炼成小型模型: 当大型模型已经表现良好时,使用在策略蒸馏:托管教师对小型模型的输出进行评分,减少了手动编写标签或设计奖励的需求。
优点
端到端托管工作流(训练 + 部署 + 聊天),具有兼容 OpenAI 的端点,最大限度地减少了运维开销。
可预测的定价,在运行前提供固定报价和预计完成时间,避免了按令牌/GPU 小时计费的意外。
支持多种后训练策略(SFT、RL/GRPO、在策略蒸馏),以满足不同的数据可用性和优化需求。
通过内核优化强调吞吐量,旨在为小型模型实现更快、更便宜的训练运行。
缺点
需要使用 Freesolo 的托管平台和身份验证(Freesolo API 密钥),这对于严格的本地或气隙环境可能是一个限制。
最适合小型模型专业化;需要大型模型完全微调或高度自定义基础设施控制的团队可能会觉得它不太适合。
在策略蒸馏依赖于托管教师模型(例如,默认情况下为 GLM 5.2),这对于需要特定教师或完全离线评分的团队可能是一个限制。
如何使用 Freesolo Flash
1) 获取访问权限 + 安装工具: 在 https://freesolo.co 创建一个帐户并获取 Freesolo API 密钥。为您的平台安装 Freesolo Flash 训练包/CLI(CLI 被描述为用于排队 Freesolo 后端训练作业的瘦客户端)。
2) 准备一个训练存储库(或从现有代码/数据存储库开始): Flash 旨在由编码代理(Claude Code、Cursor、Codex 等)驱动。将您的代理指向 Flash 训练包和将包含您的数据集和环境代码的源存储库(或新存储库)。
3) 定义您的任务数据(SFT 提示/答案对): 对于监督微调 (SFT),创建提示/答案对的数据集(例如,JSONL)。使用公共 SDK 接口在本地加载和验证它:`from freesolo.datasets import load_dataset` 然后 `dataset = load_dataset("support.jsonl")` 并检查 `len(dataset.examples)`。
4) (可选但推荐)定义评估/评分环境: 创建一个 Python 环境模块,该模块公开 `load_environment()` 并返回 `EnvironmentSingleTurn` 或 `EnvironmentMultiTurn`。使用公共 SDK 接口在本地加载它:`from freesolo.environments import load_environment` 然后 `environment = load_environment("freesolo/environment.py:load_environment")`。单轮环境通过 `start_episode()` 构建情节;多轮环境拥有自己的 `start_episode()`,并且应该在那里包含任何特定于任务的初始系统消息。
5) 选择训练方法:SFT vs RL vs 在线蒸馏: 根据您可以提供的内容进行选择:(a) 当您已经有提示/答案示例时使用 SFT;(b) 当您可以用奖励/环境评分输出但无法手写完美答案时使用 RL(例如 GRPO);(c) 当更大的教师模型可以逐个 token 评估您的模型的完成度时使用在线蒸馏(GLM 5.2 被提及为默认的托管教师),因此您不需要答案或奖励函数。
6) 为 Flash 编写一个简短的 TOML 配置: 创建一个 TOML 配置,选择 (1) 支持的基础模型,(2) 任务/训练模式(SFT、RL/GRPO 或蒸馏),以及 (3) 指向您的数据集和/或环境模块的指针。Flash 在基础模型之上训练一个 LoRA 适配器(小型附加权重)。
7) 运行单个 Flash 命令以开始训练: 运行 Flash CLI 命令,该命令使用您的 TOML 配置排队托管训练作业。在任何运行之前,Flash 会返回一个固定报价和预计到达时间;确认后继续(文档将其描述为:它打印报价和预计到达时间,然后您说“开始”)。
8) (可选)在最终训练之前使用代理驱动的优化器循环: 如果使用 Freesolo 代理工作流程,请运行基于存储库的循环:`draft` 从源存储库创建初始训练合同(返回 `targetRepoUrl`),然后 `optimize` 生成存储库级别的训练文件并运行有界策略发现实验(具有并发性和时间限制),然后 `training` 运行优化器选择的 SFT/RL 脚本/配置组合。
9) 监控作业进度和完成情况: 使用 CLI 轮询工作流程来监视作业:`poll` 列出最近的组织作业,并可以监视选定的作业直到它完成。当作业完成时,它会打印一个简短的摘要,包括作业 ID、存储库、提交和更改的文件;完整详细信息可在 Freesolo 网页平台 https://freesolo.co 上获取。
10) 检索您的输出(LoRA 适配器 + 导出的权重): 训练完成后,您将获得一个可部署的结果:生成 LoRA 适配器,并将权重以标准格式导出到您的存储库中,以便您可以下载并在任何地方提供它们。
11) 使用托管服务部署(可选): 运行 `flash deploy` 以向托管服务注册适配器。部署后,您可以使用您的 Freesolo 密钥通过 `flash chat` 或任何与 OpenAI 兼容的客户端调用模型(Flash 在与 OpenAI 兼容的端点后面提供服务;无需托管)。
12) 随着生产数据的演变,廉价地迭代和重新训练: Flash 定位为在生产数据上重复进行后训练(特别是对于低于 10B 的模型)。通过更新您的数据集/环境、调整 TOML 配置、重新运行作业以获取新的预先报价/预计到达时间以及重新部署更新的适配器来迭代。
Freesolo Flash 常见问题
Freesolo Flash 是一个原生代理的后训练软件包,旨在由编码代理(例如 Claude Code、Cursor、Codex)驱动,以运行 SFT 和 RL 等后训练工作流,并返回一个已完成的、可部署的模型,其权重会导出回您的仓库。











