
Paritok
Paritok 是一个即插即用的非破坏性上下文压缩网关,适用于 AI 编码代理,它语义压缩工具模式、文件读取和对话历史记录,以实现更长的会话并显著降低令牌费用。
https://www.paritok.com/?ref=producthunt&utm_source=aipure

产品信息
更新于:2026年08月11日
什么是 Paritok
Paritok 是一个开源(Apache-2.0)中间件层,位于编码代理(例如 Claude Code、Cursor、Codex、OpenHands 或任何与 OpenAI/Anthropic 兼容的客户端)和上游 LLM API 之间。其目的是通过压缩代理在每个轮次中重复发送的大量输入(工具模式、文件内容、日志和累积历史记录)来对抗“上下文膨胀”,从而使代理可以在相同的上下文窗口内运行更多轮次并降低成本。它由一个代码原生的 4B 压缩模型提供支持(基于 Qwen3-4B-Instruct,带有 PEFT/LoRA),该模型在数万个真实编码代理轨迹上进行端到端训练,并且可以自托管或通过托管 GPU 端点使用。
Paritok 的主要功能
Paritok 是一个嵌入式的、无损压缩网关,专为 AI 编码代理设计,它位于代理(例如 Claude Code、Cursor、Codex、OpenHands)和上游 LLM API(Anthropic/OpenAI 兼容)之间。在每个请求中,它会剥离工具模式的冗余,语义化压缩文件读取和工具输出,并总结陈旧的对话历史,以将会话保持在固定的上下文预算内——从而减少 token 消耗(早期轮次通常减少 25%,在长/饱和会话中减少 85% 以上),并使相同上下文窗口中的轮次增加约 3 倍。压缩是“传输时有损但可恢复的”,允许代理通过召回(例如 read_original)按需拉取精确的原始字节,而来自上游模型的响应则未经更改地通过。
通过一个环境变量即插即用代理: 通过将代理的 BASE_URL(例如 ANTHROPIC_BASE_URL)指向 Paritok,作为中间件层集成,只需最少的设置,同时与 OpenAI/Anthropic 风格的 API 兼容。
工具模式过滤和存根: 通过仅保留相关的完整工具模式并存根其余部分,减少了重复的每轮工具 JSON 开销(通常是数万个 token);工具块可以针对每个对话冻结以实现缓存稳定性。
文件和工具结果的语义压缩: 使用一个开源的、代码原生的 4B 模型,该模型经过真实编码代理轨迹的训练,可以压缩文件读取、日志和命令输出,同时保留标识符、路径、函数签名和错误详细信息。
预算下的陈旧历史总结: 一旦配置的上下文预算已满,就会总结较旧的轮次,保持最近的轮次完整,并防止在长时间的多步骤调试或重构会话期间上下文窗口溢出。
原始文件的无损召回: 没有任何东西被永久丢弃:压缩段被标记,因此当需要高保真细节时,代理可以在本地请求精确的原始内容(例如 read_original(ref))。
灵活部署:自托管或托管 GPU: 可作为 Apache-2.0 开源堆栈(网关 + 4B 模型)用于自托管,以及托管 GPU 选项,可在不拥有硬件的情况下实现更快的压缩。
Paritok 的使用场景
企业软件工程副驾驶: 降低 LLM 输入成本并增加内部编码助手的会话长度,这些助手经常读取大文件、运行测试和粘贴日志——尤其是在具有许多工具的 MCP 密集型环境中。
长时间运行的调试和事件响应: 通过压缩重复的日志、堆栈跟踪和工具输出,同时总结陈旧的历史记录,以避免在生产事件期间上下文溢出,从而保持多轮故障排除会话的稳定性。
大型代码库导航和 PR 自动化: 使 repo 感知代理能够遍历目录、读取许多文件并生成 PR,而不会使上下文膨胀,从而使自动化重构和代码审查工作流更加实用。
成本控制的代理平台和 IDE 集成: 对于构建 IDE 助手或代理运行时的供应商,Paritok 可以通过修剪工具模式和每轮发送的重复上下文来降低可变 token 消耗并提高可靠性。
注重隐私的本地开发: 自托管压缩器以将原始工具输出和文件内容保留在本地,同时仍将较小的压缩提示发送到上游——这对于处理敏感代码的受监管行业非常有用。
优点
显著的 token 节省,在较长的会话中会复合(在上下文饱和运行中报告高达 85% 以上),并且可以在相同的上下文窗口中适应约 3 倍的轮次。
具有按需召回精确原始文件的无损设计,与不可逆的截断/总结相比,降低了风险。
与流行的编码代理和 OpenAI/Anthropic 兼容的 API 即插即用兼容;最小的集成工作。
开源(Apache-2.0)网关和 4B 压缩模型,具有自托管选项,可实现成本控制和隐私。
缺点
转发的提示中压缩本质上是有损的;某些边缘情况的细节可能需要显式召回调用才能恢复精确的原始文件。
为基础设施增加了额外的组件(网关/代理),增加了操作复杂性和潜在的故障点。
保留的质量很高,但与未压缩的基线相比并不完美(在没有召回的基准测试中报告约为 86.5%),因此结果可能因工作流而异。
如何使用 Paritok
1) 选择您的部署模式(自托管或托管 GPU): Paritok 是您的编码代理和 LLM API 之间的中间层。您可以选择 (a) 在您自己的硬件上自托管开源网关 + 4B 压缩模型,或者 (b) 使用 Paritok 的托管 GPU 端点(带有使用情况仪表板),这样您就不需要 GPU。
2) 将 Paritok 放在您的代理和 LLM 提供商之间: Paritok 作为网关/代理工作:您的代理将常规聊天/消息 + 工具模式 + 工具结果发送给 Paritok,Paritok 压缩它们,然后将压缩后的请求转发给您的上游模型提供商(与 Anthropic/OpenAI 兼容的上游)。来自上游模型的输出保持不变。
3) 使用一个环境变量将您的代理指向 Paritok 网关: 将您的代理的提供商基本 URL 设置为 Paritok 网关。Anthropic 兼容代理的示例显示为:`export ANTHROPIC_BASE_URL=http://127.0.0.1:8080`。在此之后,代理发送的工具/文件/历史记录将自动通过 Paritok 路由。
4) 启用语义工具模式过滤(对工具密集型代理来说是最大的优势): 如果您的代理发送许多工具(通常是 40-70+),请配置 Paritok 的工具发现,以仅保留少数相关的工具模式,并将其余的进行存根。使用:`tool_discovery.strategy: embedding`。这可以大幅缩小每个轮次的工具模式块(例如,在示例中从约 29K 减少到约 8K 令牌)。
5) 让 Paritok 将文件读取和工具输出压缩为标记段: Paritok 专为编码代理流量(文件读取、工具结果、日志)设计。将您要压缩的内容包装在段标签中,以便压缩器知道它是什么。示例模式:`[SEG id=1 kind=file_read] ... [/SEG]`(工具结果/日志输出类似)。Paritok 的 4B 模型压缩这些段,同时保留标识符、路径和错误。
6) 直接使用开源 Paritok 4B 压缩模型(可选,本地/离线压缩): 如果您想在 Python 中自己运行压缩器模型,请加载基础模型和 Paritok 适配器,然后从您的标记段生成压缩文本。来自源代码的示例:import torch; from peft import PeftModel; from transformers import AutoModelForCausalLM, AutoTokenizer; BASE_MODEL=`Qwen/Qwen3-4B-Instruct-2507`; ADAPTER=`paritok/paritok-4b-v1`; 加载 tokenizer+base,使用 `PeftModel.from_pretrained` 附加适配器,然后通过聊天模板和模型传递包含 `[SEG ...]` 内容的消息。
7) 依靠非破坏性压缩和按需恢复: Paritok 在传输过程中是有损的,但可恢复:它标记所有压缩的内容,并支持在需要时(例如,通过 `read_original(ref)` 样式的检索)拉回精确的原始字节。这意味着您可以保持请求小巧,同时仍然能够在本地恢复完整保真度,而无需花费额外的 LLM 轮次。
8) 当达到预算时,通过总结陈旧历史记录来运行更长的会话: 随着对话的增长,一旦达到您设置的上下文预算,Paritok 就可以总结旧的轮次,同时保持最近的轮次不变。这有助于防止上下文窗口溢出,并增加在压缩之前适合的轮次数量。
9) 验证节省并迭代您的设置: 测量每个轮次的令牌减少量(随着历史记录的增长,节省会累积)。工具密集型设置(70 多个工具)和上下文饱和的会话通常会看到更高的节省。如果使用托管 GPU,请使用 Paritok 仪表板跟踪令牌/成本节省,并确认流量正在通过托管 GPU 服务器。
10) 与常见的编码代理环境一起使用: Paritok 旨在与使用标准消息格式的流行编码代理工具和框架兼容(例如 Claude Code、Cursor、Codex、OpenHands 和与 OpenAI 兼容的上游)。一旦基本 URL 指向 Paritok,您现有的代理工作流应该会继续工作,同时发送更少的输入上下文。
Paritok 常见问题
Paritok 是一个用于 AI 编码代理的无损压缩网关,它位于您的代理(例如 Claude Code、Cursor、Codex、OpenHands 或任何兼容 OpenAI BASE_URL 的代理)和上游 LLM 之间。它通过剥离工具模式冗余、压缩工具结果和文件读取以及总结过时历史来重写每个请求,然后将压缩后的请求转发到上游(因此您只需为更少的输入令牌付费)。











