
Paritok
Paritok è un gateway di compressione del contesto non distruttivo e "drop-in" per agenti di codifica AI che comprime semanticamente schemi di strumenti, letture di file e cronologia di conversazione per consentire sessioni più lunghe e costi di token significativamente inferiori.
https://www.paritok.com/?ref=producthunt&utm_source=aipure

Informazioni sul Prodotto
Aggiornato:Aug 11, 2026
Cos'è Paritok
Paritok è un livello middleware open-source (Apache-2.0) che si interpone tra un agente di codifica (ad esempio, Claude Code, Cursor, Codex, OpenHands o qualsiasi client compatibile con OpenAI/Anthropic) e un'API LLM a monte. Il suo scopo è combattere il "context bloat" comprimendo le grandi quantità di input ripetuti che gli agenti reinviano ad ogni turno (schemi di strumenti, contenuti di file, log e cronologia accumulata), in modo che gli agenti possano eseguire più turni all'interno della stessa finestra di contesto e a un costo inferiore. È alimentato da un modello di compressione 4B nativo per il codice (basato su Qwen3-4B-Instruct con PEFT/LoRA) addestrato end-to-end su decine di migliaia di traiettorie reali di agenti di codifica, e può essere auto-ospitato o utilizzato tramite un endpoint GPU ospitato.
Caratteristiche principali di Paritok
Paritok è un gateway di compressione drop-in e non distruttivo per agenti di codifica AI che si posiziona tra un agente (ad esempio, Claude Code, Cursor, Codex, OpenHands) e un'API LLM a monte (compatibile con Anthropic/OpenAI). Ad ogni richiesta, elimina il "bloat" dello schema degli strumenti, comprime semanticamente le letture dei file e gli output degli strumenti, e riassume la cronologia delle conversazioni obsolete per mantenere le sessioni entro un budget di contesto fisso, riducendo la spesa in token (spesso il 25% nelle prime "turnate" fino all'85%+ nelle sessioni lunghe/sature) e consentendo circa 3 volte più "turnate" nella stessa finestra di contesto. La compressione è "lossy sul filo ma recuperabile", consentendo all'agente di recuperare i byte originali esatti su richiesta tramite richiamo (ad esempio, read_original), mentre le risposte dal modello a monte passano inalterate.
Proxy drop-in tramite una variabile d'ambiente: Si integra come livello middleware puntando la BASE_URL del tuo agente (ad esempio, ANTHROPIC_BASE_URL) a Paritok, richiedendo una configurazione minima pur rimanendo compatibile con le API in stile OpenAI/Anthropic.
Filtraggio e "stubbing" dello schema degli strumenti: Riduce il sovraccarico ripetuto del JSON degli strumenti per "turnata" (spesso decine di migliaia di token) mantenendo solo gli schemi degli strumenti pertinenti per intero e "stubbing" il resto; il blocco degli strumenti può essere "congelato" per conversazione per la stabilità della cache.
Compressione semantica di file e risultati degli strumenti: Utilizza un modello 4B open-source, "code-native", addestrato su traiettorie di agenti di codifica reali per comprimere letture di file, log e output di comandi, preservando identificatori, percorsi, firme di funzioni e dettagli di errore.
Riassunto della cronologia obsoleta sotto budget: Riassume le "turnate" più vecchie una volta che un budget di contesto configurato si riempie, mantenendo intatte le "turnate" recenti e prevenendo gli overflow della finestra di contesto durante lunghe sessioni di debug o refactoring a più passaggi.
Richiamo non distruttivo degli originali: Nulla viene scartato permanentemente: i segmenti compressi sono etichettati in modo che l'agente possa richiedere il contenuto originale esatto localmente (ad esempio, read_original(ref)) quando sono necessari dettagli ad alta fedeltà.
Distribuzione flessibile: self-host o GPU ospitata: Disponibile come stack aperto Apache-2.0 (gateway + modello 4B) per l'auto-hosting, più un'opzione GPU ospitata gestita per una compressione più rapida senza possedere hardware.
Casi d'uso di Paritok
Copiloti di ingegneria del software aziendale: Ridurre i costi di input LLM e aumentare la durata delle sessioni per gli assistenti di codifica interni che leggono frequentemente file di grandi dimensioni, eseguono test e incollano log, specialmente in ambienti "MCP-heavy" con molti strumenti.
Debug e risposta agli incidenti a lungo termine: Mantenere stabili le sessioni di risoluzione dei problemi a più "turnate" comprimendo log ripetuti, stack trace e output degli strumenti, riassumendo la cronologia obsoleta per evitare l'overflow del contesto durante gli incidenti di produzione.
Navigazione di grandi codebase e automazione delle PR: Consentire agli agenti "repo-aware" di attraversare directory, leggere molti file e generare PR senza gonfiare il contesto, rendendo più pratici i refactoring automatizzati e i flussi di lavoro di revisione del codice.
Piattaforme agenti e integrazioni IDE a costo controllato: Per i fornitori che creano assistenti IDE o runtime di agenti, Paritok può ridurre la spesa variabile in token e migliorare l'affidabilità tagliando gli schemi degli strumenti e il contesto ripetuto inviato ad ogni "turnata".
Sviluppo on-premise attento alla privacy: Ospitare autonomamente il compressore per mantenere gli output degli strumenti grezzi e i contenuti dei file locali, inviando comunque un prompt più piccolo e compresso a monte, utile per le industrie regolamentate che gestiscono codice sensibile.
Vantaggi
Significativi risparmi di token che si accumulano su sessioni più lunghe (riportato fino all'85%+ in esecuzioni sature di contesto) e possono contenere circa 3 volte più "turnate" nella stessa finestra di contesto.
Il design non distruttivo con richiamo su richiesta degli originali esatti riduce il rischio rispetto a troncamenti/riassunti irreversibili.
Compatibilità drop-in con agenti di codifica popolari e API compatibili con OpenAI/Anthropic; minimo sforzo di integrazione.
Gateway open-source (Apache-2.0) e modello di compressione 4B con opzione di auto-hosting per il controllo dei costi e la privacy.
Svantaggi
La compressione è intrinsecamente "lossy" nel prompt inoltrato; alcuni dettagli di casi limite potrebbero richiedere chiamate di richiamo esplicite per recuperare gli originali esatti.
Aggiunge un componente extra (gateway/proxy) all'infrastruttura, aumentando la complessità operativa e un potenziale punto di fallimento.
La qualità mantenuta è alta ma non perfetta rispetto ai "baseline" non compressi (riportato ~86,5% in un'impostazione di benchmark senza richiamo), quindi i risultati possono variare a seconda del flusso di lavoro.
Come usare Paritok
1) Scegli la modalità di deployment (Self-host o GPU ospitata): Paritok è un livello intermedio tra il tuo agente di codifica e la tua API LLM. Puoi (a) auto-ospitare il gateway open-source + il modello di compressione 4B sul tuo hardware, oppure (b) utilizzare l'endpoint GPU ospitato di Paritok (con una dashboard di utilizzo) in modo da non aver bisogno di una GPU.
2) Inserisci Paritok tra il tuo agente e il provider LLM: Paritok funziona come un gateway/proxy: il tuo agente invia le solite chat/messaggi + schemi di strumenti + risultati degli strumenti a Paritok, Paritok li comprime, quindi inoltra la richiesta compressa al tuo provider di modelli a monte (provider compatibili con Anthropic/OpenAI). L'output del modello a monte rimane invariato.
3) Punta il tuo agente al gateway Paritok usando una variabile d'ambiente: Imposta l'URL di base del provider del tuo agente sul gateway Paritok. Esempio mostrato per agenti compatibili con Anthropic: `export ANTHROPIC_BASE_URL=http://127.0.0.1:8080`. Dopo questo, gli strumenti/file/cronologia inviati dall'agente verranno instradati automaticamente tramite Paritok.
4) Abilita il filtro semantico degli schemi degli strumenti (il maggior vantaggio per gli agenti che usano molti strumenti): Se il tuo agente invia molti strumenti (spesso più di 40-70), configura la scoperta degli strumenti di Paritok per mantenere solo i pochi schemi di strumenti pertinenti per intero e troncare il resto. Usa: `tool_discovery.strategy: embedding`. Questo può ridurre sostanzialmente il blocco dello schema degli strumenti per turno (ad esempio, da ~29K a ~8K token per turno nell'esempio).
5) Lascia che Paritok comprima le letture dei file e gli output degli strumenti come segmenti taggati: Paritok è progettato per il traffico degli agenti di codifica (letture di file, risultati di strumenti, log). Avvolgi il contenuto che desideri comprimere in tag di segmento in modo che il compressore sappia di cosa si tratta. Esempio di pattern: `[SEG id=1 kind=file_read] ... [/SEG]` (similmente per i risultati degli strumenti/output di log). Il modello 4B di Paritok comprime questi segmenti preservando identificatori, percorsi ed errori.
6) Usa direttamente il modello di compressione Paritok 4B open-source (opzionale, compressione locale/offline): Se vuoi eseguire il modello di compressione da solo in Python, carica il modello base e l'adattatore Paritok, quindi genera testo compresso dai tuoi segmenti taggati. Esempio dalle fonti: import torch; from peft import PeftModel; from transformers import AutoModelForCausalLM, AutoTokenizer; BASE_MODEL=`Qwen/Qwen3-4B-Instruct-2507`; ADAPTER=`paritok/paritok-4b-v1`; carica tokenizer+base, allega l'adattatore con `PeftModel.from_pretrained`, quindi passa un messaggio contenente il contenuto `[SEG ...]` attraverso il template di chat e il modello.
7) Affidati alla compressione non distruttiva con recupero su richiesta: Paritok è lossy sulla rete ma recuperabile: tagga tutto ciò che comprime e supporta il recupero dei byte originali esatti quando necessario (ad esempio, tramite un recupero in stile `read_original(ref)`). Ciò significa che puoi mantenere le richieste piccole pur essendo in grado di recuperare la piena fedeltà localmente senza spendere turni LLM extra.
8) Esegui sessioni più lunghe riassumendo la cronologia obsoleta quando raggiungi un budget: Man mano che le conversazioni crescono, Paritok può riassumere i turni più vecchi una volta raggiunto un budget di contesto impostato, mantenendo intatti i turni recenti. Questo aiuta a prevenire overflow della finestra di contesto e aumenta il numero di turni che rientrano prima della compattazione.
9) Verifica i risparmi e itera sulla tua configurazione: Misura le riduzioni dei token tra i turni (i risparmi si accumulano man mano che la cronologia cresce). Le configurazioni con molti strumenti (più di 70 strumenti) e le sessioni sature di contesto di solito registrano risparmi maggiori. Se utilizzi la GPU ospitata, usa la dashboard di Paritok per monitorare i risparmi di token/costi e confermare che il traffico stia passando attraverso il server GPU ospitato.
10) Utilizza con ambienti comuni di agenti di codifica: Paritok è progettato per essere compatibile con strumenti e framework popolari di agenti di codifica che utilizzano formati di messaggio standard (ad esempio, Claude Code, Cursor, Codex, OpenHands e provider compatibili con OpenAI). Una volta che l'URL di base è puntato su Paritok, i tuoi flussi di lavoro esistenti dovrebbero continuare a funzionare inviando meno contesto di input.
FAQ di Paritok
Paritok è un gateway di compressione non distruttivo per agenti di codifica AI che si posiziona tra il tuo agente (ad esempio, Claude Code, Cursor, Codex, OpenHands o qualsiasi agente BASE_URL compatibile con OpenAI) e l'LLM a monte. Riscrive ogni richiesta eliminando il "bloat" dello schema degli strumenti, comprimendo i risultati degli strumenti e le letture dei file, e riassumendo la cronologia obsoleta, quindi inoltra la richiesta compressa a monte (così ti vengono addebitati meno token di input).
Articoli Popolari

Atoms: Una Piattaforma AI Multi-Agente Che Trasforma le Idee in Prodotti Pronti al Lancio
May 22, 2026

Nano Banana SBTI: Cos'è, come funziona e come usarlo nel 2026
Apr 15, 2026

Recensione di Atoms — Il builder di prodotti AI che ridefinisce la creazione digitale nel 2026
Apr 10, 2026

Kilo Claw: Come Distribuire e Utilizzare un Vero Agente AI "Fai-da-Te" (Aggiornamento 2026)
Apr 3, 2026







