OmniRoute / Routing e controllo

Scegli come si muove ogni richiesta.

Esamina strategie di routing, conteggio dei tier gratuiti, compressione, isolamento dei guasti e controlli di rete.

Strategie di routing

Scegli una route `auto` o crea la tua.

Usa una modalità pronta o combina 19 strategie attorno all'obiettivo che conta.

Modello · fallback attivoautoBalanced default
Richiesta compatibile con OpenAI
curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Write a TypeScript retry helper."}]}'

Routing alias auto selected. Objective: Balanced default. Fallback enabled.

Consuma la quota dell'abbonamento

Usa la quota che già hai prima di toccare le API a pagamento.

priority · fill-first

Distribuisci il carico

Bilancia il traffico tra chiavi e account per ridurre la pressione dei rate limit.

weighted · round-robin · p2c · least-used · headroom

Prima il più economico

Instrada verso il target idoneo a costo più basso.

cost-optimized

In base al contesto

Tieni i contesti lunghi su modelli adeguati, poi trasferisci quando serve.

context-relay · context-optimized · cache-optimized

Casuale

Distribuisci il traffico idoneo tra i target.

random · strict-random

Punteggio adattivo

Usa un punteggio a 15 fattori, l'ultimo target funzionante e finestre che tengono conto dei reset.

reset-window · reset-aware · lkgp · auto · fusion · pipeline

Conteggio dei tier gratuiti

Circa 1.51B token pubblicati ogni mese.

455 voci di catalogo vengono deduplicate in 40 pool ricorrenti; solo i budget pubblicati positivi alimentano il totale in evidenza.

1.51B

Il conteggio deduplicato per pool evita che le quote condivise vengano contate più di una volta. I provider senza limite restano visibili senza gonfiare il totale dei token. Checked 2026-08-30.

View the calculation (si apre in una nuova scheda)
Provider gratuiti per sempre, ricorrenti o senza chiave56
  • Mistral1B/month
  • LLM7150M/month
  • Nara150M/month
  • Gemini CLI · forever60M/month
  • Kiro50 credits/month
  • Qoder · foreverFree catalog
  • LongCat · forever50M/day
  • Cerebras1M/day
  • NVIDIA NIM~40 RPM
  • Pollinations · foreverNo key
  • Cloudflare Workers AI · foreverDaily neurons
  • OpenCode Free · foreverNo-auth catalog

Compressione del contesto

Riduci i token idonei del 15–95%.

Output dei tool, contesto ripetuto e dati strutturati gonfiati possono essere compressi prima di arrivare al modello.

Illustrative Ultra profile example from the audited documentation.

Before69 tokens
The function should iterate over the list of items, and for each item, it should check whether the value is greater than zero, and if so, add it to the running total.
After19 tokens
sum all list items where value > 0

Composable pipeline

  1. Session-Dedup
    Elimina i contenuti già inviati in precedenza nella sessione.
  2. CCR
    Archivia i blocchi grandi e ripristinali su richiesta.
  3. Lite
    Applica una pulizia lossless conservativa.
  4. RTK
    Filtra e deduplica l'output di comandi e tool.
  5. Responses Tool Output
    Compatta i payload dei tool della Responses API.
  6. Headroom
    Applica una compattazione reversibile di dati tabulari e strutturati.
  7. Relevance
    Conserva le frasi più pertinenti all'ultima query.
  8. Caveman
    Usa una condensazione della prosa basata su regole.
  9. Aggressive
    Applica un pruning configurato più aggressivo.
  10. LLMLingua-2
    Usa un pruning semantico sicuro per il codice in un worker isolato.
  11. Ultra
    Combina fasi ad alto risparmio con protezioni di conservazione.
  12. OmniGlyph
    Codifica in modo compatto le strutture ripetute idonee.

Profiles

Intervallo pubblicato del profilo~30%x-omniroute-compression: standard

Compressione Standard selezionata. Intervallo pubblicato ~30%.

Controls and output styles

  • Profili con nome e selettore attivo
  • Visual Compression Studio
  • Anthropic Context Editing
  • Regolatore adattivo del budget di contesto
  • Header \
  • per singola richiesta
  • Harness di eval offline
  • Attivazione automatica a soglia di token
  • Terse prose
  • Less code (YAGNI)
  • Terse CJK 文言

Precedenza dei controlli: header di richiesta → combo → profilo → policy adattiva → default.

Isolamento dei guasti

Isola i guasti di provider, connessione e modello.

Una chiave guasta non deve bloccare un provider. Un modello limitato non deve bloccare una connessione.

modello ⊂ connessione ⊂ provider
Circuit breaker del providerQuando un provider non è sano, il routing delle combo lo salta finché una sonda half-open non ha successo.
Cooldown della connessioneMetti in pausa una chiave o un account mentre le connessioni sorelle continuano a servire.
Blocco del modelloBlocca un modello soggetto a rate limit o non disponibile mentre gli altri modelli della connessione restano disponibili.

Controlli di rete e dati locali

Routing di rete e controllo dei dati locali.

Gli scope proxy controllano il routing di rete, mentre lo storage local-first tiene i dati operativi sulla tua macchina.

Tre scope proxy

Instrada a livello globale, per provider o per singola connessione.

  • Globale · per provider · per connessione
  • Proxy SOCKS5 e HTTP(S)
  • Integrazione con marketplace di proxy

Controlli del fingerprint TLS e client

Replica i client dei provider supportati fino a caratteristiche di trasporto selezionate.

  • Trasporto con supporto JA3/JA4 tramite wreq-js
  • Profili client specifici per provider
  • Controlli di uscita IPv4 e IPv6

Privato e local-first

Chiavi, utilizzo e cronologia restano sull'host che controlli.

  • SQLite su disco con credenziali cifrate AES-256-GCM
  • Nessun account OmniRoute richiesto
  • Self-hosting sull'infrastruttura che scegli
RussiaCinaIranCubaTürkiye

OmniRoute di Cheaper Inference

Scegli come eseguire OmniRoute.

Fai self-hosting di OmniRoute oppure usa Cheaper Inference per un gateway hosted ordinato per costo.