OmniRoute / 路由与控制

决定每个请求怎么走。

查看路由策略、免费额度计量、压缩、故障隔离和网络控制。

路由策略

选择一条 `auto` 路由,或自己构建。

使用现成模式,或围绕你关心的目标组合 19 种策略。

模型 · 已启用故障转移autoBalanced default
OpenAI 兼容请求
curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Write a TypeScript retry helper."}]}'

Routing alias auto selected. Objective: Balanced default. Fallback enabled.

用尽订阅配额

先用完已有配额,再动用付费 API。

priority · fill-first

分散负载

在密钥和账户之间均衡流量,降低速率限制压力。

weighted · round-robin · p2c · least-used · headroom

最便宜优先

路由到成本最低的合格目标。

cost-optimized

上下文感知

把长上下文留给容得下的模型,必要时再中继。

context-relay · context-optimized · cache-optimized

随机

把合格流量分散到各个目标。

random · strict-random

自适应评分

使用 15 因子评分、最近可用记录和感知重置的时间窗口。

reset-window · reset-aware · lkgp · auto · fusion · pipeline

免费额度计量

每月约 1.51B 个公开 token。

455 条目录条目去重为 40 个周期性额度池;只有公开的正向预算计入头条数字。

1.51B

池去重计量避免共享配额被重复计算。无上限的提供商保持可见,但不会抬高 token 总数。 Checked 2026-08-30.

View the calculation (在新标签页中打开)
周期性或免密钥的永久免费提供商56
  • Mistral1B/month
  • LLM7150M/month
  • Nara150M/month
  • Gemini CLI · forever60M/month
  • Kiro50 credits/month
  • Qoder · foreverFree catalog
  • LongCat · forever50M/day
  • Cerebras1M/day
  • NVIDIA NIM~40 RPM
  • Pollinations · foreverNo key
  • Cloudflare Workers AI · foreverDaily neurons
  • OpenCode Free · foreverNo-auth catalog

上下文压缩

将符合条件的 token 减少 15–95%。

工具输出、重复上下文和臃肿的结构化数据可以在到达模型之前被压缩。

Illustrative Ultra profile example from the audited documentation.

Before69 tokens
The function should iterate over the list of items, and for each item, it should check whether the value is greater than zero, and if so, add it to the running total.
After19 tokens
sum all list items where value > 0

Composable pipeline

  1. Session-Dedup
    丢弃会话中此前已发送过的内容。
  2. CCR
    归档大块内容,按需恢复。
  3. Lite
    应用保守的无损清理。
  4. RTK
    过滤并去重命令和工具输出。
  5. Responses Tool Output
    精简 Responses API 工具载荷。
  6. Headroom
    对表格和结构化数据进行可逆压缩。
  7. Relevance
    保留与最新查询最相关的句子。
  8. Caveman
    使用基于规则的文本浓缩。
  9. Aggressive
    应用更强的已配置裁剪。
  10. LLMLingua-2
    在隔离的 worker 中进行代码安全的语义裁剪。
  11. Ultra
    组合高节省阶段与保护守卫。
  12. OmniGlyph
    紧凑编码符合条件的重复结构。

Profiles

公开的配置范围~30%x-omniroute-compression: standard

已选择 Standard 压缩。公开范围 ~30%。

Controls and output styles

  • 命名配置与当前选择器
  • 可视化 Compression Studio
  • Anthropic Context Editing
  • 自适应上下文预算调节
  • 按请求的 \
  • 请求头
  • 离线评估工具
  • Token 阈值自动触发
  • Terse prose
  • Less code (YAGNI)
  • Terse CJK 文言

控制优先级:请求头 → 组合 → 配置 → 自适应策略 → 默认值。

故障隔离

隔离提供商、连接和模型故障。

一个坏密钥不该拖垮提供商。一个受限模型不该拖垮连接。

模型 ⊂ 连接 ⊂ 提供商
提供商熔断器提供商不健康时,组合路由会跳过它,直到半开探测成功。
连接冷却冷却某个密钥或账户,同级连接继续服务。
模型锁定锁定某个被限速或不可用的模型,同一连接上的其他模型保持可用。

网络与本地数据控制

网络路由与本地数据控制。

代理作用域控制网络路由,本地优先存储把运行数据留在你的机器上。

三种代理作用域

全局、按提供商或按单个连接路由。

  • 全局 · 按提供商 · 按连接
  • SOCKS5 和 HTTP(S) 代理
  • 代理市场集成

TLS 与客户端指纹控制

匹配受支持的提供商客户端,直至选定的传输层特征。

  • 通过 wreq-js 实现支持 JA3/JA4 的传输
  • 针对提供商的客户端配置
  • IPv4 和 IPv6 出口控制

私密且本地优先

密钥、用量和历史留在你掌控的主机上。

  • 磁盘上的 SQLite,凭据以 AES-256-GCM 加密
  • 无需 OmniRoute 账户
  • 在你选择的基础设施上自托管
俄罗斯中国伊朗古巴土耳其

OmniRoute by Cheaper Inference

选择运行 OmniRoute 的方式。

自托管 OmniRoute,或使用 Cheaper Inference 按成本排序的托管网关。