OmniRoute / API 接口

一个端点,不止于聊天。

聊天、embeddings、重排序、图像、视频、音乐、语音、OCR、文件和批处理,沿用你的客户端已有的请求格式。

线路格式

沿用你的客户端已在发送的请求格式。

一个进程接受多种格式,所以基于某家厂商 SDK 构建的工具只需改一下 base URL,别的都不用动。

OpenAI

Chat Completions、embeddings、图像、音频和文件,原样支持。

/v1/chat/completions

Anthropic

Messages 线路格式,包括 token 计数。

/v1/messages

OpenAI Responses

Responses API 格式,带工具输出精简。

/v1/responses

Gemini

generateContent 和 Gemini 模型列表。

/v1beta/models

Ollama

可直接替换使用本地 Ollama API 的工具。

/v1/api/chat

Rerank and Jina

Cohere/Voyage 重排序,以及 Jina 分类和分段。

/v1/rerank

端点

不止于 chat completions。

按你想做的事分组,而不是按哪家提供商恰好提供服务。

聊天与消息

三种请求格式到达同一个路由器,客户端可以沿用已有的格式。

  • POST/v1/chat/completionsOpenAI Chat Completions,流式或缓冲
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokens花费前先统计 token

Embeddings、搜索与排序

RAG 栈的检索部分,在同一个端点、同一把密钥之后。

  • POST/v1/embeddings文本和多模态 embeddings
  • POST/v1/rerank兼容 Cohere 和 Voyage 的重排序
  • POST/v1/search跨提供商的网页搜索抽象
  • POST/v1/classifyJina 文本分类
  • POST/v1/segmentJina 内容分段
  • POST/v1/web/fetch可读网页提取

图像、视频与音乐

生成任务走与文本相同的故障转移和成本计量。

  • POST/v1/images/generations图像生成
  • POST/v1/images/edits编辑与局部重绘
  • POST/v1/videos/generations视频生成
  • POST/v1/music/generations音乐生成

音频与文档

双向语音,以及针对扫描件的 OCR。

  • POST/v1/audio/transcriptions语音转文字
  • POST/v1/audio/translations转写并翻译
  • POST/v1/audio/speech文字转语音
  • POST/v1/ocr文档 OCR

文件与批处理

上传一次,然后异步运行任务,而不是一直占着连接。

  • POST/v1/files上传文件
  • GET/v1/files/{id}/content流式读回文件内容
  • POST/v1/batches创建批处理任务
  • GET/v1/batches/{id}轮询批处理状态
  • POST/v1/batches/{id}/cancel取消运行中的批处理

发现与控制

客户端选择模型、控制预算所需的一切。

  • GET/v1/models按提供商分组的模型目录
  • GET/v1/quotas/check预先校验剩余配额
  • POST/v1/moderations内容审核
  • GET/v1/ws面向流式客户端的 WebSocket 升级

代理协议

带 110 个工具的 MCP 服务器和一张 A2A agent card,由同一个进程提供。

  • GET/api/mcp/streamMCP over HTTP,33 个作用域
  • GET/api/mcp/sseMCP over Server-Sent Events
  • POST/a2aJSON-RPC 2.0,6 项代理技能
  • GET/.well-known/agent.json公开 agent card

请求头

每个响应都说明自己是如何被处理的。

路由不是黑箱:产生响应的决策、成本和压缩都会随响应一起返回。

响应头

  • X-OmniRoute-Decision处理该请求的策略、提供商别名和延迟
  • X-OmniRoute-Provider实际路由到的提供商别名
  • X-OmniRoute-Model解析后的模型标识符
  • X-OmniRoute-Latency-Ms上游延迟,单位毫秒
  • X-OmniRoute-Tokens-In输入 token 数
  • X-OmniRoute-Tokens-Out输出 token 数
  • X-OmniRoute-Response-Cost本次响应的美元成本
  • X-OmniRoute-Cost-Saved缓存命中时避免的美元花费
  • X-OmniRoute-Cache非流式请求的 HIT 或 MISS
  • X-OmniRoute-Compression应用的压缩模式及其来源
  • X-OmniRoute-Fallback-Attempts发生过的故障转移跳数
  • X-OmniRoute-Request-Id请求日志的关联 id

请求头

  • x-omniroute-compression为单个请求覆盖压缩配置
  • X-OmniRoute-No-Cache绕过语义缓存
  • x-omniroute-no-memory跳过记忆和技能注入
  • X-Session-Id会话亲和与成本归属键
  • Idempotency-Key对重试请求去重
阅读 API 参考 (在新标签页中打开)

OmniRoute by Cheaper Inference

选择运行 OmniRoute 的方式。

自托管 OmniRoute,或使用 Cheaper Inference 按成本排序的托管网关。