OmniRoute / API サーフェス

ひとつのエンドポイント、チャット以上。

チャット、埋め込み、リランキング、画像、動画、音楽、音声、OCR、ファイル、バッチを、クライアントが今使うリクエスト形式で。

ワイヤーフォーマット

クライアントが今送るリクエスト形式をそのまま。

ひとつのプロセスが複数の形式を受け付けるため、あるベンダーの SDK 向けに作ったツールは Base URL の変更だけで済みます。

OpenAI

Chat Completions、埋め込み、画像、音声、ファイルをそのまま。

/v1/chat/completions

Anthropic

トークンカウントを含む Messages ワイヤーフォーマット。

/v1/messages

OpenAI Responses

ツール出力の圧縮付きの Responses API 形式。

/v1/responses

Gemini

generateContent と Gemini のモデル一覧。

/v1beta/models

Ollama

ローカル Ollama API を話すツールにそのまま差し替え可能。

/v1/api/chat

Rerank and Jina

Cohere/Voyage のリランキングに加え、Jina の分類とセグメント化。

/v1/rerank

エンドポイント

チャット補完だけではない。

どのプロバイダーが処理するかではなく、何をしたいかで分類。

チャットとメッセージ

3 つのリクエスト形式が同じルーターに届くため、クライアントは今の形式をそのまま使えます。

  • POST/v1/chat/completionsOpenAI Chat Completions、ストリーミングまたはバッファード
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokens使う前にトークンをカウント

埋め込み、検索、ランキング

RAG スタックの検索側を、同じエンドポイントと同じキーの背後で。

  • POST/v1/embeddingsテキストとマルチモーダルの埋め込み
  • POST/v1/rerankCohere と Voyage 互換のリランキング
  • POST/v1/searchプロバイダー横断の Web 検索抽象化
  • POST/v1/classifyJina テキスト分類
  • POST/v1/segmentJina コンテンツセグメント化
  • POST/v1/web/fetch読みやすいページ抽出

画像、動画、音楽

生成もテキストと同じフォールバックとコスト集計を経由。

  • POST/v1/images/generations画像生成
  • POST/v1/images/edits編集とインペインティング
  • POST/v1/videos/generations動画生成
  • POST/v1/music/generations音楽生成

音声とドキュメント

双方向の音声処理に加え、スキャン資料向けの OCR。

  • POST/v1/audio/transcriptions音声からテキスト
  • POST/v1/audio/translations翻訳付き文字起こし
  • POST/v1/audio/speechテキストから音声
  • POST/v1/ocrドキュメント OCR

ファイルとバッチ

一度アップロードし、接続を保持せずに非同期で処理を実行。

  • POST/v1/filesファイルをアップロード
  • GET/v1/files/{id}/contentファイル内容をストリーミングで取得
  • POST/v1/batchesバッチジョブを作成
  • GET/v1/batches/{id}バッチ状態をポーリング
  • POST/v1/batches/{id}/cancel実行中のバッチをキャンセル

ディスカバリーと制御

クライアントがモデルを選び、予算内に収まるために必要なすべて。

  • GET/v1/modelsプロバイダー別のモデルカタログ
  • GET/v1/quotas/check残クォータを事前検証
  • POST/v1/moderationsコンテンツモデレーション
  • GET/v1/wsストリーミングクライアント向け WebSocket アップグレード

エージェントプロトコル

110 のツールを持つ MCP サーバーと A2A エージェントカードを同じプロセスで提供。

  • GET/api/mcp/streamMCP over HTTP、33 スコープ
  • GET/api/mcp/sseMCP over Server-Sent Events
  • POST/a2aJSON-RPC 2.0、6 のエージェントスキル
  • GET/.well-known/agent.json公開エージェントカード

ヘッダー

すべての応答が処理方法を伝える。

ルーティングはブラックボックスではありません。応答を生んだ判断、コスト、圧縮がすべて応答とともに返ります。

応答ヘッダー

  • X-OmniRoute-Decisionリクエストを処理した戦略、プロバイダーエイリアス、レイテンシ
  • X-OmniRoute-Provider実際にルーティングされたプロバイダーエイリアス
  • X-OmniRoute-Model解決されたモデル識別子
  • X-OmniRoute-Latency-Msアップストリームのレイテンシ (ミリ秒)
  • X-OmniRoute-Tokens-In入力トークン数
  • X-OmniRoute-Tokens-Out出力トークン数
  • X-OmniRoute-Response-Costこの応答の USD コスト
  • X-OmniRoute-Cost-Savedキャッシュヒットで回避した USD
  • X-OmniRoute-Cache非ストリーミングリクエストでの HIT または MISS
  • X-OmniRoute-Compression適用された圧縮モードとその由来
  • X-OmniRoute-Fallback-Attempts発生した場合のフォールバックホップ
  • X-OmniRoute-Request-Idリクエストログの相関 ID

リクエストヘッダー

  • x-omniroute-compression1 リクエストだけ圧縮プロファイルを上書き
  • X-OmniRoute-No-Cacheセマンティックキャッシュをバイパス
  • x-omniroute-no-memoryメモリとスキルの注入をスキップ
  • X-Session-Idセッションアフィニティとコスト帰属キー
  • Idempotency-Key再試行されたリクエストを重複排除
API リファレンスを読む (新しいタブで開きます)

OmniRoute by Cheaper Inference

OmniRoute の使い方を選ぶ。

OmniRoute をセルフホストするか、ホスト型のコスト順ゲートウェイとして Cheaper Inference を使う。