OmniRoute / API-Oberfläche

Ein Endpunkt, mehr als Chat.

Chat, Embeddings, Reranking, Bilder, Video, Musik, Sprache, OCR, Dateien und Batches, im Anfrageformat, das dein Client bereits spricht.

Wire-Formate

Behalte das Anfrageformat, das dein Client schon sendet.

Ein Prozess akzeptiert mehrere Formate, sodass ein gegen das SDK eines Anbieters gebautes Tool nur eine neue Basis-URL braucht und sonst nichts.

OpenAI

Chat Completions, Embeddings, Bilder, Audio und Dateien, unverändert.

/v1/chat/completions

Anthropic

Das Messages-Wire-Format, inklusive Token-Zählung.

/v1/messages

OpenAI Responses

Die Responses-API-Struktur, mit Verdichtung der Tool-Ausgaben.

/v1/responses

Gemini

generateContent und die Gemini-Modellliste.

/v1beta/models

Ollama

Drop-in für Tools, die die lokale Ollama-API sprechen.

/v1/api/chat

Rerank and Jina

Cohere/Voyage-Reranking plus Jina Classify und Segment.

/v1/rerank

Endpunkte

Mehr als Chat Completions.

Gruppiert nach dem, was du erreichen willst, statt danach, welcher Anbieter es gerade bedient.

Chat und Messages

Drei Anfrageformate erreichen denselben Router, sodass ein Client das Format behält, das er bereits spricht.

  • POST/v1/chat/completionsOpenAI Chat Completions, gestreamt oder gepuffert
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensTokens zählen, bevor sie ausgegeben werden

Embeddings, Suche und Ranking

Die Retrieval-Hälfte eines RAG-Stacks hinter demselben Endpunkt und demselben Schlüssel.

  • POST/v1/embeddingsText- und multimodale Embeddings
  • POST/v1/rerankCohere- und Voyage-kompatibles Reranking
  • POST/v1/searchWebsuche-Abstraktion über Anbieter hinweg
  • POST/v1/classifyJina-Textklassifikation
  • POST/v1/segmentJina-Inhaltssegmentierung
  • POST/v1/web/fetchLesbare Seitenextraktion

Bild, Video und Musik

Generierung läuft über denselben Fallback und dieselbe Kostenrechnung wie Text.

  • POST/v1/images/generationsBildsynthese
  • POST/v1/images/editsBearbeitung und Inpainting
  • POST/v1/videos/generationsVideogenerierung
  • POST/v1/music/generationsMusiksynthese

Audio und Dokumente

Sprache in beide Richtungen, plus OCR für gescannte Quellen.

  • POST/v1/audio/transcriptionsSprache zu Text
  • POST/v1/audio/translationsÜbersetzende Transkription
  • POST/v1/audio/speechText zu Sprache
  • POST/v1/ocrDokument-OCR

Dateien und Batches

Einmal hochladen, dann asynchron verarbeiten, statt eine Verbindung offen zu halten.

  • POST/v1/filesDatei hochladen
  • GET/v1/files/{id}/contentDateiinhalt zurückstreamen
  • POST/v1/batchesBatch-Job erstellen
  • GET/v1/batches/{id}Batch-Status abfragen
  • POST/v1/batches/{id}/cancelLaufenden Batch abbrechen

Discovery und Steuerung

Alles, was ein Client braucht, um ein Modell zu wählen und im Budget zu bleiben.

  • GET/v1/modelsNach Anbieter gruppierter Modellkatalog
  • GET/v1/quotas/checkRestkontingent vorab prüfen
  • POST/v1/moderationsInhaltsmoderation
  • GET/v1/wsWebSocket-Upgrade für Streaming-Clients

Agent-Protokolle

Ein MCP-Server mit 110 Tools und eine A2A-Agent-Card, bereitgestellt vom selben Prozess.

  • GET/api/mcp/streamMCP über HTTP, 33 Scopes
  • GET/api/mcp/sseMCP über Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 Agent-Skills
  • GET/.well-known/agent.jsonÖffentliche Agent Card

Header

Jede Antwort sagt, wie sie bedient wurde.

Routing ist keine Blackbox: Entscheidung, Kosten und Kompression, die eine Antwort erzeugt haben, reisen mit ihr zurück.

Response-Header

  • X-OmniRoute-DecisionStrategie, Anbieter-Alias und Latenz, die die Anfrage bedient haben
  • X-OmniRoute-ProviderDer tatsächlich angesteuerte Anbieter-Alias
  • X-OmniRoute-ModelDie aufgelöste Modellkennung
  • X-OmniRoute-Latency-MsUpstream-Latenz in Millisekunden
  • X-OmniRoute-Tokens-InAnzahl Eingabe-Tokens
  • X-OmniRoute-Tokens-OutAnzahl Ausgabe-Tokens
  • X-OmniRoute-Response-CostKosten dieser Antwort in USD
  • X-OmniRoute-Cost-SavedBei einem Cache-Hit vermiedene USD
  • X-OmniRoute-CacheHIT oder MISS bei nicht gestreamten Anfragen
  • X-OmniRoute-CompressionAngewandter Kompressionsmodus und seine Herkunft
  • X-OmniRoute-Fallback-AttemptsDurchgeführte Fallback-Hops, falls vorhanden
  • X-OmniRoute-Request-IdKorrelations-ID für das Request-Log

Request-Header

  • x-omniroute-compressionKompressionsprofil für eine Anfrage überschreiben
  • X-OmniRoute-No-CacheSemantischen Cache umgehen
  • x-omniroute-no-memoryMemory- und Skills-Injection überspringen
  • X-Session-IdSchlüssel für Session-Affinität und Kostenzuordnung
  • Idempotency-KeyWiederholte Anfrage deduplizieren
API-Referenz lesen (öffnet in neuem Tab)

OmniRoute von Cheaper Inference

Wähle, wie du OmniRoute betreibst.

Hoste OmniRoute selbst oder nutze Cheaper Inference als gehostetes, kostensortiertes Gateway.