OpenAI
Chat Completions, embeddings, afbeeldingen, audio en bestanden, ongewijzigd.
/v1/chat/completionsOmniRoute / API-oppervlak
Chat, embeddings, reranking, afbeeldingen, video, muziek, spraak, OCR, bestanden en batches, in het verzoekformaat dat je client al spreekt.
Wireformaten
Eén proces accepteert meerdere formaten, dus een tool gebouwd op de SDK van één leverancier heeft alleen een andere base-URL nodig.
Chat Completions, embeddings, afbeeldingen, audio en bestanden, ongewijzigd.
/v1/chat/completionsHet Messages-wireformaat, inclusief het tellen van tokens.
/v1/messagesDe vorm van de Responses API, met verdichting van tool-output.
/v1/responsesgenerateContent en de Gemini-modellijst.
/v1beta/modelsDrop-in voor tools die de lokale Ollama API spreken.
/v1/api/chatCohere/Voyage-reranking plus Jina classify en segment.
/v1/rerankEndpoints
Gegroepeerd op wat je wilt doen in plaats van op welke provider het toevallig levert.
Drie verzoekvormen bereiken dezelfde router, zodat een client het formaat houdt dat hij al spreekt.
/v1/chat/completionsOpenAI Chat Completions, streaming of gebufferd/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensTel tokens voordat je ze uitgeeftDe retrieval-kant van een RAG-stack achter hetzelfde endpoint en dezelfde sleutel.
/v1/embeddingsTekst- en multimodale embeddings/v1/rerankCohere- en Voyage-compatibele reranking/v1/searchWebzoekabstractie over providers/v1/classifyJina-tekstclassificatie/v1/segmentJina-contentsegmentatie/v1/web/fetchLeesbare pagina-extractieGeneratie loopt via dezelfde fallback en kostenboekhouding als tekst.
/v1/images/generationsAfbeeldingssynthese/v1/images/editsBewerken en inpainting/v1/videos/generationsVideogeneratie/v1/music/generationsMuzieksyntheseSpraak in beide richtingen, plus OCR voor gescand bronmateriaal.
/v1/audio/transcriptionsSpraak naar tekst/v1/audio/translationsVertalende transcriptie/v1/audio/speechTekst naar spraak/v1/ocrDocument-OCREén keer uploaden en het werk asynchroon uitvoeren in plaats van een verbinding open te houden.
/v1/filesEen bestand uploaden/v1/files/{id}/contentBestandsinhoud terugstreamen/v1/batchesEen batchtaak aanmaken/v1/batches/{id}Batchstatus opvragen/v1/batches/{id}/cancelEen lopende batch annulerenAlles wat een client nodig heeft om een model te kiezen en binnen budget te blijven.
/v1/modelsModelcatalogus gegroepeerd per provider/v1/quotas/checkResterende quota vooraf valideren/v1/moderationsContentmoderatie/v1/wsWebSocket-upgrade voor streaming-clientsEen MCP-server met 110 tools en een A2A agent card, geleverd door hetzelfde proces.
/api/mcp/streamMCP via HTTP, 33 scopes/api/mcp/sseMCP via Server-Sent Events/a2aJSON-RPC 2.0, 6 agent-skills/.well-known/agent.jsonOpenbare agent cardHeaders
Routering is geen black box: de beslissing, de kosten en de compressie achter een antwoord reizen allemaal mee terug.
X-OmniRoute-DecisionStrategie, provideralias en latentie die het verzoek bediendenX-OmniRoute-ProviderDe provideralias waar daadwerkelijk naar is gerouteerdX-OmniRoute-ModelDe opgeloste model-identifierX-OmniRoute-Latency-MsUpstream-latentie in millisecondenX-OmniRoute-Tokens-InAantal invoertokensX-OmniRoute-Tokens-OutAantal uitvoertokensX-OmniRoute-Response-CostKosten van dit antwoord in USDX-OmniRoute-Cost-SavedVermeden USD bij een cache-hitX-OmniRoute-CacheHIT of MISS bij niet-streaming verzoekenX-OmniRoute-CompressionToegepaste compressiemodus en waar die vandaan kwamX-OmniRoute-Fallback-AttemptsGenomen fallback-hops, als die er warenX-OmniRoute-Request-IdCorrelatie-id voor het verzoeklogx-omniroute-compressionOverschrijf het compressieprofiel voor één verzoekX-OmniRoute-No-CacheOmzeil de semantische cachex-omniroute-no-memorySla geheugen- en skills-injectie overX-Session-IdSleutel voor sessieaffiniteit en kostentoewijzingIdempotency-KeyDedupliceer een opnieuw verzonden verzoek