OmniRoute / Superficie de la API

Un endpoint, más que chat.

Chat, embeddings, reranking, imágenes, vídeo, música, voz, OCR, archivos y lotes, en el formato de solicitud que tu cliente ya habla.

Formatos de red

Conserva la forma de solicitud que tu cliente ya envía.

Un solo proceso acepta varios formatos, así que una herramienta construida sobre el SDK de un proveedor solo necesita cambiar la URL base y nada más.

OpenAI

Chat Completions, embeddings, imágenes, audio y archivos, sin cambios.

/v1/chat/completions

Anthropic

El formato de red de Messages, incluido el recuento de tokens.

/v1/messages

OpenAI Responses

La forma de Responses API, con compactación de la salida de herramientas.

/v1/responses

Gemini

generateContent y el listado de modelos de Gemini.

/v1beta/models

Ollama

Sustituto directo para herramientas que hablan la API local de Ollama.

/v1/api/chat

Rerank and Jina

Reranking de Cohere/Voyage más clasificación y segmentación de Jina.

/v1/rerank

Endpoints

Más que chat completions.

Agrupados por lo que intentas hacer, no por el proveedor que casualmente lo sirve.

Chat y mensajes

Tres formas de solicitud llegan al mismo router, así que el cliente conserva el formato que ya habla.

  • POST/v1/chat/completionsOpenAI Chat Completions, en streaming o con búfer
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensCuenta los tokens antes de gastarlos

Embeddings, búsqueda y ranking

La mitad de recuperación de un stack RAG detrás del mismo endpoint y la misma clave.

  • POST/v1/embeddingsEmbeddings de texto y multimodales
  • POST/v1/rerankReranking compatible con Cohere y Voyage
  • POST/v1/searchAbstracción de búsqueda web entre proveedores
  • POST/v1/classifyClasificación de texto de Jina
  • POST/v1/segmentSegmentación de contenido de Jina
  • POST/v1/web/fetchExtracción de páginas legibles

Imagen, vídeo y música

La generación pasa por el mismo fallback y la misma contabilidad de costes que el texto.

  • POST/v1/images/generationsSíntesis de imágenes
  • POST/v1/images/editsEdición e inpainting
  • POST/v1/videos/generationsGeneración de vídeo
  • POST/v1/music/generationsSíntesis de música

Audio y documentos

Voz en ambas direcciones, más OCR para material escaneado.

  • POST/v1/audio/transcriptionsVoz a texto
  • POST/v1/audio/translationsTranscripción con traducción
  • POST/v1/audio/speechTexto a voz
  • POST/v1/ocrOCR de documentos

Archivos y lotes

Sube una vez y ejecuta el trabajo de forma asíncrona en lugar de mantener una conexión abierta.

  • POST/v1/filesSube un archivo
  • GET/v1/files/{id}/contentDevuelve el contenido del archivo en streaming
  • POST/v1/batchesCrea un trabajo por lotes
  • GET/v1/batches/{id}Consulta el estado del lote
  • POST/v1/batches/{id}/cancelCancela un lote en ejecución

Descubrimiento y control

Todo lo que un cliente necesita para elegir un modelo y no salirse del presupuesto.

  • GET/v1/modelsCatálogo de modelos agrupado por proveedor
  • GET/v1/quotas/checkValida de antemano la cuota restante
  • POST/v1/moderationsModeración de contenido
  • GET/v1/wsUpgrade a WebSocket para clientes en streaming

Protocolos de agentes

Un servidor MCP con 110 herramientas y una agent card A2A, servidos por el mismo proceso.

  • GET/api/mcp/streamMCP sobre HTTP, 33 ámbitos
  • GET/api/mcp/sseMCP sobre Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 habilidades de agente
  • GET/.well-known/agent.jsonAgent card pública

Cabeceras

Cada respuesta dice cómo se sirvió.

El enrutamiento no es una caja negra: la decisión, el coste y la compresión que produjeron una respuesta viajan de vuelta con ella.

Cabeceras de respuesta

  • X-OmniRoute-DecisionEstrategia, alias de proveedor y latencia que sirvieron la solicitud
  • X-OmniRoute-ProviderEl alias de proveedor al que se enrutó realmente
  • X-OmniRoute-ModelEl identificador de modelo resuelto
  • X-OmniRoute-Latency-MsLatencia upstream en milisegundos
  • X-OmniRoute-Tokens-InRecuento de tokens de entrada
  • X-OmniRoute-Tokens-OutRecuento de tokens de salida
  • X-OmniRoute-Response-CostCoste en USD de esta respuesta
  • X-OmniRoute-Cost-SavedUSD evitados en un acierto de caché
  • X-OmniRoute-CacheHIT o MISS en solicitudes sin streaming
  • X-OmniRoute-CompressionModo de compresión aplicado y de dónde procede
  • X-OmniRoute-Fallback-AttemptsSaltos de fallback realizados, si hubo alguno
  • X-OmniRoute-Request-IdId de correlación para el registro de solicitudes

Cabeceras de solicitud

  • x-omniroute-compressionAnula el perfil de compresión para una sola solicitud
  • X-OmniRoute-No-CacheOmite la caché semántica
  • x-omniroute-no-memoryOmite la inyección de memoria y habilidades
  • X-Session-IdClave de afinidad de sesión y atribución de costes
  • Idempotency-KeyDeduplica una solicitud reintentada
Lee la referencia de la API (se abre en una pestaña nueva)

OmniRoute de Cheaper Inference

Elige cómo ejecutar OmniRoute.

Autoaloja OmniRoute o usa Cheaper Inference para un gateway alojado clasificado por coste.