serviciosia

Enrutado de modelos y optimización del coste de IA

La misma calidad por una fracción de la factura, porque no todo necesita el modelo caro

depende de la arquitectura
Enrutado de modelos y optimización del coste de IA — servicio SRV-47 de serviciosia, nivel de infraestructura: el dato sale o no según la arquitectura que elijas.
Enrutado de modelos y optimización del coste de IA — servicio SRV-47 de serviciosia, nivel de infraestructura: el dato sale o no según la arquitectura que elijas.

6400 € para no descubrirlo por las malas.

Casi todo el mundo manda el 100% de sus peticiones al modelo más caro que conoce. Clasificar un correo de tres líneas y analizar un contrato de cuarenta páginas van al mismo sitio y cuestan lo mismo por palabra. Es como llevar la compra en taxi porque el día que te mudaste te hizo falta.

Qué hacemos

Montamos una puerta única por la que pasa toda tu IA — LiteLLM o un gateway equivalente, en tu infraestructura — y desde ahí se ve por primera vez la foto completa: qué llamada, cuánto costó, cuánto tardó y quién la hizo.

Con esa foto se enruta: lo repetitivo al modelo barato, lo difícil al frontera, lo sensible al modelo local que no sale de tu red. Las reglas son tuyas y se cambian sin tocar la aplicación.

Aplicamos las técnicas que de verdad mueven la aguja: caché semántica (la pregunta parecida ya contestada no se vuelve a pagar), caché de prompt, compresión de contexto y lotes donde el caso lo permita. En implantaciones típicas, la caché sola se lleva entre el 20% y el 40% de las peticiones.

Y ponemos límites de gasto por proyecto y por usuario, con corte automático. Un agente en bucle puede gastar en una noche lo que tenías presupuestado para un trimestre: eso se evita con un tope, no con buena voluntad.

Cómo funciona

Diagrama de funcionamiento de Enrutado de modelos y optimización del coste de IA: el dato entra desde tus sistemas, se procesa dentro de tu red y el resultado vuelve sin cruzar el límite.TU EMPRESATus sistemastus sistemasentraMotor (dentro o fuera)Enrutado de modelos y…devuelve el resultado a tu sistemaTu equiporevisa y decideno cruza el límite
Todo el recorrido ocurre dentro de tu red: entra desde tus sistemas, se procesa en tu servidor y vuelve. Ni tu proveedor de nube ni nosotros vemos el contenido.

Dónde vive el dato

El enrutador y la caché corren en tu infraestructura y ven todo lo que pasa por ellos, así que esa parte es tuya. Adónde va cada petición después lo decides tú con las reglas: se puede configurar para que lo sensible nunca salga del modelo local.

Diagrama: el dato se procesa dentro de tu red, y una parte cruza el límite hacia proveedor externo.TU EMPRESALÍMITEDocumentosModelono cruzaConsultaproveedor externosale de la empresa
El procesado ocurre dentro de tu red, pero parte del recorrido cruza el límite hacia proveedor externo. Queda escrito en la propuesta.

Retorno de la inversión

6400 € para no descubrirlo por las malas.

Este servicio no libera horas: evita un gasto o un disgusto. El retorno se ve el día que habría pasado y no pasa.

Inversión
6400 €
Cómo se paga
Evitando gasto, no liberando horas
Supuestos de este cálculo (5)
  • Este servicio no libera horas: baja una factura que ya estás pagando
  • La reducción típica en implantaciones con enrutado y caché está entre el 40% y el 70% del gasto en modelos
  • Sobre una factura de 1.500 €/mes, eso son entre 600 y 1.000 € mensuales recuperados
  • Por debajo de 300 €/mes de gasto en IA, el montaje no se amortiza y lo decimos antes de empezar
  • No se baja de modelo en ningún caso sin demostrar antes, con pruebas, que la calidad aguanta

Qué incluye

  • Puerta única para toda la IA, desplegada en tu infraestructura
  • Inventario del gasto actual por sistema, por modelo y por equipo
  • Reglas de enrutado por coste, calidad, latencia y sensibilidad del dato
  • Caché semántica y de prompt, con medición del porcentaje de acierto
  • Límites de gasto por proyecto y por usuario, con corte automático
  • Batería de evaluación para demostrar que el modelo barato no baja la calidad donde se aplica
  • Panel con el antes y el después, en euros

Con qué lo montamos

No trabajamos con una sola herramienta ni te casamos con ninguna. Esto es lo que solemos usar para este servicio y para qué sirve cada pieza — si ya tienes algo montado, partimos de ahí.

  • LiteLLMla puerta única, autoalojada, por la que pasa toda tu IA
  • OpenRouter / Portkeyalternativa gestionada cuando no queréis operar la puerta
  • Redisla caché semántica y el control de cuota
  • Qdrantbúsqueda de la pregunta parecida ya contestada
  • Langfuseel antes y el después, en euros por operación
  • Promptfoo / Ragasdemuestra que el modelo barato aguanta antes de bajar
  • Ollama / vLLMel destino local de lo que no puede salir

Cada una de estas piezas está catalogada en el stack, con lo importante: si se ejecuta dentro de tu empresa o si al meterla tu dato empieza a viajar.

Con qué motor lo movemos

Preferimos montarlo dentro de tu red, con un modelo abierto en tu propio servidor: es la única forma de que el dato no dependa de las condiciones de un tercero. Cuando eso no encaja — por presupuesto o porque no hace falta — trabajamos con modelos low cost adaptados a lo que puedas gastar, o con modelos frontera si la tarea lo pide. Para este servicio proponemos la capa marcada, pero se cambia sin rehacer el trabajo.

En tu servidor

Lo que proponemos aquí

El dato no sale. Es lo que preferimos.

Cuándo
Historiales, expedientes, nóminas, contratos, datos de salud, sector público — o cualquier cosa que no puedas explicar en una auditoría si acaba fuera.
Tu dato
No cruza el límite de tu empresa. Ni tu proveedor de nube ni nosotros vemos el contenido.
Cómo se paga
Inversión inicial en hardware y después coste plano: no sube aunque dupliques el uso.
  • LlamaMeta · pesos abiertos
  • QwenAlibaba · pesos abiertos
  • DeepSeekChina · pesos abiertos
  • MistralFrancia · pesos abiertos
  • GemmaGoogle · pesos abiertos
  • gpt-ossOpenAI · pesos abiertos

API de bajo coste

Potencia de sobra por céntimos.

Cuándo
Cuando el dato puede salir y lo que manda es el volumen: clasificar, extraer, traducir, resumir, etiquetar. Miles de operaciones al mes donde lo que cuenta es el precio por unidad.
Tu dato
Sale al proveedor que elijas. Te decimos cuál, en qué país están sus servidores y qué dicen sus condiciones de empresa sobre entrenar con lo que les mandas.
Cómo se paga
Céntimos por millón de palabras. Es la capa que hace viables los volúmenes grandes sin comprar una máquina.
  • Kimi K2Moonshot · China
  • DeepSeekChina
  • MistralFrancia · Europa
  • Gemini FlashGoogle · EE. UU.
  • GrokxAI · EE. UU.
  • GPT miniOpenAI · EE. UU.

Modelos frontera

Cuando el trabajo es difícil de verdad.

Cuándo
Razonamiento largo, código, análisis jurídico o financiero, agentes que encadenan veinte pasos sin que nadie mire. Donde una respuesta mediocre cuesta más de lo que cuesta el modelo.
Tu dato
Sale al proveedor. Leemos sus condiciones de empresa y te las resumimos por escrito antes de firmar nada.
Cómo se paga
El precio por palabra más alto del mercado — y a menudo el coste por tarea resuelta más bajo, porque acierta a la primera y no hay que revisarlo.
  • Claude Opus 5Anthropic · EE. UU.
  • GPT-5OpenAI · EE. UU.
  • Gemini ProGoogle · EE. UU.

En la práctica casi nunca es uno solo

Lo normal es enrutar: el modelo barato se come el 90% del volumen y solo lo que de verdad es difícil sube al modelo frontera. Si además hay dato sensible, esa parte se queda en el servidor local y nunca entra en el enrutado. Se factura la mezcla, no el modelo más caro — y ahí es donde una factura de IA se divide entre tres o entre diez.

Cómo elegimos el motor, en detalle →

Qué necesitamos de ti

  • Acceso a las facturas actuales de vuestros proveedores de IA
  • Poder cambiar el punto de acceso de vuestras aplicaciones a la puerta única
  • Casos reales con los que medir si el modelo barato aguanta

Plazo típico: 4 a 7 semanas

Lo que sueles preguntarte

¿Cuánto tarda en estar funcionando?

4 a 7 semanas, contando desde que tenemos los accesos. El plazo exacto va en la propuesta, no lo dejamos abierto.

¿Salen mis datos de la empresa?

Depende de la arquitectura que elijas. El enrutador y la caché corren en tu infraestructura y ven todo lo que pasa por ellos, así que esa parte es tuya. Adónde va cada petición después lo decides tú con las reglas: se puede configurar para que lo sensible nunca salga del modelo local.

¿Con qué modelo de IA lo montáis?

Por defecto lo movemos con un modelo abierto en tu propio servidor, porque aquí el dato no debería salir. Si prefieres API, se cambia — y entonces te decimos exactamente qué sale. Preferimos la seguridad del dato y montar red y sistemas en local, pero trabajamos con las tres capas: modelos abiertos en tu propio servidor, LLM de bajo coste adaptados al presupuesto —chinos como Kimi K2 o DeepSeek, europeos como Mistral, estadounidenses como Gemini o Grok— y modelos frontera como Claude Opus 5 o GPT-5. El motor se cambia en la configuración sin rehacer el trabajo.

¿Cuánto tiene que funcionar para que me salga a cuenta?

6400 € para no descubrirlo por las malas. Este servicio no libera horas: evita un gasto o un disgusto. El retorno se ve el día que habría pasado y no pasa. Los supuestos del cálculo están publicados en esta misma página, para que puedas discutirlos.

¿Qué necesitáis de mi parte?

Acceso a las facturas actuales de vuestros proveedores de IA; Poder cambiar el punto de acceso de vuestras aplicaciones a la puerta única; Casos reales con los que medir si el modelo barato aguanta. Nada más: el resto del trabajo es nuestro.

¿Cuándo NO me conviene contratarlo?

Si tu factura de IA está por debajo de 300 € al mes, no montes esto: el trabajo cuesta más que lo que vas a ahorrar el primer año. Vuelve cuando el gasto crezca — o llámanos y te decimos en una llamada las dos cosas gratis que sí puedes hacer hoy.

¿Puedo mantenerlo yo después, sin vosotros?

Sí. Todo lo que montamos se entrega documentado y con traspaso al equipo. No trabajamos con cajas negras.

¿Bajar de modelo no va a empeorar las respuestas?

En las tareas donde se aplica, no — y eso no se afirma, se demuestra. Antes de cambiar el modelo de un caso concreto se pasa una batería de pruebas con ejemplos reales tuyos y se compara el resultado. Si el modelo barato no llega al umbral, ese caso se queda arriba. El ahorro sale de los casos donde sí llega, que suelen ser la mayoría del volumen.

¿La caché semántica puede devolverme una respuesta equivocada?

Puede, si se configura con el umbral mal puesto. Por eso se ajusta con tus datos, se excluyen de caché las consultas que dependen del momento o del usuario, y se mide la tasa de acierto en producción. Una caché mal montada es peor que no tenerla, y por eso no la vendemos como una casilla que se activa.

¿Esto me ata a vosotros?

Al contrario: la puerta única es exactamente lo que te desata. Hoy tu aplicación llama directamente a un proveedor; después llama a una puerta tuya que puede apuntar a quien quieras, incluidos modelos locales. Es la pieza que hace que cambiar de motor sea un cambio de configuración.

¿Encaja con lo que necesitas?

Cuéntanos el proceso concreto y te decimos si este servicio es el que te conviene — o cuál de los otros 48 lo es.