serviciosia

IA local y on-premise

Modelos abiertos en tu servidor: ningún dato cruza y el coste deja de crecer con el uso

se queda dentro
IA local y on-premise — servicio SRV-25 de serviciosia, nivel de infraestructura: el dato se queda dentro de tu empresa.
IA local y on-premise — servicio SRV-25 de serviciosia, nivel de infraestructura: el dato se queda dentro de tu empresa.

Desde 16.878 documentos al mes, sale más barato que la nube.

Hay procesos que no puedes mandar a un tercero: historiales clínicos, expedientes, nóminas, contratos bajo acuerdo de confidencialidad. La respuesta habitual del sector es que eso no se puede hacer con IA. Sí se puede — lo que pasa es que hay que montarla dentro, y montarla dentro requiere saber de servidores.

Qué hacemos

Desplegamos modelos de pesos abiertos en tu propio servidor. El documento se procesa, se responde y no sale de la red local. Tu proveedor de nube no lo ve, y nosotros tampoco.

Elegimos el modelo según tu caso y tu hardware, no según lo que esté de moda esta semana. Un modelo mediano bien cuantizado en una GPU que ya tienes suele batir a uno enorme que te obligaría a comprar máquina nueva.

Se entrega en contenedores, con arranque automático, actualizaciones controladas y una interfaz de uso para el equipo con control de accesos. Y con la documentación para que puedas mantenerlo tú.

Cómo funciona

Diagrama de funcionamiento de IA local y on-premise: el dato entra desde tus sistemas, se procesa dentro de tu red y el resultado vuelve sin cruzar el límite.TU EMPRESATus sistemasREST · Webhooks · SMB ·…entraMotor en tu servidorIA local y on-premisedevuelve el resultado a tu sistemaTu equiporevisa y decideno cruza el límite
Todo el recorrido ocurre dentro de tu red: entra desde REST · Webhooks · SMB · S3 compatible, se procesa en tu servidor y vuelve. Ni tu proveedor de nube ni nosotros vemos el contenido.

Dónde vive el dato

Diagrama: el dato se procesa dentro de tu red y no cruza el límite en ningún momento.TU EMPRESALÍMITEDocumentosModelono cruza
Todo el recorrido ocurre dentro de tu red. Ni tu proveedor de nube ni nosotros vemos el contenido.

Retorno de la inversión

Desde 16.878 documentos al mes, sale más barato que la nube.

Por debajo de esa cifra te decimos que no te compensa. Preferimos perder el proyecto a venderte un servidor que no necesitas.

Comparación de coste a 36 meses entre desplegar on-premise y pagar por uso en la nube. El punto de cruce está en 16.878 documentos al mes.16.878 documentos/meson-premise · 25.520 €nube · crece con el uso033.757 documentos/mes55.123 €0 €
Coste total acumulado a 36 meses. La franja de la izquierda es la zona en la que montarlo dentro no te compensa: por debajo de 16.878 documentos al mes sale más barato pagar por uso.
Inversión inicial
14.000 €
Operación local
320 € /mes
Coste en nube
42 € / 1.000 documentos
Volumen de equilibrio
16.878 documentos /mes
Supuestos de este cálculo (5)
  • Inversión inicial: servidor con GPU de 24 GB, instalación y despliegue
  • Coste mensual local: electricidad, mantenimiento y soporte
  • Coste de nube por cada mil documentos procesados, a tarifas de proveedor habituales
  • Horizonte de 36 meses, que es la vida útil razonable del hardware
  • No se contabiliza el valor de que el dato no salga, porque no tiene precio de mercado — pero es el motivo real de la mitad de estos proyectos

Qué incluye

  • Selección del modelo según caso de uso y hardware disponible
  • Cuantización y ajuste de rendimiento medidos, no estimados
  • Despliegue en contenedores con arranque automático
  • Interfaz de uso para el equipo con control de accesos
  • Monitorización de latencia, uso y calidad
  • Documentación y traspaso: repositorio, runbook y dos sesiones

Con qué lo montamos

No trabajamos con una sola herramienta ni te casamos con ninguna. Esto es lo que solemos usar para este servicio y para qué sirve cada pieza — si ya tienes algo montado, partimos de ahí.

  • Ollamaservicio de modelos, sencillo de mantener
  • vLLMcuando hace falta throughput
  • SGLangalternativa con muy buen rendimiento en lotes
  • NVIDIA Container Toolkitla GPU disponible dentro del contenedor
  • Docker Composearranque automático y actualizaciones
  • Nginx / Caddyproxy y certificado
  • Open WebUIinterfaz de uso para el equipo, con accesos
  • LiteLLMuna API común y control de gasto por usuario

Cada una de estas piezas está catalogada en el stack, con lo importante: si se ejecuta dentro de tu empresa o si al meterla tu dato empieza a viajar.

Con qué motor lo movemos

Preferimos montarlo dentro de tu red, con un modelo abierto en tu propio servidor: es la única forma de que el dato no dependa de las condiciones de un tercero. Cuando eso no encaja — por presupuesto o porque no hace falta — trabajamos con modelos low cost adaptados a lo que puedas gastar, o con modelos frontera si la tarea lo pide. Para este servicio proponemos la capa marcada, pero se cambia sin rehacer el trabajo.

En tu servidor

Lo que proponemos aquí

El dato no sale. Es lo que preferimos.

Cuándo
Historiales, expedientes, nóminas, contratos, datos de salud, sector público — o cualquier cosa que no puedas explicar en una auditoría si acaba fuera.
Tu dato
No cruza el límite de tu empresa. Ni tu proveedor de nube ni nosotros vemos el contenido.
Cómo se paga
Inversión inicial en hardware y después coste plano: no sube aunque dupliques el uso.
  • LlamaMeta · pesos abiertos
  • QwenAlibaba · pesos abiertos
  • DeepSeekChina · pesos abiertos
  • MistralFrancia · pesos abiertos
  • GemmaGoogle · pesos abiertos
  • gpt-ossOpenAI · pesos abiertos

API de bajo coste

Potencia de sobra por céntimos.

Cuándo
Cuando el dato puede salir y lo que manda es el volumen: clasificar, extraer, traducir, resumir, etiquetar. Miles de operaciones al mes donde lo que cuenta es el precio por unidad.
Tu dato
Sale al proveedor que elijas. Te decimos cuál, en qué país están sus servidores y qué dicen sus condiciones de empresa sobre entrenar con lo que les mandas.
Cómo se paga
Céntimos por millón de palabras. Es la capa que hace viables los volúmenes grandes sin comprar una máquina.
  • Kimi K2Moonshot · China
  • DeepSeekChina
  • MistralFrancia · Europa
  • Gemini FlashGoogle · EE. UU.
  • GrokxAI · EE. UU.
  • GPT miniOpenAI · EE. UU.

Modelos frontera

Cuando el trabajo es difícil de verdad.

Cuándo
Razonamiento largo, código, análisis jurídico o financiero, agentes que encadenan veinte pasos sin que nadie mire. Donde una respuesta mediocre cuesta más de lo que cuesta el modelo.
Tu dato
Sale al proveedor. Leemos sus condiciones de empresa y te las resumimos por escrito antes de firmar nada.
Cómo se paga
El precio por palabra más alto del mercado — y a menudo el coste por tarea resuelta más bajo, porque acierta a la primera y no hay que revisarlo.
  • Claude Opus 5Anthropic · EE. UU.
  • GPT-5OpenAI · EE. UU.
  • Gemini ProGoogle · EE. UU.

En la práctica casi nunca es uno solo

Lo normal es enrutar: el modelo barato se come el 90% del volumen y solo lo que de verdad es difícil sube al modelo frontera. Si además hay dato sensible, esa parte se queda en el servidor local y nunca entra en el enrutado. Se factura la mezcla, no el modelo más caro — y ahí es donde una factura de IA se divide entre tres o entre diez.

Cómo elegimos el motor, en detalle →

Qué necesitamos de ti

  • Inventario del hardware disponible, o presupuesto para dimensionarlo
  • Muestra representativa de los documentos a procesar
  • Un responsable técnico de tu lado para el traspaso

Plazo típico: 3 a 6 semanas

Lo que sueles preguntarte

¿Cuánto tarda en estar funcionando?

3 a 6 semanas, contando desde que tenemos los accesos. El plazo exacto va en la propuesta, no lo dejamos abierto.

¿Salen mis datos de la empresa?

No. Todo el procesado ocurre dentro de tu red y ni tu proveedor de nube ni nosotros vemos el contenido.

¿Con qué modelo de IA lo montáis?

Por defecto lo movemos con un modelo abierto en tu propio servidor, porque aquí el dato no debería salir. Si prefieres API, se cambia — y entonces te decimos exactamente qué sale. Preferimos la seguridad del dato y montar red y sistemas en local, pero trabajamos con las tres capas: modelos abiertos en tu propio servidor, LLM de bajo coste adaptados al presupuesto —chinos como Kimi K2 o DeepSeek, europeos como Mistral, estadounidenses como Gemini o Grok— y modelos frontera como Claude Opus 5 o GPT-5. El motor se cambia en la configuración sin rehacer el trabajo.

¿Cuánto tiene que funcionar para que me salga a cuenta?

Desde 16.878 documentos al mes, sale más barato que la nube. Por debajo de esa cifra te decimos que no te compensa. Preferimos perder el proyecto a venderte un servidor que no necesitas. Los supuestos del cálculo están publicados en esta misma página, para que puedas discutirlos.

¿Qué necesitáis de mi parte?

Inventario del hardware disponible, o presupuesto para dimensionarlo; Muestra representativa de los documentos a procesar; Un responsable técnico de tu lado para el traspaso. Nada más: el resto del trabajo es nuestro.

¿Cuándo NO me conviene contratarlo?

Si tu volumen es bajo y ningún dato es sensible, la inversión en hardware no se te paga. El gráfico de esta ficha te dice exactamente a partir de qué volumen empieza a compensar — y si estás por debajo, te lo diremos antes de presupuestar, no después.

¿Puedo mantenerlo yo después, sin vosotros?

Sí. La entrega incluye repo + runbook + 2 sesiones. No trabajamos con cajas negras: si algún día quieres seguir por tu cuenta, puedes.

¿Encaja con lo que necesitas?

Cuéntanos el proceso concreto y te decimos si este servicio es el que te conviene — o cuál de los otros 48 lo es.