serviciosia

La pregunta de la segunda reunión

Preferimos montarlo en tu casa. Si no cabe, elegimos motor por presupuesto — no por moda.

Nuestro punto de partida no cambia: red, servidor y modelo dentro de tu empresa siempre que el caso lo permita. Es la única arquitectura en la que el dato no depende de la política de privacidad de un tercero, y la única que puedes enseñar entera en una auditoría.

Pero no todo el mundo necesita — ni tiene por qué pagar — un servidor con GPU. Por eso trabajamos también con las capas de API que hay hoy en el mercado: modelos low cost chinos y europeos adaptados a tu presupuesto, o modelos frontera cuando la tarea es difícil de verdad. Te decimos cuál te conviene por escrito, con su precio, antes de empezar.

Y no te casamos con ninguno. El motor se cambia en un fichero de configuración: si el mes que viene sale uno mejor o más barato, se cambia sin rehacer el trabajo. Lo que no se cambia luego es dónde vive el dato — eso se decide el primer día, y por eso está escrito en cada ficha.

~/aitactica $ ver servidores.webp
Frontal de varios servidores montados en armario
El motor se elige al final, no al principio.

Las tres capas

Lista revisada en agosto de 2026. Solo nombramos versiones que hemos comprobado que existen: si ha salido una nueva y no está aquí, es que todavía no la hemos mirado. Y el motor se cambia en la configuración, así que quedarse corto un mes no rehace ningún trabajo.

Capa 1 de 3

En tu servidor

El dato no sale. Es lo que preferimos.

Cuándo es la correcta
Historiales, expedientes, nóminas, contratos, datos de salud, sector público — o cualquier cosa que no puedas explicar en una auditoría si acaba fuera.
Qué le pasa a tu dato
No cruza el límite de tu empresa. Ni tu proveedor de nube ni nosotros vemos el contenido.
Cómo se paga
Inversión inicial en hardware y después coste plano: no sube aunque dupliques el uso.

Motores que usamos

  • LlamaMeta · pesos abiertosEl caballo de batalla: bien documentado y con hardware barato de sobra.
  • QwenAlibaba · pesos abiertosMuy fuerte en varios idiomas y en tamaños pequeños que caben en una GPU modesta.
  • DeepSeekChina · pesos abiertosRazonamiento a coste de modelo abierto. Se puede autoalojar entero.
  • MistralFrancia · pesos abiertosEuropeo, ligero y con licencia cómoda para uso comercial.
  • GemmaGoogle · pesos abiertosModelos pequeños que rinden por encima de su tamaño para clasificar y extraer.
  • gpt-ossOpenAI · pesos abiertosLa opción abierta de OpenAI cuando quieres su estilo sin mandar nada fuera.

Capa 2 de 3

API de bajo coste

Potencia de sobra por céntimos.

Cuándo es la correcta
Cuando el dato puede salir y lo que manda es el volumen: clasificar, extraer, traducir, resumir, etiquetar. Miles de operaciones al mes donde lo que cuenta es el precio por unidad.
Qué le pasa a tu dato
Sale al proveedor que elijas. Te decimos cuál, en qué país están sus servidores y qué dicen sus condiciones de empresa sobre entrenar con lo que les mandas.
Cómo se paga
Céntimos por millón de palabras. Es la capa que hace viables los volúmenes grandes sin comprar una máquina.

Motores que usamos

  • Kimi K2Moonshot · ChinaRelación potencia-precio difícil de batir en tareas largas de texto.
  • DeepSeekChinaRazonamiento a una fracción del precio de un modelo frontera.
  • MistralFrancia · EuropaDatos tratados en la UE. La opción cómoda cuando el RGPD pesa en la decisión.
  • Gemini FlashGoogle · EE. UU.Rapidísimo y muy barato, y traga documentos enormes de una sentada.
  • GrokxAI · EE. UU.Buen precio por token y acceso a contexto en tiempo real.
  • GPT miniOpenAI · EE. UU.El escalón barato de OpenAI para tareas de volumen.

Capa 3 de 3

Modelos frontera

Cuando el trabajo es difícil de verdad.

Cuándo es la correcta
Razonamiento largo, código, análisis jurídico o financiero, agentes que encadenan veinte pasos sin que nadie mire. Donde una respuesta mediocre cuesta más de lo que cuesta el modelo.
Qué le pasa a tu dato
Sale al proveedor. Leemos sus condiciones de empresa y te las resumimos por escrito antes de firmar nada.
Cómo se paga
El precio por palabra más alto del mercado — y a menudo el coste por tarea resuelta más bajo, porque acierta a la primera y no hay que revisarlo.

Motores que usamos

  • Claude Opus 5Anthropic · EE. UU.Nuestra primera opción en agentes largos, código y documentos densos.
  • GPT-5OpenAI · EE. UU.Muy sólido en razonamiento general y con el ecosistema más grande.
  • Gemini ProGoogle · EE. UU.Contexto enorme: útil cuando hay que leerse un expediente entero de golpe.

En la práctica casi nunca es uno solo

Lo normal es enrutar: el modelo barato se come el 90% del volumen y solo lo que de verdad es difícil sube al modelo frontera. Si además hay dato sensible, esa parte se queda en el servidor local y nunca entra en el enrutado. Se factura la mezcla, no el modelo más caro — y ahí es donde una factura de IA se divide entre tres o entre diez.

Preguntas frecuentes

+¿Puedo usar IA sin que mis datos salgan de mi empresa?

Sí, y es lo que preferimos. Los modelos de pesos abiertos —Llama, Qwen, DeepSeek, Mistral, Gemma— se descargan y corren en tu propio servidor. No hay llamada a internet, no hay proveedor que guarde nada y no hay condiciones que puedan cambiar el año que viene. La contrapartida es hardware: hace falta una máquina con GPU, y por eso cada ficha del catálogo lleva el cálculo de a partir de qué volumen sale a cuenta.

+¿Es seguro trabajar con modelos chinos como DeepSeek o Kimi?

Depende de cómo se use, y hay que separar dos cosas. Si te descargas los pesos y los ejecutas en tu servidor, el origen del modelo es irrelevante para la privacidad: no hay conexión con nadie, ni china ni americana. Si llamas a su API, tus datos viajan a sus servidores igual que viajarían a los de cualquier proveedor de EE. UU. Nosotros te decimos cuál de las dos cosas estamos haciendo, y para dato sensible proponemos siempre la primera.

+¿Cuánto se ahorra usando un modelo low cost en vez de uno frontera?

Entre diez y treinta veces por palabra procesada, según la pareja que compares. En tareas de volumen —clasificar correos, extraer campos de facturas, traducir fichas— la diferencia de calidad es pequeña y la de factura es enorme, así que ahí el modelo caro no se justifica. En razonamiento largo o análisis complejo la cosa se invierte: el modelo barato falla, hay que revisarlo a mano, y esa revisión cuesta más que la diferencia de precio.

+¿Podéis trabajar solo con proveedores europeos por el RGPD?

Sí. Mistral trata los datos en la UE, y cualquier modelo de pesos abiertos desplegado en un servidor europeo —o en el tuyo— deja el tratamiento dentro del territorio. Es una restricción perfectamente asumible y la aplicamos cuando el cliente la pide o cuando el tipo de dato la hace recomendable.

+¿Qué pasa si mañana sale un modelo mejor o más barato?

Se cambia el motor y ya está. Lo montamos de forma que el modelo es una pieza reemplazable en la configuración, no algo cosido al resto del sistema. Lo que no se cambia sin trabajo es la arquitectura del dato: si empiezas mandando información a una API y luego quieres traértelo todo dentro, eso sí es un proyecto. Por eso esa decisión se toma el primer día.

+¿Cuándo merece la pena pagar un modelo frontera como Claude Opus 5 o GPT-5?

Cuando el coste de una respuesta mediocre supera al del modelo. Agentes que encadenan muchos pasos sin supervisión, código, análisis jurídico o financiero, documentos densos donde un matiz mal leído cambia la conclusión. En esos casos el modelo caro suele salir más barato por tarea resuelta, porque acierta a la primera y no genera trabajo de revisión.

+¿Hay que elegir una sola capa para todo el proyecto?

Casi nunca conviene. Lo habitual es enrutar: el grueso del volumen lo resuelve el modelo barato y solo lo difícil sube al frontera, mientras que la parte con dato sensible se queda en el servidor local y ni siquiera entra en el enrutado. Se factura la mezcla, no el modelo más caro, y ahí es donde una factura de IA se divide entre tres o entre diez.

¿Qué motor te conviene a ti?

Depende del dato que muevas y del presupuesto que tengas, y las dos cosas se ven en media hora. Cuéntanos el proceso y te lo decimos con números — incluido el caso en el que no te compensa montar nada.