serviciosia

Nivel 5 de 6 · El diferencial

Infraestructura

IA en tu propio servidor: dimensionado de GPU, despliegue reproducible, alta disponibilidad, monitorización y acceso seguro.

Es donde casi ninguna agencia de IA puede seguirte la conversación, y es la razón por la que existe esta web. Montar un modelo de pesos abiertos en tu servidor no es descargar un programa: es dimensionar la GPU con datos reales, elegir cuantización midiendo, servir con concurrencia, poner copias verificadas y saber cuánto cuesta cada respuesta.

La pregunta que contestamos con números y no con opinión es a partir de qué volumen compensa. Por debajo de cierta cifra de consultas al mes, montar tu propio servidor sale más caro que pagar por uso, y lo decimos aunque nos quite el proyecto. Por encima, el coste deja de crecer con el uso y la diferencia se hace grande rápido.

El despliegue va descrito como código —Docker Compose, Terraform, GitHub Actions— para que lo puedas volver a levantar tú el día que dejemos de estar. Un sistema que solo sabe arrancar quien lo montó no es una entrega, es una dependencia.

Y entra aquí también lo que hace que la factura no se dispare: la puerta única por la que pasa toda tu IA, con enrutado por coste y sensibilidad, caché semántica y topes de gasto con corte automático.

~/aitactica $ ver rack.webp
Bandejas de un armario de servidores vistas desde arriba
Tu servidor, tu sala, tu dato. Sin billete de salida.
servicios
9
se quedan dentro
7
cruzan a un tercero
1
según arquitectura
1

Lo que se pregunta antes de contratar este nivel

+¿A partir de cuántas consultas compensa montar un modelo en mi servidor?

Depende del tipo de tarea, y cada ficha con este modelo de coste publica su punto de cruce calculado. Como orden de magnitud, por debajo de unas 15.000 operaciones al mes sale más barato pagar por uso. La inversión inicial en hardware es lo que hay que amortizar; a partir de ahí el coste es plano y no sube aunque dupliques el volumen.

+¿Qué GPU necesito de verdad?

Menos de la que suele venderse. Se decide midiendo: se prueba el modelo con tus casos reales, con distintas cuantizaciones, y se anota peticiones por segundo, latencia y uso real de memoria. El informe sale con números, no con impresiones — y en bastantes casos concluye que tu hardware actual aguanta.

+¿Qué pasa si os vais? ¿Puedo mantenerlo yo?

Es el objetivo declarado. Todo va descrito como código en tu repositorio, con runbook de incidencias y una sesión de traspaso. Si la única razón para renovar con nosotros fuera que nadie más entiende el sistema, lo habríamos montado mal.

¿Este nivel es el que necesitas?

Casi nunca se contrata un nivel entero. Cuéntanos el proceso concreto y te decimos cuál de los 49 servicios lo resuelve — o si no hace falta ninguno.