¿Con qué sirvo un modelo en mi propio servidor?
Ollama vs vLLM vs SGLang vs llama.cpp
Los cuatro ejecutan el mismo modelo. La diferencia es cuánta gente lo usa a la vez y cuánto duele mantenerlo.
Todos sirven modelos de pesos abiertos y todos exponen una API compatible con OpenAI, así que cambiar de uno a otro no obliga a tocar la aplicación. Eso quita presión a la decisión: no es un matrimonio.
La diferencia real está en el rendimiento con varios usuarios a la vez. Con una persona probando, los cuatro van bien. Con veinte personas simultáneas, tres de ellos se caen y uno aguanta.
Las opciones
Ollama
La forma más sencilla de tener un modelo corriendo hoy
Tu dato: Depende del motor que le pongas
- Cuándo gana
- Equipos pequeños, prototipos y despliegues internos con pocos usuarios simultáneos. Se instala en diez minutos y se mantiene solo.
- Cuándo pierde
- Con concurrencia alta se atasca: no fue diseñado para exprimir la GPU con muchas peticiones a la vez.
vLLM
El motor de referencia para servir en producción con concurrencia
Tu dato: No sale de tu casa
- Cuándo gana
- Cuando hay usuarios simultáneos de verdad. Su gestión de memoria multiplica las peticiones por segundo sobre el mismo hardware.
- Cuándo pierde
- Más piezas que configurar y más sensible a la versión de CUDA. Necesita a alguien que lo cuide.
SGLang
Alternativa a vLLM, muy fuerte en lotes y en respuestas estructuradas
Tu dato: No sale de tu casa
- Cuándo gana
- Cargas por lotes, salidas con esquema estricto y flujos con mucho contexto compartido entre peticiones.
- Cuándo pierde
- Comunidad más pequeña que vLLM: menos respuestas cuando algo se rompe a las dos de la mañana.
llama.cpp
Ejecuta modelos en hardware modesto, incluso sin GPU
Tu dato: No sale de tu casa
- Cuándo gana
- Portátiles, mini-PC, servidores sin tarjeta gráfica y despliegues en el borde. Cuantizaciones agresivas que caben donde no cabe nada más.
- Cuándo pierde
- Rendimiento por debajo de los anteriores cuando sí hay GPU decente disponible.
Cara a cara
| Criterio | Ollama | vLLM | SGLang | llama.cpp |
|---|---|---|---|---|
| Tu dato | No sale | No sale | No sale | No sale |
| Facilidad de montaje | Muy alta | Media | Media | Media |
| Usuarios simultáneos | Pocos | Muchos | Muchos | Pocos |
| Necesita GPU | Recomendable | Sí | Sí | No |
| API compatible OpenAI | Sí | Sí | Sí | Sí |
| Mantenimiento | Casi nulo | Requiere atención | Requiere atención | Bajo |
| Dónde brilla | Equipo interno | Producción | Lotes y esquemas | Hardware limitado |
Qué elegiríamos nosotros
Ollama para empezar y para uso interno; en la mayoría de las pymes no hace falta nada más y su coste de mantenimiento es casi cero. vLLM cuando el sistema atienda a usuarios de verdad y la latencia importe. SGLang si tu carga es por lotes o con salidas estructuradas. llama.cpp cuando el hierro es el que es y no va a cambiar. Como la API es la misma, se puede empezar por Ollama y migrar el día que haga falta.
Cuándo no elegir ninguna
Si vas a hacer menos de unas 15.000 consultas al mes, servir tu propio modelo no compensa: sale más barato pagar por uso. La cifra exacta para tu caso está calculada en la ficha de IA local.
¿Y en tu caso concreto?
Ninguna comparativa sabe cuántos usuarios tienes, qué dato mueves ni quién lo va a mantener. Cuéntanoslo y te decimos cuál de estas —o ninguna.