serviciosia

¿Con qué sirvo un modelo en mi propio servidor?

Ollama vs vLLM vs SGLang vs llama.cpp

Los cuatro ejecutan el mismo modelo. La diferencia es cuánta gente lo usa a la vez y cuánto duele mantenerlo.

Todos sirven modelos de pesos abiertos y todos exponen una API compatible con OpenAI, así que cambiar de uno a otro no obliga a tocar la aplicación. Eso quita presión a la decisión: no es un matrimonio.

La diferencia real está en el rendimiento con varios usuarios a la vez. Con una persona probando, los cuatro van bien. Con veinte personas simultáneas, tres de ellos se caen y uno aguanta.

Las opciones

Cara a cara

Comparación de Ollama, vLLM, SGLang, llama.cpp por 7 criterios
CriterioOllamavLLMSGLangllama.cpp
Tu datoNo saleNo saleNo saleNo sale
Facilidad de montajeMuy altaMediaMediaMedia
Usuarios simultáneosPocosMuchosMuchosPocos
Necesita GPURecomendableNo
API compatible OpenAI
MantenimientoCasi nuloRequiere atenciónRequiere atenciónBajo
Dónde brillaEquipo internoProducciónLotes y esquemasHardware limitado

Qué elegiríamos nosotros

Ollama para empezar y para uso interno; en la mayoría de las pymes no hace falta nada más y su coste de mantenimiento es casi cero. vLLM cuando el sistema atienda a usuarios de verdad y la latencia importe. SGLang si tu carga es por lotes o con salidas estructuradas. llama.cpp cuando el hierro es el que es y no va a cambiar. Como la API es la misma, se puede empezar por Ollama y migrar el día que haga falta.

Cuándo no elegir ninguna

Si vas a hacer menos de unas 15.000 consultas al mes, servir tu propio modelo no compensa: sale más barato pagar por uso. La cifra exacta para tu caso está calculada en la ficha de IA local.

¿Y en tu caso concreto?

Ninguna comparativa sabe cuántos usuarios tienes, qué dato mueves ni quién lo va a mantener. Cuéntanoslo y te decimos cuál de estas —o ninguna.