Ingeniería de datos y cuadros de mando
Reunir en un sitio lo que hoy está en seis, y que el número del informe sea el mismo para todos
Con liberar 11,0 horas a la semana, ya está pagado.
El dato de ventas está en el CRM, el de facturación en el ERP, el de la web en una hoja que actualiza alguien los lunes y el de producción en un programa de 2009. Cada reunión empieza discutiendo cuál de las tres cifras es la buena. Y sin esto resuelto, cualquier proyecto de IA que dependa de esos datos hereda el problema y lo amplifica.
Qué hacemos
Montamos los procesos de carga que traen cada fuente a un mismo sitio, con horario, reintentos y aviso cuando una carga falla — que es lo que separa un almacén vivo de una copia que se quedó parada en marzo.
Definimos las métricas una sola vez, en código y versionadas con dbt: qué es un cliente activo, qué cuenta como venta, cuándo se imputa un ingreso. A partir de ahí, todos los informes salen del mismo sitio y la reunión deja de empezar con una discusión.
Ponemos reglas de calidad que fallan de verdad: si llegan facturas con importe negativo o el número de pedidos cae un 90% de un día para otro, el proceso para y avisa en vez de escribir basura y seguir.
Y encima, los cuadros de mando que hacen falta, con acceso por rol. Sobre esta base, preguntar a tus datos en lenguaje natural (SRV-10) empieza a funcionar de verdad: sin ella, un modelo consulta datos sucios y contesta con seguridad cosas falsas.
Cómo funciona
Dónde vive el dato
Retorno de la inversión
Con liberar 11,0 horas a la semana, ya está pagado.
En un caso típico libera unas 28 h al mes, por encima de ese listón.
- Coste actual del proceso
- 2030 € /mes
- Horas liberadas al mes
- 28 h
- Inversión de implantación
- 17.500 €
- Operación
- 210 € /mes
- Ahorro neto
- 785 € /mes
- Punto de equilibrio
- 23 meses
- Resultado a 12 meses
- -8084 €
Supuestos de este cálculo (4)
- 58 h/mes es lo que consume preparar informes a mano cruzando hojas de cálculo en una empresa mediana
- No contabiliza el coste de decidir mal por usar una cifra equivocada, que es el caro de verdad
- El alcance típico son de tres a seis fuentes; cada fuente adicional suma al proyecto
- Es el cimiento de SRV-10: sin datos ordenados, preguntar en lenguaje natural devuelve respuestas seguras y falsas
Qué incluye
- Inventario de fuentes con su dueño, su frecuencia y su nivel de fiabilidad
- Procesos de carga programados con reintentos y aviso de fallo
- Almacén analítico separado de los sistemas de producción
- Métricas definidas una vez en código, versionadas y documentadas
- Reglas de calidad que detienen el proceso en vez de propagar el error
- Cuadros de mando con acceso por rol y actualización automática
- Diccionario de datos: qué significa cada campo y de dónde sale
Con qué lo montamos
No trabajamos con una sola herramienta ni te casamos con ninguna. Esto es lo que solemos usar para este servicio y para qué sirve cada pieza — si ya tienes algo montado, partimos de ahí.
- Airbytelas cargas desde cada fuente, con reintentos
- dbtlas métricas definidas una vez, versionadas
- PostgreSQL / ClickHouseel almacén analítico, en tu servidor
- DuckDBanálisis local rápido sin levantar infraestructura
- Dagster / Airfloworquestación con horario, dependencias y aviso
- Great Expectationsreglas de calidad que detienen el proceso
- Metabaselos cuadros de mando, con acceso por rol
- Apache Kafkacuando hace falta que el dato llegue al momento
Cada una de estas piezas está catalogada en el stack, con lo importante: si se ejecuta dentro de tu empresa o si al meterla tu dato empieza a viajar.
Con qué motor lo movemos
Preferimos montarlo dentro de tu red, con un modelo abierto en tu propio servidor: es la única forma de que el dato no dependa de las condiciones de un tercero. Cuando eso no encaja — por presupuesto o porque no hace falta — trabajamos con modelos low cost adaptados a lo que puedas gastar, o con modelos frontera si la tarea lo pide. Para este servicio proponemos la capa marcada, pero se cambia sin rehacer el trabajo.
En tu servidor
Lo que proponemos aquí
El dato no sale. Es lo que preferimos.
- Cuándo
- Historiales, expedientes, nóminas, contratos, datos de salud, sector público — o cualquier cosa que no puedas explicar en una auditoría si acaba fuera.
- Tu dato
- No cruza el límite de tu empresa. Ni tu proveedor de nube ni nosotros vemos el contenido.
- Cómo se paga
- Inversión inicial en hardware y después coste plano: no sube aunque dupliques el uso.
- LlamaMeta · pesos abiertos
- QwenAlibaba · pesos abiertos
- DeepSeekChina · pesos abiertos
- MistralFrancia · pesos abiertos
- GemmaGoogle · pesos abiertos
- gpt-ossOpenAI · pesos abiertos
API de bajo coste
Potencia de sobra por céntimos.
- Cuándo
- Cuando el dato puede salir y lo que manda es el volumen: clasificar, extraer, traducir, resumir, etiquetar. Miles de operaciones al mes donde lo que cuenta es el precio por unidad.
- Tu dato
- Sale al proveedor que elijas. Te decimos cuál, en qué país están sus servidores y qué dicen sus condiciones de empresa sobre entrenar con lo que les mandas.
- Cómo se paga
- Céntimos por millón de palabras. Es la capa que hace viables los volúmenes grandes sin comprar una máquina.
- Kimi K2Moonshot · China
- DeepSeekChina
- MistralFrancia · Europa
- Gemini FlashGoogle · EE. UU.
- GrokxAI · EE. UU.
- GPT miniOpenAI · EE. UU.
Modelos frontera
Cuando el trabajo es difícil de verdad.
- Cuándo
- Razonamiento largo, código, análisis jurídico o financiero, agentes que encadenan veinte pasos sin que nadie mire. Donde una respuesta mediocre cuesta más de lo que cuesta el modelo.
- Tu dato
- Sale al proveedor. Leemos sus condiciones de empresa y te las resumimos por escrito antes de firmar nada.
- Cómo se paga
- El precio por palabra más alto del mercado — y a menudo el coste por tarea resuelta más bajo, porque acierta a la primera y no hay que revisarlo.
- Claude Opus 5Anthropic · EE. UU.
- GPT-5OpenAI · EE. UU.
- Gemini ProGoogle · EE. UU.
En la práctica casi nunca es uno solo
Lo normal es enrutar: el modelo barato se come el 90% del volumen y solo lo que de verdad es difícil sube al modelo frontera. Si además hay dato sensible, esa parte se queda en el servidor local y nunca entra en el enrutado. Se factura la mezcla, no el modelo más caro — y ahí es donde una factura de IA se divide entre tres o entre diez.
Cómo elegimos el motor, en detalle →Qué necesitamos de ti
- Acceso de lectura a cada fuente que entre en el alcance
- Alguien de negocio que pueda cerrar las definiciones de las métricas
- Los informes que se usan hoy, para no perder nada por el camino
Plazo típico: 6 a 12 semanas según el número de fuentes
Lo que sueles preguntarte
¿Cuánto tarda en estar funcionando?
6 a 12 semanas según el número de fuentes, contando desde que tenemos los accesos. El plazo exacto va en la propuesta, no lo dejamos abierto.
¿Salen mis datos de la empresa?
No. Todo el procesado ocurre dentro de tu red y ni tu proveedor de nube ni nosotros vemos el contenido.
¿Con qué modelo de IA lo montáis?
Por defecto lo movemos con un modelo abierto en tu propio servidor, porque aquí el dato no debería salir. Si prefieres API, se cambia — y entonces te decimos exactamente qué sale. Preferimos la seguridad del dato y montar red y sistemas en local, pero trabajamos con las tres capas: modelos abiertos en tu propio servidor, LLM de bajo coste adaptados al presupuesto —chinos como Kimi K2 o DeepSeek, europeos como Mistral, estadounidenses como Gemini o Grok— y modelos frontera como Claude Opus 5 o GPT-5. El motor se cambia en la configuración sin rehacer el trabajo.
¿Cuánto tiene que funcionar para que me salga a cuenta?
Con liberar 11,0 horas a la semana, ya está pagado. En un caso típico libera unas 28 h al mes, por encima de ese listón. Los supuestos del cálculo están publicados en esta misma página, para que puedas discutirlos.
¿Qué necesitáis de mi parte?
Acceso de lectura a cada fuente que entre en el alcance; Alguien de negocio que pueda cerrar las definiciones de las métricas; Los informes que se usan hoy, para no perder nada por el camino. Nada más: el resto del trabajo es nuestro.
¿Cuándo NO me conviene contratarlo?
Si toda tu operación cabe en un ERP que ya saca los informes que necesitas, no montes un almacén: estarías duplicando el dato para complicártelo. Esto empieza a compensar a partir de tres o cuatro fuentes que no se hablan entre sí.
¿Puedo mantenerlo yo después, sin vosotros?
Sí. Todo lo que montamos se entrega documentado y con traspaso al equipo. No trabajamos con cajas negras.
¿Necesito esto antes de hacer nada de IA?
No siempre. Un asistente sobre documentación o una extracción de facturas no lo necesitan. Lo necesitas cuando la IA tenga que responder con cifras de negocio: ahí, si los datos están sucios, el modelo no lo nota y contesta con total seguridad un número equivocado. Es peor que no tener nada.
¿Por qué no lo montáis directamente en BigQuery o Snowflake?
Porque para el volumen de una pyme suelen ser un cañón para matar moscas, con una factura que crece con cada consulta. PostgreSQL o ClickHouse en tu servidor aguantan mucho más de lo que la gente cree y el coste es plano. Si tus volúmenes justifican un almacén en la nube, te lo diremos y lo montamos ahí.
¿Quién decide qué es un «cliente activo»?
Vosotros, y ese es el trabajo incómodo del proyecto. Nuestra parte técnica es fácil; la difícil es sentar a ventas y a administración a acordar una definición. Lo que aportamos es que, una vez acordada, se escribe en código una sola vez y ya nadie puede calcularla distinto en su hoja.
¿Encaja con lo que necesitas?
Cuéntanos el proceso concreto y te decimos si este servicio es el que te conviene — o cuál de los otros 48 lo es.