Las cinco etapas de un proyecto
Un proyecto típico dura entre ocho y catorce semanas. Los plazos varían según la complejidad del problema y el estado de los datos.
Consulta inicial y definición del problema
Nos reunimos con tu equipo durante una o dos sesiones de 90 minutos. El objetivo es entender el problema de negocio en detalle: qué decisión quieres mejorar, qué datos existen y dónde están almacenados. Al final de esta etapa entregamos un documento de alcance con métricas de éxito concretas. Por ejemplo, si el proyecto busca reducir devoluciones, definimos el porcentaje base actual y el objetivo realista.
Esta consulta es gratuita. Si después de revisarla concluimos que el proyecto no es viable con los datos disponibles, te lo decimos directamente y no cobramos nada.
Auditoría de datos
Nuestro equipo accede a tus fuentes de datos (bases SQL, archivos CSV, APIs internas, hojas de cálculo) y evalúa la calidad: registros faltantes, formatos inconsistentes, sesgos evidentes. Esta fase dura entre tres y cinco días laborables.
Producimos un informe con gráficos de distribución, correlaciones relevantes y una recomendación clara: seguir adelante, limpiar ciertos campos primero o recolectar datos adicionales antes de construir el modelo. Si la limpieza es menor, la hacemos nosotros. Si implica cambios en tus sistemas de captura, te ayudamos a especificar qué ajustes necesitas.
Desarrollo y entrenamiento del modelo
Seleccionamos la arquitectura adecuada según el tipo de problema. Para predicción tabular solemos usar gradient boosting (XGBoost o LightGBM). Para texto, modelos transformer ajustados. Para imágenes, redes convolucionales o modelos preentrenados como YOLO.
Entrenamos varias versiones y las comparamos con validación cruzada. Cada semana enviamos un informe de progreso con las métricas actualizadas: precisión, recall, F1 o la métrica que hayamos acordado. No esperamos a tener el modelo perfecto para mostrarte resultados; preferimos iterar contigo.
Despliegue en producción
El modelo final se empaqueta como una API REST o se integra directamente en tu sistema existente. Configuramos monitoreo automático: si la precisión del modelo baja de un umbral, recibimos una alerta y tú también.
Documentamos todo: endpoints, formato de entrada y salida, tiempos de respuesta esperados y procedimiento para reentrenar. Tu equipo técnico recibe una sesión de transferencia de conocimiento de dos horas donde explicamos cómo funciona internamente el modelo y cómo interpretar sus predicciones.
Soporte y reentrenamiento
Durante los tres primeros meses después del despliegue, monitoreamos el rendimiento del modelo sin costo adicional. Si los datos cambian (por ejemplo, un nuevo producto entra al catálogo), reentrenamos el modelo con datos frescos.
Después de ese periodo, ofrecemos contratos de mantenimiento mensual que incluyen reentrenamiento programado, ajustes de hiperparámetros y soporte técnico por correo y videollamada. El 70 % de nuestros clientes opta por este plan porque prefieren no depender de su equipo interno para mantener el modelo actualizado.
Qué herramientas usamos
Trabajamos con Python como lenguaje principal. Las bibliotecas más frecuentes en nuestros proyectos son scikit-learn, PyTorch, Hugging Face Transformers y OpenCV. Para orquestación de pipelines usamos Airflow o Prefect, según la infraestructura del cliente.
Los modelos se despliegan en contenedores Docker sobre Kubernetes o directamente en servicios gestionados como AWS SageMaker o Google Vertex AI. Si tu empresa tiene restricciones de soberanía de datos, configuramos todo en servidores locales en Colombia.
Para el versionado de modelos usamos MLflow. Cada experimento queda registrado con sus hiperparámetros, métricas y artefactos, así que podemos volver a cualquier versión anterior en minutos si es necesario.
Preguntas frecuentes sobre el proceso
Las dudas más comunes que recibimos antes de comenzar un proyecto.
No es imprescindible. Nos adaptamos a tu situación. Si tienes desarrolladores, colaboramos con ellos durante el despliegue. Si no los tienes, nos encargamos de toda la parte técnica y te entregamos el sistema funcionando con documentación clara para que cualquier persona con conocimientos básicos pueda operarlo.
Depende del problema. Para un modelo de predicción tabular, generalmente necesitamos al menos 5 000 registros históricos con la variable que queremos predecir. Para visión por computadora, entre 500 y 2 000 imágenes etiquetadas suelen ser suficientes para un primer prototipo funcional. En la auditoría de datos evaluamos si lo que tienes alcanza.
Lo hemos vivido en tres ocasiones. En dos de ellas, el problema era la calidad de los datos de entrada, y lo resolvimos mejorando el pipeline de limpieza. En la tercera, el problema resultó no ser predecible con los datos disponibles y lo comunicamos abiertamente. No cobramos por un modelo que no cumple lo acordado.
Sí. El modelo, el código de entrenamiento y toda la documentación son tuyos. Usamos licencias de código abierto siempre que es posible para que no dependas de nosotros para seguir operando. El contrato de mantenimiento es opcional, no obligatorio.
Un proyecto de ocho semanas con un modelo predictivo y despliegue en producción suele costar entre 18 y 35 millones de pesos colombianos, dependiendo de la complejidad. Proyectos de visión por computadora con hardware dedicado pueden ser más costosos por el componente de infraestructura. Siempre entregamos un presupuesto cerrado antes de empezar.