Recorrido
Pipeline
10 pasos, en el orden real en que se construyó el proyecto — no agrupados por tema. Cada uno es un zoom sobre la parte del diagrama de arquitectura que le corresponde, con las herramientas que entraron en ese momento y por qué. La arquitectura completa se explica aparte, en Arquitectura.
- 1Datos crudosRaw data → tabla listings limpia. El embudo real de 12,164 a 6,811 filas, y por qué cada corte.
- 2Featuresdistrict_avg_price_per_m2 con leave-one-out suavizado, y el catálogo feature_metadata.
- 3Baseline modelXGBoost sin infraestructura todavía — confirmar que el problema es viable, y el overfitting real que apareció después.
- 4Infra corePostgres, Redis, MLflow y Feast en Docker Compose — versiones, decisiones, y el bug real de artifacts de MLflow.
- 5Feature storeFeast: offline store en Postgres, online store en Redis, point-in-time correctness.
- 6Modelo definitivoLeyendo desde Feast — el leakage real que se encontró y se sacó, registro en MLflow, export a ONNX.
- 7API de inferenciaNode.js/Fastify sirviendo el modelo ONNX, trazabilidad de cada predicción.
- 8MonitoreoPrometheus para métricas de servicio, Evidently para drift de datos — dos herramientas, dos preguntas distintas.
- 9DashboardNext.js junta todo en un solo lugar — único punto de entrada del navegador.
- 10Drift real2020 vs. hoy: la receta para comparar el modelo contra el mercado actual — y lo que quedó pendiente por tiempo.