Recorrido

Pipeline

10 pasos, en el orden real en que se construyó el proyecto — no agrupados por tema. Cada uno es un zoom sobre la parte del diagrama de arquitectura que le corresponde, con las herramientas que entraron en ese momento y por qué. La arquitectura completa se explica aparte, en Arquitectura.

  1. 1Datos crudosRaw data → tabla listings limpia. El embudo real de 12,164 a 6,811 filas, y por qué cada corte.
  2. 2Featuresdistrict_avg_price_per_m2 con leave-one-out suavizado, y el catálogo feature_metadata.
  3. 3Baseline modelXGBoost sin infraestructura todavía — confirmar que el problema es viable, y el overfitting real que apareció después.
  4. 4Infra corePostgres, Redis, MLflow y Feast en Docker Compose — versiones, decisiones, y el bug real de artifacts de MLflow.
  5. 5Feature storeFeast: offline store en Postgres, online store en Redis, point-in-time correctness.
  6. 6Modelo definitivoLeyendo desde Feast — el leakage real que se encontró y se sacó, registro en MLflow, export a ONNX.
  7. 7API de inferenciaNode.js/Fastify sirviendo el modelo ONNX, trazabilidad de cada predicción.
  8. 8MonitoreoPrometheus para métricas de servicio, Evidently para drift de datos — dos herramientas, dos preguntas distintas.
  9. 9DashboardNext.js junta todo en un solo lugar — único punto de entrada del navegador.
  10. 10Drift real2020 vs. hoy: la receta para comparar el modelo contra el mercado actual — y lo que quedó pendiente por tiempo.