Proyectos
metasurvey — Procesamiento Reproducible de Encuestas
Paquete de R para integrar y analizar datos de encuestas de múltiples fuentes. Actualmente en revisión en rOpenSci. Provee un pipeline basado en pasos para el procesamiento reproducible de datos de encuestas, construido sobre el paquete survey para diseños muestrales complejos.
- Pipeline de pasos lazy (
step_compute,step_recode,step_rename,step_remove,step_join) que preserva los metadatos del diseño muestral a través de cada transformación. - Sistema de recetas para empaquetar pipelines de transformación en objetos portables y versionados con metadatos y seguimiento de dependencias.
- Transpilador de archivos
.dode STATA que convierte scripts de procesamiento institucional legacy en pipelines reproducibles de R. - API REST y explorador Shiny para publicar, descubrir y compartir recetas entre equipos de investigación.
- 90%+ de cobertura de tests, 25 viñetas (inglés y español), R CMD check con 0 errores/warnings.
Spark de Ideas — Blog & Podcast
Blog técnico y podcast en español sobre Databricks, Data Engineering, MLOps y arquitectura de datos. Incluye la serie Databricks Tips (9 posts y creciendo) con laboratorios prácticos que los lectores pueden ejecutar en su propio workspace.
- Blog construido con Quarto y publicado en GitHub Pages.
- Diagramas generados con R + ggplot2, código reproducible en cada post.
- Laboratorios prácticos deployables con Databricks Asset Bundles.
- Podcast en Spotify con episodios sobre libros, herramientas y carrera en datos.