Mauro Loprete
  • Inicio
  • Experiencia
  • Docencia
  • Proyectos
  • Certificaciones
  • Blog
  • Slides
Categorías
Todas (31)
AI Agents (1)
Book Review (2)
Carrera (1)
Data Architecture (6)
Data Engineering (26)
Databricks Tips (22)
DataOps (1)
Delta Lake (4)
Developer Tools (1)
DevOps (1)
Feature Engineering (1)
Machine Learning (2)
MLflow (1)
MLOps (5)
Open Source (1)
Podcast (8)
Serverless (1)
Streaming (3)
Unity Catalog (2)

Blog

Tips avanzados de Databricks, reseñas de libros de Data Engineering, y episodios del podcast Spark de Ideas. Contenido en español para ingenieros de datos.

Databricks Tips #16: Data Quality — expectations dinámicas, cuarentena y DQX
Databricks Tips
Data Engineering

Warn es el default y no filtra nada: cómo pasar de checks sueltos a un sistema de calidad en Databricks, con reglas cargadas dinámicamente desde una tabla Delta, cuarentena…

5 ago 2026

Databricks Tips #15: Query Federation — consultar Postgres y MySQL sin mover datos
Databricks Tips
Data Architecture

Cómo consultar Postgres y MySQL desde Databricks sin mover datos: connection y foreign catalog en Unity Catalog, qué parte de la query se empuja a la base origen y cómo…

18 jul 2026

Databricks Tips #14: Liquid Clustering — el reemplazo de particiones y Z-ORDER
Databricks Tips
Delta Lake

Qué es Liquid Clustering, por qué reemplaza al particionado y a Z-ORDER, la sintaxis de CLUSTER BY (incluido AUTO), cómo se dispara con OPTIMIZE, y un lab reproducible donde…

10 jul 2026

Databricks Tips #13: OpenSharing — compartir sin copiar
Databricks Tips
Data Engineering
Delta Lake

Qué hereda OpenSharing de Delta Sharing y qué agrega: zero-copy real, shares a clientes Iceberg como Snowflake y Trino, modelos y agent skills como assets compartibles…

7 jul 2026

Databricks Tips #12: Photon — el motor C++ que acelera tus queries sin cambiar código
Databricks Tips
Data Engineering

Qué es el motor vectorizado de Databricks, dónde corre, qué acelera y qué no, cómo medir cuánto Photon usa tu query, un benchmark con/sin Photon y la cuenta de cuándo el DBU…

2 jul 2026

De YAML a producción: deploy de AI Agents con Declarative Automation Bundles
Databricks Tips
Data Engineering
MLOps

Cómo deployar un agente RAG completo con memoria, guardrails y CI/CD usando un solo databricks.yml — con código real, paso a paso.

27 jun 2026

Genie ZeroOps: Databricks quiere que tus pipelines se arreglen solos
Data Engineering
Databricks Tips
MLOps

Detect, Assess, Remediate, Verify — cómo funciona el agente de Databricks que monitorea, diagnostica y propone fixes para tus pipelines en producción.

27 jun 2026

El mapa de GitHub de Databricks: repos que tenés que conocer
Data Engineering
Databricks Tips

Guía curada de los repositorios más útiles del ecosistema Databricks en GitHub: desde las cuatro orgs oficiales hasta herramientas de la comunidad y MVPs. Con contexto de…

21 jun 2026

LTAP: Databricks quiere eliminar el ETL entre tu base y tu warehouse
Data Engineering
Data Architecture
Databricks Tips

LTAP unifica OLTP y OLAP en una sola copia de datos sobre Delta e Iceberg. Qué es, cómo funciona, en qué se diferencia de HTAP y Zero ETL, y un ejemplo concreto de cómo…

19 jun 2026

DAIS 2026 Día 3: Genie Code for ML, Lakeflow Designer y Nadella x Ghodsi
Data Engineering
Databricks Tips
MLOps

Genie Code se especializa en ML engineering, Lakeflow Designer sale de preview, AI Runtime suma multi-node training, y Nadella graba un fireside chat con Ghodsi. Resumen del…

17 jun 2026

DAIS 2026: todo lo que Databricks anunció (y lo que significa para tu stack)
Data Engineering
Data Architecture
Databricks Tips
MLOps

Lakehouse//RT, LTAP, Genie One, CustomerLake, Lakewatch, OpenSharing y más. Resumen completo del Data + AI Summit 2026 desde la virtualidad, con links a cada anuncio.

16 jun 2026

Omnigent: el meta-harness open source para orquestar todos tus agentes AI
AI Agents
Developer Tools
Open Source

Compose, govern y share: Omnigent es la capa que falta arriba de Claude Code, Codex y Pi. Instalación, configuración YAML, policies y prueba real.

14 jun 2026

Databricks Tips #11: Lakeflow Declarative Pipelines (ex DLT) — pipelines declarativos con calidad built-in
Databricks Tips
Data Engineering
Streaming

Streaming tables, materialized views, expectations, AUTO CDC con SCD Type 1/2, modos triggered vs continuous, serverless y los gotchas que no están en el tutorial.

11 jun 2026

Databricks Tips #10: Unity AI Gateway — governance centralizada para LLMs en producción
Databricks Tips
Data Engineering
MLOps

Rate limiting, guardrails, usage tracking, cost attribution, fallbacks y traffic splitting. Todo lo que necesitás para gobernar LLMs en tu organización.

9 jun 2026

Databricks Tips #9: SQL Warehouses — el compute que se prende solo
Databricks Tips
Data Engineering
Serverless

Classic, Pro o Serverless: cuál elegir, cómo dimensionarlo y qué gotchas te van a ahorrar plata. Con Photon, Query Federation, AI Functions y costos reales.

6 jun 2026

Databricks Tips #8: Jobs & Workflows — streaming y triggers que arrancan solos
Databricks Tips
Data Engineering
Streaming

File arrival triggers, table update triggers, Trigger.AvailableNow, Job Clusters y las limitaciones que no están en el tutorial.

4 jun 2026

Databricks Tips #7: Docker en Databricks — contenedores custom para entornos que no se rompen
Databricks Tips
Data Engineering
Delta Lake

Databricks Container Services, imágenes custom, golden containers, CI/CD con Docker y los errores que te van a hacer perder horas.

30 may 2026

Data Mesh en la práctica: lo que funciona, lo que no, y lo que nadie te dice
Data Architecture
Data Engineering
Podcast

Data Mesh más allá del hype. Los 4 principios, implementación real con Unity Catalog, y por qué la mayoría de las empresas lo implementan mal.

21 abr 2026

Data Contracts: cómo diseñar un framework desde cero
Data Architecture
Data Engineering
Podcast

Qué son los Data Contracts, por qué los necesitás, y cómo implementé un framework en producción con Databricks y PySpark.

14 abr 2026

Medallion vs Data Vault vs Kimball: cuándo usar cada uno y por qué importa
Data Architecture
Data Engineering
Podcast

Comparativa práctica de los tres modelos de datos más usados en la industria. Con ejemplos reales, trade-offs y una guía para elegir.

7 abr 2026

Databricks Tips #6: Feature Engineering — diseñar features que sobrevivan a producción
Databricks Tips
Machine Learning
Feature Engineering

Feature Store, point-in-time lookups, online features, feature freshness y los errores clásicos de data leakage.

31 mar 2026

Databricks Tips #5: MLflow + Unity Catalog — del experimento al modelo en producción
Databricks Tips
Machine Learning
MLflow
Unity Catalog

Registro de modelos en UC, aliases en vez de stages, linaje de datos a modelo, y model serving con AI Gateway.

24 mar 2026

Databricks Tips #4: Structured Streaming — watermarks, triggers y las trampas del micro-batch
Databricks Tips
Data Engineering
Streaming

Trigger modes, watermarks, foreachBatch, Auto Loader y las trampas que te hacen perder datos o plata.

17 mar 2026

Databricks Tips #3: Unity Catalog — el modelo de gobernanza que nadie implementa bien
Databricks Tips
Data Engineering
Unity Catalog

Namespace de 3 niveles, GRANTS heredados, linaje automático, row/column security y errores comunes de gobernanza.

10 mar 2026

Databricks Tips #2: 7 cosas de Delta Lake que ojalá me hubieran dicho antes
Databricks Tips
Data Engineering
Delta Lake

Liquid clustering, OPTIMIZE, Z-ORDER, vacuum, time travel y trucos que cambian cómo trabajás con Delta.

3 mar 2026

Databricks Tips #1: Databricks Asset Bundles — lo que no te cuentan en la documentación
Databricks Tips
Data Engineering
DevOps

Casos avanzados, patrones de deployment, variables complejas y trucos que descubrí laburando con DABs en producción.

24 feb 2026

Si empezara de cero… qué priorizaría aprender en Data Engineering
Podcast
Data Engineering
Carrera

Python, SQL, Spark, dbt, Databricks — el orden importa. Lo que aprendí después de años laburando con datos y lo que haría distinto si volviera a empezar.

17 feb 2026

Data Engineering Design Patterns: 8 patrones de ingesta que tenés que conocer
Podcast
Data Engineering
Book Review

Los 8 patrones de ingesta del libro de Bartosz Konieczny. Ejemplos en PySpark/SQL y cómo mapean a la arquitectura Medallion.

15 sept 2025

DataOps: cómo llevar tus pipelines al siguiente nivel
Podcast
Data Engineering
DataOps

Qué es DataOps de verdad, en qué se diferencia de DevOps, los tres pilares (automatización, observabilidad, colaboración) y errores comunes en producción.

1 sept 2025

Fundamentals of Data Engineering: las bases que todo ingeniero de datos necesita conocer
Podcast
Data Engineering
Book Review

Review del libro de Joe Reis y Matt Housley (O’Reilly, 2da ed.). Ciclo de vida del dato, arquitecturas clave, undercurrents y qué cambió en esta edición.

26 ago 2025

Spark de Ideas: la chispa de la ingeniería de datos en español
Podcast
Data Engineering

Por qué hace falta un podcast de Data Engineering en español. Databricks, arquitectura de datos, MLOps y carrera — desde la región, para la región.

18 ago 2025
No hay resultados

    Sitio hecho con Quarto, por Mauro Loprete. Licencia: CC BY-SA 2.0.