El mapa de GitHub de Databricks: repos que tenés que conocer

Data Engineering
Databricks Tips
Guía curada de los repositorios más útiles del ecosistema Databricks en GitHub: desde las cuatro orgs oficiales hasta herramientas de la comunidad y MVPs. Con contexto de qué es cada cosa y cuándo te sirve.
Autor
Publicado

21 de junio de 2026

El ecosistema de Databricks se mueve rápido. Cada Data + AI Summit trae una avalancha de anuncios, y entre summit y summit aparecen repos nuevos que a veces resuelven problemas que venías peleando hace meses. El tema es que si no estás mirando activamente, te los perdés — y terminás reinventando la rueda o usando herramientas deprecadas.

¿Cómo se afronta esto sin volverse loco? No necesitás seguir todo. Lo que sí necesitás es saber dónde mirar y qué vale la pena. La buena noticia es que Databricks construye en abierto — sus repos de GitHub son la ventana más directa a lo que viene. Spark Declarative Pipelines, Lakebase, Omnigent — todo apareció primero en GitHub, antes que en cualquier blog corporativo o keynote. Seguir los repos correctos, seguir a los referentes que aportan a la comunidad, y probar las herramientas en tu propio entorno es la forma más práctica de estar actualizado sin depender de que alguien te lo cuente.

Databricks tiene más de 500 repos públicos, dispersos en cuatro organizaciones propias más varios proyectos open-source que viven en fundaciones independientes. Cada org tiene un propósito distinto, un nivel de soporte distinto, y si no sabés cuál es cuál, podés terminar usando en producción algo que es un experimento de un hackathon interno. Si alguna vez buscaste algo y terminaste en un repo deprecado de 2019, este post es para vos.

Armé esta guía curada organizando todo por tema y nivel de madurez. Podés leerla de corrido como un blog post — tiene contexto, reseñas y demos para cada herramienta — o usarla como fuente de consulta cuando necesites encontrar un repo para un problema puntual. No es un listado exhaustivo: es lo que yo considero más útil si laburás con Databricks día a día.

NotaTL;DR
  • Databricks tiene cuatro orgs propias en GitHub — todas mantenidas por empleados, pero con distinto rol: databricks (producto), databrickslabs (experimental), databricks-solutions (toolkits de campo), databricks-industry-solutions (soluciones finales por industria). Más proyectos OSS en fundaciones independientes.
  • Para desarrollo con coding agents (Claude Code, Cursor, Copilot): el AI Dev Kit es el repo más completo con 75+ herramientas.
  • Para Databricks Apps: AppKit es el SDK nuevo de React/Node.js con plugins para Genie, Lakebase, SQL y Files.
  • Para Data Engineering: dbt-databricks, terraform-provider-databricks, mlops-stacks y los bundles examples siguen siendo esenciales.
  • Los MVPs de la comunidad (MrPowers, Jacek Laskowski) mantienen herramientas que muchos equipos usan en producción sin saber que son community-driven.

Guía de colores

A lo largo del post, cada card tiene un borde de color que indica de qué organización viene:

databricks — Producto oficial

databrickslabs — Experimental

databricks-solutions — Field Engineering

databricks-industry-solutions — Soluciones por industria

OSS foundations — Linux Foundation / Apache

Comunidad — MVPs y terceros


Las organizaciones de Databricks en GitHub

Todas son de Databricks, pero no son lo mismo. Las cuatro organizaciones son propiedad de Databricks y están mantenidas por empleados — ninguna es comunidad externa. La diferencia está en quién dentro de Databricks las mantiene y con qué nivel de compromiso:

databricks Oficial

Equipo de producto. SDKs oficiales, CLI, drivers, conectores, material educativo. Soporte oficial con issues atendidos, versionado y SLAs.

databrickslabs Labs

Empleados, proyectos experimentales. Prototipos, herramientas incubadas, side projects internos. Best-effort, sin garantía. Algunos migran al producto.

databricks-solutions Solutions

Equipo de Field Engineering. Toolkits horizontales, templates de apps, integraciones con herramientas (AI Dev Kit, AppKit cookbook, Lakebase dev kit). Código de referencia para developers y platform engineers.

databricks-industry-solutions Industry

213 repos de soluciones finales por industria. Notebooks completos, pipelines end-to-end, datos de ejemplo. Más “soft” que las otras orgs — acá no hay SDKs ni CLIs, hay soluciones de negocio listas para clonar y adaptar: fraud detection para banca, demand forecasting para retail, imágenes médicas para salud. Es lo que Databricks llama Solution Accelerators.

¿Cuál es la diferencia entre las cuatro? databricks es el producto. databrickslabs son experimentos que pueden desaparecer. databricks-solutions son herramientas horizontales para developers. databricks-industry-solutions son soluciones verticales de negocio — el nivel más alto de abstracción, listas para presentarle a un stakeholder.

Además, hay una quinta categoría: proyectos que Databricks creó o impulsó pero que viven en organizaciones independientes bajo la Linux Foundation o Apache (delta-io, mlflow, unitycatalog, apache/spark). Estos tienen gobernanza comunitaria y son los más estables de todos.

ImportanteCuidado con repos deprecados

Varios repos históricos en databricks están archivados o deprecados: koalas (ahora es pyspark.pandas), spark-csv (integrado en Spark core), databricks-cli en Python (reemplazado por el CLI en Go). Si un README dice “deprecated”, creelo.


Developer Experience Oficial Solutions

Esta es la categoría que más creció en el último año. Databricks apostó fuerte a que puedas desarrollar desde tu editor favorito, con coding agents, y con un portal centralizado.

databricks-agent-skills

Stars Last Commit Contributors

El approach más liviano: skills que se instalan como archivos Markdown en tu agente de código. Auto-detecta qué agente tenés instalado y escribe los SKILL.md en la ubicación correcta. Incluye databricks-setup y databricks-doctor para diagnóstico.

databricks aitools install

cli

Stars Last Commit Go

El CLI moderno en Go que reemplazó al viejo CLI en Python. Es el core de Databricks Asset Bundles (DABs) — si usás DABs, ya lo tenés instalado.

databricks-sdk-py

Stars Last Commit Contributors

El SDK oficial. Reemplaza al viejo patrón de requests + token manual. Tipado, con retry logic, y compatible con toda la API REST.

databricks-vscode

Stars Last Commit

Para desarrollo local con conexión a clusters remotos. Incluye ejecución de notebooks, debugging, y autocompletado de catálogo.

DevHub

No es un repo, pero es el portal que nuclea todo. Templates, documentación de AppKit, setup guides. Si vas a construir algo sobre Databricks, empezá acá.


Databricks Apps Oficial Solutions

Databricks Apps es la plataforma para deployar aplicaciones web dentro del workspace, con autenticación, governance y networking resueltos.

databricks-apps-cookbook

Stars Last Commit

Snippets listos para copiar y pegar en tu Databricks App.

apx

Stars Last Commit

Toolkit para construir apps sobre Databricks.

app-templates

Stars Last Commit

Templates oficiales de Databricks para arrancar rápido.

claude-databricks-app-template

Stars Last Commit

Template de Databricks App nativa con Claude AI.

caspers

Stars Last Commit

Demo simulada de negocio completa: streaming, agentes AI, apps — todo deployable.


Databricks Lakebase Solutions

Lakebase es el Postgres serverless de Databricks que escribe directamente en Delta/Iceberg (la promesa de LTAP). El ecosistema de repos alrededor está creciendo rápido.

lakebase-fastapi-app

Stars Last Commit

App FastAPI con Lakebase como backend.

brickhouse-brands-demo

Stars Last Commit

Demo full-stack: React + FastAPI + Lakebase. Gestión de inventario deployable.


Agents & AI Oficial

lilac

Stars Last Commit

Curar y limpiar datasets para fine-tuning de LLMs.

judges

Stars Last Commit

Biblioteca de LLM judges para evaluación de modelos.

genai-cookbook

Stars Last Commit

Recetario de GenAI en Databricks: patrones, ejemplos, best practices.

databricks-ai-bridge

Stars Last Commit

Puente entre Databricks y frameworks de AI: LangChain, LlamaIndex.

megablocks

Stars Last Commit

Mixture-of-Experts para entrenamiento eficiente de LLMs.

Databricks compró MosaicML en 2023. Sus repos siguen activos y son los que se usan internamente para entrenar los foundation models de Databricks (DBRX, MPT).

llm-foundry

Stars Last Commit Contributors

Código de entrenamiento de foundation models. Acá está el código real que se usa para entrenar DBRX y los modelos que corren detrás de AI/BI Genie. Uno de los repos de entrenamiento de LLMs más completos en open source.

composer

Stars Last Commit

Framework de entrenamiento eficiente de modelos.

streaming

Stars Last Commit

Data loading optimizado para training de modelos.


Data Engineering & Platform Oficial

Estos son los repos que probablemente ya conocés si laburás con Databricks, pero vale la pena tenerlos juntos.

terraform-provider-databricks

Stars Last Commit Contributors

IaC para workspaces, clusters, jobs, Unity Catalog. Esencial para cualquier setup serio.

terraform-databricks-examples

Stars Last Commit

Templates Terraform multi-cloud (AWS, Azure, GCP).

terraform-databricks-sra

Stars Last Commit

Security Reference Architecture. Best practices de seguridad con Terraform.

mlops-stacks

Stars Last Commit

Template de producción MLOps con DABs y CI/CD. El mejor punto de partida si arrancás un proyecto de cero.

dbt-databricks

Stars Last Commit

Adaptador dbt oficial para Databricks.

bundle-examples

Stars Last Commit

Ejemplos de Databricks Asset Bundles. Templates para jobs, pipelines, MLOps.

delta-live-tables-notebooks

Stars Last Commit

Notebooks de referencia para Delta Live Tables.

databricks-sql-python

Stars Last Commit

Conector SQL oficial para Python.

notebook-best-practices

Stars Last Commit

Patrones de ingeniería de software para notebooks Databricks.


Solution Accelerators por industria Industry

Esta es la org más “soft” de Databricks — y probablemente la menos conocida entre developers. Acá no vas a encontrar SDKs ni CLIs. Lo que hay son soluciones de negocio completas: notebooks con pipelines end-to-end, datos de ejemplo, y documentación orientada al caso de uso. Si tu jefe te dice “necesito esto para ayer”, estos repos son tu mejor amigo.

La org databricks-industry-solutions tiene 213 repos organizados por vertical. Los Solution Accelerators están pensados para clonarlos, adaptarlos a tus datos, y tener algo funcionando rápido. Databricks los lista en su catálogo oficial.

pixels — Imágenes médicas a escala

Stars Last Commit

El repo más popular de la org (418 stars). Procesamiento masivo de imágenes DICOM, documentos y ZIPs. Incluye integración con OHIF Viewer y modelos de segmentación. Si laburás con datos de salud, este es imprescindible.

smolder — HL7 como DataSource de Spark

Stars Last Commit

Datasource nativo de Spark para mensajes HL7 (el estándar de interoperabilidad en salud). Leés archivos HL7 como si fueran Parquet.

hls-llm-doc-qa — QA sobre documentos médicos

Stars Last Commit

RAG sobre documentación clínica con LLMs open-source. Un buen punto de partida si querés armar un asistente para profesionales de salud.

esg-scoring — Scoring ESG con NLP

Stars Last Commit

Finanzas sostenibles: analiza noticias con NLP para generar scores ESG automáticos. Pipeline completo de ingesta, procesamiento y scoring.

smart-claims — Gestión inteligente de reclamos

Stars Last Commit

Pipeline DLT para gestión de reclamos de seguros con detección de fraude. Incluye modelos ML y dashboards.

fine-grained-demand-forecasting — Demand forecasting distribuido

Stars Last Commit

Forecasting a nivel tienda-ítem con modelos distribuidos en Spark. El acelerador clásico para retail — uno de los más clonados.

product-search — Búsqueda semántica de productos

Stars Last Commit

Embeddings + vector store para búsqueda semántica en catálogos de productos. Ideal para e-commerce.

security-analysis-tool — Auditoría de seguridad

Stars Last Commit

SAT analiza las configuraciones de seguridad de tu workspace Databricks y te da recomendaciones de best practices. Útil para cualquier empresa, independientemente de la industria.

many-model-forecasting — Forecasting a gran escala

Stars Last Commit

Framework para entrenar miles de modelos de forecasting en paralelo (MMF). Aplica a retail, finanzas, logística — cualquier dominio con series temporales masivas.

auto-data-linkage — Entity resolution automatizada

Stars Last Commit

Linkeo y deduplicación de registros con Databricks ARC. Resuelve el clásico problema de “¿es el mismo cliente?” a escala.

Tip¿Cómo usar un Solution Accelerator?

Cloná el repo, importá los notebooks en tu workspace, y adaptá las queries a tus datos. Los aceleradores vienen con datos de ejemplo para que puedas probarlos sin conectar nada. El catálogo oficial te deja filtrar por industria y caso de uso.


Databricks Labs Labs

Labs es donde pasan las cosas interesantes. Proyectos construidos por empleados de Databricks que no tienen soporte oficial pero que muchas veces terminan siendo herramientas indispensables.

dolly

Stars Last Commit

Primer LLM open-source instruction-tuned de Databricks. Histórico — marcó un antes y después en la democratización de LLMs.

dbldatagen

Stars Last Commit

Generador de datos sintéticos a escala de billones de filas usando Spark nativo. Lo uso en mis pipelines para generar datos de prueba antes de tocar datos reales. Soporta claves primarias/foráneas consistentes entre tablas, distribuciones estadísticas, pesos en valores discretos y integración con Faker.

vs. Faker en Python: Faker es single-thread y no escala. dbldatagen genera datos distribuidos en Spark manteniendo consistencia referencial entre tablas.

import dbldatagen as dg

df = (dg.DataGenerator(spark, name="test_data",
                       rows=1_000_000, partitions=4)
    .withIdOutput()
    .withColumn("status", "string",
                values=['active', 'inactive', 'pending'],
                random=True, weights=[9, 1, 1])
    .withColumn("score", "float",
                expr="floor(rand() * 100)")
).build()

dqx

Stars Last Commit

Framework de Data Quality para PySpark DataFrames. Lo uso en producción para validar datos entre capas del medallion — si algo viene mal desde bronze, te enterás antes de que llegue a gold.

vs. Great Expectations / Soda Core: dqx es nativo de PySpark sin dependencias externas, con un profiler integrado que genera reglas de calidad automáticamente desde perfiles estadísticos de tus datos. GE requiere mucha config manual; Soda necesita su cloud propio. dqx además genera expectations para DLT/Lakeflow Pipelines.

from databricks.labs.dqx.profiler.profiler import DQProfiler
from databricks.labs.dqx.engine import DQEngine
from databricks.sdk import WorkspaceClient

ws = WorkspaceClient()
profiler = DQProfiler(ws)
_, profiles = profiler.profile(input_df)

# Genera checks automáticamente — revisalos antes de aplicar
checks = DQGenerator(ws).generate_dq_rules(profiles)

# Separar válidos de cuarentena
valid_df, quarantine_df = DQEngine(ws) \
    .apply_checks_by_metadata_and_split(input_df, checks)

ucx

Stars Last Commit Contributors

La única herramienta para migrar workspaces completos de Hive Metastore a Unity Catalog de forma automatizada. Maneja grupos, tablas, vistas, dashboards, jobs, notebooks, DLT pipelines y permisos en bloque.

vs. migración manual: sin UCX necesitás semanas de scripting manual con CREATE TABLE ... AS SELECT. UCX genera un assessment previo que identifica incompatibilidades y luego migra en batch con reconciliación de datos post-migración.

# 1. Instalar
databricks labs install ucx

# 2. Assessment del workspace actual
databricks labs ucx assessment

# 3. Mapeo de tablas Hive → Unity Catalog
databricks labs ucx create-table-mapping

# 4. Migrar tablas y código
databricks labs ucx migrate-tables
databricks labs ucx migrate-local-code
Importante

Requiere Workspace Administrator, metastore UC ya creado, y un PRO/Serverless SQL Warehouse para el reporte de assessment.

tempo

Stars Last Commit

API de series temporales sobre Spark: lagged values, rolling stats, AS OF joins, downsampling.

mosaic

Stars Last Commit

Procesamiento geoespacial a gran escala sobre Spark.

dlt-meta

Stars Last Commit

ETL metadata-driven con DLT. Definís bronze/silver en config, no en código.

ontos

Stars Last Commit

Business Catalog: capa de contexto de negocio sobre Unity Catalog.

lakebridge

Stars Last Commit

Acelerador de migraciones desde otros data warehouses a Databricks.

discoverx

Stars Last Commit

Swiss-army-knife para explorar y administrar Unity Catalog.

mcp

Stars Last Commit

Model Context Protocol para Databricks.

pylint-plugin

Stars Last Commit

Plugin PyLint con reglas específicas para código Databricks.

AdvertenciaLabs ≠ producto oficial

Ningún repo de Labs tiene soporte oficial de Databricks. Antes de usar uno en producción, revisá la actividad reciente del repo (commits, issues respondidos) y tené un plan B. Algunos repos populares como dbx y overwatch ya están deprecados.


Ecosistema Open-Source OSS

Acá hay un punto que vale la pena aclarar: no todos estos proyectos “los creó Databricks”. La relación es más matizada que eso, y entenderla ayuda a dimensionar qué tan independiente es cada uno.

Apache Spark nació en 2009 en el AMPLab de UC Berkeley como proyecto de investigación académica. Los fundadores de ese proyecto (Matei Zaharia y otros) después fundaron Databricks en 2013 para comercializarlo, pero Spark ya existía antes que la empresa. Hoy es un proyecto de la Apache Software Foundation, gobernado por la comunidad, con contribuidores de decenas de empresas. Databricks construyó toda su plataforma alrededor de Spark, no al revés.

Delta Lake sí fue creado por Databricks y open-sourced en 2019. Pero vive como proyecto independiente en la Linux Foundation bajo la org delta-io. Tiene su propia governance y contribuidores externos. Databricks lo usa como formato de tabla core de su plataforma, pero Delta Lake funciona perfectamente fuera de Databricks — con Spark standalone, con Flink, o directamente desde Python vía delta-rs.

MLflow fue creado por Databricks (liderado por Matei Zaharia) y open-sourced en 2018. También vive en la Linux Foundation con gobernanza independiente. Databricks lo integró profundamente en su plataforma (Model Registry, Experiment Tracking, Model Serving), pero MLflow corre en cualquier lado — es agnóstico de plataforma.

Unity Catalog es el más reciente. Fue producto propietario de Databricks hasta 2024, cuando open-sourced la versión OSS. Todavía es el proyecto con mayor dependencia del ecosistema Databricks, pero la intención es que funcione como catálogo abierto multi-motor.

El punto clave: son proyectos independientes que Databricks fue encajando en su plataforma, no al revés. Spark existía antes que Databricks, y Delta Lake, MLflow y Unity Catalog funcionan fuera de Databricks. Si mañana migrás a otro vendor, estos proyectos siguen siendo tuyos.

Apache Spark

MLflow

Delta Lake

Unity Catalog

delta-rs

Stars Last Commit Contributors

Delta Lake nativo en Rust, con bindings Python. La prueba viviente de que Delta Lake es un proyecto independiente: esta implementación no tiene una sola línea de código de Databricks ni de Spark.

vs. delta-spark: delta-spark requiere JVM + Spark. delta-rs corre en Python puro — perfecto para CI/CD, Lambda functions, scripts de validación, o integraciones con Polars y pandas. Es la única opción para acceso a Delta Lake en entornos sin JVM.

from deltalake import DeltaTable, write_deltalake
import pandas as pd

# Escribir Delta sin Spark (también acepta s3://, abfss://)
df = pd.DataFrame({"id": [1, 2, 3], "value": ["a", "b", "c"]})
write_deltalake("./data/mi_tabla", df)

# Leer con filtros y time travel
dt = DeltaTable("./data/mi_tabla")
df = dt.to_pandas(filters=[("id", ">", 1)])

# DML nativo: merge, delete, update
dt.merge(source=new_df, predicate="s.id = t.id",
         source_alias="s", target_alias="t") \
  .when_matched_update_all() \
  .when_not_matched_insert_all() \
  .execute()

delta-sharing

Stars Last Commit

Protocolo abierto para compartir datos de forma segura entre organizaciones. Funciona cross-platform — no necesitás que ambas partes usen Databricks.

delta-kernel-rs

Stars Last Commit

Implementación Rust de bajo nivel para leer/escribir Delta desde cualquier motor. Es el kernel que permite que cualquier query engine (no solo Spark) pueda trabajar con Delta Lake de forma nativa.


Comunidad y Developer Advocates Comunidad

No todos los repos útiles del ecosistema Databricks vienen de las orgs oficiales. Algunos vienen de Developer Advocates de Databricks (empleados que construyen herramientas open-source para la comunidad) y otros de MVPs externos reconocidos por el programa de MVPs.

Matthew Powers es Staff Developer Advocate en Databricks (no MVP — es empleado). Pero sus repos son open-source, viven fuera de las orgs de Databricks, y los mantiene como proyectos personales. Muchos equipos los usan en producción sin saber que vienen de alguien de Databricks. Fun fact: la mayoría de sus repos llevan nombres de personajes de Daria — la serie animada de MTV. spark-daria, quinn (la hermana de Daria), mack, jodie… Si ves un repo de PySpark con nombre de personaje noventero, probablemente sea de MrPowers.

chispa — GitHub

chispa

Stars Last Commit

La única librería de testing PySpark que te muestra mensajes de error con colores y diffs legibles — filas que difieren en rojo, iguales en azul. Sin chispa, un test que falla te tira un dump ilegible de objetos Row. Con chispa, ves exactamente qué fila falló y por qué.

vs. la alternativa (asserts manuales con .collect()): incomparable. chispa ahorra horas de debugging.

from chispa import assert_column_equality
import pyspark.sql.functions as F

data = [("jo&&se", "jose"), ("**li**", "li"), (None, None)]
df = (spark.createDataFrame(data, ["nombre", "esperado"])
      .withColumn("limpio",
          F.regexp_replace(F.col("nombre"), "[^\\w\\s]+", "")))

# Si falla, te muestra exactamente qué fila difiere
assert_column_equality(df, "limpio", "esperado")

spark-daria

Stars Last Commit

Extensiones esenciales de Spark en Scala. La que le dio nombre a la saga.

quinn

Stars Last Commit

Utilidades PySpark para productividad. Column helpers, DataFrame validations, transformations.

mack

Stars Last Commit

Helpers para Delta Lake: SCD Type 2, upserts, deduplicación, kill duplicates.

Databricks MVP. Mantiene “The Internals Of”, una serie de libros open-source que son probablemente el mejor recurso gratuito que existe para entender cómo funcionan Spark, Delta Lake y el ecosistema por dentro. No son tutoriales superficiales — son deep dives reales en el código fuente, los algoritmos y las decisiones de diseño. Si alguna vez quisiste entender por qué Spark hace lo que hace (y no solo cómo usarlo), esta serie es imprescindible. Todos gratuitos en books.japila.pl.

apache-spark-internals

Stars Last Commit

El libro principal de la serie. Cubre el scheduler, memory management, shuffle, storage — todo lo que la documentación oficial no explica.

spark-sql-internals

Stars Last Commit

Catalyst optimizer, Tungsten execution, query planning, AQE. Si optimizás queries en Spark, este libro te cambia la perspectiva.

spark-structured-streaming-internals

Stars Last Commit

Micro-batching, watermarks, state management — Structured Streaming de adentro para afuera.

delta-lake-internals

Stars Last Commit

Transaction log, checkpointing, optimistic concurrency, VACUUM — todo lo que pasa debajo de una tabla Delta.

sqlglot

Stars Last Commit

Parser y transpiler SQL en Python. Soporta dialecto Databricks/Spark SQL. Usado internamente por muchas herramientas del ecosistema.

dataflint/spark

Stars Last Commit

Drop-in replacement para la Spark UI. Mucho mejor para debugging y profiling de jobs.

spark-style-guide

Stars

Stars

Guía de estilo comunitaria para proyectos Spark. Buena referencia para equipos que quieren estandarizar.


Cómo navegar todo esto: mi recomendación

Si te sentís abrumado por la cantidad de repos, acá va mi filtro pragmático:

TipSi sos Data Engineer
  1. Instalá AI Dev Kit o Agent Skills en tu editor
  2. Mirá bundle-examples para templates de DABs
  3. Usá chispa para testing y dqx para data quality
TipSi estás construyendo una Databricks App
  1. Arrancá con AppKit y el DevHub
  2. Copiá snippets del apps-cookbook
  3. Si usás Lakebase, mirá el lakebase-app-dev-kit
TipSi querés entender cómo funciona todo por dentro
  1. Los libros de Jacek Laskowski son el mejor recurso gratuito que existe
  2. delta-rs para entender Delta Lake sin la complejidad de Spark
  3. llm-foundry si te interesa cómo se entrenan los modelos

Reflexión final: el open source como forma de estar al día

Si hay algo que me queda claro después de armar este mapa, es que el ecosistema de Databricks se mueve rápido porque se mueve en abierto. Los repos que listamos acá no son proyectos estáticos — tienen issues, PRs, discusiones, releases. Cada uno es una ventana a cómo se están resolviendo problemas reales hoy.

Mantener una buena relación con la comunidad open source no es solo “dar back” — es una de las formas más efectivas de mantenerte actualizado. Cuando seguís un repo, leés los changelogs, probás una nueva versión o reportás un bug, estás aprendiendo cómo evoluciona la plataforma antes de que salga en un blog corporativo o en una keynote.

No hace falta contribuir a todo. Con seguir los repos que te importan, probar las herramientas en tu entorno y compartir lo que aprendés, ya estás participando. El open source funciona porque hay gente que elige estar al día — y lo comparte. Mientras quieras seguir aprendiendo, la comunidad te va a tener al tanto.


Los badges de stars y último commit se actualizan automáticamente — si estás leyendo esto meses después de la publicación, los números que ves son los de hoy.

¿Conocés algún repo que me haya faltado? Dejame un comentario acá abajo — siempre estoy buscando herramientas nuevas.