Saltar al contenido principal

Conocimiento

Data Product Builder: crea productos de datos con tu coding agent

Escribe lo que necesitas en forma de Data Contract y pide a tu coding agent que lo construya. Implementación en minutos, conforme a tus convenciones e integrada de principio a fin con Entropy Data.

El Data Product Builder en acción.

Implementar productos de datos en la era de los coding agents

Seamos honestos: hoy los data engineers construyen productos de datos con coding agents como Claude Code, OpenAI Codex o GitHub Copilot. El agente escribe los modelos dbt, los tests y el workflow de CI. Lo que necesita son tres entradas, y todas se gestionan desde Entropy Data:

  • El Data Contract define el qué: el conjunto de datos que el producto de datos debe entregar, especificado desde el punto de vista del Data Consumer.
  • El repositorio de skills define el cómo: las convenciones, plantillas y políticas de tu organización para construir productos de datos sobre tu stack.
  • El marketplace de datos aporta los datos sobre los que construir: los productos de datos upstream, las aplicaciones de origen y los datos externos que consume el nuevo producto de datos.

El coding agent combina las tres y implementa el producto de datos en minutos: un dataset, un proyecto dbt, un Databricks Asset Bundle, lo que pida tu stack, con tests, workflow de despliegue, data lineage y metadatos incluidos.

El Data Contract define el qué, las skills definen el cómo, el marketplace de datos aporta los datos sobre los que construir y el coding agent combina las tres cosas para construir el producto de datos. Data Contract YAML Qué Skills Cómo Marketplace de datos Datos sobre los que construir Coding Agent Claude Code, Codex, Copilot Producto de datos Dataset, proyecto dbt, DAB, …
El Data Contract define el qué, las skills definen el cómo y el marketplace aporta los datos sobre los que construir. El coding agent convierte las tres cosas en un producto de datos.

Esta página explica los tres bloques (contrato, skills y marketplace) y cómo encajan en el flujo de desarrollo.

El Data Contract define el qué

Un Data Contract describe el producto de datos esperado desde el punto de vista del Data Consumer: el esquema con tipos y semántica, las reglas de calidad, las garantías de actualidad, los SLA y las condiciones de uso. Deja por escrito qué debe entregar el producto de datos, y por eso es la especificación ideal para un coding agent.

Así que el flujo empieza por el contrato, no por el código ni por los datos. Escribe o amplía primero el contrato ODCS, en el editor de Entropy Data, con nuestra plantilla ODCS de Excel o directamente en YAML. Luego entrégaselo al agente para que genere el pipeline de datos, los tests, el workflow de CI y el cableado de data lineage que lo satisfacen. Por último, ejecuta datacontract test sobre el resultado para comprobar que los datos reales coinciden con la especificación.

En esta página usamos el producto de datos Shelf Warmers como ejemplo recurrente: una lista de artículos en stock sin ventas en los últimos seis meses, propiedad del equipo de fulfillment. Su contrato especifica el SKU, el nombre del artículo y la marca de tiempo de la última venta, con actualización diaria.

El Data Contract de Shelf Warmers en el editor de contratos de Entropy Data, con el YAML ODCS a la izquierda y el esquema renderizado con SKU, nombre del artículo y marca de tiempo de la última venta a la derecha.
El contrato de Shelf Warmers se edita en Entropy Data (o en YAML) y después se le pasa al agente.

El repositorio de skills define el cómo

Un mismo contrato se puede implementar de formas muy distintas: convenciones de nombres, capas de modelos, orquestación, despliegue, requisitos de seguridad. Ese conocimiento es propio de cada organización y vive en un repositorio de skills: un repositorio Git con skills (instrucciones en Markdown que el agente carga para una tarea concreta), plantillas de archivos y hooks de validación.

entropy-data/dataproduct-builder-dbt es la referencia open source para dbt. Haz un fork y codifica tus propias convenciones: cambia la nomenclatura de las capas de modelos, sustituye GitHub Actions por Airflow, añade reglas de lint internas, incorpora tu taxonomía de PII, inserta puntos de control de gobernanza.

El repositorio se enchufa al coding agent mediante su mecanismo de plugins, por ejemplo como plugin de Claude Code, plugin de Codex o vía enrutado con AGENTS.md. Una vez instalado, el agente elige la skill adecuada para cada tarea e implementa el producto de datos en minutos, siguiendo al pie de la letra las políticas y convenciones de tu empresa.

Entropy Data ofrece repositorios de skills open source por stack:

  • dataproduct-builder-dbt. dbt sobre cualquier adaptador: Snowflake, BigQuery, Databricks, Redshift, Postgres, DuckDB. GitHub Actions para CI. Integración completa con Entropy Data: ODPS, ODCS, data lineage con OpenLineage y detección de drift.
  • dataproduct-builder-databricks. Databricks Asset Bundles con Lakeflow Spark Declarative Pipelines. Compartición vía Unity Catalog. Integración completa con Entropy Data.
  • Snowflake Native Apps Framework. Próximamente.
  • AWS Glue. Próximamente.

Los repositorios de la comunidad y los personalizados son bienvenidos. Envía un pull request al registro dataproduct-builders para publicar el tuyo.

El repositorio entropy-data/dataproduct-builder-dbt en GitHub con skills, hooks, .claude-plugin, .codex-plugin y plantillas.
El repositorio de skills de referencia en GitHub: skills, hooks, manifiestos por agente y plantillas de archivos.

El marketplace de datos aporta los datos sobre los que construir

Un producto de datos rara vez parte de cero. Consume datos upstream, y el coding agent los encuentra en el marketplace de Entropy Data. A través de la CLI de Entropy Data, el agente busca en todo lo que el marketplace conoce:

  • Productos de datos upstream con sus contratos, su semántica y su historial de calidad.
  • Aplicaciones de origen, los sistemas operacionales detrás de los productos de datos alineados con la fuente.
  • Datos externos disponibles de proveedores comerciales y datos abiertos publicados en el marketplace.

Shelf Warmers necesita el catálogo de artículos actual y los movimientos de stock, así que el agente ejecuta

entropy-data search query "articles stock" -o json

El agente lee los contratos y la semántica de los candidatos y evalúa si son relevantes para el producto de datos que está construyendo: ¿encajan los campos, las claves de unión, las garantías de calidad y las condiciones de uso con los requisitos? Para Shelf Warmers se queda con dos productos de datos upstream: Articles latest, del equipo de producto, para el catálogo de artículos, y Stock Update Events, del equipo de fulfillment, para los movimientos de stock. Ambos pasan a ser Input Ports del nuevo producto de datos (models/input_ports/*.odcs.yaml en la estructura de referencia de dbt), de modo que el data lineage queda cableado desde el primer commit.

El listado de Data Products en el marketplace de Entropy Data: productos de datos, aplicaciones e informes con propietario, dominio, tipo, estado y etiquetas de nivel de calidad y clasificación de datos.
El marketplace: productos de datos, aplicaciones de origen y datos externos que el agente puede descubrir y evaluar.

Cuando el acceso a una fuente está restringido, el agente da un paso más: solicita el acceso en nombre del nuevo producto de datos consumidor, con la justificación de negocio incluida. Para Shelf Warmers, eso es una solicitud de acceso al Output Port de Articles latest con el propósito «identificar artículos en stock sin ventas en los últimos seis meses». El Data Product Owner ve la solicitud en Entropy Data y la aprueba, o bien una política de gobernanza la aprueba automáticamente según la configuración del producto de datos y su perfil de clasificación de datos.

Resumen en la terminal de una ejecución de Claude Code implementando el producto de datos Shelf Warmers: estructura del proyecto, acuerdos de acceso aprobados para articles-latest y stock-update-events, contratos de Input Port y Output Port, modelos dbt y tests de dbt y datacontract en verde.
El resumen de la ejecución del agente en la terminal: fuentes cableadas como Input Ports, acuerdos de acceso aprobados, modelos construidos y todos los tests de dbt y de contrato en verde.
La tabla SHELF_WARMERS en el Database Explorer de Snowflake con 14,6 K filas y las columnas SKU, nombre del artículo, marca de tiempo de la última venta y marca de tiempo de procesamiento.
El resultado en Snowflake: la tabla SHELF_WARMERS, materializada por la ejecución de dbt con exactamente el esquema que especifica el contrato.
Una solicitud de acceso en Entropy Data: el equipo de Fulfillment pide acceso al producto de datos Articles latest, con botones de aprobar y rechazar para el Data Product Owner y un diagrama de los productos de datos consumidor y proveedor.
La solicitud de acceso creada por el agente, tal y como la ve en Entropy Data el owner de Articles latest.

Bajo el capó

CLI de Entropy Data

La CLI de Entropy Data es el puente entre tu repositorio local y la plataforma Entropy Data. Se conecta a Entropy Data para descubrir productos de datos upstream en el marketplace, recuperar sus contratos y su semántica para entender las claves de unión y las definiciones de campos, actualizar los metadatos y el data lineage de tu producto de datos, y publicar los resultados de los tests de contrato. Instálala una vez por repositorio, autorízala con una API key y las skills de sincronización y publicación la usarán automáticamente.

Elegimos la CLI en lugar de MCP porque es más eficiente en tokens y más sencilla de configurar.

Guía dentro de Entropy Data

Un repositorio Data Product Builder se registra como builder en Entropy Data, en Governance → Data Product Builders. El builder es donde los data engineers definen la experiencia para los equipos que lo van a usar:

  • Instrucciones de instalación para los coding agents que la plantilla admite (Claude Code, OpenAI Codex, GitHub Copilot CLI). Los comandos de instalación se generan a partir de la URL del repositorio.
  • Prompts de uso con variantes según la fase del ciclo de vida. Un producto de datos en draft recibe un prompt de arranque; uno active recibe prompts de evolución y de test.

Entropy Data también controla la visibilidad: cada equipo ve unos plugins de Data Product Builder u otros según el arquetipo del producto de datos, el equipo propietario, las etiquetas y el estado. Un equipo que construye un producto alineado con el consumo sobre Databricks ve un builder optimizado para Databricks. Otro que construye un producto alineado con la fuente sobre Snowflake ve un builder de Snowflake. Cada equipo trabaja con el builder que encaja con su stack y sus convenciones.

La pestaña Data Product Builder en la página del producto de datos Shelf Warmers: elige el coding agent (Claude Code, OpenAI Codex, GitHub Copilot CLI), copia los comandos de instalación y conexión y consulta las skills del builder.
La pestaña Builder en la página del producto de datos: elige el builder, consulta el comando de instalación y copia el prompt precargado.

Skills (ejemplos)

Una skill es un archivo Markdown que el agente carga cuando aparece la tarea correspondiente. Las siete skills siguientes son las que incluye el repositorio de skills de referencia para dbt (entropy-data/dataproduct-builder-dbt); en tu fork puedes añadir, quitar o sustituir cualquiera de ellas.

  • datacontract-edit modifica el contrato de un Output Port a partir de una instrucción en lenguaje natural. El contrato sigue siendo el punto de entrada.
  • dataproduct-bootstrap genera el esqueleto de un proyecto dbt nuevo: dbt_project.yml, la estructura de modelos en cuatro capas, README y profiles.yml.example.
  • dataproduct-implement lee los contratos de entrada y de salida y escribe los modelos dbt que los cumplen.
  • datacontract-test ejecuta datacontract test sobre los datos reales y devuelve los resultados de esquema y calidad.
  • dataproduct-exampledata extrae filas de muestra, elimina las columnas marcadas como PII en el contrato y sube la muestra depurada a Entropy Data.
  • entropy-data-sync toma un proyecto dbt existente, lo alinea con la estructura de referencia, configura el workflow de despliegue y sincroniza los metadatos de ODPS, ODCS y data lineage.
  • entropy-data-teams lista los equipos configurados en tu tenant para que el agente pueda pedir al usuario que elija un owner.

Para ver la estructura del proyecto dbt resultante y el papel de cada componente, consulta Construir productos de datos con dbt.

Coding agents compatibles

  • Claude Code
  • OpenAI Codex
  • GitHub Copilot CLI
  • Cursor, Aider y cualquier otro agente que lea AGENTS.md (o que use directamente la carpeta skills/)

Los comandos de instalación exactos para tu producto de datos, con la URL de tu repositorio ya rellenada, se muestran en la pestaña Builder.

Configuración

Dos pasos únicos por repositorio: instalar el plugin y conectar la CLI.

claude plugin marketplace add https://github.com/entropy-data/dataproduct-builder-dbt
claude plugin install dataproduct-builder-dbt@dataproduct-builder-dbt -s project
uv tool install --upgrade entropy-data
entropy-data connection add default --api-key <your-api-key> --host <your-entropy-data-host>

Genera la API key en Organization Settings → API Keys. Para CI, usa una clave con alcance de equipo o de organización guardada como secreto del repositorio. La pestaña Builder te da los dos comandos con el host y la clave ya rellenados.

Entropy Data

Entropy Data es un marketplace de productos de datos gobernados por Data Contracts. El Data Product Builder cierra el círculo entre contrato e implementación: edita el contrato en el marketplace, pásale el prompt a tu agente y el producto de datos sale con los Output Ports, los tests, el data lineage y los metadatos ya cableados.

El producto de datos que construye el agente es mucho más que código en un repositorio. Aparece completamente integrado en Entropy Data:

  • Ficha en el marketplace: Shelf Warmers se puede descubrir con su propósito, su equipo propietario, sus Output Ports y sus condiciones de uso, tanto por personas como por agentes de IA.
  • Data lineage: desde Articles latest y Stock Update Events, pasando por los modelos dbt, hasta el Output Port, publicado vía OpenLineage en cada ejecución.
  • Resultados de los tests de contrato: cada ejecución de datacontract test reporta sus resultados, así los Data Consumers ven de un vistazo que el producto entrega lo prometido.
  • Detección de drift: Entropy Data avisa cuando la implementación real se desvía del contrato.
  • Gestión de accesos: los Data Consumers solicitan acceso al Output Port y las aprobaciones pueden aprovisionar los roles en la plataforma de datos.
  • Datos de ejemplo: filas de muestra sin PII para que los Data Consumers evalúen el producto antes de pedir acceso.
La página del producto de datos Shelf Warmers en Entropy Data: diagrama del producto con las dos fuentes upstream, descripción, Output Port con su Data Contract, Input Ports vía solicitud de acceso, data lineage del pipeline a partir de eventos OpenLineage, comprobaciones de cumplimiento, semántica y conexión con Git.
El producto de datos Shelf Warmers terminado en Entropy Data: data lineage, contrato, resultados de tests y accesos en un solo sitio.

Empieza gratis, explora la demo o lee la documentación del Data Product Builder.