Todos los proyectos

Ingeniería de datos

Pipeline de crédito

Validar antes de publicar.

20 reglas de calidad

MI PARTICIPACIÓN

Proyecto propio de ingeniería de datos

CÓMO INTERPRETAR EL RESULTADO

Job serverless con seis tareas y más de 40 pruebas automatizadas en la alternativa local. No representa una operación de concesión de crédito.

LA DECISIÓN QUE IMPORTA

Bloquear la publicación cuando los datos fallan

Una ejecución terminada no basta. Las reglas de calidad impiden que los datos inválidos lleguen a los análisis y modelos, y dejan un registro de auditoría.

PRUEBA UNA DECISIÓN DEL PROYECTO

¿Publicarías estos datos?

Modifica la muestra y ejecuta la validación. La publicación solo se permite si todas las comprobaciones de esta demostración se superan.

Simulación local con datos ficticios y tres comprobaciones simplificadas. No ejecuta Databricks ni reproduce las 20 reglas del proyecto.

Muestra ficticia de clientes
ClienteIngresos mensuales
Cliente 1013200,00 BRL
Cliente 1024500,00 BRL
Cliente 1032800,00 BRL

Activa JavaScript para probarlo. La explicación del proyecto está disponible a continuación.

    El reto

    Los análisis de crédito dependen de una base consistente. Los registros inválidos no deben pasar silenciosamente a los informes y modelos.

    Mi contribución

    Construí un pipeline en Databricks con etapas de ingesta, tratamiento y publicación de datos. Incluí actualizaciones incrementales, auditoría de ejecuciones y controles de calidad con 20 reglas.

    El resultado

    Los datos que fallan en la validación bloquean la publicación y las tareas siguientes. La misma lógica también se ejecuta localmente, con más de 40 pruebas automatizadas.

    Proyecto propio de ingeniería de datos. No representa una operación de concesión de crédito ni un resultado financiero para clientes.

    Ejecución del pipeline de crédito en Databricks y diagrama de las etapas de ingesta, transformación, calidad, análisis y modelo.
    Ejecución y arquitectura del pipeline de crédito. Abrir imagen en tamaño original
    Explorar los detalles técnicos

    Arquitectura medallón, job serverless de seis tareas, Databricks Asset Bundles, Delta Lake y Unity Catalog. Bronze con historial de ingesta y Silver con MERGE INTO por cliente. Reglas de calidad en una sola pasada, caché de Gold y ajuste de las particiones de shuffle. Alternativa local con Parquet, PostgreSQL, Airflow y CI en GitHub Actions.

    Ver código y documentación
    Siguiente proyecto: PGNN: estudio sobre ItaipuConversar sobre una oportunidad

    Imagen del proyecto