AI Data Engineer
Hace 4 semanas
Lima, Perú
Multiplica
Jornada completa
Gratis con email o Google
Guarda esta oferta y sigue tu búsqueda
Crea una cuenta gratis para guardar empleos, crear alertas y volver a esta oferta desde tu panel.
Gratis con email o Google
Al continuar, aceptas nuestros Términos & Política de Privacidad.
Por encargo de nuestro cliente líder del sector financiero, nos encontramos de la búsqueda de un AI Data Engineer, quien pertenecerá al equipo de GEN AI & Innovación.
Misión:
El Data Engineer asegura la disponibilidad, calidad y escalabilidad de los datos para soluciones de IA Generativa, mediante la construcción de pipelines ligeros y confiables. Su propósito es preparar, transformar y exponer datos que habiliten la operación óptima de agentes, copilotos y automatizaciones, en coordinación con equipos de IA y negocio.
Funciones:
Diseñar, construir y mantener pipelines de ingestión, transformación y orquestación. Modelar datos orientados a IA y preparar datasets para RAG/embeddings. Aplicar controles de calidad y trazabilidad. Mantener CI/CD de pipelines de datos y documentación versionada. Orquestar workflows y exponer feeds/endpoints para consumo de agentes/copilotos y productos analíticos.
Requisitos:
Profesional universitario de las carreras de Ingeniería de Sistemas, Computación, Ciencia de Datos o afines. Experiencia de 3–5 años en ingeniería de datos o integración de datos cloud. Experiencia construyendo pipelines y modelos de datos para analítica o IA (incluye preparación de datasets para RAG/LLMs). Participación en migraciones on‑prem → cloud y orquestación de workflows de datos. Manejo de Inglés Técnico (Deseable Intermedio). Softwares y Tecnologías: Azure Data Factory, Databricks, PySpark/Spark SQL, Delta Lake, Azure Synapse/Storage. SQL avanzado (SQL Server, PostgreSQL) y Python (intermedio–avanzado). Control de versiones y CI/CD: Git, GitHub/Bitbucket, GitHub Actions / Azure DevOps / Jenkins. Integración: APIs REST/JSON; consumo desde fuentes internas y externas. Deseable manejo de Airflow para orquestación adicional; Power BI para visualizaciones de soporte. Otros conocimientos: Conceptos de linaje, calidad y gobierno de datos (solo para alineamiento). Diseño de modelos de datos orientados a IA (tabulares, semiestructurados) e implementación técnica con formatos optimizados (Parquet/Delta), particionamiento, esquemas y metadatos. Batch y streaming sobre Delta Lake; patrones de auditoría/versionado. Seguridad y privacidad (PII: anonimización/pseudonimización básica; controles de acceso). Integración de datos desde APIs, bases de datos y fuentes externas. Optimización de performance y costos en plataformas cloud. Conocimientos Deseables: Exposición general a AWS o GCP (lectura de servicios equivalentes, despliegues simples o conocimientos básicos). Nociones de LLMOps para preparar datos y habilitar inferencia. Familiaridad con orquestación ligera (GitHub Actions, Data Factory, Airflow). Certificación AZ‑900; DP‑203, Databricks Data Engineer Associate, DP‑900, PL‑300. Este anuncio se encuentra abierto para personas con discapacidad.
Funciones:
Diseñar, construir y mantener pipelines de ingestión, transformación y orquestación. Modelar datos orientados a IA y preparar datasets para RAG/embeddings. Aplicar controles de calidad y trazabilidad. Mantener CI/CD de pipelines de datos y documentación versionada. Orquestar workflows y exponer feeds/endpoints para consumo de agentes/copilotos y productos analíticos.
Requisitos:
Profesional universitario de las carreras de Ingeniería de Sistemas, Computación, Ciencia de Datos o afines. Experiencia de 3–5 años en ingeniería de datos o integración de datos cloud. Experiencia construyendo pipelines y modelos de datos para analítica o IA (incluye preparación de datasets para RAG/LLMs). Participación en migraciones on‑prem → cloud y orquestación de workflows de datos. Manejo de Inglés Técnico (Deseable Intermedio). Softwares y Tecnologías: Azure Data Factory, Databricks, PySpark/Spark SQL, Delta Lake, Azure Synapse/Storage. SQL avanzado (SQL Server, PostgreSQL) y Python (intermedio–avanzado). Control de versiones y CI/CD: Git, GitHub/Bitbucket, GitHub Actions / Azure DevOps / Jenkins. Integración: APIs REST/JSON; consumo desde fuentes internas y externas. Deseable manejo de Airflow para orquestación adicional; Power BI para visualizaciones de soporte. Otros conocimientos: Conceptos de linaje, calidad y gobierno de datos (solo para alineamiento). Diseño de modelos de datos orientados a IA (tabulares, semiestructurados) e implementación técnica con formatos optimizados (Parquet/Delta), particionamiento, esquemas y metadatos. Batch y streaming sobre Delta Lake; patrones de auditoría/versionado. Seguridad y privacidad (PII: anonimización/pseudonimización básica; controles de acceso). Integración de datos desde APIs, bases de datos y fuentes externas. Optimización de performance y costos en plataformas cloud. Conocimientos Deseables: Exposición general a AWS o GCP (lectura de servicios equivalentes, despliegues simples o conocimientos básicos). Nociones de LLMOps para preparar datos y habilitar inferencia. Familiaridad con orquestación ligera (GitHub Actions, Data Factory, Airflow). Certificación AZ‑900; DP‑203, Databricks Data Engineer Associate, DP‑900, PL‑300. Este anuncio se encuentra abierto para personas con discapacidad.