Paradigma Digital logo
Hiring from
Spain
Work type
Remote
Posted
Oct 2, 2026
Is this job info correct?

¡Forma parte del futuro de Paradigma!

En Paradigma seguimos creciendo y buscamos un/a AI Trust Engineer Senior que nos ayude a garantizar la calidad, fiabilidad, trazabilidad y seguridad de nuestros sistemas de Inteligencia Artificial, LLMs y arquitecturas agénticas.


¿Que buscamos?

Importante: no buscamos un perfil de QA tradicional centrado en testing funcional. Buscamos un/a ingeniero/a capaz de entender cómo se comportan los modelos y agentes, medir objetivamente su calidad y construir los mecanismos que permitan evaluarlos y monitorizarlos de forma continua.


Responsabilidades

Tu misión será diseñar y operar los mecanismos de evaluación, observabilidad y gobierno de sistemas de IA, aportando evidencias objetivas de que su comportamiento cumple con los requisitos funcionales, técnicos y de negocio.

Trabajarás durante todo el ciclo de vida de las soluciones, desde el diseño hasta producción, colaborando estrechamente con equipos de Software Builders, Agentic Platform Engineers y AI Architects.

Entre tus principales responsabilidades estarán:

? Observabilidad de LLMs y agentes

  • Instrumentar aplicaciones de IA utilizando Langfuse u otras herramientas equivalentes.
  • Capturar y analizar trazas completas: prompts, respuestas, llamadas a herramientas, pasos intermedios de agentes, latencia, tokens y costes.
  • Investigar comportamientos y detectar degradaciones o anomalías en producción.
  • Construir dashboards y alertas con Grafana para monitorizar calidad, rendimiento, latencia y costes.
  • Trabajar con estándares como OpenTelemetry aplicados a sistemas de IA.

? Evaluación de LLMs

  • Diseñar y ejecutar evaluaciones utilizando frameworks como Ragas y DeepEval.
  • Trabajar con métricas de faithfulness, relevancia, precisión y exhaustividad del contexto en sistemas RAG, alucinaciones y uso correcto de herramientas.
  • Diseñar benchmarks y datasets de referencia para comparar versiones de forma reproducible.
  • Aplicar técnicas como Human-in-the-Loop y LLM-as-a-Judge, entendiendo sus limitaciones y posibles sesgos.
  • Evaluar la robustez y seguridad de sistemas de IA frente a sesgos, prompt injection y jailbreaks.
  • Definir métricas objetivas y criterios de aceptación adaptados a cada caso de uso.

? Automatización y Quality Gates

  • Integrar evaluaciones de IA dentro de pipelines CI/CD.
  • Construir quality gates que permitan bloquear cambios que no cumplan los umbrales de calidad definidos.
  • Automatizar la evaluación de cambios en modelos, prompts, configuraciones y agentes.
  • Desarrollar herramientas y evaluaciones en Python, aplicando buenas prácticas de ingeniería de software.

? Calidad y mejora continua

  • Construir y mantener un motor de evaluación basado en datasets versionados.
  • Detectar regresiones y comparar de forma reproducible el comportamiento entre versiones.
  • Garantizar la trazabilidad de las respuestas: contexto utilizado, modelo, versión del prompt y pasos intermedios del agente.
  • Definir y analizar KPIs de calidad e identificar oportunidades de mejora.
  • Comunicar el estado de la calidad de las soluciones tanto a perfiles técnicos como de negocio.


Debes tener experiencia en:

Buscamos una persona con +4 años de experiencia profesional en ámbitos como:

  • AI Quality Engineering
  • Software Engineering
  • MLOps
  • Observabilidad
  • Ingeniería de datos/IA

Y, especialmente, con experiencia práctica en IA generativa llevada a producción.

Nos interesa especialmente que tengas:

✅ Experiencia real con Ragas y/o DeepEval.
✅ Experiencia con Langfuse u otras plataformas de observabilidad de LLMs/agentes.
✅ Experiencia integrando evaluaciones automatizadas como quality gates en CI/CD.
✅ Conocimientos sólidos de Python.
✅ Experiencia trabajando con LLMs, RAG y arquitecturas agénticas.
✅ Conocimientos de métricas y metodologías de evaluación de LLMs.
✅ Experiencia con Grafana y, valorable, OpenTelemetry.
✅ Conocimientos sobre seguridad y robustez de sistemas de IA.
✅ Capacidad para interpretar resultados y convertirlos en acciones de mejora.

Y sobre todo, buscamos a alguien que no se limite a ejecutar tests: queremos una persona capaz de definir qué significa que un sistema de IA sea bueno, cómo medirlo y cómo garantizarlo de forma automatizada y continua.


¿Por qué Paradigma?

✅ Libertad con responsabilidad

Confiamos en las personas para organizar su trabajo de forma flexible, favoreciendo el equilibrio entre la vida personal y profesional sin perder de vista los objetivos y el impacto de nuestro trabajo. Tendrás la posibilidad de trabajar en un modelo de trabajo remoto o híbrido.


✅ Una comunidad de referencia

Formarás parte de una comunidad ágil y tecnológica activa, donde compartir conocimiento, aprender de otros expertos y contribuir al desarrollo de las mejores prácticas del sector.


✅ Acompañamiento desde el primer día

Contarás con el apoyo de un Buddy que te ayudará en tu integración, resolverá tus dudas y facilitará que te sientas parte de Paradigma desde el inicio.


✅Excelencia técnica como seña de identidad

Nos apasiona la tecnología y apostamos por el desarrollo continuo de nuestras capacidades. El conocimiento, la calidad y la mejora constante forman parte de nuestra cultura.

También apostamos por el aprendizaje continúo y tendrás acceso a un plan anual de formación, certificaciones oficiales y espacios de aprendizaje diseñados para impulsar tu desarrollo profesional.


✅Beneficios

Además de un entorno de trabajo cercano y colaborativo, ofrecemos seguro médico 100% subvencionado, retribución flexible a través de Edenred, 25 días de vacaciones anuales y otros beneficios orientados al bienestar de las personas.


Contacta con nosotros en careers@paradigmadigital.com

Similar jobs

Apply for this job