Dans le cadre de notre croissance et afin de renforcer notre Squad AI Quality & Evaluation, nous recherchons un.e AI Evaluation Engineer — Agentic Systems.
Intégré.e au sein de nos équipes, en télétravail avec une flexibilité sur la région parisienne, vous interviendrez sur l'un des métiers les plus stratégiques de l'IA : garantir, mesurer et fiabiliser le comportement des agents et systèmes multi-agents avant leur mise en production. Un domaine qui s'invente aujourd'hui, où vous mettrez en pratique vos acquis en QA et développerez de nouvelles compétences à la frontière de l'IA.
MISSIONS:
=> Concevoir des stratégies d'évaluation pour agents et systèmes multi-agents : trajectoires, orchestration d'outils (tool use), raisonnement multi-étapes, gestion de mémoire et de contexte
=> Évaluer au-delà du résultat final : détecter les échecs intermédiaires, la propagation d'erreurs et les dérives de comportement le long de la trajectoire
=> Concevoir et éprouver des workflows agentiques : décomposition de tâches, enchaînement d'agents (planner / executor / critic), points de contrôle et garde-fous
=> Construire des jeux de tests et scénarios de simulation d'utilisateurs : personas, cas limites, tests adversariaux
=> Exploiter le prompt engineering comme levier d'évaluation : prompts de test, LLM-as-a-judge, rubriques d'évaluation
=> Industrialiser l'évaluation dans les pipelines CI/CD : évaluation automatisée, détection de régressions, quality gates avant déploiement
=> Définir les métriques qui comptent pour un agent : réussite de tâche, fidélité, robustesse, sécurité, coût, latence, consommation de tokens
=> Combiner évaluation automatisée et évaluation humaine (human-in-the-loop), et arbitrer entre les deux
=> Documenter et diffuser les bonnes pratiques d'évaluation agentique auprès des équipes
PROFIL:
=> Idéalement une première expérience en évaluation de systèmes IA — en poste, en freelance ou même sur un projet personnel sérieux : ce métier s'invente, nous valorisons ce que vous avez déjà exploré par vous-même
=> Compréhension de ce qui rend l'évaluation d'un agent spécifique : non-déterminisme, comportement probabiliste, trajectoires multi-étapes, échecs intermédiaires, absence de vérité unique — on n'évalue pas une sortie, on score une trajectoire (chaque appel d'outil, chaque état intermédiaire devient une surface d'évaluation)
=> Familiarité avec les approches de scoring : graders à base de règles (code-based), LLM-as-a-judge pour l'ouvert, évaluation humaine — et le bon sens de savoir quand combiner les trois
=> Maîtrise réelle d'au moins un framework ou plateforme d'évaluation IA : DeepEval, Ragas, TruLens, Giskard, Maxim AI, Braintrust, Langfuse, Opik ou équivalent
=> Capacité à construire un eval harness et des jeux de tests : cas experts (goldens), minage de traces de production, scénarios adversariaux
=> Bonnes pratiques de prompt engineering appliquées au test et à l'évaluation : conception de rubriques, prompts de test, calibration du juge
=> Maîtrise de Python et de l'automatisation de tests
=> Sensibilité sécurité IA, robustesse et reproductibilité
=> Une connaissance au moins générale du cadre réglementaire IA — EU AI Act (transparence, gestion des risques, littératie IA) et RGPD — et de son impact sur l'évaluation et la mise en production
=> Idéalement certifié.e ISTQB CT-AI (v2.0) et CT-GenAI — à défaut l'une des deux, avec l'envie d'obtenir la seconde
=> Socle solide en QA / test / qualité logicielle, ou en dev/data avec une vraie envie de basculer vers l'IA agentique
=> Anglais professionnel courant
SOFT SKILLS:
=> Passionné.e par les technologies innovantes et le champ de l'IA agentique
=> Rigoureux.se et doté.e d'un fort esprit critique : un tableau de bord tout vert ne vous suffit pas
=> Désireux.se de vous investir dans des projets challengeants et de gagner rapidement en responsabilités
=> Pédagogue, empathique et "Problem Solver" : vous rendez l'évaluation lisible et actionnable pour les équipes
=> Doté.e d'un excellent relationnel, d'un sens prononcé du service et de la qualité
=> Curieux.se et en veille active : un domaine qui évolue chaque semaine, et vous suivez
=> Excellent niveau de français à l'oral et à l'écrit, l'anglais professionnel étant ici indispensable