Évaluations de l'agent
Écrit par Stanislas
Dernière mise à jour Il y a 16 jours
Vue d'ensemble
Les évaluations d'agent offrent une interface de test dédiée pour mesurer la précision et la cohérence des réponses de votre agent IA. En comparant les résultats générés à des réponses de référence définies, vous pouvez évaluer méthodiquement la conformité de votre agent avec ses instructions et ses sources de connaissances.
Utilisez les évaluations lors de l'optimisation des prompts de l'agent, de la mise à jour des documents connectés ou de la validation d'un agent avant son déploiement en production afin d'éviter toute régression et garantir la qualité des réponses.
Prérequis
Rôles et autorisations : Seuls les propriétaires et les administrateurs de l'espace de travail ont accès à la configuration et à l'exécution des évaluations.
Agent personnalisé actif : Au moins un agent IA personnalisé configuré dans votre espace de travail.
Critères de test : Un ensemble de requêtes de test associées à des réponses de référence attendues.
Guide étape par étape
1. Accéder au tableau de bord des évaluations
Dans la barre latérale gauche de votre espace de travail, cliquez sur Agents et sélectionnez l'agent à évaluer.
Dans le panneau de navigation latérale de configuration de l'agent, faites défiler jusqu'à la section Observabilité et cliquez sur Evaluations.

La page Evaluations s'affiche avec le tableau Questions and answers, la barre de recherche et les actions disponibles.

2. Ajouter manuellement une évaluation
Cliquez sur le menu déroulant + Add situé au-dessus du tableau.

Sélectionnez Add an evaluation.
Dans la boîte de dialogue, renseignez les informations demandées :
Question : Saisissez le message ou la question utilisateur à soumettre à l'agent IA.
Expected response : Définissez la réponse idéale attendue qui servira de référence.
Add comment (optional) : Ajoutez des notes ou des critères d'évaluation destinés aux réviseurs.

Cliquez sur Save pour enregistrer le cas de test dans le tableau.
3. Importer des évaluations depuis un fichier CSV
Cliquez sur le menu déroulant + Add et choisissez Import evaluations from csv file.
Cliquez sur le lien sample.csv pour télécharger le modèle de référence.
Préparez votre fichier CSV avec les colonnes de question, réponse attendue et commentaire optionnel.
Glissez-déposez votre fichier dans la zone Drop your file here, ou cliquez pour parcourir vos dossiers locaux.

Cliquez sur Save pour importer les cas de test dans le tableau d'évaluation.
4. Exécuter les évaluations et consulter les scores
Dans le tableau Questions and answers, cochez la case correspondant à chaque évaluation à lancer.
Cliquez sur le bouton Run evaluation dans la barre d'outils supérieure.

Une fois l'analyse terminée, la colonne Semantic similarity affiche le score de similarité obtenu pour chaque élément testé.
Consultez le bloc Global Score situé sous le tableau pour connaître la note globale de similarité sémantique et le palier de performance atteint.
5. Inspecter le détail d'une évaluation
Cliquez sur l'icône en forme d'œil dans la colonne Action de la ligne évaluée.
Examinez le volet latéral affichant la Question initiale, la Expected response, la réponse réelle (Agent response after evaluation) et le score calculé de Semantic Similarity.

Comparez la réponse produite avec la réponse attendue pour repérer d'éventuels oublis, imprécisions ou erreurs de récupération documentaire.
Cas d'usage pratiques
Validation avant déploiement : Exécutez un jeu de test de 25 questions récurrentes sur un nouvel agent afin d'en vérifier la conformité et la pertinence avant de l'ouvrir aux utilisateurs finaux.
Itérations de prompts et tests de régression : Lancez vos évaluations après avoir modifié les instructions système ou changé de modèle LLM pour vous assurer qu'aucune régression n'apparaît sur les réponses clés.
Contrôle des mises à jour documentaires : Testez l'agent avant et après l'ajout de nouvelles ressources pour vous assurer qu'il exploite correctement les documents récents.
Conseils et bonnes pratiques
Évaluez des sélections ciblées de questions lors de vos itérations rapides afin d'économiser vos crédits d'exécution.
Rédigez des réponses attendues claires et objectives, centrées sur les faits essentiels plutôt que sur une tournure de phrase stricte.
Supprimez les cas de test obsolètes à l'aide de l'icône de corbeille rouge dès que vos processus métier évoluent.
Portez une attention particulière aux résultats inférieurs à 80 % afin d'identifier les instructions à clarifier ou les sources documentaires manquantes.
Dépannage
Le bouton Run evaluation reste grisé :
Cause : Aucune ligne de test n'est actuellement cochée dans le tableau.
Solution : Cochez au moins une case dans le tableau pour activer le bouton.
La rubrique Evaluations n'apparaît pas dans le menu :
Cause : Votre compte dispose d'un rôle membre standard sans prérogatives d'administrateur ou de propriétaire.
Solution : Demandez à un administrateur de votre espace de travail de vous attribuer les droits d'administration.
Score de similarité sémantique trop bas :
Cause : L'agent a omis des points clés, mal interprété la consigne ou manqué d'informations de contexte.
Solution : Cliquez sur l'icône d'œil pour lire la réponse générée, puis affinez le prompt système ou complétez la base de connaissances.
Ressources supplémentaires
Analytique de l'agent – Surveillez les volumes d'exécutions, les taux de succès et l'utilisation des crédits au fil du temps.
Surveillance des sessions et des traces de l'agent – Auditez les conversations individuelles et identifiez les erreurs techniques.
Paramètres de l'agent – Ajustez les instructions système, la température et le choix des modèles LLM.
Cela a-t-il été utile ?
Plus dans Observabilité des agents
Analytique de l'agentJournal des modifications de l'agentBesoin d'aide supplémentaire ? Demander à l'équipe