Passer au contenu principal

Evals pour Fin [beta]

Testez le comportement de Fin avant qu'il n'atteigne vos clients

Écrit par Beth-Ann Sher

Evals est actuellement en bêta fermée. Si vous souhaitez un accès anticipé, veuillez remplir ce formulaire de demande de bêta. Pour utiliser Evals via Operator, vous devez également avoir accès à Operator.


Qu'est-ce que Fin Evals ?

Utilisez Fin Evals pour créer des conversations de test réalistes, les exécuter contre votre configuration Fin, et obtenir des résultats automatiques de réussite/échec — avant qu'un changement n'atteigne un vrai client. Cet article explique comment créer des Evals et des Simulations, les exécuter manuellement ou via Operator, lire les résultats avec des Scorecards, et construire des suites de régression qui détectent les problèmes au fil du temps.

Au lieu de deviner comment Fin gérera une demande de remboursement délicate, un client en colère, ou un changement que vous venez d'apporter à une Procédure, vous pouvez créer des conversations de test réalistes, les exécuter contre Fin, et obtenir un résultat automatique de réussite/échec. Exécutez le même ensemble de tests chaque fois que vous effectuez un changement, et vous saurez en quelques minutes si Fin se comporte toujours comme prévu.

Fin Evals repose sur deux concepts simples :

  • Evals sont un conteneur (un groupe thématique de tests). Pensez à « Demandes de remboursement », « Scénarios d'escalade » ou « Ton et convivialité ».

  • Simulations sont les tests individuels à l'intérieur d'un Eval. Chaque Simulation est une conversation réaliste à plusieurs échanges entre un client simulé et Fin, avec les critères selon lesquels vous souhaitez juger le comportement de Fin.

Lorsque vous exécutez un Eval, chaque Simulation à l'intérieur s'exécute automatiquement, et vous obtenez un résultat de réussite/échec pour chacune, évalué par une combinaison de vérifications déterministes et un juge IA, basé sur les critères que vous avez définis.

Vue d'ensemble de l'interface Fin Evals montrant une liste d'Evals avec les résultats réussite/échec pour chaque Simulation


Pourquoi, quand et comment vous devriez utiliser les Evals

Pourquoi utiliser les Evals ?

Le comportement de Fin n'est pas fixe, il dépend de votre contenu, de vos Procédures, de vos directives, et des données auxquelles il a accès au moment de répondre. Chaque fois que vous modifiez l'un de ces éléments, il y a une chance que cela modifie le comportement de Fin ailleurs, de manière facile à manquer jusqu'à ce qu'un vrai client rencontre le problème.

Les Evals vous offrent un moyen répétable de vérifier le comportement de Fin à travers des conversations réalistes à plusieurs échanges, et de détecter les problèmes avant qu'ils n'atteignent une conversation en direct.

Quand devriez-vous utiliser les Evals ?

Recourez à un Eval chaque fois que vous souhaitez avoir confiance dans le comportement de Fin :

  • Avant de déployer un changement : au contenu, aux directives, aux Procédures, ou à tout autre élément de la configuration de Fin.

  • Après une correction : pour confirmer que vous avez réellement résolu le problème que vous vouliez résoudre.

  • De manière continue : réexécutez périodiquement les Evals existants comme une suite de régression, pour détecter les dérives inattendues avant que les clients ne les remarquent.

  • Avant la mise en production de Fin : pour vérifier que votre configuration fonctionne comme vous l'attendez avant que vos clients n'interagissent avec Fin pour la première fois.

Comment organiser vos Evals

Regroupez les Simulations dans un Eval selon le thème qui a du sens pour votre entreprise. Points de départ courants utilisés par les clients bêta :

  • Scénarios d'escalade : situations où Fin doit (ou ne doit pas) transférer à un humain.

  • Scénarios thématiques : un sujet spécifique comme les demandes de remboursement, testé à travers une gamme de variations.

  • Scénarios comportementaux : vérifier que Fin reste dans le ton et la marque à travers différentes situations, quel que soit le sujet.


Créer et analyser des Evals avec Operator

Si vous avez accès à Operator, il peut créer vos Evals et Simulations pour vous, et analyser les résultats une fois qu'ils ont été exécutés.

Comment créer un Eval avec Operator

Allez sur Operator et demandez-lui de créer un Eval pour votre cas d'utilisation.

Interface de chat Operator montrant une invite demandant à Operator de créer un Eval pour des scénarios de demande de remboursement

Vous pouvez lui indiquer ce que doivent être les Simulations, les vérifications de Simulation, et les vérifications de transfert, ou laisser Operator les déduire. Une fois qu'il a créé votre Eval et vos Simulations, ils apparaîtront pour que vous puissiez les examiner et les approuver.

Operator affichant un Eval proposé avec des Simulations et des vérifications de transfert prêtes à être examinées et approuvées

Comment exécuter un Eval avec Operator

Quand vous êtes prêt, demandez à Operator d'exécuter l'Eval pour vous.

Operator exécutant un Eval, montrant chaque Simulation traitée en temps réel avec un indicateur de progression

Il vous montrera les résultats au fur et à mesure que chaque Simulation est exécutée.

Tableau des résultats d'Operator montrant les Simulations avec statuts Réussi, Échoué et Erreur et les vérifications derrière chaque résultat

Une fois que chaque Simulation a été exécutée, Operator présente les résultats et les explique pour vous :

  • Un tableau des résultats — chaque Simulation avec son résultat global (Réussi, Échoué ou Erreur) et les vérifications individuelles derrière, pour que vous puissiez voir pourquoi il a abouti ainsi. Dans l'exemple ci-dessus, « Export en masse de l'espace de travail » a échoué parce que la vérification de transfert a échoué (Fin a escaladé alors qu'il n'aurait pas dû), même si la vérification de la réponse de Fin a réussi.

  • Un résumé — les totaux principaux (3 réussis, 1 échoué, 2 erreurs) suivis d'une explication en langage clair de ce qui a mal tourné et pourquoi. Ici, Operator retrace l'échec de l'export vers une règle de guidage qui oriente vers un humain chaque fois que le mot « échec » apparaît.

Operator ne se contente pas de rapporter les résultats — il propose les prochaines actions et offre de les exécuter pour vous.

Vous n'avez pas besoin d'Operator pour exécuter un Eval. Rendez-vous sur Fin AI Agent > Test > Evals et exécutez-le vous-même.

Onglet Fin Evals montrant un Eval avec des Simulations prêtes à être exécutées, avec un bouton Exécuter en haut à droite


Étape par étape : créer et exécuter un Eval

1. Créez votre Eval

Allez à Fin AI Agent > Test > Evals et cliquez sur Nouvel eval. Donnez-lui un nom clair et descriptif (jusqu'à 250 caractères). Vous et vos collègues réexécuterez cet Eval plus tard, il doit donc être évident ce qu'il couvre d'un coup d'œil (par exemple « Demandes de remboursement - parcours heureux et cas limites »).

Vous pouvez également joindre une Scorecard à ce stade pour mesurer la qualité des réponses de Fin selon des critères que vous définissez, en plus des tests de réussite/échec. Voir la notation de la qualité avec les Scorecards.

Écran de création de nouvel eval avec un champ de nom, un sélecteur optionnel de Scorecard, et un champ de description

2. Ajoutez des Simulations à votre Eval

Dans votre Eval, sélectionnez Nouvelle Simulation. Pour chaque Simulation, vous remplirez :

Si vous n'ajoutez pas de titre, la Simulation est automatiquement nommée d'après le premier message client dans la conversation.

Éditeur de Nouvelle Simulation affichant les champs pour le message client simulé, les instructions de suivi et le contexte

  • Ce que dit le client simulé : la conversation que le client simulé a avec Fin. Ajoutez des instructions de suivi si vous souhaitez que la conversation soit à plusieurs tours, afin qu'il y ait suffisamment de contexte pour générer le côté client de la conversation.

    Éditeur de Simulation avec le champ du message client rempli avec un scénario de demande de remboursement et des instructions de suivi

  • Tout contexte que Fin doit avoir : par exemple, des attributs client ou l'état d'un connecteur de données, pour que le test reflète un scénario réaliste du monde réel.

    Éditeur de Simulation affichant le champ de contexte où des attributs client ou l'état du connecteur de données peuvent être ajoutés

  • Comment le comportement de Fin doit être évalué :

    • Vérifications de la Simulation — ce que Fin doit dire ou faire pour réussir.

      Ajoutez un ou plusieurs des éléments suivants :

      • Réponse de Fin — la réponse de Fin remplit une condition que vous décrivez.

      • Procédure déclenchée — Fin a démarré une Procédure spécifique.

      • Procédure changée — Fin est passé d'une Procédure à une autre en cours de conversation.

      • Connecteur de données — Fin a appelé un connecteur de données spécifique.

      Éditeur de Simulation affichant les Vérifications de Simulation (Réponse de Fin, Procédure déclenchée) et les options de Vérification de Transfert
    • Vérifications de transfert — ce qui doit être vrai concernant le transfert à la fin de la conversation. Choisissez-en un :

      • Pas de transfert — Fin a résolu le problème sans transférer à une équipe ou un workflow.

      • Transféré à une équipe ou un coéquipier — Fin n'a pas pu répondre, ou vos instructions de transfert ont été appliquées.

      • Transféré à un workflow — Fin a passé la conversation à un workflow. (Remarque : la conversation n'est pas simulée après le transfert.)

Note :

  • Chaque Eval prend actuellement en charge jusqu'à 50 Simulations. Vous ne pourrez pas en ajouter plus tant que vous n'aurez pas supprimé les existantes.

  • Vous pouvez aussi créer une Simulation à partir d'une conversation réelle dans l'inbox — voir la section créer une Simulation à partir d'une conversation réelle ci-dessous.

  • Bientôt disponible :

    • Importation en masse depuis un CSV, pour ne pas avoir à créer chaque Simulation manuellement, une par une.

3. Exécutez l'Eval

Une fois vos Simulations en place, exécutez l'Eval. Fin traite chaque Simulation du groupe, et vous recevrez :

  • Un résultat réussi/échoué pour chaque Simulation, vérifié selon les Vérifications de Simulation et les Vérifications de transfert que vous avez définies.

  • La transcription complète de la conversation pour chaque exécution de Simulation.

  • Le journal des événements montrant la réflexion de Fin et les outils et informations utilisés à chaque étape.

  • Le résultat de la Vérification de transfert pour chacun : si Fin a traité la requête ou l'a transférée à votre équipe ou à un workflow. Parallèlement, vos Vérifications de Simulation confirment les détails que vous avez définis, comme si une Procédure a été déclenchée ou si un connecteur de données a été appelé.

Si une seule conversation nécessite que Fin travaille sur plusieurs Procédures, les Evals gèrent cela aussi. Vous pourrez voir Fin passer d'une Procédure à une autre au fur et à mesure que la conversation simulée se déroule, comme ce serait le cas pour un client réel.

Si une Simulation affiche Erreur au lieu de Réussi ou Échoué, la conversation n'a pas pu être complétée — vérifiez la configuration de la Simulation (message client, contexte ou vérifications) pour une mauvaise configuration. Si elle a échoué, ouvrez la transcription et le journal des événements pour voir où le comportement de Fin a divergé des vérifications que vous avez définies.

4. Relancez à la demande

Après avoir modifié le contenu, les Procédures ou les instructions de Fin, relancez vos Evals existants pour vérifier les régressions. Comme chaque Simulation est stockée et réutilisable, cela prend quelques secondes au lieu de vous obliger à recréer vos scénarios de test depuis le début, ce qui facilite la création de véritables suites de régression au fil du temps.


Créer une Simulation à partir d'une conversation réelle

Certains des tests les plus précieux proviennent de conversations déjà passées. Lorsque vous repérez une conversation réelle où la réponse de Fin n'était pas suffisante, vous pouvez transformer ce moment exact en replay — et continuer à le relancer au fur et à mesure que vous améliorez Fin, jusqu'à ce que la réponse soit correcte.

Un replay capture un instantané de la conversation jusqu'à la réponse de Fin que vous avez sélectionnée, et fige les tours précédents. Fin est alors relancé à partir de ce point de départ figé pour que vous puissiez voir comment il répond maintenant. Modifiez la configuration de Fin, exécutez-le à nouveau et comparez — car tout ce qui précède cette réponse reste fixe, vous testez la réponse unique qui vous importe, pas une cible mouvante.

Comment créer un replay

  1. Dans l'inbox, ouvrez la conversation et trouvez la réponse de Fin que vous souhaitez tester.

  2. Ouvrez le menu débordement (...) sur cette réponse de Fin et sélectionnez Ajouter la réponse de Fin à l'évaluation. (Cette action n'apparaît que sur les réponses de Fin pouvant être rejouées.)

    Conversation inbox Fin avec le menu débordement ouvert sur une réponse de Fin, montrant l'option Ajouter la réponse de Fin à l'évaluation

  3. Choisissez un Eval existant auquel l'ajouter, ou créez-en un nouveau en lui donnant un nom.

    Modal affichant une liste d'Evals existants pour ajouter le replay, avec une option pour créer un nouvel Eval par nom
  4. Le replay est enregistré comme une Simulation dans cet Eval, intitulé avec le message d'ouverture du client. Exécutez-le immédiatement, ou plus tard dans le cadre de l'Eval complète. Pour l'exécuter plus tard, allez dans Fin AI Agent > Test > Evals, ouvrez l'Eval, et cliquez sur Exécuter.

    Page de détail de l'Eval montrant le replay enregistré comme une Simulation intitulée avec le message d'ouverture du client

Comment utiliser un replay pour corriger et retester les réponses de Fin

Une fois que vous avez enregistré une Simulation replay à partir d'une conversation réelle, utilisez ce workflow pour diagnostiquer et corriger le problème :

  • Exécutez-le pour voir comment Fin répond à la conversation figée avec votre configuration actuelle.

  • Faites un changement — mettez à jour le contenu, une Procédure ou les instructions — puis relancez pour voir si la réponse s'est améliorée.

  • Ajoutez des Vérifications de Simulation, des Vérifications de transfert ou une Fiche d'évaluation pour définir ce que signifie « corrigé », afin d'obtenir un résultat clair réussi/échoué plutôt qu'un jugement subjectif.

  • Conservez la Simulation une fois qu'elle est validée. Elle sert désormais aussi de test de régression : relancez-la après des modifications futures pour vous assurer que la correction tient.

C'est la manière la plus rapide de transformer une erreur réelle en test permanent — au lieu d'écrire un scénario de zéro, vous partez de quelque chose qui s'est réellement produit.

Note : Une relecture rejoue la réponse unique Fin que vous avez sélectionnée, avec les tours précédents de la conversation figés. Si vous voulez simuler ce qui se passe ensuite dans la conversation, ajoutez des « instructions de suivi » dans l'éditeur de Simulation — elles indiquent au système ce que le client dirait ensuite pour que Fin ait des tours auxquels répondre.


Évaluer la qualité avec des Scorecards

Les vérifications de transfert et les vérifications de Simulation vous indiquent si Fin a fait ce qu'il fallait. Une Scorecard vous dit à quel point il l'a bien fait.

Par défaut, chaque Simulation est notée sur ses vérifications de transfert (Fin a-t-il répondu, ou transféré à votre équipe ou à un workflow) et sur toutes les vérifications de Simulation que vous avez définies (par exemple, une Procédure spécifique déclenchée ou un connecteur de données appelé). C'est une lecture réussite/échec du comportement de Fin.

Une Scorecard ajoute une couche d'évaluation qualitative en plus des vérifications réussite/échec de votre Eval — mesurant des dimensions comme le ton, la sécurité de la marque ou l'efficacité qui ne se traduisent pas clairement par un résultat binaire. Les Scorecards sont partagées avec les Monitors, vous testez donc selon la même grille de qualité avant qu'un changement soit mis en ligne, que vos monitors appliquent ensuite.

Ce qu'il y a dans une Scorecard

Une Scorecard est composée d'un ou plusieurs critères — les dimensions qui vous importent (par exemple « Efficacité », « Clarification », « Facilité d'escalade »). Chaque critère comprend :

  • Un nom : un label court qui apparaît dans vos résultats.

  • Une description : ce que vous évaluez et comment cela doit être jugé. C'est l'instruction que suit le juge IA — utilisez une des options préexistantes, ou soyez précis si vous créez la vôtre.

  • Options de notation : les scores possibles (au moins deux), chacun avec un nom (par exemple « Bon », « Correct », « Mauvais ») et une valeur numérique (par exemple 100 %, 50 %, 0 %).

Dans une Eval, les critères sont notés automatiquement par un juge IA, en même temps que le reste de la Simulation.

Comment configurer la notation d'une Scorecard

Lorsque vous associez une Scorecard à une Eval, vous pouvez configurer la contribution de chaque critère au score global :

  • Poids : donnez à chaque critère un poids pour refléter son importance. Les poids sont proportionnels, donc un critère avec un poids de 2 compte deux fois plus qu'un critère avec un poids de 1.

  • Critères critiques : marquez un critère comme Critique lorsqu'il est non négociable (par exemple pour la conformité ou la sécurité). Une note d'échec sur un critère Critique entraîne l'échec de toute la revue qualitative, quels que soient les autres scores.

  • Seuil de réussite : définissez le score global minimum qu'une Simulation doit atteindre pour réussir la qualité.

Comment lire les résultats d'une Scorecard

Lorsqu'une Eval est lancée, chaque Simulation affiche ses résultats de vérification de transfert et de vérification de Simulation comme avant, plus son score Scorecard et la note ainsi que la raison données par le juge pour chaque critère. Parce que le juge montre son raisonnement, vous pouvez voir pourquoi une réponse a obtenu ce score, et en déduire directement une correction.

Résultat de Simulation montrant les scores Scorecard par critère avec la note et le raisonnement du juge IA pour chacun

Conseil : Des critères vagues produisent des scores vagues. Rédigez chaque critère comme si vous expliquiez à un nouveau réviseur — détaillez ce qu'est un « bon » et ce qui doit faire échouer la note. Voir comment rédiger des critères efficaces pour Monitor & Scorecard.


Comment les Evals complètent les Simulations de Procédure

Les Simulations de Procédure ne vont nulle part, et elles restent l'outil adapté pour un travail spécifique : tester une Procédure isolément. Elles vous obligent à définir les critères de succès et de résultat pour chaque test, et sont idéales pour valider qu'une Procédure individuelle se comporte correctement seule.

Les Evals prennent le relais là où les Simulations de Procédure s'arrêtent. Là où une Simulation de Procédure est limitée à une seule Procédure, une Simulation Eval peut exercer toute la configuration de Fin de bout en bout : enchaînant plusieurs Procédures, contenus, guides et connecteurs de données dans une conversation réaliste unique, comme dans une vraie conversation client.

Utilisez-les ensemble :

  • Utilisez les Simulations de Procédure pour construire et valider une Procédure individuelle pendant que vous y travaillez.

  • Utilisez les Evals pour valider le parcours client complet une fois que cette Procédure est en ligne, y compris comment elle interagit avec tout le reste dans la configuration de Fin.


Utiliser les Evals au lieu de Batch Test

Aujourd'hui, de nombreuses équipes utilisent Batch Test pour valider Fin, ce qui consiste à poser un lot de questions informatives à un seul tour et à noter manuellement chaque réponse comme Bonne, Acceptable ou Mauvaise.

Fin Evals est conçu pour faire tout ce que Batch Test fait, et bien plus encore :

Le tableau ci-dessous compare Batch Test et Fin Evals selon quatre dimensions : type de conversation, notation, test de régression et regroupement.

Batch Test

Fin Evals

Type de conversation

Questions informatives à un seul tour uniquement

Conversations complètes à plusieurs tours

Notation

Notation manuelle (Bonne/Acceptable/Mauvaise)

Automatique — vérifications déterministes plus IA en tant que juge selon les critères que vous définissez

Test de régression

Relance manuelle

Relance à la demande en tant que suite de régression

Regroupement

Groupé, jusqu'à 50 questions

Groupé en Evals jusqu'à 50 Simulations, organisés comme vous le souhaitez

Si vous utilisez actuellement Batch Test, nous vous encourageons à commencer à créer des scénarios de test équivalents sous forme d'Evals pendant la bêta. Evals vous offre une manière plus rapide, plus automatisée et plus réaliste d'obtenir la même confiance, et plus encore.


Limites d'utilisation des Simulations

Il y a une limite au nombre de Simulations que vous pouvez exécuter dans Evals chaque mois. Cette limite s'applique au niveau de l'espace de travail et se réinitialise le premier jour de chaque mois civil.

Chaque espace de travail reçoit une allocation mensuelle de simulations. Cette allocation est basée sur le segment de volume de conversation de votre espace de travail, les clients plus importants recevant des allocations plus élevées.

L'allocation de simulation est basée sur le volume de conversations de votre workspace dans Intercom.

  • Nous attribuons votre workspace à un segment en fonction du nombre de conversations du dernier mois calendaire.

  • Votre segment est réévalué chaque mois et votre allocation reflétera le volume de conversations du mois le plus récent.

  • Si votre volume de conversations augmente ou diminue, votre allocation peut changer lors du prochain cycle mensuel.

Le tableau ci-dessous montre l'allocation mensuelle de Simulation par segment de volume de conversations du workspace.

Segment de volume de conversations

Limite de Simulation par mois

Moins de 1K

250

1K–15K

1 000

15K–100K

1 750

100K–1M

5 000

1M+

12 500

Surveillance de votre utilisation

Pour vous aider à gérer vos tests, vous verrez des indicateurs visuels dans l'onglet Evaluations :

Alerte d'utilisation

Lorsque votre workspace atteint 80 % de sa limite mensuelle, une bannière d'avertissement jaune apparaît. Elle affiche votre utilisation actuelle (par exemple, « 850/1000 ») et vous rappelle la date de réinitialisation de la limite.

Onglet Evals affichant une bannière d'avertissement jaune à 850/1000 Simulations utilisées avec la date de réinitialisation mensuelle affichée

Limite atteinte

Une fois que vous atteignez 100 % de votre limite mensuelle, un message d'erreur rouge apparaît. Vous ne pourrez plus lancer de Simulations dans Evals jusqu'au début du mois suivant.

Onglet Evals affichant une bannière d'erreur rouge indiquant que la limite mensuelle de Simulation a été atteinte et qu'aucune exécution supplémentaire n'est possible


Points clés à connaître sur la version bêta

Fin Evals est en Closed Beta, et nous le développons activement. Voici ce qu'il faut garder à l'esprit pour le moment :

  • L'organisation au-delà d'une Eval elle-même n'est pas encore disponible. Il n'existe actuellement aucune structure de dossiers pour regrouper les Evals par équipe ou propriété.

  • L'annotation dans le produit arrive bientôt. Vous pourrez bientôt ajouter des notes simples à une Simulation, mais il n'y a pas encore de moyen dédié pour enregistrer si un évaluateur est d'accord ou non avec un résultat.

  • Il n'y a pas encore de modèles préconstruits. Les catégories de tests courantes comme l'injection de prompt ou les questions génériques en cas limite n'ont pas de point de départ prêt à l'emploi — vous devrez les créer vous-même pour l'instant.

  • Workflows sont hors de portée pour le moment. Evals couvre actuellement la configuration des réponses de Fin — contenu, procédures, directives, audiences et connecteurs de données — mais pas les Workflows.

  • Jusqu'à 50 Simulations par Eval, et jusqu'à 50 lignes par import CSV.


Comprendre réussite/échec : le comportement par défaut « no handoff »

Si vous ajoutez une Simulation sans vérification explicite de transfert et sans vérifications de Simulation, Evals évalue par défaut selon un critère « No handoff » — ce qui signifie que la Simulation réussit uniquement si Fin a résolu la conversation sans la transférer à une équipe ou un workflow.

Ce comportement par défaut n'est pas affiché dans l'interface de configuration de la Simulation, ce qui signifie que les Simulations peuvent échouer de manière inattendue si Fin a escaladé et que vous n'aviez pas l'intention de tester cela. Si une Simulation échoue et que vous ne voyez pas pourquoi, vérifiez si une vérification de transfert a été définie — si aucune n'a été définie, c'est la règle par défaut « no handoff » qui a causé l'échec.

Conseil : Ajoutez toujours une vérification explicite de transfert à chaque Simulation pour que le résultat réussite/échec reflète votre intention, pas la valeur par défaut.

Vous avez des retours sur Fin Evals ? Nous serions ravis de les recevoir, alors veuillez contacter votre responsable de compte.

Avez-vous trouvé la réponse à votre question ?