Ir al contenido principal

Evals para Fin [beta]

Prueba el comportamiento de Fin antes de que llegue a tus clientes

Escrito por Beth-Ann Sher

Evals está actualmente en beta cerrada. Si estás interesado en acceso anticipado, por favor completa este formulario de solicitud beta. Para usar Evals a través de Operator, también necesitas acceso a Operator.


¿Qué es Fin Evals?

Usa Fin Evals para crear conversaciones de prueba realistas, ejecutarlas contra tu configuración de Fin y obtener resultados automáticos de aprobado/reprobado, antes de que cualquier cambio llegue a un cliente real. Este artículo explica cómo crear Evals y Simulaciones, ejecutarlas manualmente o vía Operator, leer resultados con Scorecards y construir suites de regresión que detecten problemas con el tiempo.

En lugar de adivinar cómo Fin manejará una solicitud de reembolso complicada, un cliente enojado o un cambio que acabas de hacer a un Procedure, puedes crear conversaciones de prueba realistas, ejecutarlas contra Fin y obtener un resultado automático de aprobado/reprobado. Ejecuta el mismo conjunto de pruebas cada vez que hagas un cambio y sabrás en minutos si Fin sigue comportándose como esperas.

Fin Evals se basa en dos conceptos simples:

  • Evals son un contenedor (un grupo temático de pruebas). Piensa en "Solicitudes de reembolso", "Escenarios de escalación" o "Tono y amabilidad".

  • Simulaciones son las pruebas individuales dentro de un Eval. Cada Simulación es una conversación realista de múltiples turnos entre un cliente simulado y Fin, junto con los criterios contra los que quieres juzgar el comportamiento de Fin.

Cuando ejecutas un Eval, cada Simulación dentro de él se ejecuta automáticamente y obtienes un resultado de aprobado/reprobado para cada una, evaluado por una combinación de verificaciones deterministas y un juez de IA, basado en los criterios que estableciste.

Vista general de la interfaz de Fin Evals mostrando una lista de Evals con resultados de aprobado/reprobado para cada Simulación


Por qué, cuándo y cómo deberías usar Evals

¿Por qué usar Evals?

El comportamiento de Fin no es fijo, depende de tu contenido, tus Procedures, tu guía y los datos a los que tiene acceso en el momento de responder. Cada vez que haces un cambio en cualquiera de estos, existe la posibilidad de que cambie cómo se comporta Fin en otro lugar, de formas que son fáciles de pasar por alto hasta que un cliente real encuentra el problema.

Evals te dan una forma repetible de verificar el comportamiento de Fin en conversaciones realistas de múltiples turnos y detectar problemas antes de que lleguen a una conversación en vivo.

¿Cuándo deberías usar Evals?

Usa un Eval siempre que quieras tener confianza en cómo se comporta Fin:

  • Antes de enviar un cambio: al contenido, guía, Procedures o cualquier otra cosa en la configuración de Fin.

  • Después de una corrección: para confirmar que realmente resolviste el problema que querías solucionar.

  • De forma continua: vuelve a ejecutar Evals existentes periódicamente como una suite de regresión, para detectar desviaciones inesperadas antes que los clientes.

  • Antes de poner Fin en producción: para verificar que tu configuración funciona como esperas antes de que tus clientes interactúen con Fin por primera vez.

Cómo organizar tus Evals

Agrupa Simulaciones en un Eval según el tema que tenga sentido para tu negocio. Puntos de partida comunes que han usado clientes beta:

  • Escenarios de escalación: situaciones donde Fin debería (o no debería) pasar la conversación a un humano.

  • Escenarios por tema: un tema específico como solicitudes de reembolso, probado en una variedad de variaciones.

  • Escenarios de comportamiento: verificar que Fin mantenga el tono y la marca en diferentes situaciones, sin importar el tema.


Creación y análisis de Evals con Operator

Si tienes acceso a Operator, puede crear tus Evals y Simulaciones por ti y analizar los resultados una vez que se hayan ejecutado.

Cómo crear un Eval con Operator

Ve a Operator y pídele que cree un Eval para tu caso de uso.

Interfaz de chat de Operator mostrando un mensaje pidiendo a Operator crear un Eval para escenarios de solicitudes de reembolso

Puedes guiarlo sobre qué deberían ser las Simulaciones, las verificaciones de Simulación y las verificaciones de transferencia, o dejar que Operator las infiera. Una vez que haya creado tu Eval y Simulaciones, aparecerán para que las revises y apruebes.

Operator mostrando un Eval propuesto con Simulaciones y verificaciones de transferencia listo para revisar y aprobar

Cómo ejecutar un Eval con Operator

Cuando estés listo, pídele a Operator que ejecute el Eval por ti.

Operator ejecutando un Eval, mostrando cada Simulación siendo procesada en tiempo real con un indicador de progreso

Te mostrará los resultados a medida que se ejecuta cada Simulación.

Tabla de resultados de Operator mostrando Simulaciones con estados Aprobado, Reprobado y Error y las verificaciones detrás de cada resultado

Una vez que todas las Simulaciones se hayan ejecutado, Operator presenta los resultados y te los explica:

  • Una tabla de resultados: cada Simulación con su resultado general (Aprobado, Reprobado o Error) y las verificaciones individuales detrás, para que puedas ver por qué obtuvo ese resultado. En el ejemplo anterior, "Exportación masiva de espacio de trabajo" falló porque la verificación de transferencia falló (Fin escaló cuando no debería), aunque la verificación de respuesta de Fin pasó.

  • Un resumen: los conteos principales (3 aprobados, 1 reprobado, 2 con error) seguido de un desglose en lenguaje sencillo de qué salió mal y por qué. Aquí, Operator rastrea la exportación fallida hasta una regla de guía que dirige a un humano cada vez que aparece la palabra "failure".

Operator no solo reporta los resultados, también propone las siguientes acciones y ofrece realizarlas por ti.

No necesitas Operator para ejecutar un Eval. Ve a Fin AI Agent > Test > Evals y ejecútalo tú mismo.

Pestaña Fin Evals mostrando un Eval con Simulaciones listas para ejecutar, con un botón Ejecutar en la esquina superior derecha


Paso a paso: crear y ejecutar un Eval

1. Crea tu Eval

Ve a Fin AI Agent > Test > Evals y haz clic en Nuevo eval. Dale un nombre claro y descriptivo (hasta 250 caracteres). Tú y tus colegas volverán a ejecutar este Eval más adelante, así que debe ser obvio qué cubre de un vistazo (por ejemplo, "Solicitudes de reembolso - camino feliz y casos límite").

También puedes adjuntar opcionalmente un Scorecard en esta etapa para medir la calidad de las respuestas de Fin contra criterios que definas, además de la prueba de aprobado/reprobado. Ver puntuación de calidad con Scorecards.

Pantalla de creación de nuevo eval con campo de nombre, selector opcional de Scorecard y campo de descripción

2. Añade Simulaciones a tu Eval

Dentro de tu Eval, selecciona Nueva Simulación. Para cada Simulación, completarás:

Si no agregas un título, la Simulación se nombra automáticamente a partir del primer mensaje del cliente en la conversación.

Editor de Nueva Simulación mostrando campos para el mensaje simulado del cliente, instrucciones de seguimiento y contexto

  • Lo que dice el cliente simulado: la conversación que el cliente simulado tiene con Fin. Agrega instrucciones de seguimiento si quieres que la conversación sea de varios turnos, para que haya suficiente contexto para generar el lado del cliente de la conversación.

    Editor de Simulación con el campo del mensaje del cliente completado con un escenario de solicitud de reembolso e instrucciones de seguimiento

  • Cualquier contexto que Fin deba tener: por ejemplo, atributos del cliente o el estado de un conector de datos, para que la prueba refleje un escenario realista del mundo real.

    Editor de Simulación mostrando el campo de contexto donde se pueden agregar atributos del cliente o el estado del conector de datos

  • Cómo se debe evaluar el comportamiento de Fin:

    • Verificaciones de Simulación — lo que Fin debe decir o hacer para aprobar.

      Agrega uno o más de:

      • Respuesta de Fin — la respuesta de Fin cumple una condición que describes.

      • Procedimiento activado — Fin inició un Procedimiento específico.

      • Procedimiento cambiado — Fin pasó de un Procedimiento a otro en medio de la conversación.

      • Conector de datos — Fin llamó a un conector de datos específico.

      Editor de Simulación mostrando Verificaciones de Simulación (Respuesta de Fin, Procedimiento activado) y opciones de Verificación de Transferencia
    • Verificaciones de Transferencia — lo que debe ser cierto sobre la transferencia al final de la conversación. Elige uno:

      • Sin transferencia — Fin lo resolvió sin transferir a un equipo o workflow.

      • Transferido a un equipo o compañero — Fin no pudo responder, o se aplicó tu guía de transferencia.

      • Transferido a un workflow — Fin pasó la conversación a un workflow. (Nota: la conversación no se simula después de la transferencia.)

Nota:

  • Cada Eval actualmente soporta hasta 50 Simulaciones. No podrás agregar más hasta que elimines las existentes.

  • También puedes crear una Simulación a partir de una conversación real de inbox — consulta la sección crear una Simulación a partir de una conversación real a continuación.

  • Próximamente:

    • Importación masiva desde un CSV, para que no tengas que crear cada Simulación manualmente, una por una.

3. Ejecutar el Eval

Una vez que tus Simulaciones estén listas, ejecuta el Eval. Fin procesa cada Simulación del grupo y recibirás:

  • Un resultado de aprobado/reprobado para cada Simulación, verificado contra las Verificaciones de Simulación y Verificaciones de Transferencia que definiste.

  • La transcripción completa de la conversación para cada ejecución de Simulación.

  • El registro de eventos que muestra el pensamiento de Fin y las herramientas e información que usó en cada turno.

  • El resultado de la Verificación de Transferencia para cada una: si Fin manejó la consulta o la transfirió a tu equipo o a un workflow. Junto a esto, tus Verificaciones de Simulación confirman los detalles que estableciste, como si se activó un Procedimiento o se llamó a un conector de datos.

Si una sola conversación necesita que Fin trabaje con múltiples Procedimientos, los Evals también lo manejan. Podrás ver a Fin cambiar entre Procedimientos a medida que se desarrolla la conversación simulada, tal como lo haría con un cliente real.

Si una Simulación muestra Error en lugar de Aprobado o Reprobado, la conversación no pudo completarse — revisa la configuración de la Simulación (mensaje del cliente, contexto o verificaciones) por una mala configuración. Si Reprobó, abre la transcripción y el registro de eventos para ver dónde el comportamiento de Fin se desvió de las verificaciones que estableciste.

4. Ejecutar de nuevo bajo demanda

Después de hacer cualquier cambio en el contenido, Procedimientos o guía de Fin, vuelve a ejecutar tus Evals existentes para verificar regresiones. Como cada Simulación se almacena y es reutilizable, esto toma segundos en lugar de requerir que recrees tus escenarios de prueba desde cero, facilitando la creación de suites genuinas de regresión con el tiempo.


Crear una Simulación a partir de una conversación real

Algunas de las pruebas más valiosas provienen de conversaciones que ya han ocurrido. Cuando detectas una conversación real donde la respuesta de Fin no fue suficiente, puedes convertir ese momento exacto en una repetición — y seguir ejecutándola mientras mejoras a Fin, hasta que la respuesta sea correcta.

Una repetición captura una instantánea de la conversación hasta la respuesta de Fin que seleccionaste, y congela los turnos anteriores en su lugar. Luego, Fin se ejecuta nuevamente contra ese punto de partida congelado para que puedas ver cómo responde ahora. Cambia la configuración de Fin, ejecútalo de nuevo y compara — porque todo antes de esa respuesta permanece fijo, estás probando la única respuesta que te importa, no un objetivo en movimiento.

Cómo crear una repetición

  1. En el inbox, abre la conversación y encuentra la respuesta de Fin que quieres probar.

  2. Abre el menú de desbordamiento (...) en esa respuesta de Fin y selecciona Agregar respuesta de Fin a la Evaluación. (Esta acción solo aparece en respuestas de Fin que pueden ser repetidas.)

    Conversación de inbox de Fin con el menú de desbordamiento abierto en una respuesta de Fin, mostrando la opción Agregar respuesta de Fin a la Evaluación

  3. Elige un Eval existente para agregarla, o crea uno nuevo dándole un nombre.

    Modal mostrando una lista de Evals existentes para agregar la repetición, con una opción para crear un nuevo Eval por nombre
  4. La repetición se guarda como una Simulación dentro de ese Eval, titulada con el mensaje inicial del cliente. Ejecútala de inmediato o ejecútala más tarde como parte de todo el Eval. Para ejecutarla más tarde, ve a Fin AI Agent > Test > Evals, abre el Eval y haz clic en Ejecutar.

    Página de detalle del Eval mostrando la repetición guardada como una Simulación titulada con el mensaje inicial del cliente

Cómo usar una repetición para corregir y volver a probar las respuestas de Fin

Una vez que hayas guardado una Simulación de repetición de una conversación real, usa este workflow para diagnosticar y corregir el problema:

  • Ejecuta para ver cómo responde Fin a la conversación congelada con tu configuración actual.

  • Haz un cambio — actualiza contenido, un Procedimiento o guía — luego vuelve a ejecutar para ver si la respuesta mejoró.

  • Agrega Verificaciones de Simulación, Verificaciones de Transferencia o una Tarjeta de puntuación para definir cómo se ve lo 'arreglado', para que obtengas un claro aprobado/reprobado en lugar de un juicio subjetivo.

  • Mantén la Simulación una vez que pase. Ahora también funciona como una prueba de regresión: ejecútala de nuevo después de futuros cambios para asegurarte de que la corrección se mantiene.

Esta es la forma más rápida de convertir un error del mundo real en una prueba permanente: en lugar de escribir un escenario desde cero, comienzas con algo que realmente sucedió.

Nota: Una repetición vuelve a ejecutar la única respuesta de Fin que seleccionaste, con los turnos anteriores de la conversación congelados. Si quieres simular lo que sucede después en la conversación, añade 'instrucciones de seguimiento' en el editor de Simulación; estas indican al sistema lo que el cliente diría a continuación para que Fin tenga turnos para responder.


Calificación de calidad con Scorecards

Las comprobaciones de transferencia y las comprobaciones de Simulación te indican si Fin hizo lo correcto. Un Scorecard te dice qué tan bien lo hizo.

Por defecto, cada Simulación se califica según sus comprobaciones de transferencia (si Fin respondió o transfirió a tu equipo o a un workflow) y cualquier comprobación de Simulación que configures (por ejemplo, que se haya activado un Procedimiento específico o llamado un conector de datos). Esa es una lectura de aprobado/reprobado sobre el comportamiento de Fin.

Un Scorecard añade una capa cualitativa de puntuación sobre las comprobaciones de aprobado/reprobado de tu Eval, midiendo dimensiones como tono, seguridad de marca o eficiencia que no se ajustan claramente a un resultado binario. Los Scorecards se comparten con los Monitores, por lo que pruebas con la misma rúbrica de calidad antes de que un cambio se active y que tus monitores aplican después.

Qué contiene un Scorecard

Un Scorecard está compuesto por uno o más criterios, las dimensiones que te importan (por ejemplo, "Eficiencia", "Clarificación", "Facilidad de escalación"). Cada criterio tiene:

  • Un nombre: una etiqueta corta que aparece en tus resultados.

  • Una descripción: lo que estás evaluando y cómo debe juzgarse. Esta es la instrucción que sigue el juez de IA; usa una de las opciones preexistentes o sé específico si creas la tuya propia.

  • Opciones de calificación: las posibles puntuaciones (al menos dos), cada una con un nombre (por ejemplo, "Bueno", "Aceptable", "Pobre") y un valor numérico (por ejemplo, 100%, 50%, 0%).

En un Eval, los criterios se califican automáticamente por un juez de IA, junto con el resto de la Simulación.

Cómo configurar la puntuación del Scorecard

Al adjuntar un Scorecard a un Eval, puedes configurar cómo cada criterio contribuye a la puntuación general:

  • Ponderación: asigna a cada criterio un peso para reflejar su importancia. Los pesos son proporcionales, por lo que un criterio con peso 2 cuenta el doble que uno con peso 1.

  • Criterios críticos: marca un criterio como Crítico cuando es innegociable (por ejemplo, para cumplimiento o seguridad). Una calificación reprobatoria en un criterio Crítico hace que toda la revisión cualitativa sea reprobada, sin importar las otras puntuaciones.

  • Umbral de aprobación: establece la puntuación mínima general que una Simulación necesita para aprobar en calidad.

Cómo interpretar los resultados del Scorecard

Cuando se ejecuta un Eval, cada Simulación muestra sus resultados de comprobación de transferencia y comprobación de Simulación como antes, además de su puntuación en el Scorecard y la calificación y razón que el juez dio para cada criterio. Debido a que el juez muestra su razonamiento, puedes ver por qué una respuesta obtuvo esa puntuación y convertir eso directamente en una corrección.

Resultado de la Simulación mostrando puntuaciones del Scorecard por criterio con la calificación y razonamiento del juez de IA para cada uno

Consejo: Los criterios vagos producen puntuaciones vagas. Escribe cada criterio como si le explicaras a un nuevo revisor: detalla cómo es un 'bueno' y qué debería hacer que la puntuación sea baja. Consulta cómo escribir criterios efectivos para Monitor y Scorecard.


Cómo los Evals complementan las Simulaciones de Procedimientos

Las Simulaciones de Procedimientos no van a desaparecer, y siguen siendo la herramienta adecuada para un trabajo específico: probar un Procedimiento en aislamiento. Requieren que definas criterios de éxito y resultado para cada prueba, y son ideales para validar que un Procedimiento individual se comporte correctamente por sí solo.

Los Evals continúan donde las Simulaciones de Procedimientos terminan. Mientras que una Simulación de Procedimiento se limita a un solo Procedimiento, una Simulación de Eval puede ejercitar toda la configuración de Fin de extremo a extremo: moviéndose a través de múltiples Procedimientos, contenido, guías y conectores de datos dentro de una sola conversación realista, tal como lo haría una conversación real con un cliente.

Úsalos juntos:

  • Usa Simulaciones de Procedimientos para construir y validar un Procedimiento individual mientras trabajas en él.

  • Usa Evals para validar todo el recorrido del cliente una vez que ese Procedimiento esté activo, incluyendo cómo interactúa con todo lo demás en la configuración de Fin.


Usando Evals en lugar de Batch Test

Hoy, muchos equipos usan Batch Test para validar Fin, lo que implica hacer un lote de preguntas informativas de un solo turno y calificar manualmente cada respuesta como Buena, Aceptable o Pobre.

Fin Evals está diseñado para hacer todo lo que hace Batch Test, y mucho más:

La tabla a continuación compara Batch Test y Fin Evals en cuatro dimensiones: tipo de conversación, puntuación, pruebas de regresión y agrupación.

Batch Test

Fin Evals

Tipo de conversación

Solo preguntas informativas de un solo turno

Conversaciones completas de múltiples turnos

Puntuación

Calificación manual (Buena/Aceptable/Pobre)

Automática: comprobaciones deterministas más IA como juez según criterios que configures

Pruebas de regresión

Repetición manual

Repetición bajo demanda como suite de regresión

Agrupación

Agrupado, hasta 50 preguntas

Agrupado en Evals de hasta 50 Simulaciones, organizados como prefieras

Si actualmente usas Batch Test, te animamos a comenzar a crear escenarios de prueba equivalentes como Evals durante la beta. Evals te ofrece una forma más rápida, automatizada y realista de obtener la misma confianza y más.


Límites de uso de Simulación

Hay un límite en la cantidad de Simulaciones que puedes ejecutar dentro de Evals cada mes. Este límite se aplica a nivel de espacio de trabajo y se restablece el primer día de cada mes calendario.

Cada espacio de trabajo recibe una asignación mensual de ejecuciones de simulación. La asignación se basa en el segmento de volumen de conversación de tu espacio de trabajo, con clientes más grandes recibiendo asignaciones mayores.

La asignación de simulación se basa en el volumen de conversaciones de tu workspace en Intercom.

  • Asignamos tu workspace a un segmento usando el número de conversaciones del último mes calendario.

  • Tu segmento se reevalúa mensualmente y tu asignación reflejará el volumen de conversaciones del mes más reciente.

  • Si tu volumen de conversaciones aumenta o disminuye, tu asignación puede cambiar en el siguiente ciclo mensual.

La tabla a continuación muestra la asignación mensual de ejecuciones de Simulation por segmento de volumen de conversaciones del workspace.

Segmento de Volumen de Conversación

Límite de Simulation por mes

Menos de 1K

250

1K–15K

1,000

15K–100K

1,750

100K–1M

5,000

1M+

12,500

Monitoreo de tu uso

Para ayudarte a gestionar tus pruebas, verás indicadores visuales dentro de la pestaña Evaluations:

Advertencia de uso

Cuando tu workspace alcance el 80% de su límite mensual, aparecerá un banner amarillo de advertencia. Muestra tu uso actual (por ejemplo, "850/1000") y te recuerda cuándo se reiniciará el límite.

Pestaña Evals mostrando un banner amarillo de advertencia en 850/1000 Simulations usadas con la fecha de reinicio mensual mostrada

Límite alcanzado

Una vez que alcances el 100% de tu límite mensual, aparecerá un mensaje de error rojo. No podrás ejecutar más Simulations dentro de Evals hasta el inicio del próximo mes.

Pestaña Evals mostrando un banner rojo de error indicando que se ha alcanzado el límite mensual de Simulation y no se pueden hacer más ejecuciones


Aspectos clave sobre la beta

Fin Evals está en Beta Cerrada y estamos desarrollándola activamente. Esto es lo que debes tener en cuenta ahora mismo:

  • Organizar más allá de una Eval en sí no está disponible aún. Actualmente no hay estructura de carpetas para agrupar Evals por equipo o propiedad.

  • La anotación dentro del producto está en camino. Pronto podrás agregar notas simples a una Simulation, pero aún no hay una forma dedicada para registrar si un revisor está de acuerdo o en desacuerdo con un resultado.

  • Aún no hay plantillas preconstruidas. Categorías comunes de prueba como inyección de prompt o preguntas genéricas de casos límite no tienen un punto de partida listo; por ahora las construirás desde cero.

  • Workflows están fuera del alcance por ahora. Evals cubre actualmente la configuración de respuestas de Fin: contenido, Procedures, guías, audiencias y conectores de datos, pero no Workflows.

  • Hasta 50 Simulations por Eval, y hasta 50 filas por importación CSV.


Entendiendo aprobado/reprobado: el comportamiento predeterminado de "no handoff"

Si agregas una Simulation sin verificación explícita de Handoff y sin verificaciones de Simulation, Evals evalúa por defecto contra un criterio de "No handoff", lo que significa que la Simulation pasa solo si Fin resolvió la conversación sin transferir a un equipo o workflow.

Este valor predeterminado no se muestra en la interfaz de configuración de Simulation, lo que significa que las Simulations pueden fallar de formas inesperadas si Fin escaló y no tenías la intención de probar eso. Si una Simulation falla y no ves por qué, verifica si se estableció una verificación de Handoff; si no, la regla predeterminada de no handoff es la que la falló.

Consejo: Siempre agrega una verificación explícita de Handoff a cada Simulation para que el resultado aprobado/reprobado refleje tu intención, no el valor predeterminado.

¿Tienes comentarios sobre Fin Evals? Nos encantaría escucharlos, así que por favor contacta a tu gerente de cuenta.

¿Ha quedado contestada tu pregunta?