Evals está atualmente em beta fechado. Se você estiver interessado em acesso antecipado, por favor preencha este formulário de solicitação de beta. Para usar Evals via Operator, você também precisa de acesso ao Operator.
O que é Fin Evals?
Use Fin Evals para criar conversas de teste realistas, executá-las contra sua configuração do Fin e obter resultados automáticos de aprovação/reprovação — antes que qualquer alteração chegue a um cliente real. Este artigo explica como criar Evals e Simulações, executá-los manualmente ou via Operator, ler resultados com Scorecards e construir suítes de regressão que detectam problemas ao longo do tempo.
Em vez de adivinhar como o Fin lidará com um pedido de reembolso complicado, um cliente irritado ou uma alteração que você acabou de fazer em um Procedure, você pode criar conversas de teste realistas, executá-las contra o Fin e obter um resultado automático de aprovação/reprovação. Execute o mesmo conjunto de testes sempre que fizer uma alteração e você saberá em minutos se o Fin ainda se comporta como esperado.
Fin Evals é construído em torno de dois conceitos simples:
Evals são um contêiner (um grupo temático de testes). Pense em "Pedidos de reembolso", "Cenários de escalonamento" ou "Tom e simpatia".
Simulações são os testes individuais dentro de um Eval. Cada Simulação é uma conversa realista de múltiplas interações entre um cliente simulado e o Fin, junto com os critérios contra os quais você quer que o comportamento do Fin seja avaliado.
Quando você executa um Eval, cada Simulação dentro dele é executada automaticamente, e você obtém um resultado de aprovação/reprovação para cada uma, avaliado por uma combinação de verificações determinísticas e um juiz de IA, baseado nos critérios que você definiu.
Por que, quando e como você deve usar Evals
Por que usar Evals?
O comportamento do Fin não é fixo, depende do seu conteúdo, seus Procedures, suas orientações e dos dados aos quais ele tem acesso no momento da resposta. Toda vez que você faz uma alteração em qualquer um desses, há uma chance de que o comportamento do Fin mude em outro lugar, de formas que são fáceis de passar despercebidas até que um cliente real enfrente o problema.
Evals oferecem uma maneira repetível de verificar o comportamento do Fin em conversas realistas de múltiplas interações e detectar problemas antes que eles cheguem a uma conversa ao vivo.
Quando você deve usar Evals?
Use um Eval sempre que quiser ter confiança em como o Fin se comporta:
Antes de enviar uma alteração: para conteúdo, orientações, Procedures ou qualquer outra coisa na configuração do Fin.
Após uma correção: para confirmar que você realmente resolveu o problema que pretendia resolver.
De forma contínua: reexecute Evals existentes periodicamente como uma suíte de regressão, para detectar desvios inesperados antes que os clientes percebam.
Antes de colocar o Fin em produção: para verificar se sua configuração está funcionando da maneira esperada antes que seus clientes interajam com o Fin pela primeira vez.
Como organizar seus Evals
Agrupe Simulações em um Eval pelo tema que fizer sentido para o seu negócio. Pontos de partida comuns usados por clientes beta:
Cenários de escalonamento: situações em que o Fin deve (ou não deve) passar para um humano.
Cenários de tópicos: um tópico específico como pedidos de reembolso, testado em várias variações.
Cenários comportamentais: verificar se o Fin mantém o tom e a marca em diferentes situações, independentemente do tópico.
Criando e analisando Evals com Operator
Se você tem acesso ao Operator, ele pode criar seus Evals e Simulações para você, e analisar os resultados depois que forem executados.
Como criar um Eval com Operator
Vá para Operator e peça para criar um Eval para seu caso de uso.
Você pode orientá-lo sobre quais devem ser as Simulações, as verificações das Simulações e as verificações de passagem, ou deixar que o Operator as deduza. Depois que ele criar seu Eval e Simulações, eles aparecerão para você revisar e aprovar.
Como executar um Eval com Operator
Quando estiver pronto, peça ao Operator para executar o Eval para você.
Ele mostrará os resultados conforme cada Simulação for executada.
Quando todas as Simulações forem executadas, o Operator apresenta os resultados e os explica para você:
Uma tabela de resultados — cada Simulação com seu resultado geral (Aprovado, Reprovado ou Erro) e as verificações individuais por trás dele, para que você possa ver por que ele chegou a esse resultado. No exemplo acima, "Exportação em massa do workspace" falhou porque a verificação de passagem falhou (Fin escalou quando não deveria), mesmo que a verificação da resposta do Fin tenha passado.
Um resumo — as contagens principais (3 aprovados, 1 reprovado, 2 com erro) seguidas por uma explicação em linguagem simples do que deu errado e por quê. Aqui, o Operator rastreia a exportação com falha até uma regra de orientação que direciona para um humano sempre que a palavra "failure" aparece.
O Operator não apenas relata os resultados — ele propõe as próximas ações e oferece-se para executá-las para você.
Você não precisa do Operator para executar um Eval. Vá para Fin AI Agent > Test > Evals e execute você mesmo.
Passo a passo: criando e executando um Eval
1. Crie seu Eval
Vá para Fin AI Agent > Test > Evals e clique em Novo eval. Dê um nome claro e descritivo (até 250 caracteres). Você e seus colegas irão reexecutar este Eval depois, então deve ser óbvio o que ele cobre à primeira vista (ex: "Pedidos de reembolso - caminho feliz e casos extremos").
Você também pode opcionalmente anexar um Scorecard nesta etapa para medir a qualidade das respostas do Fin contra critérios que você definir, além do teste de aprovação/reprovação. Veja Como pontuar qualidade com Scorecards.
2. Adicione Simulações ao seu Eval
Dentro do seu Eval, selecione Nova Simulação. Para cada Simulação, você preencherá:
Se você não adicionar um título, a Simulação será nomeada automaticamente a partir da primeira mensagem do cliente na conversa.
O que o cliente simulado diz: a conversa que o cliente simulado tem com Fin. Adicione instruções de acompanhamento se quiser que a conversa seja de múltiplas interações, para que haja contexto suficiente para gerar o lado do cliente na conversa.
Qualquer contexto que Fin deve ter: por exemplo, atributos do cliente ou o estado de um conector de dados, para que o teste reflita um cenário realista do mundo real.
Como o comportamento do Fin deve ser avaliado:
Verificações da Simulação — o que Fin deve dizer ou fazer para passar.
Adicione um ou mais dos seguintes:
Resposta do Fin — a resposta do Fin atende a uma condição que você descreve.
Procedimento acionado — Fin iniciou um Procedimento específico.
Procedimento alterado — Fin mudou de um Procedimento para outro no meio da conversa.
Conector de dados — Fin chamou um conector de dados específico.
Verificações de Transferência — o que deve ser verdadeiro sobre a transferência até o final da conversa. Escolha uma:
Sem transferência — Fin resolveu sem transferir para uma equipe ou workflow.
Transferido para equipe ou colega — Fin não conseguiu responder, ou sua orientação de transferência foi aplicada.
Transferido para um workflow — Fin passou a conversa para um workflow. (Nota: a conversa não é simulada após a transferência.)
Nota:
Cada Eval suporta atualmente até 50 Simulações. Você não poderá adicionar mais até excluir as existentes.
Você também pode criar uma Simulação a partir de uma conversa real na inbox — veja a seção criando uma Simulação a partir de uma conversa real abaixo.
Em breve:
Importação em massa a partir de um CSV, para que você não precise criar cada Simulação manualmente, uma de cada vez.
3. Execute o Eval
Depois que suas Simulações estiverem configuradas, execute o Eval. Fin passará por cada Simulação do grupo, e você receberá:
Um resultado de aprovação/reprovação para cada Simulação, verificado contra as Verificações da Simulação e Verificações de Transferência que você definiu.
A transcrição completa da conversa para cada execução da Simulação.
O registro de eventos mostrando o raciocínio do Fin e as ferramentas e informações que ele usou a cada etapa.
O resultado da Verificação de Transferência para cada uma: se Fin lidou com a consulta ou transferiu para sua equipe ou um workflow. Junto com isso, suas Verificações da Simulação confirmam os detalhes que você definiu, como se um Procedimento foi acionado ou um conector de dados foi chamado.
Se uma única conversa precisar que Fin trabalhe em múltiplos Procedimentos, os Evals também lidam com isso. Você poderá ver Fin alternar entre Procedimentos conforme a conversa simulada se desenrola, assim como faria para um cliente real.
Se uma Simulação mostrar Erro em vez de Aprovado ou Reprovado, a conversa não pôde ser concluída — verifique a configuração da Simulação (mensagem do cliente, contexto ou verificações) para erros. Se estiver Reprovado, abra a transcrição e o registro de eventos para ver onde o comportamento do Fin divergiu das verificações que você definiu.
4. Reexecute sob demanda
Após fazer qualquer alteração no conteúdo, Procedimentos ou orientações do Fin, reexecute seus Evals existentes para verificar regressões. Como cada Simulação é armazenada e reutilizável, isso leva segundos em vez de exigir que você recrie seus cenários de teste do zero, facilitando a criação de suítes reais de regressão ao longo do tempo.
Criando uma Simulação a partir de uma conversa real
Alguns dos testes mais valiosos vêm de conversas que já aconteceram. Quando você identifica uma conversa real em que a resposta do Fin não foi boa o suficiente, pode transformar esse exato momento em uma reprodução — e continuar executando-a enquanto melhora o Fin, até que a resposta esteja correta.
Uma reprodução captura um instantâneo da conversa até a resposta do Fin que você selecionou e congela as interações anteriores. O Fin é então reexecutado a partir desse ponto congelado para que você possa ver como ele responde agora. Altere a configuração do Fin, execute novamente e compare — porque tudo antes dessa resposta permanece fixo, você está testando a única resposta que importa, não um alvo em movimento.
Como criar uma reprodução
Na inbox, abra a conversa e encontre a resposta do Fin que deseja testar.
Abra o menu de transbordamento (...) nessa resposta do Fin e selecione Adicionar resposta do Fin à Avaliação. (Esta ação aparece apenas em respostas do Fin que podem ser reproduzidas.)
Escolha um Eval existente para adicioná-la, ou crie um novo dando um nome.
A reprodução é salva como uma Simulação dentro daquele Eval, intitulada com a mensagem inicial do cliente. Execute-a imediatamente ou depois como parte do Eval completo. Para executá-la depois, vá para Fin AI Agent > Test > Evals, abra o Eval e clique em Executar.
Como usar uma reprodução para corrigir e re-testar as respostas do Fin
Depois de salvar uma Simulação de reprodução a partir de uma conversa real, use este Workflows para diagnosticar e corrigir o problema:
Execute para ver como o Fin responde à conversa congelada com sua configuração atual.
Faça uma alteração — atualize o conteúdo, um Procedimento ou orientação — e reexecute para ver se a resposta melhorou.
Adicione Verificações da Simulação, Verificações de Transferência ou um Scorecard para definir como é o 'consertado', para que você tenha uma aprovação/reprovação clara em vez de um julgamento subjetivo.
Mantenha a Simulação após ela passar. Agora ela também funciona como um teste de regressão: execute-a novamente após mudanças futuras para garantir que a correção se mantenha.
Esta é a maneira mais rápida de transformar um erro do mundo real em um teste permanente — em vez de escrever um cenário do zero, você começa com algo que realmente aconteceu.
Nota: Uma reprodução executa novamente a única resposta Fin que você selecionou, com as etapas anteriores da conversa congeladas. Se quiser simular o que acontece a seguir na conversa, adicione 'instruções de acompanhamento' no editor de Simulação — elas dizem ao sistema o que o cliente diria a seguir para que Fin tenha turnos para responder.
Pontuando qualidade com Scorecards
Verificações de transferência e verificações de Simulação indicam se o Fin fez a coisa certa. Um Scorecard mostra o quão bem ele fez isso.
Por padrão, toda Simulação é pontuada com base nas verificações de transferência (se o Fin respondeu ou transferiu para sua equipe ou um workflow) e em quaisquer verificações de Simulação que você definir (por exemplo, um Procedimento específico acionado ou um conector de dados chamado). Isso é uma leitura de aprovação/reprovação do comportamento do Fin.
Um Scorecard adiciona uma camada qualitativa de pontuação além das verificações de aprovação/reprovação da sua Avaliação — medindo dimensões como tom, segurança da marca ou eficiência que não se encaixam claramente em um resultado binário. Scorecards são compartilhados com Monitores, para que você teste com a mesma régua de qualidade antes de uma mudança entrar em vigor, que seus monitores aplicam depois.
O que há em um Scorecard
Um Scorecard é composto por um ou mais critérios — as dimensões que você valoriza (ex.: "Eficiência", "Esclarecimento", "Facilidade de escalonamento"). Cada critério tem:
Um nome: um rótulo curto que aparece nos seus resultados.
Uma descrição: o que você está avaliando e como deve ser julgado. Esta é a instrução que o juiz de IA segue — use uma das opções pré-existentes ou seja específico se estiver criando seu próprio critério.
Opções de avaliação: as pontuações possíveis (pelo menos duas), cada uma com um nome (ex.: "Bom", "Ok", "Ruim") e um valor numérico (ex.: 100%, 50%, 0%).
Em uma Avaliação, os critérios são pontuados automaticamente por um juiz de IA, junto com o restante da Simulação.
Como configurar a pontuação do Scorecard
Ao anexar um Scorecard a uma Avaliação, você pode configurar como cada critério contribui para a pontuação geral:
Ponderação: dê a cada critério um peso para refletir sua importância. Os pesos são proporcionais, então um critério com peso 2 conta o dobro de um com peso 1.
Critérios críticos: marque um critério como Crítico quando ele for inegociável (ex.: para conformidade ou segurança). Uma avaliação reprovada em um critério Crítico reprova toda a revisão qualitativa, independentemente das outras pontuações.
Limiar de aprovação: defina a pontuação mínima geral que uma Simulação precisa para passar na qualidade.
Como interpretar os resultados do Scorecard
Quando uma Avaliação é executada, cada Simulação mostra seus resultados de verificação de transferência e verificação de Simulação como antes, além da pontuação do Scorecard e da avaliação e motivo que o juiz deu para cada critério. Como o juiz mostra seu raciocínio, você pode ver por que uma resposta recebeu aquela pontuação e transformar isso diretamente em uma correção.
Dica: Critérios vagos produzem pontuações vagas. Escreva cada critério como se estivesse orientando um novo revisor — explique claramente o que significa 'bom' e o que deve derrubar a pontuação. Veja como escrever critérios eficazes para Monitor e Scorecard.
Como as Avaliações complementam as Simulações de Procedimento
Simulações de Procedimento não vão desaparecer, e ainda são a ferramenta certa para um trabalho específico: testar um Procedimento isoladamente. Elas exigem que você defina critérios de sucesso e resultado para cada teste, e são ideais para validar que um Procedimento individual se comporta corretamente por conta própria.
As Avaliações continuam de onde as Simulações de Procedimento param. Enquanto uma Simulação de Procedimento é limitada a um único Procedimento, uma Simulação de Avaliação pode exercitar toda a configuração do Fin de ponta a ponta: passando por múltiplos Procedimentos, conteúdos, orientações e conectores de dados dentro de uma única conversa realista, do mesmo jeito que uma conversa real com o cliente.
Use-os juntos:
Use Simulações de Procedimento para construir e validar um Procedimento individual enquanto você trabalha nele.
Use Avaliações para validar toda a jornada do cliente depois que esse Procedimento estiver ativo, incluindo como ele interage com todo o resto na configuração do Fin.
Usando Avaliações em vez de Batch Test
Hoje, muitas equipes usam Batch Test para validar o Fin, o que envolve fazer um lote de perguntas informativas de turno único e avaliar manualmente cada resposta como Boa, Aceitável ou Ruim.
Fin Evals foi projetado para fazer tudo o que o Batch Test faz, e muito mais:
A tabela abaixo compara Batch Test e Fin Evals em quatro dimensões: tipo de conversa, pontuação, teste de regressão e agrupamento.
| Batch Test | Fin Evals |
Tipo de conversa | Apenas perguntas informativas de turno único | Conversas completas de múltiplos turnos |
Pontuação | Avaliação manual (Boa/Aceitável/Ruim) | Automática — verificações determinísticas mais IA como juiz contra critérios que você define |
Teste de regressão | Reexecutar manualmente | Reexecutar sob demanda como uma suíte de regressão |
Agrupamento | Agrupado, até 50 perguntas | Agrupado em Avaliações de até 50 Simulações, organizadas da forma que preferir |
Se você está usando Batch Test atualmente, recomendamos começar a criar cenários de teste equivalentes como Avaliações durante a versão beta. Avaliações oferecem uma forma mais rápida, automatizada e realista de obter a mesma confiança e muito mais.
Limites de uso da Simulação
Há um limite para o número de Simulações que você pode executar dentro das Avaliações a cada mês. Esse limite é aplicado no nível do workspace e é reiniciado no primeiro dia de cada mês do calendário.
Cada workspace recebe uma cota mensal de execuções de simulação. A cota é baseada no segmento de volume de conversas do seu workspace, com clientes maiores recebendo cotas maiores.
A cota de simulação é baseada no volume de conversas do seu workspace no Intercom.
Atribuímos seu workspace a um segmento usando o número de conversas no último mês do calendário.
Seu segmento é reavaliado mensalmente e sua cota refletirá o volume de conversas do mês mais recente.
Se o volume de conversas aumentar ou diminuir, sua cota pode mudar no próximo ciclo mensal.
A tabela abaixo mostra a cota mensal de execuções de Simulation por segmento de volume de conversas do workspace.
Segmento de Volume de Conversas | Limite de Simulation por mês |
Menos de 1K | 250 |
1K–15K | 1.000 |
15K–100K | 1.750 |
100K–1M | 5.000 |
1M+ | 12.500 |
Monitorando seu uso
Para ajudar a gerenciar seus testes, você verá indicadores visuais na aba Evaluations:
Aviso de uso
Quando seu workspace atingir 80% do limite mensal, um banner amarelo de aviso aparecerá. Ele mostra seu uso atual (ex.: "850/1000") e lembra quando o limite será reiniciado.
Limite atingido
Quando você atingir 100% do limite mensal, uma mensagem de erro vermelha aparecerá. Você não poderá executar mais Simulations dentro do Evals até o início do próximo mês.
Coisas importantes para saber sobre a versão beta
Fin Evals está em Closed Beta, e estamos desenvolvendo ativamente. Aqui está o que você deve lembrar agora:
Organizar além de um Eval em si ainda não está disponível. Atualmente não há estrutura de pastas para agrupar Evals por equipe ou propriedade.
Anotação dentro do produto está chegando. Em breve você poderá adicionar notas simples a uma Simulation, mas ainda não há uma forma dedicada para registrar se um revisor concorda ou discorda de um resultado.
Ainda não existem templates pré-construídos. Categorias comuns de teste como injeção de prompt ou perguntas genéricas de casos extremos não têm um ponto de partida pronto — você terá que criar do zero por enquanto.
Workflows estão fora do escopo por enquanto. Evals atualmente cobrem a configuração de respostas do Fin — conteúdo, Procedures, orientações, públicos e conectores de dados — mas não Workflows.
Até 50 Simulations por Eval, e até 50 linhas por importação CSV.
Entendendo aprovação/reprovação: o comportamento padrão "sem handoff"
Se você adicionar uma Simulation sem verificação explícita de Handoff e sem verificações de Simulation, o Evals avalia por padrão contra o critério "Sem handoff" — significando que a Simulation passa apenas se o Fin resolveu a conversa sem transferir para uma equipe ou workflow.
Esse padrão não é mostrado na interface de configuração da Simulation, o que significa que Simulations podem falhar de formas inesperadas se o Fin escalou e você não pretendia testar isso. Se uma Simulation falhar e você não souber o motivo, verifique se uma verificação de Handoff foi configurada — se não foi, a regra padrão de sem handoff é o que causou a falha.
Dica: Sempre adicione uma verificação explícita de Handoff a cada Simulation para que o resultado de aprovação/reprovação reflita sua intenção, não o padrão.
Tem feedback sobre o Fin Evals? Adoraríamos ouvir, então entre em contato com seu gerente de conta.
















