メインコンテンツにスキップ

効果的なモニター&スコアカード基準の書き方

モニターとスコアカードを使ってチームメンバーのパフォーマンスを評価するための、明確で実行可能な基準を定義するベストプラクティス。

対応者:Dawn Perrott

効果的な基準を書くことは、実際の問題を浮き彫りにするモニターと、ノイズでキューを溢れさせるモニターを分けるものです。このガイドは、モニターのフラグ基準とスコアカードの属性説明の両方のベストプラクティスをカバーします。モニターは現在、Fin AI Agentの会話のみを評価しています。

注意: モニターはProアドオンの一部として利用可能です。


モニターフラグ基準とスコアカード属性説明の違い

これら2種類の基準は動作が異なるため、書き方も異なる必要があります。

モニターフラグ基準

スコアカード基準説明

目的

どの会話をレビューするかを決定する

各会話がどのように評価されるかを定義する

ロジック

はい/いいえ - 各モニターは独立して実行される

競合 - AIが単一の最適な一致を選択する

主な課題

偽陽性と偽陰性を減らすこと

基準値間の重複を排除すること


モニターフラグ基準作成のベストプラクティス

モニターは独立したはい/いいえチェックとして動作します。複数のモニターが同じ会話にフラグを立てることがあり、それは問題ありません。このため、区別よりも精度が重要です。

1. 推測された意図ではなく、観察可能な行動を記述する

  • 会話に現れる内容に焦点を当ててください。

  • 避ける例:顧客が苛立っている

  • 推奨例:顧客が「これは受け入れられない」「非常に失望している」「これはばかげている」などのフレーズを使う。

AIは感情的な解釈よりも明示的な信号を評価する方が性能が良くなります。

2. 具体的な例を含める

  • 例は曖昧さを大幅に減らします。

  • 明示的な表現パターンを使う:例)サブスクリプションをキャンセルする、アカウントを閉じる、データを削除する

  • 例はモデルを実際の言語に結びつけます。

3. 明確な除外条件を追加する

偽陽性を減らすことはモニターにとって重要です。

例:顧客が汚い言葉を使う。除外:damnやcrapのような軽い言葉。モニターをトリガーしない場合は明確に記述してください。

4. 定量的な閾値を使う

  • あいまいな表現は避ける。

  • 悪い例:Finが短い返答をする。

  • 良い例:Finの返答が50語未満である。

  • 具体的な閾値は一貫性を向上させます。

5. 複数ステップのロジックは番号付き基準に分ける

モニターが順序やパターンに依存する場合は、明確に構造化してください。

  1. 顧客が苛立ちを表現する。

  2. Finが感情を認識せずに応答する。

  3. 顧客が不満を繰り返す。

これによりロジックが決定的になり、評価が容易になります。

6. シンプルに保つ

  • ルールが単純なら、複雑にしすぎないでください。

  • 例:Finが次のステップを提案する(例:キャッシュをクリアしてください、ログアウトして再ログインしてください、このリンクをクリックしてください)。

  • 明快さは複雑さに勝る。

7. 「explicitly」を使って顧客の直接的な言葉を要求する

モニターが顧客の直接的な発言時のみトリガーする場合は、基準に「explicitly」という言葉を含めてください。これがないと、AIは文脈から意図を推測し、示唆されただけの会話も一致させる可能性があります。

  • 「explicitly」なし:顧客が折り返し電話を依頼する — AIが「セキュリティチームに繋げますか?」を折り返し電話の依頼と推測する可能性があります。

  • 「explicitly」あり:顧客が明確に折り返し電話を依頼する — 顧客が「電話をもらえますか?」「電話してください」と直接依頼した場合のみ一致します。

ヒント: モニターをオンにする前に、テストモニター機能で実際の会話に対して基準を検証してください。フラグ基準を更新し、結果がモニターで捉えたい内容を正確に反映するまでテストを繰り返しましょう。

8. フラグ基準ではなく、割り当て条件には正確なフィルターを使う

フラグ基準は会話の文字起こしを読みますが、構造化された割り当て履歴には信頼できるアクセスがありません。「会話終了時にエージェントXが担当していた場合のみ」や「終了前に再割り当てされていたらフラグを立てない」などの条件はフラグ基準に書かないでください。これらはAIが非構造化テキストを解釈するため、偽陽性を生みます。

代わりに、フィルターを追加で利用可能な会話フィルターを使い、担当者でモニターの範囲を直接絞り込みましょう。これらは会話の実際の割り当て記録をチェックし、文字起こしではなく決定的に適用され、AIの解釈は関与しません。

ヒント: フラグ基準で割り当て条件を回避する除外文を書いている場合、それは正確なフィルターに条件を移すべきサインです。


スコアカード基準説明作成のベストプラクティス

基本原則:基準は競合します。AIは全リストを見て、各基準に対して単一の最適な一致を選びます。あなたの役割はその選択を明確にすることです。

1. 明確で簡潔な名前を使う

  • 名前は短く具体的に。リストを読む人が説明を開かなくても目的がすぐに分かるように。

  • 悪い例:顧客コミュニケーションの問題

  • 良い例:トーン - 無礼または軽視的

2. 包括的な説明を書く

説明は分類の信号の大部分を担います。

  • 該当するすべての会話タイプを明示的に説明する。

  • キーワード、一般的な表現、例を含める。

  • エッジケースを考慮し、含める。

  • 良い例と悪い例を明確にする。

説明は抽象的な定義だけでなく、実際の言い回しをAIが認識しやすくするものであるべきです。

3. 基準を明確に区別する

同じスコアカード内の基準は概念的に競合してはいけません。

  • 意味の重複を避ける。

  • 各属性に明確な境界を設ける。

  • 同じ理由で両方が適用可能な場合は、どちらかを洗練させる。

単一の会話がスコアカード内の複数基準に該当しても問題ありません。重要なのは各基準セット内で値が明確に区別できることです。

4. 品質を体系的に評価する

分類体系を見直す際、各基準を以下で評価する:

  • 明確さ/簡潔さ

  • 説明の包括性

  • 基準の区別

  • 重複する基準(あれば)

  • 最終スコア+コメント

この構造化されたレビューにより定義を厳密にし、曖昧さを減らすことで分類性能が直接向上します。


よくある質問

フラグ基準はどのくらいの長さが適切ですか?

固定の長さはありません。正確に行動を記述するのに必要な長さが適切です。単純なモニターなら2〜3文で十分かもしれません。複雑なもの(多段階の失敗パターン検出など)は構造化された番号付き説明が必要です。詳細を多めに書く方が安全です。

同じスコアカード基準を複数のスコアカードで使えますか?

はい。基準のタイトルと説明は再利用可能です。一度作成すれば複数のスコアカードに追加できます。ただし、過去の評価スコアは再利用できず、各スコアカードで新たに設定する必要があります。

モニターフラグ基準とスコアカード基準説明の違いは何ですか?

モニターフラグ基準は会話がモニターに取り込まれるかどうかを決める、はい/いいえのフィルターです。スコアカード基準説明は、会話がモニターに入った後にどのように評価されるかを定義します。モニターは網、スコアカードは定規のようなものと考えてください。

こちらの回答で解決しましたか?