メインコンテンツにスキップ

ウェブサイトを同期して管理する

Knowledgeの公開URLを同期して、これらのコンテンツをFinで利用できるようにする方法。

対応者:Beth-Ann Sher

ウェブサイトのコンテンツをIntercomに追加し、Fin AI AgentとCopilotで利用可能にしたい場合は、サイトの公開URLを同期してください。ブログ記事、変更ログ、ニュース更新、または日付のあるその他のウェブページのコンテンツでFinとCopilotをトレーニングすることもできます。これにより、FinとCopilotはこれらの情報源から最新かつ関連性の高い情報を常に使用できます。

注意: この機能は公開URLでのみ動作します。使用したいコンテンツがログインの背後にある場合、Finはそれにアクセスしたりインポートしたりできません。


FinおよびCopilotとウェブサイトのコンテンツを同期する

Fin AI Agent > Train > Contentに移動し、「Add content」からWebsite syncを選択します。

外部サポートコンテンツのURL(トップレベルドメイン)を入力し、Nextをクリックします:

指定したウェブサイトURLからすべてのページを取得し、サブドメインのページもすべて読み取ります。

ヒント: トップレベルドメインが最良の結果をもたらします(例:外部help centerのホームページURL https://myhelpcenter.com をサブページ https://myhelpcenter.com/articles より使用してください)。

注意: ウェブサイト同期は最大100サイトまでです。

同期するページを確認する

URLを入力すると、有効でアクセス可能かを確認します。次に、同期するページを確認する必要があります。選択した各セクションにリンクされているすべてのサブページが同期されます。関連性があり最新のコンテンツのみを選択してください。

ヒント:

  • ヘルプ記事、ガイド、FAQなどのサポートコンテンツを含むページやセクションを選択してください。

  • マーケティングページ、製品一覧、または複雑なレイアウトのページは選択しないでください。

  • 選択したセクション内のすべてのリンクされたサブページは自動的に含まれます。

  • 詳細設定でいつでも選択を更新できます。

詳細設定 [optional]

追加のURL、除外するURL、除外するCSSセレクタなどを設定するには、Advanced settings ドロップダウンを選択します。

追加のURL

ウェブサイトの構造はさまざまです。最も関連性の高いコンテンツを同期するために、特定のサブページ用に追加のURLを追加することをおすすめします。

例えば、上で https://myhelpcenter.com/help を主要なURLとして入力した場合、特定のURL 例えば https://myhelpcenter.com/help/index.html を追加したい場合があります。

除外するURL

同期したくない特定のページを除外するには、URLグロブのリストを追加できます。

URLグロブとは?

グロブは、ファイルパスやURLに一致させるために使用されるリテラル文字および/またはワイルドカード文字の文字列です。グロビングは、1つ以上のグロブを使用してファイルシステム上のファイルを検索する行為です。URLグロブを使用すると、要求間で一部が変化するだけのほぼ同じ範囲のURLを取得するのにも役立ちます。

例えば、このURLグロブ https://{store,docs}.example.com/** はクローラーが https://store.example.com/ または https://docs.example.com/ で始まるすべてのURLと https://example.com/**/*\?*foo=* にアクセスできるようにします。

ヒント: 除外したいURLにグロブパターンが一致するか不明な場合は、適用する前にDigitalOceanのGlob Toolを使用してサンプルURLに対してパターンをテストできます。 (これはIntercomが管理していないサードパーティツールです。)

除外するCSSセレクタ

特定のページ要素を除外するには、除外したい特定のセクションや要素のCSSセレクタを使用できます。

これは関連性の低いページコンテンツをスキップするのに便利です。値はdocument.querySelectorAll()関数が受け付ける有効なCSSセレクタである必要があります。デフォルトでは、一般的なナビゲーション要素、ヘッダー、フッター、モーダル、スクリプト、インライン画像は既に削除されます。

クリック可能なCSSセレクタ

これにより、ウェブ同期プロセス中にCSSセレクタで識別されたDOM要素をクリックできます。

これは、折りたたまれたセクションを展開してそのテキストコンテンツを取得するのに便利です。値はdocument.querySelectorAll()関数が受け付ける有効なCSSセレクタである必要があります。

例は "[aria-expanded=\"false\"]", #expand_section です。

複雑な条件はCSSセレクタで記述することもできます。CSSでは、セレクタをスペースなしで連結するとANDのような条件になり、例えば .button.blue.small は3つのクラスすべてを持つ要素のみ一致します。

区切り文字としてカンマ(,)を使用するとORのように機能します。例えば .button, .blue, h1 はクラスbutton、またはクラスblue、または一階見出しを持つすべての要素を対象とします。

CSSセレクタの読み込み待ち

ページ上で表示に遅延がある可能性のあるコンテンツをターゲットにするには、ウェブスクレイパーがクロール前に待機するCSSセレクタを追加できます。

これは、ネットワークのアイドルによるデフォルトのコンテンツ読み込み認識が失敗するページに有用です。このオプションを設定するとデフォルトの動作が完全に無効になり、指定したセレクタで示される要素が表示された場合にのみページが処理されます。

注意: 値はdocument.querySelectorAll()関数が受け付ける有効なCSSセレクタである必要があります。

XMLサイトマップ

サイトマップ対応サイトでより堅牢なウェブ同期を行うためにXMLサイトマップを有効にし、初期URLから到達できないページへのアクセスを可能にします。

このオプションが有効な場合、ウェブスクレイパーは提供されたソースURLのドメインでサイトマップを検索し、クロールしたページで見つかったリンクと同様に一致するURLをキューに入れます。また、https://www.example.com/sitemap.xml のようにsitemap.xmlファイルを別のStart URLとして参照することもできます。

プロキシの地域

特定の地域や国に設定されたプロキシでウェブサイトをクロールする必要がある場合、クローラーが使用するプロキシを選択できます。

現在、以下のプロキシをサポートしています:

  • ローテーティング: United States, Germany, France, United Kingdom, Czechia, Hungary

  • スタティック:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • ヨーロッパ - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • オーストラリア - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

クローラーの種類

このウェブサイトを同期する際に、クローラーが各ページをどれだけ丁寧にレンダリングするかを選択します。

  • ページが空または切り詰められて同期される場合、通常はJavaScriptによるレンダリングが原因です。Fullに切り替えて再同期してください。

  • Fullは負荷が大きいため、大きなソースを縮小スケジュールにする可能性が高くなります。

  • 既存のソースでこれを変更し、比較のために再同期することができます。

オプション

機能

使用する場合

高速

JavaScriptを実行せずにHTMLを読み取ります。

コンテンツが初期HTMLに含まれている場合 — ほとんどのブログ、ドキュメント、help center。

自動(既定)

必要に応じて当社が判断し、サイトがJavaScriptを必要とする場合はFullに切り替えます。

どちらか確信が持てない場合。ほとんどの人に適しています。

Full

各ページをブラウザで読み込みJavaScriptを実行します。遅くなります。

コンテンツがスクリプト実行後にのみ表示される場合、シングルページアプリやJavaScript多用のページ。

正規化(canonical)URLを無視する

有効にすると、ウェブスクレイパーはcanonicalリンクタグ(rel="canonical")を無視し、各URLを別個のページとして扱います。このオプションはデフォルトで無効です。

多くのページが1つのcanonical URLを指していて、その結果コンテンツが見逃されている場合に便利です。

クエリパラメータの除外とrobots.txtの尊重

詳細設定の下にさらに2つのトグルがあります。どちらもデフォルトではオフです。

Respect robots.txt:クローラーがサイトのrobots.txtのdisallowルールに従うようにします。サイトのrobots.txtがFinで取得したいコンテンツをdisallowしている場合、これをオンにすると同期される内容が減少します。

Exclude query parameters:クエリ文字列(?)を含むURLをスキップします。トラッキング、セッション、ソートパラメータによってほとんど重複に近い多くのページが生成される場合にオンにしてください。/docs?page=introのように実際のコンテンツがクエリ文字列の背後にある場合はオフにしてください — そのようなページもスキップされてしまいます。

対象のオーディエンス

Targetステップでは、同期されたすべてのページに対するデフォルトのオーディエンスを設定したり、URLパターンに基づいて特定のオーディエンスを自動的に割り当てるルールを作成したりできます — 手動でタグ付けする必要はありません。

まず、このソースのコンテンツがFin AI Agentおよび/またはCopilotで有効かどうかを決めます。

その後、デフォルトのFinオーディエンスを設定してこのソースから同期されたすべてのページに適用するか(デフォルトが設定されていない場合、コンテンツはEveryoneにデフォルト設定されます)、またはURLパターンに基づいて特定のオーディエンスを割り当てるルールを作成できます。

例:URLに /uk が含まれる場合は、UKオーディエンスを割り当てます。 ルールは同期中に評価されるため、FinとCopilotは常に適切なコンテンツを適切なオーディエンスに提供します。

各ルールは3つのURL比較演算子をサポートします:

  • で始まる — 指定したプレフィックスで始まるURLに一致します。

  • で終わる — 指定したサフィックスで終わるURLに一致します。

  • 含む — 指定した部分文字列を含むURLに一致します。

注:

  • ライブプレビューは各ルールに一致するページ数を表示し、保存前にルールを検証するのに役立ちます。これにはウェブ同期ソース用のサイトマップが利用可能である必要があります。サイトマップがない場合でもルールは適用されますが、一致のプレビューはできません。

  • ルールは作成時に自動で名前が付けられますが、名前を変更することができます。ウェブ同期ソースごとに最大10件のルールが適用されます。

  • オーディエンスルールは追加のみです:コンテンツにオーディエンスを追加するだけで、既存の割り当てを削除することはありません。ルールを削除しても過去のオーディエンス割り当ては元に戻りません。

同期設定の確認

最後に、同期設定を確認してからSync website をクリックして、ウェブサイトのコンテンツをIntercomと同期してください。


ウェブサイト同期の管理

同期が完了すると、メール通知を受け取り、ウェブサイトがFin AI Agent > Train > Contentの下に同期済みソースとして表示されます。

特定ページの設定を構成する

Fin AI Agent > Train > Contentに移動し、ウェブサイトソースを選択して、同期したページをクリックします。右側に「詳細」パネルがあり、次の項目が含まれます:

  • データ:コンテンツの種類、言語、作成日、最終更新(ソースと最後に同期された日時)を表示します。

  • Fin settings: Fin AI AgentおよびCopilotの有効/無効にする設定。 有効にすると、コンテンツは顧客にFin AI Agent経由で、チームメイトにはCopilot経由でそれぞれ利用可能になります。

  • リンク:このウェブサイトソースの公開URL。

  • レポート:このウェブサイトソースが関与または解決したFinの会話。

  • タグ:Intercomでコンテンツをグループ化・整理するためのカスタムタグを適用します。

  • フォルダー: この公開URLがKnowledge Hubのどのフォルダーにあるかです。同期されたコンテンツのフォルダーを変更することはできません。

注: ウェブサイトのソースは読み取り専用で、Intercom内で編集することはできません。ソースで編集する必要があります。

Fin と Copilot に利用可能にする

Fin AI Agentおよび/またはCopilotでウェブサイトソースを利用可能にするには、Fin AI Agent > Train > Contentに移動してウェブサイトソースを選択し、同期したライブページをクリックしてChange AI Agent state > Enable for AI Agent またはChange Copilot state > Enable for Copilot.を選択します。

個々のウェブページの「Details」 パネルからもこれらの設定を管理できます。下にスクロールしてFin 設定を見つけ、オンに切り替えるかどうかを選択してください:

  • Fin AI Agent - この設定により、公開URLがFinによってカスタマー対応時に使用可能になります。

  • Copilot - この設定により、公開URLがCopilotによってinboxのCopilotパネル経由でチームメイトの質問に回答する際に使用可能になります。

お客様向けにFin AI Agentのセットアップを行う方法、またはチームがinboxのCopilotを使用できるようにする方法について学んでください。

特定のオーディエンスに利用可能にする

ウェブ同期作成時にURLベースのルールを使用して同期されたコンテンツにオーディエンスを自動的に割り当てるか、ページごとに手動で割り当てることができます。まず、ターゲットにしたいオーディエンスを作成して定義する必要があります。

個々のページに手動でオーディエンスを割り当てるには、Fin AI Agent > Train > Contentに移動してウェブサイトソースを選択し、同期したライブページをクリックしてMore actions > Change Fin audience.を選択します。

注:

  • 公開URLのデフォルトオーディエンスは「Everyone」です。

  • Finは公開URLに適用したオーディエンスを尊重し、オーディエンスルールに一致する場合にのみこの記事を使用してカスタマーの質問に回答します。

既存の同期にオーディエンスルールを追加または編集する

オーディエンスターゲティングを追加するために同期を再作成する必要はありません。Fin AI Agent > Train > Contentに移動し、ソースを選択して右上の設定ドロップダウンをクリックし、Open settingsを選択します。Targetステップに移動してURLベースのルールを追加または編集してください。

注: 既存のウェブ同期にオーディエンスルールが追加されると、それらはそのソースから既に取り込まれたすべてのコンテンツに遡及的に適用されます — 新しいコンテンツだけでなく。

ウェブサイトをソースとして再同期または削除する

公開URLをソースとして再同期または削除する場合は、Fin AI Agent > Train > Contentに移動してソースを選択します。次に右上の設定ドロップダウンをクリックし、Re-sync またはRemove this source.を選択します。

ヒント: ウェブサイトの再同期は通常、ソースのサイズに応じて週次で 行われ、いつでも手動で再同期できます。

ウェブサイト同期設定を管理する

ウェブサイト同期の詳細設定を調整するには、Fin AI Agent > Train > Contentに移動してソースを選択し、右上の設定ドロップダウンをクリックしてOpen settings.を選択します。

ウェブサイト同期履歴を表示する

過去のウェブサイト同期の一覧を表示して、最後に実行された日時、見つかったページ、失敗したページを確認できます。Fin AI Agent > Train > Contentに移動してウェブサイトソースを選択し、右上の設定ドロップダウンをクリックしてView sync historyを選択します。


テーブルの各行は過去またはアクティブな実行を表し、ステータスで実行をフィルターできます。以下の情報が含まれます:

  • 同期日

  • ステータス

  • 同期されたページ

  • 除外されたページ

  • 失敗したページ

  • 所要時間

  • 同期を開始した人

同期が失敗した場合、詳細な説明を見るためにステータスにカーソルを合わせることができます。

自動同期はFinがウェブサイトを使用していないときに一時停止する

新しいソースは最初の90日間はスケジュールどおり同期されます。その後、次のいずれかが当てはまる場合にのみ自動的に同期を続けます:

  • 過去90日間にFinの回答でそのページが使用された。

それ以外の場合、スケジュールされた同期は一時停止します。

一時停止中: ページはKnowledge Hubに残り、FinとCopilotで使用可能なままです(何も削除されません)。再クロールのみが停止するため、サイトでの編集は反映されません。

復元するには: Sync nowボタンはコンテンツを一度更新しますが、スケジュールは再起動しません。自動同期はFinが再びそのソースを使用すると自動的に再開します。

クロール負荷の高いウェブサイトは同期頻度が低くなる

非常に大きなサイトや完全なJavaScriptレンダリングが必要なサイトは、クロールに遠く多くのコストがかかります。ソースがリソース集約型であると判明した場合、週次から14日ごとのスケジュールに移動します。

これはソースごとに自動で発生します。大きなサイトを高速なスケジュールのままにしたい場合は、URL除外を使用してクロール範囲を狭めるか、ドメイン全体ではなく特定のサブページを追加してください。


ウェブサイト同期のトラブルシューティング

一般的な問題

Finを有効にするためにウェブサイトコンテンツをインポートする際には、public URLを入力する必要があります。これにより、そのURL以下にネストされたすべてのページが検索され、Fin AI Agentが使用するために同期されます。

インポーターが期待したページ数を返さなかった場合、いくつかの理由が考えられます...

提供されたURLがトップレベルのドメインではない

ウェブサイト同期は、指定したURLにアクセスしてから、そのURL以下にネストされたすべてのページを検索することで動作します。これらのページは、指定したURLと同じURLパターンである必要があります。

例えば、トップレベルドメインがhttps://myhelpcenter.com/homeの場合、インポートしたいすべてのページはURLに/homeプレフィックスを含める必要があります。例: https://myhelpcenter.com/home/article。含まれていない場合は、プレフィックスを削除して最も基本的なURLステム(例: https://myhelpcenter.com)を使用し、再度インポートを試してください。

URLが非公開である

If the content you want to use is behind a login, Fin won't be able to access or import it.

ページ制限

ウェブサイトの同期には2つの制限があります:

  • Domains: you can sync up to 100 different top-level domains.

  • Pages per source: Fin syncs a maximum of 4,000 pages from each source.

同期は、単一のページに非常に大量のコンテンツが含まれている場合にも失敗することがあります。同期が失敗すると、メールで通知されます。

注意:

  • ソースに4,000ページを超えるページがある場合は、それぞれが制限内に収まるように複数のソースに分割してください:

    • サイトを小さなセクションに分割し、それぞれを個別のソースとして追加します。

    • たとえば、製品分野やカテゴリごとに1つのソースとして、異なるURLパスを個別に同期します。

  • これにより各ソースがページ制限を超えないように保ち、同期ごとに処理されるコンテンツが減ります。

特定地域のIPに制限されたウェブサイト

Intercom’s website sync (used to add public URLs for Fin AI Agent and Copilot) does not use a dedicated, custom user-agent string at this time.


これらのリクエストを識別または許可するには:

  • By IP address: Our crawler normally uses dynamic IPs. If your site requires allowlisting, contact us and we can enable static, region-specific IPs for your workspace.

  • これらのリクエストはウェブサイトの同期にのみ使用されます。Messengerのトラフィックやエンドユーザーのトラッキングには影響しません。

英語以外または国際サイトのページが同期されない

サイトマップに非ASCII文字(アクセント付き文字や中国語、アラビア語などのスクリプトを含むURL)が含まれている場合、これらのページの一部は期待通りに同期されないことがあります。サイトマップ検出はこれらのURLをサポートしていますが、同期プロセスの他の部分で問題が発生することがあります。手動で再同期して解決を試みてください。ページがまだ欠落している場合は、サポートに連絡してください。

ウェブサイト同期のエラー

コンテンツを同期すると、プロセス中に発生したことを示すさまざまなステータスが表示される場合があります。ウェブサイトの同期ステータスを表示するには、Fin AI Agent > Train > Contentに移動し、ウェブサイトのソースを選択して、Status ドロップダウンで次のようにフィルタリングします:

  • 同期中

  • 公開済み

  • 失敗

  • 除外済み

各ステータスの意味と次にできることはこちらです:

同期中

ページ同期はまだ進行中です。初回の同期は、コンテンツ量によって数分から1時間以上かかることがあります。

公開済み

ページは正常に同期され、Fin と Copilot で有効にできます。

注意: 成功した同期がページ上の全てのコンテンツをスクレイプできたとは限りません。完全なカバレッジを確認したい場合は、そのページから見つかると予想される回答でFin をプレビューすることをおすすめします。

除外済み

これらのページは、同期設定で除外したため、意図的に同期されていません。再試行できず、指定がない限り含めることはできません。

失敗

これらのエラーは同期が完了しなかったことを意味し、再試行する前にサイト側で変更が必要な場合があります:

1. Unknown error

  • Message: “This page couldn't be accessed. It may be slow or blocked. Try syncing again, or contact support if it fails.”

  • What it means: Something prevented us from accessing the page, but the cause isn’t clear.

2. Session blocked / Rate limited

  • Message: “The website is preventing us from accessing its content. Check if it's being blocked by an anti-crawler setting or firewall. Check your site configuration and try syncing again. If the issue persists, contact support.”

  • What it means: Your site is actively blocking or limiting our crawler.

3. Network, timeout, or similar errors

  • Message: “This page couldn't be accessed. It may be slow to load or blocked by anti-crawler settings or a firewall. Check your site configuration and try syncing again. If the issue persists, contact support.

  • What it means: The page didn’t load in time or couldn’t be reached due to network issues or blocking.

4. Duplicate

  • Message: “This page has the same content as another that's already synced. Only one version will be included.”

  • What it means: We detected identical content elsewhere, so only one copy is kept.

5. Keyword filtering

  • Message: “Pages with keywords like category, collection, or tag in the URL are excluded by default, as they usually don't contain unique content. If this page should be included, contact support.”

  • What it means: These URLs often represent lists, not standalone content pages.

6. Status code 400

  • メッセージ: “ページのコンテンツが見つかりません。URLが有効であり、ページが問題なく読み込まれることを確認してください。”

  • 意味: URLが壊れているか、ウェブサイトでエラーを返している可能性があります。

7. ブロックされたURL

  • メッセージ: “This website domain is blocked from being synced. If you require this, contact support.”

  • 意味: domainは同期対象から意図的に除外されています。


再試行するには、ページにカーソルを合わせ、三点メニューを選択してからResyncを選んで失敗したページ同期をやり直してください。

: Website Syncは生のMarkdownファイルのインポートをサポートしていません。適切な書式設定とタイトル検出のため、レンダリング済みのHTMLとしてコンテンツを提供するか、スニペット/ファイルとしてアップロードしてください。Markdownの構造(例:# 見出し)はHTMLに変換されない限り認識されません。

こちらの回答で解決しましたか?