WebサイトのコンテンツをIntercomに追加してFin AI AgentとCopilotに利用可能にしたい場合は、サイトの公開URLを同期してください。ブログ記事、変更履歴、ニュース更新、または日付のあるその他のウェブページのコンテンツでFinとCopilotをトレーニングすることもできます。これにより、FinとCopilotはこれらの情報源から常に最新で関連性の高い情報を利用できます。
注意: この機能は公開URLでのみ動作します。使用したいコンテンツがログインの背後にある場合、Finはそれにアクセスまたはインポートできません。
WebサイトのコンテンツをFinおよびCopilotと同期する
Fin AI Agent > Train > Contentに移動し、「Add content」の下でWebsite syncを選択します。
外部サポートコンテンツのURL(トップレベルdomain)を入力し、Nextをクリックします:
入力したウェブサイトのURLからすべてのページを取得し、サブドメインのページも読み取ります。
ヒント: トップレベルdomainが最良の結果をもたらします(例: サブページhttps://myhelpcenter.com/articlesよりも外部help centerホームページURLhttps://myhelpcenter.comを使用してください)。
注意: ウェブサイト同期は最大100サイトです。
同期するページを確認する
URLを入力すると、有効でアクセス可能か確認します。その後、同期するページを確認する必要があります。選択した各セクションにリンクされたすべてのサブページが同期されます。関連性のある最新のコンテンツのみを選択してください。
ヒント:
ヘルプ記事、ガイド、FAQのようなサポートコンテンツを含むページやセクションを選択してください。
マーケティングページ、商品一覧、複雑なレイアウトのページは選択しないでください。
選択したセクション内のすべてのリンクされたサブページが自動的に含まれます。
詳細設定でいつでも選択内容を更新できます。
詳細設定 [オプション]
追加のURL、除外するURL、除外するCSSセレクターなどを設定するには、Advanced settings ドロップダウンを選択します。
追加のURL
Webサイトの構造は様々です。最も関連するコンテンツを同期するために、特定のサブページ用に追加のURLを追加することをお勧めします。
例えば、上でhttps://myhelpcenter.com/helpを主要URLとして入力した場合、https://myhelpcenter.com/help/index.htmlのような特定のURLを追加することも検討してください。
除外するURL
同期したくない特定のページを除外するには、URLグロブのリストを追加できます。
URLグロブとは何ですか?
グロブは、ファイルパスやURLに一致させるために使用されるリテラルおよび/またはワイルドカード文字の文字列です。グロブ処理は、1つ以上のグロブを使用してファイルシステム上のファイルを見つける行為です。URLグロブを使用すると、ほとんど同じでリクエスト間で一部のみが変わる範囲のURLを取得するのに役立ちます。
例えば、このURLグロブ https://{store,docs}.example.com/** は、クローラーがhttps://store.example.com/ または https://docs.example.com/ で始まるすべてのURLにアクセスできるようにし、https://example.com/**/*\?*foo=*
ヒント: 除外したいURLにglobパターンが一致するか不明な場合は、適用する前にDigitalOceanのGlobツールを使用してサンプルURLに対してパターンをテストできます。 (これはIntercomが管理していないサードパーティのツールです。)
除外するCSSセレクター
特定のページ要素を除外するには、除外したい特定のセクションや要素のCSSセレクターを使用できます。
これは関連性の低いページコンテンツをスキップするのに便利です。値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターである必要があります。デフォルトで、一般的なナビゲーション要素、ヘッダー、フッター、モーダル、スクリプト、インライン画像は既に削除しています。
クリック可能なCSSセレクター
これにより、CSSセレクターで識別されたDOM要素がWeb同期プロセス中にクリックされるようになります。
これは折りたたまれたセクションを展開してテキストコンテンツを取得するのに便利です。値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターである必要があります。
例は"[aria-expanded=\"false\"]", #expand_sectionです。
複雑な条件はCSSセレクターで表現することもできます。CSSでは、セレクターをスペースなしで連結するとANDのような条件になり、例えば.button.blue.smallは3つのクラスすべてを持つ要素のみと一致します。
カンマ(,)を区切り文字として使用するとORのように機能します。例えば.button, .blue, h1はclassがbutton、またはclassがblue、または一次見出しに一致する要素すべてを対象にします。
CSSセレクターの読み込みを待つ
ページに表示されるのに遅延がある可能性のあるコンテンツを対象にするには、スクレイピング前に待機するCSSセレクターを追加できます。
これは、アイドルネットワークによるデフォルトのコンテンツ読み込み認識が失敗するページに役立ちます。このオプションを設定するとデフォルトの動作が完全に無効になり、このセレクターで指定された要素が表示された場合にのみページが処理されます。
注意: 値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターである必要があります。
XMLサイトマップ
サイトマップ対応サイトでより堅牢なウェブ同期を有効にし、初期URLから到達できないページへのアクセスを可能にします。
このオプションが有効な場合、ウェブスクレイパーは提供されたソースURLのドメインでサイトマップを探し、クロールしたページで見つかったリンクと同様に一致するURLをキューに入れます。https://www.example.com/sitemap.xmlのようにsitemap.xmlファイルを別のStart URLとして直接参照することもできます。
プロキシ地域
ウェブサイトを特定の地域や国に設定されたプロキシでクロールする必要がある場合、クローラーが使用するプロキシを選択できます。
現在、次のプロキシをサポートしています:
Rotating: United States, Germany, France, United Kingdom, Czechia, Hungary
Static:
United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
ヨーロッパ - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
オーストラリア - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
クロールタイプ
このウェブサイトを同期する際に、クローラーが各ページをどの程度レンダリングするかを選択します。
ページが空または切り詰められて同期される場合、通常はJavaScriptのレンダリングが原因です。Fullに切り替えて再同期してください。
Fullは負荷が大きいため、大きなソースを短いスケジュールにする可能性が高くなります。
既存のソースでこれを変更して、比較のために再同期できます。
オプション | 機能 | 使用時 |
高速 | JavaScriptを実行せずにHTMLを読み取ります。 | コンテンツは初期HTMLにあります — ほとんどのブログ、ドキュメント、help center. |
Auto(デフォルト) | サイトがJavaScriptを必要とする場合、当社が選択してFullに切り替えます。 | あなたが確信がない場合。ほとんどの人に適しています。 |
Full | 各ページをブラウザで読み込み、JavaScriptを実行します。遅くなります。 | コンテンツはスクリプト実行後にのみ表示されます。単一ページアプリやJavaScript多用ページ。 |
正規化URLを無視する
有効にすると、ウェブスクレイパーはcanonicalリンクタグ(rel="canonical")を無視し、各URLを別々のページとして扱います。このオプションはデフォルトで無効です。
サイトが多くのページを1つの正規URLに向けており、その結果コンテンツが見落とされている場合に役立ちます。
クエリパラメータの除外とrobots.txtの尊重
詳細設定の下にさらに2つのトグルがあります。どちらもデフォルトではオフです。
Respect robots.txt:クローラーにサイトのrobots.txtのdisallowルールを守らせます。他のクローラーが到達できる範囲と同期を一致させたい場合に有効にしてください。robots.txtがFinで取り込みたいコンテンツを含むパスを禁止している場合、同期される内容が減少します。
Exclude query parameters:クエリ文字列(?)があるURLをスキップします。追跡、セッション、またはソートパラメータを追加してほぼ重複ページを大量に生成するサイトで有効にしてください。/docs?page=introのように実際のコンテンツがクエリ文字列の背後にある場合はオフにしてください — そのページもスキップされます。
対象のオーディエンス
Targetステップでは、同期されたすべてのページのデフォルトオーディエンスを設定し、URLベースのルールを作成してURLパターンに基づいて特定のオーディエンスを自動的に割り当てることができます — 手動タグ付けは不要です。
まず、このソースからのコンテンツをFin AI Agentおよび/またはCopilotで有効にするかどうかを決定します。
次に、このソースから同期されたすべてのページに適用するデフォルトのFinオーディエンスを設定するか(デフォルトが設定されていない場合、コンテンツはデフォルトでEveryoneになります)、URLパターンに基づいて特定のオーディエンスを割り当てるルールを作成できます。
例えば:URLに/ukが含まれている場合、UKオーディエンスを割り当てます。 ルールは同期中に評価されるため、FinとCopilotは常に適切なコンテンツを適切なオーディエンスに提供します。
各ルールは3つのURL比較演算子をサポートします:
Starts with — 指定したプレフィックスで始まるURLと一致します。
Ends with — 指定したサフィックスで終わるURLと一致します。
Contains — 指定した部分文字列を含むURLと一致します。
注意:
ライブプレビューは、各ルールに一致するページ数を表示して、保存前にルールを検証するのに役立ちます。これは、ウェブ同期ソースにサイトマップが利用可能であることが必要です。サイトマップがない場合でも、ルールは適用されますが一致をプレビューできません。
ルールは作成時に自動的に名前が付けられますが、名前を変更できます。ウェブ同期ソースごとに最大10個のルールが適用されます。
オーディエンスルールは追加のみです:コンテンツにオーディエンスを追加しますが、既存の割り当てを削除することはありません。ルールを削除しても過去のオーディエンス割り当ては元に戻りません。
同期設定を確認する
最後に、同期設定を確認してからSync website をクリックして、ウェブサイトコンテンツの同期を開始します。
ウェブサイト同期を管理する
同期が完了すると、メール通知を受け取り、ウェブサイトはFin AI Agent > Train > Contentの下に同期ソースとして表示されます。
特定のページの設定を構成する
Fin AI Agent > Train > Contentに移動し、ウェブサイトソースを選択してから、同期したページをクリックします。右側に「詳細」パネルがあり、以下が含まれます:
データ:コンテンツタイプ、言語、作成日、最終更新日(ソースと同期された時)を表示します。
Fin settings: Fin AI AgentおよびCopilotで有効/無効にするための設定。 有効にすると、コンテンツは顧客がFin AI Agentを通じて、チームメンバーはCopilotを通じてそれぞれ利用可能になります。
リンク: このウェブサイトソースの公開URL。
レポート:このウェブサイトソースが関与または解決したFinの会話。
タグ:Intercomでコンテンツをグループ化および整理するために独自のカスタムタグを適用します。
フォルダー: この公開URLがKnowledge Hubのどのフォルダーにあるか。同期されたコンテンツのフォルダーは変更できません。
注: ウェブサイトのソースは読み取り専用で、Intercom内で編集できません。ソース側で編集する必要があります。
Make it available to Fin and Copilot
To make a website source available to Fin AI Agent and/or Copilot, go to Fin AI Agent > Train > Content and select the website source, then click on the live page(s) you've synced and select Change AI Agent state > Enable for AI Agent or Change Copilot state > Enable for Copilot..
You can also manage these settings from an individual webpage in the "Details" panel, scroll down to Fin settings and choose whether to toggle on:
Fin AI Agent - This setting will make the public URL available for Fin to use when responding to customers.
Copilot - This setting will make the public URL available for Copilot to use when answering teammates questions in the inbox via the Copilot panel.
Learn how to set up Fin AI Agent for your customers or enable your team on using Copilot in the inbox.
Make it available to a specific audience
You can assign audiences to synced content automatically using URL-based rules during web sync creation, or manually on a per-page basis. First, you'll need to create and define the audience you want to target.
To assign an audience manually to individual pages, go to Fin AI Agent > Train > Content and select the website source, then click on the live page(s) you've synced and select More actions > Change Fin audience..
注:
公開URLのデフォルトの対象は「Everyone」です。
Finは公開URLに適用した対象を尊重し、対象のルールに一致する場合にのみこの記事を顧客の質問に答えるために使用します。
Add or edit audience rules on existing syncs
You don't need to recreate a sync to add audience targeting. Go to Fin AI Agent > Train > Content, select the source, click the settings dropdown in the top right, and select Open settings. Navigate to the Target step to add or edit URL-based rules.
Note: When audience rules are added to an existing web sync, they apply retroactively to all content already ingested from that source — not just new content going forward.
Re-sync or remove a website as a source
If you’d like to re-sync or remove a public URL as a source, go to Fin AI Agent > Train > Content and select the source. Then click the settings dropdown in the top right and select Re-sync or Remove this source..
ヒント: ウェブサイトの再同期は通常 週単位で行われます(ソースのサイズによります)が、いつでも手動で再同期できます。
Manage website sync settings
If you’d like to adjust the advanced settings for a website sync, go to Fin AI Agent > Train > Content and select the source. Then click the settings dropdown in the top right and select Open settings..
View website sync history
You can view a list of past website syncs to see when they were last run, which pages were found, and any failed pages. Go to Fin AI Agent > Train > Content and select the website source, then click the settings dropdown in the top right and select View sync history.
表の各行は過去または実行中のランを表し、ステータスでランをフィルタリングできます。以下の情報が含まれます:
同期日
ステータス
同期されたページ
除外されたページ
失敗したページ
所要時間
同期を開始した人
If a sync has failed, you can hover over the status to see a detailed explanation for why.
Automatic syncs pause when Fin isn't using a website
A new source syncs on schedule for its first 90 days regardless. After that, it keeps syncing automatically if either is true:
A page from it was used in a Fin answer in the last 90 days.
Otherwise, scheduled syncs pause.
When paused: pages stay in your Knowledge Hub and stay available to Fin and Copilot (nothing is deleted). Only the re-crawl stops, so edits on your site won't be picked up.
To restore it: The Sync now button refreshes the content once but doesn't restart the schedule. Automatic syncing resumes on its own once Fin uses the source again.
Websites that are heavy to crawl sync less often
Very large sites, and sites needing full JavaScript rendering, cost far more to crawl. When a source turns out to be resource-heavy, we move it from a weekly to an every 14 days schedule.
This happens automatically, per source. To keep a big site on a faster schedule, narrow the crawl by using URL exclusions, or add specific subpages instead of a whole domain.
Troubleshooting website sync
Common issues
When importing website content to enable Fin, you need to enter the public URL. This will search for all pages nested under that URL and sync them for Fin AI Agent to use.
If the importer didn't return the number of pages you expected, there are a few reasons...
The URL provided isn't the top level domain
The website sync works by going to the URL you provide and then searching for all pages nested under that URL. These pages must have the same URL pattern as the URL you provide.
For example, if the top level domain is https://myhelpcenter.com/home, then all pages you want to import must include /home prefix in the URL e.g. https://myhelpcenter.com/home/article. If they do not, remove the prefix and use the most basic URL stem e.g. https://myhelpcenter.com, then try the import again.
The URL is private
If the content you want to use is behind a login, Fin won't be able to access or import it.
ページ制限
ウェブサイトの同期には2つの制限があります:
Domains: 同期できるトップレベルドメインは最大100個です。
Pages per source: Fin は各ソースから最大4,000ページを同期します。
同期は、単一ページに非常に大量のコンテンツが含まれている場合にも失敗することがあります。同期が失敗した場合は、メールで通知されます。
注意:
ソースが4,000ページを超える場合は、各ソースが制限以下になるよういくつかのソースに分割してください:
サイトを小さなセクションに分割し、それぞれを個別のソースとして追加します。
例えば、製品分野やカテゴリごとに1つのソースとして、異なるURLパスを別々に同期します。
これにより各ソースがページ制限内に収まり、同期ごとに処理されるコンテンツが減ります。
特定の地域IPに制限されたウェブサイト
Intercom のウェブサイト同期(Fin AI Agent と Copilot の公開URLを追加するために使用)は、現時点で専用のカスタムユーザーエージェント文字列を使用していません。
これらのリクエストを識別または許可するには:
By IP address: 当社のクローラーは通常動的IPを使用します。サイトがホワイトリストを必要とする場合はご連絡ください。ワークスペース向けに静的な地域別IPを有効にできます。
これらのリクエストはウェブサイトの同期にのみ使用されます。Messengerのトラフィックやエンドユーザーのトラッキングには影響しません。
英語以外または国際サイトのページが同期されない
サイトマップに非ASCII文字(アクセント付き文字や中国語・アラビア語などのスクリプト)を含むURLがある場合、それらのページの一部は期待通りに同期されないことがあります。サイトマップの検出はこれらのURLをサポートしますが、同期プロセスの他の部分で問題が発生することがあります。手動で再同期して解決を試みてください。ページがまだ欠落している場合は、support にお問い合わせください。
ウェブサイト同期エラー
コンテンツを同期すると、プロセス中に発生したことを示すさまざまなステータスが表示されることがあります。ウェブサイトの同期ステータスを確認するには Fin AI Agent > Train > Content に移動し、ウェブサイトソースを選択して、Status ドロップダウンで以下をフィルタしてください:
同期中
公開中
失敗
除外済み
各ステータスの意味と次に取るべき対応は以下の通りです:
同期中
ページの同期はまだ進行中です。初回同期は、コンテンツ量によって数分から1時間以上かかることがあります。
公開中
ページは正常に同期され、Fin と Copilot で有効化できます。
注意: 成功した同期がページ上のすべてのコンテンツを必ずしもスクレイプできているとは限りません。完全にカバーされているか確認したい場合は、そのページから期待される回答で Fin をプレビュー することを推奨します。
除外済み
これらのページは、同期設定で除外したため意図的に同期されていません。再試行不可で、特に指定がない限り含めることはできません。
失敗
これらのエラーは同期が完了しなかったことを意味し、再試行する前にあなたの側で変更が必要な場合があります:
1. 不明なエラー
Message: “このページにアクセスできませんでした。遅いかブロックされている可能性があります。再同期を試すか、失敗する場合は support にお問い合わせください。”
What it means: ページへのアクセスを妨げる何かがあり、原因は明確ではありません。
2. セッションがブロック / レート制限
Message: “ウェブサイトが当社のコンテンツへのアクセスを防いでいます。アンチクローラー設定やファイアウォールでブロックされていないか確認してください。サイトの構成を確認して再同期を試してください。問題が続く場合は support にお問い合わせください。”
What it means: あなたのサイトが当社のクローラーを積極的にブロックまたは制限しています。
3. ネットワーク、タイムアウト、または類似のエラー
Message: “このページにアクセスできませんでした。ページの読み込みが遅いか、アンチクローラー設定やファイアウォールでブロックされている可能性があります。サイトの構成を確認して再同期を試してください。問題が続く場合は support にお問い合わせください。”
What it means: ページが時間内に読み込まれなかったか、ネットワークの問題やブロックのために到達できませんでした。
What to do: 「Navigation timeout」エラーは、ボット保護やセキュリティソフトが当社のクローラーをブロックしていることが原因であることが多いです。これを解決するには、上記の詳細設定セクションに記載された static proxy IP addresses をホワイトリストに追加し、ウェブサイト同期の作成または編集時にAdvanced settingsで該当するプロキシ地域を選択し、同期を再試行してください。
4. 重複
Message: “このページは既に同期されている別のページと同じコンテンツを持っています。1つのバージョンだけが含まれます。”
What it means: 同一のコンテンツが別の場所で検出されたため、1つのコピーのみが保持されます。
5. キーワードフィルタリング
Message: “URLにcategory、collection、またはtagのようなキーワードが含まれるページは、通常ユニークなコンテンツを含まないためデフォルトで除外されます。もしこのページを含めるべき場合は support にお問い合わせください。”
What it means: これらのURLは一覧を表していることが多く、単独のコンテンツページではありません。
6. ステータスコード 400
メッセージ:「ページのコンテンツが見つかりません。URLが有効であり、ページが正常に読み込まれるか確認してください。」
意味: URL が壊れているか、ウェブサイトでエラーを返している可能性があります。
7. ブロックされた URL
メッセージ:「この website domain は同期からブロックされています。必要な場合はサポートに連絡してください。」
意味: domain は同期から意図的に除外されています。
失敗したページ同期は、ページにカーソルを合わせて三点リーダーメニューを選択し、Resync を選ぶことで再試行できます。
注意: Website Sync は生の Markdown ファイルのインポートをサポートしていません。正しい書式とタイトル検出のため、コンテンツはレンダリング済みの HTML として提供するか、スニペット/ファイルとしてアップロードしてください。Markdown の構造(例: # 見出し)は HTML に変換されない限り認識されません。























