Se você deseja adicionar conteúdo de sites ao Intercom e torná-lo disponível para Fin AI Agent e Copilot, você pode fazer isso sincronizando a URL pública do seu site. Você também pode treinar Fin e Copilot com conteúdo de posts de blog, changelogs, atualizações de notícias ou quaisquer outras páginas da web com datas. Isso garante que Fin e Copilot sempre usem as informações mais atualizadas e relevantes dessas fontes.
Observação: Esse recurso funciona apenas com URLs públicas. Se o conteúdo que você deseja usar estiver atrás de um login, o Fin não poderá acessá‑lo ou importá‑lo.
Sincronize conteúdo do site com Fin e Copilot
Vá para Fin AI Agent > Train > Content, em seguida selecione Website sync em “Add content.”
Agora insira a URL do seu conteúdo de suporte externo (domínio de nível superior) e clique em Next:
Isso buscará todas as páginas do URL do site que você fornecerá e lerá todas as páginas de subdomínio.
Dica: Domínios de nível superior fornecerão os melhores resultados (por exemplo, use a URL da página inicial do seu help center externo https://myhelpcenter.com em vez de subpáginas https://myhelpcenter.com/articles).
Observação: A sincronização de sites tem um máximo de 100 sites.
Revisar páginas para sincronizar
Depois de inserir sua URL, iremos verificar se ela é válida e acessível. Em seguida, você precisará revisar as páginas a serem sincronizadas. Todas as subpáginas vinculadas em cada seção selecionada serão sincronizadas. Selecione apenas conteúdo relevante e atualizado.
Dicas:
Selecione páginas e seções que contenham conteúdo de suporte, como artigos de ajuda, guias ou FAQs.
Evite selecionar páginas de marketing, listas de produtos ou páginas com layouts complexos.
Todas as subpáginas vinculadas dentro das seções selecionadas serão incluídas automaticamente.
Você sempre pode atualizar sua seleção mais tarde nas configurações avançadas.
Configurações avançadas [opcional]
Selecione o menu suspenso Advanced settings para configurar URLs adicionais, excluir URLs, seletores CSS a excluir e mais.
URLs adicionais
As estruturas de sites podem variar. Para garantir que sincronizemos seu conteúdo mais relevante, recomendamos que você adicione URLs adicionais para essas subpáginas específicas.
Por exemplo, se você inserir https://myhelpcenter.com/help como a URL principal acima, talvez também queira adicionar a URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir certas páginas das quais você não deseja sincronizar conteúdo, você pode adicionar uma lista de globs de URL.
O que é um glob de URL?
Um glob é uma sequência de caracteres literais e/ou curingas usada para corresponder caminhos de arquivos ou URLs. Globbing é o ato de localizar arquivos em um sistema de arquivos usando um ou mais globs. Usar globs de URL também ajuda a obter uma faixa de URLs que são quase iguais, com apenas uma pequena parte mudando entre as solicitações.
Por exemplo, este glob de URL https://{store,docs}.example.com/** permite que o rastreador acesse todas as URLs que começam com https://store.example.com/ ou https://docs.example.com/ e https://example.com/**/*\?*foo=*
Dica: Não tem certeza se seu padrão glob corresponderá às URLs que você deseja excluir? Você pode usar a ferramenta DigitalOcean's Glob Tool para testar padrões contra URLs de exemplo antes de aplicá‑los. (Esta é uma ferramenta de terceiros não mantida pela Intercom.)
Seletores CSS para excluir
Para excluir certos elementos da página, você pode usar seletores CSS dessas seções ou elementos específicos que deseja excluir.
Isso é útil para pular conteúdo irrelevante da página. O valor deve ser um seletor CSS válido, aceito pela função document.querySelectorAll(). Por padrão, já removemos elementos comuns de navegação, cabeçalhos, rodapés, modais, scripts e imagens inline.
Seletor CSS clicável
Isso permite que elementos do DOM identificados pelo seletor CSS sejam clicados durante o processo de sincronização da web.
Isso é útil para expandir seções recolhidas, a fim de capturar seu conteúdo de texto. O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll().
Exemplos são "[aria-expanded=\"false\"]", #expand_section
Condições complexas também podem ser descritas com um seletor CSS. Em CSS, encadear seletores sem espaços cria uma condição do tipo E, por exemplo .button.blue.small corresponderá apenas a elementos com todas as três classes.
Usar vírgula (,) como separador funciona como OU, por exemplo .button, .blue, h1 alvo todos os elementos com a classe button, ou a classe blue, ou cabeçalhos de primeiro nível.
Aguardar carregamento do seletor CSS
Para segmentar conteúdo que pode ter um atraso ao aparecer na página, você pode adicionar um seletor CSS que fará o rastreador aguardar antes de raspar o conteúdo.
Isso é útil para páginas em que o reconhecimento padrão de carregamento de conteúdo por rede ociosa falha. Definir esta opção desativa completamente o comportamento padrão, e a página será processada somente se o elemento especificado por esse seletor aparecer.
Observação: O valor deve ser um seletor CSS válido aceitado pela função document.querySelectorAll().
XML Sitemap
Habilite o XML Sitemap para uma sincronização web mais robusta em sites que suportam sitemap, permitindo o acesso a páginas que podem não ser alcançáveis a partir das URLs iniciais.
Se essa opção estiver ativada, o rastreador procurará Sitemaps nos domínios da URL de origem fornecida e enfileirará URLs correspondentes de forma semelhante aos links encontrados nas páginas rastreadas. Você também pode referenciar um arquivo sitemap.xml diretamente adicionando-o como outra Start URL, por exemplo https://www.example.com/sitemap.xml.
Região do proxy
Você pode selecionar um proxy para o rastreador usar se precisar que seu site seja rastreado com um proxy configurado para uma região ou país específico.
Atualmente suportamos os seguintes proxies:
Rotativo: United States, Germany, France, United Kingdom, Czechia, Hungary
Estático:
United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Austrália - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de rastreador
Escolha com que profundidade o rastreador renderiza cada página enquanto sincroniza este site.
Páginas sincronizadas vazias ou truncadas geralmente significam renderização por JavaScript. Mude para Full e re-sincronize.
Full é mais pesado, portanto é mais provável que coloque uma fonte grande em uma programação reduzida.
Você pode alterar isso em uma fonte existente e re-sincronizar para comparar.
Opção | O que faz | Use quando |
Rápido | Lê HTML sem executar JavaScript. | O conteúdo está no HTML inicial — a maioria dos blogs, docs, help centers. |
Auto (padrão) | Nós escolhemos, e mudamos para Full se o site precisar de JavaScript. | Você não tem certeza. Certo para quase todo mundo. |
Full | Carrega cada página em um navegador e executa JavaScript. Mais lento. | O conteúdo aparece apenas depois que os scripts são executados, aplicativos de página única e páginas pesadas em JavaScript. |
Ignorar URLs canônicos
Quando ativado, o web scraper ignora tags de link canonical (rel="canonical") e trata cada URL como uma página distinta. Esta opção está desativada por padrão.
Isto é útil quando um site aponta muitas páginas para uma URL canônica e o conteúdo está sendo perdido como resultado.
Excluindo parâmetros de consulta e respeitando robots.txt
Existem dois alternadores adicionais em Advanced settings. Ambos estão desativados por padrão.
Respect robots.txt: faz com que o rastreador obedeça às regras de disallow no robots.txt do seu site. Ative para manter a sincronização consistente com o que você permite que outros rastreadores acessem. Se o robots.txt proibir caminhos que contenham conteúdo que você deseja no Fin, isso reduzirá o que é sincronizado.
Exclude query parameters: ignora qualquer URL com uma string de consulta (?). Ative quando seu site adiciona parâmetros de rastreamento, sessão ou ordenação que produzem muitas páginas quase duplicadas. Deixe desativado se conteúdo real estiver por trás de uma string de consulta, como /docs?page=intro — essas páginas também seriam ignoradas.
Públicos-alvo
A etapa Target permite definir um público padrão para todas as páginas sincronizadas e criar regras baseadas em URL para atribuir automaticamente públicos específicos com base em padrões de URL — sem necessidade de marcação manual.
Primeiro decida se o conteúdo desta fonte está habilitado para Fin AI Agent e/ou Copilot.
Então você pode definir um público Fin padrão para aplicar a todas as páginas sincronizadas desta fonte (se nenhum padrão for definido, o conteúdo terá como padrão Everyone), ou criar regras para atribuir públicos específicos com base em padrões de URL.
Por exemplo: Se a URL contiver /uk, atribua o público do Reino Unido. As regras são avaliadas durante a sincronização, então Fin e Copilot sempre fornecem o conteúdo certo ao público certo.
Cada regra suporta três comparadores de URL:
Começa com — corresponde a URLs que começam com um determinado prefixo.
Termina com — corresponde a URLs que terminam com um determinado sufixo.
Contém — corresponde a URLs que contêm uma determinada substring.
Nota:
Uma pré-visualização ao vivo mostra quantas páginas correspondem a cada regra, ajudando a validar as regras antes de salvar. Isso requer um sitemap disponível para sua fonte de sincronização web. Sem um sitemap, as regras ainda se aplicam, mas você não pode visualizar correspondências.
As regras são nomeadas automaticamente ao serem criadas, mas podem ser renomeadas. É aplicado um máximo de 10 regras por fonte de sincronização web.
As regras de público são apenas aditivas: elas adicionam públicos ao conteúdo, mas nunca removem atribuições existentes. Remover uma regra não desfaz suas atribuições de público passadas.
Revisar configurações de sincronização
Por fim, revise suas configurações de sincronização e clique em Sync website para começar a sincronizar o conteúdo do seu site com o Intercom.
Gerenciar sincronizações de sites
Depois que a sincronização for concluída, você receberá uma notificação por e-mail e o site aparecerá como uma fonte sincronizada em Fin AI Agent > Train > Content.
Configurar configurações para páginas específicas
Vá para Fin AI Agent > Train > Content selecione a fonte do site e clique em uma página que você sincronizou. Você encontrará um painel "Details" à direita que contém:
Dados: Veja o tipo de conteúdo, idioma, data de criação e última atualização (quando foi sincronizado pela última vez com a fonte).
Fin settings: Para ativar/desativar para Fin AI Agent e Copilot. Quando ativado, o conteúdo fica disponível para clientes através de Fin AI Agent e para colegas via Copilot, respectivamente.
Link: A URL pública para esta fonte do site.
Relatórios: As conversas do Fin onde esta fonte do site esteve envolvida ou foi resolvida.
Tags: Para aplicar suas próprias tags personalizadas para agrupar e organizar conteúdo no Intercom.
Folder: The folder where this public URL lives in the Knowledge Hub. You can’t change the folder of synced content.
Note: Website sources are read-only and can’t be edited within Intercom, they must be edited at the source.
Make it available to Fin and Copilot
To make a website source available to Fin AI Agent and/or Copilot, go to Fin AI Agent > Train > Content and select the website source, then click on the live page(s) you've synced and select Change AI Agent state > Enable for AI Agent or Change Copilot state > Enable for Copilot.
You can also manage these settings from an individual webpage in the "Details" panel, scroll down to Fin settings and choose whether to toggle on:
Fin AI Agent - This setting will make the public URL available for Fin to use when responding to customers.
Copilot - This setting will make the public URL available for Copilot to use when answering teammates questions in the inbox via the Copilot panel.
Learn how to set up Fin AI Agent for your customers or enable your team on using Copilot in the inbox.
Make it available to a specific audience
You can assign audiences to synced content automatically using URL-based rules during web sync creation, or manually on a per-page basis. First, you'll need to create and define the audience you want to target.
To assign an audience manually to individual pages, go to Fin AI Agent > Train > Content and select the website source, then click on the live page(s) you've synced and select More actions > Change Fin audience.
Note:
The default audience for public URLs is “Everyone”.
Fin will respect any audience you apply to a public URL and only use this article to answer customer questions if they match the audience rules.
Add or edit audience rules on existing syncs
You don't need to recreate a sync to add audience targeting. Go to Fin AI Agent > Train > Content, select the source, click the settings dropdown in the top right, and select Open settings. Navigate to the Target step to add or edit URL-based rules.
Note: When audience rules are added to an existing web sync, they apply retroactively to all content already ingested from that source — not just new content going forward.
Re-sync or remove a website as a source
If you’d like to re-sync or remove a public URL as a source, go to Fin AI Agent > Train > Content and select the source. Then click the settings dropdown in the top right and select Re-sync or Remove this source.
Tip: Website re-syncs usually happen weekly (depending on the size of the source) and can be re-synced manually at any time.
Manage website sync settings
If you’d like to adjust the advanced settings for a website sync, go to Fin AI Agent > Train > Content and select the source. Then click the settings dropdown in the top right and select Open settings.
View website sync history
You can view a list of past website syncs to see when they were last run, which pages were found, and any failed pages. Go to Fin AI Agent > Train > Content and select the website source, then click the settings dropdown in the top right and select View sync history.
Each row in the table represents a past or active run, and you can filter the runs by status. It includes the following information:
Sync date
Status
Synced pages
Excluded pages
Failed pages
Duration
Sync started by
If a sync has failed, you can hover over the status to see a detailed explanation for why.
Automatic syncs pause when Fin isn't using a website
A new source syncs on schedule for its first 90 days regardless. After that, it keeps syncing automatically if either is true:
A page from it was used in a Fin answer in the last 90 days.
Otherwise, scheduled syncs pause.
When paused: pages stay in your Knowledge Hub and stay available to Fin and Copilot (nothing is deleted). Only the re-crawl stops, so edits on your site won't be picked up.
To restore it: The Sync now button refreshes the content once but doesn't restart the schedule. Automatic syncing resumes on its own once Fin uses the source again.
Websites that are heavy to crawl sync less often
Very large sites, and sites needing full JavaScript rendering, cost far more to crawl. When a source turns out to be resource-heavy, we move it from a weekly to an every 14 days schedule.
This happens automatically, per source. To keep a big site on a faster schedule, narrow the crawl by using URL exclusions, or add specific subpages instead of a whole domain.
Troubleshooting website sync
Common issues
When importing website content to enable Fin, you need to enter the public URL. This will search for all pages nested under that URL and sync them for Fin AI Agent to use.
If the importer didn't return the number of pages you expected, there are a few reasons...
The URL provided isn't the top level domain
The website sync works by going to the URL you provide and then searching for all pages nested under that URL. These pages must have the same URL pattern as the URL you provide.
For example, if the top level domain is https://myhelpcenter.com/home, then all pages you want to import must include /home prefix in the URL e.g. https://myhelpcenter.com/home/article. If they do not, remove the prefix and use the most basic URL stem e.g. https://myhelpcenter.com, then try the import again.
The URL is private
Se o conteúdo que você quer usar estiver atrás de um login, Fin não poderá acessá‑lo nem importá‑lo.
Limites de páginas
A sincronização de site tem dois limites:
Domains: você pode sincronizar até 100 diferentes domínios de nível superior.
Pages per source: Fin sincroniza no máximo 4.000 páginas de cada fonte.
Uma sincronização também pode falhar se uma única página contiver uma quantidade muito grande de conteúdo. Você receberá uma notificação por e‑mail sempre que uma sincronização falhar.
Note:
Se uma fonte tiver mais de 4.000 páginas, divida‑a em várias fontes para que cada uma fique abaixo do limite:
Partition the site into smaller sections and add each section as its own source.
Sincronize diferentes caminhos de URL separadamente — por exemplo, uma fonte por área de produto ou categoria.
Isso mantém cada fonte abaixo do limite de páginas e reduz o conteúdo processado por sincronização.
Sites restritos a IPs regionais específicos
A sincronização de site da Intercom (usada para adicionar URLs públicas para Fin AI Agent e Copilot) não utiliza uma string de user‑agent dedicada e personalizada no momento.
Para identificar ou permitir essas requisições:
By IP address: Nosso crawler normalmente usa IPs dinâmicos. Se seu site exigir allowlisting, entre em contato conosco e podemos habilitar IPs estáticos por região para seu workspace.
Essas requisições são usadas apenas para sincronização de site. Elas não afetam o tráfego do Messenger nem o rastreamento de usuários finais.
Páginas de sites não ingleses ou internacionais não estão sendo sincronizadas
Se seu sitemap incluir URLs com caracteres não ASCII (como letras acentuadas, ou scripts como chinês ou árabe), algumas dessas páginas podem não sincronizar conforme o esperado. A descoberta de sitemap agora suporta esses URLs, mas eles ainda podem apresentar problemas em outras partes do processo de sincronização. Tente sincronizar manualmente para resolver. Se as páginas ainda estiverem faltando, contacte o suporte.
Erros de sincronização de site
Ao sincronizar conteúdo, você pode ver diferentes status que indicam o que aconteceu durante o processo. Para ver o status de sincronização do seu site, vá para Fin AI Agent > Train > Content e selecione a fonte do site, então use o menu suspenso Status para filtrar por:
Sincronizando
Ativo
Falhou
Excluído
Isto é o que cada um significa e o que você pode fazer em seguida:
Sincronizando
A sincronização da página ainda está em andamento. Uma sincronização inicial pode levar desde alguns minutos até mais de uma hora, dependendo de quanto conteúdo você tem.
Ativo
A página foi sincronizada com sucesso e pode ser habilitada para Fin e Copilot.
Note: Uma sincronização bem‑sucedida nem sempre significa que conseguimos raspar todo o conteúdo da página. Se você quiser confirmar a cobertura completa, recomendamos pré‑visualizar o Fin com respostas que você espera que ele encontre nessa página.
Excluído
Essas páginas não são sincronizadas intencionalmente porque você as excluiu nas suas configurações de sincronização. Elas não são reexecutáveis e não podem ser incluídas, a menos que especificado de outra forma.
Falhou
Esses erros significam que a sincronização não foi concluída e pode exigir alterações do seu lado antes de tentar novamente:
1. Unknown error
Message: “This page couldn't be accessed. It may be slow or blocked. Try syncing again, or contact support if it fails.”
What it means: Algo impediu o acesso à página, mas a causa não está clara.
2. Session blocked / Rate limited
Message: “The website is preventing us from accessing its content. Check if it's being blocked by an anti-crawler setting or firewall. Check your site configuration and try syncing again. If the issue persists, contact support.”
What it means: Seu site está bloqueando ou limitando ativamente nosso crawler.
3. Network, timeout, or similar errors
Message: “This page couldn't be accessed. It may be slow to load or blocked by anti-crawler settings or a firewall. Check your site configuration and try syncing again. If the issue persists, contact support.
What it means: A página não carregou a tempo ou não pôde ser alcançada devido a problemas de rede ou bloqueio.
What to do: A erro de "Navigation timeout" geralmente é causada por proteção contra bots ou software de segurança no seu site bloqueando o crawler da Intercom. Para resolver isto, permita na lista branca os endereços IP de proxy estáticos listados na seção Advanced settings acima, então selecione a região de proxy correspondente em Advanced settings ao criar ou editar sua sincronização de site, e tente novamente a sincronização.
4. Duplicate
Message: “This page has the same content as another that's already synced. Only one version will be included.”
What it means: Detectamos conteúdo idêntico em outro lugar, então apenas uma cópia é mantida.
5. Keyword filtering
Message: “Pages with keywords like category, collection, or tag in the URL are excluded by default, as they usually don't contain unique content. If this page should be included, contact support.”
What it means: Essas URLs geralmente representam listas, não páginas de conteúdo independentes.
6. Código de status 400
Mensagem: “O conteúdo da página não pode ser encontrado. Verifique se a URL é válida e se a página carrega sem problemas.
O que significa: A URL pode estar quebrada ou retornando um erro em seu site.
7. URL bloqueada
Mensagem: “This website domain is blocked from being synced. If you require this, contact support.”
O que significa: O domain está intencionalmente excluído da sincronização.
Você pode tentar sincronizar novamente uma página com falha posicionando o cursor sobre a página, selecionando o menu de três pontos e então selecionando Resync.
Observação: Website Sync não dá suporte à importação de arquivos Markdown brutos. Para formatação adequada e detecção de títulos, você deve fornecer o conteúdo como HTML renderizado ou enviá-lo como um snippet/arquivo. A estrutura Markdown (por exemplo, # headings) não será reconhecida a menos que convertida para HTML.























