Passar para o conteúdo principal

Sincronizar e gerenciar websites

Como sincronizar URLs públicas no Knowledge e habilitar este conteúdo para Fin.

Escrito por Beth-Ann Sher

Se você deseja adicionar conteúdo de sites ao Intercom e torná‑lo disponível para Fin AI Agent e Copilot, você pode fazê‑lo sincronizando a URL pública do seu site. Você também pode treinar Fin e Copilot com conteúdo de posts de blog, changelogs, atualizações de notícias ou quaisquer outras páginas da web com datas. Isso garante que Fin e Copilot usem sempre as informações mais atualizadas e relevantes dessas fontes.

Observação: Este recurso funciona apenas com URLs públicas. Se o conteúdo que você deseja usar estiver atrás de um login, Fin não conseguirá acessá‑lo ou importá‑lo.


Sincronize conteúdo do site com Fin e Copilot

Vá para Fin AI Agent > Train > Content, depois selecione Website sync em “Add content.”

Agora insira a URL do seu conteúdo de suporte externo (domínio de nível superior) e clique em Next:

Isso buscará todas as páginas do URL do site que você fornecer e lerá todas as páginas de sub domain.

Dica: Domínios de nível superior trarão os melhores resultados (por exemplo, use a URL da página inicial do seu external help center https://myhelpcenter.com em vez de subpáginas https://myhelpcenter.com/articles).

Observação: A sincronização de sites tem um máximo de 100 websites.

Revisar páginas a sincronizar

Depois de inserir sua URL, verificaremos se ela é válida e acessível. Então você precisará revisar as páginas a sincronizar. Todas as subpáginas vinculadas em cada seção selecionada serão sincronizadas. Selecione apenas conteúdo relevante e atualizado.

Dicas:

  • Selecione páginas e seções que contenham conteúdo de suporte como artigos de ajuda, guias ou FAQS.

  • Evite selecionar páginas de marketing, listagens de produtos ou páginas com layouts complexos.

  • Todas as subpáginas vinculadas dentro das seções selecionadas serão incluídas automaticamente.

  • Você sempre pode atualizar sua seleção mais tarde nas configurações avançadas.

Configurações avançadas [opcional]

Selecione o dropdown Advanced settings para configurar URLs adicionais, excluir URLs, seletores CSS para excluir e mais.

URLs adicionais

A estrutura dos websites pode variar. Para garantir que sincronizemos seu conteúdo mais relevante, recomendamos adicionar URLs adicionais para essas subpáginas específicas.

Por exemplo, se você inserir https://myhelpcenter.com/help como a URL principal acima, você também pode querer adicionar a URL específica como https://myhelpcenter.com/help/index.html

URLs para excluir

Para excluir determinadas páginas das quais você não deseja sincronizar conteúdo, você pode adicionar uma lista de globs de URL.

O que é um glob de URL?

Um glob é uma sequência de caracteres literais e/ou curingas usada para corresponder caminhos de arquivos ou URLs. Globbing é o ato de localizar arquivos em um sistema de arquivos usando um ou mais globs. Usar globs de URL também ajuda a obter uma gama de URLs que são em sua maioria iguais, com apenas uma pequena parte mudando entre as requisições.

Por exemplo, este glob de URL https://{store,docs}.example.com/** permite que o rastreador acesse todas as URLs que começam com https://store.example.com/ ou https://docs.example.com/ e https://example.com/**/*\?*foo=*

Dica: Não tem certeza se seu padrão glob corresponderá às URLs que você deseja excluir? Você pode usar a ferramenta DigitalOcean's Glob Tool para testar padrões contra URLs de amostra antes de aplicá‑los. (Esta é uma ferramenta de terceiros não mantida pela Intercom.)

Seletores CSS para excluir

Para excluir certos elementos da página, você pode usar seletores CSS dessas seções ou elementos específicos que deseja excluir.

Isso é útil para pular conteúdo irrelevante da página. O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll(). Por padrão, já removemos elementos comuns de navegação, cabeçalhos, rodapés, modais, scripts e imagens inline.

Seletor CSS clicável

Isso permite que elementos do DOM identificados pelo seletor CSS sejam clicados durante o processo de sincronização da web.

Isso é útil para expandir seções recolhidas, a fim de capturar seu conteúdo de texto. O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll().

Exemplos são "[aria-expanded=\"false\"]", #expand_section

Condições complexas também podem ser descritas com um seletor CSS. Em CSS, encadear seletores sem espaços cria uma condição semelhante a AND, por exemplo .button.blue.small corresponderá apenas a elementos com as três classes.

Usar vírgula (,) como separador funciona como OR, por exemplo .button, .blue, h1 direciona todos os elementos com classe button, ou classe blue, ou cabeçalhos de primeiro nível.

Aguardar carregamento do seletor CSS

Para direcionar conteúdo que pode ter um atraso em aparecer na página, você pode adicionar um seletor CSS que fará o scraper da web aguardar antes de raspar o conteúdo.

Isso é útil para páginas nas quais o reconhecimento padrão de carregamento de conteúdo por rede ociosa falha. Definir essa opção desativa completamente o comportamento padrão, e a página será processada somente se o elemento especificado por esse seletor aparecer.

Observação: O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll().

XML Sitemap

Ative o XML Sitemap para uma websync mais robusta em sites que suportam sitemap, permitindo o acesso a páginas que podem não ser alcançáveis a partir das URLs iniciais.

Se esta opção estiver ativada, o scraper da web procurará Sitemaps nos domínios da URL de origem fornecida e enfileirará URLs correspondentes de forma semelhante aos links encontrados nas páginas rastreadas. Você também pode referenciar um arquivo sitemap.xml diretamente adicionando‑o como outra Start URL, por exemplo https://www.example.com/sitemap.xml.

Região do proxy

Você pode selecionar um proxy para o crawler usar se precisar que seu website seja rastreado com um proxy configurado para uma região ou país específico.

Atualmente suportamos os seguintes proxies:

  • Rotativo: United States, Germany, France, United Kingdom, Czechia, Hungary

  • Estático:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • Austrália - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

Tipo de rastreador

Escolha com que profundidade o rastreador renderiza cada página ao sincronizar este site.

  • Páginas sincronizadas vazias ou truncadas geralmente significam renderização por JavaScript. Mude para Full e sincronize novamente.

  • Full é mais pesado, então é mais provável que coloque uma fonte grande em um cronograma reduzido.

  • Você pode alterar isso em uma fonte existente e re-sincronizar para comparar.

Opção

O que faz

Use quando

Rápido

Lê HTML sem executar JavaScript.

O conteúdo está no HTML inicial — a maioria dos blogs, docs, help centers.

Auto (padrão)

Nós escolhemos e mudamos para Full se o site precisar de JavaScript.

Você não tem certeza. Adequado para quase todo mundo.

Full

Carrega cada página em um navegador e executa JavaScript. Mais lento.

O conteúdo só aparece depois que os scripts são executados, aplicativos de página única e páginas com muito JavaScript.

Ignorar URLs canônicos

Quando ativado, o web scraper ignora tags de link canônico (rel="canonical") e trata cada URL como uma página distinta. Esta opção está desativada por padrão.

Isto é útil quando um site aponta muitas páginas para um URL canônico e o conteúdo está sendo perdido como resultado.

Excluindo parâmetros de consulta e respeitando robots.txt

Há dois toggles adicionais em Advanced settings. Ambos estão desativados por padrão.

Respect robots.txt: faz o rastreador obedecer às regras de disallow no robots.txt do seu site. Ative para manter a sincronização consistente com o que você permite que outros rastreadores alcancem. Se o robots.txt impedir caminhos que contenham conteúdo que você deseja no Fin, isso reduzirá o que é sincronizado.

Exclude query parameters: pula qualquer URL com uma string de consulta (?). Ative quando seu site adiciona parâmetros de rastreamento, sessão ou ordenação que produzem muitas páginas quase duplicadas. Deixe desativado se conteúdo real estiver atrás de uma string de consulta, como /docs?page=intro — essas páginas também seriam puladas.

Públicos-alvo

A etapa Target permite definir um público padrão para todas as páginas sincronizadas e criar regras baseadas em URL para atribuir automaticamente públicos específicos com base em padrões de URL — sem necessidade de marcação manual.

Primeiro decida se o conteúdo desta fonte está habilitado para Fin AI Agent e/ou Copilot.

Em seguida, você pode definir um público Fin padrão para aplicar a todas as páginas sincronizadas desta fonte (se nenhum padrão for definido, o conteúdo fica definido como Everyone), ou criar regras para atribuir públicos específicos com base em padrões de URL.

Por exemplo: Se a URL contiver /uk, atribua o público do Reino Unido. As regras são avaliadas durante a sincronização, então Fin e Copilot sempre servem o conteúdo certo para o público certo.

Cada regra suporta três comparadores de URL:

  • Starts with — corresponde a URLs que começam com um determinado prefixo.

  • Ends with — corresponde a URLs que terminam com um determinado sufixo.

  • Contains — corresponde a URLs que contêm uma determinada substring.

Nota:

  • Uma visualização ao vivo mostra quantas páginas correspondem a cada regra, ajudando a validar as regras antes de salvar. Isso requer um sitemap disponível para sua fonte de sincronização web. Sem um sitemap, as regras ainda se aplicam, mas você não pode visualizar correspondências.

  • As regras são nomeadas automaticamente ao serem criadas, mas podem ser renomeadas. Um máximo de 10 regras por fonte de sincronização web é aplicado.

  • As regras de público são apenas aditivas: adicionam públicos ao conteúdo, mas nunca removem atribuições existentes. Remover uma regra não desfaz suas atribuições de público passadas.

Revisar configurações de sincronização

Por fim, revise suas configurações de sincronização e clique em Sync website para começar a sincronizar o conteúdo do seu site com o Intercom.


Gerenciar sincronizações de sites

Uma vez que a sincronização for concluída, você receberá uma notificação por e-mail e o site aparecerá como uma fonte sincronizada em Fin AI Agent > Train > Content.

Configurar configurações para páginas específicas

Vá para Fin AI Agent > Train > Content selecione a fonte do site e clique em uma página que você sincronizou. Você encontrará um painel "Details" à direita que contém:

  • Dados: Veja o tipo de conteúdo, idioma, data de criação e última atualização (quando foi sincronizado pela última vez com a fonte).

  • Fin settings: Para ativar/desativar para Fin AI Agent e Copilot. Quando ativado, o conteúdo fica disponível para clientes através de Fin AI Agent e para colegas via Copilot, respectivamente.

  • Link: A URL pública para esta fonte do site.

  • Relatórios: As conversas do Fin onde esta fonte do site esteve envolvida ou resolvida.

  • Tags: Para aplicar suas próprias tags personalizadas para agrupar e organizar conteúdo no Intercom.

  • Folder: A pasta onde esta URL pública está localizada no Knowledge Hub. Você não pode alterar a pasta do conteúdo sincronizado.

Note: As fontes do site são somente leitura e não podem ser editadas dentro do Intercom; devem ser editadas na fonte.

Torná-la disponível para Fin e Copilot

Para tornar uma fonte do site disponível para Fin AI Agent e/ou Copilot, vá para Fin AI Agent > Train > Content e selecione a fonte do site, depois clique nas páginas ao vivo que você sincronizou e selecione Change AI Agent state > Enable for AI Agent ou Change Copilot state > Enable for Copilot.

Você também pode gerenciar essas configurações a partir de uma página individual no painel "Details" , role para baixo até as configurações Fin e escolha se deseja ativar:

  • Fin AI Agent - Esta configuração tornará a URL pública disponível para o Fin usar ao responder aos clientes.

  • Copilot - Esta configuração tornará a URL pública disponível para o Copilot usar ao responder às perguntas dos colegas na inbox pelo painel do Copilot.

Saiba como configurar o Fin AI Agent para seus clientes ou habilitar sua equipe para usar o Copilot na inbox.

Torná-la disponível para um público específico

Você pode atribuir públicos ao conteúdo sincronizado automaticamente usando regras baseadas em URL durante a criação da sincronização web, ou manualmente por página. Primeiro, você precisará criar e definir o público que deseja segmentar.

Para atribuir um público manualmente a páginas individuais, vá para Fin AI Agent > Train > Content e selecione a fonte do site, depois clique nas páginas ao vivo que você sincronizou e selecione More actions > Change Fin audience.

Note:

  • O público padrão para URLs públicas é “Everyone”.

  • Fin respeitará qualquer público que você aplicar a uma URL pública e usará este artigo para responder às perguntas dos clientes apenas se elas corresponderem às regras de público.

Adicionar ou editar regras de público em sincronizações existentes

Você não precisa recriar uma sincronização para adicionar segmentação de público. Vá para Fin AI Agent > Train > Content, selecione a fonte, clique no menu de configurações no canto superior direito e selecione Open settings. Navegue até a etapa Target para adicionar ou editar regras baseadas em URL.

Note: Quando regras de público são adicionadas a uma sincronização web existente, elas se aplicam retroativamente a todo o conteúdo já ingerido dessa fonte — não apenas ao conteúdo novo daqui para frente.

Re-sincronizar ou remover um site como fonte

Se desejar re-sincronizar ou remover uma URL pública como fonte, vá para Fin AI Agent > Train > Content e selecione a fonte. Em seguida, clique no menu de configurações no canto superior direito e selecione Re-sync ou Remove this source.

Tip: Re-sincronizações de sites geralmente acontecem semanalmente (dependendo do tamanho da fonte) e podem ser re-sincronizadas manualmente a qualquer momento.

Gerenciar configurações de sincronização do site

Se quiser ajustar as configurações avançadas para uma sincronização de site, vá para Fin AI Agent > Train > Content e selecione a fonte. Em seguida, clique no menu de configurações no canto superior direito e selecione Open settings.

Ver histórico de sincronização do site

Você pode ver uma lista de sincronizações de sites passadas para ver quando foram executadas pela última vez, quais páginas foram encontradas e quaisquer páginas com falha. Vá para Fin AI Agent > Train > Content e selecione a fonte do site, depois clique no menu de configurações no canto superior direito e selecione View sync history.


Cada linha na tabela representa uma execução passada ou ativa, e você pode filtrar as execuções por status. Inclui as seguintes informações:

  • Data da sincronização

  • Status

  • Páginas sincronizadas

  • Páginas excluídas

  • Páginas com falha

  • Duração

  • Sincronização iniciada por

Se uma sincronização falhou, você pode passar o cursor sobre o status para ver uma explicação detalhada do motivo.

Sincronizações automáticas pausam quando o Fin não está usando um site

Uma nova fonte sincroniza conforme o cronograma pelos primeiros 90 dias independentemente. Depois disso, ela continua sincronizando automaticamente se qualquer uma das condições for verdadeira:

  • Uma página dela foi usada em uma resposta do Fin nos últimos 90 dias.

Caso contrário, as sincronizações programadas pausam.

When paused: as páginas permanecem no seu Knowledge Hub e continuam disponíveis para Fin e Copilot (nada é excluído). Apenas a re-varredura é interrompida, então edições no seu site não serão captadas.

To restore it: O botão Sync now atualiza o conteúdo uma vez, mas não reinicia o cronograma. A sincronização automática retoma por si só quando o Fin voltar a usar a fonte.

Sites que são pesados para rastrear sincronizam com menos frequência

Sites muito grandes e sites que precisam de renderização completa de JavaScript custam muito mais para rastrear. Quando uma fonte se mostra pesada em recursos, nós a movemos de uma programação semanal para uma programação de every 14 days.

Isso acontece automaticamente, por fonte. Para manter um site grande em um cronograma mais rápido, restrinja a varredura usando exclusões de URL ou adicione subpáginas específicas em vez de um domínio inteiro.


Solução de problemas da sincronização do site

Problemas comuns

Ao importar conteúdo do site para habilitar o Fin, você precisa inserir a public URL. Isso pesquisará todas as páginas aninhadas sob essa URL e as sincronizará para o Fin AI Agent usar.

Se o importador não retornou o número de páginas que você esperava, há algumas razões...

A URL fornecida não é o top level domain

A sincronização do site funciona indo até a URL que você fornece e então pesquisando todas as páginas aninhadas sob essa URL. Essas páginas devem ter o mesmo padrão de URL que a URL que você fornece.

Por exemplo, se o domínio de nível superior for https://myhelpcenter.com/home, então todas as páginas que você deseja importar devem incluir o prefixo /home na URL, por exemplo https://myhelpcenter.com/home/article. Se não incluírem, remova o prefixo e use o tronco de URL mais básico, por exemplo https://myhelpcenter.com, então tente a importação novamente.

A URL é privada

Se o conteúdo que você quer usar estiver protegido por login, Fin não poderá acessá-lo ou importá-lo.

Limites de páginas

A sincronização de sites tem dois limites:

  • Domains: você pode sincronizar até 100 domínios de nível superior diferentes.

  • Pages per source: Fin sincroniza no máximo 4.000 páginas de cada fonte.

Uma sincronização também pode falhar se uma única página contiver uma quantidade muito grande de conteúdo. Você será notificado por email sempre que uma sincronização falhar.

Note:

  • Se uma fonte tiver mais de 4.000 páginas, divida-a em várias fontes para que cada uma fique dentro do limite:

    • Particione o site em seções menores e adicione cada seção como sua própria fonte.

    • Sincronize diferentes caminhos de URL separadamente, por exemplo, uma fonte por área de produto ou categoria.

  • Isso mantém cada fonte dentro do limite de páginas e reduz o conteúdo processado por sincronização.

Sites restritos a IPs regionais específicos

A sincronização de sites da Intercom (usada para adicionar URLs públicas para Fin AI Agent e Copilot) não utiliza uma string de user-agent dedicada e personalizada no momento.


Para identificar ou permitir essas requisições:

  • By IP address: Nosso rastreador normalmente usa IPs dinâmicos. Se seu site exigir allowlisting, entre em contato conosco e podemos habilitar IPs estáticos específicos por região para seu espaço de trabalho.

  • Essas requisições são usadas apenas para sincronização de sites. Elas não afetam o tráfego do Messenger nem o rastreamento de usuários finais.

Páginas de sites não ingleses ou internacionais não estão sincronizando

Se seu sitemap inclui URLs com caracteres não ASCII (como letras acentuadas ou scripts como chinês ou árabe), algumas dessas páginas podem não sincronizar como esperado. A descoberta de sitemaps agora suporta essas URLs, mas elas ainda podem ter problemas em outras partes do processo de sincronização. Tente ressincronizar manualmente para resolver. Se as páginas ainda estiverem ausentes, entre em contato com o suporte.

Erros de sincronização de sites

Ao sincronizar conteúdo, você pode ver diferentes status que indicam o que aconteceu durante o processo. Para ver o status de sincronização do seu site, vá para Fin AI Agent > Train > Content e selecione a fonte do site, em seguida use o menu Status para filtrar por:

  • Sincronizando

  • Ativo

  • Falhou

  • Excluído

Isto é o que cada um significa e o que você pode fazer a seguir:

Sincronizando

A sincronização de páginas ainda está em andamento. Uma sincronização inicial pode levar de alguns minutos a mais de uma hora, dependendo da quantidade de conteúdo que você tem.

Ativo

A página foi sincronizada com sucesso e pode ser habilitada para Fin e Copilot.

Note: Uma sincronização bem-sucedida nem sempre significa que conseguimos rastrear todo o conteúdo da página. Se você quiser confirmar cobertura completa, recomendamos visualizar o Fin com respostas que você espera que ele encontre nessa página.

Excluído

Essas páginas não são sincronizadas intencionalmente porque você as excluiu nas suas configurações de sincronização. Elas não são reexecutáveis e não podem ser incluídas, salvo indicação em contrário.

Falhou

Esses erros significam que a sincronização não foi concluída e pode exigir alterações do seu lado antes de tentar novamente:

1. Unknown error

  • Message: “This page couldn't be accessed. It may be slow or blocked. Try syncing again, or contact support if it fails.”

  • What it means: Algo impediu que acessássemos a página, mas a causa não está clara.

2. Session blocked / Rate limited

  • Message: “The website is preventing us from accessing its content. Check if it's being blocked by an anti-crawler setting or firewall. Check your site configuration and try syncing again. If the issue persists, contact support.”

  • What it means: Seu site está ativamente bloqueando ou limitando nosso rastreador.

3. Network, timeout, or similar errors

  • Message: “This page couldn't be accessed. It may be slow to load or blocked by anti-crawler settings or a firewall. Check your site configuration and try syncing again. If the issue persists, contact support.

  • What it means: A página não carregou a tempo ou não pôde ser alcançada devido a problemas de rede ou bloqueio.

4. Duplicate

  • Message: “This page has the same content as another that's already synced. Only one version will be included.”

  • What it means: Detectamos conteúdo idêntico em outro lugar, então apenas uma cópia é mantida.

5. Keyword filtering

  • Message: “Pages with keywords like category, collection, or tag in the URL are excluded by default, as they usually don't contain unique content. If this page should be included, contact support.”

  • What it means: These URLs often represent lists, not standalone content pages.

6. Status code 400

  • Mensagem: “Conteúdo da página não encontrado. Verifique se a URL é válida e se a página carrega sem problemas.

  • O que isso significa: A URL pode estar quebrada ou retornando um erro no seu site.

7. URL Bloqueada

  • Mensagem: “This website domain is blocked from being synced. If you require this, contact support.”

  • O que isso significa: The domain is intentionally excluded from syncing.


​Você pode tentar novamente uma sincronização de página que falhou passando o cursor sobre a página, selecionando o menu de três pontos e então selecionando Resync.

Observação: Website Sync NÃO suporta importar arquivos Markdown brutos. Para formatação adequada e detecção de título, você deve fornecer o conteúdo como HTML renderizado ou enviá-lo como um snippet/arquivo. A estrutura Markdown (por exemplo, # headings) não será reconhecida a menos que convertida para HTML.

Respondeu à sua pergunta?