Si deseas añadir contenido de sitios web a Intercom y ponerlo a disposición de Fin AI Agent y Copilot, puedes hacerlo sincronizando la URL pública de tu sitio. También puedes entrenar a Fin y Copilot con contenido de entradas de blog, registros de cambios, noticias o cualquier otra página web con fechas. Esto garantiza que Fin y Copilot siempre utilicen la información más actualizada y relevante de estas fuentes.
Nota: Esta función funciona solo con URLs públicas. Si el contenido que deseas usar está detrás de un inicio de sesión, Fin no podrá acceder a él ni importarlo.
Sincronizar contenido del sitio web con Fin y Copilot
Ve a Fin AI Agent > Train > Content, luego selecciona Website sync en “Add content.”
Ahora ingresa la URL de tu contenido de soporte externo (dominio de nivel superior) y haz clic en Siguiente:
Esto recuperará todas las páginas de la URL del sitio que proporciones y leerá todas las páginas de sub domain.
Consejo: Los dominios de nivel superior ofrecerán los mejores resultados (por ejemplo, usa la URL de la página principal de tu help center externa https://myhelpcenter.com en lugar de subpáginas https://myhelpcenter.com/articles).
Nota: La sincronización de sitios web tiene un máximo de 100 sitios web.
Revisar páginas para sincronizar
Una vez que ingreses tu URL, verificaremos que sea válida y accesible. Luego tendrás que revisar las páginas para sincronizar. Todas las subpáginas vinculadas en cada sección seleccionada se sincronizarán. Selecciona solo contenido relevante y actualizado.
Consejos:
Selecciona páginas y secciones que contengan contenido de soporte como artículos de ayuda, guías o FAQS.
Evita seleccionar páginas de marketing, listados de productos o páginas con diseños complejos.
Todas las subpáginas vinculadas dentro de las secciones seleccionadas se incluirán automáticamente.
Siempre puedes actualizar tu selección más tarde en la configuración avanzada.
Configuración avanzada [opcional]
Selecciona el desplegable de Advanced settings para configurar URLs adicionales, excluir URLs, selectores CSS para excluir y más.
URLs adicionales
Las estructuras de sitios web pueden variar. Para asegurarte de que sincronizamos tu contenido más relevante, recomendamos que añadas URLs adicionales para esas subpáginas específicas.
Por ejemplo, si ingresas https://myhelpcenter.com/help como la URL principal anterior, también puede que quieras añadir la URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir ciertas páginas de las que no deseas sincronizar contenido, puedes añadir una lista de globs de URL.
¿Qué es un glob de URL?
Un glob es una cadena de caracteres literales y/o comodines utilizada para coincidir con rutas de archivos o URLs. Globbing es el acto de localizar archivos en un sistema de archivos usando uno o más globs. Usar globs de URL también ayuda a obtener un rango de URLs que son mayormente iguales, con solo una pequeña parte cambiando entre las solicitudes.
Por ejemplo, este glob de URL https://{store,docs}.example.com/** permite que el rastreador acceda a todas las URLs que comienzan con https://store.example.com/ o https://docs.example.com/ y https://example.com/**/*\?*foo=*
Consejo: ¿No estás seguro de si tu patrón glob coincidirá con las URLs que deseas excluir? Puedes usar la Herramienta Glob de DigitalOcean para probar patrones contra URLs de ejemplo antes de aplicarlos. (Esta es una herramienta de terceros no mantenida por Intercom.)
Selectores CSS para excluir
Para excluir ciertos elementos de la página, puedes usar selectores CSS de esas secciones o elementos específicos que desees excluir.
Esto es útil para omitir contenido irrelevante de la página. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll(). Por defecto, ya eliminamos elementos comunes de navegación, encabezados, pies de página, modales, scripts e imágenes en línea.
Selector CSS clicable
Esto permite que los elementos DOM identificados por el selector CSS sean clicados durante el proceso de sincronización web.
Esto es útil para expandir secciones colapsadas, con el fin de capturar su contenido de texto. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Ejemplos son "[aria-expanded=\"false\"]", #expand_section
También se pueden describir condiciones complejas con un selector CSS. En CSS, encadenar selectores sin espacios crea una condición tipo AND; por ejemplo .button.blue.small coincidirá solo con elementos que tengan las tres clases.
Usar coma (,) como separador funciona como OR; por ejemplo .button, .blue, h1 apunta a todos los elementos con la clase button, o la clase blue, o encabezados de primer nivel.
Esperar la carga del selector CSS
Para apuntar a contenido que pueda tardar en aparecer en la página, puedes añadir un selector CSS que hará que el scraper web espere antes de extraer el contenido.
Esto es útil para páginas en las que el reconocimiento predeterminado de carga de contenido por red inactiva falla. Configurar esta opción desactiva por completo el comportamiento predeterminado, y la página se procesará solo si aparece el elemento especificado por este selector.
Nota: El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Mapa del sitio XML
Activa el Mapa del sitio XML para una sincronización web más robusta en sitios que lo soporten, permitiendo el acceso a páginas que podrían no ser alcanzables desde las URLs iniciales.
Si esta opción está activada, el scraper web buscará Sitemaps en los dominios de la URL de origen proporcionada y encolará las URLs coincidentes de forma similar a los enlaces encontrados en las páginas rastreadas. También puedes referenciar un archivo sitemap.xml directamente agregándolo como otra URL de inicio, por ejemplo https://www.example.com/sitemap.xml.
Región del proxy
Puedes seleccionar un proxy para que lo use el rastreador si requieres que tu sitio web sea rastreado con un proxy configurado en una región o país específico.
Actualmente soportamos los siguientes proxies:
Rotativo: United States, Germany, France, United Kingdom, Czechia, Hungary
Estático:
United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de rastreador
Elija cuán exhaustivamente el rastreador renderiza cada página al sincronizar este sitio web.
Las páginas que se sincronizan vacías o truncadas suelen deberse al renderizado de JavaScript. Cambie a Full y vuelva a sincronizar.
Full es más pesado, por lo que es más probable que coloque una fuente grande en un horario reducido.
Puede cambiar esto en una fuente existente y volver a sincronizar para comparar.
Opción | Qué hace | Úselo cuando |
Rápido | Lee HTML sin ejecutar JavaScript. | El contenido está en el HTML inicial: la mayoría de los blogs, documentación, help centers. |
Auto (predeterminado) | Seleccionamos y cambiamos a Full si el sitio necesita JavaScript. | No está seguro. Adecuado para casi todos. |
Full | Carga cada página en un navegador y ejecuta JavaScript. Más lento. | El contenido solo aparece después de que se ejecutan los scripts, aplicaciones de una sola página, páginas con mucho JavaScript. |
Ignorar URLs canónicas
Cuando está habilitado, el rastreador web ignora las etiquetas de enlace canónico (rel="canonical") y trata cada URL como una página distinta. Esta opción está desactivada por defecto.
Esto es útil cuando un sitio apunta muchas páginas a una URL canónica y se está perdiendo contenido como resultado.
Excluir parámetros de consulta y respetar robots.txt
Hay dos conmutadores más bajo Advanced settings. Ambos están desactivados por defecto.
Respect robots.txt: hace que el rastreador obedezca las reglas disallow en el robots.txt de su sitio. Enciéndalo para mantener la sincronización consistente con lo que permite a otros rastreadores alcanzar. Si robots.txt desautoriza rutas que contienen contenido que desea en Fin, esto reducirá lo que se sincroniza.
Exclude query parameters: omite cualquier URL con una cadena de consulta (?). Enciéndalo cuando su sitio agregue parámetros de seguimiento, sesión o ordenación que produzcan muchas páginas casi duplicadas. Déjelo apagado si el contenido real se encuentra detrás de una cadena de consulta, como /docs?page=intro: esas páginas también se omitirían.
Audiencias objetivo
El paso Target le permite establecer una audiencia predeterminada para todas las páginas sincronizadas y crear reglas basadas en URL para asignar automáticamente audiencias específicas según patrones de URL; no se requiere etiquetado manual.
Primero decida si el contenido de esta fuente está habilitado para Fin AI Agent y/o Copilot.
Luego puede establecer una audiencia Fin predeterminada que se aplique a todas las páginas sincronizadas desde esta fuente (si no se establece una predeterminada, el contenido por defecto es Everyone), o crear reglas para asignar audiencias específicas según patrones de URL.
Por ejemplo: Si la URL contiene /uk, asigne la audiencia del Reino Unido. Las reglas se evalúan durante la sincronización, por lo que Fin y Copilot siempre sirven el contenido correcto a la audiencia correcta.
Cada regla admite tres comparadores de URL:
Comienza con — coincide con las URLs que comienzan con un prefijo dado.
Termina con — coincide con las URLs que terminan con un sufijo dado.
Contiene — coincide con las URLs que contienen una subcadena dada.
Nota:
Una vista previa en vivo muestra cuántas páginas coinciden con cada regla, lo que le ayuda a validar las reglas antes de guardar. Esto requiere que un sitemap esté disponible para su fuente de sincronización web. Sin un sitemap, las reglas aún se aplican pero no puede obtener vista previa de las coincidencias.
Las reglas se nombran automáticamente al crearlas pero se pueden renombrar. Se aplica un máximo de 10 reglas por fuente de sincronización web.
Las reglas de audiencia son solo aditivas: añaden audiencias al contenido pero nunca eliminan asignaciones existentes. Eliminar una regla no deshace sus asignaciones de audiencia pasadas.
Revisar configuraciones de sincronización
Por último, revise sus configuraciones de sincronización y haga clic en Sync website para comenzar a sincronizar el contenido de su sitio web con Intercom.
Administrar sincronizaciones de sitios web
Una vez que la sincronización se complete, recibirá una notificación por correo electrónico y el sitio web aparecerá como una fuente sincronizada en Fin AI Agent > Train > Content.
Configurar ajustes para páginas específicas
Vaya a Fin AI Agent > Train > Content seleccione la fuente del sitio web, luego haga clic en una página que haya sincronizado. Encontrará un panel "Detalles" a la derecha que contiene:
Datos: Vea el tipo de contenido, idioma, fecha de creación y última actualización (cuando se sincronizó por última vez con la fuente).
Fin settings: Para habilitar/deshabilitar para Fin AI Agent y Copilot. Cuando está habilitado, el contenido queda disponible para los clientes a través de Fin AI Agent y para los compañeros de equipo a través de Copilot, respectivamente.
Enlace: La URL pública para esta fuente de sitio web.
Informes: Las conversaciones de Fin en las que esta fuente de sitio web ha participado o se han resuelto.
Etiquetas: Para aplicar sus propias etiquetas personalizadas para agrupar y organizar contenido en Intercom.
Carpeta: La carpeta donde vive esta URL pública en el Knowledge Hub. No puedes cambiar la carpeta del contenido sincronizado.
Nota: Las fuentes de sitios web son de solo lectura y no pueden editarse dentro de Intercom; deben editarse en la fuente.
Hazlo disponible para Fin y Copilot
Para poner una fuente de sitio web a disposición de Fin AI Agent y/o Copilot, ve a Fin AI Agent > Train > Content, selecciona la fuente del sitio web, luego haz clic en la(s) página(s) en vivo que sincronizaste y selecciona Cambiar estado del agente de IA > Habilitar para AI Agent o Cambiar estado de Copilot > Habilitar para Copilot.
También puedes gestionar estos ajustes desde una página web individual en el panel de Detalles, desplázate hasta los ajustes de Fin y elige si activar:
Fin AI Agent - Esta configuración hará que la URL pública esté disponible para que Fin la use al responder a los clientes.
Copilot - Esta configuración hará que la URL pública esté disponible para que Copilot la use al responder preguntas de los compañeros en la inbox a través del panel de Copilot.
Aprende cómo configurar Fin AI Agent para tus clientes u habilitar a tu equipo para usar Copilot en la inbox.
Hazlo disponible para una audiencia específica
Puedes asignar audiencias al contenido sincronizado automáticamente usando reglas basadas en URL durante la creación de la sincronización web, o manualmente por página. Primero, necesitarás crear y definir la audiencia que deseas orientar.
Para asignar una audiencia manualmente a páginas individuales, ve a Fin AI Agent > Train > Content, selecciona la fuente, luego haz clic en la(s) página(s) en vivo que sincronizaste y selecciona Más acciones > Cambiar audiencia de Fin.
Nota:
La audiencia predeterminada para las URLs públicas es “Everyone”.
Fin respetará cualquier audiencia que apliques a una URL pública y solo usará este artículo para responder preguntas de clientes si coinciden con las reglas de audiencia.
Agregar o editar reglas de audiencia en sincronizaciones existentes
No necesitas recrear una sincronización para añadir orientación de audiencia. Ve a Fin AI Agent > Train > Content, selecciona la fuente, haz clic en el menú de configuración en la esquina superior derecha y selecciona Abrir ajustes. Navega al paso Target para añadir o editar reglas basadas en URL.
Nota: Cuando se añaden reglas de audiencia a una sincronización web existente, se aplican retroactivamente a todo el contenido ya ingerido desde esa fuente, no solo al contenido nuevo.
Volver a sincronizar o eliminar un sitio web como fuente
Si deseas volver a sincronizar o eliminar una URL pública como fuente, ve a Fin AI Agent > Train > Content y selecciona la fuente. Luego haz clic en el menú de configuración en la esquina superior derecha y selecciona Re-sync o Remove this source.
Sugerencia: Las re-sincronizaciones del sitio web normalmente suceden semanalmente (dependiendo del tamaño de la fuente) y se pueden re-sincronizar manualmente en cualquier momento.
Gestionar ajustes de sincronización del sitio web
Si deseas ajustar los ajustes avanzados para una sincronización de sitio web, ve a Fin AI Agent > Train > Content y selecciona la fuente. Luego haz clic en el menú de configuración en la esquina superior derecha y selecciona Abrir ajustes.
Ver historial de sincronización del sitio web
Puedes ver una lista de sincronizaciones pasadas para ver cuándo se ejecutaron por última vez, qué páginas se encontraron y cualquier página fallida. Ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego haz clic en el menú de configuración en la esquina superior derecha y selecciona Ver historial de sincronización.
Cada fila de la tabla representa una ejecución pasada o activa, y puedes filtrar las ejecuciones por estado. Incluye la siguiente información:
Fecha de sincronización
Estado
Páginas sincronizadas
Páginas excluidas
Páginas fallidas
Duración
Sincronización iniciada por
Si una sincronización ha fallado, puedes pasar el cursor sobre el estado para ver una explicación detallada del por qué.
Las sincronizaciones automáticas se pausarán cuando Fin no esté usando un sitio web
Una nueva fuente se sincroniza según el programa durante sus primeros 90 días independientemente. Después de eso, sigue sincronizándose automáticamente si se cumple alguna de estas condiciones:
Se usó una página de ella en una respuesta de Fin en los últimos 90 días.
De lo contrario, las sincronizaciones programadas se pausan.
Cuando está pausado: las páginas permanecen en tu Knowledge Hub y siguen disponibles para Fin y Copilot (nada se elimina). Solo se detiene la nueva rastreada, por lo que las ediciones en tu sitio no se recogerán.
Para restaurarlo: El botón Sync now actualiza el contenido una vez pero no reinicia el programa. La sincronización automática se reanuda por sí sola una vez que Fin vuelva a usar la fuente.
Los sitios web que requieren muchos recursos para rastrear se sincronizan con menos frecuencia
Los sitios muy grandes y los que necesitan renderizado completo de JavaScript cuestan mucho más rastrear. Cuando una fuente resulta ser exigente en recursos, la movemos de una programación semanal a una cada 14 días.
Esto ocurre automáticamente, por fuente. Para mantener un sitio grande en un programa más rápido, reduce el rastreo usando exclusiones de URL, o añade subpáginas específicas en lugar de un dominio completo.
Solución de problemas de la sincronización del sitio web
Problemas comunes
Al importar contenido del sitio web para habilitar Fin, necesitas introducir la URL pública. Esto buscará todas las páginas anidadas bajo esa URL y las sincronizará para que Fin AI Agent las use.
Si el importador no devolvió el número de páginas que esperabas, hay varias razones...
La URL proporcionada no es el dominio de nivel superior
La sincronización del sitio web funciona yendo a la URL que proporcionas y luego buscando todas las páginas anidadas bajo esa URL. Estas páginas deben tener el mismo patrón de URL que la URL que proporcionas.
Por ejemplo, si el dominio de nivel superior es https://myhelpcenter.com/home, entonces todas las páginas que quieras importar deben incluir el prefijo /home en la URL, p. ej. https://myhelpcenter.com/home/article. Si no lo hacen, elimina el prefijo y usa el tallo de URL más básico, p. ej. https://myhelpcenter.com, luego intenta la importación de nuevo.
La URL es privada
Si el contenido que quieres usar está detrás de un inicio de sesión, Fin no podrá accederlo ni importarlo.
Límites de páginas
La sincronización de sitios web tiene dos límites:
Domains: puedes sincronizar hasta 100 dominios de nivel superior diferentes.
Pages per source: Fin sincroniza un máximo de 4.000 páginas desde cada fuente.
Una sincronización también puede fallar si una sola página contiene una cantidad muy grande de contenido. Se te notificará por correo electrónico cada vez que falle una sincronización.
Nota:
Si una fuente tiene más de 4.000 páginas, divídela en varias fuentes para que cada una se mantenga por debajo del límite:
Partition the site into smaller sections and add each section as its own source.
Sincroniza diferentes rutas URL por separado; por ejemplo, una fuente por área de producto o categoría.
Esto mantiene cada fuente por debajo del límite de páginas y reduce el contenido procesado por sincronización.
Sitios web restringidos a IPs regionales específicas
La sincronización de sitios web de Intercom (usada para añadir URLs públicas para Fin AI Agent y Copilot) no utiliza en este momento una cadena user-agent personalizada o dedicada.
Para identificar o permitir estas solicitudes:
By IP address: Nuestro rastreador normalmente usa IPs dinámicas. Si tu sitio requiere allowlisting, contáctanos y podemos habilitar IPs estáticas específicas por región para tu espacio de trabajo.
Estas solicitudes se usan solo para la sincronización de sitios web. No afectan tu tráfico de Messenger ni el seguimiento de usuarios finales.
Las páginas de sitios no ingleses o internacionales no se están sincronizando
Si tu sitemap incluye URLs con caracteres no ASCII (como letras acentuadas o escrituras como chino o árabe) algunas de esas páginas pueden no sincronizarse como se espera. El descubrimiento de sitemaps ahora admite estas URLs, pero aún pueden tener problemas en otras partes del proceso de sincronización. Intenta volver a sincronizar manualmente para resolverlo. Si aún faltan páginas, contacta con support.
Errores de sincronización del sitio web
Cuando sincronizas contenido, puedes ver diferentes estados que indican lo que sucedió durante el proceso. Para ver el estado de sincronización del sitio web ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego usa el menú desplegable Status para filtrar por:
Sincronizando
En vivo
Fallido
Excluido
Esto es lo que significa cada uno y qué puedes hacer a continuación:
Sincronizando
La sincronización de la página aún está en progreso. Una sincronización inicial puede tardar desde unos minutos hasta más de una hora, según la cantidad de contenido que tengas.
En vivo
La página se sincronizó correctamente y puede habilitarse para Fin y Copilot.
Note: Una sincronización exitosa no siempre significa que pudimos extraer todo el contenido de la página. Si quieres confirmar la cobertura completa, recomendamos previsualizar Fin con las respuestas que esperas que encuentre en esa página.
Excluido
Estas páginas no se sincronizan intencionalmente porque las excluiste en tus sync settings. No se pueden reintentar y no pueden incluirse a menos que se especifique lo contrario.
Fallido
Estos errores significan que la sincronización no se completó y puede requerir cambios de tu parte antes de volver a intentarlo:
1. Unknown error
Message: “This page couldn't be accessed. It may be slow or blocked. Try syncing again, or contact support if it fails.”
What it means: Algo impidió que accediéramos a la página, pero la causa no está clara.
2. Session blocked / Rate limited
Message: “The website is preventing us from accessing its content. Check if it's being blocked by an anti-crawler setting or firewall. Check your site configuration and try syncing again. If the issue persists, contact support.”
What it means: Tu sitio está bloqueando o limitando activamente a nuestro rastreador.
3. Network, timeout, or similar errors
Message: “This page couldn't be accessed. It may be slow to load or blocked by anti-crawler settings or a firewall. Check your site configuration and try syncing again. If the issue persists, contact support.
What it means: La página no se cargó a tiempo o no se pudo alcanzar debido a problemas de red o bloqueo.
4. Duplicate
Message: “This page has the same content as another that's already synced. Only one version will be included.”
What it means: Detectamos contenido idéntico en otro lugar, por lo que solo se conserva una copia.
5. Keyword filtering
Message: “Pages with keywords like category, collection, or tag in the URL are excluded by default, as they usually don't contain unique content. If this page should be included, contact support.”
What it means: Estas URLs a menudo representan listas, no páginas de contenido independientes.
6. Status code 400
Mensaje: “No se puede encontrar el contenido de la página. Comprueba que la URL es válida y que la página carga sin problemas.”
Qué significa: La URL puede estar rota o devolviendo un error en tu sitio web.
7. URL bloqueada
Mensaje: “Este website domain está bloqueado para sincronizarse. Si lo necesitas, contacta con support.”
Qué significa: El domain está intencionadamente excluido de la sincronización.
Puedes reintentar una sincronización de página fallida colocando el cursor sobre la página, seleccionando el menú de tres puntos y luego Resync.
Nota: Website Sync no admite la importación de archivos Markdown sin procesar. Para un formato y detección de títulos adecuados, debes proporcionar el contenido como HTML renderizado o subirlo como fragmento/archivo. La estructura de Markdown (p. ej., encabezados con #) no se reconocerá a menos que se convierta a HTML.























