Si deseas agregar contenido web a Intercom y ponerlo a disposición de Fin AI Agent y Copilot, puedes hacerlo sincronizando la URL pública de tu sitio. También puedes entrenar a Fin y Copilot con contenido de publicaciones de blog, registros de cambios, actualizaciones de noticias o cualquier otra página web con fechas. Esto asegura que Fin y Copilot siempre usen la información más actualizada y relevante de estas fuentes.
Nota: Esta función solo funciona con URLs públicas. Si el contenido que deseas usar está detrás de un inicio de sesión, Fin no podrá acceder ni importarlo.
Sincroniza contenido web con Fin y Copilot
Ve a Fin AI Agent > Entrenar > Contenido, luego selecciona Sincronización de sitio web en “Agregar contenido.”
Ahora ingresa la URL de tu contenido de soporte externo (dominio de nivel superior) y haz clic en Siguiente:
Esto obtendrá todas las páginas de la URL del sitio web que proporciones y leerá todas las páginas de subdominios.
Consejo: Los dominios de nivel superior ofrecen los mejores resultados (por ejemplo, usa la URL principal de tu help center externo https://myhelpcenter.com en lugar de subpáginas https://myhelpcenter.com/articles).
Nota: La sincronización de sitios web tiene un máximo de 100 sitios.
Revisar páginas para sincronizar
Una vez que ingreses tu URL, verificaremos que sea válida y accesible. Luego deberás revisar las páginas para sincronizar. Todas las subpáginas vinculadas en cada sección seleccionada se sincronizarán. Selecciona solo contenido relevante y actualizado.
Consejos:
Selecciona páginas y secciones que contengan contenido de soporte como artículos de ayuda, guías o FAQS.
Evita seleccionar páginas de marketing, listados de productos o páginas con diseños complejos.
Todas las subpáginas vinculadas dentro de las secciones seleccionadas se incluirán automáticamente.
Siempre puedes actualizar tu selección más adelante en la configuración avanzada.
Configuración avanzada [opcional]
Selecciona el menú desplegable de Configuración avanzada para configurar URLs adicionales, excluir URLs, selectores CSS para excluir y más.
URLs adicionales
Las estructuras de sitios web pueden variar. Para asegurarte de sincronizar tu contenido más relevante, recomendamos agregar URLs adicionales para esas subpáginas específicas.
Por ejemplo, si ingresas https://myhelpcenter.com/help como URL principal arriba, también podrías querer agregar la URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir ciertas páginas de las que no quieres sincronizar contenido, puedes agregar una lista de patrones glob de URL.
¿Qué es un patrón glob de URL?
Un glob es una cadena de caracteres literales y/o comodines usada para coincidir con rutas de archivos o URLs. Globbing es el acto de localizar archivos en un sistema de archivos usando uno o más globs. Usar patrones glob de URL también ayuda a obtener un rango de URLs que son mayormente iguales, con solo una pequeña parte cambiando entre las solicitudes.
Por ejemplo, este patrón glob de URL https://{store,docs}.example.com/** permite que el rastreador acceda a todas las URLs que comienzan con https://store.example.com/ o https://docs.example.com/ y https://example.com/**/*\?*foo=*
Consejo: ¿No estás seguro si tu patrón glob coincidirá con las URLs que quieres excluir? Puedes usar DigitalOcean's Glob Tool para probar patrones contra URLs de ejemplo antes de aplicarlos. (Esta es una herramienta de terceros no mantenida por Intercom.)
Selectores CSS para excluir
Para excluir ciertos elementos de página, puedes usar selectores CSS de esas secciones o elementos específicos que quieres excluir.
Esto es útil para omitir contenido irrelevante de la página. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll(). Por defecto, ya eliminamos elementos comunes de navegación, encabezados, pies de página, modales y scripts.
Nota: Las imágenes ahora se ingieren por defecto al sincronizar sitios web. Para controlar cómo Fin usa imágenes y GIFs en las respuestas, consulta Usar imágenes y GIFs en respuestas de Fin AI Agent.
Selector CSS clicable
Esto permite que los elementos DOM identificados por el selector CSS sean clicados durante el proceso de sincronización web.
Esto es útil para expandir secciones colapsadas, para capturar su contenido de texto. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Los ejemplos son "[aria-expanded=\"false\"]", #expand_section
Las condiciones complejas también pueden describirse con un selector CSS. En CSS, encadenar selectores sin espacios crea una condición tipo AND, por ejemplo .button.blue.small coincidirá solo con elementos que tengan las tres clases.
Usar coma (,) como separador funciona como OR, por ejemplo .button, .blue, h1 apunta a todos los elementos con clase button, o clase blue, o encabezados de primer nivel.
Esperar para cargar selector CSS
Para apuntar a contenido que puede tardar en aparecer en la página, puedes agregar un selector CSS que hará que el scraper web espere antes de extraer contenido.
Esto es útil para páginas en las que el reconocimiento predeterminado de carga de contenido por red inactiva falla. Configurar esta opción desactiva completamente el comportamiento predeterminado, y la página se procesará solo si aparece el elemento especificado por este selector.
Nota: El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Mapa del sitio XML
Habilita el Mapa del sitio XML para una sincronización web más robusta en sitios que soportan mapas del sitio, permitiendo acceso a páginas que podrían no ser accesibles desde las URLs iniciales.
Si esta opción está habilitada, el scraper web buscará Mapas del sitio en los dominios de la URL fuente proporcionada y encolará URLs coincidentes de manera similar a los enlaces encontrados en las páginas rastreadas. También puedes referenciar un archivo sitemap.xml directamente agregándolo como otra URL de inicio, por ejemplo https://www.example.com/sitemap.xml.
Región del proxy
Puedes seleccionar un proxy para que el rastreador lo use si requieres que tu sitio web sea rastreado con un proxy configurado en una región o país específico.
Actualmente soportamos los siguientes proxies:
Rotativo: Estados Unidos, Alemania, Francia, Reino Unido, Chequia, Hungría
Estático:
Estados Unidos - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de rastreador
Elija qué tan a fondo el rastreador procesa cada página mientras sincroniza este sitio web.
Las páginas que se sincronizan vacías o truncadas generalmente significan renderizado de JavaScript. Cambie a Completo y vuelva a sincronizar.
Completo es más pesado, por lo que es más probable que programe una fuente grande en un horario reducido.
Puede cambiar esto en una fuente existente y volver a sincronizar para comparar.
Opción | Qué hace | Úselo cuando |
Rápido | Lee HTML sin ejecutar JavaScript. | El contenido está en el HTML inicial: la mayoría de blogs, docs, help centers. |
Auto (predeterminado) | Nosotros elegimos y cambiamos a Completo si el sitio necesita JavaScript. | No está seguro. Adecuado para casi todos. |
Completo | Carga cada página en un navegador y ejecuta JavaScript. Más lento. | El contenido solo aparece después de que se ejecutan los scripts, aplicaciones de una sola página, páginas con mucho JavaScript. |
Ignorar URLs canónicas
Cuando está habilitado, el scraper web ignora las etiquetas de enlace canónicas (rel="canonical") y trata cada URL como una página distinta. Esta opción está deshabilitada por defecto.
Esto es útil cuando un sitio apunta muchas páginas a una URL canónica y se pierde contenido como resultado.
Excluir parámetros de consulta y respetar robots.txt
Hay dos interruptores más bajo Configuración avanzada. Ambos están desactivados por defecto.
Respetar robots.txt: hace que el rastreador obedezca las reglas de disallow en el robots.txt de su sitio. Enciéndalo para mantener la sincronización consistente con lo que permite que otros rastreadores alcancen. Si robots.txt prohíbe rutas que contienen contenido que desea en Fin, esto reducirá lo que se sincroniza.
Excluir parámetros de consulta: omite cualquier URL con una cadena de consulta (?). Enciéndalo cuando su sitio agregue parámetros de seguimiento, sesión o clasificación que produzcan muchas páginas casi duplicadas. Déjelo apagado si el contenido real está detrás de una cadena de consulta, como /docs?page=intro — esas páginas también se omitirían.
Audiencias objetivo
El paso Objetivo le permite establecer una audiencia predeterminada para todas las páginas sincronizadas y crear reglas basadas en URL para asignar automáticamente audiencias específicas según patrones de URL — sin etiquetado manual.
Primero decida si el contenido de esta fuente está habilitado para Fin AI Agent y/o Copilot.
Luego puede establecer una audiencia Fin predeterminada para aplicar a todas las páginas sincronizadas desde esta fuente (si no se establece un predeterminado, el contenido se asigna por defecto a Everyone), o crear reglas para asignar audiencias específicas según patrones de URL.
Por ejemplo: Si la URL contiene /uk, asigne la audiencia del Reino Unido. Las reglas se evalúan durante la sincronización, por lo que Fin y Copilot siempre sirven el contenido correcto a la audiencia correcta.
Cada regla admite tres comparadores de URL:
Comienza con — coincide con URLs que comienzan con un prefijo dado.
Termina con — coincide con URLs que terminan con un sufijo dado.
Contiene — coincide con URLs que contienen una subcadena dada.
Nota:
Una vista previa en vivo muestra cuántas páginas coinciden con cada regla, ayudándole a validar reglas antes de guardar. Esto requiere que un sitemap esté disponible para su fuente de sincronización web. Sin un sitemap, las reglas aún se aplican pero no puede previsualizar coincidencias.
Las reglas se nombran automáticamente al crearlas pero pueden ser renombradas. Se aplica un máximo de 10 reglas por fuente de sincronización web.
Las reglas de audiencia son solo aditivas: agregan audiencias al contenido pero nunca eliminan asignaciones existentes. Eliminar una regla no deshace sus asignaciones de audiencia pasadas.
Revisar configuración de sincronización
Finalmente, revise su configuración de sincronización y luego haga clic en Sincronizar sitio web para comenzar a sincronizar el contenido de su sitio con Intercom.
Administrar sincronizaciones de sitios web
Una vez que la sincronización esté completa, recibirá una notificación por correo electrónico y el sitio web aparecerá como una fuente sincronizada bajo Fin AI Agent > Train > Content.
Configurar ajustes para páginas específicas
Vaya a Fin AI Agent > Train > Content, seleccione la fuente del sitio web y luego haga clic en una página que haya sincronizado. Encontrará un panel "Detalles" a la derecha que contiene:
Datos: Vea el tipo de contenido, idioma, fecha de creación y última actualización (cuando se sincronizó por última vez con la fuente).
Configuración Fin: Para habilitar/deshabilitar para Fin AI Agent y Copilot. Cuando está habilitado, el contenido está disponible para clientes a través de Fin AI Agent y para compañeros de equipo vía Copilot, respectivamente.
Enlace: La URL pública para esta fuente del sitio web.
Informes: Las conversaciones de Fin donde esta fuente del sitio web ha estado involucrada o resuelta.
Etiquetas: Para aplicar tus propias etiquetas personalizadas para agrupar y organizar contenido en Intercom.
Carpeta: La carpeta donde vive esta URL pública en el Knowledge Hub. No puedes cambiar la carpeta del contenido sincronizado.
Nota: Las fuentes del sitio web son de solo lectura y no se pueden editar dentro de Intercom, deben editarse en la fuente.
Hazlo disponible para Fin y Copilot
Para hacer que una fuente de sitio web esté disponible para Fin AI Agent y/o Copilot, ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego haz clic en la(s) página(s) en vivo que has sincronizado y selecciona Cambiar estado del agente de IA > Habilitar para agente de IA o Cambiar estado de Copilot > Habilitar para Copilot.
También puedes gestionar estos ajustes desde una página web individual en el panel de "Detalles" , desplázate hacia abajo hasta los ajustes de Fin y elige si activar:
Fin AI Agent - Esta configuración hará que la URL pública esté disponible para que Fin la use al responder a los clientes.
Copilot - Esta configuración hará que la URL pública esté disponible para que Copilot la use al responder preguntas de compañeros en el inbox a través del panel de Copilot.
Aprende cómo configurar Fin AI Agent para tus clientes o habilitar a tu equipo para usar Copilot en el inbox.
Hazlo disponible para una audiencia específica
Puedes asignar audiencias al contenido sincronizado automáticamente usando reglas basadas en URL durante la creación de la sincronización web, o manualmente por página. Primero, necesitarás crear y definir la audiencia que quieres dirigir.
Para asignar una audiencia manualmente a páginas individuales, ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego haz clic en la(s) página(s) en vivo que has sincronizado y selecciona Más acciones > Cambiar audiencia de Fin.
Nota:
La audiencia predeterminada para URLs públicas es “Todos”.
Fin respetará cualquier audiencia que apliques a una URL pública y solo usará este artículo para responder preguntas de clientes si coinciden con las reglas de audiencia.
Agregar o editar reglas de audiencia en sincronizaciones existentes
No necesitas recrear una sincronización para agregar segmentación de audiencia. Ve a Fin AI Agent > Train > Content, selecciona la fuente, haz clic en el menú de configuración en la parte superior derecha y selecciona Abrir configuración. Navega al paso Objetivo para agregar o editar reglas basadas en URL.
Nota: Cuando se agregan reglas de audiencia a una sincronización web existente, se aplican retroactivamente a todo el contenido ya ingerido de esa fuente, no solo al contenido nuevo en adelante.
Volver a sincronizar o eliminar un sitio web como fuente
Si deseas volver a sincronizar o eliminar una URL pública como fuente, ve a Fin AI Agent > Train > Content y selecciona la fuente. Luego haz clic en el menú de configuración en la parte superior derecha y selecciona Volver a sincronizar o Eliminar esta fuente.
Consejo: Las re-sincronizaciones de sitios web suelen ocurrir semanalmente (dependiendo del tamaño de la fuente) y pueden re-sincronizarse manualmente en cualquier momento.
Gestionar ajustes de sincronización del sitio web
Si deseas ajustar los ajustes avanzados para una sincronización de sitio web, ve a Fin AI Agent > Train > Content y selecciona la fuente. Luego haz clic en el menú de configuración en la parte superior derecha y selecciona Abrir configuración.
Ver historial de sincronización del sitio web
Puedes ver una lista de sincronizaciones pasadas para ver cuándo se ejecutaron por última vez, qué páginas se encontraron y cualquier página fallida. Ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego haz clic en el menú de configuración en la parte superior derecha y selecciona Ver historial de sincronización.
Cada fila en la tabla representa una ejecución pasada o activa, y puedes filtrar las ejecuciones por estado. Incluye la siguiente información:
Fecha de sincronización
Estado
Páginas sincronizadas
Páginas excluidas
Páginas fallidas
Duración
Sincronización iniciada por
Si una sincronización ha fallado, puedes pasar el cursor sobre el estado para ver una explicación detallada del motivo.
Las sincronizaciones automáticas se pausan cuando Fin no está usando un sitio web
Una nueva fuente se sincroniza según el horario durante sus primeros 90 días sin importar qué. Después de eso, sigue sincronizándose automáticamente si se cumple alguna de estas condiciones:
Una página de ella fue usada en una respuesta de Fin en los últimos 90 días.
De lo contrario, las sincronizaciones programadas se pausan.
Cuando está pausado: las páginas permanecen en tu Knowledge Hub y siguen disponibles para Fin y Copilot (nada se elimina). Solo se detiene el re-crawl, por lo que no se detectarán ediciones en tu sitio.
Para restaurarlo: El botón Sincronizar ahora actualiza el contenido una vez pero no reinicia el horario. La sincronización automática se reanuda sola cuando Fin vuelve a usar la fuente.
Los sitios web que son pesados de rastrear se sincronizan con menos frecuencia
Los sitios muy grandes y los que necesitan renderizado completo de JavaScript cuestan mucho más rastrear. Cuando una fuente resulta ser pesada en recursos, la movemos de un horario semanal a uno de cada 14 días.
Esto sucede automáticamente, por fuente. Para mantener un sitio grande en un horario más rápido, reduce el rastreo usando exclusiones de URL, o añade subpáginas específicas en lugar de un dominio completo.
Solución de problemas de sincronización de sitios web
Problemas comunes
Al importar contenido de un sitio web para habilitar Fin, necesitas ingresar la URL pública. Esto buscará todas las páginas anidadas bajo esa URL y las sincronizará para que Fin AI Agent las use.
Si el importador no devolvió el número de páginas que esperabas, hay algunas razones...
La URL proporcionada no es el dominio de nivel superior
La sincronización del sitio web funciona yendo a la URL que proporcionas y luego buscando todas las páginas anidadas bajo esa URL. Estas páginas deben tener el mismo patrón de URL que la URL que proporcionas.
Por ejemplo, si el dominio de nivel superior es https://myhelpcenter.com/home, entonces todas las páginas que quieres importar deben incluir el prefijo /home en la URL, por ejemplo https://myhelpcenter.com/home/article. Si no lo hacen, elimina el prefijo y usa el tallo de URL más básico, por ejemplo https://myhelpcenter.com, luego intenta la importación de nuevo.
La URL es privada
Si el contenido que quieres usar está detrás de un inicio de sesión, Fin no podrá acceder ni importarlo.
Límites de páginas
La sincronización del sitio web tiene dos límites:
Domains: puedes sincronizar hasta 100 dominios de nivel superior diferentes.
Páginas por fuente: Fin sincroniza un máximo de 4,000 páginas de cada fuente.
Una sincronización también puede fallar si una sola página contiene una gran cantidad de contenido. Se te notificará por correo electrónico cada vez que una sincronización falle.
Nota:
Si una fuente tiene más de 4,000 páginas, divídela en varias fuentes para que cada una se mantenga por debajo del límite:
Divide el sitio en secciones más pequeñas y añade cada sección como su propia fuente.
Sincroniza diferentes rutas URL por separado, por ejemplo, una fuente por área de producto o categoría.
Esto mantiene cada fuente por debajo del límite de páginas y reduce el contenido procesado por sincronización.
Sitios web restringidos a IPs regionales específicas
La sincronización del sitio web de Intercom (usada para añadir URLs públicas para Fin AI Agent y Copilot) no utiliza en este momento una cadena de agente de usuario dedicada y personalizada.
Para identificar o permitir estas solicitudes:
Por dirección IP: Nuestro rastreador normalmente usa IPs dinámicas. Si tu sitio requiere lista blanca, contáctanos y podemos habilitar IPs estáticas específicas por región para tu espacio de trabajo.
Estas solicitudes se usan solo para la sincronización del sitio web. No afectan el tráfico de tu Messenger ni el seguimiento de usuarios finales.
Las páginas de sitios no ingleses o internacionales no se están sincronizando
Si tu sitemap incluye URLs con caracteres no ASCII (como letras acentuadas o escrituras como chino o árabe) algunas de esas páginas pueden no sincronizarse como se espera. El descubrimiento del sitemap ahora soporta estas URLs, pero aún pueden surgir problemas en otras partes del proceso de sincronización. Intenta sincronizar manualmente para resolverlo. Si las páginas siguen faltando, contacta con soporte.
Errores de sincronización del sitio web
Cuando sincronizas contenido, puedes ver diferentes estados que indican lo que ocurrió durante el proceso. Para ver el estado de sincronización de tu sitio web, ve a Fin AI Agent > Train > Content y selecciona la fuente del sitio web, luego usa el menú desplegable Status para filtrar por:
Sincronizando
En vivo
Fallido
Excluido
Esto es lo que significa cada uno y qué puedes hacer a continuación:
Sincronizando
La sincronización de la página aún está en progreso. Una sincronización inicial puede tardar desde unos minutos hasta más de una hora según la cantidad de contenido que tengas.
En vivo
La página se sincronizó correctamente y puede ser habilitada para Fin y Copilot.
Nota: Una sincronización exitosa no siempre significa que pudimos extraer todo el contenido de la página. Si quieres confirmar la cobertura completa, recomendamos previsualizar Fin con las respuestas que esperas encontrar en esa página.
Excluido
Estas páginas no se sincronizan intencionalmente porque las excluiste en tus configuraciones de sincronización. No se pueden reintentar ni incluir a menos que se especifique lo contrario.
Fallido
Estos errores significan que la sincronización no se completó y pueden requerir cambios de tu parte antes de reintentar:
1. Error desconocido
Mensaje: “No se pudo acceder a esta página. Puede estar lenta o bloqueada. Intenta sincronizar de nuevo o contacta con soporte si falla.”
Qué significa: Algo impidió que accediéramos a la página, pero la causa no está clara.
2. Sesión bloqueada / Límite de tasa
Mensaje: “El sitio web nos está impidiendo acceder a su contenido. Verifica si está bloqueado por una configuración anti-rastreador o firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta con soporte.”
Qué significa: Tu sitio está bloqueando o limitando activamente nuestro rastreador.
3. Errores de red, tiempo de espera o similares
Mensaje: “No se pudo acceder a esta página. Puede estar lenta para cargar o bloqueada por configuraciones anti-rastreador o firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta con soporte.
Qué significa: La página no cargó a tiempo o no se pudo alcanzar debido a problemas de red o bloqueos.
Qué hacer: Un error de "Tiempo de espera de navegación" suele ser causado por protección contra bots o software de seguridad en tu sitio que bloquea el rastreador de Intercom. Para resolverlo, pon en lista blanca las direcciones IP proxy estáticas listadas en la sección de Configuración avanzada arriba, luego selecciona la región proxy correspondiente en Configuración avanzada al crear o editar tu sincronización de sitio web, y vuelve a intentar la sincronización.
4. Duplicado
Mensaje: “Esta página tiene el mismo contenido que otra que ya está sincronizada. Solo se incluirá una versión.”
Qué significa: Detectamos contenido idéntico en otro lugar, por lo que solo se mantiene una copia.
5. Filtrado por palabra clave
Mensaje: “Las páginas con palabras clave como category, collection o tag en la URL están excluidas por defecto, ya que usualmente no contienen contenido único. Si esta página debe incluirse, contacta con soporte.”
Qué significa: Estas URLs a menudo representan listas, no páginas de contenido independientes.
6. Código de estado 400
Mensaje: “No se puede encontrar el contenido de la página. Verifique que la URL sea válida y que la página se cargue sin problemas.
Qué significa: La URL puede estar rota o devolver un error en su sitio web.
7. URL bloqueada
Mensaje: “Este domain está bloqueado para sincronización. Si lo necesita, contacte con soporte.”
Qué significa: El domain está intencionalmente excluido de la sincronización.
Puede reintentar una sincronización de página fallida pasando el cursor sobre la página, seleccionando el menú de tres puntos y luego seleccionando Resync.
Nota: Website Sync no admite la importación de archivos Markdown sin procesar. Para un formato adecuado y detección de títulos, debe proporcionar contenido como HTML renderizado o cargarlo como fragmento/archivo. La estructura Markdown (por ejemplo, encabezados #) no se reconocerá a menos que se convierta a HTML.























