Saltar al contenido principal

Smart Document Crawler

Dentro de Smart Document Access, es posible configurar el crawler para la indexación de los contenidos de un sitio web.

El crawler opera en tres fases distintas: una primera fase de navegación de enlaces, que mapea la estructura del sitio, una segunda fase de extracción de contenidos, que identifica los contenidos útiles, y una tercera fase de conversión a PDF, que genera los documentos indexados.

1. Navegación de enlaces

El crawler sigue los enlaces internos del sitio y mapea su estructura, sin extraer contenidos.

2. Extracción de contenidos

Las páginas navegadas se analizan para identificar los contenidos útiles.

3. Conversión a PDF

Los contenidos extraídos se convierten en documentos PDF indexados. Si una página no contiene contenido extraíble, no se genera ningún documento.

 

advertencia

Una página solo puede extraerse si ha sido visitada durante la fase de navegación. Asegúrese de que las Direcciones a incluir en la sección Navegación cubran todas las páginas de interés.

Activación y creación de la estructura

Dentro de una subcarpeta ya creada, seleccione la opción Configurar Smart Crawler.

Opción Configurar Smart Crawler en la subcarpeta

Active la casilla Habilitar en subcarpeta.

Casilla Habilitar en subcarpeta

Seleccione Añadir configuración.

Botón Añadir configuración

Asigne un nombre a la configuración y seleccione Guardar.

Ventana de creación de configuración del crawler

información

En esta fase es posible importar configuraciones previamente descargadas o descargar las ya existentes.

Configurar el Crawler

Seleccionando Editar campos se accede a la configuración del Crawler.

Botón Editar campos para acceder a la configuración

General

Introduzca la URL de inicio del sitio en el campo Dirección.

Campo Dirección URL de inicio del sitio

Introduzca otras URLs en Páginas adicionales si es necesario.

Active la opción Excluir sitios fuera del dominio para limitar la navegación solo a los enlaces internos del dominio principal.

Active la opción Incluir documentos PDF, doc, docx si también desea navegar por los documentos adjuntos a las páginas web.

En el campo Direcciones a incluir, introduzca la lista de páginas del sitio a navegar.

En el campo Direcciones a excluir, introduzca la lista de páginas del sitio a no navegar.

Ambos campos aceptan expresiones regulares (regex) para definir patrones de URL. Antes de crear regex, es útil analizar la estructura de paths del sitio: los segmentos del path revelan la categorización de las páginas.

Ejemplo — estructura de un sitio:

ejemplo.com/use-cases
ejemplo.com/products/algho
ejemplo.com/products/sda
ejemplo.com/products/booking
ejemplo.com/products/pricing
ejemplo.com/blog/first-post
ejemplo.com/docs/getting-started
ejemplo.com/docs/getting-started-api
ejemplo.com/about
ejemplo.com/contact

Tipos de patrones principales:

PatrónEjemploURLs coincidentes
Coincidencia exactahttps://ejemplo.com/use-casesejemplo.com/use-cases
Alternanciahttps://ejemplo.com/products/((algho)|(sda)|(booking))ejemplo.com/products/algho, ejemplo.com/products/sda, ejemplo.com/products/booking
Comodín con .*https://ejemplo.com/products/.*ejemplo.com/products/algho, ejemplo.com/products/sda, ejemplo.com/products/booking, ejemplo.com/products/pricing
Prefijo compartidohttps://ejemplo.com/docs/getting-.*ejemplo.com/docs/getting-started, ejemplo.com/docs/getting-started-api

La estructura de cada regex sigue el esquema: https://[dominio]/[segmento1]/[segmento2]/...

ComponenteSignificado
https://Protocolo HTTP o HTTPS
dominioNombre de dominio
.*Cualquier texto (comodín genérico)
(a|b|c)Alternancia: uno de a, b o c
información

Una regex debe probarse contra el conjunto total de URLs del sitio, no solo contra las páginas conocidas. Esto revela los falsos positivos: páginas no deseadas que la regex captura de todos modos.

Por ejemplo, https://ejemplo.com/products/.* captura tanto products/algho (deseado) como products/pricing (falso positivo). Si pricing no es deseado, el patrón con alternancia es preferible.

Principios para elegir la mejor regex:

  • Preferir la simplicidad: una regex corta y legible es mejor que una compleja.
  • Siempre probar contra el crawl completo: una regex que funciona solo en las páginas conocidas no es fiable.
  • Evitar regex demasiado genéricas: https?://.* captura todo el sitio, lo cual no es útil.
  • Considerar el crecimiento futuro: un comodín en una categoría también capturará las páginas añadidas después de definir la regla.

Campos de direcciones a incluir y excluir en la navegación

Establezca la profundidad máxima y el número máximo de páginas a navegar.

Configuraciones de profundidad máxima y número máximo de páginas

Extracción

En la sección Extracción se configuran las reglas que el Crawler seguirá para transformar las páginas web en documentación.

En el campo Filtro de direcciones a incluir, introduzca la lista de páginas a extraer y convertir en documentación.

Ambos campos aceptan las mismas expresiones regulares descritas en la sección Navegación. Las páginas a extraer podrían coincidir con las páginas a navegar o representar un subconjunto específico.

En el campo Filtro de direcciones a excluir, introduzca la lista de páginas a no extraer.

Campos de filtro de direcciones a incluir y excluir en la extracción

Añada los selectores predefinidos en el campo Eliminar elementos.

información

Los elementos a eliminar antes de la extracción también pueden indicarse manualmente, especificando un selector CSS, XPATH o compatible con Puppeteer.

Selectores predefinidos en el campo Eliminar elementos

Planificación

Seleccione Habilitar planificación y establezca la frecuencia de ejecución del Crawler (semanal o mensual), configure el día y la hora de inicio; es posible establecer múltiples días de la semana o del mes para la ejecución repetida.

Configuraciones de planificación del Crawler

Visualización de documentos

Para verificar los documentos PDF generados por el crawler, vuelva a la subcarpeta en Smart Document Access.

La lista de documentos indexados estará disponible en la sección dedicada a la subcarpeta configurada.

Cada documento tiene asociado como Archivo fuente la URL desde la cual se generó el documento.

Documentos PDF generados por el crawler en la subcarpeta