Smart Document Crawler
Dentro de Smart Document Access, es posible configurar el crawler para la indexación de los contenidos de un sitio web.
El crawler opera en tres fases distintas: una primera fase de navegación de enlaces, que mapea la estructura del sitio, una segunda fase de extracción de contenidos, que identifica los contenidos útiles, y una tercera fase de conversión a PDF, que genera los documentos indexados.
1. Navegación de enlaces
El crawler sigue los enlaces internos del sitio y mapea su estructura, sin extraer contenidos.
2. Extracción de contenidos
Las páginas navegadas se analizan para identificar los contenidos útiles.
3. Conversión a PDF
Los contenidos extraídos se convierten en documentos PDF indexados. Si una página no contiene contenido extraíble, no se genera ningún documento.
Una página solo puede extraerse si ha sido visitada durante la fase de navegación. Asegúrese de que las Direcciones a incluir en la sección Navegación cubran todas las páginas de interés.
Activación y creación de la estructura
Dentro de una subcarpeta ya creada, seleccione la opción Configurar Smart Crawler.

Active la casilla Habilitar en subcarpeta.

Seleccione Añadir configuración.

Asigne un nombre a la configuración y seleccione Guardar.

En esta fase es posible importar configuraciones previamente descargadas o descargar las ya existentes.
Configurar el Crawler
Seleccionando Editar campos se accede a la configuración del Crawler.

General
Introduzca la URL de inicio del sitio en el campo Dirección.

Introduzca otras URLs en Páginas adicionales si es necesario.
Navegación
Active la opción Excluir sitios fuera del dominio para limitar la navegación solo a los enlaces internos del dominio principal.
Active la opción Incluir documentos PDF, doc, docx si también desea navegar por los documentos adjuntos a las páginas web.
En el campo Direcciones a incluir, introduzca la lista de páginas del sitio a navegar.
En el campo Direcciones a excluir, introduzca la lista de páginas del sitio a no navegar.
Ambos campos aceptan expresiones regulares (regex) para definir patrones de URL. Antes de crear regex, es útil analizar la estructura de paths del sitio: los segmentos del path revelan la categorización de las páginas.
Ejemplo — estructura de un sitio:
ejemplo.com/use-cases
ejemplo.com/products/algho
ejemplo.com/products/sda
ejemplo.com/products/booking
ejemplo.com/products/pricing
ejemplo.com/blog/first-post
ejemplo.com/docs/getting-started
ejemplo.com/docs/getting-started-api
ejemplo.com/about
ejemplo.com/contact
Tipos de patrones principales:
| Patrón | Ejemplo | URLs coincidentes |
|---|---|---|
| Coincidencia exacta | https://ejemplo.com/use-cases | ejemplo.com/use-cases |
| Alternancia | https://ejemplo.com/products/((algho)|(sda)|(booking)) | ejemplo.com/products/algho, ejemplo.com/products/sda, ejemplo.com/products/booking |
Comodín con .* | https://ejemplo.com/products/.* | ejemplo.com/products/algho, ejemplo.com/products/sda, ejemplo.com/products/booking, ejemplo.com/products/pricing |
| Prefijo compartido | https://ejemplo.com/docs/getting-.* | ejemplo.com/docs/getting-started, ejemplo.com/docs/getting-started-api |
La estructura de cada regex sigue el esquema: https://[dominio]/[segmento1]/[segmento2]/...
| Componente | Significado |
|---|---|
https:// | Protocolo HTTP o HTTPS |
dominio | Nombre de dominio |
.* | Cualquier texto (comodín genérico) |
(a|b|c) | Alternancia: uno de a, b o c |
Una regex debe probarse contra el conjunto total de URLs del sitio, no solo contra las páginas conocidas. Esto revela los falsos positivos: páginas no deseadas que la regex captura de todos modos.
Por ejemplo, https://ejemplo.com/products/.* captura tanto products/algho (deseado) como products/pricing (falso positivo). Si pricing no es deseado, el patrón con alternancia es preferible.
Principios para elegir la mejor regex:
- Preferir la simplicidad: una regex corta y legible es mejor que una compleja.
- Siempre probar contra el crawl completo: una regex que funciona solo en las páginas conocidas no es fiable.
- Evitar regex demasiado genéricas:
https?://.*captura todo el sitio, lo cual no es útil. - Considerar el crecimiento futuro: un comodín en una categoría también capturará las páginas añadidas después de definir la regla.

Establezca la profundidad máxima y el número máximo de páginas a navegar.

Extracción
En la sección Extracción se configuran las reglas que el Crawler seguirá para transformar las páginas web en documentación.
En el campo Filtro de direcciones a incluir, introduzca la lista de páginas a extraer y convertir en documentación.
Ambos campos aceptan las mismas expresiones regulares descritas en la sección Navegación. Las páginas a extraer podrían coincidir con las páginas a navegar o representar un subconjunto específico.
En el campo Filtro de direcciones a excluir, introduzca la lista de páginas a no extraer.

Añada los selectores predefinidos en el campo Eliminar elementos.
Los elementos a eliminar antes de la extracción también pueden indicarse manualmente, especificando un selector CSS, XPATH o compatible con Puppeteer.

Planificación
Seleccione Habilitar planificación y establezca la frecuencia de ejecución del Crawler (semanal o mensual), configure el día y la hora de inicio; es posible establecer múltiples días de la semana o del mes para la ejecución repetida.

Visualización de documentos
Para verificar los documentos PDF generados por el crawler, vuelva a la subcarpeta en Smart Document Access.
La lista de documentos indexados estará disponible en la sección dedicada a la subcarpeta configurada.
Cada documento tiene asociado como Archivo fuente la URL desde la cual se generó el documento.
