Smart Document Crawler
Dans Smart Document Access, vous pouvez configurer le crawler pour indexer le contenu d'un site web.
Le crawler fonctionne en trois phases distinctes : une première phase de navigation des liens, qui cartographie la structure du site, une seconde phase d'extraction du contenu, qui identifie le contenu utile, et une troisième phase de conversion en PDF, qui génère les documents indexés.
1. Navigation des liens
Le crawler suit les liens internes du site et en cartographie la structure, sans extraire le contenu.
2. Extraction du contenu
Les pages naviguées sont analysées pour identifier le contenu utile.
3. Conversion en PDF
Le contenu extrait est converti en documents PDF indexés. Si une page ne contient pas de contenu extractible, aucun document n'est généré.
Une page ne peut être extraite que si elle a été visitée lors de la phase de navigation. Assurez-vous que les Adresses à inclure dans la section Navigation couvrent toutes les pages souhaitées.
Activation et création de la structure
Dans un sous-dossier déjà créé, sélectionnez l'option Configurer Smart Crawler.

Activez l'option Activer sur le sous-dossier.

Sélectionnez Ajouter une configuration.

Attribuez un nom à la configuration et sélectionnez Enregistrer.

À ce stade, vous pouvez importer des configurations téléchargées précédemment ou télécharger celles déjà existantes.
Configuration du Crawler
Sélectionnez Modifier les champs pour accéder à la configuration du Crawler.

Général
Saisissez l'URL de départ du site dans le champ Adresse.

Ajoutez d'autres URL dans Pages supplémentaires si nécessaire.
Navigation
Activez l'option Exclure les sites hors domaine pour limiter la navigation aux seuls liens internes au domaine principal.
Activez l'option Inclure les documents PDF, doc, docx pour naviguer également dans les documents attachés aux pages web.
Dans le champ Adresses à inclure, saisissez la liste des pages à naviguer.
Dans le champ Adresses à exclure, saisissez la liste des pages à éviter.
Les deux champs acceptent des expressions régulières (regex) pour définir des modèles d'URL. Avant de créer des regex, il est utile d'analyser la structure des paths du site : les segments de path révèlent la catégorisation des pages.
Exemple — structure d'un site :
exemple.com/use-cases
exemple.com/products/algho
exemple.com/products/sda
exemple.com/products/booking
exemple.com/products/pricing
exemple.com/blog/first-post
exemple.com/docs/getting-started
exemple.com/docs/getting-started-api
exemple.com/about
exemple.com/contact
Types de modèles principaux :
| Modèle | Exemple | URLs correspondantes |
|---|---|---|
| Correspondance exacte | https://exemple.com/use-cases | exemple.com/use-cases |
| Alternance | https://exemple.com/products/((algho)|(sda)|(booking)) | exemple.com/products/algho, exemple.com/products/sda, exemple.com/products/booking |
Caractère générique .* | https://exemple.com/products/.* | exemple.com/products/algho, exemple.com/products/sda, exemple.com/products/booking, exemple.com/products/pricing |
| Préfixe partagé | https://exemple.com/docs/getting-.* | exemple.com/docs/getting-started, exemple.com/docs/getting-started-api |
La structure de chaque regex suit le schéma : https://[domaine]/[segment1]/[segment2]/...
| Composant | Signification |
|---|---|
https:// | Protocole HTTP ou HTTPS |
domaine | Nom de domaine |
.* | Tout texte (caractère générique) |
(a|b|c) | Alternance : l'un parmi a, b ou c |
Une regex doit être testée sur l'ensemble des URLs du site, pas uniquement sur les pages connues. Cela révèle les faux positifs : pages non désirées que la regex capture quand même.
Par exemple, https://exemple.com/products/.* capture à la fois products/algho (désiré) et products/pricing (faux positif). Si pricing n'est pas désiré, le modèle avec alternance est préférable.
Principes pour choisir la meilleure regex :
- Préférer la simplicité : une regex courte et lisible est préférable à une complexe.
- Toujours tester sur l'ensemble du crawl : une regex qui fonctionne uniquement sur les pages connues n'est pas fiable.
- Éviter les regex trop génériques :
https?://.*capture l'ensemble du site, ce qui n'est pas utile. - Envisager la croissance future : un caractère générique sur une catégorie capturera également les pages ajoutées après la définition de la règle.

Définissez la profondeur maximale et le nombre maximum de pages à naviguer.

Extraction
Dans la section Extraction, vous configurez les règles que le Crawler suivra pour transformer les pages web en documentation.
Dans le champ Filtrer les adresses à inclure, saisissez la liste des pages à extraire et à convertir en documentation.
Les deux champs acceptent les mêmes expressions régulières décrites dans la section Navigation. Les pages à extraire peuvent coïncider avec les pages à naviguer ou représenter un sous-ensemble spécifique.
Dans le champ Filtrer les adresses à exclure, saisissez la liste des pages à ne pas extraire.

Ajoutez des sélecteurs prédéfinis dans le champ Supprimer les éléments.
Les éléments à supprimer avant l'extraction peuvent également être spécifiés manuellement, en fournissant un sélecteur CSS, XPATH ou compatible avec Puppeteer.

Planification
Sélectionnez Activer la planification et définissez la fréquence d'exécution du Crawler (hebdomadaire ou mensuelle), puis configurez le jour et l'heure de démarrage ; vous pouvez définir plusieurs jours de la semaine ou du mois pour une exécution répétée.

Visualisation des documents
Pour vérifier les documents PDF générés par le crawler, revenez au sous-dossier dans Smart Document Access.
La liste des documents indexés sera disponible dans la section dédiée au sous-dossier configuré.
Chaque document a comme Fichier source l'URL à partir de laquelle il a été généré.
