Aller au contenu principal

Smart Document Crawler

Dans Smart Document Access, vous pouvez configurer le crawler pour indexer le contenu d'un site web.

Le crawler fonctionne en trois phases distinctes : une première phase de navigation des liens, qui cartographie la structure du site, une seconde phase d'extraction du contenu, qui identifie le contenu utile, et une troisième phase de conversion en PDF, qui génère les documents indexés.

1. Navigation des liens

Le crawler suit les liens internes du site et en cartographie la structure, sans extraire le contenu.

2. Extraction du contenu

Les pages naviguées sont analysées pour identifier le contenu utile.

3. Conversion en PDF

Le contenu extrait est converti en documents PDF indexés. Si une page ne contient pas de contenu extractible, aucun document n'est généré.

 

avertissement

Une page ne peut être extraite que si elle a été visitée lors de la phase de navigation. Assurez-vous que les Adresses à inclure dans la section Navigation couvrent toutes les pages souhaitées.

Activation et création de la structure

Dans un sous-dossier déjà créé, sélectionnez l'option Configurer Smart Crawler.

Option Configurer Smart Crawler dans le sous-dossier

Activez l'option Activer sur le sous-dossier.

Case à cocher Activer sur le sous-dossier

Sélectionnez Ajouter une configuration.

Bouton Ajouter une configuration

Attribuez un nom à la configuration et sélectionnez Enregistrer.

Fenêtre de création de configuration du crawler

info

À ce stade, vous pouvez importer des configurations téléchargées précédemment ou télécharger celles déjà existantes.

Configuration du Crawler

Sélectionnez Modifier les champs pour accéder à la configuration du Crawler.

Bouton Modifier les champs pour accéder à la configuration

Général

Saisissez l'URL de départ du site dans le champ Adresse.

Champ adresse URL de départ du site

Ajoutez d'autres URL dans Pages supplémentaires si nécessaire.

Activez l'option Exclure les sites hors domaine pour limiter la navigation aux seuls liens internes au domaine principal.

Activez l'option Inclure les documents PDF, doc, docx pour naviguer également dans les documents attachés aux pages web.

Dans le champ Adresses à inclure, saisissez la liste des pages à naviguer.

Dans le champ Adresses à exclure, saisissez la liste des pages à éviter.

Les deux champs acceptent des expressions régulières (regex) pour définir des modèles d'URL. Avant de créer des regex, il est utile d'analyser la structure des paths du site : les segments de path révèlent la catégorisation des pages.

Exemple — structure d'un site :

exemple.com/use-cases
exemple.com/products/algho
exemple.com/products/sda
exemple.com/products/booking
exemple.com/products/pricing
exemple.com/blog/first-post
exemple.com/docs/getting-started
exemple.com/docs/getting-started-api
exemple.com/about
exemple.com/contact

Types de modèles principaux :

ModèleExempleURLs correspondantes
Correspondance exactehttps://exemple.com/use-casesexemple.com/use-cases
Alternancehttps://exemple.com/products/((algho)|(sda)|(booking))exemple.com/products/algho, exemple.com/products/sda, exemple.com/products/booking
Caractère générique .*https://exemple.com/products/.*exemple.com/products/algho, exemple.com/products/sda, exemple.com/products/booking, exemple.com/products/pricing
Préfixe partagéhttps://exemple.com/docs/getting-.*exemple.com/docs/getting-started, exemple.com/docs/getting-started-api

La structure de chaque regex suit le schéma : https://[domaine]/[segment1]/[segment2]/...

ComposantSignification
https://Protocole HTTP ou HTTPS
domaineNom de domaine
.*Tout texte (caractère générique)
(a|b|c)Alternance : l'un parmi a, b ou c
info

Une regex doit être testée sur l'ensemble des URLs du site, pas uniquement sur les pages connues. Cela révèle les faux positifs : pages non désirées que la regex capture quand même.

Par exemple, https://exemple.com/products/.* capture à la fois products/algho (désiré) et products/pricing (faux positif). Si pricing n'est pas désiré, le modèle avec alternance est préférable.

Principes pour choisir la meilleure regex :

  • Préférer la simplicité : une regex courte et lisible est préférable à une complexe.
  • Toujours tester sur l'ensemble du crawl : une regex qui fonctionne uniquement sur les pages connues n'est pas fiable.
  • Éviter les regex trop génériques : https?://.* capture l'ensemble du site, ce qui n'est pas utile.
  • Envisager la croissance future : un caractère générique sur une catégorie capturera également les pages ajoutées après la définition de la règle.

Champs adresses à inclure et exclure dans la navigation

Définissez la profondeur maximale et le nombre maximum de pages à naviguer.

Paramètres de profondeur maximale et nombre maximum de pages

Extraction

Dans la section Extraction, vous configurez les règles que le Crawler suivra pour transformer les pages web en documentation.

Dans le champ Filtrer les adresses à inclure, saisissez la liste des pages à extraire et à convertir en documentation.

Les deux champs acceptent les mêmes expressions régulières décrites dans la section Navigation. Les pages à extraire peuvent coïncider avec les pages à naviguer ou représenter un sous-ensemble spécifique.

Dans le champ Filtrer les adresses à exclure, saisissez la liste des pages à ne pas extraire.

Champs de filtre d'adresses à inclure et exclure dans l'extraction

Ajoutez des sélecteurs prédéfinis dans le champ Supprimer les éléments.

info

Les éléments à supprimer avant l'extraction peuvent également être spécifiés manuellement, en fournissant un sélecteur CSS, XPATH ou compatible avec Puppeteer.

Sélecteurs prédéfinis dans le champ Supprimer les éléments

Planification

Sélectionnez Activer la planification et définissez la fréquence d'exécution du Crawler (hebdomadaire ou mensuelle), puis configurez le jour et l'heure de démarrage ; vous pouvez définir plusieurs jours de la semaine ou du mois pour une exécution répétée.

Paramètres de planification du Crawler

Visualisation des documents

Pour vérifier les documents PDF générés par le crawler, revenez au sous-dossier dans Smart Document Access.

La liste des documents indexés sera disponible dans la section dédiée au sous-dossier configuré.

Chaque document a comme Fichier source l'URL à partir de laquelle il a été généré.

Documents PDF générés par le crawler dans le sous-dossier