Smart Document Crawler
Innerhalb von Smart Document Access können Sie den Crawler konfigurieren, um den Inhalt einer Website zu indexieren.
Der Crawler arbeitet in drei getrennten Phasen: einer ersten Link-Navigations-Phase, die die Seitenstruktur kartiert, einer zweiten Inhaltsextraktions-Phase, die nützliche Inhalte identifiziert, und einer dritten PDF-Konvertierungs-Phase, die indizierte Dokumente generiert.
1. Link-Navigation
Der Crawler folgt internen Links der Website und kartiert die Struktur, ohne Inhalte zu extrahieren.
2. Inhaltsextraktion
Besuchte Seiten werden analysiert, um nützliche Inhalte zu identifizieren.
3. PDF-Konvertierung
Extrahierte Inhalte werden in indizierte PDF-Dokumente umgewandelt. Wenn eine Seite keine extrahierbaren Inhalte enthält, wird kein Dokument erstellt.
Eine Seite kann nur extrahiert werden, wenn sie während der Navigationsphase besucht wurde. Stellen Sie sicher, dass die Einzuschließenden Adressen im Abschnitt Navigation alle relevanten Seiten abdecken.
Aktivierung und Strukturerstellung
Wählen Sie in einem bereits erstellten Unterordner die Option Smart Crawler konfigurieren.

Aktivieren Sie den Schalter Im Unterordner aktivieren.

Wählen Sie Konfiguration hinzufügen.

Weisen Sie der Konfiguration einen Namen zu und wählen Sie Speichern.

In dieser Phase können Sie zuvor heruntergeladene Konfigurationen importieren oder vorhandene herunterladen.
Einrichten des Crawlers
Durch Auswahl von Felder bearbeiten wird die Crawler-Konfiguration geöffnet.

Allgemein
Geben Sie die Start-URL der Website im Feld Adresse ein.

Fügen Sie bei Bedarf weitere URLs unter Zusätzliche Seiten hinzu.
Navigation
Aktivieren Sie die Option Off-Site-Domains ausschließen, um die Navigation auf Links innerhalb der Hauptdomain zu beschränken.
Aktivieren Sie die Option PDF-, Doc-, Docx-Dokumente einschließen, um auch Dokumente zu navigieren, die an Webseiten angehängt sind.
Geben Sie im Feld Einzuschließende Adressen die Liste der zu navigierenden Seiten ein.
Geben Sie im Feld Auszuschließende Adressen die Liste der zu vermeidenden Seiten ein.
Beide Felder akzeptieren reguläre Ausdrücke (Regex), um URL-Muster zu definieren. Vor der Erstellung von Regex ist es hilfreich, die Pfadstruktur der Website zu analysieren: Pfadsegmente offenbaren die Kategorisierung der Seiten.
Beispiel — Website-Struktur:
beispiel.com/use-cases
beispiel.com/products/algho
beispiel.com/products/sda
beispiel.com/products/booking
beispiel.com/products/pricing
beispiel.com/blog/first-post
beispiel.com/docs/getting-started
beispiel.com/docs/getting-started-api
beispiel.com/about
beispiel.com/contact
Hauptmuster-Typen:
| Muster | Beispiel | Übereinstimmende URLs |
|---|---|---|
| Exakte Übereinstimmung | https://beispiel.com/use-cases | beispiel.com/use-cases |
| Alternation | https://beispiel.com/products/((algho)|(sda)|(booking)) | beispiel.com/products/algho, beispiel.com/products/sda, beispiel.com/products/booking |
Wildcard mit .* | https://beispiel.com/products/.* | beispiel.com/products/algho, beispiel.com/products/sda, beispiel.com/products/booking, beispiel.com/products/pricing |
| Gemeinsamer Präfix | https://beispiel.com/docs/getting-.* | beispiel.com/docs/getting-started, beispiel.com/docs/getting-started-api |
Die Struktur jedes Regex folgt dem Schema: https://[Domain]/[Segment1]/[Segment2]/...
| Komponente | Bedeutung |
|---|---|
https:// | HTTP- oder HTTPS-Protokoll |
Domain | Domänenname |
.* | Beliebiger Text (generischer Wildcard) |
(a|b|c) | Alternation: eines von a, b oder c |
Ein Regex sollte gegen die Gesamtheit der URLs der Website getestet werden, nicht nur gegen die bekannten Seiten. Dies enthüllt Fehlpositive: unerwünschte Seiten, die das Regex trotzdem erfasst.
Zum Beispiel erfasst https://beispiel.com/products/.* sowohl products/algho (gewünscht) als auch products/pricing (Fehlpositiv). Wenn pricing nicht gewünscht ist, ist das Alternationsmuster vorzuziehen.
Prinzipien für die Auswahl des besten Regex:
- Einfachheit bevorzugen: ein kurzes, lesbares Regex ist besser als ein komplexes.
- Immer gegen den gesamten Crawl testen: ein Regex, das nur auf bekannten Seiten funktioniert, ist unzuverlässig.
- Zu generische Regex vermeiden:
https?://.*erfasst die gesamte Website, was nicht nützlich ist. - Zukünftiges Wachstum berücksichtigen: ein Wildcard auf einer Kategorie erfasst auch Seiten, die nach der Definition der Regel hinzugefügt werden.

Legen Sie die maximale Tiefe und die maximale Anzahl von Seiten für die Navigation fest.

Extraktion
Im Bereich Extraktion konfigurieren Sie die Regeln, die der Crawler befolgt, um Webseiten in Dokumentation umzuwandeln.
Geben Sie im Feld Filteradressen zum Einschließen die Liste der Seiten ein, die extrahiert und in Dokumentation umgewandelt werden sollen.
Beide Felder akzeptieren die gleichen regulären Ausdrücke, die im Abschnitt Navigation beschrieben sind. Die zu extrahierenden Seiten können mit den zu navigierenden Seiten übereinstimmen oder eine spezifische Untermenge darstellen.
Geben Sie im Feld Filteradressen zum Ausschließen die Liste der Seiten ein, die nicht extrahiert werden sollen.

Fügen Sie voreingestellte Selektoren im Feld Elemente entfernen hinzu.
Elemente, die vor der Extraktion entfernt werden sollen, können auch manuell angegeben werden, indem ein CSS-, XPATH- oder Puppeteer-kompatibler Selektor bereitgestellt wird.

Zeitplanung
Wählen Sie Zeitplanung aktivieren und legen Sie die Crawler-Ausführungshäufigkeit fest (wöchentlich oder monatlich), konfigurieren Sie dann den Tag und die Startzeit; Sie können mehrere Wochentage oder Monatstage für die wiederholte Ausführung festlegen.

Dokumente anzeigen
Um die vom Crawler generierten PDF-Dokumente zu überprüfen, gehen Sie zurück zum Unterordner in Smart Document Access.
Die Liste der indexierten Dokumente wird im Abschnitt für den konfigurierten Unterordner verfügbar sein.
Jedes Dokument hat die URL, von der es generiert wurde, als Quelldatei zugeordnet.
