Zum Hauptinhalt springen

Smart Document Crawler

Innerhalb von Smart Document Access können Sie den Crawler konfigurieren, um den Inhalt einer Website zu indexieren.

Der Crawler arbeitet in drei getrennten Phasen: einer ersten Link-Navigations-Phase, die die Seitenstruktur kartiert, einer zweiten Inhaltsextraktions-Phase, die nützliche Inhalte identifiziert, und einer dritten PDF-Konvertierungs-Phase, die indizierte Dokumente generiert.

1. Link-Navigation

Der Crawler folgt internen Links der Website und kartiert die Struktur, ohne Inhalte zu extrahieren.

2. Inhaltsextraktion

Besuchte Seiten werden analysiert, um nützliche Inhalte zu identifizieren.

3. PDF-Konvertierung

Extrahierte Inhalte werden in indizierte PDF-Dokumente umgewandelt. Wenn eine Seite keine extrahierbaren Inhalte enthält, wird kein Dokument erstellt.

 

Warnung

Eine Seite kann nur extrahiert werden, wenn sie während der Navigationsphase besucht wurde. Stellen Sie sicher, dass die Einzuschließenden Adressen im Abschnitt Navigation alle relevanten Seiten abdecken.

Aktivierung und Strukturerstellung

Wählen Sie in einem bereits erstellten Unterordner die Option Smart Crawler konfigurieren.

Option Smart Crawler konfigurieren im Unterordner

Aktivieren Sie den Schalter Im Unterordner aktivieren.

Schalter Im Unterordner aktivieren

Wählen Sie Konfiguration hinzufügen.

Schaltfläche Konfiguration hinzufügen

Weisen Sie der Konfiguration einen Namen zu und wählen Sie Speichern.

Konfigurationsfenster des Crawlers

Info

In dieser Phase können Sie zuvor heruntergeladene Konfigurationen importieren oder vorhandene herunterladen.

Einrichten des Crawlers

Durch Auswahl von Felder bearbeiten wird die Crawler-Konfiguration geöffnet.

Schaltfläche Felder bearbeiten zum Öffnen der Konfiguration

Allgemein

Geben Sie die Start-URL der Website im Feld Adresse ein.

Feld Adresse Start-URL der Website

Fügen Sie bei Bedarf weitere URLs unter Zusätzliche Seiten hinzu.

Aktivieren Sie die Option Off-Site-Domains ausschließen, um die Navigation auf Links innerhalb der Hauptdomain zu beschränken.

Aktivieren Sie die Option PDF-, Doc-, Docx-Dokumente einschließen, um auch Dokumente zu navigieren, die an Webseiten angehängt sind.

Geben Sie im Feld Einzuschließende Adressen die Liste der zu navigierenden Seiten ein.

Geben Sie im Feld Auszuschließende Adressen die Liste der zu vermeidenden Seiten ein.

Beide Felder akzeptieren reguläre Ausdrücke (Regex), um URL-Muster zu definieren. Vor der Erstellung von Regex ist es hilfreich, die Pfadstruktur der Website zu analysieren: Pfadsegmente offenbaren die Kategorisierung der Seiten.

Beispiel — Website-Struktur:

beispiel.com/use-cases
beispiel.com/products/algho
beispiel.com/products/sda
beispiel.com/products/booking
beispiel.com/products/pricing
beispiel.com/blog/first-post
beispiel.com/docs/getting-started
beispiel.com/docs/getting-started-api
beispiel.com/about
beispiel.com/contact

Hauptmuster-Typen:

MusterBeispielÜbereinstimmende URLs
Exakte Übereinstimmunghttps://beispiel.com/use-casesbeispiel.com/use-cases
Alternationhttps://beispiel.com/products/((algho)|(sda)|(booking))beispiel.com/products/algho, beispiel.com/products/sda, beispiel.com/products/booking
Wildcard mit .*https://beispiel.com/products/.*beispiel.com/products/algho, beispiel.com/products/sda, beispiel.com/products/booking, beispiel.com/products/pricing
Gemeinsamer Präfixhttps://beispiel.com/docs/getting-.*beispiel.com/docs/getting-started, beispiel.com/docs/getting-started-api

Die Struktur jedes Regex folgt dem Schema: https://[Domain]/[Segment1]/[Segment2]/...

KomponenteBedeutung
https://HTTP- oder HTTPS-Protokoll
DomainDomänenname
.*Beliebiger Text (generischer Wildcard)
(a|b|c)Alternation: eines von a, b oder c
Info

Ein Regex sollte gegen die Gesamtheit der URLs der Website getestet werden, nicht nur gegen die bekannten Seiten. Dies enthüllt Fehlpositive: unerwünschte Seiten, die das Regex trotzdem erfasst.

Zum Beispiel erfasst https://beispiel.com/products/.* sowohl products/algho (gewünscht) als auch products/pricing (Fehlpositiv). Wenn pricing nicht gewünscht ist, ist das Alternationsmuster vorzuziehen.

Prinzipien für die Auswahl des besten Regex:

  • Einfachheit bevorzugen: ein kurzes, lesbares Regex ist besser als ein komplexes.
  • Immer gegen den gesamten Crawl testen: ein Regex, das nur auf bekannten Seiten funktioniert, ist unzuverlässig.
  • Zu generische Regex vermeiden: https?://.* erfasst die gesamte Website, was nicht nützlich ist.
  • Zukünftiges Wachstum berücksichtigen: ein Wildcard auf einer Kategorie erfasst auch Seiten, die nach der Definition der Regel hinzugefügt werden.

Felder Ein- und Ausschließende Adressen in der Navigation

Legen Sie die maximale Tiefe und die maximale Anzahl von Seiten für die Navigation fest.

Einstellungen für maximale Tiefe und maximale Seitenanzahl

Extraktion

Im Bereich Extraktion konfigurieren Sie die Regeln, die der Crawler befolgt, um Webseiten in Dokumentation umzuwandeln.

Geben Sie im Feld Filteradressen zum Einschließen die Liste der Seiten ein, die extrahiert und in Dokumentation umgewandelt werden sollen.

Beide Felder akzeptieren die gleichen regulären Ausdrücke, die im Abschnitt Navigation beschrieben sind. Die zu extrahierenden Seiten können mit den zu navigierenden Seiten übereinstimmen oder eine spezifische Untermenge darstellen.

Geben Sie im Feld Filteradressen zum Ausschließen die Liste der Seiten ein, die nicht extrahiert werden sollen.

Filterfelder zum Ein- und Ausschließen in der Extraktion

Fügen Sie voreingestellte Selektoren im Feld Elemente entfernen hinzu.

Info

Elemente, die vor der Extraktion entfernt werden sollen, können auch manuell angegeben werden, indem ein CSS-, XPATH- oder Puppeteer-kompatibler Selektor bereitgestellt wird.

Voreingestellte Selektoren im Feld Elemente entfernen

Zeitplanung

Wählen Sie Zeitplanung aktivieren und legen Sie die Crawler-Ausführungshäufigkeit fest (wöchentlich oder monatlich), konfigurieren Sie dann den Tag und die Startzeit; Sie können mehrere Wochentage oder Monatstage für die wiederholte Ausführung festlegen.

Zeitplaneinstellungen des Crawlers

Dokumente anzeigen

Um die vom Crawler generierten PDF-Dokumente zu überprüfen, gehen Sie zurück zum Unterordner in Smart Document Access.

Die Liste der indexierten Dokumente wird im Abschnitt für den konfigurierten Unterordner verfügbar sein.

Jedes Dokument hat die URL, von der es generiert wurde, als Quelldatei zugeordnet.

Vom Crawler generierte PDF-Dokumente im Unterordner