Zum Hauptinhalt springen

Dokumentation Web Crawler

Diese Anleitung erklärt Schritt für Schritt, wie Sie mit dem Webcrawler Inhalte von Webseiten automatisch in eine Wissensdatenbank einlesen. Es sind keine technischen Vorkenntnisse nötig – alles passiert über die Benutzeroberfläche. 

1. Was macht der Webcrawler?

Der Webcrawler ruft Seiten einer Website auf, wandelt ihren Text in Dokumente um und legt diese in einer Wissensdatenbank ab. Danach kann der Chatbot die Inhalte dieser Seiten in seinen Antworten verwenden – genauso wie hochgeladene PDF- oder Word-Dateien.

Sie richten dafür eine Crawl-Quelle ein. Das ist eine gespeicherte Konfiguration ("Ab dieser Adresse, mit diesen Einstellungen"), die Sie beliebig oft erneut ausführen können – manuell per Klick oder automatisch nach Zeitplan.

Wichtig: Bei jedem weiteren Durchlauf werden nur neue und geänderte Seiten eingelesen. Unveränderte Seiten werden erkannt und übersprungen. Ein wöchentlicher Lauf erzeugt also keine Duplikate und verursacht kaum Aufwand.

 

2. Wo finde ich den Crawler?

  • Öffnen Sie die gewünschte Wissensdatenbank.
  • Klicken Sie links in der Seitenleiste auf Crawler.

Sie sehen nun eine Tabelle mit allen bereits angelegten Crawl-Quellen. Ist noch keine vorhanden, steht dort „Noch keine Crawl-Quellen vorhanden."

Alternativ finden Sie den Einstieg im Tab Datensatz unter Inhalte hinzufügen → Web-Crawl. Dieser Knopf führt an dieselbe Stelle und öffnet direkt das Formular für eine neue Crawl-Quelle.

 

3. Eine neue Crawl-Quelle anlegen

Klicken Sie oben rechts auf Neue Crawl-Quelle. Es öffnet sich ein Formular.

Für den Anfang genügen die drei Felder im oberen Bereich – alles darunter („Erweiterte Einstellungen") können Sie zunächst geschlossen lassen.

3.1 Link-Erkennung

Hier legen Sie fest, wie der Crawler herausfindet, welche Seiten er einlesen soll. Es gibt zwei Möglichkeiten:

Auswahl

Bedeutung

Wann verwenden?

Deep Crawl (Links folgen)

Der Crawler startet auf einer Seite und folgt von dort aus allen internen Links – wie jemand, der sich durch die Website klickt.

Standardfall. Immer dann, wenn Sie keine Sitemap kennen.

Sitemap

Sie geben die Adresse einer XML-Sitemap an. Der Crawler liest genau die Seiten ein, die dort aufgelistet sind.

Wenn die Website eine Sitemap anbietet – das ist schneller, vollständiger und schonender für die Website.

Was ist eine Sitemap? Viele Websites veröffentlichen ein maschinenlesbares Inhaltsverzeichnis unter einer Adresse wie https://beispiel.de/sitemap.xml. Probieren Sie diese Adresse einfach im Browser aus: Erscheint eine (unschön formatierte) Liste von Adressen, existiert eine Sitemap und Sie können den Sitemap-Modus verwenden. Erscheint eine Fehlerseite, nehmen Sie Deep Crawl.

3.2 URL bzw. Sitemap-URL

Die Adresse, bei der der Crawler beginnt – inklusive https://.

  • Bei Deep Crawl: die Startseite oder ein Bereich, z. B. https://beispiel.deoder https://beispiel.de/wissen/
  • Bei Sitemap: die Adresse der Sitemap-Datei, z. B. https://beispiel.de/sitemap.xml

Tipp: Beim Deep Crawl bestimmt die Start-Adresse den Umfang. Geben Sie https://beispiel.de/handbuch/ an, bleibt der Crawler im Wesentlichen in diesem Bereich – das ist meist gezielter als die komplette Startseite.

Nur öffentlich erreichbare Adressen sind erlaubt. Interne Adressen aus dem Firmennetz (z. B. 192.168.… oder localhost) werden abgelehnt.

3.3 Name

Ein frei wählbarer Name, unter dem die Crawl-Quelle in der Tabelle erscheint, z. B. „Website Physiotherapie – Fachartikel". Wenn Sie in das Feld klicken, wird automatisch ein Vorschlag aus der Adresse erzeugt, den Sie überschreiben können.

3.4 Nach Crawl analysieren

Bleibt normalerweise eingeschaltet.

  • Ein (Standard):Die gefundenen Seiten werden direkt nach dem Crawl automatisch verarbeitet („geparst und eingebettet") und stehen dem Chatbot danach zur Verfügung.
  • Aus:Die Seiten werden zwar heruntergeladen und als Dokumente gespeichert, aber noch nicht verarbeitet. Sie müssten sie später im Tab Datensatzvon Hand starten. Sinnvoll nur, wenn Sie die Ergebnisse vorher prüfen möchten.

3.5 Bilder für Änderungserkennung berücksichtigen

Bleibt normalerweise eingeschaltet. Diese Einstellung betrifft nur wiederholte Durchläufe:

  • Ein (Standard):Eine Seite gilt als geändert, sobald sich auch nur eine Bild-Adresse darauf ändert.
  • Aus:Bild-Adressen werden beim Vergleich ignoriert. Das hilft bei Websites, die ihren Bildern bei jedem Aufruf technisch neue Adressen geben – sonst würde jede Seite bei jedem Lauf fälschlich als „geändert" gelten und unnötig neu verarbeitet.

Wenn Sie nach wiederholten Läufen sehen, dass verdächtig viele Seiten als „Aktualisiert" gemeldet werden, obwohl sich inhaltlich nichts getan hat: schalten Sie diese Option aus.

3.6 Speichern

Klicken Sie auf OK. Die Crawl-Quelle erscheint jetzt in der Tabelle – sie ist damit angelegt, aber noch nicht ausgeführt.

 

4. Einen Crawl starten und beobachten

In der Tabelle finden Sie pro Zeile rechts vier Symbole:

Symbol

Funktion

▶ Jetzt ausführen

Startet einen Durchlauf sofort.

✏️ Bearbeiten

Öffnet die Einstellungen erneut.

🕘 Verlauf

Zeigt alle bisherigen Durchläufe und deren Reports.

🗑️ Löschen

Entfernt die Crawl-Quelle.

Während ein Durchlauf läuft, wird das ▶-Symbol durch ein Stopp-Symbol (■) ersetzt, mit dem Sie den Crawl vorzeitig beenden können. Bearbeiten und Löschen sind währenddessen deaktiviert.

Die Status-Spalte lesen

Der Status aktualisiert sich automatisch (alle paar Sekunden). Ein Durchlauf hat zwei Phasen, die nacheinander angezeigt werden:

  • „Crawlt 42 %"– die Seiten werden gerade von der Website abgerufen.
  • „17 von 120 Seiten verarbeitet"mit Fortschrittsbalken – die abgerufenen Seiten werden nun analysiert und für die Suche aufbereitet. Diese zweite Phase dauert meist deutlich länger als die erste.

Weitere Anzeigen:

Anzeige

Bedeutung

Noch nie ausgeführt

Die Quelle ist angelegt, aber noch nicht gelaufen.

Wird gestoppt…

Der Stopp wurde angefordert; der Crawl beendet noch den aktuellen Block.

Crawl abgebrochen

Der Durchlauf wurde per Stopp beendet.

Crawl fehlgeschlagen

Der Durchlauf konnte nicht ausgeführt werden – Details im Report.

X fehlgeschlagen (rot)

Einzelne Seiten konnten nicht verarbeitet werden.

X nicht analysiert

Seiten wurden geholt, aber nicht verarbeitet (siehe „Nach Crawl analysieren").

Ein Klick auf den Statustext öffnet den Report des letzten Durchlaufs.

Hinweis: Es kann immer nur ein Durchlauf pro Crawl-Quelle gleichzeitig laufen. Klicken Sie ▶ trotzdem, erscheint der Hinweis „Es läuft bereits ein Durchlauf".

 

5. Den Report verstehen

Der Report ist das Protokoll eines Durchlaufs. Sie erreichen ihn über den Statustext oder über 🕘 Verlauf → Report anzeigen.

Er enthält:

  • Start-URL– wo der Durchlauf begonnen hat.
  • Zusammenfassung– z. B. „120 Seiten insgesamt, 118 erfolgreich, 2 fehlgeschlagen."
  • Seit letztem Lauf– z. B. „3 neu, 5 aktualisiert, 110 unverändert (nicht erneut analysiert)." Genau hier sehen Sie, dass wiederholte Läufe sparsam arbeiten.
  • Erfolgreiche Seiten– Tabelle mit Adresse, Titel, Statuscode und Ergebnis:
  • Neu– Seite war noch nicht in der Wissensdatenbank.
  • Aktualisiert– Seite existierte, ihr Inhalt hat sich geändert; das alte Dokument wurde durch das neue ersetzt.
  • Unverändert – übersprungen– nichts zu tun.
  • Fehlerhafte Seiten– Tabelle mit Adresse, Statuscode, wahrscheinlicher Ursache und Fehlermeldung. Steht dort „Keine Fehler – alle Seiten erfolgreich gecrawlt.", ist alles in Ordnung.
  • Crawl-Konfiguration– die Einstellungen, mit denen dieser Lauf ausgeführt wurde. (Praktisch, wenn Sie die Einstellungen zwischenzeitlich geändert haben.)

Über Report herunterladen speichern Sie das Protokoll als Datei, z. B. um es an Kolleginnen und Kollegen weiterzugeben.

Häufige Statuscodes

Code

Bedeutung im Klartext

200

Alles in Ordnung.

401 / 403

Zugriff verweigert – die Seite verlangt eine Anmeldung (siehe Abschnitt 8).

404

Seite existiert nicht (mehr) – oft ein toter Link auf der Website.

429

Zu viele Anfragen – die Website bremst uns aus (siehe „Sequential Crawling" in Abschnitt 7).

5xx

Fehler auf Seiten der Website selbst.

 

6. Automatisch nach Zeitplan ausführen

Damit die Wissensdatenbank aktuell bleibt, können Sie einen wiederkehrenden Zeitplan festlegen – dann läuft der Crawl ohne Ihr Zutun.

  • Klicken Sie in der Zeile der Crawl-Quelle auf die Spalte Zeitplan(dort steht zunächst „Aus").
  • Schalten Sie Automatisch ausführen
  • Wählen Sie:
  • Häufigkeit:Wöchentlich oder Monatlich
  • WochentagTag im Monat (bei kürzeren Monaten läuft der Crawl am letzten Tag des Monats)
  • Uhrzeit– bitte in Ihrer lokalen Zeit; die Umrechnung passiert automatisch
  • Enddatum(optional) – danach läuft nichts mehr
  • OK

In der Tabelle steht dann z. B. „Wöchentlich · Montag · 06:00" und darunter „Nächster Lauf: 2026-09-08 06:00".

Empfehlung: Legen Sie den Lauf in die frühen Morgenstunden. Das schont die Zielwebsite und das System zu Zeiten, in denen ohnehin niemand damit arbeitet.

Läuft zum geplanten Zeitpunkt noch ein früherer Durchlauf, wird der neue Termin übersprungen und der Zeitplan geht regulär zum nächsten Termin weiter.

 

7. Erweiterte Einstellungen

Diese Einstellungen brauchen Sie im Normalfall nicht. Die Standardwerte sind für die meisten Websites gut gewählt. Klappen Sie den Bereich Erweiterte Einstellungen nur auf, wenn ein konkretes Problem zu lösen ist.

Im Folgenden die Optionen, die im Alltag tatsächlich relevant werden können:

Umfang begrenzen

Einstellung

Standard

Wozu

Max Depth (nur Deep Crawl)

10

Wie viele Klicks weit sich der Crawler von der Startseite entfernen darf. 1 = nur die direkt verlinkten Seiten. Kleiner setzen, wenn zu viel eingelesen wird.

Max Pages

10000

Obergrenze für die Anzahl Seiten. Als Sicherheitsnetz bei unbekannten Websites gerne auf z. B. 200 setzen und das Ergebnis erst einmal ansehen.

Url Patterns

leer

Nur Adressen einlesen, die zu einem Muster passen, z. B. https://beispiel.de/blog/*.

Url Exclude Patterns

leer

Adressen ausschließen, z. B. */login/* oder *.pdf.

URLs to Include / Exclude

leer

Einzelne, vollständige Adressen gezielt ein- oder ausschließen.

Allowed Types

Text, HTML, PDF, Office-Dateien

Welche Dateitypen mitgenommen werden. Hier können Sie z. B. PDFs abwählen.

Umgang mit der Zielwebsite

Einstellung

Standard

Wozu

Sequential Crawling

aus

Ruft die Seiten einzeln und langsamer ab. Einschalten, wenn die Website mit Fehler 429 („zu viele Anfragen") reagiert oder ins Straucheln gerät.

Check robots.txt

ein

Beachtet die Regeln, mit denen eine Website automatischen Zugriff einschränkt. Bitte eingeschaltet lassen – ausschalten nur bei eigenen Websites und in Absprache.

Exclude External Links

ein

Verhindert, dass der Crawler auf fremde Websites abwandert. Eingeschaltet lassen.

Exclude Domains

facebook.com, instagram.com, twitter.com, linkedin.com

Domains, die grundsätzlich nicht besucht werden.

Qualität des eingelesenen Textes

Einstellung

Standard

Wozu

Excluded Tags

header, footer, aside, form

Entfernt Kopf-/Fußzeilen, Randspalten und Formulare aus dem Text. Sorgt dafür, dass Navigation und Impressum nicht in jedem Dokument landen.

Excluded CSS-Selector

leer

Entfernt gezielt einzelne Bereiche einer Seite. Erfordert technische Kenntnis der Website – fragen Sie hier bei Bedarf in der IT nach.

Remove Consent Popups

aus

Versucht, Cookie-Banner zu entfernen. Einschalten, wenn in den eingelesenen Dokumenten überall der Cookie-Hinweis auftaucht.

Remove Overlay Elements

aus

Entfernt eingeblendete Overlays/Popups (z. B. Newsletter-Fenster).

Scraping Strategy

LXML (fast, no JS)

„LXML" ist schnell, verarbeitet aber keine Inhalte, die erst per JavaScript nachgeladen werden. Erscheinen Seiten leer oder unvollständig, auf Browser (JS rendering) umstellen – das ist deutlich langsamer.

Scan Full Page

aus

Scrollt die Seite vor dem Auslesen durch. Nötig bei Seiten, die Inhalte erst beim Scrollen nachladen.

Delay Before Return HTML

0.1 s

Wartezeit vor dem Auslesen. Erhöhen (z. B. auf 1–2 s), wenn Inhalte beim Auslesen noch nicht fertig geladen sind.

Nur im Sitemap-Modus

Einstellung

Standard

Wozu

Unveränderte Seiten überspringen (Sitemap lastmod)

ein

Nutzt die Änderungsdaten aus der Sitemap, um unveränderte Seiten gar nicht erst abzurufen – der schnellste Weg für wiederkehrende Läufe. Zum Erzwingen eines vollständigen Neu-Crawls ausschalten.

Verlinkte PDFs herunterladen

aus

Lädt zusätzlich PDFs, die auf den gecrawlten Seiten verlinkt sind, auch wenn sie nicht in der Sitemap stehen. Anderen Links wird dabei nicht gefolgt.

Die übrigen Optionen (Pruning Content Filter, Markdown Generator Optionen, Cache Mode) sind Feineinstellungen für Spezialfälle und sollten nur nach Rücksprache mit der IT verändert werden.

 

8. Geschützte Bereiche crawlen

Verlangt die Website eine Anmeldung, stehen unter Erweiterte Einstellungen → Authentifizierung zwei Verfahren zur Verfügung. Welches das richtige ist, hängt davon ab, wie sich die Website anmeldet – fragen Sie im Zweifel bei der IT oder beim Betreiber der Website nach.

  • Basic Auth– für Websites, bei denen beim Aufruf ein kleines Browser-Fenster nach Benutzername und Passwort fragt. Sie tragen einfach Benutzername und Passwort ein.
  • Formular-Login– für Websites mit einer normalen Login-Seite. Zusätzlich zu Benutzername und Passwort brauchen Sie die Login-URL(die Adresse der Anmeldeseite) sowie die technischen Namen der beiden Eingabefelder („Benutzername-Feld", „Passwort-Feld"). Die Standardwerte user und pass passen längst nicht überall – hier hilft die IT weiter.

Gespeicherte Passwörter werden beim späteren Öffnen des Formulars nur noch maskiert angezeigt. Wenn Sie die Felder unangetastet lassen, bleibt das hinterlegte Passwort erhalten.

Bitte beachten: Verwenden Sie nach Möglichkeit ein eigenes, nur lesendes Konto für den Crawler – kein persönliches Benutzerkonto.

 

9. Verlauf und Aufräumen

Über 🕘 Verlauf sehen Sie alle bisherigen Durchläufe einer Crawl-Quelle mit Datum und Status. Von dort aus können Sie jeden einzelnen Report öffnen, herunterladen oder löschen. Der jeweils letzte Durchlauf kann nicht gelöscht werden – er liefert die Anzeige in der Übersichtstabelle.

Crawl-Quelle löschen: Entfernt nur die gespeicherte Konfiguration. Die bereits eingelesenen Dokumente bleiben in der Wissensdatenbank erhalten – diese verwalten Sie weiterhin im Tab Datensatz.

Was passiert mit Seiten, die von der Website verschwinden? Sie werden nicht automatisch gelöscht. Ein Dokument zu einer entfernten Seite bleibt in der Wissensdatenbank, bis Sie es im Tab Datensatz von Hand löschen.

 

10. Empfohlenes Vorgehen für den ersten Crawl

  • Klein anfangen.Legen Sie die Quelle an und setzen Sie unter „Erweiterte Einstellungen" Max Pagesauf einen kleinen Wert (z. B. 50).
  • Einmal manuell ausführen(▶) und den Durchlauf abwarten.
  • Report ansehen:Stimmen Zahl und Auswahl der Seiten? Gibt es viele Fehler?
  • Stichprobe im Tab „Datensatz":Öffnen Sie zwei, drei der neuen Dokumente. Ist der Text sauber – oder stehen dort Cookie-Banner, Navigation und Impressum? Dann in den erweiterten Einstellungen nachschärfen (Abschnitt 7).
  • Im Tab „Testen der Suche"eine typische Frage stellen und prüfen, ob die erwarteten Stellen gefunden werden.
  • Passt alles: Max Pageshochsetzen, vollständig durchlaufen lassen und einen Zeitplan

 

11. Typische Probleme

Beobachtung

Wahrscheinliche Ursache und Lösung

Es wurden nur ganz wenige Seiten gefunden.

Deep Crawl: Max Depth zu klein, oder die Startseite verlinkt kaum intern. Falls vorhanden: den Sitemap-Modus verwenden.

Es wurden viel zu viele Seiten eingelesen.

Max Pages und Max Depth senken, spezifischere Start-URL wählen oder mit Url Exclude Patterns ganze Bereiche ausschließen.

Die Dokumente sind leer oder sehr kurz.

Die Website lädt ihre Inhalte per JavaScript nach: Scraping Strategy auf Browser (JS rendering) stellen, ggf. zusätzlich Scan Full Page einschalten und Delay Before Return HTML erhöhen.

In jedem Dokument steht der Cookie-Hinweis.

Remove Consent Popups einschalten.

In jedem Dokument steht die Navigation/das Impressum.

Excluded Tags prüfen (header, footer, aside sollten enthalten sein); notfalls über Excluded CSS-Selector gezielt entfernen – dabei die IT hinzuziehen.

Viele Fehler mit Code 429.

Sequential Crawling einschalten.

Alle Seiten mit 401 oder 403.

Die Website verlangt eine Anmeldung – siehe Abschnitt 8.

Bei jedem Lauf gelten fast alle Seiten als „Aktualisiert".

Bilder für Änderungserkennung berücksichtigen ausschalten.

Der Fortschritt bleibt bei „X von Y Seiten verarbeitet" stehen.

Die Verarbeitung großer Seitenmengen dauert; bewegt sich über längere Zeit nichts, bitte an die IT wenden.

▶ ist ausgegraut.

Es läuft bereits ein Durchlauf. Warten oder über ■ stoppen.

 

12. Bitte beachten

  • Crawlen Sie nur Websites, für die Sie die Erlaubnis haben– eigene Websites, oder fremde nach Absprache. Lassen Sie Check robots.txt
  • Beachten Sie Urheberrecht und Nutzungsbedingungen der Quelle. Fremde Inhalte in eine interne Wissensdatenbank zu übernehmen, ist nicht automatisch zulässig.
  • Personenbezogene Daten auf Websites unterliegen dem Datenschutz. Im Zweifel vorher Rücksprache halten.
  • Ein Crawl erzeugt Last auf der Zielwebsite. Große Läufe deshalb möglichst nachts oder in Randzeiten planen und Sequential Crawlingverwenden, wenn die Website empfindlich reagiert.