Buddy Infocenter
- Anwendungsbeispiele
- Integrationsmöglichkeiten
- Benutzerauthentifizierung
- API
- Anforderungs- & Leistungskatalog
- Tutorials
- Dokumentation
- Glossar
- Sicherheit und Datenschutz
- Preismodell
- FAQ
- Technische Daten & Infrastruktur
- Zusätzliche Dienstleistungen
- Unterschiede Buddy vs. andere Chatbots
- Online-Kurs zu KI-Kompetenzen
Dokumentation Web Crawler
Diese Anleitung erklärt Schritt für Schritt, wie Sie mit dem Webcrawler Inhalte von Webseiten automatisch in eine Wissensdatenbank einlesen. Es sind keine technischen Vorkenntnisse nötig – alles passiert über die Benutzeroberfläche.
1. Was macht der Webcrawler?
Der Webcrawler ruft Seiten einer Website auf, wandelt ihren Text in Dokumente um und legt diese in einer Wissensdatenbank ab. Danach kann der Chatbot die Inhalte dieser Seiten in seinen Antworten verwenden – genauso wie hochgeladene PDF- oder Word-Dateien.
Sie richten dafür eine Crawl-Quelle ein. Das ist eine gespeicherte Konfiguration ("Ab dieser Adresse, mit diesen Einstellungen"), die Sie beliebig oft erneut ausführen können – manuell per Klick oder automatisch nach Zeitplan.
Wichtig: Bei jedem weiteren Durchlauf werden nur neue und geänderte Seiten eingelesen. Unveränderte Seiten werden erkannt und übersprungen. Ein wöchentlicher Lauf erzeugt also keine Duplikate und verursacht kaum Aufwand.
2. Wo finde ich den Crawler?
- Öffnen Sie die gewünschte Wissensdatenbank.
- Klicken Sie links in der Seitenleiste auf Crawler.
Sie sehen nun eine Tabelle mit allen bereits angelegten Crawl-Quellen. Ist noch keine vorhanden, steht dort „Noch keine Crawl-Quellen vorhanden."
Alternativ finden Sie den Einstieg im Tab Datensatz unter Inhalte hinzufügen → Web-Crawl. Dieser Knopf führt an dieselbe Stelle und öffnet direkt das Formular für eine neue Crawl-Quelle.
3. Eine neue Crawl-Quelle anlegen
Klicken Sie oben rechts auf Neue Crawl-Quelle. Es öffnet sich ein Formular.
Für den Anfang genügen die drei Felder im oberen Bereich – alles darunter („Erweiterte Einstellungen") können Sie zunächst geschlossen lassen.
3.1 Link-Erkennung
Hier legen Sie fest, wie der Crawler herausfindet, welche Seiten er einlesen soll. Es gibt zwei Möglichkeiten:
|
Auswahl |
Bedeutung |
Wann verwenden? |
|
Deep Crawl (Links folgen) |
Der Crawler startet auf einer Seite und folgt von dort aus allen internen Links – wie jemand, der sich durch die Website klickt. |
Standardfall. Immer dann, wenn Sie keine Sitemap kennen. |
|
Sitemap |
Sie geben die Adresse einer XML-Sitemap an. Der Crawler liest genau die Seiten ein, die dort aufgelistet sind. |
Wenn die Website eine Sitemap anbietet – das ist schneller, vollständiger und schonender für die Website. |
Was ist eine Sitemap? Viele Websites veröffentlichen ein maschinenlesbares Inhaltsverzeichnis unter einer Adresse wie https://beispiel.de/sitemap.xml. Probieren Sie diese Adresse einfach im Browser aus: Erscheint eine (unschön formatierte) Liste von Adressen, existiert eine Sitemap und Sie können den Sitemap-Modus verwenden. Erscheint eine Fehlerseite, nehmen Sie Deep Crawl.
3.2 URL bzw. Sitemap-URL
Die Adresse, bei der der Crawler beginnt – inklusive https://.
- Bei Deep Crawl: die Startseite oder ein Bereich, z. B. https://beispiel.deoder https://beispiel.de/wissen/
- Bei Sitemap: die Adresse der Sitemap-Datei, z. B. https://beispiel.de/sitemap.xml
Tipp: Beim Deep Crawl bestimmt die Start-Adresse den Umfang. Geben Sie https://beispiel.de/handbuch/ an, bleibt der Crawler im Wesentlichen in diesem Bereich – das ist meist gezielter als die komplette Startseite.
Nur öffentlich erreichbare Adressen sind erlaubt. Interne Adressen aus dem Firmennetz (z. B. 192.168.… oder localhost) werden abgelehnt.
3.3 Name
Ein frei wählbarer Name, unter dem die Crawl-Quelle in der Tabelle erscheint, z. B. „Website Physiotherapie – Fachartikel". Wenn Sie in das Feld klicken, wird automatisch ein Vorschlag aus der Adresse erzeugt, den Sie überschreiben können.
3.4 Nach Crawl analysieren
Bleibt normalerweise eingeschaltet.
- Ein (Standard):Die gefundenen Seiten werden direkt nach dem Crawl automatisch verarbeitet („geparst und eingebettet") und stehen dem Chatbot danach zur Verfügung.
- Aus:Die Seiten werden zwar heruntergeladen und als Dokumente gespeichert, aber noch nicht verarbeitet. Sie müssten sie später im Tab Datensatzvon Hand starten. Sinnvoll nur, wenn Sie die Ergebnisse vorher prüfen möchten.
3.5 Bilder für Änderungserkennung berücksichtigen
Bleibt normalerweise eingeschaltet. Diese Einstellung betrifft nur wiederholte Durchläufe:
- Ein (Standard):Eine Seite gilt als geändert, sobald sich auch nur eine Bild-Adresse darauf ändert.
- Aus:Bild-Adressen werden beim Vergleich ignoriert. Das hilft bei Websites, die ihren Bildern bei jedem Aufruf technisch neue Adressen geben – sonst würde jede Seite bei jedem Lauf fälschlich als „geändert" gelten und unnötig neu verarbeitet.
Wenn Sie nach wiederholten Läufen sehen, dass verdächtig viele Seiten als „Aktualisiert" gemeldet werden, obwohl sich inhaltlich nichts getan hat: schalten Sie diese Option aus.
3.6 Speichern
Klicken Sie auf OK. Die Crawl-Quelle erscheint jetzt in der Tabelle – sie ist damit angelegt, aber noch nicht ausgeführt.
4. Einen Crawl starten und beobachten
In der Tabelle finden Sie pro Zeile rechts vier Symbole:
|
Symbol |
Funktion |
|
▶ Jetzt ausführen |
Startet einen Durchlauf sofort. |
|
✏️ Bearbeiten |
Öffnet die Einstellungen erneut. |
|
🕘 Verlauf |
Zeigt alle bisherigen Durchläufe und deren Reports. |
|
🗑️ Löschen |
Entfernt die Crawl-Quelle. |
Während ein Durchlauf läuft, wird das ▶-Symbol durch ein Stopp-Symbol (■) ersetzt, mit dem Sie den Crawl vorzeitig beenden können. Bearbeiten und Löschen sind währenddessen deaktiviert.
Die Status-Spalte lesen
Der Status aktualisiert sich automatisch (alle paar Sekunden). Ein Durchlauf hat zwei Phasen, die nacheinander angezeigt werden:
- „Crawlt 42 %"– die Seiten werden gerade von der Website abgerufen.
- „17 von 120 Seiten verarbeitet"mit Fortschrittsbalken – die abgerufenen Seiten werden nun analysiert und für die Suche aufbereitet. Diese zweite Phase dauert meist deutlich länger als die erste.
Weitere Anzeigen:
|
Anzeige |
Bedeutung |
|
Noch nie ausgeführt |
Die Quelle ist angelegt, aber noch nicht gelaufen. |
|
Wird gestoppt… |
Der Stopp wurde angefordert; der Crawl beendet noch den aktuellen Block. |
|
Crawl abgebrochen |
Der Durchlauf wurde per Stopp beendet. |
|
Crawl fehlgeschlagen |
Der Durchlauf konnte nicht ausgeführt werden – Details im Report. |
|
X fehlgeschlagen (rot) |
Einzelne Seiten konnten nicht verarbeitet werden. |
|
X nicht analysiert |
Seiten wurden geholt, aber nicht verarbeitet (siehe „Nach Crawl analysieren"). |
Ein Klick auf den Statustext öffnet den Report des letzten Durchlaufs.
Hinweis: Es kann immer nur ein Durchlauf pro Crawl-Quelle gleichzeitig laufen. Klicken Sie ▶ trotzdem, erscheint der Hinweis „Es läuft bereits ein Durchlauf".
5. Den Report verstehen
Der Report ist das Protokoll eines Durchlaufs. Sie erreichen ihn über den Statustext oder über 🕘 Verlauf → Report anzeigen.
Er enthält:
- Start-URL– wo der Durchlauf begonnen hat.
- Zusammenfassung– z. B. „120 Seiten insgesamt, 118 erfolgreich, 2 fehlgeschlagen."
- Seit letztem Lauf– z. B. „3 neu, 5 aktualisiert, 110 unverändert (nicht erneut analysiert)." Genau hier sehen Sie, dass wiederholte Läufe sparsam arbeiten.
- Erfolgreiche Seiten– Tabelle mit Adresse, Titel, Statuscode und Ergebnis:
- Neu– Seite war noch nicht in der Wissensdatenbank.
- Aktualisiert– Seite existierte, ihr Inhalt hat sich geändert; das alte Dokument wurde durch das neue ersetzt.
- Unverändert – übersprungen– nichts zu tun.
- Fehlerhafte Seiten– Tabelle mit Adresse, Statuscode, wahrscheinlicher Ursache und Fehlermeldung. Steht dort „Keine Fehler – alle Seiten erfolgreich gecrawlt.", ist alles in Ordnung.
- Crawl-Konfiguration– die Einstellungen, mit denen dieser Lauf ausgeführt wurde. (Praktisch, wenn Sie die Einstellungen zwischenzeitlich geändert haben.)
Über Report herunterladen speichern Sie das Protokoll als Datei, z. B. um es an Kolleginnen und Kollegen weiterzugeben.
Häufige Statuscodes
|
Code |
Bedeutung im Klartext |
|
200 |
Alles in Ordnung. |
|
401 / 403 |
Zugriff verweigert – die Seite verlangt eine Anmeldung (siehe Abschnitt 8). |
|
404 |
Seite existiert nicht (mehr) – oft ein toter Link auf der Website. |
|
429 |
Zu viele Anfragen – die Website bremst uns aus (siehe „Sequential Crawling" in Abschnitt 7). |
|
5xx |
Fehler auf Seiten der Website selbst. |
6. Automatisch nach Zeitplan ausführen
Damit die Wissensdatenbank aktuell bleibt, können Sie einen wiederkehrenden Zeitplan festlegen – dann läuft der Crawl ohne Ihr Zutun.
- Klicken Sie in der Zeile der Crawl-Quelle auf die Spalte Zeitplan(dort steht zunächst „Aus").
- Schalten Sie Automatisch ausführen
- Wählen Sie:
- Häufigkeit:Wöchentlich oder Monatlich
- WochentagTag im Monat (bei kürzeren Monaten läuft der Crawl am letzten Tag des Monats)
- Uhrzeit– bitte in Ihrer lokalen Zeit; die Umrechnung passiert automatisch
- Enddatum(optional) – danach läuft nichts mehr
- OK
In der Tabelle steht dann z. B. „Wöchentlich · Montag · 06:00" und darunter „Nächster Lauf: 2026-09-08 06:00".
Empfehlung: Legen Sie den Lauf in die frühen Morgenstunden. Das schont die Zielwebsite und das System zu Zeiten, in denen ohnehin niemand damit arbeitet.
Läuft zum geplanten Zeitpunkt noch ein früherer Durchlauf, wird der neue Termin übersprungen und der Zeitplan geht regulär zum nächsten Termin weiter.
7. Erweiterte Einstellungen
Diese Einstellungen brauchen Sie im Normalfall nicht. Die Standardwerte sind für die meisten Websites gut gewählt. Klappen Sie den Bereich Erweiterte Einstellungen nur auf, wenn ein konkretes Problem zu lösen ist.
Im Folgenden die Optionen, die im Alltag tatsächlich relevant werden können:
Umfang begrenzen
|
Einstellung |
Standard |
Wozu |
|
Max Depth (nur Deep Crawl) |
10 |
Wie viele Klicks weit sich der Crawler von der Startseite entfernen darf. 1 = nur die direkt verlinkten Seiten. Kleiner setzen, wenn zu viel eingelesen wird. |
|
Max Pages |
10000 |
Obergrenze für die Anzahl Seiten. Als Sicherheitsnetz bei unbekannten Websites gerne auf z. B. 200 setzen und das Ergebnis erst einmal ansehen. |
|
Url Patterns |
leer |
Nur Adressen einlesen, die zu einem Muster passen, z. B. https://beispiel.de/blog/*. |
|
Url Exclude Patterns |
leer |
Adressen ausschließen, z. B. */login/* oder *.pdf. |
|
URLs to Include / Exclude |
leer |
Einzelne, vollständige Adressen gezielt ein- oder ausschließen. |
|
Allowed Types |
Text, HTML, PDF, Office-Dateien |
Welche Dateitypen mitgenommen werden. Hier können Sie z. B. PDFs abwählen. |
Umgang mit der Zielwebsite
|
Einstellung |
Standard |
Wozu |
|
Sequential Crawling |
aus |
Ruft die Seiten einzeln und langsamer ab. Einschalten, wenn die Website mit Fehler 429 („zu viele Anfragen") reagiert oder ins Straucheln gerät. |
|
Check robots.txt |
ein |
Beachtet die Regeln, mit denen eine Website automatischen Zugriff einschränkt. Bitte eingeschaltet lassen – ausschalten nur bei eigenen Websites und in Absprache. |
|
Exclude External Links |
ein |
Verhindert, dass der Crawler auf fremde Websites abwandert. Eingeschaltet lassen. |
|
Exclude Domains |
facebook.com, instagram.com, twitter.com, linkedin.com |
Domains, die grundsätzlich nicht besucht werden. |
Qualität des eingelesenen Textes
|
Einstellung |
Standard |
Wozu |
|
Excluded Tags |
header, footer, aside, form |
Entfernt Kopf-/Fußzeilen, Randspalten und Formulare aus dem Text. Sorgt dafür, dass Navigation und Impressum nicht in jedem Dokument landen. |
|
Excluded CSS-Selector |
leer |
Entfernt gezielt einzelne Bereiche einer Seite. Erfordert technische Kenntnis der Website – fragen Sie hier bei Bedarf in der IT nach. |
|
Remove Consent Popups |
aus |
Versucht, Cookie-Banner zu entfernen. Einschalten, wenn in den eingelesenen Dokumenten überall der Cookie-Hinweis auftaucht. |
|
Remove Overlay Elements |
aus |
Entfernt eingeblendete Overlays/Popups (z. B. Newsletter-Fenster). |
|
Scraping Strategy |
LXML (fast, no JS) |
„LXML" ist schnell, verarbeitet aber keine Inhalte, die erst per JavaScript nachgeladen werden. Erscheinen Seiten leer oder unvollständig, auf Browser (JS rendering) umstellen – das ist deutlich langsamer. |
|
Scan Full Page |
aus |
Scrollt die Seite vor dem Auslesen durch. Nötig bei Seiten, die Inhalte erst beim Scrollen nachladen. |
|
Delay Before Return HTML |
0.1 s |
Wartezeit vor dem Auslesen. Erhöhen (z. B. auf 1–2 s), wenn Inhalte beim Auslesen noch nicht fertig geladen sind. |
Nur im Sitemap-Modus
|
Einstellung |
Standard |
Wozu |
|
Unveränderte Seiten überspringen (Sitemap lastmod) |
ein |
Nutzt die Änderungsdaten aus der Sitemap, um unveränderte Seiten gar nicht erst abzurufen – der schnellste Weg für wiederkehrende Läufe. Zum Erzwingen eines vollständigen Neu-Crawls ausschalten. |
|
Verlinkte PDFs herunterladen |
aus |
Lädt zusätzlich PDFs, die auf den gecrawlten Seiten verlinkt sind, auch wenn sie nicht in der Sitemap stehen. Anderen Links wird dabei nicht gefolgt. |
Die übrigen Optionen (Pruning Content Filter, Markdown Generator Optionen, Cache Mode) sind Feineinstellungen für Spezialfälle und sollten nur nach Rücksprache mit der IT verändert werden.
8. Geschützte Bereiche crawlen
Verlangt die Website eine Anmeldung, stehen unter Erweiterte Einstellungen → Authentifizierung zwei Verfahren zur Verfügung. Welches das richtige ist, hängt davon ab, wie sich die Website anmeldet – fragen Sie im Zweifel bei der IT oder beim Betreiber der Website nach.
- Basic Auth– für Websites, bei denen beim Aufruf ein kleines Browser-Fenster nach Benutzername und Passwort fragt. Sie tragen einfach Benutzername und Passwort ein.
- Formular-Login– für Websites mit einer normalen Login-Seite. Zusätzlich zu Benutzername und Passwort brauchen Sie die Login-URL(die Adresse der Anmeldeseite) sowie die technischen Namen der beiden Eingabefelder („Benutzername-Feld", „Passwort-Feld"). Die Standardwerte user und pass passen längst nicht überall – hier hilft die IT weiter.
Gespeicherte Passwörter werden beim späteren Öffnen des Formulars nur noch maskiert angezeigt. Wenn Sie die Felder unangetastet lassen, bleibt das hinterlegte Passwort erhalten.
Bitte beachten: Verwenden Sie nach Möglichkeit ein eigenes, nur lesendes Konto für den Crawler – kein persönliches Benutzerkonto.
9. Verlauf und Aufräumen
Über 🕘 Verlauf sehen Sie alle bisherigen Durchläufe einer Crawl-Quelle mit Datum und Status. Von dort aus können Sie jeden einzelnen Report öffnen, herunterladen oder löschen. Der jeweils letzte Durchlauf kann nicht gelöscht werden – er liefert die Anzeige in der Übersichtstabelle.
Crawl-Quelle löschen: Entfernt nur die gespeicherte Konfiguration. Die bereits eingelesenen Dokumente bleiben in der Wissensdatenbank erhalten – diese verwalten Sie weiterhin im Tab Datensatz.
Was passiert mit Seiten, die von der Website verschwinden? Sie werden nicht automatisch gelöscht. Ein Dokument zu einer entfernten Seite bleibt in der Wissensdatenbank, bis Sie es im Tab Datensatz von Hand löschen.
10. Empfohlenes Vorgehen für den ersten Crawl
- Klein anfangen.Legen Sie die Quelle an und setzen Sie unter „Erweiterte Einstellungen" Max Pagesauf einen kleinen Wert (z. B. 50).
- Einmal manuell ausführen(▶) und den Durchlauf abwarten.
- Report ansehen:Stimmen Zahl und Auswahl der Seiten? Gibt es viele Fehler?
- Stichprobe im Tab „Datensatz":Öffnen Sie zwei, drei der neuen Dokumente. Ist der Text sauber – oder stehen dort Cookie-Banner, Navigation und Impressum? Dann in den erweiterten Einstellungen nachschärfen (Abschnitt 7).
- Im Tab „Testen der Suche"eine typische Frage stellen und prüfen, ob die erwarteten Stellen gefunden werden.
- Passt alles: Max Pageshochsetzen, vollständig durchlaufen lassen und einen Zeitplan
11. Typische Probleme
|
Beobachtung |
Wahrscheinliche Ursache und Lösung |
|
Es wurden nur ganz wenige Seiten gefunden. |
Deep Crawl: Max Depth zu klein, oder die Startseite verlinkt kaum intern. Falls vorhanden: den Sitemap-Modus verwenden. |
|
Es wurden viel zu viele Seiten eingelesen. |
Max Pages und Max Depth senken, spezifischere Start-URL wählen oder mit Url Exclude Patterns ganze Bereiche ausschließen. |
|
Die Dokumente sind leer oder sehr kurz. |
Die Website lädt ihre Inhalte per JavaScript nach: Scraping Strategy auf Browser (JS rendering) stellen, ggf. zusätzlich Scan Full Page einschalten und Delay Before Return HTML erhöhen. |
|
In jedem Dokument steht der Cookie-Hinweis. |
Remove Consent Popups einschalten. |
|
In jedem Dokument steht die Navigation/das Impressum. |
Excluded Tags prüfen (header, footer, aside sollten enthalten sein); notfalls über Excluded CSS-Selector gezielt entfernen – dabei die IT hinzuziehen. |
|
Viele Fehler mit Code 429. |
Sequential Crawling einschalten. |
|
Alle Seiten mit 401 oder 403. |
Die Website verlangt eine Anmeldung – siehe Abschnitt 8. |
|
Bei jedem Lauf gelten fast alle Seiten als „Aktualisiert". |
Bilder für Änderungserkennung berücksichtigen ausschalten. |
|
Der Fortschritt bleibt bei „X von Y Seiten verarbeitet" stehen. |
Die Verarbeitung großer Seitenmengen dauert; bewegt sich über längere Zeit nichts, bitte an die IT wenden. |
|
▶ ist ausgegraut. |
Es läuft bereits ein Durchlauf. Warten oder über ■ stoppen. |
12. Bitte beachten
- Crawlen Sie nur Websites, für die Sie die Erlaubnis haben– eigene Websites, oder fremde nach Absprache. Lassen Sie Check robots.txt
- Beachten Sie Urheberrecht und Nutzungsbedingungen der Quelle. Fremde Inhalte in eine interne Wissensdatenbank zu übernehmen, ist nicht automatisch zulässig.
- Personenbezogene Daten auf Websites unterliegen dem Datenschutz. Im Zweifel vorher Rücksprache halten.
- Ein Crawl erzeugt Last auf der Zielwebsite. Große Läufe deshalb möglichst nachts oder in Randzeiten planen und Sequential Crawlingverwenden, wenn die Website empfindlich reagiert.