Crawlen
Crawlen bezeichnet das automatische Durchsuchen und Erfassen von Webseiten oder Dokumenten durch ein Programm. Im Messaging-Kontext wird Crawling genutzt, um Inhalte einer Website automatisch in die Wissensdatenbank einer KI einzulesen – statt jedes Dokument manuell hochzuladen.
Was bedeutet Crawlen?
Crawlen (von englisch „to crawl" – kriechen) ist der automatische Vorgang, bei dem ein Programm (der „Crawler" oder „Bot") systematisch Seiten im Web aufruft, deren Inhalt liest und Verlinkungen weiterverfolgt. Google macht das, um seinen Index zu bauen. KI-Plattformen tun es, um eine Wissensdatenbank automatisch zu befüllen.
Crawlen im KI-Kontext
Damit ein KI-Chatbot oder KI-Agent Kundenfragen beantworten kann, braucht er Wissen über Ihr Unternehmen: Produkte, Preise, Versandbedingungen, FAQ, Öffnungszeiten. Klassisch wird dieses Wissen mühsam einzeln hochgeladen. Per Crawling reicht eine Eingabe der Startseite – der Crawler arbeitet sich automatisch durch die verlinkten Unterseiten und legt sie als durchsuchbare Quelle an.
So funktioniert ein KI-Crawler
- Start-URL: Sie geben die Domain an, z. B.
www.ihre-firma.de. - Robots.txt prüfen: Der Crawler liest die Datei
robots.txtund respektiert, welche Bereiche er nicht betreten darf. - Sitemap nutzen: Wenn vorhanden, nutzt er die XML-Sitemap als Karte für effizientes Vorgehen.
- Seiten abrufen: Jede Seite wird heruntergeladen, der HTML-Code analysiert.
- Inhalt extrahieren: Navigation, Footer, Cookie-Banner werden entfernt, der eigentliche Text und die Überschriftenstruktur bleiben.
- Indexieren: Inhalte werden in kleinere, semantisch sinnvolle Abschnitte zerlegt und in einer Vektordatenbank gespeichert.
- Updates: In einstellbaren Intervallen prüft der Crawler erneut, ob Inhalte sich geändert haben.
Was beim Crawlen schiefgehen kann
- JavaScript-Seiten: Inhalte, die erst durch JavaScript geladen werden, sehen viele Crawler nicht. Lösung: Server-seitiges Rendering oder ein moderner Headless-Browser-Crawler.
- Login-geschützte Bereiche: Hinter einem Login sieht der Crawler nichts – außer Sie hinterlegen Zugangsdaten.
- Veraltete Inhalte: Wenn der Crawler nur einmal läuft, wird die Wissensdatenbank schnell veraltet. Regelmäßige Updates sind Pflicht.
- Strukturierungsprobleme: Ohne klare Überschriften und semantisches HTML verliert der Crawler an Trefferqualität.
Was robots.txt damit zu tun hat
Jeder seriöse Crawler respektiert die robots.txt-Datei einer Domain. Dort steht, welche Pfade er besuchen darf und welche nicht. Wenn Sie Ihre eigene Website crawlen lassen, hat das keinen Effekt – Sie sind ja der Eigentümer. Wenn Sie eine fremde Quelle crawlen, müssen Sie deren Regeln befolgen.
Crawlen vs. manuelles Hochladen
| Aspekt | Manuell hochladen | Crawlen |
|---|---|---|
| Initialaufwand | Hoch (Datei für Datei) | Niedrig (eine URL) |
| Aktualität | Nur so frisch wie der letzte Upload | Automatisch bei jedem Crawl-Lauf |
| Kontrolle | Vollständig | Über Whitelist / Blacklist |
| Eignung für | PDFs, Word-Dokumente, statische Datensätze | Dynamische Websites, FAQ-Bereiche, Produktkataloge |
Crawlen bei SendSeven
Die SendSeven Wissensdatenbank lässt sich aus mehreren Quellen befüllen: hochgeladene Dokumente (PDF, DOCX), Website-Crawls (mit konfigurierbarem Update-Rhythmus) und direkte Eingaben. Der gecrawlte Inhalt steht dem KI-Chatbot und KI-Agenten sofort als Antwortbasis zur Verfügung.