Zum Hauptinhalt springen
Schematische Illustration: Eine Frau in weißem Anzug kniet neben leuchtenden Förderbahnen mit farbigen Würfeln, Servergehäuse und Beschriftungen wie „Bot-Identität“ und „Abrufzweck“.
Journal

ANORA Journal

Business OS 21.09.2026 7 Min. Lesezeit N.O.A.H. · Über die Redaktion

Ein Bot war hier. War das schon Nachfrage?

Ein User-Agent ist noch kein Interessent. Der Praxisreport zeigt, wie Sie Bot-Identität, Abrufzweck, Seitentyp und Folgeereignis trennen – und aus Server-Logs belastbare Signale gewinnen.

Im ArtikelInhaltsverzeichnis 9 Kapitel

Der Zähler kennt keinen Interessenten

Im Log-Dashboard steigt eine Kurve. KI-Bots haben Fachartikel geladen, die Leistungsseite besucht und sogar die Preisübersicht abgerufen. Das sieht nach wachsendem Interesse aus. Gemessen wurden jedoch zunächst nur Requests.

Hinter ihnen können sehr verschiedene Vorgänge stehen: eine Trainingspipeline sammelt Texte, ein Suchsystem aktualisiert seinen Index, eine Nutzerfrage löst einen einzelnen Abruf aus oder ein Agent versucht, eine Handlung auszuführen. Im Server-Log ähneln sich diese Ereignisse. Ihr wirtschaftlicher Wert ist nicht derselbe.

Wie groß der Abstand sein kann, zeigte Cloudflare im August 2025 für einen untersuchten Zwölfmonatszeitraum: 80 Prozent des klassifizierten KI-Crawlings entfielen auf Training, 18 Prozent auf Suche und zwei Prozent auf Nutzeraktionen. Das ist kein Erwartungswert für eine einzelne Website. Es belegt aber, warum eine Gesamtsumme namens „AI Traffic“ wenig erklärt. Cloudflares Analyse der Crawl-Zwecke ↗

Wer AI Traffic analysieren will, braucht deshalb keine größere Zahl, sondern eine sauberere Ereigniskette: Wer hat nachweislich zugegriffen, welchem dokumentierten Zweck dient der Zugriff, welche Seite war betroffen und was geschah danach?

Vier Zugriffe, vier Bedeutungen

Für die erste Auswertung ist der Zweck hilfreicher als der Anbietername. Vier Kategorien trennen technische Datennutzung von möglicher Nachfrage.

Illustration: Eine stilisierte Frau im weißen Anzug berührt Würfel und eine leuchtende Kugel auf einer hellen Oberfläche mit Büchern, Lupen, Zahnrädern, Schaltern und englisch beschrifteten Feldern.
Eine stilisierte Frau im weißen Anzug berührt Würfel und eine leuchtende Kugel auf einer hellen Oberfläche mit Büchern, Lupen, Zahnrädern, Schaltern und englisch beschrifteten Feldern. KI-generierte Illustration.
EreignisStärkste vertretbare AussageWas offenbleibt
Training oder ModellentwicklungInhalte wurden für eine mögliche Nutzung bei Entwicklung oder Verbesserung eines Modells abgerufen.Ob die Seite in einer aktuellen Antwort erschien oder ein Nutzer Interesse zeigte.
Suche, Indexierung oder GroundingEin System konnte Inhalte für Suche oder Antwortgrundlagen erschließen.Ob die Seite zitiert, positiv dargestellt oder angeklickt wurde.
Nutzerinitiierter AbrufEine konkrete Nutzeraktion löste den Seitenabruf aus.Welche Frage gestellt wurde und ob eine Kaufabsicht bestand.
AgentenhandlungEin automatisiertes System navigierte oder versuchte eine Aktion auszuführen.Ob die Handlung autorisiert, erfolgreich und geschäftlich verwertbar war.

Die Kategorien sind ein Messmodell, kein universelles Wörterbuch. Nicht jeder Betreiber verwendet dieselben Bezeichnungen. Zudem kann ein technischer Abruf mehr als einem erlaubten Zweck dienen.

OpenAI dokumentiert die Unterschiede für seine Zugriffe vergleichsweise deutlich. OAI-SearchBot erschließt Websites für die Suchfunktionen von ChatGPT. GPTBot ruft Inhalte ab, die für das Training generativer Basismodelle verwendet werden können. ChatGPT-User wird bei bestimmten Aktionen von ChatGPT-Nutzern und Custom GPTs eingesetzt und crawlt laut Anbieter nicht automatisch das Web. OpenAI weist zugleich darauf hin, dass das Ergebnis eines Abrufs für mehrere erlaubte Zwecke genutzt werden kann, wenn eine Website sowohl OAI-SearchBot als auch GPTBot zulässt. OpenAIs Übersicht der Crawler und User-Agents ↗

Auch bei Google darf der Name im Log nicht vorschnell interpretiert werden. Google-Agent navigiert und handelt laut Dokumentation auf Anforderung eines Nutzers. Google-Extended ist dagegen kein eigener HTTP-User-Agent. Es handelt sich um einen Kontrolltoken in der robots.txt für die Nutzung bereits gecrawlter Inhalte beim Training und Grounding bestimmter Gemini-Angebote. Die Einstellung beeinflusst weder die Aufnahme in Google Search noch das Ranking. Googles Dokumentation nutzerinitiierter Fetcher ↗ Googles Angaben zu Google-Extended ↗

Damit wird eine wichtige Messgrenze sichtbar: Nicht jede Nutzungsregel besitzt ein eigenes Gegenstück im Log. Umgekehrt ist nicht jeder sichtbare Bot-Name ein Beweis für die behauptete Herkunft.

Ein Bot-Name ist noch keine Identität

Der User-Agent ist eine Zeichenfolge, die das anfragende System selbst mitsendet. Sie lässt sich kopieren. Wer lediglich nach „GPTBot“, „OAI-SearchBot“ oder „Google-Agent“ filtert, misst daher zunächst behauptete Identitäten.

Google nennt für die Verifikation drei Merkmale: User-Agent, Quell-IP und den Reverse-DNS-Hostnamen der IP-Adresse. OpenAI veröffentlicht für seine dokumentierten Bots eigene IP-Verzeichnisse. Verifizierte Bot-Signale eines CDN oder einer Web Application Firewall können die Prüfung ergänzen. Googles Hinweise zur Crawler-Verifikation ↗

Die Vorsicht ist nicht theoretisch. HUMAN Security verglich für seinen im März 2026 veröffentlichten Bericht deklarierte Bot-Identitäten mit Infrastruktur- und Verhaltenssignalen. Ein erheblicher Teil der untersuchten Requests, die sich als Bots von ChatGPT, Mistral oder Perplexity ausgaben, stammte laut Bericht nicht aus der Infrastruktur der behaupteten Betreiber. Eine universell übertragbare Spoofing-Quote nennt die Untersuchung nicht. Ihre belastbare Aussage ist enger: Eine Freigabe allein anhand des User-Agents kann unbekannten Akteuren Zugang verschaffen. HUMANs Bericht zu KI-Traffic und Bot-Spoofing ↗

Für die Analyse ergibt sich daraus eine feste Reihenfolge:

  1. Nutzen Sie Server-, CDN- oder WAF-Logs als Datenbasis und speichern Sie mindestens Zeitstempel, Methode, Pfad, Statuscode, User-Agent, Quell-IP, Referer, Query-Parameter und übertragene Bytes.
  2. Normalisieren Sie wechselnde Versionsnummern, ohne verschiedene Bot-Familien zusammenzuführen.
  3. Prüfen Sie die behauptete Identität gegen veröffentlichte IP-Bereiche, DNS-Merkmale oder verifizierte Sicherheitssignale.
  4. Kennzeichnen Sie nicht verifizierbare Zugriffe als „behauptet“ oder „unbekannt“ statt als bestätigten Betreiber-Traffic.

Erst danach lohnt sich die Frage nach dem geschäftlichen Signal.

Was eine Woche im Log tatsächlich sagt

Modelliertes Beispiel, keine Kundenmessung: Ein B2B-Anbieter wertet verifizierte Zugriffe einer Woche aus. Die URLs sind nach ihrer Funktion geordnet: Fachinformation, Leistungsbeschreibung, Preisübersicht und Kontaktprozess.

Illustration: Eine Frau im weißen Anzug steht auf einer schwebenden Plattform zwischen holografischen Tafeln, Molekülsymbolen, Checkboxen und leuchtenden Handschlag-Icons.
Eine Frau im weißen Anzug steht auf einer schwebenden Plattform zwischen holografischen Tafeln, Molekülsymbolen, Checkboxen und leuchtenden Handschlag-Icons. KI-generierte Illustration.

Am Montag lädt GPTBot mehrere ältere Fachartikel. Am Dienstag ruft OAI-SearchBot die Sitemap und einige kürzlich geänderte Seiten ab. Am Mittwoch fordert ChatGPT-User eine Leistungsseite und die Preisübersicht an. Am Donnerstag bewegt sich Google-Agent durch den Kontaktprozess und sendet ein Formular. Am Freitag erfasst die Webanalyse eine Sitzung mit utm_source=chatgpt.com, auf die eine Demo-Anfrage folgt.

Die Einträge stehen im selben Bericht. Sie rechtfertigen dennoch verschiedene Aussagen:

  • Der GPTBot-Lauf ist zunächst Datennutzung. Er kann Bandbreite, Serverlast und die Entscheidung über Trainingszugriff betreffen. Eine Nachfragekennzahl ist er nicht.
  • Der OAI-SearchBot-Lauf belegt technische Erreichbarkeit. Das System konnte die geänderten Seiten erschließen. Ob daraus eine Zitation oder ein Besuch entstand, bleibt offen.
  • ChatGPT-User liegt näher an einer konkreten Frage. Der Zugriff wurde laut dokumentiertem Zweck durch eine Nutzeraktion ausgelöst. Die aufgerufenen Seiten machen ihn untersuchenswert. Ohne Prompt sind jedoch weder Empfehlung noch Kaufabsicht bekannt.
  • Die Google-Agent-Sequenz zeigt einen Handlungsversuch. Der Formular-Request ist stärker als ein Seitenabruf. Vor einer geschäftlichen Wertung muss dennoch geprüft werden, ob die Übermittlung gültig, autorisiert und verwertbar war.
  • Die Demo-Anfrage ist ein erfasstes Reaktionssignal. OpenAI gibt an, Referral-URLs aus ChatGPT-Suchergebnissen mit utm_source=chatgpt.com zu kennzeichnen. Im Beispiel verbindet sich die Herkunft mit einer Conversion. Erst nach Validierung der Anfrage wird daraus ein belastbares Nachfragesignal. OpenAIs Hinweise zur Referral-Kennzeichnung ↗

Der ChatGPT-User-Abruf ist somit ein Frühsignal möglicher Nachfrage. Die validierte Anfrage ist erfasste Nachfrage. Der GPTBot-Aufruf bleibt technischer Zugriff. Wer diese Ereignisse addiert, macht aus Infrastruktur, Auffindbarkeit und Geschäftsergebnis eine Zahl, die nichts mehr eindeutig bezeichnet.

Drei Messsichten statt einer AI-Traffic-Zahl

Ein belastbares Modell trennt drei Sichten. Sie dürfen in einem Dashboard nebeneinanderstehen, sollten aber nicht zu einem einzigen Score verrechnet werden.

Betrieb: Was kostet und belastet der Zugriff?

Hier zählen Requests, Datenvolumen, Cache-Treffer, Antwortzeiten, Fehlercodes und blockierte Zugriffe. Ein Trainingscrawler kann in dieser Sicht hochrelevant sein, obwohl er keine Nachfrage erzeugt. Die operative Frage lautet: Ist der Zugriff erwünscht, technisch beherrscht und für seinen dokumentierten Zweck geregelt?

Auffindbarkeit: Welche Inhalte können erschlossen werden?

Diese Sicht umfasst verifizierte Such- und Grounding-Crawler, aufgerufene Seitengruppen, Aktualität und Statuscodes. Zitationen und KI-Referrals werden als eigene Folgeereignisse ergänzt. Ein erneuter Abruf kann zeigen, dass eine geänderte Seite erreichbar war. Er beweist weder eine prominente Darstellung noch eine positive Erwähnung.

Hier gilt dieselbe Vorsicht wie bei einem KI-Sichtbarkeits-Score: Erst Herkunft, Zweck und Folgemaßnahme geben dem Signal Bedeutung. Warum Crawlzugriff, Zitation und tatsächlicher Besuch verschiedene Ereignisse bleiben, vertieft der Beitrag Die Antwort ist nicht zu verkaufen.

Nachfrage: Welche Reaktion folgte?

In diese Sicht gehören verifizierte nutzerinitiierte Abrufe, Referrals, Interaktionen, Formulare, Käufe, qualifizierte Kontakte und nachgelagerte Geschäftsergebnisse. Ordnen Sie Seiten dafür nach ihrer Funktion: Information, Entscheidung oder Transaktion. Ein einzelner Abruf einer Preisseite ist interessanter als ein Trainingscrawl durch das gesamte Archiv. Er bleibt schwächer als eine bestätigte Anfrage.

Jede Sequenz lässt sich anschließend mit vier Merkmalen beschreiben:

  • Identität: bestätigt, nur behauptet oder unbekannt.
  • Zweck: Training, Sucherschließung, Nutzerabruf, Agentenhandlung oder nicht klassifizierbar.
  • Seitennähe: Information, Entscheidung oder Transaktion.
  • Folge: keine beobachtete, Referral, Interaktion, Conversion oder validiertes Geschäftsergebnis.

Ein bestätigter, wiederkehrender Nutzerabruf auf entscheidungsnahen Seiten kann damit ein sinnvolles Frühsignal sein. Er verdient eine Untersuchung, aber noch keine Erfolgsmeldung.

Bei der Verbindung von Logs, Analytics-, Formular- und Geschäftsdaten müssen Datenschutz, Aufbewahrungsfristen und Zugriffsrechte vorab geklärt werden. Für viele Auswertungen genügen aggregierte Seitengruppen, Zeitfenster und Ereignisklassen. Bot-Traffic zu messen verlangt nicht automatisch ein dauerhaftes Profil einzelner Besucher.

Der stärkste Satz bleibt begrenzt

Auch eine sorgfältige Logauswertung sieht den Prompt nicht. Sie weiß nicht, ob jemand nach einer Empfehlung, einer Warnung, einer Zusammenfassung oder einem Gegenargument gefragt hat. Ein Agent kann eine Preisseite für einen Kauf prüfen – oder für einen Wettbewerbsvergleich. Umgekehrt kann ein Referral fehlen, obwohl ein KI-System an der Customer Journey beteiligt war.

Die stärkste Aussage eines verifizierten nutzerinitiierten Abrufs lautet daher: Eine konkrete Aufgabe hat diesen Zugriff ausgelöst. Das ist mehr als ein Trainingscrawl und weniger als belegte Nachfrage.

Beim nächsten Bot-Zugriff lautet die relevante Frage deshalb nicht: Wie viel AI Traffic hatten wir? Sondern: Wer war nachweislich hier, welchem Zweck diente der Abruf – und welches beobachtbare Ereignis folgte? Im Log ist der Unterschied klein. In der unternehmerischen Auswertung trennt er Serverlast von Sichtbarkeit und Sichtbarkeit von Nachfrage.

Einordnung

N.O.A.H. Insights

Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.

Redaktionelle TheseNicht die Menge der Bot-Requests ist entscheidend, sondern die belegbare Ereigniskette aus Identität, Zweck, Seitentyp und Folge.

MessgrenzeEin nutzerinitiierter Abruf verrät weder den Prompt noch die Darstellung der Quelle in einer Antwort. Er darf nicht als Empfehlung oder Kaufabsicht ausgewiesen werden.

Operative KonsequenzCrawlerkosten, KI-Auffindbarkeit und Nachfrage benötigen getrennte Messsichten. Erst nachvollziehbare Folgeereignisse verbinden sie.

Unterschätztes RisikoEin bekannter Bot-Name im User-Agent bestätigt den Betreiber nicht. Nicht verifizierte Zugriffe sollten als behauptete Identität gekennzeichnet werden.

FAQ

Häufige Fragen

Kurze Antworten auf die wichtigsten Fragen zum Beitrag.

Ist ein Zugriff von ChatGPT-User bereits echte Nachfrage?

Nein. Er zeigt laut OpenAI, dass eine Nutzeraktion den Abruf ausgelöst hat. Ohne Prompt und ohne validiertes Folgeereignis bleiben Interesse, Haltung und Kaufabsicht unbekannt.

Kann Google-Extended in Server-Logs gefunden werden?

Nicht als eigener HTTP-User-Agent. Google-Extended ist ein robots.txt-Kontrolltoken. Die zugehörigen Inhalte werden über bestehende Google-User-Agents abgerufen.

Welche Logfelder werden für die Auswertung benötigt?

Mindestens Zeitstempel, HTTP-Methode, Pfad, Statuscode, User-Agent, Quell-IP, Referer, Query-Parameter und Datenvolumen. Hilfreich sind Request-IDs sowie verifizierte Bot- und Sicherheitsklassifikationen des CDN oder der Web Application Firewall.

Welche KI-Bot-Zugriffe sind als Frühsignal am wertvollsten?

Verifizierte, nutzerinitiierte Abrufe auf entscheidungsnahen Seiten sind aussagekräftiger als breite Trainings- oder Indexierungsläufe. Belastbar werden sie erst durch ein weiteres Signal wie Referral, Interaktion, validierte Anfrage oder Transaktion.

Zum Nachlesen

Quellen zum Beitrag

Diese Referenzen werden im Artikel verlinkt. Maßgeblich sind die jeweilige Aussage, ihr Kontext und der Stand der Quelle.

Alle 7 Quellen anzeigen1 weitere Referenzen
Aus Erkenntnis wird Umsetzung

Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.

Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.

KI-Workflow mit ANORA prüfen