btlabs Core · offene Messung

Das ai-discovery-radar

Wir messen, was Maschinen auf Websites tatsächlich vorfinden — und veröffentlichen es, auch wenn es unbequem ist. Über KI-Sichtbarkeit wird viel behauptet und wenig gemessen. Welche Wege eine Website Maschinen anbietet, damit sie gefunden und richtig gelesen wird, lässt sich aber schlicht nachzählen. Genau das tun wir, monatlich, öffentlich und mit offengelegtem Verfahren.

Datensatz

AI Discovery Radar — adoption measurements for machine-readable discovery and consent routes

v2026.09 · 4. September 2026 · CC BY 4.0

Monthly measurements of how many websites in a frozen, stratified sample (Tranco + Chrome UX Report country lists) publish machine-readable discovery and consent files (robots.txt, llms.txt, TDMRep, agent-card.json and others). Shares over observed hosts only, Wilson 95% intervals; full ruleset with version history in RULESET.md. Data files carry run identifier and ruleset version; numbers across ruleset versions are not comparable. Published by Berger+Team, Bolzano — project page: https://btlabs.dev/en/ai-discovery-radar

DOI 10.5281/zenodo.22178282

Zitieren

Berger, Florian (2026). AI Discovery Radar — adoption measurements for machine-readable discovery and consent routes (v2026.09) [Dataset]. Zenodo. https://doi.org/10.5281/zenodo.22178282

Was gemessen wird

Das Radar prüft, welche maschinenlesbaren Dateien eine Website für Maschinen bereitstellt: die robots.txt, die seit dreißig Jahren regelt, welche Bereiche automatische Besucher betreten dürfen. Die llms.txt, ein Inhaltsverzeichnis für Sprachmodelle. Die ai-catalog.json, die beschreibt, welche Inhalte und Dienste eine Domain KI-Agenten anbietet. Insgesamt stehen 34 solcher Wege in der laufenden Messung.

Dazu kommt, was wir bewusst nicht messen. 24 weitere Wege stehen unter Beobachtung: bekannt, aber noch nicht verbreitet genug, um bei jedem Host der Stichprobe eine Anfrage zu rechtfertigen. Und 48 haben wir geprüft und wieder verworfen — mit Begründung, Eintrag für Eintrag. Ein Katalog wird nicht besser, indem man jedes Format aufnimmt, von dem jemand redet.

Abgerufen werden ausschließlich öffentliche, für Maschinen bestimmte Konfigurationsdateien — keine Seiteninhalte, keine Bilder, keine Texte. Die Messung hält sich an die robots.txt der jeweiligen Domain und nennt sich beim Namen.

Was das Panel zeigt

Stand September 2026, gemessen an einer geschichteten Stichprobe von 853 erreichbaren Domains:

  • 86,2 % liefern eine robots.txt aus. Der alte Standard ist der einzige, den fast alle bedienen.
  • 13,5 % liefern eine llms.txt. Das Format ist jung, die Verbreitung entsprechend.
  • 0,0 % liefern eine ai-catalog.json. Von den 34 geprüften Wegen kam bei 16 über das gesamte Panel hinweg keine einzige Antwort.

Diese Nullen sind kein Messfehler. Sie sind das Ergebnis. Über viele dieser Formate wird geredet, als wären sie etabliert — im offenen Web sind sie es nicht.

Seit September 2026 wird dasselbe Panel von 1.000 Quellen jeden Monat neu gemessen; die Zahlen oben sind der jeweils jüngste Lauf und von Monat zu Monat vergleichbar. Die Erkundungsserie vom August 2026 über 16.554 Domains bleibt als Basislinie im GitHub-Repo dokumentiert.

Warum wir das offenlegen

Wir bauen Websites, die von Menschen und von KI-Systemen gefunden werden sollen. Diese Arbeit braucht Zahlen statt Annahmen: Welcher Weg trägt heute wirklich, und welcher ist eine Wette auf morgen? Wer das nicht misst, verkauft Vermutungen.

Deshalb ist das Verfahren öffentlich — Stichprobe, Regelsatz, Konfidenzintervalle, und die Wege, die bei null herauskamen, stehen mit in der Tabelle. Wer eine dieser Zahlen anzweifelt, kann sie nachrechnen. Das ist der Punkt.

Das vollständige Verfahren — Klassifikationsmodell, Nennerregel, Stichprobendesign, Prüfverfahren und die Messfallen, die uns selbst Daten gekostet haben — steht im Technical Report v1.0 (Zenodo, DOI 10.5281/zenodo.22769680, CC BY 4.0, englisch). Wer eine Quote zitiert, sollte ihn vorher gelesen haben.

Wer nicht gemessen werden will

Keine Rückfragen, keine Begründung. Eine E-Mail mit der Domain genügt, oder eine Zeile in der eigenen robots.txt. Ausgeschlossene Domains werden übersprungen, bevor eine Anfrage gestellt wird.

Das Radar auf GitHub ansehen

Reden wir Klartext

Fragen zur Messung?

Schreib uns — zur Methode, zu einer einzelnen Zahl, oder wenn deine Domain nicht gemessen werden soll.

  • Antwort in der Regel binnen 24 Stunden
  • Austragung ohne Rückfragen
  • Verfahren vollständig offengelegt

Unverbindlich · Ehrlich · Kein Bot