Das tragende Vokabular von Claude: 47.464 GitHub PRs zeigen, dass fast die Hälfte des „menschlichen“ Codes von Claude stammt.

31. August 2026, 06:05

Der Entwickler Louis Abraham führte eine KL-Divergenz‑K‑Means‑Clustering‑Analyse auf dem Vokabular von 47.464 GitHub‑Pull‑Request‑Beschreibungen durch. Acht Cluster entstanden. Einer davon existierte im Jahr 2025 nicht. Im letzten Monat deckte er 45 % der PRs ab, die Menschen zugeschrieben wurden. Mit anderen Worten: Fast die Hälfte der „menschlich verfassten“ PRs wurde von Claude geschrieben oder stark überarbeitet.

„Load-bearing“ ist das Erkennungszeichen

Das Wort „load-bearing“ erscheint 929 Mal innerhalb dieses Clusters und nur 82 Mal außerhalb – ein 39‑facher Unterschied, was es zum klarsten Shibboleth für Claudes Präsenz macht. Weitere Hinweise: „quietly“, „latent“, „genuine“, „seam“. Die Wendung: „delve“, das Lieblingswort der Internet‑Community zur KI‑Erkennung, war nie ein Claude‑Merkmal. Dieses Wort gehört zu ChatGPT.

Was es tatsächlich ist

Dies ist ein Datenanalyse‑Projekt, das sich in ein interaktives Wörterbuch von Claude‑Sprache verwandelt hat: Wort auswählen, Frequenzkurve sehen und echte PR‑Beispiele ansehen. Kein Modell, keine API – nur Clustering‑Mathematik auf öffentlichen GitHub‑Daten. Genau deshalb explodierte es: 694 Punkte und 326 Kommentare auf Hacker News, aufgegriffen von Daring Fireball und BoingBoing. Niemand hatte eine Zahl dafür, wie viel Claude Open‑Source‑Code ghost‑writes. Jetzt gibt es eine, und sie beträgt 45 %.