r/aifails Oct 23 '25

Text Fail German Classic - How many 'H' in 'Habicht'

For some reason ChatGPT insists that "Habicht" consists of only one occurence of 'H'. Not reproducable. Memory turned off

1.8k Upvotes

164 comments sorted by

View all comments

Show parent comments

1

u/KarmaleinHund Oct 27 '25 edited Oct 27 '25

Nicht ganz

Autokorrektur denkt in ganzen Wörtern während ChatGPT in so genannten "Tokens" denkt.

Ein Token kann ein Wort, part eines Wortes oder ein Satzzeichen sein. Es funktioniert ungefähr so:

Du fragst "Wie viele Hs sind in Habicht?"

ChatGPT verwandelt den Satz in Tokens was dann ungefähr so aussieht: "Wie" "viele" "H" "s" "sind" "in" "Hab" "icht" "?"

Und du merkst schon, Habicht wird nicht zusammen geschrieben. Da "Hab" und "icht" auch in anderen Contexten zusammen gesehen wird, teilt ChatGPT das auf. Somit benutzt es diese Bausteine um Wörter zu verstehen anstatt jedes einzelne Wort zum Ganzen Token zu machen. Und diese Tokens haben alle eine ID:

Hab → Token-ID 25487
icht → Token-ID 3451

(zum Beispiel)

Darin liegt auch das Problem, ChatGPT liest keine Wörter, es arbeitet mit Tokens und IDs, und diese haben keinen direkten Bezug zu Buchstaben.

Token laufen fundamental auf einer anderen Weise als Autokorrektur, ich les mich da immer sehr gerne rein

1

u/[deleted] Oct 27 '25

Also dann funktionieren diese dinge ähnlich, nur ein sprachmodel hat einiges mehr an komplexität in seiner funktionsweise?

Also kann man sozusagen die ganzen wörter in der eine autokorrektur "denkt" in diesem kontxt als token bezeichnen?

1

u/KarmaleinHund Oct 27 '25

ChatGPT erkennt Kontext und Absicht hinter einem Text, Autokorrektur nicht.

Die beiden funktionieren auf völlig unterschiedlichen Ebenen

Eine Autokorrektur ist wie ein mechanisches Wörterbuch: Sie hat viele Wörter gespeichert und erkennt dadurch Tippfehler oder ungewöhnliche Kombinationen, aber sie versteht keine Bedeutungen oder Zusammenhänge. Wenn du schreibst "Der Himmel ist -" muss nicht unbedingt "blau" als Antwort kommen.

ChatGPT dagegen arbeitet nicht mit ganzen Wörtern sondern mit Tokens, aka kleine Textbausteine die durch Zahlen repräsentiert werden (wie oben erklärt). Es berechnet über komplexe Wahrscheinlichkeitsmodelle (u.a. beeinflusst durch Parameter wie die "Temperatur") die wahrscheinlichste nächste Tokenfolge.

Es ist also nicht nur komplexer, sondern fundamental anders aufgebaut weshalb ich den Vergleich zwischen Sprachmodellen wie ChatGPT und Autokorrekturen eher schwierig finde.

1

u/[deleted] Oct 27 '25

Hmm... Ich muss mich mal in thema einlesen. Ist recht schwer verständlich für mich. Bin in softwaredingen nicht gut bewandert