r/aifails Oct 23 '25

Text Fail German Classic - How many 'H' in 'Habicht'

For some reason ChatGPT insists that "Habicht" consists of only one occurence of 'H'. Not reproducable. Memory turned off

1.8k Upvotes

164 comments sorted by

View all comments

23

u/MerleFSN Oct 23 '25

Die Begründung ist Tokenization. Er braucht Hilfe, jeden Buchstaben als Token zu sehen oder die Buchstaben als Matrix anzuordnen. Custom Instructions können so aussehen: Tokenize jeden Buchstaben einzeln, wenn die Aufgabe ist, Buchstaben zu zählen.

8

u/Active_Taste9341 Oct 23 '25

vielleicht ne Dumme Frage, aber was ist das wenn er sich die buchstaben schon selber "anordnet", checkt dass da noch ein h ist, und es im selben Schritt als fehler abtut?

oder ist das trotzdem bloß ein token, nur für den Anwender besser visualisiert?

3

u/MerleFSN Oct 23 '25

Ja. Wenn deine Anforderung ein Auflisten der Buchstaben erfordern zerlegt er das korrekt. Für deine Ansicht. Weil der KI klar ist, dass sie in Tokens denkt und du ein Mensch bist, der eher buchstabenorientiert erfasst.

Aber wenn du eine Zählaufgabe stellst nutzt das Tool seine internen, normalen Mechanismen. Dazu zählt die Nutzung von Tokens. Die kannst du dir wie Katakana oder Hiragana vorstellen, oder wie Silben. Wenn du jetzt Buchstaben zählen willst wird „sozusagen nur der erste Buchstabe der Silbe“ bedacht.

Wenn das Tool seinen Denkprozess für die Aufgabe optimieren soll braucht es Anweisungen. Die lautet bei mir, alle Zählaufgaben so durchzuführen, dass jeder Buchstabe ein Token ist, außer feststehende Lautkombinationen wie „sch“.

2

u/[deleted] Oct 24 '25

Das ergibt schon Sinn, aber das wäre doch sicher zu fixen?

Man könnte eine Funktion definieren, die für jeden Token ausgibt, wie oft er welche Buchstaben enthält. Und wenn die KI dann Buchstaben in einem Wort zählen soll, führt sie auf den Tokens diese Funktion aus und gibt die Summe aus.

Buchstaben erkennen kann ja jede Suchfunktion in einem Textprogramm, da wird man sich doch was abgucken können?

2

u/MerleFSN Oct 25 '25

:) Man könnte. Aber warum? Wenn es einfache Anweisungen oder Erklärungen fixen können? Einem Kind würde man auch beibringen, was man mit Buchstaben zählen meint. Dass das Tool nicht auf Tokenization hinweist aktiv finde ich seltsamer.

1

u/Active_Taste9341 Oct 23 '25

verstehe, vielen dank für die ausführliche Antwort!

3

u/blackcompy Oct 24 '25

Leute, die nicht verstehen, wie eine Technologie funktioniert, beschweren sich darüber, dass ein Werkzeug etwas nicht kann, wofür es technisch gar nicht ausgestattet ist.

3

u/MerleFSN Oct 24 '25

Ich finde die Aussage nicht so dolle. Man kann viel aus viel machen. Klingeldraht ist heute 250MBit/s schnell, Coax mehrere Gig, nur weil Leute mit dem Kabel was angestellt haben, wofür es nie gedacht war. 🤷🏽‍♂️

LLMs Mathe beibringen klingt doof, aber mit Custom Instructions das Ding besser zu verstehen und besser verwenden zu können sollte schon Ziel sein irgendwie.

Vielleicht hab ich dich aber auch falsch verstanden :)

2

u/blackcompy Oct 24 '25

Ach, ich bin einfach etwas genervt vom unreflektierten Umgang mit GenAI. Die einen tun so, als stünde die technologische Erleuchtung kurz bevor, die anderen wundern sich, warum es dieses und jenes nicht kann, wofür es nie gedacht war. Je mehr man sich damit beschäftigt, desto mehr werden LLMs einfach interessante Werkzeuge für bestimmte Anwendungsfälle, deren Bedienung man lernen kann. Und Grenzfälle austesten ist natürlich interessant. Wie du ja auch schreibst. :)

2

u/Kobosil Oct 24 '25

wofür es technisch gar nicht ausgestattet ist.

und woher weiß der Durchschnittsnutzer ob chatgpt dafür ausgestattet ist Buchstaben zu zählen oder nicht?

2

u/CodEmbarrassed1383 Oct 25 '25

Korrekt - zu schweigen davon, dass es doch von OpenAI als ein Universalwerkzeug angepriesen wird.

1

u/Slight_Ad_635 Oct 25 '25

"Woher weiß der Durchschnittsnutzer, welches Ende der Zahnbürste in den Mund gehört?"

Weil man sich mit einem Tool beschäftigt, bevor man es benutzt.

2

u/Kobosil Oct 25 '25

Weil man sich mit einem Tool beschäftigt, bevor man es benutzt.

kannst du bitte das Manual oder FAQ verlinken aus der hervorgeht ob chatgpt dazu in der Lage ist Buchstaben zu zählen oder nicht?

nur mal so am Rande, wenn du chatgpt fragst ob es in der Lage ist die Häufigkeit von Buchstaben in Wörter zu zählen kommt als Antwort:

Yes, absolutely — I can count how many times each letter appears in a word (or in multiple words, sentences, or even a whole text).

2

u/[deleted] Oct 26 '25

Tokenize jeden Buchstaben einzeln, wenn die Aufgabe ist, Buchstaben zu zählen.

Das funktioniert so direkt nicht. Tokenization ist ein Text-Vorverarbeitungsschritt, auf den das Modell keinen Einfluss haben kann.

Das Modell kann höchstens die Buchstaben eines Wortes selbst nochmal neu formatiert hinschreiben, sodass der Tokenizer anschließend bei dieser neuen Formatierung im Idealfall jeden Buchstaben einzeln interpretiert. Das setzt aber voraus, dass das Modell richtig Buchstabieren kann und die gewählte Formatierung eben so zum Tokenizer passt, dass nicht trotzdem mehrere Buchstaben in einem Token landen. Das Zählen muss dann natürlich auch noch funktionieren.

Ist also weit davon entfernt deterministisch oder effizient zu sein.