Liefert Ihre KI manchmal absichtlich schlechte Antworten?

Ist dir schon einmal aufgefallen, dass die Qualität deiner KI nicht immer gleich ist?
Manchmal liefert sie auf Anhieb ein Ergebnis, das fast perfekt ist. An einem anderen Tag wirkt dieselbe KI plötzlich schwer von Begriff. Sie ignoriert klare Anweisungen, wiederholt Fehler oder braucht fünf Anläufe für etwas, das gestern noch problemlos funktioniert hat.
Ich frage mich manchmal, ob Uhrzeit, Wochentag, Region und die aktuelle Auslastung der KI Systeme bei der Qualität der Antworten eine Rolle spielen?
KI kostet Geld. Und zwar nicht wenig.
Bei der API wird nach Tokens abgerechnet. Dabei sind Output-Tokens bei vielen Modellen deutlich teurer als Input-Tokens. Bei Flatrate-ähnlichen Angeboten wie ChatGPT Plus sieht der Nutzer diese Kosten dagegen nicht direkt.
Der Anbieter muss trotzdem kalkulieren, was passiert, wenn weltweit gleichzeitig besonders viele Nutzer auf die leistungsstärksten Modelle zugreifen? Wie verhindert man, dass die laufenden Kosten dauerhaft über den Einnahmen liegen?
Dass es Nutzungslimits, unterschiedliche Prioritäten und Kapazitätssteuerung gibt, ist kein Geheimnis. Auch langsamere oder günstigere Verarbeitungsstufen existieren technisch bereits.
Die spannende Frage ist daher nicht, ob Anbieter ihre Rechenleistung steuern, sondern wie stark merkt das der einzelne Nutzer?
Bei langen Chats kommt noch ein anderes Problem dazu: Jede weitere Korrektur, Ergänzung und Richtungsänderung verlängert den Kontext. Frühere Informationen können an Bedeutung verlieren, Anweisungen können sich widersprechen und wichtige Details gehen in der Masse unter.
Das ist übrigens kein Fine-Tuning.
Das Modell wird im Chat nicht neu trainiert. Es muss lediglich immer mehr bisherigen Kontext berücksichtigen. Das gelingt nicht immer zuverlässig.
Trotzdem bleibt manchmal das Gefühl: „Der stellt sich doch gerade absichtlich dumm.“
Mögliche Erklärungen gibt es mehrere:
Der Chat ist inzwischen zu lang oder widersprüchlich.
Eine Anfrage wird anders geroutet oder mit weniger Rechenaufwand bearbeitet.
Das System ist gerade stark ausgelastet.
Im Hintergrund wurde ein Modell oder dessen Konfiguration geändert.
Was ich bisher nicht belegen kann: Dass einzelne Nutzer nach besonders intensiver Nutzung heimlich schlechtere Antworten erhalten, damit sie weniger Kosten verursachen.
Technisch und wirtschaftlich völlig abwegig wäre eine Form der Priorisierung allerdings nicht.




Kommentare