Sie setzen KI in der Kanzlei oder im Unternehmen ein und haben einen Fehler korrigiert. Damit ist er nicht automatisch weg. OpenAI hat am 29.04.2026 im Goblin-Fall offengelegt, wie ein unbeabsichtigtes Belohnungssignal im Training ein Sprachmuster erzeugte, das die eigene Korrektur überdauerte. Der Vorbehalt vorweg: Das ist ein Fall aus der Modellentwicklung, keine Aussage über juristische Anwendungen. Die Übertragung auf die Kanzlei ist unsere eigene Einschätzung aus der Praxis.
Aus unserer Sicht: Eine einmal falsch gespeicherte Rechtsauffassung bleibt drin, bis jemand sie aktiv herausholt.
Die vier Kernaussagen dieses Beitrags:
- Eine einmal belohnte Fehlannahme kann in die nächste Modellgeneration wandern, auch wenn die Ursache schon bekannt ist.
- Eine Korrektur an der Ursache erreicht das bereits ausgelieferte Verhalten nicht zwingend.
- Ein belohntes Verhalten bleibt nicht sicher auf den Kontext beschränkt, in dem es entstanden ist.
- In Steuersachen ersetzt Plausibilität die Primärquelle nicht. § 150 Abs. 2 AO verlangt wahrheitsgemäße Angaben nach bestem Wissen und Gewissen und unterscheidet nicht danach, ob sie mit oder ohne Softwareunterstützung zustande gekommen sind.
Was im Goblin-Fall bei OpenAI passiert ist
Ein Belohnungssignal im Training hat ein Sprachmuster verstärkt, das niemand beabsichtigt hatte. Ab GPT-5.1 erwähnten OpenAIs Modelle in Metaphern auffällig häufig Goblins, Gremlins und ähnliche Kreaturen. Gemessen wurde für „goblin" ein Anstieg von 175 Prozent, für „gremlin" einer von 52 Prozent. Damals galt das als nicht alarmierend. Erst bei GPT-5.4 fiel der Anstieg deutlich stärker aus, und die zweite interne Analyse führte zur Grundursache.
Die Ursache lag im Training der Persönlichkeitsanpassung, konkret in der Persönlichkeit „Nerdig". OpenAI beschreibt es im eigenen Wortlaut so:
„Unbewusst vergaben wir besonders hohe Belohnungen für Metaphern mit Kreaturen. Von dort aus breiteten sich die Goblins aus." (OpenAI, 29.04.2026, deutsche Fassung, abgerufen 18.08.2026)
Niemand hatte diese Regel geschrieben, sie entstand als Nebenwirkung einer Optimierung auf verspielten Stil.
Warum der Fehler durch keine Prüfung fiel
Weil er in keiner Kennzahl auftauchte. Nach OpenAIs Darstellung zeigte sich das Verhalten weder durch eine gescheiterte Evaluierung noch durch eine sprunghafte Trainingsmetrik, es „schlich sich unauffällig ein".
Auslöser der Untersuchung waren Beschwerden über einen merkwürdig zu vertraulichen Ton, nicht die Kreaturen selbst. Ein einzelner Goblin in einer Antwort kann harmlos sein, über mehrere Modellgenerationen hinweg war die Angewohnheit kaum zu übersehen.
Unsere Einschätzung: Ein Fehler, der keine Kennzahl reißt, wird eher zufällig entdeckt als durch die laufende Kontrolle.
Der Übertragungsbefund: gelernt in einem Kontext, wirksam auch außerhalb
Ein Muster, das nur unter einer bestimmten Bedingung belohnt wurde, trat danach auch ohne diese Bedingung auf.
Die Bündelung war eindeutig messbar. Die Persönlichkeit „Nerdig" machte 2,5 Prozent aller ChatGPT-Antworten aus, aber 66,7 Prozent aller Erwähnungen von „goblin". Ein breiter Internettrend hätte sich gleichmäßig verteilt. Ein werkzeuggestütztes Audit verglich Ausgaben mit und ohne Kreaturenwörter zur selben Aufgabe. In 76,2 Prozent der Datensätze bewertete das Belohnungssignal der Persönlichkeit „Nerdig" die Ausgaben mit Kreaturenwörtern höher.
Erklärt war damit die Häufung unter der Persönlichkeit, nicht das Auftreten ohne sie. In Stichproben ohne die Persönlichkeit stiegen die Erwähnungen um nahezu denselben relativen Anteil. OpenAI zieht daraus den Schluss:
„Die Belohnungen wurden nur unter der Bedingung ‚Nerdig' angewendet, doch Reinforcement Learning garantiert nicht, dass gelernte Verhaltensweisen sauber auf die Bedingung beschränkt bleiben, die sie hervorgebracht hat." (OpenAI, 29.04.2026, deutsche Fassung, abgerufen 18.08.2026)
Dazu kommt eine Rückkopplung, die OpenAI in fünf Schritten beschreibt:
- Ein verspielter Stil wird belohnt.
- Einige der belohnten Beispiele enthalten einen markanten sprachlichen Tick.
- Der Tick erscheint häufiger in den erzeugten Ausgaben.
- Diese Ausgaben werden für überwachtes Fine-Tuning verwendet.
- Das Modell wird noch geübter darin, den Tick zu erzeugen.
Nach unserer Lesart ist Schritt 4 die Stelle, an der aus einer Marotte ein Bestandteil wird.
Warum der Fehler das Modell überlebt hat
Weil das Training der nächsten Generation schon lief, bevor die Ursache bekannt war. Die Persönlichkeit „Nerdig" wurde Mitte März eingestellt. Danach wurde das goblin-affine Belohnungssignal entfernt und die Trainingsdaten mit Kreaturenwörtern wurden gefiltert.
Trotzdem trug GPT-5.5 den Tick weiter. Diese Generation wurde nie mit „Nerdig" ausgeliefert und zeigte gegenüber GPT-5.4 noch einen weiteren Anstieg. OpenAI nennt den Grund: Das Training von GPT-5.5 hatte begonnen, bevor die Grundursache gefunden war. Abgeschwächt wurde die Vorliebe dort nicht im Modell, sondern beim Einsatz in Codex über eine Anweisung im Developer-Prompt, also in der Systemvorgabe der Anwendung.
Die Erkenntnis über eine Ursache heilt ein bereits trainiertes Muster nicht. Sie sorgt nur dafür, dass ab einem bestimmten Zeitpunkt anders trainiert wird.
Was das für den Einsatz von KI in Steuersachen bedeutet
Es bedeutet, dass eine Korrektur an der Ursache nicht genügt. Wer KI in Steuersachen einsetzt, braucht zusätzlich eine Kontrolle am Ergebnis, geklärte Schreibrechte und eine dokumentierte Gegenprüfung.
Belegt ist damit zunächst nichts über juristische Anwendungen. OpenAI trifft dazu keine Aussage, und der Fall betrifft ein Sprachmuster, keine Rechtsauffassung. Wer daraus ableitet, ein bestimmtes juristisches KI-Produkt sei fehlerhaft, geht über die Quelle hinaus.
Als Analogie halten wir drei Punkte für übertragbar, das ist unsere eigene Einschätzung und nicht die der Quelle.
- Oft ist der sichtbare Fehler der harmlosere. Ein Goblin fällt in der Regel sofort auf, eine fachliche Schlagseite niemandem.
- Der Fehler überlebt die Erkenntnis. Wer bemerkt, dass eine hinterlegte Auffassung falsch ist, hat sie damit noch nicht entfernt.
- Was in einem Kontext belohnt wird, bleibt nicht sicher dort. Eine Vorgabe für einen Bereich kann an anderer Stelle weiterwirken.
Warum die unauffällige Verzerrung teurer ist als der offensichtliche Fehler
Weil sie in der Regel niemandem auffällt und deshalb selten nachgeprüft wird, während gerade an ihr die Rechtsfolgen hängen. Eine Antwort, die sich in Richtung der Hausmeinung neigt, liest sich wie ein Ergebnis.
Im Steuerstrafrecht geht es dabei um die Abgrenzung von Vorsatz und Irrtum, um die Wirksamkeit einer Selbstanzeige und um die Höhe einer Schätzung. Wie schmal der Grat zwischen Fehler und Straftat ist, zeigt der Beitrag zu Vorsatz bei der Steuerhinterziehung und der Abgrenzung zum Irrtum, wie wenig Spielraum bei einer Berichtigung bleibt der Überblick zum Ablauf einer Selbstanzeige beim Finanzamt.
Die Verantwortung bleibt dabei beim Menschen. Nach § 150 Abs. 2 AO sind die Angaben in den Steuererklärungen wahrheitsgemäß nach bestem Wissen und Gewissen zu machen. Der Wortlaut unterscheidet nicht danach, ob die Angaben mit oder ohne Softwareunterstützung zustande gekommen sind. Wen die Abgabepflicht trifft, regelt er nicht, das ergibt sich aus § 149 AO und den Einzelsteuergesetzen. Nach unserer Einschätzung spricht beides dafür, dass der Einsatz eines Programms den Erklärungspflichtigen nicht ohne Weiteres entlastet.
Ob ein falscher Wert Folgen hat, hängt zunächst davon ab, ob dadurch Steuern verkürzt oder nicht gerechtfertigte Steuervorteile erlangt werden. Erst danach entscheidet das Verschulden darüber, ob es bei einer Ordnungswidrigkeit bleibt oder eine Steuerhinterziehung in Betracht kommt. Den Tatbestand der leichtfertigen Steuerverkürzung stellt § 378 Abs. 1 AO auf, und er trifft nicht nur den Steuerpflichtigen, sondern auch denjenigen, der dessen Angelegenheiten wahrnimmt. Die Rechtsfolge steht im Absatz darauf: § 378 Abs. 2 AO setzt für die Geldbuße ein Höchstmaß von 50.000 Euro. Vorsatz führt dagegen ins Strafrecht, § 370 Abs. 1 AO droht Geldstrafe oder Freiheitsstrafe bis zu fünf Jahren an, im besonders schweren Fall hebt § 370 Abs. 3 AO den Rahmen auf sechs Monate bis zehn Jahre. Vertieft ist die Abgrenzung im Beitrag zur Haftung für Fehler in einer KI-Steuererklärung.
Wer darf einem KI-System beibringen, was gilt?
Die Person, die den Inhalt auch berufsrechtlich verantwortet. Schreibende Rechte am Wissensbestand eines Systems sind kein IT-Detail, sondern eine fachliche Zuständigkeit. Diese Frage sollte beantwortet sein, bevor das erste System produktiv läuft.
Schritt 4 der Rückkopplungsschleife ist das Argument dafür. Sobald bestätigte Ausgaben zur Grundlage des nächsten Lernschritts oder eines dauerhaften Gedächtnisses werden, verstärkt sich ein Fehler selbst. Wer einem System bestätigt „so sehen wir das", setzt damit keinen Vermerk, sondern eine Weiche.
Für Kanzleien kommt eine zweite Ebene hinzu. Wer Mandatsinhalte in ein System einspeist, berührt die anwaltliche Verschwiegenheitspflicht nach § 43a Abs. 2 BRAO. Sie bezieht sich nach Satz 2 auf alles, was dem Rechtsanwalt in Ausübung seines Berufes bekanntgeworden ist. Satz 3 nimmt davon Tatsachen aus, die offenkundig sind oder ihrer Bedeutung nach keiner Geheimhaltung bedürfen.
Was wir aus dem Fall für die eigene Arbeit ziehen
Wir ziehen daraus vier Konsequenzen.
- Gegenprüfung durch jemanden, der die Lieblingsargumente des Hauses nicht kennt. Wer die Hausmeinung teilt, erkennt eine Neigung zur Hausmeinung typischerweise nicht als Fehler.
- Primärquelle statt Plausibilität. Ein Ergebnis, das gut klingt, ist damit nicht belegt. Die Norm im Wortlaut und die Entscheidung im Volltext ersetzen die Einschätzung eines Systems.
- Schreibrechte klären und protokollieren. Wer hat wann was als dauerhaft geltend hinterlegt? Ohne diese Aufzeichnung lässt sich eine falsche Auffassung später nicht gezielt herausnehmen.
- Die Korrektur am Ergebnis messen, nicht an der Ursache. Eine Korrektur, die nur im Protokoll steht, ist damit noch nicht wirksam.
Ein einmal erkannter Fehler sei damit erledigt, diese Annahme begegnet uns häufig. Der Goblin-Fall ist das Gegenbeispiel aus einem Haus mit weit mehr Messmöglichkeiten als jede Kanzlei.
Häufige Fragen
Kurz gesagt: Der Goblin-Fall zeigt ein Trainingsmuster und keine Untauglichkeit juristischer KI, verlangt aber eine Kontrolle am Ergebnis.
Bedeutet der Goblin-Fall, dass juristische KI unbrauchbar ist?
Nein. Er zeigt ein Trainingsmuster in einem allgemeinen Sprachmodell und nicht die Untauglichkeit juristischer KI. Er belegt aber, dass ein antrainiertes Muster eine Korrektur an der Ursache überdauern kann. Wer KI einsetzt, sollte deshalb die Kontrolle des Ergebnisses genauso einplanen wie die Erzeugung.
Ist das dasselbe wie eine Halluzination?
Nein. Bei einer Halluzination erfindet ein Modell einen Fakt. Hier liegt die Ursache in einer Belohnung im Training, die ein bestimmtes Verhalten verstärkt hat. Das Ergebnis kann sachlich richtig sein und trotzdem eine Schlagseite tragen, die niemand beabsichtigt hat.
Worin unterscheidet sich das von einem KI-Gedächtnis, das die Position des Nutzers übernimmt?
Im Mechanismus. Beim Gedächtnis wirkt die gespeicherte Position des Nutzers auf die Antwort, hier wirkt ein Belohnungssignal aus dem Training, das den einzelnen Nutzer gar nicht kennt. Die Folge ähnelt sich, nämlich eine Antwort, die sich richtig anfühlt und es nicht sein muss.
Wer trägt das Risiko, wenn eine KI-gestützte Steuererklärung falsch ist?
In erster Linie der Erklärungspflichtige. Nach § 150 Abs. 2 AO sind die Angaben in den Steuererklärungen wahrheitsgemäß nach bestem Wissen und Gewissen zu machen, und der Wortlaut unterscheidet nicht danach, ob sie mit oder ohne Softwareunterstützung zustande gekommen sind. Wen die Abgabepflicht trifft, ergibt sich aus § 149 AO und den Einzelsteuergesetzen. Nach unserer Einschätzung spricht beides dafür, dass der Einsatz eines Programms den Erklärungspflichtigen nicht ohne Weiteres entlastet. Wer die Angelegenheiten eines Steuerpflichtigen wahrnimmt, hat daneben ein eigenes Risiko, § 378 Abs. 1 AO erfasst ihn ausdrücklich. Ob ein falscher Wert Folgen hat, hängt zunächst davon ab, ob dadurch Steuern verkürzt oder nicht gerechtfertigte Steuervorteile erlangt werden. Erst danach entscheidet das Verschulden über die Ebene: bei Leichtfertigkeit die Ordnungswidrigkeit nach § 378 Abs. 1 AO, für die § 378 Abs. 2 AO ein Höchstmaß der Geldbuße von 50.000 Euro setzt, bei Vorsatz der Straftatbestand des § 370 Abs. 1 AO.
Reicht es, einen erkannten KI-Fehler einmal zu korrigieren?
Nach unserer Einschätzung nicht ohne anschließende Kontrolle. Der Goblin-Fall zeigt, dass eine Korrektur an der Ursache das bereits ausgelieferte Verhalten nicht zwingend erreicht. Prüfen Sie deshalb am Ergebnis, ob die Korrektur wirkt, und halten Sie fest, wann Sie das geprüft haben.
Ihre nächsten Schritte
Der nächste Schritt ist eine Bestandsaufnahme Ihres KI-Einsatzes. Sind Erklärungen oder Anmeldungen betroffen, ordnen wir ein, ob eine Berichtigung oder eine Selbstanzeige der richtige Weg ist. Melden Sie sich unter 089 273 740 110 oder schildern Sie uns Ihre Lage über das Kontaktformular auf dieser Seite. Einen Überblick über unsere Arbeit finden Sie unter Steuerstrafrecht.
Ihr Experte für Fragen zum Thema:
Maximilian Krämer LL.M.
Rechtsanwalt, Partner, Fachanwalt für Steuerrecht, Zertifizierter Berater im Steuerstrafrecht, Strafverteidiger
T
+49 89 273 740 110
M
+49 170 68 29 712
E
maximilian.kraemer@dnk-rechtsanwaelte.de
Erscheinungsdatum:
Trotz sorgfältiger Datenzusammenstellung können wir keine Gewähr für die vollständige Richtigkeit der dargestellten Informationen übernehmen. Bei weiteren Fragen stehen wir Ihnen im Rahmen unserer Berufsberechtigung jederzeit gerne für eine persönliche Beratung zur Verfügung.