Diese fünf Fälle kommen aus der Testsammlung des Zahlenfilters, der im Analysemodus über jede Antwort läuft. Sie sind keine Illustrationen. Sie sind die Fälle, gegen die der Code getestet wird, und sie sind die klarste Beschreibung dessen, was der Filter tut, die wir geben können.
Jeder Fall zeigt den Satz, den das Modell geschrieben hat, und den Satz, den die Leserin sehen darf.
Fall 1: eine gerundete Zahl
Das Modell schrieb: Etwa 800.000 DKK über 4 Benutzer.
Sie sehen: Etwa … DKK über … Benutzer.
Die Buchhaltung gab 812.400 über 3 Benutzer zurück. Keine der beiden Zahlen im Satz kommt in den Zeilen vor, also überlebt keine von beiden.
Dieser Fall ist der Grund, warum es den Filter gibt. Der Satz ist keine Lüge. Er ist eine Zusammenfassung, und er ist die Art Zusammenfassung, die ein hilfsbereiter Assistent schreibt. Er liegt außerdem bei der Benutzerzahl falsch, und niemand, der ihn liest, würde das nachprüfen. Eine Zahl, die gerundet, geglättet oder falsch erinnert wurde, ist nicht die Zahl, die zurückkam.
Fall 2: eine belegte Zahl
Das Modell schrieb: Der Umsatz betrug 812.400 DKK, ein Anteil von 12,3 % an 3.901 Zeilen.
Sie sehen: Der Umsatz betrug 812.400 DKK, ein Anteil von 12,3 % an 3.901 Zeilen.
Jede Zahl kommt in den Zeilen vor, die die Abfrage zurückgegeben hat, in einem der Formate, in denen diese Zeilen geschrieben werden können. Der Satz geht unverändert durch.
Zahlenformate unterscheiden sich zwischen Deutsch, Dänisch, Englisch und Spanisch. Ein Filter, der nur eines davon erkennt, entfernt richtige Zahlen, und das erzieht die Leute dazu, die Entfernung zu übersehen. Der Umgang mit Formaten ist hier keine Kleinigkeit. Er ist der Unterschied zwischen einem Filter, dem Menschen vertrauen, und einem Filter, über den sie zu lesen lernen.
Fall 3: eine Zahl, die das Modell selbst geschrieben hat
Das Modell schrieb: Die Bildunterschrift sagte 777 und der Vorschlag 555.
Sie sehen: Die Bildunterschrift sagte … und der Vorschlag ….
Das ist der unauffällige Fall. Die Bildunterschrift über dem Block wurde vom Modell geschrieben, und das Modell hat dann seine eigene Bildunterschrift als Nachweis für die Zahl in seiner Prosa zitiert.
Text, den das Modell selbst geschrieben hat, ist kein Nachweis. Wäre er es, könnte jedes Modell jede Zahl belegen, indem es sie zweimal schreibt. Nur Zeilen, die ein Werkzeug zurückgegeben hat, und Werte, die das Modell als Werkzeugeingaben gesendet hat, können eine Zahl belegen.
Fall 4: ein Hinweis mit erfundenen Anzahlen
Das Modell schrieb: Nur 500 von 3.901 Zeilen stehen in dieser Datei. Der Export ist unvollständig.
Sie sehen: Nur … von … Zeilen stehen in dieser Datei. Der Export ist unvollständig.
Die Warnung ist richtig und wichtig. Die Anzahlen wurden in diesem Zug von keinem Werkzeug zurückgegeben, also überleben sie nicht.
Dieser Fall sieht hart aus, und das ist Absicht. Eine Warnung, die erfundene Zahlen trägt, ist schlimmer als eine Warnung ohne Zahlen, denn die Leserin handelt nach der Größe des Problems. Der Satz behält seine Bedeutung. Die Leserin erfährt, dass der Export unvollständig ist, und muss nachfragen, um wie viel.
Fall 5: Text, der Zahlen enthält, aber keine Zahlenwerte
Das Modell schrieb: Letzte 7 Tage (3. September – 10. September 2026), nach 14:30, Ticket #3, Projekt PR0017.
Sie sehen: Letzte 7 Tage (3. September – 10. September 2026), nach 14:30, Ticket #3, Projekt PR0017.
Nichts hiervon ist eine Zahl im Sinne des Filters. Datumsangaben, Jahre,
Uhrzeiten, Wochennummern, Quartale, Listenmarkierungen und Bezeichner sind
ausgenommen, auf Deutsch, Englisch, Dänisch und Spanisch. P7D ist eine Dauer
nach ISO 8601 und ist erlaubt.
Ein Filter, der ein Datum entfernt, ist nicht streng. Er ist kaputt, und er macht jede Antwort unlesbar.
Was die fünf Fälle gemeinsam haben
| Fall | Überlebt? | Regel |
|---|---|---|
| Aufgerundet | Nein | Eine Zahl muss in den zurückgegebenen Zeilen vorkommen |
| Belegt | Ja | Jedes Format, in dem diese Zeilen geschrieben werden können |
| Eigene Bildunterschrift | Nein | Text des Modells ist kein Nachweis |
| Hinweis mit Anzahlen | Teils | Der Satz überlebt, die erfundenen Anzahlen nicht |
| Daten und Bezeichner | Ja | Das sind in keiner Sprache Zahlenwerte |
Die Anzahl der Ersetzungen reist mit der Nachricht mit. Sie können sehen, dass ein Satz geändert wurde und wie oft.
Warum die Testfälle veröffentlichen?
Weil die Behauptung nur dann überprüfbar ist, wenn die Fälle öffentlich sind.
Jeder Anbieter kann sagen, dass sein Assistent keine Zahlen erfindet. Die nützliche Fassung dieser Behauptung ist eine Liste von Sätzen, die das System ablehnt, einschließlich derer, bei denen die Ablehnung etwas kostet. Fall 4 kostet etwas. Genau darum veröffentlichen wir ihn.
Wenn Sie Assistenten bewerten, nehmen Sie diese fünf Sätze mit zum Anbieter und fragen Sie, was ihr System mit jedem einzelnen tut. Die Antworten werden sich stärker unterscheiden als die Marketingseiten.
Fragen und Antworten
- Was passiert mit einer Zahl, die keine Abfrage zurückgegeben hat?
- Die Plattform ersetzt die Zahl durch Auslassungspunkte und zählt die Ersetzung. Der Satz um die Zahl herum bleibt, eine Warnung überlebt also auch dann, wenn ihre Anzahlen es nicht tun.
- Kann eine Bildunterschrift, die das Modell geschrieben hat, eine Zahl belegen?
- Nein. Text, den das Modell selbst geschrieben hat, ist kein Nachweis. Eine Zahl, die das Modell in eine Bildunterschrift geschrieben hat, kann dieselbe Zahl in seiner Prosa nicht belegen.
- Wo findet die Prüfung statt?
- Die Prüfung findet auf dem Server statt, bevor der Text gestreamt und bevor er gespeichert wird. Ein geprüfter Text erreicht jeden Client, die Datenbank und die eigene Historie des Modells.
Quellen
Wir prüfen jede externe Aussage zum angezeigten Datum. Microsoft verschiebt Funktionszustände zwischen Release-Wellen, prüfen Sie die Seite also noch einmal, bevor Sie sich darauf verlassen.
- 01FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim VerificationarXiv · Quellen geprüft 2026-09-17
- 02FAITH: A Framework for Assessing Intrinsic Tabular Hallucinations in FinancearXiv · Quellen geprüft 2026-09-17