Ein Sprachmodell, das Ihre Zahlen hält, kann sie ändern. Es tut das nicht oft, und genau das ist das Problem. Ein System, das in einer von fünfzig Antworten falsch liegt, ist schwerer zu erwischen als ein System, das jedes Mal falsch liegt.
Die Antwort darauf ist kein besseres Modell. Die Antwort ist, das Modell von den Werten fernzuhalten. Diese Seite beschreibt, wie das funktioniert.
Wie kann ein Assistent mit Daten antworten, die er nicht sehen kann?
Der Assistent schreibt die Abfrage. Er schreibt nicht das Ergebnis.
- Sie stellen eine Frage in normaler Sprache.
- Der Assistent schreibt eine Abfrage: eine Tabelle, einen Satz Filter, eine Kennzahl.
- Die Plattform führt diese Abfrage gegen Ihr System aus, über Ihre eigene Verbindung.
- Die Plattform stellt die Zeilen, die sie erhalten hat, als Block dar: eine Tabelle, einen Wert, ein Diagramm oder einen Satz Kennzahlen.
- Die Plattform sagt dem Assistenten, dass ein Block erschienen ist, mit seinem Typ, seinen Spaltennamen und seiner Zeilenanzahl. Sie sendet die Werte nicht.
- Der Assistent schreibt den Satz um den Block herum.
Die Zahlen, die Sie lesen, kamen aus Ihrer Datenbank und haben nichts durchlaufen, das sie ändern könnte. Der Assistent hat gewählt, wonach er fragt und wie er es beschreibt. Die Antwort hat er nie gehalten.
Das hat einen zweiten Nutzen, der über ein Jahr hinweg mehr zählt als über eine Woche. Die Abfrage ist ein dauerhaftes Objekt. Dieselbe Abfrage, die in einer Unterhaltung eine Frage beantwortet hat, wird der Bericht, den Sie jeden Monat öffnen, und die Definition, auf die sich Ihr Unternehmen einigt. Nichts wird dazwischen neu getippt.
Und der Satz um den Block herum?
Der Assistent schreibt weiterhin Prosa. Er sagt, was er gefiltert hat, was ihm aufgefallen ist und was er als Nächstes prüfen würde. Diese Prosa ist die eine Stelle, an der eine Zahl auftauchen kann, ohne aus einer Abfrage zu kommen.
Also wird auch die Prosa geprüft. Bevor der Text eine Nachricht wird, wird jede Zahl darin mit dem verglichen, was die Werkzeuge im selben Zug zurückgegeben haben. Eine Zahl überlebt, wenn sie eine von drei Prüfungen besteht:
- Sie ist ein Zahlenwert in einem Werkzeugergebnis aus diesem Zug.
- Sie ist eine Zahl, die der Assistent als Werkzeugeingabe gesendet hat, etwa ein Filterwert.
- Sie ist eine Dauer in ISO-8601-Form, etwa
P7D.
Alles andere wird durch Auslassungspunkte ersetzt, und die Ersetzung wird gezählt. Der Satz überlebt. Die erfundene Zahl nicht.
Was ist keine Zahl?
Eine Prüfung, die jede Zahl als Behauptung behandelt, macht den Text unlesbar.
Datumsangaben sind Zahlen. Quartale auch, Wochennummern und die #3 in einer
Ticketreferenz.
Diese werden nie als Zahlenwerte behandelt:
- Datumsangaben, in Ziffern und ausgeschrieben, auf Deutsch, Englisch, Dänisch und Spanisch
- Jahre, Uhrzeiten, Wochennummern und Quartale
- Listenmarkierungen, auch Markierungen in fettem Text oder in einer Überschrift
- Bezeichner wie
#3oderPR0017
Ein System, das das Datum in „3. September 2026“ entfernt, ist kein Prüfsystem. Es ist ein Fehler.
Warum auf dem Server prüfen?
Weil es mehr als eine Leserin gibt.
Der Text erreicht einen Web-Client, eine Desktop-Anwendung, eine mobile Anwendung und eine Browsererweiterung. Er wird in einer Datenbank gespeichert. Er wird im nächsten Zug als Historie an das Modell zurückgesendet. Läuft die Prüfung im Client, unterscheidet sich jede dieser Kopien, und die eigene Historie des Modells enthält Zahlen, die die Leserin nie gesehen hat.
Die Prüfung läuft deshalb auf dem Server, einmal, bevor der Text gestreamt und bevor er gespeichert wird. Ein geprüfter Text erreicht jedes Ziel.
Was kostet das?
Zwei Dinge, und es ist fair, sie zu nennen.
Sie sehen manchmal Auslassungspunkte. Rundet der Assistent eine Zahl, besteht die gerundete Zahl die Prüfung nicht und wird entfernt. „Etwa 800.000 DKK über 4 Benutzer“ wird zu „Etwa … DKK über … Benutzer“, wenn die Buchhaltung 812.400 über 3 Benutzer sagte. Die erste Fassung liest sich besser. Die zweite ist ehrlich.
Ein Hinweis kann seine Anzahlen verlieren. „Nur 500 von 3.901 Zeilen stehen in dieser Datei“ behält seine Warnung und verliert seine Zahlen, wenn diese Anzahlen nicht zurückgegeben wurden. Das ist der richtige Tausch. Eine Warnung mit erfundenen Zahlen sind zwei Fehler, nicht einer.
Was es nicht löst
Die Prüfung prüft, dass eine Zahl aus einer Zeile kam. Sie prüft nicht, dass die Zeile Ihre Frage beantwortet.
Eine vollkommen belegte Zahl kann trotzdem die falsche Zahl sein, weil die Abfrage auf das falsche Datumsfeld gefiltert hat, oder weil „Umsatz“ in der Abfrage nicht „Umsatz“ in Ihrem Unternehmen ist. Dieses Problem braucht einen anderen Mechanismus: eine gemeinsame Definition jedes Geschäftsbegriffs und einen Assistenten, der fragt, wenn eine Lesart nicht geklärt ist.
Das sind zwei weitere Teile derselben Konstruktion. Die Prüfung ist der Boden, nicht die Decke. Sie beseitigt eine ganze Fehlerklasse, und das ist es wert, und sie lässt den Rest der Arbeit sichtbar statt verborgen.
Fragen und Antworten
- Wie kann eine KI mit Daten antworten, die sie nicht sehen kann?
- Das Modell schreibt eine Abfrage. Die Plattform führt die Abfrage aus, stellt die Zeilen als Block dar und sagt dem Modell nur, dass eine Tabelle mit einer bestimmten Anzahl von Spalten und Zeilen erschienen ist. Die Leserin sieht Zeilen aus der Datenbank.
- Was ist eine belegte Zahl?
- Eine belegte Zahl ist ein Wert, der in den Zeilen vorkommt, die eine Abfrage im selben Zug zurückgegeben hat, oder ein Wert, den das Modell als Werkzeugeingabe gesendet hat. Eine Zahl, die keine der beiden Prüfungen besteht, ist nicht belegt.
- Werden Datumsangaben als Zahlen behandelt?
- Nein. Datumsangaben, Jahre, Uhrzeiten, Wochennummern, Quartale, Listenmarkierungen und Bezeichner sind keine Zahlenwerte. Sie sind von der Prüfung ausgenommen, auf Deutsch, Englisch, Dänisch und Spanisch.
Quellen
Wir prüfen jede externe Aussage zum angezeigten Datum. Microsoft verschiebt Funktionszustände zwischen Release-Wellen, prüfen Sie die Seite also noch einmal, bevor Sie sich darauf verlassen.
- 01FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim VerificationarXiv · Quellen geprüft 2026-09-17
- 02FAITH: A Framework for Assessing Intrinsic Tabular Hallucinations in FinancearXiv · Quellen geprüft 2026-09-17