Un modelo de lenguaje que tiene sus cifras puede cambiarlas. No lo hace a menudo, y ese es el problema. Un sistema que se equivoca una vez de cada cincuenta respuestas es más difícil de pillar que un sistema que se equivoca siempre.
La solución no es un modelo mejor. La solución es mantener al modelo lejos de los valores. Esta página describe cómo funciona eso.
¿Cómo puede un asistente responder con datos que no ve?
El asistente escribe la consulta. No escribe el resultado.
- Usted hace una pregunta en lenguaje corriente.
- El asistente escribe una consulta: una tabla, un conjunto de filtros, una medida.
- La plataforma ejecuta esa consulta contra su sistema, a través de su propia conexión.
- La plataforma representa las filas recibidas como un bloque: una tabla, un valor, un gráfico o un conjunto de estadísticas.
- La plataforma le dice al asistente que ha aparecido un bloque, con su tipo, los nombres de sus columnas y su número de filas. No le envía los valores.
- El asistente escribe la frase que rodea al bloque.
Las cifras que usted lee han salido de su base de datos y no han pasado por nada que pudiera cambiarlas. El asistente eligió qué pedir y cómo describirlo. Nunca tuvo la respuesta.
Esto tiene un segundo beneficio que importa más a lo largo de un año que de una semana. La consulta es un objeto duradero. La misma consulta que respondió a una pregunta en una conversación se convierte en el informe que usted abre cada mes, y en la definición que su empresa acuerda. Entre una cosa y otra no se vuelve a teclear nada.
¿Y la frase que rodea al bloque?
El asistente sigue escribiendo prosa. Dice qué ha filtrado, qué ha observado y qué comprobaría a continuación. Esa prosa es el único sitio donde puede aparecer un número sin venir de una consulta.
Así que la prosa también se comprueba. Antes de que el texto se convierta en un mensaje, cada cifra que contiene se coteja con lo que devolvieron las herramientas durante ese mismo turno. Una cifra sobrevive si supera una de estas tres pruebas:
- Es un valor numérico dentro del resultado de una herramienta de este turno.
- Es un número que el asistente envió como entrada de una herramienta, por ejemplo el valor de un filtro.
- Es una duración en formato ISO 8601, como
P7D.
Todo lo demás se sustituye por puntos suspensivos, y la sustitución se cuenta. La frase sobrevive. La cifra inventada no.
¿Qué no es una cifra?
Una verificación que trata cada número como una afirmación vuelve ilegible el
texto. Las fechas son números. También los trimestres, los números de semana y
el #3 de la referencia de un ticket.
Estas cosas nunca se tratan como cifras:
- Fechas, en forma numérica y escrita, en español, inglés, danés y alemán
- Años, horas, números de semana y trimestres
- Marcadores de lista, incluidos los que van dentro de negrita o de un título
- Identificadores como
#3oPR0017
Un sistema que redacta la fecha de «3 de septiembre de 2026» no es un sistema de verificación. Es un fallo.
¿Por qué verificar en el servidor?
Porque hay más de un lector.
El texto llega a un cliente web, a una aplicación de escritorio, a una aplicación móvil y a una extensión de navegador. Se guarda en una base de datos. Se le devuelve al modelo como historial en el turno siguiente. Si la comprobación se hace en el cliente, cada una de esas copias difiere, y el propio historial del modelo contiene cifras que quien lee nunca vio.
Por eso la verificación se ejecuta en el servidor, una vez, antes de emitir el texto y antes de guardarlo. Un único texto verificado llega a todos los destinos.
¿Qué cuesta esto?
Dos cosas, y es justo nombrarlas.
A veces verá puntos suspensivos. Cuando el asistente redondea una cifra, la cifra redondeada no pasa la comprobación y se elimina. «Alrededor de 800.000 DKK entre 4 usuarios» se convierte en «Alrededor de … DKK entre … usuarios» cuando la contabilidad decía 812.400 entre 3 usuarios. La primera versión se lee mejor. La segunda es honesta.
Una advertencia puede perder sus recuentos. «Solo 500 de 3.901 filas están en este archivo» conserva su aviso y pierde sus números si esos recuentos no se devolvieron. Ese es el intercambio correcto. Una advertencia con números inventados son dos errores, no uno.
Qué no resuelve
La verificación comprueba que una cifra venía de una fila. No comprueba que esa fila responda a su pregunta.
Un número perfectamente fundamentado puede seguir siendo el número equivocado, porque la consulta filtró por el campo de fecha equivocado, o porque «ingreso» en la consulta no es «ingreso» en su empresa. Ese problema necesita otro mecanismo: una definición compartida de cada término de negocio, y un asistente que pregunta cuando una lectura no está resuelta.
Son dos piezas más del mismo diseño. La verificación es el suelo, no el techo. Elimina por completo una clase de error, lo cual merece la pena, y deja el resto del trabajo a la vista en lugar de escondido.
Preguntas y respuestas
- ¿Cómo puede una IA responder con datos que no ve?
- El modelo escribe una consulta. La plataforma la ejecuta, representa las filas como un bloque y le dice al modelo únicamente que ha aparecido una tabla con un número dado de columnas y filas. Quien lee ve filas de la base de datos.
- ¿Qué es una cifra fundamentada?
- Una cifra fundamentada es un valor que aparece en las filas que devolvió una consulta durante el mismo turno, o un valor que el modelo envió como entrada de una herramienta. Una cifra que no supera ninguna de las dos pruebas no está fundamentada.
- ¿Las fechas se tratan como cifras?
- No. Las fechas, los años, las horas, los números de semana, los trimestres, los marcadores de lista y los identificadores no son cifras. Quedan excluidos de la verificación en español, inglés, danés y alemán.
Fuentes
Comprobamos cada afirmación externa en la fecha indicada. Microsoft cambia el estado de sus funciones entre oleadas de lanzamiento, así que vuelva a consultar la página antes de apoyarse en ella.
- 01FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim VerificationarXiv · Fuentes comprobadas 2026-09-17
- 02FAITH: A Framework for Assessing Intrinsic Tabular Hallucinations in FinancearXiv · Fuentes comprobadas 2026-09-17