Saltar al contenido
Para empresas Procedimientos Sancionatorios Pilotos empresariales Benchmark anti-alucinación Nuestra historia Capacitación corporativa Blog Plantillas descargables Diagnóstico sin costo

IA verificable · Nº 02 · v1.0

Cómo se verifica una cita legal generada por IA

Verificar una cita legal generada por inteligencia artificial es comprobar cuatro cosas contra el texto oficial: que la norma exista, que el artículo citado sea el que se transcribe, que la versión esté vigente a una fecha y que lo citado respalde efectivamente la afirmación. Las cuatro se comprueban por código contra el corpus, no pidiéndole al modelo que se revise a sí mismo. Explicamos el método completo, la abstención como salida legítima, la tasa que arroja medido con su intervalo, los cinco límites que no resuelve y qué exigirle a un proveedor.

Por — Fundador y arquitecto de la plataforma · LinkedIn
Revisión técnica: Innova y Cree

· 14 min de lectura · PDF

Verificar una cita legal generada por inteligencia artificial consiste en comprobar cuatro cosas contra el texto oficial: que la norma exista, que el artículo citado sea el que se transcribe (correspondencia), que la versión invocada esté vigente a una fecha, y que lo citado respalde efectivamente la afirmación que acompaña. Las cuatro se comprueban por código contra el corpus indexado, no pidiéndole al modelo que se revise a sí mismo. Este artículo explica el método completo, por qué la abstención es una salida legítima del sistema, qué tasa arroja cuando se mide con método publicado, los cinco límites que no resuelve y qué exigirle a un proveedor para comprobar que existe. Es la contraparte operativa de cómo medimos las alucinaciones de una IA en producción y forma parte de la serie sobre cómo evaluar a un proveedor de IA.

Qué significa «cita verificada» (definición operativa)

Una cita está verificada cuando un proceso independiente del modelo ha comprobado, contra el texto oficial, que la referencia existe, que su contenido es el que se transcribe, que la versión es la aplicable a la fecha consultada y que lo transcrito sostiene la afirmación a la que acompaña. Mientras falte cualquiera de esas cuatro comprobaciones, lo que hay es una cita plausible, que es otra cosa.

La distinción no es retórica. El estudio de Stanford RegLab y Yale sobre las principales herramientas de investigación jurídica con IA del mercado estadounidense fijó una definición operativa que conviene adoptar tal cual: una respuesta puede ser incorrecta —describe mal el derecho— o mal fundada —la afirmación podría ser cierta, pero la cita entregada no la respalda—, y ambas cuentan como alucinación1. La segunda categoría es la que rompe la intuición del comprador: hay respuestas con citas reales, verificables una por una en el sitio oficial, que siguen siendo falsas porque el artículo citado no dice lo que la respuesta afirma que dice.

Las cuatro comprobaciones

Cada cita que produce el sistema pasa por cuatro pruebas, en este orden, y cualquiera que falle degrada la respuesta antes de que llegue al usuario.

Existencia. ¿La norma y el artículo referidos están en el corpus? Es una búsqueda exacta por identificador, no semántica: número de norma, número de artículo, inciso o fracción. Si el identificador no resuelve, la cita se descarta. Esta prueba es la que atrapa el caso clásico —el artículo inventado con numeración verosímil— y es trivial de implementar; su ausencia en un producto es señal de que nadie pensó el problema.

Correspondencia. ¿El texto que la respuesta presenta como cita coincide con el texto almacenado para ese identificador? Se compara el fragmento entregado contra el fragmento del corpus. No hace falta identidad literal absoluta —hay elisiones y puntos suspensivos legítimos—, pero sí que cada segmento citado aparezca en el original. Esto atrapa la mezcla de dos artículos en uno, que es un fallo frecuente y difícil de detectar leyendo.

Vigencia. ¿La versión citada es la aplicable a la fecha de la consulta? Un texto legal no es un documento sino una serie de versiones: la misma norma dice cosas distintas según el día. El corpus debe almacenar la versión con su fecha, y la respuesta debe declarar a qué fecha corresponde lo que afirma. Los repositorios oficiales trabajan así: LeyChile publica cada norma con su fecha de versión y su estado de derogación8, el Boletín Oficial del Estado español publica textos consolidados con fecha de actualización10 y la compilación de la Cámara de Diputados de México indica la última reforma incorporada9. Un sistema que no guarda la fecha de versión no puede responder esta pregunta, y por tanto no puede verificar nada.

Suficiencia. ¿Lo citado respalda la afirmación? Es la comprobación más costosa y la que más fallos revela. Consiste en contrastar cada aserción de la respuesta contra el fragmento que la sostiene, y marcar la que no se sostiene. FACTS Grounding, el banco de pruebas publicado por Google DeepMind, formaliza exactamente esta idea: descartar primero las respuestas que eluden la pregunta —para que abstenerse de todo no sea una forma de ganar— y verificar después, frase por frase, que nada afirme lo que el documento entregado no dice3.

Por qué el modelo no debe citar de memoria

Un modelo de lenguaje produce texto estadísticamente plausible; su seguridad al expresarse es independiente de su exactitud. El NIST nombra este comportamiento confabulación —contenido falso o engañoso producido con confianza— y lo incluye entre los riesgos propios de la IA generativa, con la instrucción de medirlo, no de negarlo4. OWASP lo recoge en su lista de riesgos para aplicaciones con modelos de lenguaje bajo la etiqueta de desinformación6.

Por eso la arquitectura correcta no le pregunta al modelo qué dice la ley: le entrega los fragmentos del corpus pertinentes a la consulta y le pide que responda solo con eso, citando el identificador de cada fragmento. La diferencia práctica es que el espacio de respuestas queda acotado por documentos reales. La diferencia medida es sustancial pero no total: el trabajo previo del mismo grupo de Stanford mostró que los modelos generalistas alucinan en más de la mitad de las consultas jurídicas directas2, y el estudio de 2025 mostró que recuperar documentos reduce el problema sin eliminarlo1. La recuperación es condición necesaria; la verificación posterior es lo que convierte una reducción en una garantía comprobable.

Hay una consecuencia de diseño que conviene explicitar: los fragmentos que viajan al modelo son solo los pertinentes a cada consulta, nunca el corpus completo ni el expediente entero. Eso importa para la exactitud y, además, para la exposición de datos; el detalle de qué componente ve qué se declara en el inventario de componentes de IA.

La abstención es una salida del sistema, no un fallo

Un sistema serio tiene una respuesta prevista para «no hay fundamento en el corpus»: decirlo, decir qué se buscó y no ofrecer nada más. Esa salida se llama abstención y es una decisión de producto, no una avería.

Los modelos generalistas están afinados para ser útiles, y responder siempre es la conducta que optimiza esa utilidad aparente. En un dominio donde una afirmación falsa se convierte en un escrito presentado ante un tribunal, esa utilidad es el problema. La definición operativa que usamos separa tres cosas que suelen confundirse: alucinar (afirmar algo incorrecto o mal fundado), abstenerse (declarar que no hay fundamento) y quedarse corto (una respuesta correcta que omite una condición esencial). Solo la primera cuenta como alucinación; la segunda y la tercera se reportan aparte, porque un sistema que se abstiene demasiado es inútil aunque nunca se equivoque.

La comprobación es sencilla para un comprador: pedir una consulta cuya respuesta correcta sea «eso no existe». Si el sistema produce una respuesta bien redactada en lugar de abstenerse, el resto de las garantías no importa.

La verificación se ejecuta por código, no con un segundo modelo

Las comprobaciones de existencia, correspondencia y vigencia son deterministas: son consultas al corpus y comparaciones de texto. Ejecutarlas por código tiene tres ventajas sobre pedirle a un modelo que revise: es reproducible, es auditable línea por línea y cuesta esencialmente nada por consulta.

El motivo de fondo es otro. Un modelo que evalúa respuestas —propias o ajenas— arrastra sesgos documentados de posición, de verbosidad y de autopreferencia; por eso FACTS Grounding promedia el juicio de varios modelos de distintos proveedores en lugar de confiar en uno3. Trasladado a producción: el juez no puede ser el evaluado. Cuando la comprobación exige criterio —la suficiencia—, el evaluador debe ser un componente distinto del que generó la respuesta, y su calibración debe contrastarse contra revisión humana sobre una muestra. Todo lo anterior es la función MEASURE del marco de gestión de riesgo del NIST aplicada a un caso concreto: métodos documentados, resultados registrados, no impresiones5.

Dónde se comprueba una cita: la fuente oficial por país

La verificación termina siempre en el mismo lugar: el repositorio oficial de la jurisdicción. Un sistema que se vende en varios países necesita una fuente primaria por cada uno, con su propia forma de expresar versiones y vigencias. Esta tabla reúne las que usamos como referencia de contraste, consultadas el 17 de agosto de 2026.

repositorios oficiales usados como fuente de contraste para verificar una cita, por jurisdicción.
Jurisdicción Repositorio oficial de referencia Cómo expresa la vigencia
Chile LeyChile, Biblioteca del Congreso Nacional Versión con fecha y estado de derogación por norma8
México Compilación de textos vigentes de la Cámara de Diputados, sobre lo publicado en el Diario Oficial de la Federación «Última reforma DOF» con fecha en la portada de cada ley9
España y UE Boletín Oficial del Estado (textos consolidados) y EUR-Lex Texto consolidado con fecha de actualización y bloques modificados
Colombia Diario Oficial y compilaciones oficiales del Congreso Notas de vigencia y jurisprudencia concordante por artículo
Perú El Peruano y el Sistema Peruano de Información Jurídica Norma con fecha de publicación y modificatorias
Argentina Boletín Oficial e InfoLEG Texto actualizado con las normas modificatorias enlazadas

Qué arroja el método cuando se mide

El resultado de todo lo anterior no es una promesa: es una tasa, con fecha, versión del sistema e intervalo de confianza. Publicamos las nuestras congeladas por medición, sin actualizarlas con el corpus vivo7.

Sobre las pruebas diseñadas para inducir el error —artículos inexistentes, normas fuera del corpus, preguntas con premisa falsa— la lectura honesta no es un absoluto sino una cota. Con 120 pruebas hostiles y 0 fabricaciones observadas, lo que puede afirmarse es que la tasa real está por debajo de aproximadamente tres dividido por el número de pruebas, no que sea nula: ningún número de ensayos sin fallo demuestra la imposibilidad del fallo. La misma regla aplica a la batería interna sobre corpus legal chileno, con 115 consultas y una cota superior de 3,5 %.

Como orden de magnitud externo, el estudio de Stanford RegLab midió 33 % y 17 % de alucinación en dos plataformas comerciales que se anunciaban libres de ese defecto, sobre 202 consultas evaluadas por expertos1. No son cifras comparables entre sí —distinto corpus, distinta jurisdicción, distinto tipo de pregunta—; lo comparable es el método.

Los cinco límites del método

Un método serio se describe por lo que no cubre tanto como por lo que cubre.

  1. Corpus incompleto. La verificación solo alcanza lo indexado. Si una norma aplicable no está en el corpus, el sistema no la citará mal: simplemente no la citará, y la respuesta será incompleta sin que ninguna comprobación lo señale. Por eso la cobertura declarada del corpus, con su fecha de corte, es parte de la ficha del producto.
  2. Desfase de vigencia. Entre la publicación de una reforma y su incorporación al corpus hay una ventana. El sistema debe declarar la fecha de corte de cada fuente y, en consultas sensibles a cambios recientes, advertirlo.
  3. Interpretación. Que una cita sea exacta no hace correcta la conclusión jurídica. Dos artículos correctamente citados pueden sostener lecturas opuestas; elegir entre ellas es trabajo profesional y no se automatiza.
  4. Jurisdicción cruzada. El error más silencioso es citar bien una norma del país equivocado. La comprobación de existencia debe estar acotada al corpus de la jurisdicción de la consulta, no al corpus completo.
  5. Responsabilidad. Quien firma el escrito responde por él. Ningún sistema traslada esa responsabilidad, y ningún proveedor serio ofrece hacerlo.

Cómo exigirlo a un proveedor: cinco pruebas de una hora

Estas cinco pruebas se ejecutan en una sesión con el sistema delante y separan un producto verificable de una demostración ensayada.

cinco comprobaciones que un comprador puede ejecutar en una sola sesión técnica.
# Qué pedir Qué debe pasar
1 Una respuesta real con el enlace al texto oficial de cada cita Cada enlace abre la norma y el artículo exactos, en el repositorio oficial, no en una copia del proveedor
2 Una consulta cuya respuesta correcta sea «esa norma no existe» El sistema se abstiene y explica qué buscó; no redacta una respuesta plausible
3 Una consulta sobre una norma reformada recientemente La respuesta declara la fecha de versión y la fecha de corte del corpus
4 La tasa medida, con fecha, versión evaluada e intervalo Hay número, método y fecha; si la respuesta es un adjetivo, no hay medición
5 La cobertura del corpus y qué queda fuera Existe una lista de fuentes con fecha de corte y una declaración de lo no cubierto

Un proveedor que responde con evidencia a las cinco está describiendo un sistema; uno que responde con adjetivos está describiendo una expectativa. La forma de dejarlo por escrito —umbrales, re-medición ante cambio de modelo, aviso previo— pertenece a la política de IA responsable, y el protocolo completo de medición, con el arnés publicado, está en cómo medimos las alucinaciones de una IA en producción. Si quiere aplicar estas pruebas a un proveedor concreto, puede plantearnos el caso.


  1. Magesh, Surani, Dahl, Suzgun, Manning y Ho, Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, Journal of Empirical Legal Studies 22(2), 2025 (arXiv 2405.20362). Consultado el 17 de agosto de 2026. 

  2. Google DeepMind, FACTS Grounding: A new benchmark for evaluating the factuality of large language models, 17 de diciembre de 2024. Consultado el 17 de agosto de 2026. 

  3. NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1), julio de 2024; la confabulación figura entre los riesgos propios de la IA generativa. Consultado el 17 de agosto de 2026. 

  4. NIST, AI Risk Management Framework 1.0, 26 de enero de 2023, función MEASURE. Consultado el 17 de agosto de 2026. 

  5. OWASP GenAI Security Project, LLM Top 10 — 2026. Consultado el 17 de agosto de 2026. 

  6. Innova y Cree, Benchmark anti-alucinación, con metodología, intervalos y fecha de medición. Consultado el 17 de agosto de 2026. 

  7. Biblioteca del Congreso Nacional de Chile, LeyChile. Verificado el 17 de agosto de 2026 contra su servicio XML de intercambio de normas, que devuelve fecha de versión, fecha de publicación y estado de derogación. 

  8. Cámara de Diputados del H. Congreso de la Unión (México), Código Fiscal de la Federación, texto vigente compilado; el artículo 29 regula los comprobantes fiscales digitales por Internet. Consultado el 17 de agosto de 2026. 

  9. Boletín Oficial del Estado (España), texto consolidado de la Ley 18/2022, citado aquí como ejemplo de consolidación con fecha. Consultado el 17 de agosto de 2026. 

Puntos clave

  • Una cita está verificada cuando pasa cuatro comprobaciones contra el texto oficial: existencia, correspondencia, vigencia a una fecha y suficiencia respecto de lo afirmado.
  • Las cuatro se ejecutan por código contra el corpus; pedirle al modelo que revise sus propias citas reproduce el sesgo de autopreferencia y no sirve como control.
  • La abstención explícita es una salida del sistema, no una avería: se cuenta aparte de la alucinación y su ausencia es señal de que el sistema fue configurado para responder siempre.
  • El resultado se expresa como tasa medida con fecha, versión e intervalo de confianza; «no inventa» no es una propiedad, es el resumen impreciso de una medición.
  • El método no resuelve cinco cosas: corpus incompleto, desfase de vigencia, interpretación, jurisdicción cruzada y la responsabilidad profesional de quien firma.

Preguntas frecuentes

¿Una IA con citas puede seguir inventando?

Sí. Recuperar documentos reduce el problema pero no lo elimina: el modelo puede citar una norma real y describirla mal, o atribuir a un artículo algo que ese artículo no dice. Por eso la comprobación de suficiencia —que lo citado respalde la afirmación— es la que más fallos detecta, y es la que casi nadie implementa.

¿Qué diferencia hay entre verificar la cita y verificar la respuesta?

Verificar la cita comprueba que la referencia existe, corresponde, está vigente y respalda lo afirmado. Verificar la respuesta exigiría además juzgar la interpretación jurídica, que es trabajo de un profesional. El sistema hace lo primero por código; lo segundo lo hace la persona que firma el escrito.

¿Por qué no basta con pedirle al modelo que revise sus propias citas?

Porque un modelo tiende a validar lo que él mismo produjo, y la literatura sobre modelos usados como jueces documenta ese sesgo. La comprobación de existencia y correspondencia se hace contra el corpus por código, con comparación de texto, no preguntándole a un modelo si acertó.

¿Qué debe hacer el sistema cuando no encuentra fundamento?

Abstenerse de forma explícita y decir qué buscó. Una abstención no es una alucinación: es un error de omisión, se cuenta aparte y es preferible a una respuesta fabricada. Un sistema que nunca se abstiene está configurado para responder siempre, y eso es exactamente lo que produce citas falsas.

¿Cómo compruebo yo, como comprador, que esto existe de verdad?

Pida tres cosas: una respuesta real con sus citas y el enlace al texto oficial de cada una; el resultado de una consulta cuya respuesta correcta sea «esa norma no existe»; y la tasa medida con la fecha, la versión evaluada y el intervalo de confianza. Las tres se comprueban en una sesión de una hora.

Referencias

  1. [1] Magesh, Surani, Dahl, Suzgun, Manning, Ho — «Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools», Journal of Empirical Legal Studies 22(2), 2025 (arXiv 2405.20362). https://arxiv.org/abs/2405.20362. Consultado el 17 de agosto de 2026. paper
  2. [2] Dahl, Magesh, Suzgun, Ho — «Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models», Journal of Legal Analysis 16(1), 2024 (arXiv 2401.01301). https://arxiv.org/abs/2401.01301. Consultado el 17 de agosto de 2026. paper
  3. [3] Google DeepMind — «FACTS Grounding: A new benchmark for evaluating the factuality of large language models» (17 dic 2024). https://deepmind.google/discover/blog/facts-grounding-a-new-benchmark-for-evaluating-the-factuality-of-large-language-models/. Consultado el 17 de agosto de 2026. paper
  4. [4] NIST AI 600-1 — Generative AI Profile: la «confabulación» como riesgo propio de la IA generativa. https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf. Consultado el 17 de agosto de 2026. norma
  5. [5] NIST AI Risk Management Framework 1.0 (función MEASURE). https://www.nist.gov/itl/ai-risk-management-framework. Consultado el 17 de agosto de 2026. norma
  6. [6] OWASP GenAI — LLM Top 10 (edición 2026): desinformación y contenido no fundamentado. https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/. Consultado el 17 de agosto de 2026. norma
  7. [7] Innova y Cree — Benchmark anti-alucinación: tasas medidas con su metodología, intervalos y fecha de corte. https://innovaycree.com/empresas/benchmark/. Consultado el 17 de agosto de 2026. propio
  8. [8] Biblioteca del Congreso Nacional de Chile — LeyChile (texto oficial y versiones por fecha; verificado contra su servicio XML de intercambio de normas). https://www.bcn.cl/leychile/navegar?idNorma=1209272. Consultado el 17 de agosto de 2026. ley
  9. [9] Cámara de Diputados (México) — Código Fiscal de la Federación, texto vigente compilado (art. 29: comprobantes fiscales digitales por Internet). https://www.diputados.gob.mx/LeyesBiblio/pdf/CFF.pdf. Consultado el 17 de agosto de 2026. ley
  10. [10] Boletín Oficial del Estado (España) — texto consolidado de la Ley 18/2022, ejemplo de versión consolidada con fecha. https://www.boe.es/buscar/act.php?id=BOE-A-2022-15818. Consultado el 17 de agosto de 2026. ley

Citar este artículo

APA

Pinto, D. (2026, 17 de agosto). Cómo se verifica una cita legal generada por IA (v1.0). Blog técnico de Innova y Cree. https://innovaycree.com/blog/ia-verificable/como-verificamos-cada-cita.html

BibTeX

@misc{pinto2026como,
  author       = {Pinto, David},
  title        = {Cómo se verifica una cita legal generada por IA},
  howpublished = {Blog técnico de Innova y Cree},
  year         = {2026},
  month        = {ago},
  note         = {v1.0, revisado 2026-08-17},
  url          = {https://innovaycree.com/blog/ia-verificable/como-verificamos-cada-cita.html}
}

Descargar en PDF v1.0 · 17 ago 2026

Historial de versiones
  1. v1.0 · 17 ago 2026 Publicación inicial. Reemplaza y fusiona dos artículos anteriores («IA legal que no inventa» y «IA anti-alucinación») cuyas afirmaciones absolutas no eran verificables; las cifras pasan a la tabla maestra y las tasas se citan con intervalo.

Del mismo clúster: IA verificable

Ver todo el hub IA verificable →

Siguiente paso

Diagnóstico de IA sin costo

Una sesión de trabajo sobre su operación real: qué conviene automatizar, qué controles exigir y qué evidencia pedir antes de contratar. Sin compromiso.

Solicitar diagnóstico
  • verificación de citas
  • IA legal
  • alucinación
  • RAG con fuente
  • abstención
  • corpus normativo
  • tasa de alucinación
  • IA verificable