En una herramienta legal con inteligencia artificial, la mayor parte de la calidad de la respuesta la decide el corpus indexado, no el modelo que redacta. Por eso las cinco preguntas que importan antes de contratar son sobre el corpus: qué fuentes cubre y cuáles no, de qué jurisdicción es cada una, con qué granularidad se fragmentó, a qué fecha está actualizada cada fuente y qué queda explícitamente excluido. Un proveedor serio responde las cinco por escrito y en un solo documento. Este artículo explica cada pregunta, por qué la vigencia es el punto más frágil, cuál es el error más silencioso y cómo comprobarlo todo en una demostración de una hora.
Por qué el corpus decide el resultado
La intuición de quien compra es que el mérito está en el modelo. La evidencia empírica apunta en otra dirección. El estudio de Stanford RegLab y Yale sobre las principales herramientas comerciales de investigación jurídica del mercado estadounidense —todas construidas sobre modelos de primera línea y recuperación de documentos— encontró tasas de alucinación relevantes en todas ellas1; el trabajo previo del mismo grupo había mostrado que los modelos generalistas, sin documentos, alucinan en más de la mitad de las consultas jurídicas directas2. La diferencia entre unos y otros no está en el modelo: está en qué se recupera y cómo.
En nuestra operación la variación de calidad se explica por los mismos factores, y ninguno es el nombre del modelo: fragmentos que cortan un artículo por la mitad, ausencia de la fecha de versión del documento, mezcla de niveles normativos en un mismo índice, falta de identificador estable por fragmento. La función MAP del marco de gestión de riesgo del NIST formula la misma idea en abstracto: establecer el contexto y los componentes del sistema antes de medir o gestionar nada7. En una herramienta legal, ese contexto es el corpus.
Las cinco preguntas
Cobertura. ¿Qué fuentes están indexadas? Legislación, reglamentos, jurisprudencia, criterios administrativos y doctrina son cosas distintas y se compran distinto. Una respuesta útil enumera fuentes concretas con su volumen, no categorías. Como referencia de cómo se ve una declaración concreta, nuestros propios corpus legales se publican así: 435 leyes federales y 31.857 tesis para el corpus mexicano, y 53 leyes y 6.699 sentencias para el chileno, con su fecha de medición.
Jurisdicción. ¿De qué país y de qué nivel es cada fuente? Federal, estatal, autonómico, municipal y sectorial no son intercambiables, y un índice que los mezcla sin marcarlos producirá respuestas que citan bien la norma equivocada.
Granularidad. ¿Cuál es la unidad indexada: la norma completa, el artículo, el inciso, un fragmento de longitud fija? La unidad determina qué se puede citar con precisión. Un sistema que recupera bloques de texto sin correspondencia con la estructura normativa puede citar el artículo correcto y transcribir un fragmento que pertenece a otro.
Vigencia. ¿A qué fecha está actualizada cada fuente y con qué frecuencia se refresca? Es la pregunta con la respuesta más incómoda y la que más se evita; tiene sección propia más abajo.
Exclusiones. ¿Qué queda deliberadamente fuera? Esta es la pregunta que separa a un proveedor que conoce su producto de uno que lo describe. Una lista honesta de exclusiones vale más que un volumen grande sin delimitar, porque permite saber cuándo no usar la herramienta.
La ficha de corpus
Las cinco preguntas caben en un documento de una página, con una fila por fuente. Esa ficha es al motor legal lo que el inventario de componentes de IA es a la cadena técnica: el papel que hace evaluable el sistema desde fuera.
| Columna | Qué debe contener |
|---|---|
| Fuente | Nombre oficial del cuerpo normativo o de la colección jurisprudencial |
| Jurisdicción y nivel | País y nivel (federal, estatal o autonómico, sectorial) |
| Volumen | Unidades indexadas, con la fecha en que se contaron |
| Granularidad | Unidad indexada: artículo, inciso, párrafo, resolución |
| Fecha de vigencia | A qué fecha está actualizada esa fuente concreta |
| Frecuencia de refresco | Cada cuánto se reingesta y por qué disparador |
| Exclusiones | Qué de esa fuente no está y por qué |
Vigencia: un texto legal es una serie de versiones
Este es el punto más frágil de cualquier herramienta legal y el que más rápido separa un producto serio de uno improvisado. Una norma no es un documento: es una sucesión de versiones, y la misma disposición dice cosas distintas según la fecha. Un sistema que guarda «el texto» sin guardar «a qué fecha corresponde este texto» no puede responder si lo que afirma sigue vigente.
Los repositorios oficiales trabajan exactamente así y son la referencia de contraste. LeyChile publica cada norma con su fecha de versión y su estado de derogación3; la compilación de textos vigentes de la Cámara de Diputados de México encabeza cada ley con la leyenda de la última reforma publicada y su fecha4; el Boletín Oficial del Estado español publica textos consolidados indicando la fecha de actualización y los bloques modificados5. Un corpus que no reproduce esa estructura pierde información que la fuente sí tenía.
Tres exigencias concretas se derivan de esto. La respuesta debe declarar la fecha de corte de la fuente que usó. El sistema debe advertir cuando la consulta toca materia con reforma reciente. Y la ficha debe declarar una fecha por fuente, no una sola para todo el corpus, porque unas se actualizan a diario y otras a demanda.
El error más silencioso: la jurisdicción cruzada
Citar bien una norma del país equivocado produce respuestas seguras, bien redactadas y falsas. Es el fallo más caro porque no se detecta leyendo: el texto es coherente, la cita existe, el artículo dice lo que la respuesta afirma. Solo está en el ordenamiento de otro país.
La contención es de diseño y tiene dos partes: el índice debe estar acotado por jurisdicción en la propia consulta, no filtrado después, y la comprobación de existencia debe ejecutarse contra el corpus de esa jurisdicción y no contra el total. El método de comprobación por cita —existencia, correspondencia, vigencia y suficiencia— está explicado en cómo se verifica una cita generada por IA.
Especialización por área: qué aporta y qué no
Separar el sistema en agentes por materia —laboral, fiscal, penal, administrativo, ambiental— es una decisión de alcance, no de inteligencia. Lo que aporta es real: instrucciones específicas por área, vocabulario propio, recuperación acotada al subconjunto pertinente y, sobre todo, un conjunto de evaluación propio por materia, que permite saber dónde el sistema es fuerte y dónde no. Nuestras plataformas legales operan con 10 y 12 agentes por área respectivamente.
Lo que no aporta conviene decirlo con la misma claridad: la especialización mejora la precisión de la recuperación, no otorga criterio jurídico. Un agente de materia laboral no razona mejor sobre derecho laboral; busca mejor en derecho laboral. La diferencia importa cuando alguien intenta vender la segunda cosa.
Lo que el corpus no arregla
Tres límites que ninguna ficha resuelve. La interpretación: dos artículos correctamente citados pueden sostener lecturas opuestas, y elegir entre ellas es trabajo profesional. El procedimiento: conocer la norma no es conocer el estado de un expediente, y una integración procesal es un componente distinto con sus propios fallos. La responsabilidad: quien firma el escrito responde por él, y ningún proveedor serio ofrece asumirla.
De ahí que la cifra que un comprador debe exigir no sea una promesa sino una medición: tasa de exactitud y de error, sobre qué conjunto, contra qué versión, en qué fecha y con qué intervalo. Publicamos las nuestras congeladas por medición6, y el protocolo completo está en cómo medimos las alucinaciones de una IA en producción.
Cómo comprobarlo en una demostración
| # | Qué pedir | Qué debe pasar |
|---|---|---|
| 1 | La ficha de corpus completa | Existe, tiene una fila por fuente y una fecha por fuente |
| 2 | Una consulta sobre norma reformada hace poco | La respuesta declara la fecha de versión y advierte del cambio |
| 3 | Una consulta cuya respuesta correcta sea «no existe aquí» | El sistema se abstiene en lugar de responder con la norma de otro país |
| 4 | El enlace al texto oficial de cada cita | Abre la norma y el artículo exactos en el repositorio oficial |
| 5 | La tasa medida con fecha, versión e intervalo | Hay número, método y fecha; no un adjetivo |
Un proveedor que supera las cinco está vendiendo un sistema documentado; uno que responde con volumen —«millones de documentos»— está vendiendo una impresión. El resto del cuestionario de compra, con las diez preguntas y su marco legal por país, está en cómo evaluar a un proveedor de IA. Si quiere que revisemos una herramienta concreta con estos criterios, puede plantearnos el caso.
-
Magesh, Surani, Dahl, Suzgun, Manning y Ho, Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, Journal of Empirical Legal Studies 22(2), 2025 (arXiv 2405.20362). Consultado el 17 de agosto de 2026. ↩
-
Dahl, Magesh, Suzgun y Ho, Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models, Journal of Legal Analysis 16(1), 2024 (arXiv 2401.01301). Consultado el 17 de agosto de 2026. ↩
-
Biblioteca del Congreso Nacional de Chile, LeyChile. Verificado el 17 de agosto de 2026 contra su servicio XML de intercambio de normas, que devuelve fecha de versión, fecha de publicación y estado de derogación. ↩
-
Cámara de Diputados del H. Congreso de la Unión (México), compilación de textos vigentes; cada ley encabeza con la leyenda «Última reforma DOF» y su fecha. Consultado el 17 de agosto de 2026. ↩
-
Boletín Oficial del Estado (España), texto consolidado con fecha de actualización. Consultado el 17 de agosto de 2026. ↩
-
Innova y Cree, Benchmark anti-alucinación, con metodología, intervalos y fecha de medición. Consultado el 17 de agosto de 2026. ↩
-
NIST, AI Risk Management Framework 1.0, función MAP. Consultado el 17 de agosto de 2026. ↩