¿Qué es un corpus legal?
Un corpus legal es la base de datos de documentos jurídicos que alimenta un sistema RAG. Su calidad determina directamente la calidad de las respuestas.
Fuentes de un corpus legal
- Legislación: BOE, diarios oficiales autonómicos, EUR-Lex
- Jurisprudencia: CENDOJ, bases de tribunales constitucionales
- Doctrina administrativa: resoluciones DGT, DGRN, circulares
- Normativa sectorial: reguladores (CNMC, Banco de España, CNMV)
Proceso de construcción
- Ingesta: descarga automatizada de fuentes oficiales
- Parsing: extracción del texto estructurado (artículos, fundamentos, fallo)
- Chunking: división en fragmentos semánticos coherentes
- Embedding: vectorización de cada fragmento
- Indexación: almacenamiento en base de datos vectorial (pgvector)
Problemas de calidad
- Duplicados: la misma norma aparece múltiples veces con redacciones ligeramente diferentes
- Versiones obsoletas: normas derogadas que siguen indexadas
- Encoding: caracteres especiales mal codificados (mojibake)
- Stubs: registros vacíos o incompletos que contaminan los resultados
Métricas de calidad
| Métrica | Descripción | Objetivo |
|---|
| Cobertura | % de normas clave indexadas | >95% |
| Frescura | Tiempo medio de actualización | <48h |
| Deduplicación | Ratio de duplicados eliminados | >99% |
| Encoding | % de textos sin errores de codificación | 100% |
Mantenimiento continuo
Un corpus legal no es estático. Requiere:
- Monitorización diaria de BOE y diarios oficiales
- Deduplicación periódica
- Reindexación tras correcciones
- Benchmarks de calidad contra preguntas tipo examen