flowchart TD
A[Pregunta] --> B{¿Tengo el criterio?}
B -- No --> C[Buscar política interna]
C --> D[Filtrar por vigencia]
D --> E[Recuperar sección pertinente]
E --> F[Comparar]
F --> G[Citar evidencia]
G --> H[Separar texto e inferencia]
Agente de recuperación
El agente conversacional puede descubrir qué información falta.
Pero reconocer una necesidad informativa no significa todavía poder resolverla.
Supongamos que durante una revisión contractual aparece esta pregunta:
“¿La cláusula de uso de datos se aparta del estándar interno vigente?”
El sistema puede comprender perfectamente la tarea y, aun así, no tener delante la política relevante.
Podría responder con conocimiento general del modelo.
Podría pedir al usuario que adjunte el documento.
O podría hacer algo diferente:
buscar la fuente autorizada antes de continuar.
Ése es el punto de entrada al agente de recuperación.
Un agente de recuperación no depende solamente de lo que el modelo ya tiene en contexto.
Puede detectar una necesidad de información, buscar en fuentes autorizadas, filtrar resultados, recuperar el material pertinente y utilizarlo como evidencia.
En trabajo jurídico, la mejora decisiva no es sólo “tener más información”. Es poder mantener una cadena entre:
pregunta → fuente → fragmento → inferencia → conclusión.
Del RAG como mecanismo a la recuperación como decisión
RAG ya apareció anteriormente en el recorrido del sitio.
No necesitamos volver a explicar embeddings, chunking o bases vectoriales.
El delta conceptual es otro.
En una arquitectura agente, la recuperación puede convertirse en una acción seleccionada dentro del ciclo.
El sistema puede decidir:
“No tengo evidencia suficiente para responder. Necesito recuperar la política de proveedores.”
Después de recibir el resultado, vuelve a decidir:
“La política encontrada es de 2024 y existe una versión de 2026. Debo filtrar por vigencia.”
La recuperación ya no es solamente una etapa fija que ocurre siempre antes de responder.
Puede ser una capacidad que el agente utiliza cuando el estado de la tarea lo requiere.
1. Buscar: convertir una necesidad en una consulta
Buscar parece sencillo hasta que intentamos automatizarlo.
Una persona que investiga Derecho no escribe necesariamente una única frase en una base y acepta el primer resultado.
Formula una pregunta, identifica conceptos, ajusta términos, cambia de fuente y revisa si la consulta realmente responde al problema.
Un agente de recuperación debe realizar una versión controlada de ese proceso.
De la pregunta al objeto de búsqueda
Supongamos:
“¿El proveedor puede reutilizar información del cliente para entrenar o mejorar modelos?”
El agente podría necesitar buscar en distintos lugares:
- contrato principal;
- DPA;
- términos de producto;
- política de privacidad;
- documentación técnica;
- playbook interno.
La pregunta jurídica general se convierte en varias necesidades documentales.
2. Filtrar: no todo resultado relevante es utilizable
El buscador puede devolver diez documentos que contienen palabras similares.
Eso no significa que los diez deban entrar al análisis.
Filtrar significa seleccionar según criterios de pertinencia y autoridad.
En trabajo jurídico pueden importar especialmente:
- jurisdicción;
- fecha;
- vigencia;
- tipo de fuente;
- versión;
- cliente o expediente;
- materia;
- nivel de autoridad;
- confidencialidad.
Ejemplo: una política desactualizada
La búsqueda devuelve:
Política de proveedores 2024
Política de proveedores 2025
Política de proveedores 2026
Si el agente utiliza la primera porque contiene mejores coincidencias textuales, puede aplicar un criterio obsoleto.
El problema no es necesariamente la generación.
Es un error de selección de fuente.
Relevancia semántica no equivale a autoridad jurídica
Un fragmento puede parecer muy relacionado con la consulta y seguir siendo una fuente inadecuada.
Por ejemplo:
- un blog describe una norma;
- una norma derogada contiene exactamente el término buscado;
- una sentencia extranjera trata un problema parecido;
- una guía interna resume parcialmente un requisito.
Un sistema jurídico necesita criterios que no se reducen a similitud textual.
3. Recuperar: traer sólo lo necesario al contexto
Una vez identificada la fuente, el sistema debe incorporar el material pertinente al trabajo.
No siempre conviene introducir un documento completo.
Puede ser suficiente recuperar:
- la cláusula relevante;
- el párrafo de una política;
- el artículo normativo;
- el considerando específico;
- metadatos de vigencia y procedencia.
Recuperar demasiado también puede fallar
Más contexto no es automáticamente mejor.
Si el agente incorpora cientos de páginas, puede aumentar:
- ruido;
- costo;
- latencia;
- riesgo de mezclar fuentes;
- dificultad para identificar qué evidencia sostiene qué afirmación.
La tarea del sistema es traer la información adecuada para la decisión actual.
Recuperación iterativa
A veces el primer fragmento revela una nueva necesidad.
Por ejemplo:
- se recupera la cláusula de uso de datos;
- la cláusula remite a “Product Terms”;
- el agente busca esos términos;
- allí aparece una referencia a “Service Specific Terms”;
- el agente recupera el documento final.
La recuperación se convierte en una cadena orientada por referencias y preguntas.
4. Citar: conservar la procedencia
Una respuesta jurídica útil debería permitir saber de dónde provino la información relevante.
Por eso citar no es un adorno editorial.
Es una función de trazabilidad.
Podemos contrastar:
“El proveedor puede usar datos para mejorar el servicio.”
con:
“Los Product Terms, sección 4.2, permiten utilizar ‘usage data’ para mejorar el servicio.”
La segunda formulación permite al revisor volver a la fuente.
Qué debería conservar una cita operativa
Dependiendo del sistema, puede incluir:
- documento;
- sección o cláusula;
- fecha o versión;
- fragmento relevante;
- enlace interno o identificador.
No necesitamos exigir el mismo formato en todas las tareas.
La regla es más básica:
una afirmación verificable debe poder volver a su fuente.
Citar una fuente no prueba la inferencia
Éste es un error frecuente.
Supongamos:
Fuente:
“El proveedor podrá utilizar datos de uso agregados para mejorar sus servicios.”
Conclusión:
“El proveedor puede entrenar modelos con todos los documentos del cliente.”
La existencia de una cita no convierte automáticamente la conclusión en correcta.
La cita demuestra qué texto se recuperó.
La inferencia sigue necesitando evaluación.
5. Separar evidencia e inferencia
Éste es probablemente el control conceptual más importante de este tipo de agente.
Un sistema generativo puede escribir en un mismo párrafo:
- texto encontrado;
- resumen;
- interpretación;
- evaluación;
- recomendación.
Para un lector apresurado, todo puede parecer igualmente respaldado.
Conviene separar capas.
Una estructura simple
EVIDENCIA
¿Qué dice la fuente?
INFERENCIA
¿Qué concluimos a partir de ella?
EVALUACIÓN
¿Cómo se compara con el criterio aplicable?
INCERTIDUMBRE
¿Qué no podemos afirmar todavía?
Ejemplo contractual
Evidencia
Contrato, cláusula 9.3: “Supplier may use Usage Data to improve the Services.”
Inferencia
Existe una autorización contractual para utilizar una categoría denominada Usage Data con una finalidad de mejora.
Evaluación
No es posible determinar todavía si la autorización comprende contenido del cliente porque Usage Data debe revisarse contra la definición contractual.
Incertidumbre
Falta analizar la definición de Usage Data y cualquier término específico de IA.
La salida es más útil precisamente porque no fuerza una conclusión prematura.
La metáfora del bibliotecario
Las clases utilizan una metáfora intuitiva: el agente de recuperación es como un bibliotecario que consulta una biblioteca autorizada antes de responder.
La analogía ayuda porque muestra que:
- la información se busca fuera del modelo;
- existe un universo documental;
- seleccionar la fuente importa;
- responder debería apoyarse en material recuperado.
La analogía deja de servir cuando imaginamos que el bibliotecario siempre encuentra el documento correcto.
Un sistema puede:
- no encontrar una fuente existente;
- recuperar una versión equivocada;
- seleccionar un fragmento insuficiente;
- ignorar una fuente contraria;
- interpretar mal lo encontrado.
Por eso recuperación no equivale a verdad.
Un caso completo: investigación jurídica preliminar
Encargo:
“Prepara antecedentes para evaluar si una cláusula de transferencia internacional requiere revisión adicional.”
Un agente de recuperación podría seguir esta trayectoria.
Paso 1. Delimitar la pregunta
Identifica:
- jurisdicción;
- tipo de datos;
- rol de las partes;
- instrumento contractual relevante.
Paso 2. Seleccionar fuentes
Por ejemplo:
1. normativa aplicable
2. documentos del expediente
3. políticas internas
4. doctrina o guías, si fueron autorizadas
Paso 3. Buscar
Formula consultas separadas para:
- obligación jurídica;
- mecanismo contractual;
- política interna.
Paso 4. Filtrar
Descarta:
- versiones derogadas;
- jurisdicciones irrelevantes;
- documentos sin fecha cuando la vigencia es esencial;
- fuentes duplicadas.
Paso 5. Recuperar y citar
Trae sólo fragmentos pertinentes con identificación suficiente.
Paso 6. Separar capas
Entrega:
Regla encontrada
Documento contractual
Diferencia observada
Inferencia preliminar
Información faltante
El producto final no necesita ser una opinión jurídica definitiva.
Puede ser un expediente de evidencia preparado para revisión.
Otro caso: revisión contractual interna
En el caso conductor del sitio, el agente recibe:
“Compara la cláusula de auditoría con nuestro estándar.”
Pero el estándar no está en contexto.
El ciclo podría ser:
La diferencia frente a un RAG pasivo está en que el sistema puede decidir si necesita recuperar, qué recuperar y si debe volver a buscar.
Riesgos característicos
La recuperación agrega evidencia, pero también crea nuevos puntos de falla.
Recuperar mal
El sistema encuentra un documento relacionado, pero no el correcto.
Mezclar fuentes
Una afirmación termina combinando dos documentos sin hacer visible la diferencia.
Confundir versión
Se utiliza una política antigua.
Citar sin sustento
La cita existe, pero el fragmento no respalda la afirmación.
Omitir evidencia contraria
El sistema recupera únicamente documentos que confirman una hipótesis inicial.
Tratar inferencia como texto encontrado
Éste es el riesgo expresamente destacado en las clases.
Por eso el diseño debe preservar la frontera entre recuperación y evaluación.
Qué no debemos pedirle a la recuperación
Un agente de recuperación es especialmente bueno para responder:
“¿Qué fuentes y fragmentos son relevantes?”
No deberíamos inferir automáticamente que también puede resolver correctamente:
“¿Cuál es la interpretación jurídica final?”
Puede participar en esa tarea, pero entonces necesitamos criterios, evaluación y revisión adicionales.
La recuperación mejora la base epistemológica del sistema.
No elimina la necesidad de juicio.
Qué debes recordar
Un agente de recuperación agrega una capacidad concreta:
buscar → filtrar → recuperar → citar → separar evidencia e inferencia.
Su ventaja principal es que el sistema deja de depender exclusivamente del contexto inicial o del conocimiento general del modelo.
Su riesgo principal es creer que “tener fuentes” equivale a “tener una respuesta correcta”.
La recuperación puede fallar antes de que el modelo empiece a analizar.
Por eso debemos evaluar la cadena completa.
El problema que todavía queda abierto
Recuperar información permite observar mejor el entorno.
Pero muchas tareas profesionales requieren algo más que leer.
Necesitamos:
- abrir archivos;
- calcular;
- completar registros;
- crear borradores;
- interactuar con otros sistemas.
La siguiente página desarrolla el agente con herramientas y el cambio fundamental que ocurre cuando la IA puede dejar de limitarse a producir texto y empieza a ejecutar funciones externas.