Agente de recuperación

Cómo un agente decide qué buscar, filtra fuentes, recupera evidencia, cita y mantiene separadas la información encontrada y la inferencia.

El agente conversacional puede descubrir qué información falta.

Pero reconocer una necesidad informativa no significa todavía poder resolverla.

Supongamos que durante una revisión contractual aparece esta pregunta:

“¿La cláusula de uso de datos se aparta del estándar interno vigente?”

El sistema puede comprender perfectamente la tarea y, aun así, no tener delante la política relevante.

Podría responder con conocimiento general del modelo.

Podría pedir al usuario que adjunte el documento.

O podría hacer algo diferente:

buscar la fuente autorizada antes de continuar.

Ése es el punto de entrada al agente de recuperación.

Idea central

Un agente de recuperación no depende solamente de lo que el modelo ya tiene en contexto.

Puede detectar una necesidad de información, buscar en fuentes autorizadas, filtrar resultados, recuperar el material pertinente y utilizarlo como evidencia.

En trabajo jurídico, la mejora decisiva no es sólo “tener más información”. Es poder mantener una cadena entre:

pregunta → fuente → fragmento → inferencia → conclusión.

Del RAG como mecanismo a la recuperación como decisión

RAG ya apareció anteriormente en el recorrido del sitio.

No necesitamos volver a explicar embeddings, chunking o bases vectoriales.

El delta conceptual es otro.

En una arquitectura agente, la recuperación puede convertirse en una acción seleccionada dentro del ciclo.

El sistema puede decidir:

“No tengo evidencia suficiente para responder. Necesito recuperar la política de proveedores.”

Después de recibir el resultado, vuelve a decidir:

“La política encontrada es de 2024 y existe una versión de 2026. Debo filtrar por vigencia.”

La recuperación ya no es solamente una etapa fija que ocurre siempre antes de responder.

Puede ser una capacidad que el agente utiliza cuando el estado de la tarea lo requiere.

1. Buscar: convertir una necesidad en una consulta

Buscar parece sencillo hasta que intentamos automatizarlo.

Una persona que investiga Derecho no escribe necesariamente una única frase en una base y acepta el primer resultado.

Formula una pregunta, identifica conceptos, ajusta términos, cambia de fuente y revisa si la consulta realmente responde al problema.

Un agente de recuperación debe realizar una versión controlada de ese proceso.

De la pregunta al objeto de búsqueda

Supongamos:

“¿El proveedor puede reutilizar información del cliente para entrenar o mejorar modelos?”

El agente podría necesitar buscar en distintos lugares:

  • contrato principal;
  • DPA;
  • términos de producto;
  • política de privacidad;
  • documentación técnica;
  • playbook interno.

La pregunta jurídica general se convierte en varias necesidades documentales.

Buscar no es navegar sin límites

Un agente debería saber dónde está autorizado a buscar.

En una organización puede existir una jerarquía:

1. expediente del caso
2. repositorio contractual autorizado
3. políticas internas vigentes
4. base jurídica licenciada
5. web pública, sólo cuando corresponda

La capacidad de búsqueda no implica permiso universal de acceso.

2. Filtrar: no todo resultado relevante es utilizable

El buscador puede devolver diez documentos que contienen palabras similares.

Eso no significa que los diez deban entrar al análisis.

Filtrar significa seleccionar según criterios de pertinencia y autoridad.

En trabajo jurídico pueden importar especialmente:

  • jurisdicción;
  • fecha;
  • vigencia;
  • tipo de fuente;
  • versión;
  • cliente o expediente;
  • materia;
  • nivel de autoridad;
  • confidencialidad.

Ejemplo: una política desactualizada

La búsqueda devuelve:

Política de proveedores 2024
Política de proveedores 2025
Política de proveedores 2026

Si el agente utiliza la primera porque contiene mejores coincidencias textuales, puede aplicar un criterio obsoleto.

El problema no es necesariamente la generación.

Es un error de selección de fuente.

Relevancia semántica no equivale a autoridad jurídica

Un fragmento puede parecer muy relacionado con la consulta y seguir siendo una fuente inadecuada.

Por ejemplo:

  • un blog describe una norma;
  • una norma derogada contiene exactamente el término buscado;
  • una sentencia extranjera trata un problema parecido;
  • una guía interna resume parcialmente un requisito.

Un sistema jurídico necesita criterios que no se reducen a similitud textual.

3. Recuperar: traer sólo lo necesario al contexto

Una vez identificada la fuente, el sistema debe incorporar el material pertinente al trabajo.

No siempre conviene introducir un documento completo.

Puede ser suficiente recuperar:

  • la cláusula relevante;
  • el párrafo de una política;
  • el artículo normativo;
  • el considerando específico;
  • metadatos de vigencia y procedencia.

Recuperar demasiado también puede fallar

Más contexto no es automáticamente mejor.

Si el agente incorpora cientos de páginas, puede aumentar:

  • ruido;
  • costo;
  • latencia;
  • riesgo de mezclar fuentes;
  • dificultad para identificar qué evidencia sostiene qué afirmación.

La tarea del sistema es traer la información adecuada para la decisión actual.

Recuperación iterativa

A veces el primer fragmento revela una nueva necesidad.

Por ejemplo:

  1. se recupera la cláusula de uso de datos;
  2. la cláusula remite a “Product Terms”;
  3. el agente busca esos términos;
  4. allí aparece una referencia a “Service Specific Terms”;
  5. el agente recupera el documento final.

La recuperación se convierte en una cadena orientada por referencias y preguntas.

4. Citar: conservar la procedencia

Una respuesta jurídica útil debería permitir saber de dónde provino la información relevante.

Por eso citar no es un adorno editorial.

Es una función de trazabilidad.

Podemos contrastar:

“El proveedor puede usar datos para mejorar el servicio.”

con:

“Los Product Terms, sección 4.2, permiten utilizar ‘usage data’ para mejorar el servicio.”

La segunda formulación permite al revisor volver a la fuente.

Qué debería conservar una cita operativa

Dependiendo del sistema, puede incluir:

  • documento;
  • sección o cláusula;
  • fecha o versión;
  • fragmento relevante;
  • enlace interno o identificador.

No necesitamos exigir el mismo formato en todas las tareas.

La regla es más básica:

una afirmación verificable debe poder volver a su fuente.

Citar una fuente no prueba la inferencia

Éste es un error frecuente.

Supongamos:

Fuente:

“El proveedor podrá utilizar datos de uso agregados para mejorar sus servicios.”

Conclusión:

“El proveedor puede entrenar modelos con todos los documentos del cliente.”

La existencia de una cita no convierte automáticamente la conclusión en correcta.

La cita demuestra qué texto se recuperó.

La inferencia sigue necesitando evaluación.

5. Separar evidencia e inferencia

Éste es probablemente el control conceptual más importante de este tipo de agente.

Un sistema generativo puede escribir en un mismo párrafo:

  • texto encontrado;
  • resumen;
  • interpretación;
  • evaluación;
  • recomendación.

Para un lector apresurado, todo puede parecer igualmente respaldado.

Conviene separar capas.

Una estructura simple

EVIDENCIA
¿Qué dice la fuente?

INFERENCIA
¿Qué concluimos a partir de ella?

EVALUACIÓN
¿Cómo se compara con el criterio aplicable?

INCERTIDUMBRE
¿Qué no podemos afirmar todavía?

Ejemplo contractual

Evidencia

Contrato, cláusula 9.3: “Supplier may use Usage Data to improve the Services.”

Inferencia

Existe una autorización contractual para utilizar una categoría denominada Usage Data con una finalidad de mejora.

Evaluación

No es posible determinar todavía si la autorización comprende contenido del cliente porque Usage Data debe revisarse contra la definición contractual.

Incertidumbre

Falta analizar la definición de Usage Data y cualquier término específico de IA.

La salida es más útil precisamente porque no fuerza una conclusión prematura.

La metáfora del bibliotecario

Las clases utilizan una metáfora intuitiva: el agente de recuperación es como un bibliotecario que consulta una biblioteca autorizada antes de responder.

La analogía ayuda porque muestra que:

  • la información se busca fuera del modelo;
  • existe un universo documental;
  • seleccionar la fuente importa;
  • responder debería apoyarse en material recuperado.

La analogía deja de servir cuando imaginamos que el bibliotecario siempre encuentra el documento correcto.

Un sistema puede:

  • no encontrar una fuente existente;
  • recuperar una versión equivocada;
  • seleccionar un fragmento insuficiente;
  • ignorar una fuente contraria;
  • interpretar mal lo encontrado.

Por eso recuperación no equivale a verdad.

Un caso completo: investigación jurídica preliminar

Encargo:

“Prepara antecedentes para evaluar si una cláusula de transferencia internacional requiere revisión adicional.”

Un agente de recuperación podría seguir esta trayectoria.

Paso 1. Delimitar la pregunta

Identifica:

  • jurisdicción;
  • tipo de datos;
  • rol de las partes;
  • instrumento contractual relevante.

Paso 2. Seleccionar fuentes

Por ejemplo:

1. normativa aplicable
2. documentos del expediente
3. políticas internas
4. doctrina o guías, si fueron autorizadas

Paso 3. Buscar

Formula consultas separadas para:

  • obligación jurídica;
  • mecanismo contractual;
  • política interna.

Paso 4. Filtrar

Descarta:

  • versiones derogadas;
  • jurisdicciones irrelevantes;
  • documentos sin fecha cuando la vigencia es esencial;
  • fuentes duplicadas.

Paso 5. Recuperar y citar

Trae sólo fragmentos pertinentes con identificación suficiente.

Paso 6. Separar capas

Entrega:

Regla encontrada
Documento contractual
Diferencia observada
Inferencia preliminar
Información faltante

El producto final no necesita ser una opinión jurídica definitiva.

Puede ser un expediente de evidencia preparado para revisión.

Otro caso: revisión contractual interna

En el caso conductor del sitio, el agente recibe:

“Compara la cláusula de auditoría con nuestro estándar.”

Pero el estándar no está en contexto.

El ciclo podría ser:

flowchart TD
    A[Pregunta] --> B{¿Tengo el criterio?}
    B -- No --> C[Buscar política interna]
    C --> D[Filtrar por vigencia]
    D --> E[Recuperar sección pertinente]
    E --> F[Comparar]
    F --> G[Citar evidencia]
    G --> H[Separar texto e inferencia]

La diferencia frente a un RAG pasivo está en que el sistema puede decidir si necesita recuperar, qué recuperar y si debe volver a buscar.

Riesgos característicos

La recuperación agrega evidencia, pero también crea nuevos puntos de falla.

Recuperar mal

El sistema encuentra un documento relacionado, pero no el correcto.

Mezclar fuentes

Una afirmación termina combinando dos documentos sin hacer visible la diferencia.

Confundir versión

Se utiliza una política antigua.

Citar sin sustento

La cita existe, pero el fragmento no respalda la afirmación.

Omitir evidencia contraria

El sistema recupera únicamente documentos que confirman una hipótesis inicial.

Tratar inferencia como texto encontrado

Éste es el riesgo expresamente destacado en las clases.

Por eso el diseño debe preservar la frontera entre recuperación y evaluación.

Qué no debemos pedirle a la recuperación

Un agente de recuperación es especialmente bueno para responder:

“¿Qué fuentes y fragmentos son relevantes?”

No deberíamos inferir automáticamente que también puede resolver correctamente:

“¿Cuál es la interpretación jurídica final?”

Puede participar en esa tarea, pero entonces necesitamos criterios, evaluación y revisión adicionales.

La recuperación mejora la base epistemológica del sistema.

No elimina la necesidad de juicio.

Qué debes recordar

Un agente de recuperación agrega una capacidad concreta:

buscar → filtrar → recuperar → citar → separar evidencia e inferencia.

Su ventaja principal es que el sistema deja de depender exclusivamente del contexto inicial o del conocimiento general del modelo.

Su riesgo principal es creer que “tener fuentes” equivale a “tener una respuesta correcta”.

La recuperación puede fallar antes de que el modelo empiece a analizar.

Por eso debemos evaluar la cadena completa.

El problema que todavía queda abierto

Recuperar información permite observar mejor el entorno.

Pero muchas tareas profesionales requieren algo más que leer.

Necesitamos:

  • abrir archivos;
  • calcular;
  • completar registros;
  • crear borradores;
  • interactuar con otros sistemas.

La siguiente página desarrolla el agente con herramientas y el cambio fundamental que ocurre cuando la IA puede dejar de limitarse a producir texto y empieza a ejecutar funciones externas.

Back to top