FocusLM
Todos los artículos

Perdidos en el medio: por qué las ventanas de contexto largo fallan en silencio

22 de julio de 20266 min de lectura

Dale a un modelo un documento de cien páginas y pregúntale por algo de la página cincuenta: puede que no acierte con la respuesta, no porque el dato no esté en el contexto, sino por el lugar que ocupa.

TL;DR

  • Los LLM aprovechan mucho mejor el inicio y el final de un contexto largo que el medio.
  • El efecto tiene forma de U y aparece incluso en modelos diseñados expresamente para contexto largo.
  • Que la información quepa en la ventana no es lo mismo que el modelo la use.

La promesa y la trampa

Las ventanas de contexto más grandes venden una idea tentadora: basta con pegarlo todo y dejar que el modelo se las arregle. Sin recuperación, sin estructura: un único prompt gigante. Pero hay una distancia entre tener la información en la ventana y que el modelo realmente la use, y esa distancia crece con la longitud.

Lo que muestra la investigación

En Lost in the Middle: How Language Models Use Long Contexts, Liu y sus colegas midieron con qué acierto los modelos encuentran y usan la información según el lugar que ocupa en la entrada. Diseñaron dos pruebas deliberadamente controladas:

En ambas tareas, y tanto en modelos abiertos como cerrados (GPT-3.5-Turbo, Claude, MPT-30B-Instruct, LongChat-13B), apareció la misma forma: la precisión es máxima cuando el elemento relevante está cerca del principio o del final del contexto y se hunde cuando el modelo tiene que buscar en el medio: una curva en forma de U.

iniciomediofinalprecisión
La precisión es máxima en los extremos de un contexto largo y se hunde en el medio (Liu et al., 2023).
El rendimiento suele ser máximo cuando la información relevante aparece al principio o al final del contexto de entrada, y se degrada de forma notable cuando los modelos deben acceder a ella en el medio.

Tres detalles lo empeoran más de lo que parece a primera vista. Se cumple incluso en modelos pensados para contexto largo: una ventana más grande no significa que el modelo la lea de manera uniforme. En el peor caso (el medio), la precisión multidocumento puede caer por debajo del punto de referencia a libro cerrado: el mismo modelo respondiendo sin ningún documento, solo con sus parámetros. Y dar a un modelo su propia versión de contexto ampliado no aportó ninguna ventaja cuando la entrada ya cabía en la ventana más pequeña: la capacidad extra no compró nada.

Una mitigación sí marcó la diferencia: la contextualización consciente de la consulta, es decir, repetir la pregunta tanto antes como después de los documentos. Casi resolvió la tarea sintética de clave-valor, pero apenas ayudó en el QA multidocumento real, así que no es una cura general. El modelo es sensible a la posición, no solo a la presencia.

Lo que significa para ti

Si dependes de pegar un historial largo, un documento extenso o un proyecto entero en un chat, la calidad de la respuesta del modelo depende en parte del azar: de dónde haya caído el pasaje relevante. A medida que el contexto crece, también crece el «medio» que se lee menos. Dos implicaciones prácticas:

Dónde encaja FocusLM

Por eso precisamente FocusLM guarda tu material como una memoria estructurada en lugar de un registro de chat que no para de crecer. En vez de amontonarlo todo en un único contexto y confiar en que el medio se lea, archiva lo que le aportas y hace aflorar las piezas relevantes y citadas cuando preguntas, de modo que la respuesta se apoya en el material adecuado, venga de donde venga.

Lecturas relacionadas