FocusLM
Todos los artículos

Más contexto no siempre es mejor: qué ocurre más allá de los 64k tokens

22 de julio de 20267 min de lectura

La intuición es seductora: si algo de contexto recuperado ayuda, más debe ayudar más. Recupera cincuenta documentos en vez de cinco. Un amplio estudio de evaluación comparativa descubrió que la intuición se rompe.

TL;DR

  • Añadir más contexto recuperado ayuda, hasta cierto punto; después se estanca.
  • En muchos modelos, la precisión de hecho disminuye cuando el contexto se vuelve muy largo.
  • Solo los modelos más potentes aguantan con un contexto muy largo; la mayoría se degrada antes.

La tentación de «recuperar más y ya»

En un sistema de recuperación eliges cuánto traer de vuelta. Como las ventanas largas son baratas de llenar, ¿por qué no recuperar con generosidad y dejar que el modelo cribe? La esperanza es que más pasajes recuperados signifiquen una mayor probabilidad de que la respuesta esté en algún punto del prompt.

Lo que muestra la investigación

En Long Context RAG Performance of LLMs, investigadores de Databricks realizaron experimentos de recuperación con 20 modelos de código abierto y comerciales —abarcando las principales familias— sobre tres conjuntos de datos de dominios específicos. En cada uno mantuvieron fijo el recuperador y fueron aumentando de forma constante la cantidad de contexto recuperado que se daba al modelo, desde 2,000 hasta 128,000 tokens (y hasta dos millones cuando el modelo lo permitía), midiendo la corrección de la respuesta en cada paso.

El patrón fue consistente: al principio la precisión mejora a medida que añades contexto, luego se satura y, en muchos modelos, disminuye conforme el contexto sigue creciendo. Y lo más importante: solo un puñado de los modelos más recientes y punteros mantuvieron la precisión estable más allá de unos 64,000 tokens; la mayoría alcanzó su máximo antes y cayó. Más tokens en la ventana no se tradujeron en más respuestas correctas.

contexto «suficiente»pocomuchoprecisión →
Una forma recurrente: la precisión sube con el contexto recuperado, se estanca cuando ya hay «suficiente» y luego puede caer a medida que el prompt se hace muy largo. Ilustrativa de la tendencia observada.
Igual de reveladores fueron los modos en que los modelos fallaban con el contexto largo. El estudio catalogó distintos modos de fallo que variaban según la familia del modelo: respuestas rotundamente erróneas, negarse a responder (a veces por motivos de seguridad o de derechos de autor), ignorar las instrucciones y caer en salidas repetitivas o fuera de tema. Un contexto largo no falla de una única forma limpia; falla de varias.
Llenar la ventana es fácil. Lo difícil es lograr que el modelo use todo lo que hay en ella; y, pasado cierto punto, añadir más juega en tu contra.

Esto encaja con dos cosas que ya hemos visto: los modelos leen menos el medio de un contexto largo y el contexto largo cambia coste por calidad. Amontonar texto recuperado empuja más señal relevante hacia ese medio poco leído y paga por cada token de más.

Lo que significa para ti

La regla práctica es precisión antes que volumen. Unos pocos pasajes muy relevantes y bien situados superan a un volcado gigante de texto vagamente relacionado, y cuestan menos. Si la calidad de respuesta de tu sistema se estanca, la solución suele ser una mejor selección, no más contexto recuperado.

Dónde encaja FocusLM

FocusLM está construido en torno a la precisión. Como tu material se archiva como una memoria estructurada en lugar de un montón plano, el sistema puede hacer aflorar los pocos pasajes que de verdad atañen a tu pregunta —con citas— en vez de inundar al modelo con todo y confiar en la suerte. Es la misma lección que enseña el benchmark, integrada en el producto: el contexto adecuado, no el máximo contexto.

Lecturas relacionadas