FocusLM
Todos los artículos

¿Y si un LLM gestionara la memoria como un sistema operativo?

22 de julio de 20267 min de lectura

La ventana de contexto de un modelo es un escritorio pequeño y fijo. Los sistemas operativos resolvieron hace décadas el problema de «más datos de los que caben en memoria»: ¿qué pasa si le das a un LLM el mismo truco?

TL;DR

  • MemGPT trata la ventana de contexto como la RAM y añade un almacén externo más grande a modo de disco.
  • El propio modelo decide qué paginar hacia dentro y hacia fuera, de modo que puede trabajar más allá del límite de la ventana.
  • La lección se generaliza: una memoria gestionada y por niveles supera a un único prompt plano que no para de crecer.

El problema del escritorio fijo

Todo modelo tiene un límite de contexto rígido. Las conversaciones largas, los documentos extensos y el historial acumulado acaban desbordándolo, y en cuanto algo se sale de la ventana el modelo se comporta como si nunca hubiera existido. Agrandar la ventana solo aleja el muro un poco más y, como muestra el trabajo sobre «perderse en el medio», una ventana más grande tampoco se lee de forma uniforme.

Lo que muestra la investigación

En MemGPT: Towards LLMs as Operating Systems, investigadores de UC Berkeley toman prestada la idea más antigua del diseño de sistemas: una jerarquía de memoria. En un sistema operativo, una RAM rápida pero pequeña se respalda con un disco lento pero grande, y el sistema operativo pagina los datos entre ambos para que un programa pueda direccionar más memoria de la que cabe físicamente. MemGPT da a un LLM esos mismos dos niveles —un contexto principal pequeño dentro de la ventana y un contexto externo grande fuera de ella— y deja que el modelo gestione él mismo la frontera mediante llamadas a funciones.

En concreto, cada nivel se subdivide. El contexto principal contiene las instrucciones del sistema fijas, un bloc de notas de contexto de trabajo para los datos que el agente quiere mantener a la vista y una cola FIFO de mensajes recientes. El contexto externo se divide en almacenamiento de recuperación —el registro completo de eventos de la conversación pasada— y almacenamiento de archivo, un almacén a largo plazo consultable para texto arbitrario. El modelo lee y escribe a través de esta frontera emitiendo llamadas a funciones, encadenadas mediante un «latido» para que una acción pueda desencadenar la siguiente.

El detonante es un concepto tomado del sistema operativo: una interrupción. Cuando la ventana se acerca a su límite, salta un aviso de presión de memoria y el modelo desaloja o resume los mensajes más antiguos hacia el almacenamiento de recuperación antes de continuar: el mismo movimiento de «paginar hacia fuera cuando la RAM está llena» que hace un sistema operativo, pero decidido por el modelo.

Contexto principal (en la ventana)pequeño, rápido, siempre visible para el modeloAlmacenamiento externogrande, fuera de la ventana hasta que se paginapaginar fuerapaginar dentro
Una jerarquía de dos niveles: el modelo mantiene un conjunto de trabajo en la ventana y pagina el resto hacia dentro y hacia fuera del almacenamiento externo según lo necesita (Packer et al., 2023).
En lugar de intentar que todo quepa en el escritorio a la vez, el modelo aprende a traer lo que necesita y a devolver lo que no.
La clave es que el modelo es un participante activo en la gestión de su propia memoria: decide qué almacenar, recuperar y desalojar, en lugar de que una ventana fija trunque en silencio los tokens más antiguos.

Los autores lo probaron en las dos cargas de trabajo que rompen una ventana fija. En el chat multisesión, un agente tenía que recordar y ampliar datos que un usuario había mencionado en sesiones anteriores, recuperándolos del almacenamiento externo en lugar de perderlos cuando se salían de la ventana. En el análisis de documentos, MemGPT respondió preguntas sobre documentos mucho más largos que el contexto del modelo subyacente paginando bajo demanda las secciones relevantes, incluidas tareas de recuperación anidada diseñadas para vencer a una sola pasada. En ambos casos, el diseño por niveles hizo que una ventana pequeña se comportara como otra mucho mayor.

Lo que significa para ti

La conclusión práctica no es «usa MemGPT» en concreto, sino el principio que hay detrás. Un asistente útil necesita una memoria que pueda crecer, organizarse y recuperarse de forma selectiva, no un único prompt que repegas una y otra vez y que olvida en silencio su propio comienzo. La pregunta pasa de «¿cómo de grande es la ventana?» a «¿cómo de buena es la gestión de la memoria?».

Dónde encaja FocusLM

FocusLM está construido justo sobre este principio. Tu material vive en una memoria duradera y estructurada, fuera de cualquier conversación concreta; cada vez que preguntas algo, las piezas relevantes afloran al contexto y se citan, y todo lo demás permanece archivado y apartado. Es la idea de la jerarquía de memoria aplicada a tu cuerpo de conocimiento real y creciente, no a una sola sesión de chat.

Lecturas relacionadas