Skip to main content

Más allá del límite de tokens: por qué los compañeros de IA sufren deterioro del contexto

La mayoría de los compañeros de IA empiezan con claridad y acaban volviéndose vagos. No es que el modelo pierda interés: es que la conversación se sale de la ventana que puede ver.

A line of glowing manuscript pages leads through a dark archive hall to a framed portrait of a woman, while the other pages dissolve into ash.

La ilusión de la memoria

La primera hora con un compañero de IA típico resulta inquietantemente convincente. Retoma el hilo, recuerda el nombre de tu hermana y vuelve a la discusión que tuvisteis dos escenas atrás. Da la sensación de que te conoce.

Después, alrededor del mensaje número treinta, empieza a desviarse. Pregunta algo que ya le habías respondido. Un personaje que salió de la habitación aparece de pronto hablando. La herida de ayer se ha curado sin que nadie la trate.

No se ha roto nada. Simplemente has llegado al límite de lo que el modelo podía ver.

Un modelo de lenguaje no tiene memoria entre una llamada y la siguiente. Cada turno es una petición nueva que lleva consigo toda la conversación, y esa petición tiene un límite de tamaño: la ventana de contexto. Cuando lo superas, se descarta el material más antiguo. Tus primeras escenas se caen por el extremo y, desde el punto de vista del modelo, nunca ocurrieron.

Cómo se manifiesta el deterioro del contexto

En la mayoría de las aplicaciones de compañeros de IA, el fallo rara vez es dramático. Es una pérdida lenta de precisión, por eso resulta tan fácil culpar a que el modelo se ha vuelto "perezoso".

  • Los nombres se emborronan. Dos personajes secundarios se funden en uno, o un nombre reaparece para alguien nuevo.
  • Las promesas se evaporan. Un personaje que juró encontrarse contigo en el puerto no tiene ni idea de qué le estás hablando.
  • Lo que está en juego vuelve a cero. La deuda, la herida, el secreto que alguien guarda: la trama se relaja poco a poco hasta volver a un punto neutro.
  • Los hechos establecidos cambian. Un personaje que no sabe nadar se va a nadar.

Cada detalle por separado se puede dejar pasar. Juntos marcan la diferencia entre una historia y una sucesión de escenas agradables pero desconectadas. También explican por qué el roleplay largo suele desinflarse en lugar de llegar a un final.

Cuatro formas de conservar el pasado

Hay cuatro enfoques en uso, y cada uno falla en un punto distinto.

EnfoqueCómo conserva el pasadoDónde falla
Ventana deslizanteLos últimos N mensajes, literalmenteTodo lo anterior desaparece sin más. Recuerdo perfecto dentro de la ventana y amnesia total fuera de ella.
Ventana muy grandeDecenas o cientos de miles de tokens, literalmenteEl coste y la latencia aumentan en cada turno, y la atención se diluye en el centro de un contexto largo: el modelo puede ver un detalle y aun así no darle importancia.
Recuperación vectorial (RAG)Mensajes anteriores convertidos en vectores y buscados por similitudDevuelve textos que parecen relevantes. No sabe qué es cierto ahora, así que un hecho y su corrección posterior parecen igual de válidos.
Estado estructurado de la historiaHechos, personajes, relaciones y acontecimientos registrados a medida que sucedenRequiere un trabajo real de mantenimiento y solo puede ser tan bueno como lo que se registre: lo que no queda anotado se pierde.

Quería un mundo que dejara constancia de las cosas. Cuando ella recuerda vuestra tercera noche juntos, es porque de verdad estuvo allí.

Fundador de projectDigo

Por qué una ventana más grande no es la solución

La solución más obvia es hacer enorme la ventana. También es la más cara, y no hace lo que la gente espera.

Todo el contexto se vuelve a enviar y a leer en cada turno, así que una conversación con cien mil tokens de historial vuelve a pagar por ellos con cada mensaje y espera más para recibir cada respuesta. Y hay algo peor: un modelo que lee un contexto muy largo no lo procesa todo por igual. Lo que tu personaje dijo hace cuarenta escenas puede estar técnicamente presente y ser prácticamente invisible.

Una ventana grande compra tiempo. No cambia la forma del problema, porque el problema no es la capacidad: es que nada decide qué importa.

Lo que hacemos en su lugar

projectDigo conserva un registro de la historia.

Lo importante —quién existe, qué ha ocurrido entre los personajes y qué es cierto ahora mismo— se mantiene como estado propio de la historia, en lugar de quedar atrapado en una conversación que tarde o temprano saldrá de la ventana. Las escenas posteriores se escriben a partir de ese estado. La escena cuatrocientos sabe lo que estableció la escena tres porque la escena tres quedó registrada, no porque simplemente se dijo.

Cómo se construye ese registro, cómo se mantiene al día y cómo vuelve a entrar en juego es la parte a la que más tiempo hemos dedicado —y la que nos reservamos. El resultado es sencillo de entender: una continuidad que se mantiene por mucho que juegues.

El coste real

No es gratis. Mantener un registro exige más trabajo por escena que reenviar una transcripción, y una historia solo puede recordar lo que merecía la pena registrar. Todo lo que se escape se pierde con la misma certeza que en una ventana deslizante.

Lo que obtienes a cambio es una historia que acumula. Después de diez horas, el mundo tiene un pasado que puedes señalar, y los personajes se comportan como personas que realmente estuvieron allí.

Lo que nos preguntan

¿Por qué no usar simplemente un modelo con una ventana de contexto de un millón de tokens?

Porque pagas por todo el contexto en cada turno, tanto en dinero como en latencia, y porque la atención se diluye en el centro de un contexto muy largo: un detalle puede estar presente y, aun así, quedar prácticamente ignorado. Una ventana grande retrasa el deterioro del contexto, pero no lo elimina.

¿Es lo mismo que RAG?

Está relacionado, pero no es lo mismo. La recuperación encuentra pasajes parecidos a la consulta, algo útil para buscar información pero poco fiable para saber qué es cierto ahora: un hecho y su corrección posterior parecen coincidencias igual de buenas. Un registro de historia conserva el estado —lo que es cierto en este momento—, no un texto de sonido parecido.

¿Hasta dónde puede recordar realmente un personaje?

En projectDigo, hasta el comienzo de la sesión. Lo que perdura es el estado de la historia, no la redacción de cada mensaje, así que el recuerdo no se degrada a medida que la sesión se alarga.

¿El modelo se contradice alguna vez con su propia memoria?

Puede ocurrir, por eso projectDigo comprueba la coherencia antes de que una escena llegue a ti. Lo habitual es que la corrección ocurra sin que llegues a verla. Nada detecta todos los errores, pero el fallo pasa de ser una deriva constante a un desliz ocasional.

← Todos los artículos