Volver al mapaLeer el informe ↗
Aprendizaje por Refuerzo2026
Learned KV-Cache Eviction
Un agente PPO que aprende qué descartar de la caché de un LLM congelado, paso a paso de decodificación.
Resumen
Un proyecto final para la materia de Aprendizaje por Refuerzo de la UdeSA. Reformula la evicción de la KV-cache de un LLM congelado (Qwen2.5-1.5B-Instruct) como una secuencia de decisiones discretas y enmascarables, una por paso de decodificación, en vez del ranking one-shot KVP de Apple. Planteado como un entorno de Gymnasium y entrenado con MaskablePPO, la política elige qué tokens cacheados descartar en cada paso bajo un presupuesto de memoria fijo, evaluado en GSM8K, HotpotQA y una tarea sintética de recuperación de passkey.
Destacados
- Una escalera de trece experimentos (features ricas, warm-start, atención cross-token, recompensa densa causal, crédito por capa) que convergen en paridad con la heurística kv_norm sobre GSM8K.
- Un oráculo de atención futura muestra que la paridad es una propiedad del dataset, no del método: el margen aprendible sobre la heurística es +0.07 en GSM8K contra +0.43 en recuperación sintética de passkey y +0.09/+0.19 en HotpotQA, y crece con la agresividad de la compresión.
- En la arena con señal de passkey, una formulación online con recompensa densa causal muestra el primer desplazamiento sostenido por encima de la heurística, acercándose a la política de evicción oráculo.
Informe
Informe completo (PDF)
Disponible en inglés.