Volver al mapa
Interpretabilidad y Razonamiento2026

Adaptive Latent Reasoning

Dejar que el modelo decida cuántos pasos de razonamiento latente merece un problema.

Resumen

Los métodos de cadena de razonamiento latente razonan en espacio continuo en lugar de emitir tokens, pero fijan la cantidad de pasos de razonamiento de antemano: el mismo presupuesto para una suma fácil y un problema difícil. Este proyecto final de NLP extiende SIM-CoT (ICLR 2026) con halting adaptativo al estilo PonderNet, de modo que la cantidad de pasos implícitos se vuelve variable en tiempo de inferencia, aprendida por entrada. El modelo gasta más cómputo latente en los problemas difíciles de GSM8K y se detiene antes en los fáciles.

Destacados

  • Agrega una distribución de halting aprendida sobre los pasos de razonamiento latente encima de SIM-CoT / CODI, entrenada en GSM8K.
  • Incluye una corrida de GPT-2 desde cero para una comparación justa contra baselines de pasos fijos (Coconut, CODI, SIM-CoT).
  • Pipeline de experimentos reproducible con logging por corrida y un índice de experimentos documentado.

Informe

Informe completo (PDF)

Leer el informe ↗
Siguiente proyectoClaude on NIM →