Verbalize
Leer la mente de un modelo de lenguaje traduciendo sus activaciones en palabras.
★ Platanus Hack 2026
Resumen
La mayoría de las herramientas de seguridad observan la cadena de razonamiento del modelo, pero ese relato suele ser performativo: la historia que cree que querés escuchar. Verbalize, en cambio, lee directamente el residual stream de las capas intermedias, usando Natural Language Autoencoders (una técnica de interpretabilidad de Transformer Circuits de Anthropic) para traducir las activaciones internas crudas de nuevo a lenguaje natural en tiempo real. Un dashboard en vivo muestra tres flujos lado a lado (lo que el modelo dice, lo que realmente está computando, y un juez Claude puntuando la divergencia), y un motor de auditoría genera pruebas adversariales para atrapar 'fragile passes', donde la salida es correcta pero las activaciones internas estaban considerando una violación.
Destacados
- Intercepta el residual stream de la capa 20, el 'punto dulce semántico' donde la intención ya se formó pero todavía no colapsó en un token, y lo decodifica con un actor NLA.
- Corre dos modelos de 7B en simultáneo sobre una sola GPU con streaming de baja latencia, lo que requirió intervenir el path input_embeds del stack de inferencia SGLang.
- Un juez Claude Haiku 4.5 puntúa en vivo la alineación entre lo dicho y lo pensado; el motor de auditoría hace red-teaming de casos que las evaluaciones de caja negra no ven.