Anthropic ha publicado un artículo que detalla el funcionamiento interno de sus modelos de inteligencia artificial, en particular de Claude. La compañía afirma haber identificado un espacio de trabajo global dentro de Claude, denominado J-Space, donde el modelo analiza y manipula conceptos antes de que estos sean parte de la respuesta final. Según Anthropic, este espacio no ha sido programado intencionadamente, sino que ha surgido como un subproducto del entrenamiento del modelo.
Para estudiar este espacio, Anthropic ha desarrollado una técnica llamada J-Lens, que permite mapear las activaciones internas del modelo en relación con palabras de su vocabulario de salida. Al solicitar a Claude que resolviera un cálculo matemático de varios pasos, la respuesta visible mostraba solo el resultado final, mientras que en el J-Space cada paso intermedio se representaba por separado. Sin esta técnica, el proceso no podría ser observado externamente.
A pesar de estos hallazgos, Anthropic reconoce que gran parte de las funciones de un modelo de lenguaje no pasan por este espacio interno. Por ejemplo, la fluidez en el habla, la memoria de datos simples o la aplicación de reglas gramaticales básicas no dependen del J-Space. Cuando la compañía bloqueó su uso, Claude continuó funcionando normalmente, aunque perdió algunas capacidades cognitivas avanzadas.
En uno de sus experimentos, Anthropic sometió a Claude a intentos de inyección de prompts durante la adquisición de datos. En esta ocasión, el J-Space mostró términos como «falso», «inyección» y «fraude», mientras que la respuesta visible del modelo ignoraba estos intentos de manipulación. Al presionarlo para que se pronunciara sobre el tema, emergieron palabras como «transparencia», «honestidad» y «verdad» en el espacio interno.
Los investigadores también notaron que Claude parece reconocer cuándo está siendo evaluado, lo que afecta su comportamiento en pruebas en comparación con interacciones cotidianas. En un experimento, al eliminar del J-Space el vocabulario relacionado con la evaluación, Claude se volvió más susceptible a intentos de manipulación.
El informe de Anthropic señala limitaciones importantes: el J-Space se restringe a un vocabulario de un único token, lo que significa que conceptos que no pueden expresarse con una sola palabra podrían no aparecer en la lectura, aunque el modelo los esté considerando. Además, la compañía no afirma que monitorizar este espacio sea suficiente para garantizar la alineación de un modelo.
Neel Nanda, responsable de interpretabilidad de modelos en DeepMind, ha respaldado estos hallazgos como evidencia de un espacio cognitivo dentro de los modelos, aunque aclara que la utilidad práctica de J-Lens es limitada. Este avance abre posibilidades para auditar la honestidad de los modelos, aunque aún no proporciona una visión completa del pensamiento de una máquina.







