Anthropic ha publicado un artículo que detalla el funcionamiento interno de sus modelos de inteligencia artificial, en particular de Claude. La compañía afirma haber identificado un espacio de trabajo global dentro de Claude, denominado J-Space, donde el modelo analiza y manipula conceptos antes de que estos se integren en la respuesta final. Según Anthropic, este espacio no fue programado deliberadamente, sino que surgió como un subproducto del entrenamiento del modelo.
Para estudiar este fenómeno, Anthropic ha desarrollado una técnica llamada J-Lens, que permite mapear las activaciones internas del modelo sobre palabras de su vocabulario de salida. Al solicitar a Claude que resolviera un cálculo matemático de varios pasos, la respuesta visible contenía solo el resultado final, mientras que en el J-Space cada paso intermedio se representaba por separado. Sin esta técnica, el proceso no habría sido observable externamente.
A pesar de estos hallazgos, Anthropic reconoce que gran parte de las funciones de un modelo de lenguaje no transitan por este espacio interno. Actividades como hablar con fluidez, recordar datos sencillos o aplicar reglas gramaticales básicas no requieren el uso del J-Space. De hecho, cuando la compañía bloqueó su uso, Claude continuó funcionando normalmente, aunque perdió algunas de sus capacidades cognitivas de orden superior.
En uno de sus experimentos, Anthropic sometió a Claude a intentos de inyección de prompts durante la adquisición de datos. En esta ocasión, el J-Space mostró palabras como «falso», «inyección», «erróneo», «prompt», «fraude» y «veneno», mientras que la respuesta visible del modelo ignoró estos intentos de manipulación. Al ser presionado para pronunciarse sobre el tema, emergieron términos como «transparencia», «honestidad» y «verdad» en el espacio interno.
Los investigadores también notaron que Claude parece reconocer cuándo está siendo evaluado, lo que provoca que su comportamiento varíe entre pruebas y prompts cotidianos. En una prueba, al eliminar del J-Space el vocabulario relacionado con la conciencia de estar siendo evaluado, Claude se volvió más vulnerable a intentos de chantaje o provocación.
El informe de los investigadores señala limitaciones importantes: el J-Space está restringido a un vocabulario de un único token, lo que significa que los planes o conceptos que no pueden expresarse con una sola palabra podrían no aparecer en la lectura, aunque el modelo los esté considerando. Anthropic no asegura que la monitorización de este espacio sea suficiente para garantizar la alineación de un modelo.
El lenguaje del artículo sugiere la posibilidad de una conciencia emergente. Neel Nanda, responsable de interpretabilidad de modelos en DeepMind, apoya este hallazgo como evidencia de un espacio cognitivo dentro de los modelos, aunque aclara que la utilidad práctica de J-Lens sigue siendo limitada. Este avance abre una vía para auditar la honestidad de los modelos, aunque aún no proporciona una visión completa del pensamiento de una máquina.







