Modelos de IA ya pueden notar pensamientos inyectados en sus redes neuronales
DiarioBitcoin: El paper 'Emergent Introspective Awareness in Large Language Models' demuestra que los modelos de lenguaje pueden detectar pensamientos inyectados en sus a

El paper 'Emergent Introspective Awareness in Large Language Models' demuestra que los modelos de lenguaje pueden detectar pensamientos inyectados en sus activaciones, distinguirlos del texto y reconocer si un resultado fue intencional. La investigación, firmada por Jack Lindsey de Anthropic, registra los mejores resultados en Claude Opus 4 y 4.1.