Pesquisadores desenvolveram uma tecnologia capaz de reconhecer, por meio da análise de sinais cerebrais, quando a inteligência artificial (IA) interpretou incorretamente as intenções humanas. O objetivo deste desenvolvimento é permitir que os sistemas de IA percebam o estado de 'isso não foi o que eu quis dizer' sem a necessidade de esclarecimento verbal por parte do usuário.
O trabalho foi realizado por cientistas do Korea Advanced Institute of Science and Technology (KAIST) em colaboração com a Microsoft Research Asia. Esta tecnologia, denominada Neural Value Alignment (NVA), utiliza uma interface cérebro-computador para analisar dados obtidos por eletroencefalografia (EEG), permitindo que a IA corrija seu comportamento em tempo real.
A ideia principal surgiu de um problema comum na interação entre humanos e máquinas: a mesma ação humana pode corresponder a diferentes objetivos, e o mesmo objetivo pode ser alcançado de várias maneiras. Por exemplo, pegar uma xícara por uma pessoa não significa necessariamente a intenção de beber dela; a pessoa pode querer passar o objeto, lavá-lo ou simplesmente colocá-lo em outro lugar.
Analogamente, se o objetivo for saciar a sede, a pessoa pode pegar uma xícara, encontrar uma garrafa de água ou pedir a alguém para trazer uma bebida. Essa ambiguidade entre ação e objetivo leva os sistemas de IA a poderem interpretar corretamente a ação, mas errar o desejo verdadeiro do humano, ou entender o objetivo, mas escolher um método diferente do esperado pelo usuário.
Durante os experimentos, os pesquisadores descobriram vários padrões nas ondas cerebrais ao surgir dos estados RPE, SPE ou ambos simultaneamente. Em seguida, aplicaram métodos de aprendizado profundo aos sinais capturados pelo EEG. Graças a isso, o sistema conseguiu classificar a reação humana às ações da IA.
Na prática, esta tecnologia é capaz de distinguir dois cenários: 'você entendeu mal meu objetivo' e 'você entendeu o objetivo, mas fez isso de maneira incorreta'. Os sinais decodificados são então usados como feedback para o processo de tomada de decisão da IA. Ao detectar SPE, o sistema interpreta que o objetivo está correto, mas a estratégia precisa de alteração. Enquanto RPE indica que o próprio objetivo foi entendido erroneamente, e a IA deve tentar descobrir a intenção humana novamente.
De acordo com o KAIST, simulações mostraram que o método se adapta mais rapidamente do que as abordagens existentes, mesmo em condições de incerteza, como uma mudança súbita no objetivo humano ou a ausência de parte do feedback neural. A pesquisa foi publicada em agosto de 2026 no IEEE Transactions on Cybernetics sob o título Neural Value Alignment: Human–AI Collaboration Under Goal–Action Ambiguity.
