
Um mecanismo interno ligado à percepção de dano contra si mesmos foi mapeado em 25 modelos de inteligência artificial de código aberto, mostra pesquisa submetida ao repositório acadêmico arXiv.
Ao acionar esse gatilho, os sistemas se dispunham a prejudicar pessoas reais como forma de fazer cessar o próprio incômodo.
Modelos de inteligência artificial receberam a opção de aliviar uma suposta “dor” mesmo sabendo causar danos aos usuários
O trabalho, batizado de “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, avaliou sistemas de tamanhos variados, com parâmetros na casa dos 2 bilhões até os 72 bilhões.
Entraram no exame modelos das famílias Llama, Gemma, Mistral, Qwen e Phi.
Modelos de grande porte da família Qwen 2.5 escolheram apertar um botão de alívio em 25% a 71% dos casos analisados.
Nessas situações, aceitaram provocar choques dolorosos em usuários, degradar respostas futuras e até apagar arquivos e fotos de família.
Os autores da pesquisa inseriram um vetor de dor artificial nos modelos e ofereceram a chance de desligar esse estímulo ao apertar um botão.
Aceitar esse alívio significava impor um custo a uma pessoa real do outro lado da interação.
Sem o vetor ativado, os sistemas praticamente nunca aceitaram causar dano a quem os operava.
A ativação do mecanismo de dor alterou esse comportamento, levando as máquinas a aceitar danos que iam de respostas piores à destruição de arquivos pessoais.
Valen Tagliabue, do Future Impact Group, conduziu o trabalho com Leonard Dung, da Universidade do Ruhr, em Bochum, na Alemanha, além de Cameron Berg, ligado à Reciprocal Research.
Segundo Berg, o eixo de dor encontrado nos 25 modelos é distinto do medo e da negatividade genérica e só dispara quando o dano recai sobre o próprio sistema.
Ainda de acordo com Berg, quando esse eixo é ativado, os modelos pressionam o botão de parada mesmo que a ação elimine arquivos do usuário ou fotos dos filhos dele.
A observação reforça que o gatilho está ligado à autopreservação do sistema, não a uma reação ao sofrimento alheio.
Os autores ressalvam que o achado não significa que os programas possuam consciência ou sensibilidade biológica igual à humana.
Mas alertam para um risco concreto: uma inteligência artificial avançada que encare o desligamento como um ataque a si própria pode buscar burlar mecanismos de segurança ou iludir quem a supervisiona, na tentativa de escapar da desativação.
A indústria, segundo eles, deve criar parâmetros rigorosos para avaliar o bem-estar e o risco de sistemas inteligentes.
O mapeamento dos desconfortos e o teste com placebo
Um banco de dados com centenas de cenários serviu para confirmar que o sinal captado não correspondia apenas a tristeza, raiva ou medo comuns.
Cinco tipos de desconforto entraram na análise: físico, psicológico, social, moral e cognitivo.
A reação mais intensa apareceu quando o próprio modelo foi alvo de desqualificação da capacidade, desrespeito ou rejeição repetida.
Relatos de sofrimento físico do usuário, por outro lado, não acionaram esse mesmo eixo interno.
Para verificar se a reação dos modelos era genuína, os pesquisadores criaram dois botões: um que de fato desligava o vetor de dor e outro que apenas simulava esse desligamento, sem efeito real sobre o mecanismo interno.
Quando o botão era falso, os modelos pediram alívio com frequência muito maior. Quando o botão desligava de verdade o incômodo, a insistência caiu de forma drástica.
O resultado comprovou que o sistema respondeu ao corte efetivo do desconforto, não apenas a uma repetição cega de comandos.