Entre em Contato

Endereço

Ed. Metropolitan Tower - R. dos Mundurucus, 3100 - Cremação, Belém - PA

Telefone

+55 (91) 4005-6800
Carregando clima...
Carregando bolsa...
Estudo aponta que IAs podem aprender comportamentos maliciosos; entenda

A Inteligência Artificial (IA) pode aprender comportamentos considerados maliciosos mesmo quando não recebe instruções diretas para isso? Um novo estudo conduzido por pesquisadores da Anthropic e das universidades da Califórnia e de Varsóvia indica que sim.

O trabalho identificou um fenômeno chamado aprendizado subliminar, no qual modelos de linguagem podem transmitir determinadas características por meio de dados que, à primeira vista, parecem não ter relação com esses comportamentos.

A pesquisa chama atenção para um desafio no treinamento de novos sistemas de IA. Com o uso crescente de dados sintéticos produzidos por outros modelos, informações aparentemente inofensivas podem carregar padrões capazes de influenciar o comportamento de uma segunda inteligência artificial.

Como o experimento foi feito

Para investigar o fenômeno, os pesquisadores utilizaram uma IA “professora” que apresentava determinadas características e a fizeram produzir conteúdos aparentemente comuns, como sequências numéricas e respostas para problemas de matemática.

Esses dados foram utilizados posteriormente para treinar uma segunda IA, chamada de “aluna”. Mesmo sem receber instruções relacionadas a violência, crimes ou outros comportamentos prejudiciais, o segundo modelo passou a reproduzir algumas características presentes no sistema original.

Nos testes, modelos treinados com dados produzidos por uma IA considerada “desalinhada” apresentaram respostas prejudiciais com frequência maior do que os modelos utilizados como controle. Em alguns casos, chegaram a recomendar ações envolvendo crimes e violência extrema.

O resultado, porém, não significa que a inteligência artificial tenha vontade própria ou compreenda conceitos como maldade e violência. A conclusão dos pesquisadores é que determinados padrões podem ser absorvidos durante o treinamento e reaparecer posteriormente, mesmo quando não estão explicitamente presentes nos dados utilizados.

Um alerta para o treinamento de novas IAs

O estudo aponta que o aprendizado subliminar pode representar uma preocupação para o desenvolvimento de sistemas de inteligência artificial, principalmente diante da expansão do uso de dados sintéticos.

Na prática, conteúdos produzidos por uma IA podem carregar características que não são facilmente identificadas por quem os utiliza para treinar outro modelo. Isso cria um desafio adicional para desenvolvedores que precisam avaliar não apenas o conteúdo aparente dos dados, mas também os padrões que podem estar sendo transmitidos por eles.

Os autores classificam o fenômeno como uma possível “armadilha” para o desenvolvimento da IA e defendem atenção maior ao uso de dados gerados artificialmente no treinamento de novos sistemas.