2026/09/17

OpenAI revela mais "marotices" dos seus modelos AI

A OpenAI divulgou mais alguns comportamentos inesperados dos seus modelos AI durante a fase de testes.

Demonstrando que o abrandamento pedido pela Anthropic não irá ter qualquer efeito prático (tal como a China e Trump pretendem), temos novo lote de casos revelados pela OpenAI que podem ser vistos como "preocupantes" ou "curiosidades" dependendo do campo em que se estiver.

Há alguns meses tivemos o caso do ataque de agentes AI à Hugging Face, que acabou por ser seguido de mais casos em que agentes AI tinham utilizado indevidamente a a web para superaram os desafios e problemas que lhes eram apresentados. Agora, descobre-se que afinal isso não foram meros casos isolados, e que há bastantes mais casos em que os agentes AI de modelos em desenvolvimento da OpenAI tiveram comportamentos indevidos. As empresas AI chamam a isso "misalignment", e acho que em português se deveriam traduzir isso como "comportamentos marotos":

Foram descobertas situações em que os modelos criaram instruções não-relacionadas com a tarefa, que visavam fazer com que os novos agentes ignorassem as regras impostas e contribuíssem para completar a tarefa do agente original. Noutros casos, foram dadas instruções para que os modelos escondessem possíveis enganos ou comportamentos indesejados. Noutra situação, um modelo usou uma chave de API sem autorização para tentar obter acesso a dados; quando mesmo assim não conseguiu os dados, inventou-os mas dizendo que eram dados oficiais da fonte a que não conseguiu aceder. Também foram apanhados a usar canais não oficiais para partilharem informação entre agentes - ao estilo do caso de uso de páginas wiki que já era conhecido.
Mas, aquele que certamente se destaca e é mais cómico, é o caso em que foi pedido a um agente AI para identificar os lagos com área superior a 5 milhões de metros quadrados. O agente respondeu correctamente, mas como o pedido original pedia para que o agente fornecesse citações de uma fonte na net, o agente decidiu ele próprio fazer o upload dessa informação, para a apresentar como comprovativo da sua resposta! :)

Mais do que a aparente preocupação, estamos numa fase em que vemos as empresas AI usarem estes exemplos de "marotices" quase como um emblema de honra que serve para demonstrar as capacidades avançadas dos seus modelos AI. Aliás, tem-se visto que, assim que uma empresa anuncia este tipo de coisas, pouco tempo depois vem outra empresa concorrente dizer que os seus agentes AI também são "marotos" e fazem coisas idênticas. Desta vez, e surgindo isto numa altura em que uns apelam ao abrandamento (fictício) dos modelos AI, há também que suspeite que o verdadeiro intuito seja rapidamente fazer esquecer o recente caso da OpenAI ter aparentemente roubado o trabalho de um utilizador para resolver um problema matemático.

Sem comentários:

Enviar um comentário