2026/07/29

Hugging Face recria ataque feito por modelo da OpenAI

A Hugging Face criou uma visualização que ilustra o ataque feito pelos modelos AI da OpenAI.

Recentemente falamos do ataque à Hugging Face que parecia estar a ser feito por agentes AI; algo que mais tarde acabou por ser confirmado, quando a OpenAI revelou que afinal tinha sido um modelo AI seu, que inadvertidamente conseguiu escapar da "sandbox" durante um teste.

O caso tem dado bastante que falar, e agora temos uma visualização interactiva que melhor demonstra aquilo que se passou, como explicado pela Hugging Face.

O ataque decorreu ao longo de vários dias, a velocidade extremamente acelerada e que depressa revelou que não se tratava de um ataque normal feito por um hacker humano. No processo, reacende as discussões sobre a necessidade de se definirem regras para os testes e treino dos modelos AI; mas também do outro lado da questão, da restrição artifical das capacidades dos modelos AI. Algo que ficou cabalmente demonstrado pelo facto da Hugging Face não ter conseguido usar modelos ocidentais para analisar o ataque - por causa das restrições de segurança - acabando por ter que usar um modelo AI chinês para o fazer.

É precisamente por isso que alguns defendem que, se é certo que os modelos AI de nova geração podem constituir riscos a nível de descobrirem vulnerabilidades (como ficou demonstrado), são também esses mesmos modelos AI que se tornam na melhor defesa para detectarem e corrigirem essas mesmas vulnerabilidades. Estar a restringir os modelos AI apenas vai criar um desiquilíbrio, em que quem os quiser usar para ataques (usando jailbreaks e outras técnicas) ficará em vantagem face a quem os quiser usar da forma oficial, para defesa.

Por agora, fica o incidente registado como sendo uma excelente publicidade à OpenAI, por ter tido um modelo AI que foi capaz de actuar autonomamente ao longo de dias, saindo de um ambiente isolado e infiltrando-se numa plataforma onde o agente AI esperava encontrar as respostas que precisava para o teste.

No comments:

Post a Comment (problemas a comentar?)