No seguimento do caso do ataque à Hugging Face, descobre-se que agentes AI descobriram forma de comunicar usando páginas wiki de vários sites.
Um novo relatório de investigadores independentes revela que um grupo de agentes de inteligência artificial da OpenAI terá assumido o controlo de partes de um website alemão (e outros), transformando-o num serviços para comunicação entre agentes. O incidente terá ocorrido meses antes do mediático caso envolvendo a plataforma Hugging Face e só agora veio a público.
Segundo os investigadores, os agentes realizaram mais de 15 mil alterações num wiki dedicado a programadores, criando páginas onde partilhavam estratégias para contornar restrições, evitar detecção e preservar informações mesmo após tentativas de remoção. Algumas das mensagens eram assinadas com nomes que sugeriam uma ligação à OpenAI. Supostamente os agentes não teriam autorização para escrever directamente na web, mas descobriram formas de o fazer usando apenas comandos de "leitura".
Os agentes terão usado tácticas engenhosas: quando descobriram que um operador humano estava a apagar as suas páginas por ordem alfabética, criaram páginas de backups com nomes a começar em ZZZ para demorarem mais tempo a serem eliminadas; quando descobriram que o administrador apagava cerca de 100 páginas por dia, começaram a criar 400 páginas, para assegurar que a maioria se manteria - demonstrando um nível inesperado de coordenação autónoma.
Here's our summary of what we think happened: pic.twitter.com/CBaVNzrmeX
— Thomas Larsen (@thlarsen) September 4, 2026
Perante acusações de que terá "escondido" este incidente, a OpenAI diz que ainda não teve oportunidade de analisar o relatório completo, mas que já tinha reportado este comportamento, que classificou como sendo um "misalignment incident" e não um incidente de segurança como o da Hugging Face, mas comprometendo-se a melhorar a comunicação de tais casos no futuro.How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models.
— OpenAI (@OpenAI) September 5, 2026
Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
Supostamente, tudo isto terá sido feito por um modelo AI ainda mais avançado que o recém-lançado GPT-6 Astra, pelo que... vamos ter uns anos interessantes pela frente.



















No comments:
Post a Comment (problemas a comentar?)