Testes de cibersegurança realizados por um laboratório de inteligência artificial (IA) no Reino Unido resultaram em novos incidentes com agentes de elevadas capacidades. Os incidentes foram registados envolvendo sistemas da OpenAI e da Anthropic.
Quem descobriu os novos hacks foi o AI Security Institute (AISI), uma agência governamental que teve autorização para realizar experiências com modelos de linguagem avançados. Durante uma bateria de testes, tanto o Mythos 5 como o GPT-5.6-Sol comportaram-se de forma inadequada para atingir o objetivo proposto.
Os casos são diferentes, em alvo e formato, dos já registados anteriormente envolvendo as duas companhias: o acesso não autorizado ao repositório Hugging Face e a série de invasões promovida pelas IA da proprietária do Claude.
«Agradecemos a parceria do AISI ao longo deste processo, incluindo o trabalho de identificar, investigar e partilhar detalhes sobre a atividade. Esperamos dar continuidade à nossa colaboração», afirma a OpenAI numa publicação.
A Anthropic, por enquanto, emitiu apenas uma breve declaração a agradecer ao AISI «pela liderança no incidente, que confirma a necessidade de uma conversa de maior dimensão sobre como avaliar com segurança agentes de IA cada vez mais capazes».
Como foram os novos ataques
Segundo o relatório de incidente do AISI, os incidentes foram detetados a 28 de julho deste ano. A equipa que controlava as avaliações notou «transferências invulgares de dados» nos servidores e investigou a origem dessas atividades.
- Ao todo, foram 19 ações maliciosas causadas pelos agentes de IA controlados pelos dois modelos: duas delas pelo GPT-5.6-Sol e as restantes pelo Mythos 5;
- Todas as IA receberam o mesmo teste: uma tarefa de «capturar a bandeira» (capture the flag), ou seja, resolver um desafio de cibersegurança como se de um especialista no assunto se tratasse e apresentar uma prova de que a ação tinha sido concluída;
- O caso mais grave envolveu a Anthropic: um dos agentes tentou adicionar código malicioso a um projeto em código aberto (open-source) no GitHub. Para o fazer, criou identidades falsas e utilizou-as para tentar convencer o proprietário da conta a aprovar as modificações - ação que foi recusada antes de ter qualquer impacto;
- Noutras ações detetadas, um agente chegou a publicar no GitHub a oferecer colaboração para trabalhar com outros agentes que realizavam o mesmo teste, deixando inclusive instruções sobre como fazer progressos.
Ao contrário dos testes anteriores, os agentes tinham acesso convencional à internet e sabiam disso, mas o prompt não sugeria como a rede poderia ou deveria ser utilizada na avaliação. Qualquer filtro de cibersegurança foi também desativado para utilizar a capacidade máxima da IA.
Entidades pedem limites
O GitHub e outras organizações envolvidas foram contactadas para remover código que eventualmente tenha ficado pendente. Nenhum dano real foi provocado durante as avaliações, mas o AISI reforça que as descobertas são graves e exigem «atenção imediata».
«Esta é a primeira vez que vemos riscos relacionados com a autonomia e o engano manifestarem-se de forma tão clara, sem um comando específico e no mundo real», refere a organização. Já o CEO da Hugging Face pediu a responsabilização de programadores e empresas de IA que criem bots que realizem atividades maliciosas na rede, mesmo que se «rebelem» durante os testes.

Sem comentários:
Enviar um comentário