O Rogue AI Agent da OpenAI hackeou mais do que apenas abraçar o rosto


OpenAI disse terça-feira que o agente de IA desonesto que violou a plataforma do Hugging Face também invadiu várias contas e serviços de terceiros como parte do ataque. Agora está claro que o incidente de segurança sem precedentes, que surgiu durante um teste interno dos mais recentes modelos de IA da OpenAI, foi mais extenso do que a empresa divulgou inicialmente.

Em um atualizado postagem no blogOpenAI disse que uma revisão contínua do incidente revelou que “quatro contas” vinculadas a “serviços disponíveis publicamente” foram usadas pelo agente de IA como parte de um esforço maior para hackear o Hugging Face. O agente desonesto aparentemente encontrou credenciais expostas na web aberta e as usou para invadir as contas.

A OpenAI não revelou a quais empresas ou organizações as contas pertenciam, mas observou que elas não foram afetadas “no nível de gravidade ou escala do que compartilhamos em relação ao Hugging Face”.

Uma das contas adicionais comprometidas pelo agente da OpenAI foi usada como uma “retransmissão de saída e caminho de preparação”, potencialmente para obscurecer a origem do ataque ao Hugging Face, disse a empresa. O agente desonesto da OpenAI também usou outra conta para armazenamento de dados para ajudar no hack.

A Reuters informou na terça-feira que um cliente do Modal, empresa que oferece infraestrutura de software para treinamento e execução de serviços de IA, estava uma das entidades comprometidas pelo agente da OpenAI. Em comunicado à WIRED, o diretor de tecnologia do Modal, Akshat Bubna, confirmou que o agente da OpenAI explorou uma vulnerabilidade em uma das bases de código de seus clientes, que estava rodando na infraestrutura do Modal. No entanto, diz Bubna, “a plataforma do Modal não foi comprometida de forma alguma”. A identidade do cliente não pôde ser determinada.

A OpenAI se recusou a comentar mais sobre o incidente com a WIRED. Um porta-voz apontou para sua postagem atualizada no blog, que afirma que a empresa continuará a notificar diretamente os proprietários de serviços se descobrir que eles foram afetados em sua revisão contínua do que aconteceu.

Abraçando o rosto própria autópsia publicado esta semana descreve uma intrusão que atingiu muito mais os seus sistemas internos do que as divulgações iniciais sugeriam. A empresa afirma ter revisado cerca de 17.600 ações de agentes recuperadas de registros entre 9 e 13 de julho – a maioria das quais eram caminhos que o agente seguiu e que falharam.

Hugging Face disse que o agente da OpenAI obteve acesso de administrador a vários clusters internos do Kubernetes, acesso root em um servidor de produção e acesso de gravação a uma sub-rede de seus repositórios de código-fonte no GitHub. Ele também registrou 181 dispositivos controlados por invasores na rede mesh corporativa da empresa usando uma credencial roubada, obtendo acesso a sistemas internos onde a Hugging Face constrói e testa suas próprias bases de código.

O agente desonesto da OpenAI usou pelo menos uma sandbox de terceiros como “plataforma de lançamento externa” para seu ataque, de acordo com Hugging Face. O agente da OpenAI foi então “capaz de executar comandos como root/admin naquela sandbox externa e usá-lo como base de controle, preparação e saída para toda a campanha”.

Abraçando o rosto primeiro divulgado em 16 de julho que um agente autônomo de IA havia violado parte de sua infraestrutura de produção, mas disse na época que não sabia quem estava por trás do ataque. Na semana seguinte, OpenAI assumiu a responsabilidade pelo incidente, que disse ter sido dirigido por seu público disponível GPT-5.6 Sol modelo e um protótipo de pesquisa interna que estava testando em relação a um benchmark de capacidade cibernética, ambos com salvaguardas desativadas. A OpenAI disse na terça-feira que depois de descobrir a violação, desativou este protótipo de pesquisa interna, que nunca foi planejado para divulgação pública, e restringiu o acesso dos pesquisadores.



Source link