Pesquisadores descobrem que é possível enganar a inteligência artificial Kimi, da empresa Moonshot, para que ela forneça detalhes sobre a fabricação de bioterrorismo e assassinatos, além de expor vulnerabilidades para ataques cibernéticos.
A desenvolvedora chinesa de inteligência artificial Moonshot está conduzindo uma revisão interna urgente. Isso ocorreu após pesquisadores da área de segurança digital conseguirem persuadir dois de seus modelos populares, conhecidos como Kimi, a revelar como fabricar armas biológicas e como realizar assassinatos.
A empresa Mindgard, especializada em testar a segurança de sistemas de IA, explicou à BBC que descobriu em julho que os modelos Kimi K2.6 e K3 Swarm podiam escapar das limitações de segurança criadas pelos seus próprios desenvolvedores. A falha aconteceu durante um processo chamado de "jailbreaking" (quebra de barreiras), onde pesquisadores usam uma série de instruções complexas para verificar se as ferramentas de IA ignoram suas regras de segurança, as quais deveriam ter impedido a Kimi de discutir assuntos preocupantes.
- A empresa Moonshot, da China, está analisando falhas graves de segurança em seus modelos de IA.
- Os modelos Kimi K2.6 e K3 Swarm foram "quebrados" para falar sobre armas biológicas e assassinatos.
- A empresa de segurança Mindgard alertou a Moonshot, mas a resposta oficial só veio após contato da BBC.
- Expertos temem que hackers utilizem essas falhas para executar códigos maliciosos e atacar sistemas.
- Há um debate sobre a segurança de modelos de código aberto frente aos sistemas fechados de outras empresas.
A resposta da empresa e o risco de ataques
A Moonshot disse à BBC que acolhe bem a contribuição de terceiros "como um pilar fundamental para construir uma IA melhor e mais segura". A empresa também informou que estava em discussão com a Mindgard sobre suas descobertas. Peter Garraghan, fundador da Mindgard, afirmou ao programa Tech Life da BBC World Service que as descobertas sobre o Kimi K2.6 e K3 Swarm eram preocupantes. Ele disse: "Uma vez que a quebra funciona, ela falará sobre qualquer tópico, oferecerá livremente recomendações sobre outros tópicos igualmente nefastos e será inventiva e criativa".
Essas quebras de barreiras apresentam um tipo diferente de risco em comparação com os recentes incidentes de alto perfil de IA, que viram ferramentas autônomas conhecidas como agentes, desenvolvidas por empresas americanas, incluindo OpenAI, Meta e Anthropic, invadir alguns serviços online. Embora as quebras de barreiras sejam processos complexos que podem levar muito tempo e determinação, alguns especialistas temem que hackers e outros atores mal intencionados possam tentar usá-los para causar danos. A Anthropic disse recentemente que identificou e interrompeu tentativas de usar um de seus modelos de IA para "atividade maliciosa" que poderia apoiar o desenvolvimento de armas biológicas.
Possível plataforma para ataques cibernéticos
A Mindgard não provou se as respostas fornecidas pela Kimi sobre tópicos preocupantes realmente funcionariam na prática. No entanto, a empresa argumentou que as barreiras de segurança deveriam ter impedido os modelos em questão de entrar em discussão com usuários sobre tais assuntos. A empresa também afirmou ter certeza de que um Kimi 2.6 com barreiras quebradas poderia permitir que hackers executassem código em seus recursos de computação e se conectassem à internet, transformando-o em uma plataforma potencial para ataques cibernéticos.
Garraghan defendeu a decisão da Mindgard de discutir publicamente a quebra de barreiras nos sistemas da Moonshot, dizendo que havia informado a desenvolvedora e que não estava revelando os detalhes-chave de como conseguiu fazer os modelos da empresa ignorarem as barreiras de segurança. A Mindgard alertou a Moonshot sobre a falha por e-mail em 27 de julho, dando seguimento uma semana depois. Em seguida, publicou um blog sobre o problema em 12 de setembro. No entanto, a empresa disse que a Moonshot só entrou em contato recentemente, após ser procurada pela BBC para comentários. Em parte de um e-mail para a Mindgard pedindo mais detalhes, compartilhado com a BBC pela Moonshot, disse-se que seu modelo tinha mostrado "uma taxa de recusa alta para esse tipo de solicitações" em avaliações internas.
O debate sobre modelos abertos e fechados
As descobertas surgem num momento em que a indústria de IA continua dividida sobre se os modelos fechados e proprietários, como os que alimentam o ChatGPT e os sistemas Claude da Anthropic, ou as ferramentas de código aberto são o melhor ou caminho mais seguro. O Kimi é um modelo de pesos abertos, o que significa que, em teoria, alguém poderia pegar o modelo e executá-lo por conta própria em sua própria infraestrutura de computação. O professor Alan Woodward, da Universidade de Surrey, disse à BBC que existe o risco de modelos de código aberto acabarem em mãos erradas, mas que eles também podem ser usados para defesa cibernética.
Ele observou que a empresa de IA Hugging Face usou um modelo de código aberto da China para entender um hackeamento que depois foi revelado ter sido realizado por agentes da OpenAI. O professor Woodward disse que a regulamentação internacional é improvável que acompanhe o ritmo do desenvolvimento da IA, dizendo: "Levamos décadas para chegar a um acordo sobre o formato dos números de telefone". Assim como o fundador da Mindgard, Garraghan, o professor Woodward acredita que deve haver um maior foco em identificar e processar humanos que usam mal a IA.

Imagem ilustrativa de tecnologia e segurança digital (Fonte: Getty Images)



