Centro de Investigação em Segurança de IA da Universidade Chung-Shan lança mneme no CyberGym

O Centro de Pesquisa em Segurança da Inteligência Artificial da Universidade Soongsil da Coreia do Sul (Soongsil AISC, dirigido pelo Professor Choi Dae-sun) desenvolveu um sistema de análise de vulnerabilidades multiagente chamado “mneme”, que recentemente entrou na tabela pública do sistema de avaliação de IA em cibersegurança CyberGym. O centro de pesquisa destacou que, até 30 de agosto de 2026, este é o primeiro e único registro de uma equipa de pesquisa sul-coreana a figurar nessa lista. A palavra “mneme” tem origem grega e significa “memória”; o núcleo do design do sistema é organizar o conhecimento acumulado de análises de vulnerabilidades passadas em memórias causais estruturadas, que são ativamente acionadas por múltiplos agentes de inteligência artificial, a fim de inferir as causas e os caminhos de reprodução de novas vulnerabilidades.

Desempenho equivalente ao Microsoft MDASH

Nos 1.507 desafios do CyberGym Level 1, o mneme obteve uma taxa de sucesso de 91,0% em uma única tentativa, igualando o desempenho do sistema de análise de vulnerabilidades multiagente MDASH da Microsoft. O centro de pesquisa revelou que a avaliação correspondente foi concluída em 13 de julho de 2026, e 91,0% foi o melhor resultado público na altura, o que equivale a um empate em primeiro lugar a nível global. Este resultado demonstra que os agentes de cibersegurança desenvolvidos localmente na Coreia já possuem a capacidade de competir com sistemas de topo internacionais.

CyberGym foca na avaliação abrangente de capacidades práticas

O CyberGym é um conjunto de testes de referência em larga escala, projetado para vulnerabilidades de software de código aberto, baseado em 1.507 vulnerabilidades coletadas de 188 projetos de software de código aberto. O teste exige que a inteligência artificial analise o código-fonte, rastreie os caminhos de formação das vulnerabilidades e escreva e execute códigos que possam reproduzir as vulnerabilidades de forma realista. A avaliação não mede apenas o conhecimento de segurança ou a capacidade de geração de código, mas sim o nível abrangente de compreensão de código, raciocínio sobre vulnerabilidades, uso de ferramentas especializadas, execução repetida e validação de resultados, sendo assim considerado um indicador global chave para medir a capacidade prática de IA e agentes em cibersegurança.

Superando o recorde do Claude Mythos Preview

Antes disso, em abril deste ano, o modelo de inteligência artificial geral Claude Mythos Preview da Anthropic havia alcançado uma pontuação de 83,1% em uma avaliação centrada no modelo no CyberGym, que era o nível mais alto na altura. O resultado de 91,0% do mneme supera esse recorde em 7,9 pontos percentuais, consolidando ainda mais sua posição de liderança no campo da análise de vulnerabilidades práticas. O centro de pesquisa afirmou que continuará a otimizar o sistema e a promover a aplicação das tecnologias relacionadas em diferentes cenários de segurança.

Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep