O Claude Mythos foi confirmado por testes como líder na detecção de vulnerabilidades, mas também demonstra outras deficiências
Resumo
A empresa XBOW conduziu uma avaliação independente do modelo de IA Mythos Preview da Anthropic. Os resultados mostraram que o modelo supera os concorrentes na detecção de vulnerabilidades em código-fonte e ao trabalhar com código nativo e engenharia reversa, mas apresenta fraquezas na análise de código isolado e na confirmação da aplicabilidade prática dos exploits encontrados. O custo do modelo permanece questionável: Mythos é mais caro que Opus, porém, com um orçamento limitado de tokens, às vezes demonstra maior precisão.
1. O que a XBOW avaliou
- Volume de testes – série de experimentos independentes sobre o Mythos Preview.
- Cenários – auditoria de sistemas operacionais com acesso ao código-fonte, análise de código isolado, engenharia reversa e interação com interface gráfica.
2. Conclusões-chave
Indicador | Mythos Preview | Modelos concorrentes
Detecção de vulnerabilidades | Melhor desempenho entre todos os modelos, especialmente em código-fonte e programação nativa. Menos preciso, mas às vezes mais confiável ao verificar casos específicos. |
Redução de falsos positivos | Remove mais “falsos” do que os predecessores. Frequentemente gera mais alarmes falsos. |
Problemas com código isolado | O modelo lida pior sem o contexto do sistema. Alguns modelos funcionam melhor na análise linha a linha. |
Confirmação de exploits | Tendência a abordagem literal, às vezes superestima o valor prático das descobertas. Mais crítica quanto à aplicabilidade real. |
Engenharia reversa e código nativo | Apresenta resultados fortes; “entende” bem a lógica do programa sem código-fonte. Menos precisão nessas tarefas. |
Interação com UI | Nem sempre localiza precisamente as coordenadas dos elementos, mas identifica corretamente as ações necessárias no navegador. Alguns modelos são mais precisos na posição. |
3. Custo e eficiência
- Precificação – A Anthropic afirmou que Mythos custará cinco vezes mais que Opus.
- Análise econômica – A XBOW realizou experimentos com modelos “baratos”, dando-lhes mais tempo de operação. Os resultados mostraram que, ao normalizar pelo custo, o trabalho do Mythos Preview não parece excessivo para tarefas de alta precisão.
- Benchmarks – Com um orçamento fixo de tokens, Mythos supera Opus 4.6 na busca por vulnerabilidades web, mas fica atrás do GPT5.5.
4. Conclusão
O Mythos Preview demonstra poder excepcional na auditoria de código-fonte e programas nativos, bem como em tarefas de engenharia reversa e análise de aplicações web. No entanto, o modelo às vezes subestima a aplicabilidade real das vulnerabilidades encontradas e apresenta fraquezas na análise isolada de código. Com recursos limitados de tokens, Mythos pode ser mais vantajoso que Opus, mas com orçamento completo o GPT5.5 permanece competitivo.
Conclusão da XBOW: O Mythos Preview é uma ferramenta confiável para identificar potenciais vulnerabilidades em código-fonte e sistemas complexos, mas requer confirmação adicional do valor prático dos exploits descobertos.
Comentários (0)
Compartilhe sua opinião — por favor, seja educado e mantenha-se no tema.
Faça login para comentar