Em resumo

  • O Google apresentou o Gemini 4 Argon na quarta-feira, obtendo 77,9% no DeepSWE v1.1 e liderando 12 de 18 benchmarks em sua própria tabela comparativa.
  • Ele registrou uma taxa de sucesso de ataque de 0,7% no teste de injeção de prompt da Gray Swan, à frente do Claude Opus 5.5 e do Claude Fable 5.1, que ambos obtiveram 1,0%.
  • O Argon vai primeiro para defensores cibernéticos verificados por meio do Programa Fairwind, sem barreiras de segurança cibernética, antes de chegar aos clientes pagos da API e aos assinantes do Google AI Ultra.

O Gemini 4 finalmente chegou, uma semana após o lançamento do Claude Opus 5.5 e um dia após o GPT 6.1 Sol, provando que os laboratórios americanos estão muito comprometidos em desacelerar o desenvolvimento da IA. Por favor, perdoe nosso sarcasmo.

O Google apresentou o Gemini 4 Argon na quarta-feira, chamando-o de seu modelo de fronteira, ou seja, seu mais capaz, para codificação, trabalho de escritório e defesa cibernética.

Myriad: Até onde a Nvidia vai cair? Clique para fazer sua previsão.
Myriad: Até onde a Nvidia vai cair? Clique para fazer sua previsão.

No DeepSWE v1.1, um teste que avalia se uma IA consegue concluir tarefas de engenharia de software longas, confusas e do mundo real, pontuado como porcentagem, o Argon atingiu 77,9%. O Claude Opus 5.5 obteve 74,2%, o GPT-6 Astra 74,1% e o Claude Fable 5.1 67,4%.

Para dar escala, o Gemini 3.6 Flash conseguiu 49% no mesmo teste em julho. O Argon também consegue escrever até 1 milhão de tokens em uma única resposta, ante 64.000. Um token é um pedaço de texto, aproximadamente três quartos de uma palavra, então isso equivale a cerca de 750.000 palavras contra cerca de 48.000.

No entanto, encare esses números com cautela. O Google calculou sua própria pontuação no DeepSWE, enquanto os números dos rivais vieram de um ranking público e de relatórios das empresas. Sua tabela também admite concessões. O Argon lidera em 12 de 18 benchmarks, empata em um e fica atrás em cinco, uma mistura de testes de programação, ciência e controle de computador.

Mas o recurso chamativo do modelo são as capacidades cibernéticas. Esconda uma instrução secreta dentro de um e-mail, espere que um assistente de IA a leia e veja se a IA obedece ao estranho em vez de você. Isso é injeção indireta de prompt, e é o pesadelo para qualquer um que queira entregar a uma IA sua caixa de entrada ou carrinho de compras.

No benchmark de Injeção Indireta de Prompt do Gray Swan, que esconde instruções maliciosas em conteúdos que os agentes leem e pontua com que frequência os ataques funcionam dentro de 15 tentativas, o Argon ficou em 0,7%. Quanto menor, melhor. O Claude Opus 5.5 e o Claude Fable 5.1 obtiveram ambos 1,0%.

O GPT-6 Astra ficou em 8,5%. O Grok 4.6 e o Kimi K3 foram enganados pouco mais da metade das vezes, com 51,8% e 52,7%.

O Argon é disponibilizado a equipes de segurança verificadas por meio do Programa Fairwind, a iniciativa de defesa cibernética de acesso limitado do Google, lançada em 2 de setembro com mais de 650 parceiros, incluindo governos e operadores de infraestrutura crítica. E é distribuído "sem proteções cibernéticas", as recusas integradas que normalmente impedem um modelo de ajudar com hacking.

BitcoinBTC · USD

$83,662−0.87%

24 de set25 de set27 de set29 de set30 de set

$85,3 mil$84,4 mil$83,5 mil$82,7 mil

Máxima 24hMáxima$85.518

Mínima 24hMínima$82.951

VolVol$1,5 bi

→

Comprar Bitcoin com USDT

Fornecido por Jupiter

Dados de preço por CoinGeckoCoinGeckoMais notícias e projeções de Bitcoin →

A lógica por trás de tal movimento é que os defensores precisam de um modelo que possa pensar como um atacante para corrigir falhas antes que os criminosos as encontrem. O problema é que a mesma habilidade funciona nos dois sentidos, então o Google afirma que uma implementação faseada é o único caminho seguro. A empresa também está participando do processo voluntário do governo dos EUA para acesso a modelos antes do lançamento.

O Google não é o primeiro a colocar um modelo cibernético atrás de uma corda de veludo. Uma versão inicial do Claude Mythos, da Anthropic, ajudou a encontrar 271 vulnerabilidades no Firefox, ou seja, 271 falhas de segurança que a Mozilla depois corrigiu. A OpenAI seguiu um caminho semelhante com seu programa Trusted Access for Cyber.

As pontuações cibernéticas do Argon superam o Gemini 3.8 Flash Cyber, o modelo restrito que o Google lançou com o Fairwind. No Wiz Penetration Test Benchmark, um teste interno do Google que pede a uma IA para escrever exploits funcionais contra falhas reais de aplicações web sem ver o código, e pontua a porcentagem resolvida na primeira tentativa, o Argon alcançou 70,9% contra 58,2%.

O Google também afirma que o Argon ajudou a empresa de segurança Wiz a encontrar uma falha crítica em um software de saúde usado por hospitais em todo o mundo, uma que modelos de fronteira anteriores haviam deixado passar.

O lançamento segue um verão difícil para o Google. Em julho, ele lançou modelos Flash menores, mas pulou o prometido Gemini 3.5 Pro, e as ações da Alphabet caíram cerca de 4,4%. O Argon também chegou no mesmo dia em que o presidente Trump revelou um acordo voluntário de IA, sem penalidades, que a liderança do Google assinou.

O Google diz que o lançamento mais amplo ocorrerá o mais rápido possível, começando com clientes pagos da API e assinantes do Google AI Ultra.

O preço introdutório é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. O Google não disse quando esse período termina, apenas que as tarifas padrão são US$ 4 e US$ 20.