En resumen
- Google presentó Gemini 4 Argon el miércoles, obteniendo un 77,9% en DeepSWE v1.1 y liderando 12 de 18 benchmarks en su propia tabla comparativa.
- Registró una tasa de éxito de ataque del 0,7% en la prueba de inyección de prompts de Gray Swan, por delante de Claude Opus 5.5 y Claude Fable 5.1, que obtuvieron un 1,0% cada uno.
- Argon llega primero a defensores cibernéticos verificados a través del Programa Fairwind, sin barreras de seguridad cibernética, antes de llegar a los clientes de pago de la API y a los suscriptores de Google AI Ultra.
Gemini 4 finalmente está aquí, una semana después del lanzamiento de Claude Opus 5.5 y un día después de GPT 6.1 Sol, lo que demuestra que los laboratorios estadounidenses están muy comprometidos con frenar el desarrollo de la IA. Disculpen nuestro sarcasmo.
Google presentó Gemini 4 Argon el miércoles, llamándolo su modelo frontera, es decir, su más capaz, para programación, trabajo de oficina y defensa cibernética.

En DeepSWE v1.1, una prueba que evalúa si una IA puede completar trabajos de ingeniería de software del mundo real, largos y desordenados, puntuada como porcentaje, Argon alcanzó el 77,9%. Claude Opus 5.5 obtuvo el 74,2%, GPT-6 Astra el 74,1% y Claude Fable 5.1 el 67,4%.
Para ponerlo en escala, Gemini 3.6 Flash logró un 49% en la misma prueba en julio. Argon también puede escribir hasta 1 millón de tokens en una sola respuesta, frente a 64.000. Un token es un fragmento de texto, aproximadamente tres cuartos de una palabra, así que eso es alrededor de 750.000 palabras frente a unas 48.000.
Sin embargo, toma estos números con cautela. Google calculó su propia puntuación de DeepSWE, mientras que los números de los rivales provinieron de una tabla de clasificación pública y de informes de las empresas. Su tabla también concede terreno. Argon lidera en 12 de 18 benchmarks, empata en uno y va por detrás en cinco, una mezcla de pruebas de programación, ciencia y control informático.
Pero la característica llamativa del modelo son las capacidades cibernéticas. Esconde una instrucción secreta dentro de un correo electrónico, espera a que un asistente de IA lo lea y observa si la IA obedece al desconocido en lugar de a ti. Eso es la inyección indirecta de prompts, y es la pesadilla para cualquiera que quiera entregarle a una IA su bandeja de entrada o su carrito de compras.
En el benchmark de Inyección Indirecta de Prompts de Gray Swan, que esconde instrucciones maliciosas en el contenido que leen los agentes y puntúa con qué frecuencia funcionan los ataques dentro de 15 intentos, Argon se situó en el 0,7%. Más bajo es mejor. Claude Opus 5.5 y Claude Fable 5.1 obtuvieron ambos un 1,0%.
GPT-6 Astra obtuvo un 8,5%. Grok 4.6 y Kimi K3 fueron engañados algo más de la mitad de las veces, con un 51,8% y un 52,7%.
Argon se distribuye a equipos de seguridad verificados a través del Programa Fairwind, la iniciativa de ciberdefensa de acceso limitado de Google, que se lanzó el 2 de septiembre con más de 650 socios, incluidos gobiernos y operadores de infraestructuras críticas. Y se entrega "sin barreras de seguridad cibernética", las negativas integradas que normalmente impiden que un modelo ayude con el hacking.
BitcoinBTC · USD
$83,662−0.87%
Sep 24Sep 25Sep 27Sep 29Sep 30
$85.3k$84.4k$83.5k$82.7k
24h HighHigh$85,518
24h LowLow$82,951
VolVol$1.5B
Market projectionsOdds by Myriad
Today$82,000 to $84,000$82k–$84k55% chanceThis weekBelow $84,000Below $84k56% chanceThis month$82,000 to $84,000$82k–$84k55% chance
Buy Bitcoin with USDT
Powered by Jupiter
La lógica detrás de tal movimiento es que los defensores necesitan un modelo que pueda pensar como un atacante para parchear agujeros antes de que los criminales los encuentren. La trampa es que la misma habilidad corta en ambos sentidos, por lo que Google dice que un despliegue por fases es el único camino seguro. También está participando en el proceso voluntario del gobierno de EE. UU. para el acceso a modelos antes de su lanzamiento.
Google no es el primero en poner un modelo cibernético detrás de una cuerda de terciopelo. Una versión temprana de Claude Mythos de Anthropic ayudó a encontrar 271 vulnerabilidades en Firefox, lo que significa 271 agujeros de seguridad que Mozilla luego parcheó. OpenAI ha tomado una ruta similar con su programa Trusted Access for Cyber.
Las puntuaciones cibernéticas de Argon superan a Gemini 3.8 Flash Cyber, el modelo restringido que Google lanzó con Fairwind. En el Wiz Penetration Test Benchmark, una prueba interna de Google que pide a una IA escribir exploits funcionales contra fallos reales de aplicaciones web sin ver el código, y puntúa la proporción resuelta en el primer intento, Argon alcanzó el 70,9% frente al 58,2%.
Google también dice que Argon ayudó a la firma de seguridad Wiz a encontrar un fallo crítico en software sanitario utilizado por hospitales de todo el mundo, uno que los modelos frontera anteriores habían pasado por alto.
El lanzamiento sigue a un verano difícil para Google. En julio envió modelos Flash más pequeños pero se saltó el prometido Gemini 3.5 Pro, y las acciones de Alphabet cayeron alrededor del 4,4%. Argon también llegó el mismo día en que el presidente Trump presentó un acuerdo de IA voluntario y sin penalizaciones que la cúpula de Google firmó.
Google dice que el lanzamiento más amplio llegará lo antes posible, comenzando con clientes de pago de API y suscriptores de Google AI Ultra.
El precio introductorio es de $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Google no ha dicho cuándo termina ese período, solo que las tarifas estándar son $4 y $20.






