Коротко

  • У середу Google представила Gemini 4 Argon, яка набрала 77,9% на DeepSWE v1.1 і лідирує в 12 з 18 бенчмарків у власній порівняльній таблиці.
  • Вона показала 0,7% успішності атак у тесті на ін'єкцію підказок від Gray Swan, випередивши Claude Opus 5.5 і Claude Fable 5.1, які обидва отримали 1,0%.
  • Argon спершу надається перевіреним кіберзахисникам через програму Fairwind, без кіберобмежень, перш ніж потрапити до платних клієнтів API та підписників Google AI Ultra.

Gemini 4 нарешті тут, через тиждень після випуску Claude Opus 5.5 і через день після GPT 6.1 Sol, що доводить: американські лабораторії цілком віддані уповільненню розвитку ШІ. Просимо вибачити наш сарказм.

Google представила Gemini 4 Argon у середу, назвавши її своєю фронтирною моделлю, тобто найпотужнішою, для програмування, офісної роботи та кіберзахисту.

Myriad: Як низько впаде Nvidia? Натисніть, щоб зробити свій прогноз.
Myriad: Як низько впаде Nvidia? Натисніть, щоб зробити свій прогноз.

На DeepSWE v1.1, тесті на те, чи може ШІ завершити довгі, заплутані, реальні завдання з програмної інженерії, оціненому у відсотках, Argon досяг 77,9%. Claude Opus 5.5 отримав 74,2%, GPT-6 Astra 74,1% і Claude Fable 5.1 67,4%.

Для масштабу, Gemini 3.6 Flash досяг 49% на тому ж тесті в липні. Argon також може написати до 1 мільйона токенів в одній відповіді, порівняно з 64 000. Токен — це фрагмент тексту, приблизно три чверті слова, тож це близько 750 000 слів проти близько 48 000.

Однак ці цифри слід сприймати з часткою скепсису. Google обчислив свій власний бал DeepSWE, тоді як цифри конкурентів надійшли з публічної таблиці лідерів і звітів компаній. Його таблиця також визнає поступки. Argon лідирує за 12 з 18 бенчмарків, ділить одне місце і поступається за п'ятьма, сумішшю тестів з кодування, науки та комп'ютерного контролю.

Але яскрава особливість моделі — це кіберможливості. Сховайте секретну інструкцію в електронному листі, зачекайте, поки ШІ-асистент прочитає його, і подивіться, чи ШІ підкориться незнайомцю замість вас. Це непряма ін'єкція підказки, і це кошмар для будь-кого, хто хоче довірити ШІ свою поштову скриньку або кошик для покупок.

На бенчмарку непрямої ін'єкції підказок Gray Swan, який ховає шкідливі інструкції в контенті, який читають агенти, і оцінює, як часто атаки спрацьовують протягом 15 спроб, Argon досяг 0,7%. Нижче — краще. Claude Opus 5.5 і Claude Fable 5.1 обидва отримали 1,0%.

GPT-6 Astra показав результат 8,5%. Grok 4.6 і Kimi K3 були обмануті трохи більше ніж у половині випадків — 51,8% і 52,7%.

Argon надається перевіреним командам безпеки через програму Fairwind, ініціативу Google з кіберзахисту з обмеженим доступом, яка стартувала 2 вересня з понад 650 партнерами, включно з урядами та операторами критичної інфраструктури. І він постачається «без кібер-обмежень» — вбудованих відмов, які зазвичай заважають моделі допомагати з хакерством.

BitcoinBTC · USD

$83,662−0.87%

24 вер25 вер27 вер29 вер30 вер

$85.3k$84.4k$83.5k$82.7k

24h HighHigh$85,518

24h LowLow$82,951

VolVol$1.5B

→

Купити Bitcoin за USDT

Powered by Jupiter

Price data by CoinGeckoCoinGeckoБільше Bitcoin news and projections →

Логіка такого кроку полягає в тому, що захисникам потрібна модель, яка може думати як зловмисник, щоб закрити прогалини до того, як їх знайдуть злочинці. Підступність у тому, що той самий навик працює в обидва боки, тому Google каже, що поетапне впровадження — єдиний безпечний шлях. Компанія також бере участь у добровільному процесі уряду США щодо доступу до моделей до їх випуску.

Google не перший, хто поміщає кібермодель за оксамитову мотузку. Рання версія Claude Mythos від Anthropic допомогла знайти 271 вразливість у Firefox, тобто 271 діру в безпеці, яку Mozilla потім закрила. OpenAI пішла схожим шляхом зі своєю програмою Trusted Access for Cyber.

Кіберпоказники Argon перевершують Gemini 3.8 Flash Cyber, обмежену модель, яку Google випустила разом із Fairwind. У Wiz Penetration Test Benchmark — внутрішньому тесті Google, який просить ШІ написати робочі експлойти проти реальних вразливостей вебзастосунків, не бачачи коду, і оцінює частку розв'язаних із першої спроби, — Argon досяг 70,9% проти 58,2%.

Google також каже, що Argon допоміг компанії з кібербезпеки Wiz знайти критичну вразливість у медичному програмному забезпеченні, яке використовують лікарні по всьому світу, — ту, яку пропустили попередні фронтирні моделі.

Запуск відбувається після важкого літа для Google. У липні вона випустила менші моделі Flash, але пропустила обіцяну Gemini 3.5 Pro, і акції Alphabet впали приблизно на 4,4%. Argon також з'явився того самого дня, коли президент Трамп оприлюднив добровільну, без штрафів, AI-угоду, яку підписало керівництво Google.

Google каже, що ширший випуск відбудеться якнайшвидше, починаючи з платних клієнтів API та підписників Google AI Ultra.

Вступна ціна — $2 за мільйон вхідних токенів і $10 за мільйон вихідних токенів. Google не сказала, коли цей період закінчиться, лише що стандартні тарифи — $4 і $20.