Google представила Gemini 3.8 Flash Cyber — специализированную версию Gemini для анализа защищенности программного кода. Модель умеет работать с уязвимостями, проверять найденные проблемы и готовить исправления. В опубликованных тестах она набрала 86,2% на CyberGym и 47,2% на CWE-bench. Доступ к системе пока закрытый: Google выдает его проверенным организациям через программу Fairwind.

Gemini 3.8 Flash Cyber представили 2 сентября вместе с универсальной Gemini 3.8 Flash. Обе версии используют общую базовую модель, но предназначены для разных задач. Обычная Flash рассчитана на программирование, автономных агентов и сложные многоэтапные запросы. Cyber получила отдельную настройку для работы с уязвимостями и менее жесткие ограничения на профессиональные задачи кибербезопасности. Это позволяет специалистам применять модель для разрешенного тестирования, анализа вредоносного ПО и обратной разработки.
Компания строит связку, способную провести значительную часть работы самостоятельно: изучить код, разобраться в причине уязвимости, подготовить изменение и проверить, действительно ли оно закрывает проблему и не ломает программу.
Одна из главных цифр в презентации Google — 86,2% Pass@1 на CyberGym. Это лучший результат среди систем в опубликованной компанией сравнительной таблице. GPT-5.5-Cyber там получила 85,6%, Mythos 5 — 83,8%, GPT-5.6 Sol — 83,6%, предыдущая Gemini 3.5 Flash Cyber — 77,5%.
CyberGym содержит 1507 задач на основе реальных уязвимостей в 188 программных проектах. В основном режиме Level 1 агенту дают текстовое описание уже известной уязвимости и непропатченную версию программы. Его задача — подготовить рабочий proof of concept, то есть тест, который воспроизводит проблему. Проверяющая система запускает результат на уязвимой и исправленной версиях программы и убеждается, что агент действительно воспроизвел нужный дефект.
Авторы CyberGym предупреждают, что небольшую разницу между лидерами рейтинга не стоит автоматически интерпретировать как существенное превосходство одной системы. Запуски агентов недетерминированы, а разные команды могут использовать разные агентные оболочки и настройки.
Поэтому отрыв Flash Cyber от GPT-5.5-Cyber всего на 0,6 процентного пункта — хороший результат, но недостаточное основание объявлять модель безусловно лучшей системой поиска уязвимостей.
Есть и еще одна тонкость: Google в своем анонсе называет CyberGym тестом автономного обнаружения уязвимостей, но стандартный Level 1 самого CyberGym точнее описывается как воспроизведение известной уязвимости по ее описанию и исходному коду. Для проверки именно поиска проблем с меньшим количеством подсказок Google использовала другой набор данных.
Google отдельно протестировала Flash Cyber на собственном наборе уязвимостей в проектах на 20 языках программирования. Здесь модель должна была обнаруживать проблемы в сложных кодовых базах, а не ограничиваться преимущественно C и C++, характерными для опубликованного сравнения CyberGym. Компания сообщает о результате выше 70%.
Сам набор данных закрыт: внешний исследователь не может получить те же репозитории, запустить модель в идентичных условиях и воспроизвести результат. Google также не публикует достаточный объем данных о распределении задач между языками и классами уязвимостей, количестве ложных срабатываний и результатах отдельно по каждому языку.
Отдельно Google проверяла не поиск, а исправление уязвимостей. Для этого использовался CWE-bench — закрытый тестовый набор Collinear AI из 100 задач. Каждая построена вокруг реального проекта с открытым исходным кодом. Агент получает репозиторий и короткую команду проверить код и исправить найденные проблемы. Место уязвимости ему не показывают.
Проверка максимально приземленная: исправление засчитывается только тогда, когда подготовленная атака больше не срабатывает, а существующие тесты программы продолжают проходить.

Всего CWE-bench охватывает 54 типа слабостей CWE и шесть групп языков: C/C++, Go, Java, JavaScript/TypeScript, Python и Rust. Из 100 задач 22 на момент публикации не смогла решить ни одна из протестированных моделей. Gemini 3.8 Flash Cyber получила здесь 47,2% Pass@1.
Это почти лучший результат теста, но не первый. Модель Fable 5 показала 47,8%. Интереснее соотношение результата и затрат: в опубликованном Collinear сравнении один запуск Flash Cyber обходился примерно в $3,7, Fable 5 — примерно в $10. Разработчики CWE-bench поэтому помещают Gemini на так называемую границу Парето: получить одновременно заметно лучший результат и меньшую стоимость среди протестированных систем в этой точке не получается.
Gemini 3.8 Flash Cyber можно использовать самостоятельно, но Google особенно продвигает ее вместе с CodeMender — ИИ-агентом DeepMind для автоматического исправления уязвимого кода.
CodeMender представили осенью 2025 года. За первые шесть месяцев разработки система отправила в открытые проекты 72 исправления безопасности. Среди обработанных проектов были кодовые базы объемом до 4,5 млн строк. Все предлагаемые внешним проектам изменения на этом этапе дополнительно проверяли специалисты Google. Под капотом это заметно сложнее обычного запроса «найди баг и перепиши функцию».
Агент получает доступ к статическому и динамическому анализу программы, дифференциальному тестированию, фаззингу и SMT-решателям — инструментам, которые позволяют проверять условия и поведение программы. CodeMender сначала пытается установить первопричину дефекта, а уже после строит патч.
Отдельные агенты-критики сравнивают исходный и измененный код и проверяют, не добавило ли исправление новые ошибки. При провале проверки система может переделать решение.
Внешнему разработчику в идеале должен приходить не текст в духе «кажется, проблема вот здесь», а конкретное изменение кода, которое уже прошло несколько этапов автоматической проверки.
В июле Google встроила CodeMender в инфраструктуру OSS-Fuzz — бесплатную систему непрерывного фаззинга открытых проектов.
Раньше цепочка в основном заканчивалась подтвержденным отчетом о сбое: OSS-Fuzz находил проблему, а сопровождающему проекта приходилось разбираться в ее причине и самостоятельно готовить исправление.
Теперь данные о сбое и контекст исходного кода могут автоматически передаваться CodeMender. Агент исследует возможные причины, формирует патч и проверяет его в изолированной среде.
На текущем этапе такие автоматические исправления доступны для проектов на C и C++, где OSS-Fuzz обнаруживает ошибки безопасности памяти. Если проект уже подключен к системе, подходящий патч может появиться прямо в закрытом отчете об уязвимости. Google пока сохраняет ручную проверку таких исправлений своими инженерами.
Flash Cyber уже испытывают внутри Google. Команда безопасности Chrome получила с ее помощью в 2,6 раза больше корректных исправлений уязвимостей, чем при использовании лучших более крупных коммерческих моделей, участвовавших во внутреннем сравнении.
Похожая ситуация с результатами Wiz. Компания протестировала Flash Cyber на своем внутреннем наборе задач для тестирования защищенности и получила на 7,5–9,7 процентного пункта большую полноту обнаружения при стоимости в 2,3–5,2 раза ниже, чем у других сравниваемых передовых моделей. Публичного набора задач и полного отчета с результатами Wiz сейчас нет. Цифры опубликованы Google со ссылкой на испытания партнера.
Еще один эксперимент провела команда Google Cloud Vulnerability Research. Она использовала Flash Cyber для исследования фундаментальной уязвимости и, как утверждает компания, обнаружила ее менее чем за два часа. Google сравнивает это со сложными исследованиями, которые вручную могут занимать месяцы. Технические подробности самой находки в анонсе не раскрыты.
Google уже использует ИИ для поиска ошибок через OSS-Fuzz и исследовательские системы вроде Big Sleep. CodeMender добавил к обнаружению еще один этап — автоматическое исправление.
Обычная Gemini 3.8 Flash уже общедоступна. Ее идентификатор в Gemini API — gemini-3.8-flash. Модель принимает текст, изображения, видео, аудио и PDF, поддерживает контекст до 1 048 576 входных токенов и ответ до 65 536 токенов. Ей доступны вызов функций, выполнение кода, поиск, работа с файлами и экспериментальное управление компьютером. До конца 2026 года Google установила вводную цену $0,75 за миллион входных токенов и $3,75 за миллион выходных, включая токены рассуждений. С 1 января 2027 года тариф должен вырасти до $1,50 и $7,50 соответственно.
Вопросы и ответы
Что такое Gemini 3.8 Flash Cyber?
Специализированная версия Gemini 3.8 для задач кибербезопасности. Она рассчитана на анализ уязвимостей, работу с кодом и автоматическую подготовку исправлений.
Gemini 3.8 Flash Cyber действительно сама ищет уязвимости?
Да, Google тестирует модель в режиме самостоятельного обнаружения проблем, но самый известный опубликованный результат — 86,2% на CyberGym — требует оговорки. Стандартный тест CyberGym дает агенту описание существующей уязвимости и проверяет, сможет ли он ее воспроизвести. Результат Google выше 70% на задачах непосредственного обнаружения получен на закрытом внутреннем наборе.
Можно ли пользоваться Flash Cyber через обычный Gemini API?
Нет. Сейчас доступ предоставляется проверенным организациям через Fairwind Program. Для публичного Gemini API доступна обычная Gemini 3.8 Flash.
Сколько стоит Gemini 3.8 Flash Cyber?
Отдельный публичный тариф Google пока не опубликовала. Цена $0,75 за миллион входных и $3,75 за миллион выходных токенов до конца 2026 года относится к обычной Gemini 3.8 Flash.
Что такое CodeMender?
Это разработанный Google DeepMind агент для автоматического исправления уязвимостей. Он анализирует причину проблемы, создает патч и проверяет изменение с помощью тестов и инструментов анализа программы.
Может ли ИИ полностью заменить проверку патчей человеком?
Пока нет. Google сама сохраняет ручную проверку для патчей CodeMender, которые отправляются внешним открытым проектам. CWE-bench тоже показывает ограничение текущих систем: Flash Cyber с одного запуска успешно закрывает 47,2% задач.
Есть новость? Станьте автором.
Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.