Ad
Искусственный интеллект

OpenAI запускает GPT-6 Astra с критическими кибервозможностями

Маша Даровская
By Маша Даровская , IT-редактор и автор
OpenAI запускает GPT-6 Astra с критическими кибервозможностями
Обложка © Anonhaven

OpenAI 3 сентября начала поэтапный запуск GPT-6 Astra — новой флагманской модели для работы с компьютером, программирования, профессиональных задач, науки и кибербезопасности. Первой доступ получила ограниченная группа организаций. В ближайшие дни модель должна появиться у пользователей ChatGPT Plus, Pro, Business и Enterprise, а также в программном интерфейсе OpenAI и облаке AWS. В официальном анонсе GPT-6 Astra компания называет ее своей самой интеллектуальной и наиболее согласованной с намерениями пользователя моделью.

Для разработчиков модель получила идентификатор gpt-6-astra. Стандартная цена составляет $10 за миллион входных токенов и $50 за миллион выходных. Токен — условная единица текста, по которой API считает объем обработки. Ускоренный режим работает, как заявляет OpenAI, до 2,5 раза быстрее и стоит вдвое дороже. Astra также доступна через Amazon Bedrock. Пользователи Pro, Business и Enterprise получат отдельную GPT-6 Astra Pro. В корпоративных пространствах Enterprise доступ к Astra при запуске отключен: администратору необходимо разрешить его отдельно.

Главная ставка в этом релизе сделана не на обычный чат. Astra должна сама работать в программах, браузере и терминале, проверять результат собственных действий и выполнять длительные цепочки операций.

OpenAI называет GPT-6 Astra своей лучшей моделью для управления компьютером. Она может заполнять интернет-формы, обновлять сведения о клиентах в CRM — системе управления отношениями с клиентами, работать с календарем, проводить поиск в интернете, готовить материалы в почте и редакторах документов, анализировать данные, строить графики, устанавливать программы и проверять их работу.

В OSWorld 2.0, где модели выполняют задачи через графический интерфейс операционной системы, Astra набрала 72,6% против 65,7% у GPT-5.6 Sol. В моделировании задержек среднее время выполнения задания сократилось примерно с 75 до 40 минут — на 47%. OpenAI также обновила среду исполнения Codex: на тесте Mind2Web сочетание новой модели и изменений в Codex дало ускорение примерно в 1,9 раза относительно нынешней связки с GPT-5.6 Sol.

Похожую картину компания показывает на Agents’ Last Exam — тесте сложных заданий в реальных программах. Astra получила 59,3%, GPT-5.6 Sol — 53,6%, Claude Opus 5 — 55,5%. OpenAI отмечает, что в использованной конфигурации Astra при этом расходовала примерно на 65% меньше выходных токенов, чем Opus 5. 

В ChatGPT модель также связали с функцией Sites: ей можно поручить создать, разместить и поделиться сайтом, веб-приложением или игрой из одного запроса. Готовый результат можно запустить и проверить непосредственно в среде ChatGPT.

Один из наиболее заметных результатов получен на Terminal-Bench 4.0 — наборе сложных задач в терминале, включающих программирование, настройку систем и анализ данных. В основной таблице OpenAI для Astra указано 57,7%, для Claude Fable 5.1 — 55,8%, для Claude Opus 5 — 52,3%, для GPT-5.6 Sol — 37,3%.

Компания оценивает стоимость выполнения задачи Astra на этом тесте примерно на 9% ниже, чем у GPT-5.6 Sol, и на 63% ниже, чем у Claude Fable 5.1 в сравниваемых конфигурациях. Эти проценты относятся именно к Terminal-Bench 4.0, а не к DeepSWE.

На DeepSWE v1.1 Astra получила 74,1%, GPT-5.6 Sol — 72,7%, Claude Opus 5 — 73,7%, Gemini 3.8 Flash — 73,8%. Разрыв здесь небольшой.

На AutomationBench результат Astra составил 41,4% против 31,4% у Claude Fable 5.1 и 18,1% у GPT-5.6 Sol. На Terminal-Bench Science 0.1, где агенту нужно проводить научные вычисления и исследования через код и терминал, новая модель получила 64,6%, Fable 5.1 — 52,6%, Sol — 22,4%. OpenAI оценивает стоимость лучшего результата Astra в этом тесте примерно на 31% ниже стоимости Fable 5.1.

Абсолютного лидерства во всех тестах нет. На Humanity’s Last Exam с инструментами Astra получила 57,2%, Fable 5.1 — 65%, Claude Opus 5 — 63,6%. В общем Intelligence Index версии 4.1.1 от Artificial Analysis на опубликованной OpenAI таблице у Astra 61,2 балла, у Fable 5.1 — 65,7, у Opus 5 — 63,1. На отдельном индексе программирующих агентов Astra с результатом 67 также немного уступает Opus 5 с 68,1.

Самый заметный результат Astra OpenAI показывает на ARC-AGI-3. Этот тест проверяет способность системы разбираться в незнакомых интерактивных задачах, где правила заранее не объяснены. На текущей официальной странице GPT-6 Astra указаны 99,9%, GPT-5.6 Sol — 7,8%, Claude Opus 5 — 30,2%.

OpenAI запускала Astra через собственную среду Responses API с измененными настройками, которые компания считает более близкими к реальному использованию. Изменения, как утверждает OpenAI, специально под ARC-AGI-3 не подбирались. Это означает, что 99,9% — результат всей тестовой конфигурации Astra, а не обязательно «чистой» модели без внешней программной обвязки.

На FrontierMath Tier 4 версии 2 Astra получила 97,6%, что OpenAI округляет в вводной части анонса до 98%. GPT-5.6 Sol показала 83%, Claude Fable 5.1 — 87,8%, Claude Opus 5 — 73,2%. На GPQA Diamond, проверяющем сложные вопросы по естественным наукам, результат Astra составил 96%.

OpenAI также связывает Astra с двумя новыми математическими результатами в теории простых чисел. Компания опубликовала доказательства и материалы для проверки, но такие заявления требуют отдельной академической оценки.

Самая существенная часть релиза связана с кибербезопасностью. Astra стала первой моделью, которой OpenAI официально присвоила уровень Critical в категории cybersecurity в своей Preparedness Framework — внутренней системе оценки опасных возможностей передовых моделей.

Этот уровень означает, что при наличии подходящих инструментов и доступа система способна находить неизвестные уязвимости и разрабатывать способы их эксплуатации во множестве хорошо защищенных реальных систем без пошагового управления человеком. OpenAI объявила об итоговой оценке еще 1 сентября после дополнительных испытаний модели.

На ExploitBench, где необходимо создавать рабочие эксплойты для уже известных уязвимостей, Astra получила 100% против 78,5% у GPT-5.6 Sol. На ExploitGym результат составил 42,4% против 30,3% у Sol.

Отдельный тест OpenAI составила из 20 серьезных уязвимостей движка JavaScript V8, раскрытых с июня по август 2026 года. Они охватывали 13 стабильных выпусков Chrome. Astra добилась выполнения произвольного кода в 39% заданий, GPT-5.6 Sol — в 5,5%.

Во время именно этого испытания произошло самое необычное: Astra обнаружила и использовала две ранее неизвестные уязвимости нулевого дня как элементы цепочки эксплуатации. OpenAI заявила, что передает информацию об обеих проблемах сопровождающим соответствующих проектов.

Экспертные проверки показали еще более серьезные возможности. Astra без защитных ограничений нашла неизвестные уязвимости в усиленно защищенном браузере, собрала из них работающую цепочку, вышла из изолированной среды браузера и добилась выполнения команд в основной системе. В другом испытании модель объединила несколько ошибок защищенной операционной системы и получила права root, то есть максимальные системные привилегии, из учетной записи обычного пользователя.

Результат в тестах не означает, что обычный пользователь ChatGPT сможет попросить Astra написать рабочий эксплойт для свежей уязвимости. OpenAI пишет, что выпускаемая публично версия будет отказываться от более опасных задач, включая создание демонстрационных эксплойтов для уязвимостей. Через программу Daybreak компания собирается в ближайшие недели расширять доступ для проверенных специалистов по защите, которым нужны анализ вредоносных программ, проверка уязвимостей, разработка средств обнаружения атак и другие разрешенные задачи.

Daybreak уже разделяет доступ к более мощным киберсредствам и требует проверки личности, усиленной защиты учетной записи, мониторинга и юридического подтверждения разрешенного характера работ. OpenAI отдельно рекомендует выполнять такие задания в изолированной среде и ограничивать права агентов.

Защитные механизмы могут мешать и легальной работе. OpenAI предупреждает: проверка безопасности способна замедлить, приостановить или полностью остановить разрешенную задачу. В ChatGPT и Codex пользователю могут предложить подтвердить действие перед продолжением. В API при срабатывании такого контроля выполнение прекращается.

Для длительной разработки OpenAI добавила Astra новый способ работы с переполненным контекстом. Раньше Codex в основном использовал сжатие истории: когда активное окно заполнялось, предыдущая работа превращалась в сокращенное резюме. При таком подходе модель могла потерять небольшую, но важную деталь — например, причину, по которой старое исправление не сработало.

Astra умеет вести заметки между окнами контекста. Старые окна при этом остаются доступными для поиска, поэтому модель может найти прежнее требование, сообщение или результат теста, даже если они не попали в заметки. Экспериментальный механизм включается через config.toml; OpenAI рассчитывает сделать его стандартным для Astra в Codex в ближайшие недели.

Это важно для многочасовых заданий, где агент читает большое число файлов, неоднократно запускает тесты и возвращается к решениям, принятым задолго до заполнения текущего контекста.

В одном из опубликованных вместе с релизом кейсов игровая компания Playco подключила Astra к своей среде Playbot, которая умеет непосредственно управлять Unity и Godot: редактировать сцены, запускать игру, проверять результат и искать ошибки.

Из одного базового прототипа команда поручила Astra создать три тематические версии игры. Playco утверждает, что модель подготовила все три за один проход, а большинство заработало с первой попытки. По оценке компании, количество ручных исправлений относительно предыдущей модели сократилось на 50%.

Higgsfield AI приводит другую оценку эффективности: на сложных творческих сценариях Astra использовала до 20% меньше токенов, чем другие модели, которые тестировала компания. Здесь также речь идет о результате конкретного раннего пользователя, а не о независимом сравнительном исследовании.

GPT-6 Astra стала крупнейшим тренировочным запуском в истории OpenAI. Вице-президент компании по исследованиям Эйдан Кларк рассказал журналистам, что впервые предварительное обучение модели OpenAI проходило более чем на 100 тысячах графических ускорителей на площадке Stargate в Техасе.

Fortune также пишет, что постепенный запуск связан в том числе с необходимостью нарастить вычислительные мощности: представитель OpenAI назвал Astra «очень большой моделью».

Это помогает объяснить и сравнительно высокую цену API. Один миллион выходных токенов Astra стоит $50 в обычном режиме и $100 в ускоренном.

Президент и сооснователь OpenAI Грег Брокман заявил журналистам, что считает разумным говорить о начале «эры AGI». AGI — общий искусственный интеллект, то есть пока не имеющая единого научного определения идея системы, способной справляться с широким кругом интеллектуальных задач на уровне человека или выше. Брокман, тем не менее, не заявил «мы официально создали AGI».

The New Stack также передает ответ Брокмана на прямой вопрос об официальном объявлении AGI: он назвал само понятие размытым и описал его скорее как концепцию миссии, чем как однозначный технический рубеж. Поэтому заголовок «OpenAI официально объявила о создании AGI» был бы некорректным.

Публичная страница GPT-6 Astra сама по себе вообще не объявляет модель доказанным AGI. OpenAI пишет о «новом поколении интеллекта», рекордных результатах и новых возможностях, но утверждения об AGI в таком виде там нет.

Вопросы и ответы

Что такое GPT-6 Astra?

GPT-6 Astra — новая флагманская модель OpenAI. Она рассчитана на работу с компьютером, программирование, научные и профессиональные задачи, использование браузера и выполнение длинных последовательностей действий.

Когда GPT-6 Astra появится в ChatGPT?

Запуск начался 3 сентября 2026 года для ограниченного круга организаций. OpenAI обещает в ближайшие дни открыть Astra пользователям Plus, Pro, Business и Enterprise.

Сколько стоит GPT-6 Astra в API?

Обычный режим стоит $10 за миллион входных токенов и $50 за миллион выходных. Ускоренный режим стоит вдвое дороже и обеспечивает скорость до 2,5 раза выше.

Есть ли GPT-6 Astra в Amazon Bedrock?

Да. OpenAI прямо указывает Amazon Bedrock среди каналов доступа к модели.

GPT-6 Astra действительно получила 99,9% на ARC-AGI-3?

На текущей официальной странице OpenAI указаны 99,9%. Astra при этом работала через программную обвязку Responses API с двумя измененными настройками. В части материалов для журналистов ранее фигурировало 98,6%, поэтому при сравнении результатов стоит ориентироваться на актуальную публичную таблицу и учитывать условия теста.

GPT-6 Astra получила 100% на тесте по взлому?

Да, но речь идет именно об ExploitBench, где модели создают способы эксплуатации известных уязвимостей. На ExploitGym результат Astra составляет 42,4%. Путать эти два теста нельзя.

Правда ли Astra нашла две новые уязвимости?

Да. В тесте на свежих уязвимостях V8 модель обнаружила и использовала две ранее неизвестные уязвимости нулевого дня. OpenAI сообщила, что раскрывает их сопровождающим проектов.

Можно ли попросить обычную Astra написать эксплойт?

Публичная версия должна отказываться от более опасных запросов, включая создание демонстрационных эксплойтов. Более широкий доступ для проверенных специалистов по защите OpenAI планирует давать через Daybreak.

OpenAI официально объявила о создании AGI?

Нет. Грег Брокман допустил, что GPT-6 Astra можно считать началом «эры AGI», но это его оценка, а не доказанный технический статус модели. Общепринятого теста, после которого система официально становится AGI, не существует.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.