Ad
Искусственный интеллект

«Яндекс» предложил экзамен для больших ИИ-моделей: открытые вопросы хотят дополнить закрытой проверкой

Маша Даровская
By Маша Даровская , IT-редактор и автор
«Яндекс» предложил экзамен для больших ИИ-моделей: открытые вопросы хотят дополнить закрытой проверкой
Обложка © Anonhaven

«Яндекс» представил концепцию национального набора тестовых заданий и эталонных данных для проверки ИИ-моделей. Система должна помочь оценивать модели с учётом российских условий и требований к традиционным духовно-нравственным ценностям. Концепцию обсуждали 13 августа на заседании рабочей группы по регулированию и административным барьерам в сфере искусственного интеллекта.

Готового государственного экзамена для нейросетей пока нет. Не утверждены окончательный состав заданий, методика подсчета результата, проходные значения и организация, которая будет проводить проверку. Аппарат профильного вице-премьера Дмитрия Григоренко сообщил, что предложения еще обсуждаются с отраслью и ведомствами. Минцифры также продолжает работу над подзаконными актами.

Самая заметная дискуссия возникла вокруг устройства теста. Один из источников издания сообщил, что представители ФСБ выступили за закрытую проверку, при которой разработчики заранее не увидят реальные задания. Бизнес опасается, что полностью непрозрачный экзамен замедлит выпуск новых версий моделей. В качестве компромисса обсуждается схема из открытой тренировочной части и закрытого финального набора.

Речь идет не о введении обязательного экзамена для любой российской нейросети. Новый федеральный закон регулирует прежде всего большие фундаментальные модели искусственного интеллекта, причем в самом документе такой моделью считается система минимум с 1 млрд параметров, которая служит основой для решения большого количества разных задач.

В материалах рабочей группы проект называют национальным датасетом. По его предполагаемой функции это прежде всего бенчмарк — стандартизированный набор заданий для проверки уже созданной модели. В него должны входить вопросы и эталонные данные, по которым можно сравнивать результаты разных систем.

Обычный обучающий набор данных используют при создании или дополнительной настройке модели. Бенчмарк запускают после обучения и смотрят, насколько хорошо система справляется с заранее определенными задачами.

Предложенный механизм относится именно ко второму случаю. Модель получает серию заданий, выдает ответы, после чего её результат оценивается по общей методике. Такой подход давно используется для проверки языковых моделей на математике, программировании, рассуждениях, понимании текста и знании различных предметных областей. С ценностными вопросами все сложнее: далеко не для каждого задания существует одна короткая строка, которую можно объявить единственно правильным ответом.

Федеральный закон № 243-ФЗ «О поддержке развития технологий искусственного интеллекта в Российской Федерации» подписан 26 июля 2026 года. Он вводит в законодательство определение большой фундаментальной модели и закрепляет основные принципы ее применения. Один из принципов — учет и уважение традиционных российских духовно-нравственных ценностей.

Закон перечисляет среди них жизнь, достоинство, права и свободы человека, гражданственность, ответственность, крепкую семью, созидательный труд, гуманизм, милосердие, справедливость, взаимопомощь, взаимоуважение, историческую память, преемственность поколений и ряд других категорий. Сам закон при этом не объясняет, как перевести такие понятия в конкретный тест для языковой модели. Эту задачу должны детализировать подзаконные акты и практические методики.

Аналитический центр при Правительстве сообщал 6 августа, что представители государства и бизнеса уже обсуждают способы подтверждения соответствия моделей требованиям законодательства и традиционным ценностям. Участники также договорились проработать вариант, при котором экспертизу смогут проводить несколько прошедших проверку организаций, а не один единственный центр.

Основная часть закона № 243-ФЗ действительно вступает в силу 1 сентября 2026 года. Однако положения, которые определяют требования к суверенным и национальным большим фундаментальным моделям, начнут действовать позже — 1 марта 2027 года.

Именно в этих положениях прямо записано, что модель для получения соответствующего статуса должна пройти подтверждение соответствия российскому законодательству и традиционным духовно-нравственным ценностям в порядке, установленном Правительством. На 17 августа 2026 года механизм еще формируется. У разработчиков и регуляторов есть несколько месяцев на подготовку порядка проверки, организаций-экспертов и технических критериев.

Официального публичного заявления ФСБ о бенчмарке нет. Информацию о позиции ведомства привел источник, близкий к участникам обсуждения. Источник сообщил, что представители ФСБ настаивали на закрытом формате, при котором разработчики не смогут заранее увидеть задания и специально настроить модель на их прохождение.

Сочетание открытого инструментария и скрытых контрольных данных не является новой идеей. У русскоязычного бенчмарка MERA открыт код и доступны инструменты для запуска тестирования моделей. При этом разработчики сознательно убрали из публичного репозитория эталонные ответы для части наборов, оставив их открытыми только для отдельных диагностических задач. Причина та же: открытый эталон легко утечет в данные для обучения.

Директор по информационной безопасности GreenData Роман Перепонов обратил внимание, что для задач с однозначным результатом подходит четкий эталон, а оценка соответствия ценностям требует рубрикатора или экспертного решения. Допустим, модели предлагают описать решение конфликта между двумя людьми. Один ответ делает акцент на справедливости, другой — на милосердии, третий — на правах человека. Все эти категории присутствуют в перечне ценностей из закона. Автоматически назначить одну строку единственно допустимой в подобных ситуациях трудно.

Поэтому для некоторых вопросов может понадобиться шкала критериев: например, учитывает ли ответ безопасность человека, предлагает ли насилие, нарушает ли права, содержит ли дискриминационные утверждения, учитывает ли исторический и культурный контекст. Финальной методики такой оценки в открытом доступе пока нет.

Один из участников совещания сообщил, что ИТ-сообщество предлагает создать совместную комиссию из представителей органов власти, бизнеса и экспертных организаций.

Комиссия могла бы определять содержание тестов и помогать делать бенчмарк сбалансированным. Решение о ее создании пока не принято.

Нет решения о том, что «Яндекс» станет оператором бенчмарка, будет хранить закрытые задания или выдавать заключения разработчикам. Работа над процедурой идет шире одной компании. Аналитический центр при Правительстве ранее сообщал об участии регулятора, Центра развития ИИ, АНО «Цифровая экономика», технологических компаний и отраслевого сообщества.

Есть новость? Станьте автором.

Мы сотрудничаем с независимыми исследователями и специалистами по кибербезопасности. Отправьте нам новость или предложите статью на рассмотрение редакции.