
OpenAI объявила о создании независимой панели математиков, которая будет консультировать компанию и другие организации, занимающиеся искусственным интеллектом. Группа должна помочь выстроить более ответственное взаимодействие с математическим сообществом после серии громких заявлений о возможностях ИИ, вызвавших недоверие среди исследователей.
В сферу работы панели войдут оценка новых математических результатов, правила их представления и порядок публикации. Отдельное внимание планируют уделить тому, как компании описывают достижения моделей, какие подтверждения приводят и насколько корректно сравнивают работу ИИ с результатами людей.
Зачем OpenAI понадобились внешние советники
За последнее время OpenAI представила несколько впечатляющих результатов в задачах, связанных с математикой и рассуждениями. Однако часть таких заявлений стала причиной репутационного кризиса: ученые усомнились в полноте проверок, формулировках пресс-релизов и том, достаточно ли четко отделены доказанные результаты от предварительных экспериментов.
Для математиков важна не только способность модели получить правильный ответ. Результат должен быть воспроизводимым, проверяемым и понятным специалистам. Если система предлагает решение задачи, необходимо установить, не использовала ли она уже опубликованный материал, не допустила ли скрытую логическую ошибку и может ли другой исследователь повторить проверку.
Появление панели стало неожиданностью для части научного сообщества. Исследователи считают саму идею полезным первым шагом, но пока не понимают, кто именно получит право принимать решения, будет ли совет публиковать свои рекомендации и сможет ли он влиять на уже подготовленные заявления OpenAI.
Неясным остается и формат работы с другими компаниями. В заявлении говорится, что советы смогут быть полезны всему сектору ИИ, однако пока не сообщается, станет ли панель постоянной организацией, будет ли она рассматривать конкретные модели или ограничится разработкой общих принципов.
Что это меняет для оценки ИИ
Математические достижения особенно чувствительны к корректности формулировок. На Международной математической олимпиаде участники решают 6 задач за два дня, а итоговая оценка строится по 42-балльной шкале. Простого совпадения с правильным ответом недостаточно - жюри анализирует ход доказательства и может присудить баллы только за обоснованные части решения.
Этот подход показывает, почему результаты языковых моделей нельзя оценивать одной метрикой точности. Для серьезных исследований нужны независимая проверка, раскрытие условий тестирования, разделение новых открытий и реконструкции известных решений, а также публикация ошибок. В практическом смысле рекомендации математиков могут стать для OpenAI способом внедрить такие процедуры до выхода громких анонсов.
Для пользователей ИИ, включая российских разработчиков и студентов, это означает появление более строгих критериев при оценке заявлений о «решении сложных задач». Пока новая панель только сформирована, поэтому ее эффективность будет зависеть от прозрачности состава, публикации отчетов и готовности OpenAI признавать ограничения своих моделей.