
OpenAI столкнулась с новыми обвинениями в непрозрачности после того, как математики потребовали доказать: модели компании не использовали их неопубликованные исследования и обсуждения в ChatGPT для подготовки громких математических результатов.
Ситуация обострилась всего через несколько дней после публичного конфликта вокруг возможного использования незавершённых работ исследователей. Теперь с отдельными претензиями выступил математик Андреас Том (Andreas Thom), который считает поведение OpenAI неэтичным и «нечестным».
В серии публикаций на платформе Mastodon учёный обратил внимание на взаимодействия, которые он и его коллеги проводили с ChatGPT до объявления OpenAI о значительном прогрессе в математике. По его мнению, такие беседы могли предоставить системе идеи, формулировки или направление поиска, позднее использованные при создании результата.
Учёные требуют объяснить происхождение данных
Главный вопрос заключается не только в том, могла ли модель получить доступ к конкретной теореме или доказательству. Исследователей интересует весь путь формирования результата: какие диалоги использовались для обучения, какие данные проходили фильтрацию и как OpenAI отделяет самостоятельно найденные решения от подсказок людей.
Для математического сообщества это особенно чувствительная тема. Неопубликованная работа может содержать оригинальную идею, даже если она ещё не прошла рецензирование и не оформлена в виде статьи. Если подобные материалы попали в обучение без ясного согласия авторов, возникает вопрос о признании вклада и праве использовать результаты.
Претензии также связаны с отсутствием подробной документации. OpenAI раскрывает всё больше информации о возможностях своих моделей, однако обычно не публикует полный состав обучающих наборов и историю конкретных примеров, которые могли повлиять на ответ системы.
Для пользователей из России проблема выглядит знакомой по спорам вокруг генеративного ИИ: сервис может выдать убедительное доказательство или фрагмент кода, но не объяснить, откуда взялась исходная идея. В математике такая непрозрачность осложняет проверку авторства и воспроизводимость результата.
Что известно о настройках использования диалогов
В потребительской версии ChatGPT пользователь может отключить параметр Improve the model for everyone. После этого новые чаты не должны использоваться для обучения моделей, тогда как режим Temporary Chat не сохраняет разговор в истории и, согласно правилам сервиса, не применяется для обучения. Для корпоративных клиентов и API OpenAI по умолчанию заявляет отказ от использования входных и выходных данных для тренировки, если организация отдельно не согласилась на это.
Эти настройки, однако, не отвечают на вопрос, как обрабатывались прежние беседы математиков и какие внутренние процедуры действовали до появления нынешних ограничений. Поэтому от OpenAI ждут не только общих заявлений о конфиденциальности, но и проверяемых объяснений по конкретным случаям.
Компания пока должна прояснить, были ли соответствующие разговоры включены в обучающие массивы, использовались ли они для настройки моделей или могли повлиять на работу исследовательских систем косвенным образом. Без такой информации спор о границе между помощью человека, обучением на диалогах и самостоятельным открытием ИИ продолжится.
История важна и для будущего научных публикаций. Если модели будут регулярно находить новые доказательства, авторам понадобится понятный механизм фиксации приоритета, а разработчикам - прозрачный журнал происхождения данных и идей. Иначе даже корректный результат будет вызывать сомнения в том, кому принадлежит исходный вклад.