Андреас Том, математик, специализирующийся на несофных группах, опубликовал в Mastodon серию сообщений с обвинениями в адрес OpenAI. По его словам, взаимодействие с чат-ботом ChatGPT, которое он и его коллеги вели до того, как компания объявила о своих математических результатах, могло повлиять на успех модели. Один из десяти результатов, представленных OpenAI с большой помпой в прошлом месяце, относился именно к области несофных групп — бесконечных математических структур, которые нельзя приблизить конечными. Компания признала, что её результат во многом опирался на предыдущие работы Тома и Габора Куна.

После публикации OpenAI подверглась критике в математических кругах за то, что не указала недавний вклад Тома и Куна, и компания тихо отредактировала свой текст. Том обратил внимание на «детальное владение OpenAI нашими методами» — по его словам, это были не самые очевидные и не самые перспективные пути к решению на тот момент. Он направил письма исследователям OpenAI Себастьену Бубе и Марку Селлке, также статистику Гарварда, с вопросом, были ли его взаимодействия с ChatGPT «частью обучающих данных или доступны в процессе рассуждений» и могли ли они таким образом внести вклад в результат. Ответ Тома не удовлетворил: он касался только того, могут ли его беседы с ботом быть доступны напрямую, но не того, попали ли они в обширные пулы обучающих данных, которые компания использует для улучшения моделей. «Никаких оговорок, объяснений или доказательств предоставлено не было, — написал он. — Я считаю это нечестностью, мягко говоря».

СобытиеДетали
Публикация результатов OpenAI10 математических результатов, включая несофные группы
Признание OpenAIРезультат опирался на работы Тома и Куна
РеакцияКритика в математических кругах, тихая правка текста
Запрос ТомаПисьма Бубе и Селлке о возможном использовании данных
Ответ OpenAIНе исключил косвенного влияния обезличенных данных

Том отметил, что у исследователей нет инструментов, чтобы обратным проектированием выяснить, использовалась ли их работа. «Только у OpenAI есть соответствующие данные для этого». Если компания отрицает такое использование, именно на ней лежит ответственность доказать это, раскрыв все необходимые наборы данных и разъяснив настройки и условия, определяющие, как она использует данные. Нежелание OpenAI окончательно исключить использование пользовательских данных перекликается с тем, как компания защищала свой недавний в задаче тысячелетия — как в публичных заявлениях, так и в переписке с Бакмастером, который работал над задачами с исследователем Anthropic Левентом Альпёге в личном качестве. В блоге, анонсирующем решение задачи Навье — Стокса о движении жидкостей, OpenAI категорически отрицала использование конкретных пользовательских данных: «Мы (исследователи и агенты) не видели их работу никоим образом, пока они не опубликовали её — в частности, никакие конкретные пользовательские данные не были доступны для решения этой задачи». Но компания не стала окончательно исключать косвенное влияние: «Хотя это маловероятно, мы не можем исключить, что обезличенные данные, полученные из их использования наших продуктов, помогли улучшить наши модели». Том говорит, что это то же самое затемняющее различие, которое компания проводила в общении с ним. «Обезличивание может удалить имя; оно не удаляет интеллектуальное содержание математической идеи», — сказал он.

OpenAI признала, что её результат по несофным группам опирался на предыдущие работы Тома и Куна, и позднее отредактировала публикацию.

Construction At The First Stargate AI Data Center
Construction At The First Stargate AI Data Center · Источник: The Verge AI

В свете последних событий Том заявил, что «категоричный ответ Селлке был как минимум неоправданно широким и существенно вводящим в заблуждение; оглядываясь назад, это было откровенно нечестно». По его словам, было бы «этически неоправданно», если бы непубличные исследования, предоставленные пользователями, помогли улучшить модели, которые компания затем использовала, чтобы соревноваться с теми же пользователями в публикации, без согласия, должного раскрытия или указания авторства. OpenAI не ответила на запрос The Verge о комментарии. Его замечания добавляют к растущему беспокойству в математических кругах в момент, который должен был стать триумфом для компании. Объявленное решение одной из легендарных задач тысячелетия — выдающееся достижение, которое, если будет подтверждено, мало кто станет отрицать. Но это осложнилось необычными обстоятельствами, которые, по словам OpenAI, привели её к решению задачи: компания услышала в сети слухи о том, что другие исследователи добились серьёзного прогресса, и решила тоже попробовать. Продолжающийся инцидент оставил неприятный осадок у математиков. Многие исследователи рассказали The Verge, что опасаются: такое поведение подтолкнёт область к большей секретности, если математики будут знать, что даже слухи о близости к крупному у могут спровоцировать гонку с хорошо обеспеченным технологическим гигантом.