Лауреат премии Тьюринга Ричард Саттон, один из основоположников обучения с подкреплением, в недавнем интервью раскритиковал стратегию ведущих лабораторий ИИ, полагающихся на синтетические данные для масштабирования больших языковых моделей. По его мнению, этот подход не решает проблему ограниченности данных, а лишь упирается в «бесконечную сложность мира».

Саттон известен своим эссе 2019 года «Горький урок», где он утверждает, что в долгосрочной перспективе выигрывают методы, которые масштабируются с вычислительной мощностью, а не те, что полагаются на встроенные человеческие знания. В разговоре с сооснователем своей новой компании Oak Lab Хуррамом Джаведом он отметил, что LLM — это «половина победы»: они успешно масштабировались, «впитав интернет», но упёрлись в стену, поскольку интернет конечен, а реальный мир «массово больше всего, что мы сохранили в интернете». В этой точке, по словам Саттона, системы начинают чрезмерно полагаться на человеческие знания, что их ограничивает.

На вопрос, могут ли синтетические данные прорвать это узкое место, Саттон ответил прямо: «Нет, это просто большая ошибка». Его аргументация основана на «Гипотезе большого мира», сформулированной Джаведом и разрабатываемой группой в Альберте. Суть гипотезы в том, что мир бесконечно сложен и «массово сложнее, чем ваш разум, чем любой агент». Любая симуляция мира — «микроскопична»: небольшая программа может создать лишь маленький мир, не соответствующий реальности, с неверными значениями трения или неточной моделью поведения робота. Кроме того, мир населён множеством других агентов, чьи внутренние процессы невозможно сгенерировать как синтетические данные: «Нет способа получить синтетические данные о чужих умах».

Синтетические данные не решают проблему, так как симуляции мира «микроскопичны» и не отражают его сложность, включая «умы других людей».

Второе возражение Саттона — «человеческое узкое место». Кто решает, какие синтетические данные хорошие, а какие плохие? По аргументу Джаведа, для этого нужны эксперты в предметной области. «Нужны эксперты, которые знают, какой набор данных хорош, а какой плох, чтобы этот подход масштабировался. Это ограничено людьми». Например, чтобы обучить дрон, движущийся как летучая мышь с помощью эхолокации, пришлось бы нанимать профильных специалистов. Это не масштабируется. Даже в случае с беспилотными автомобилями, обученными в симуляции, людям приходится устранять разрыв между симуляцией и реальностью.

Альтернатива Саттона — убрать человека из цикла и позволить агентам учиться на собственном опыте. Агент должен сам строить модель мира и постоянно её корректировать, а не полагаться на замороженную симуляцию, созданную людьми. «Симуляторы они создают сами». Саттон также критикует то, что современные языковые модели перестают учиться после обучения: «Их веса никогда не меняются». Вместо этого нужно настоящее непрерывное обучение, которое, по его мнению, и есть просто обучение, поскольку «всё обучение непрерывно», без стирания старых знаний — так называемого катастрофического забывания. Саттон считает, что эту проблему можно решить, в том числе с помощью метода «Continual Backprop», опубликованного его командой в Nature. Он называет языковые модели «удивительным научным ом», но лишь «примерно 20% или четвертью интеллекта».

Позиция Саттона контрастирует с практикой таких компаний, как OpenAI и Anthropic, которые активно используют синтетические данные для обучения своих моделей. Однако его критика указывает на фундаментальные ограничения этого подхода, которые могут стать всё более актуальными по мере исчерпания реальных данных. Вопрос о том, как обеспечить непрерывное обучение и адаптацию к бесконечно сложному миру, остаётся открытым.