Ориол Виньялс, до недавнего времени вице-президент по исследованиям в Google DeepMind, выступил на саммите Agentic ИИ Summit 2026 с докладом о рекурсивном самосовершенствовании (RSI) — одной из самых обсуждаемых тем в исследованиях ИИ. Он работал над AlphaStar, AlphaCode и Gemini, а теперь покинул Google, чтобы запустить стартап Discovery Loop. По его мнению, RSI — процесс неизбежный, но медленный, и он не приведёт к внезапному взрыву интеллекта.

Виньялс задаётся вопросом: что именно должно улучшаться? У системы ИИ много компонентов — веса нейронной сети, обучающие данные, методы обучения, инструкции для каждого запроса, внешние инструменты вроде доступа к базам данных или исполнения кода, а также метрики, по которым система отслеживает свой прогресс. Каждый из них несёт свои технические и регуляторные сложности. Для самосовершенствования нужна перспективная идея, код, реализующий её, эксперименты для проверки и надёжный способ оценить, помогло ли изменение. ИИ уже продвигается в реализации и экспериментах, но генерация идей и оценка результатов остаются двумя главными узкими местами.

Этап самосовершенствованияСтатус по Виньялсу
Генерация идейОтстаёт, требует «исследовательского вкуса»
РеализацияИИ уже продвигается
ЭкспериментыИИ уже продвигается
Оценка результатовОтстаёт, нужны прямые бенчмарки

Сегодня лаборатории измеряют самосовершенствование косвенно — через бенчмарки способностей, такие как SWE-Bench Pro или ML-Bench. Исследователи следят за ростом в таблице лидеров и надеются, что самосовершенствование проявится как побочный эффект. Эти тесты дешёвы и чётко определены, но охватывают в основном реализацию и эксперименты — те этапы, которые уже работают. Вдобавок реальны проблемы переобучения и «схеминга»: Виньялс знает по опыту создания игровых агентов, что системы эксплуатируют цели неожиданным образом, обыгрывая систему подсчёта очков вместо самой игры. Более осмысленные бенчмарки должны тестировать самосовершенствование напрямую, и первые такие тесты уже появляются. Система получает метрику и бюджет вычислений, а исследователи измеряют, насколько она улучшила себя. Подход дорогой, потому что каждая оценка требует работы агента в течение нескольких часов над задачами, далёкими от конечной цели. Виньялс приводит пример: агент оптимизирует «Тетрис», тогда как реальная цель — автоматизировать целую исследовательскую лабораторию и построить лучшую в мире модель.

Главные препятствия для самосовершенствования — генерация идей и оценка результатов; реализация и эксперименты уже поддаются автоматизации.

Генерация идей развита не меньше. Хорошее исследование требует чутья, какие идеи вообще стоит преследовать, — того, что Виньялс называет «исследовательским вкусом». В обучении LLM никто всерьёз не изучал, как этому научить. Он ожидает, что будущие оценки будут измерять не только величину улучшения, но и то, как система к нему пришла. Для идей это означает те же критерии, что применяют рецензенты конференций: оригинальность, элегантность, эффективность и способность метода выдержать проверку временем. Часть этого можно выразить в правилах и проверять через reward-модели, а затем обучать с подкреплением, но делать это очень трудно и долго. Человеческая проверка тоже дорога и не особенно хорошо выявляет сильные идеи.

Виньялс указывает и на физические ограничения. Чипы не могут вычислять быстрее, чем позволяют их конструкция и скорость света, поэтому даже если ИИ спроектирует лучший алгоритм, он всё равно будет привязан к оборудованию. В некоторых областях производительность человека, возможно, уже близка к верхнему пределу. Насколько хорош AlphaGo на самом деле по сравнению с идеальной партией в го? Никто не знает, говорит Виньялс.

Свой анализ Виньялс воплощает в жизнь через Discovery Loop — стартап, который он соучредил с Джеффом Дином в роли CEO, старшим научным сотрудником Google Санджаем Гемаватом и соучредителем Google Brain Куоком Ле. Компания хочет автоматизировать полный научный цикл: от формирования гипотез до проведения экспериментов и оценки результатов, включая те два этапа, где ИИ пока отстаёт. Трое из четырёх основателей входят в число самых цитируемых исследователей ИИ, а Гемават — один из самых цитируемых в области распределённых систем. Команда планирует сначала автоматизировать исследования в области ИИ, а Discovery Loop станет собственным первым клиентом, как выразился Дин. Другие научные области подтянутся позже. На сайте компании основатели описывают будущее, где «несколько человек могут проводить научные исследования и инженерные задачи гораздо быстрее и с более высоким качеством, чем сегодня огромные команды учёных и инженеров».

Таким образом, Виньялс не отрицает самосовершенствование ИИ, но подчёркивает его постепенность и наличие фундаментальных ограничений. Его стартап — попытка ускорить прогресс за счёт автоматизации именно тех этапов, которые сейчас плохо поддаются машинам: генерации идей и оценки результатов.