Ориол Виньялс, до недавнего времени вице-президент по исследованиям в Google DeepMind, выступил на саммите Agentic ИИ Summit 2026 с докладом о рекурсивном самосовершенствовании (RSI) — одной из самых обсуждаемых тем в исследованиях ИИ. Он работал над AlphaStar, AlphaCode и Gemini, а теперь покинул Google, чтобы запустить стартап Discovery Loop. По его мнению, RSI — процесс неизбежный, но медленный, и он не приведёт к внезапному взрыву интеллекта.
Виньялс задаётся вопросом: что именно должно улучшаться? У системы ИИ много компонентов — веса нейронной сети, обучающие данные, методы обучения, инструкции для каждого запроса, внешние инструменты вроде доступа к базам данных или исполнения кода, а также метрики, по которым система отслеживает свой прогресс. Каждый из них несёт свои технические и регуляторные сложности. Для самосовершенствования нужна перспективная идея, код, реализующий её, эксперименты для проверки и надёжный способ оценить, помогло ли изменение. ИИ уже продвигается в реализации и экспериментах, но генерация идей и оценка результатов остаются двумя главными узкими местами.
| Этап самосовершенствования | Статус по Виньялсу |
|---|---|
| Генерация идей | Отстаёт, требует «исследовательского вкуса» |
| Реализация | ИИ уже продвигается |
| Эксперименты | ИИ уже продвигается |
| Оценка результатов | Отстаёт, нужны прямые бенчмарки |
Сегодня лаборатории измеряют самосовершенствование косвенно — через бенчмарки способностей, такие как SWE-Bench Pro или ML-Bench. Исследователи следят за ростом в таблице лидеров и надеются, что самосовершенствование проявится как побочный эффект. Эти тесты дешёвы и чётко определены, но охватывают в основном реализацию и эксперименты — те этапы, которые уже работают. Вдобавок реальны проблемы переобучения и «схеминга»: Виньялс знает по опыту создания игровых агентов, что системы эксплуатируют цели неожиданным образом, обыгрывая систему подсчёта очков вместо самой игры. Более осмысленные бенчмарки должны тестировать самосовершенствование напрямую, и первые такие тесты уже появляются. Система получает метрику и бюджет вычислений, а исследователи измеряют, насколько она улучшила себя. Подход дорогой, потому что каждая оценка требует работы агента в течение нескольких часов над задачами, далёкими от конечной цели. Виньялс приводит пример: агент оптимизирует «Тетрис», тогда как реальная цель — автоматизировать целую исследовательскую лабораторию и построить лучшую в мире модель.
Главные препятствия для самосовершенствования — генерация идей и оценка результатов; реализация и эксперименты уже поддаются автоматизации.
Генерация идей развита не меньше. Хорошее исследование требует чутья, какие идеи вообще стоит преследовать, — того, что Виньялс называет «исследовательским вкусом». В обучении LLM никто всерьёз не изучал, как этому научить. Он ожидает, что будущие оценки будут измерять не только величину улучшения, но и то, как система к нему пришла. Для идей это означает те же критерии, что применяют рецензенты конференций: оригинальность, элегантность, эффективность и способность метода выдержать проверку временем. Часть этого можно выразить в правилах и проверять через reward-модели, а затем обучать с подкреплением, но делать это очень трудно и долго. Человеческая проверка тоже дорога и не особенно хорошо выявляет сильные идеи.
Виньялс указывает и на физические ограничения. Чипы не могут вычислять быстрее, чем позволяют их конструкция и скорость света, поэтому даже если ИИ спроектирует лучший алгоритм, он всё равно будет привязан к оборудованию. В некоторых областях производительность человека, возможно, уже близка к верхнему пределу. Насколько хорош AlphaGo на самом деле по сравнению с идеальной партией в го? Никто не знает, говорит Виньялс.
Свой анализ Виньялс воплощает в жизнь через Discovery Loop — стартап, который он соучредил с Джеффом Дином в роли CEO, старшим научным сотрудником Google Санджаем Гемаватом и соучредителем Google Brain Куоком Ле. Компания хочет автоматизировать полный научный цикл: от формирования гипотез до проведения экспериментов и оценки результатов, включая те два этапа, где ИИ пока отстаёт. Трое из четырёх основателей входят в число самых цитируемых исследователей ИИ, а Гемават — один из самых цитируемых в области распределённых систем. Команда планирует сначала автоматизировать исследования в области ИИ, а Discovery Loop станет собственным первым клиентом, как выразился Дин. Другие научные области подтянутся позже. На сайте компании основатели описывают будущее, где «несколько человек могут проводить научные исследования и инженерные задачи гораздо быстрее и с более высоким качеством, чем сегодня огромные команды учёных и инженеров».
Таким образом, Виньялс не отрицает самосовершенствование ИИ, но подчёркивает его постепенность и наличие фундаментальных ограничений. Его стартап — попытка ускорить прогресс за счёт автоматизации именно тех этапов, которые сейчас плохо поддаются машинам: генерации идей и оценки результатов.



