Обычный будний вечер автор провёл не за ручным тестированием гипотез, а за описанием процесса для ИИ. Он сформулировал pipeline генерации идей текстом, попросил Gemini оценивать результат каждой попытки, передал всё агенту и лёг спать. Утром в логе оказалось 40 проверенных гипотез — больше, чем автор сделал бы сам за неделю.
Этот случай — не единичный трюк, а часть подхода, который уже получил имя autoresearch. Ранее похожий эксперимент описал пользователь sankalp: он натравил Codex на задачу QR-разложения матрицы, агент держал beam из кандидатов, создавал суб-агентов для профилировки и сам отбраковывал слабые ветки. Итог — ускорение batched QR в 232 раза и 12-е место из 183 участников, при том что у автора не было профессионального опыта с GPU.
Ключевое изменение — в том, кто оценивает результат. В традиционной работе эксперт вкладывается в само решение: собирает признаки, придумывает эвристики, пишет код. Теперь это знание напрямую не нужно. Вместо этого инженер строит цикл, который решение находит сам: бенчмарк, oracle, критерий остановки. Это напоминает bitter lesson, только применительно к роли человека: чем больше вычислительной мощности и данных в распоряжении ИИ, тем менее ценным становится ручное конструирование признаков.
За ночь агент проверил 40 гипотез; часть оказалась мусором, но скорость сравнима с неделей ручной работы.
Практические выводы для разработчиков: можно физически делать меньше работы, если правильно описать критерии оценки. Но есть и ограничения: часть из 40 гипотез оказалась мусором или повторами. Ответственность за постановку задачи и валидацию результатов остаётся на человеке. Autoresearch не отменяет экспертизу, а переносит её на уровень проектирования процесса.

