В статье на Habr автор, скрывающийся под псевдонимом, делится историей из детства, которая, по его мнению, иллюстрирует фундаментальное различие между обучением человека и современных ИИ-моделей. В детском саду мальчик из семьи математиков утверждал, что существует число «миллиард», но другие дети, включая автора, не знали такого числа. В споре автор, не имея возможности проверить факт, заявила: «Докажи. Досчитай до миллиарда». Мальчик сбился, и группа признала победу автора, хотя формально она была неправа.
Ключевой момент, по мнению автора, не в том, что ошибка была исправлена позже, когда родители мальчика объяснили, что миллиард существует. Важнее то, что до выяснения истины ошибка привела к изменению социального статуса автора: дети стали относиться к ней как к лидеру, воспитатели начали давать более сложные задания, и впоследствии автор стала лучше учиться. Из этой ошибки система обучения извлекла не знание «миллиард существует», а знание «я могу справляться со сложными интеллектуальными ситуациями». Это изменило не конкретный факт в памяти, а правило отбора будущего опыта: автор начала выбирать более сложные задачи и чаще рисковать.
Автор утверждает, что в современных ИИ ошибка работает иначе. Модели минимизируют функцию потерь, используют обучение с подкреплением и корректируют параметры, но все эти сигналы — loss, reward prediction error, RLHF — работают единой схемы числовой оптимизации, где цели задаёт разработчик. Даже продвинутые методы meta-learning не меняют пространство целей. У человека же существует отдельный, телесно укоренённый контур благополучия, который может конкурировать с чистой логикой минимизации риска и боли. Ошибка прогноза проигрыша, подкреплённая дофамином, норадреналином и кортизолом, может стать триггером для изменения политики обучения, а не просто для корректировки параметров.
Автор предлагает архитектурный принцип, согласно которому ИИ должен иметь возможность извлекать из ошибки не только сигнал для изменения весов, но и мета-знание о том, как учиться дальше. Это потребовало бы введения отдельного контура, который оценивает не только правильность ответа, но и влияние ошибки на будущую стратегию. Пока такого механизма нет, ИИ останется инструментом, оптимизирующим заданные функции, но не способным к настоящему разуму, который предполагает способность пересматривать собственные цели обучения.

