Отчёт OpenAI о восьми кейсах модернизации научного ПО, преимущественно в биологии, показывает: coding-агенты Codex и Claude Code справляются с задачами от обновления сборки до полного переписывания на современных языках. Однако авторы исследования предупреждают: агенты не могут оценить, корректна ли наука, стоящая за кодом.

Самый заметный результат — у проекта RustQC. Объединив 15 инструментов контроля качества в одну программу, агенты сократили время обработки большого набора данных с 15 часов 34 минут до 14 минут 54 секунд, то есть более чем в 60 раз. GPU-версия HelixForge выполнила полный конвейер генерации синтетических геномных данных в 59,6 раза быстрее BamSurgeon, а основной этап вычислений — в 98,6 раза. Проект rustar-aligner переписал STAR на Rust: на 10 тысячах коротких прочтений дрожжевых клеток совпадение с оригиналом составило 99,8% для одноцепочных прочтений и 99,9% для парно-концевых.

ПроектЧто сделаноРезультат
RustQCОбъединение 15 инструментов контроля качестваВремя обработки сократилось с 15 ч 34 мин до 14 мин 54 с (ускорение >60×)
HelixForgeGPU-переписывание генератора синтетических геномных данныхПолный конвейер в 59,6 раза быстрее BamSurgeon, основной шаг — в 98,6 раза
rustar-alignerПереписывание STAR на RustСовпадение с оригиналом 99,815% (single-end) и 99,883% (paired-end)
hifiasmОптимизация сиквенс-сборщика с помощью GPT-5.5Сокращение времени работы на реальных данных почти на 15%

При этом агенты не способны судить о научной корректности результатов. В кейсе bayesm ошибка инвертировала управляющий параметр, из-за чего программа использовала обратные значения; баг нашли только после калибровочного теста на тысячах синтетических наборов. Разработчик RustQC Филип Эвелс описывает агентов как «красноречивых, убедительных и уверенно ошибающихся»: он не позволял моделям оценивать собственную работу, а создал независимый тестовый контур.

rustar-aligner переписал STAR на Rust: совпадение результатов с оригиналом достигло 99,8% на тестовых данных.

The eight projects span from simple build modernization to a full GPU-native rewrite. | Image: OpenAI
The eight projects span from simple build modernization to a full GPU-native rewrite. | Image: OpenAI · Источник: The Decoder

Проекты строились по единой схеме: люди определяли цели и критерии валидации, агенты писали код. Разработчик MHCflurry Сергей Фельдман связывает неудачный порт на PyTorch начала 2025 года с ограничениями тогдашних моделей: по его мнению, только новые поколения стали достаточно надёжными. Пока же «быстро» не означает «правильно»: как пишет разработчик cyvcf2 Брент Педерсен, для движения в науке по-прежнему нужны экспертиза, понимание и тщательность.