Отчёт OpenAI о восьми кейсах модернизации научного ПО, преимущественно в биологии, показывает: coding-агенты Codex и Claude Code справляются с задачами от обновления сборки до полного переписывания на современных языках. Однако авторы исследования предупреждают: агенты не могут оценить, корректна ли наука, стоящая за кодом.
Самый заметный результат — у проекта RustQC. Объединив 15 инструментов контроля качества в одну программу, агенты сократили время обработки большого набора данных с 15 часов 34 минут до 14 минут 54 секунд, то есть более чем в 60 раз. GPU-версия HelixForge выполнила полный конвейер генерации синтетических геномных данных в 59,6 раза быстрее BamSurgeon, а основной этап вычислений — в 98,6 раза. Проект rustar-aligner переписал STAR на Rust: на 10 тысячах коротких прочтений дрожжевых клеток совпадение с оригиналом составило 99,8% для одноцепочных прочтений и 99,9% для парно-концевых.
| Проект | Что сделано | Результат |
|---|---|---|
| RustQC | Объединение 15 инструментов контроля качества | Время обработки сократилось с 15 ч 34 мин до 14 мин 54 с (ускорение >60×) |
| HelixForge | GPU-переписывание генератора синтетических геномных данных | Полный конвейер в 59,6 раза быстрее BamSurgeon, основной шаг — в 98,6 раза |
| rustar-aligner | Переписывание STAR на Rust | Совпадение с оригиналом 99,815% (single-end) и 99,883% (paired-end) |
| hifiasm | Оптимизация сиквенс-сборщика с помощью GPT-5.5 | Сокращение времени работы на реальных данных почти на 15% |
При этом агенты не способны судить о научной корректности результатов. В кейсе bayesm ошибка инвертировала управляющий параметр, из-за чего программа использовала обратные значения; баг нашли только после калибровочного теста на тысячах синтетических наборов. Разработчик RustQC Филип Эвелс описывает агентов как «красноречивых, убедительных и уверенно ошибающихся»: он не позволял моделям оценивать собственную работу, а создал независимый тестовый контур.
rustar-aligner переписал STAR на Rust: совпадение результатов с оригиналом достигло 99,8% на тестовых данных.

Проекты строились по единой схеме: люди определяли цели и критерии валидации, агенты писали код. Разработчик MHCflurry Сергей Фельдман связывает неудачный порт на PyTorch начала 2025 года с ограничениями тогдашних моделей: по его мнению, только новые поколения стали достаточно надёжными. Пока же «быстро» не означает «правильно»: как пишет разработчик cyvcf2 Брент Педерсен, для движения в науке по-прежнему нужны экспертиза, понимание и тщательность.
