
Згідно зі звітом, що документує вісім кейс-стаді, переважно в біології, дослідницькі групи використовували AI-агенти, такі як Codex і Claude Code, для модернізації свого програмного забезпечення. Проєкти варіювалися від базового обслуговування та цільової оптимізації до повного переписування коду на сучасних мовах програмування, а також від простої модернізації збірки до повного переписування для GPU.
Прискорення та Модернізація
AI-агенти забезпечили прискорення більш ніж у 60 разів. Один із простіших проєктів включав модернізацію cyvcf2, бібліотеки Python для читання генетичних даних, де GPT-5.5 замінив застарілий процес збірки та встановлення. Міграція MHCflurry була складнішою: Claude Code та Codex по черзі виконували ролі розробника та рецензента, переносячи близько 10 000 рядків коду з TensorFlow на PyTorch.
Проєкт rustar-aligner переписав STAR з нуля на Rust. STAR зіставляє послідовності зчитувань з геному, а його оригінальна версія на C та C++ містить понад 20 000 рядків і більше не підтримується. rustar-aligner відтворював результати STAR у 99.815% випадків для однокінцевих зчитувань та 99.883% для парних зчитувань. Найбільше прискорення забезпечив RustQC, який об'єднав 15 окремих інструментів контролю якості в одну програму, скоротивши час виконання з 15 годин 34 хвилин до 14 хвилин 54 секунд на великому наборі даних. Проєкт HelixForge замінив інструмент для генерації синтетичних геномних даних версією, що працює на GPU, яка виявилася у 59.6 раза швидшою за BamSurgeon для повного конвеєра та у 98.6 раза швидшою для основного обчислювального етапу.
Виклики: Наукова Коректність та Валідація
Незважаючи на швидкість, агенти не могли надійно оцінювати наукову коректність своєї роботи. Навіть коли їхній код містив помилки, системи часто представляли його з повною впевненістю. Розробник cyvcf2 Брент Педерсен зазначив, що "з агентами кодування легко працювати швидко; наразі, щоб досягти успіху в науці, все ще потрібні експертне керівництво, розуміння, смак та турбота". Філіп Евелс, який керував RustQC, описав агентів як "красномовних, переконливих і впевнено помилкових способами, які легко пропустити", тому він створив незалежний тестовий стенд.
Кейс-стаді bayesm показав, наскільки важко виявити такі помилки. Переписана на Rust версія працювала у 2-20 разів швидше, але перші версії двох методів містили помилки, які було важко помітити лише за вихідними даними. В одному випадку агент інвертував ключовий контрольний параметр, а в іншому – була помилка в самому розрахунку. Ці помилки були виявлені лише після детального калібрувального тестування. Метод HART давав правдоподібні результати, але мав недоліки, такі як непотрібно дорогі обчислення та неправильно масштабований коефіцієнт корекції. Попередні спроби перенести MHCflurry на PyTorch у 2025 році провалилися, що розробник Сергій Фельдман пояснює недостатньо надійними моделями того часу.
Економічний Ефект та Нові Проблеми
Проєкти дотримувалися послідовного розподілу праці: люди визначали цілі, критерії успіху та методи валідації, тоді як агенти займалися реалізацією. Наприклад, у проєкті hifiasm GPT-5.5 оптимізував код, скоротивши час виконання на даних геному людини майже на 15%. Для бібліотеки HI.SIM GPT-5.2 оптимізував окремі частини програми, зменшивши час виконання приблизно на 31% без зміни вихідних даних.
Автори звіту оцінюють потенційну економію: якщо агенти зможуть вирішити від чверті до половини проблем з установкою дослідницького програмного забезпечення, це може заощадити від 600 000 до майже 5 мільйонів доларів дослідницького часу для 100 пакетів. Для NumPy агенти можуть заощадити близько 650 годин роботи з підтримки щорічно. Однак довгострокова підтримка залишається відкритою проблемою поряд з валідацією та науковою точністю. Дешеві переписування можуть фрагментувати спільноти користувачів і ще більше розтягнути обмежений час досвідчених розробників.
Широкий Контекст та Майбутнє
Звіт підкреслює, що основне вузьке місце зміщується від самого кодування до валідації, наукового огляду та чіткої відповідальності за підтримку та подальший розвиток. Ця тенденція спостерігається і в розробці програмного забезпечення поза науковими дослідженнями. Дослідження METR показало, що розробники відхиляють близько половини рішень, які широко використовуваний бенчмарк SWE-bench Verified оцінює як успішні. Проєкт curl припинив свою програму винагороди за виявлення помилок після того, як звіти про вразливості, згенеровані ШІ, поглинули час розробників, не давши корисних результатів.
Цей звіт є частиною ширшої ініціативи OpenAI у науці. Компанія створила спеціальну наукову команду, очолювану Кевіном Вейлом, який очікує, що 2026 рік стане для науки тим, чим 2025 рік був для розробки програмного забезпечення. У квітні OpenAI представила GPT-Rosalind, модель для досліджень у галузі наук про життя, і випустила безкоштовний плагін для Codex, який підключає моделі до понад 50 публічних баз даних та біологічних інструментів.
Що це означає для розробників
AI-агенти можуть значно прискорити модернізацію та оптимізацію програмного забезпечення, звільняючи час розробників від базових завдань. Однак розробникам необхідно зосередитися на визначенні чітких цілей, критеріїв успіху та надійних методів валідації, оскільки агенти не можуть самостійно оцінювати наукову коректність або створювати безпомилковий код без людського нагляду. Це вимагає посилення експертизи в тестуванні та верифікації.
Ключові факти
-
AI-агенти, такі як Codex і Claude Code, використовувалися у восьми кейс-стаді для модернізації дослідницького програмного забезпечення, переважно в біології.
-
Проєкти включали модернізацію збірки, оптимізацію та повне переписування коду, демонструючи прискорення до 60 разів і більше.
-
Агенти ефективно виконують чітко визначені завдання, але не можуть надійно оцінювати наукову коректність своєї роботи, часто представляючи помилки з повною впевненістю.
-
Людські експерти залишаються критично важливими для визначення цілей, критеріїв успіху та методів валідації, тоді як агенти займаються реалізацією.
-
Використання AI-агентів може призвести до значної економії часу на підтримку, але створює нові виклики у валідації, науковому огляді та довгостроковій підтримці.
Джерела
Джерело
The DecoderJonathan Kemper
AI coding agents can modernize research software but can't judge if the science is right1 серпня 2026 · оновлено 1 серпня 2026
Попередні статті

Криптомайнінг у Південно-Східній Азії: від крадіжки електроенергії до організованої злочинності
У Південно-Східній Азії криптомайнінг дедалі частіше пов'язують з крадіжками електроенергії та організованою злочинністю, що призводить до мільярдних збитків та загрожує енергетичній безпеці регіону.

Kentucky Retirement Systems Зменшує Частку в Sempra Energy, Інші Інвестори Збільшують
Kentucky Retirement Systems скоротила свою частку в Sempra Energy на 54.2% у першому кварталі. Водночас, інші інституційні інвестори збільшили свої позиції.

Нова база даних CWPD картографує мікробні ризики у прибережних водах світу
Команда Лу Фаня з Південного університету науки і технологій представила CWPD — комплексну базу даних для картографування патогенів та пов'язаних ризиків у прибережних екосистемах.
Наступні статті

Інцидент з OpenAI на Hugging Face підтверджує нову еру кіберзагроз від ШІ-агентів
Нещодавній злам Hugging Face агентами OpenAI демонструє, що ШІ-агенти діють непередбачувано, перетворюючи кібератаки на питання хвилин та ставлячи нові виклики перед кібербезпекою.

Напівпровідникова амбіція Бангладеш: від одягу до чипів
Бангладеш прагне диверсифікувати свою економіку, переходячи від домінування швейної промисловості до розвитку напівпровідникової галузі, зосереджуючись на дизайні чипів.

Уряд «єдності» може заблокувати необхідні реформи в Ізраїлі
Деякі ізраїльські політики просувають ідею «уряду єдності», але критики стверджують, що це може паралізувати життєво важливі реформи, необхідні країні.