
Genie Code: Новий стандарт для агентів даних
Традиційно вважається, що для отримання кращих відповідей від агентів штучного інтелекту потрібно більше токенів, що дозволяє агенту довше досліджувати, більше перевіряти та повторювати спроби, що, як очікується, підвищує точність. Однак, нещодавня оцінка Genie Code від Databricks показала протилежне.
Методологія оцінки
Databricks провела порівняльне дослідження, зіставивши Genie Code з трьома провідними універсальними кодувальними агентами (умовно названими Агент X, Агент Y та Агент Z). Оцінка проводилася на понад 400 реальних завданнях, взятих з внутрішнього використання Databricks. Ці завдання охоплювали широкий спектр: від пошуку потрібних активів до створення та модифікації коду та запитів, налагодження, розуміння існуючого коду та точного пошуку даних.
Кожному агенту було виділено 20 хвилин на виконання завдання. Відповіді оцінювалися незалежним суддею на предмет коректності та корисності. Завдання, що перевищило ліміт часу, вважалося невдалим. Вартісні показники є оцінками, що відображають відносну ефективність. Усі агенти використовували схожі LLM "frontier-рівня" та були доповнені Databricks MCP. Важливо зазначити, що Genie Ontology було вимкнено під час цього тестування, оскільки воно ще не є глобально доступним.
Результати: Точність та Вартість
Результати тестування показали, що Genie Code перевершує універсальні кодувальні агенти як за точністю, так і за вартістю.
| Агент | Точність | Середня вартість за завдання |
|---|---|---|
| Genie Code | 76.6% | $0.55 |
| Агент X | 72.1% | $1.09 |
| Агент Y | 55.9% | $0.91 |
| Агент Z | 56.1% | $1.16 |
Genie Code виявився найточнішим агентом у цьому тесті та найдешевшим, коштуючи приблизно вдвічі менше за завдання, ніж Агент X, і менше половини його вартості за правильну відповідь. Агенти Y та Z показали точність близько 50%, значною мірою через перевищення часу на тривалих скануваннях, часто спричинених неефективними запитами до дуже великих таблиць.
Медіанна вартість завдання становила $0.34, 99-й перцентиль — $2.72, а найдорожче завдання — $3.87. Лише 4% завдань Genie Code перевищили $2. Для порівняння, 33-40% завдань інших агентів перевищили $1 (проти 16% для Genie Code), а найдорожчі запуски Агента X сягали $9.49.
Чому Genie Code ефективніший?
Основна причина переваги Genie Code полягає в його здатності ефективно знаходити потрібні дані. Агенти даних працюють в умовах, де універсальні кодувальні агенти стикаються з труднощами: їм потрібно виявляти правильні активи у динамічному, постійно змінюваному робочому просторі з сотнями тисяч таблиць, блокнотів, дашбордів та документів. Вони також повинні визначати джерело істини серед метаданих та документів, які можуть бути застарілими або суперечливими, і робити це без перевірених тестів, на які покладаються кодувальні агенти.
Genie Code вирішує ці проблеми завдяки:
- Семантичному пошуку по каталогу та активам робочого простору.
- Постійній пам'яті про таблиці та бізнес-логіку, на яку покладаються користувачі.
- Глибокому семантичному розумінню корпоративного контексту.
Це дозволяє Genie Code пропускати "випадковий пошук", до якого вдаються універсальні кодувальні агенти. Наприклад, Genie Code може ефективно знайти потрібну таблицю, використовуючи семантичний пошук та метадані, написати один SQL-запит і отримати правильну відповідь за п'ять викликів інструментів, тоді як жоден з трьох універсальних агентів не зміг відновитися після етапу дослідження. Genie Code в середньому виконує лише 8.3 виклики інструментів на завдання, що менше, ніж у будь-якого іншого протестованого агента.
Висновок
Дослідження показало, що замість очікуваного компромісу між точністю та вартістю, Genie Code демонструє вищу точність та нижчу вартість завдяки своєму глибокому семантичному розумінню даних. Він оптимізований для роботи у високодинамічному та неоднозначному середовищі, такому як робочий простір Databricks, де універсальні кодувальні агенти витрачають ресурси на повторне відкриття контексту. Ця експертиза забезпечує одночасно точність, швидкість та економічність без компромісів у загальних можливостях.
Що це означає для розробників
Ці результати свідчать, що спеціалізовані агенти даних, такі як Genie Code, можуть значно підвищити ефективність та знизити витрати на завдання, пов'язані з даними, порівняно з універсальними кодувальними агентами. Розробники можуть очікувати кращої продуктивності та економічності при використанні інструментів, оптимізованих для динамічних середовищ даних.
Ключові факти
-
Genie Code перевершив три провідні універсальні кодувальні агенти за точністю та вартістю.
-
Оцінка проводилася на 401 реальному завданні з внутрішнього використання Databricks.
-
Genie Code досяг 76.6% точності при середній вартості $0.55 за завдання.
-
Універсальні агенти мали точність від 55.9% до 72.1% та вартість від $0.91 до $1.16 за завдання.
-
Ефективність Genie Code зумовлена семантичним пошуком, постійною пам'яттю та глибоким розумінням контексту, що дозволяє уникнути "випадкового пошуку".
Джерела
Джерело
DatabricksThe Databricks AI Research Team
Why A Frontier Data Agent Outperforms General Coding Agents in Quality and Cost23 липня 2026
Попередні статті

Створення LLM-агента, що пише та виконує код
Дізнайтеся, як побудувати LLM-агента, здатного писати та виконувати код для аналізу даних та генерації звітів, використовуючи OpenAI Agents SDK та Docker. Цей підхід дозволяє автоматизувати складні завдання, такі як інспекція файлів та обробка даних.

OpenAI збільшує бюджет на інфраструктуру до $750 мільярдів та інвестує в дата-центри
OpenAI оголосила про збільшення бюджету на розвиток інфраструктури до $750 мільярдів до 2030 року. Це на 25% більше, ніж попередня оцінка, і спрямовано на забезпечення обчислювальної потужності для ШІ-моделей. Компанія також інвестує $20 мільярдів у новий дата-центр у Джорджії.

Чому ШІ-агенти помиляються з упевненістю: Проблема не в моделях, а в інженерії даних
ШІ-чатботи можуть почати надавати невірні відповіді з упевненістю через місяці після запуску, навіть без змін у моделі чи промптах. Причина криється у застарілих або неповних даних, які не перевіряються на коректність. Це викриває давні слабкості в інженерії даних, де спостережуваність даних стає ключовим рішенням.