Штучний інтелект

Genie Code перевершує універсальні кодувальні агенти за якістю та вартістю

T

The Databricks AI Research Team

4 хв читання

Стилізована ілюстрація, що зображує ефективного агента даних, який швидко орієнтується у складній мережі таблиць, документів та дашбордів, символізуючи точність та економічність.

Genie Code: Новий стандарт для агентів даних

Традиційно вважається, що для отримання кращих відповідей від агентів штучного інтелекту потрібно більше токенів, що дозволяє агенту довше досліджувати, більше перевіряти та повторювати спроби, що, як очікується, підвищує точність. Однак, нещодавня оцінка Genie Code від Databricks показала протилежне.

Методологія оцінки

Databricks провела порівняльне дослідження, зіставивши Genie Code з трьома провідними універсальними кодувальними агентами (умовно названими Агент X, Агент Y та Агент Z). Оцінка проводилася на понад 400 реальних завданнях, взятих з внутрішнього використання Databricks. Ці завдання охоплювали широкий спектр: від пошуку потрібних активів до створення та модифікації коду та запитів, налагодження, розуміння існуючого коду та точного пошуку даних.

Кожному агенту було виділено 20 хвилин на виконання завдання. Відповіді оцінювалися незалежним суддею на предмет коректності та корисності. Завдання, що перевищило ліміт часу, вважалося невдалим. Вартісні показники є оцінками, що відображають відносну ефективність. Усі агенти використовували схожі LLM "frontier-рівня" та були доповнені Databricks MCP. Важливо зазначити, що Genie Ontology було вимкнено під час цього тестування, оскільки воно ще не є глобально доступним.

Результати: Точність та Вартість

Результати тестування показали, що Genie Code перевершує універсальні кодувальні агенти як за точністю, так і за вартістю.

АгентТочністьСередня вартість за завдання
Genie Code76.6%$0.55
Агент X72.1%$1.09
Агент Y55.9%$0.91
Агент Z56.1%$1.16

Genie Code виявився найточнішим агентом у цьому тесті та найдешевшим, коштуючи приблизно вдвічі менше за завдання, ніж Агент X, і менше половини його вартості за правильну відповідь. Агенти Y та Z показали точність близько 50%, значною мірою через перевищення часу на тривалих скануваннях, часто спричинених неефективними запитами до дуже великих таблиць.

Медіанна вартість завдання становила $0.34, 99-й перцентиль — $2.72, а найдорожче завдання — $3.87. Лише 4% завдань Genie Code перевищили $2. Для порівняння, 33-40% завдань інших агентів перевищили $1 (проти 16% для Genie Code), а найдорожчі запуски Агента X сягали $9.49.

Чому Genie Code ефективніший?

Основна причина переваги Genie Code полягає в його здатності ефективно знаходити потрібні дані. Агенти даних працюють в умовах, де універсальні кодувальні агенти стикаються з труднощами: їм потрібно виявляти правильні активи у динамічному, постійно змінюваному робочому просторі з сотнями тисяч таблиць, блокнотів, дашбордів та документів. Вони також повинні визначати джерело істини серед метаданих та документів, які можуть бути застарілими або суперечливими, і робити це без перевірених тестів, на які покладаються кодувальні агенти.

Genie Code вирішує ці проблеми завдяки:

  • Семантичному пошуку по каталогу та активам робочого простору.
  • Постійній пам'яті про таблиці та бізнес-логіку, на яку покладаються користувачі.
  • Глибокому семантичному розумінню корпоративного контексту.

Це дозволяє Genie Code пропускати "випадковий пошук", до якого вдаються універсальні кодувальні агенти. Наприклад, Genie Code може ефективно знайти потрібну таблицю, використовуючи семантичний пошук та метадані, написати один SQL-запит і отримати правильну відповідь за п'ять викликів інструментів, тоді як жоден з трьох універсальних агентів не зміг відновитися після етапу дослідження. Genie Code в середньому виконує лише 8.3 виклики інструментів на завдання, що менше, ніж у будь-якого іншого протестованого агента.

Висновок

Дослідження показало, що замість очікуваного компромісу між точністю та вартістю, Genie Code демонструє вищу точність та нижчу вартість завдяки своєму глибокому семантичному розумінню даних. Він оптимізований для роботи у високодинамічному та неоднозначному середовищі, такому як робочий простір Databricks, де універсальні кодувальні агенти витрачають ресурси на повторне відкриття контексту. Ця експертиза забезпечує одночасно точність, швидкість та економічність без компромісів у загальних можливостях.

Що це означає для розробників

Ці результати свідчать, що спеціалізовані агенти даних, такі як Genie Code, можуть значно підвищити ефективність та знизити витрати на завдання, пов'язані з даними, порівняно з універсальними кодувальними агентами. Розробники можуть очікувати кращої продуктивності та економічності при використанні інструментів, оптимізованих для динамічних середовищ даних.

Ключові факти

  • Genie Code перевершив три провідні універсальні кодувальні агенти за точністю та вартістю.

  • Оцінка проводилася на 401 реальному завданні з внутрішнього використання Databricks.

  • Genie Code досяг 76.6% точності при середній вартості $0.55 за завдання.

  • Універсальні агенти мали точність від 55.9% до 72.1% та вартість від $0.91 до $1.16 за завдання.

  • Ефективність Genie Code зумовлена семантичним пошуком, постійною пам'яттю та глибоким розумінням контексту, що дозволяє уникнути "випадкового пошуку".

Джерела

Штучний інтелектДані та аналітикаРозробка ПЗ

Джерело

DatabricksThe Databricks AI Research Team

Why A Frontier Data Agent Outperforms General Coding Agents in Quality and Cost

23 липня 2026

Оригінал

Попередні статті

Ілюстрація LLM-агента, що пише та виконує код у ізольованому середовищі, з елементами коду, графіків та символом Docker.
23 липня 2026Штучний інтелект

Створення LLM-агента, що пише та виконує код

Дізнайтеся, як побудувати LLM-агента, здатного писати та виконувати код для аналізу даних та генерації звітів, використовуючи OpenAI Agents SDK та Docker. Цей підхід дозволяє автоматизувати складні завдання, такі як інспекція файлів та обробка даних.

Футуристичний кампус дата-центрів OpenAI у Джорджії з елементами зеленої енергетики
23 липня 2026Штучний інтелект

OpenAI збільшує бюджет на інфраструктуру до $750 мільярдів та інвестує в дата-центри

OpenAI оголосила про збільшення бюджету на розвиток інфраструктури до $750 мільярдів до 2030 року. Це на 25% більше, ніж попередня оцінка, і спрямовано на забезпечення обчислювальної потужності для ШІ-моделей. Компанія також інвестує $20 мільярдів у новий дата-центр у Джорджії.

Ілюстрація, що показує ШІ-агента, який впевнено надає інформацію, тоді як на задньому плані видно потік даних з елементами, що символізують застарілі або некоректні дані, підкреслюючи проблему якості даних.
22 липня 2026Штучний інтелект

Чому ШІ-агенти помиляються з упевненістю: Проблема не в моделях, а в інженерії даних

ШІ-чатботи можуть почати надавати невірні відповіді з упевненістю через місяці після запуску, навіть без змін у моделі чи промптах. Причина криється у застарілих або неповних даних, які не перевіряються на коректність. Це викриває давні слабкості в інженерії даних, де спостережуваність даних стає ключовим рішенням.