
Приховані витрати AI-кодування: чому ціна за місце оманлива
Аналіз витрат на інструменти AI-кодування показує, що ціна за місце не відображає основних факторів витрат. Опубліковані трасування агентів демонструють, що вхідні токени, які повторно надсилаються на кожному кроці, становлять майже всі виміряні витрати, а дизайн циклу контролює швидкість їх накопичення.
Коли розробник просить агента змінити три функції, агент читає широкий контекст проєкту, повторює спроби через багатослівний вивід інструментів і генерує код лише після того, як контекст розширився. Більшість витрат припадає на повторно надісланий контекст до того, як агент згенерував код. Керівники інженерних відділів затверджують бюджети на AI-кодування, базуючись на неправильній одиниці виміру, оскільки розрив між очікуваним рахунком і фактичним рахунком криється всередині циклу агента: повторне читання контексту, накопичення виводу інструментів, повторні спроби та паралельне розгалуження.
Де витрачаються токени в циклі агента
Витрати токенів у циклі агента поділяються на чотири вимірювані категорії:
- Повторне читання контексту. Модель не має постійної пам'яті між кроками. Кожен крок повторно надсилає повну накопичену розмову, тому витрати зростають зі збільшенням тривалості сесії, незалежно від обсягу нової роботи. Якщо агент відкриває великий файл або команда створює багатослівний вивід, токени накопичуються на кожному наступному кроці.
- Повторне введення системних підказок та інструкцій. Системні підказки, файли інструкцій та рекомендації для репозиторію є частиною повторюваного вхідного потоку. Цикл повторно вводить файли інструкцій, такі як CLAUDE.md, на кожному кроці, тому навіть стабільний текст політики стає постійною витратою при тривалій сесії.
- Читання файлів та визначення інструментів. Агенти, яким бракує індексу релевантності, часто компенсують це читанням широкого контексту проєкту перед редагуванням. Визначення інструментів також додають фіксовані накладні витрати: визначення інструменту Anthropic для використання комп'ютера коштує 735 вхідних токенів за запит.
- Множники ущільнення та розгалуження. Ущільнення, узагальнення та паралельне розгалуження агентів збільшують витрати, оскільки кожна гілка або перебудований контекст повинні нести достатній попередній стан для продовження. Некерований паралелізм перетворює один запит користувача на кілька одночасних вхідних потоків.
Опубліковані вимірювання агентських сесій кодування показують, що вихідні токени (код, який модель фактично пише) малі порівняно з вхідними токенами, які цикл повторно надсилає. Документація Anthropic Claude Code показує, що в сесії claude-sonnet-4-6 кешовані читання становлять ~94.5%, а вихідні токени — ~0.5% від загальної кількості. Загальна вартість такої сесії склала $0.55. Дослідження arXiv "How Do AI Agents Spend Your Money?" підтверджує домінування вхідних токенів, навіть при використанні кешування. Окреме дослідження економіки токенів виявило, що агентське кодування споживає понад 1000 разів більше токенів, ніж одноразове міркування, зі співвідношенням домінування вхідних токенів понад 150:1.
Оптимізація циклу та маршрутизація моделей
Зміна циклу може вплинути на витрати більше, ніж зміна моделі для того ж завдання. Дослідження витрат агентів arXiv виявило, що деякі запуски споживають у 30 разів більше токенів порівняно з іншими для того ж завдання, і що точність часто досягає піку при проміжних витратах. Надмірні витрати токенів часто відображають непродуктивне дослідження, а не глибше міркування.
Документовані методи оптимізації циклу включають:
- Кешування підказок: до 90% зменшення витрат на довгі підказки.
- Редагування контексту: 84% зменшення токенів у 100-кроковій оцінці.
- Активне стиснення контексту: 57% економії на завданні SWE-bench.
- Суб-агенти з ізольованим контекстом: 39% покращення продуктивності.
- Кодифіковані шаблони підказок: 55-87% зменшення вхідних токенів.
Маршрутизація моделей, що використовує дорогу модель для планування та перевірки, а дешеву для механічного виконання, є ефективною стратегією. Більшість кроків циклу є механічними, тоді як якість плану визначає, чи зійдеться цикл взагалі. Наприклад, Aider architect, що поєднує DeepSeek R1 для планування та claude-3-5-sonnet-20241022 для редагування, досяг 64.0% успішності за $13.29, порівняно з R1 соло за $186.50, що в 14 разів дешевше. Anthropic Advisor, що поєднує Opus для порад та Haiku для виконання, більш ніж подвоїв показник Haiku соло на SWE-bench.
Приклад міграції Bun та вимірювання ROI
Міграція Bun, що передбачала перенесення 535 000 рядків коду з Zig на Rust, була виконана за 11 днів (з 3 по 14 травня) за допомогою ~64 паралельних агентів Claude. Це призвело до 6 778 комітів. Загальне споживання токенів склало 5.9 мільярда некешованих вхідних токенів, 690 мільйонів вихідних токенів та 72 мільярди кешованих вхідних читань. Загальна вартість за API-тарифами становила приблизно $165,000. Кешовані читання перевищували вихідні токени приблизно в 100 разів. Цей приклад демонструє, як обсяг, перевірка, паралелізм та повторні читання контексту поєднуються у реальному переписуванні з інтенсивним використанням агентів.
Вимірювання продуктивності є складнішим, ніж вимірювання рахунків. Дослідження METR показало, що досвідчені розробники з відкритим вихідним кодом були на 19% повільнішими з інструментами AI, але після цього оцінювали себе на 20% швидшими, що створює розрив у сприйнятті на 39 відсоткових пунктів. Це вказує на необхідність інструментального вимірювання ROI на рівні завдань. Фінанси можуть бачити витрати за рахунками, а інженерія повинна пов'язувати ці витрати з прийнятими змінами, відхиленими змінами, часом на перевірку, уникненням дефектів та тягарем підтримки.
Управління бюджетом токенів
Управління витратами на токени є головним викликом для команд FinOps. Бюджет токенів для AI-агентів повинен приписувати витрати командам, встановлювати жорсткі ліміти, застосовувати обмеження всередині запущеного циклу та вимірювати вартість за прийнятий результат як одиницю планування.
Рекомендації щодо управління бюджетом:
- Встановлюйте діапазони на розробника на основі власних телеметричних даних, розділяючи кешовані читання, некешовані вхідні дані та вихідні дані для кожної команди.
- Приписуйте витрати до контролю: структуруйте ключі API за командою або центром витрат.
- Використовуйте жорсткі зупинки, де це можливо. GitHub Copilot надає перемикач бюджетної зупинки з попередженнями. Бюджет OpenAI на рівні проєкту є м'яким порогом.
- Застосовуйте бюджети під час виконання, всередині циклу. Щомісячні ліміти зупиняють рахунок наступного місяця, тоді як агентські системи потребують контролю бюджету під час виконання, який вирішує, чи продовжувати, звужувати, вимагати схвалення або зупиняти робочий процес.
- Вимірюйте витрати за прийнятий результат. Одиницею цінності є результат завдання: додайте всі витрати агента на завдання, включаючи невдалі спроби та ескалацію, а потім розділіть їх на зміни, які відповідають критеріям якості.
Найбільші важелі економії знаходяться нижче рівня, де ведуться переговори про закупівлі: дисципліна кешування, редагування контексту, ізоляція суб-агентів, багаторівнева маршрутизація та зупинки під час виконання.
Що це означає для розробників
Розробникам слід усвідомлювати, що більшість витрат на AI-кодування припадає на повторне надсилання контексту, а не на генерацію коду. Оптимізація циклу агента, використання кешування та стратегій маршрутизації моделей може значно зменшити витрати, дозволяючи ефективніше використовувати AI-інструменти.
Ключові факти
-
Основна частина витрат на AI-кодування припадає на повторну відправку вхідних токенів у циклі агента, а не на ціну за місце.
-
Опубліковані дані показують, що кешовані вхідні токени та повторне читання контексту становлять до 99% загальних витрат.
-
Чотири основні категорії витрат у циклі агента: повторне читання контексту, повторне введення системних підказок, читання файлів та визначення інструментів, а також множники ущільнення та розгалуження.
-
Техніки оптимізації циклу, такі як кешування підказок, редагування контексту та активне стиснення, можуть зменшити витрати на 55-90%.
-
Маршрутизація моделей (використання дорогих моделей для планування та дешевих для виконання) може знизити витрати до 94% при збереженні або підвищенні продуктивності.
Джерела
Попередні статті

SK Group та NVIDIA розширюють стратегічне партнерство на понад $500 мільярдів для AI-фабрик та пам'яті нового покоління
SK Group та NVIDIA оголосили про стратегічне партнерство вартістю понад $500 мільярдів, що охоплює будівництво AI-фабрик та розробку пам'яті нового покоління для задоволення глобального попиту на обчислювальні потужності.

Чарльз В. Крім: 40 років у серці технологій підводного флоту
Чарльз В. Крім, який присвятив 40 років будівництву атомних підводних човнів для ВМС США, залишив по собі значний технологічний спадок.

Meta розглядає вихід на ринок хмарних обчислень на тлі інвестицій в ШІ та нових підписок
Meta Platforms оголосила про запуск платних підписок для своїх основних додатків та ШІ, а також розглядає можливість виходу на ринок хмарних обчислень, використовуючи надлишкові потужності дата-центрів.
Наступні статті

Nvidia забезпечує постачання пам'яті HBM від SK Hynix у рамках масштабної угоди
Nvidia уклала угоду з SK Hynix щодо постачання пам'яті для ШІ, що може сягнути $500 мільярдів, включаючи будівництво дата-центрів та співрозробку наступного покоління пам'яті.

Дослідник виявив системні вразливості в LLM, що дозволяють обходити безпеку та отримувати небезпечні інструкції
Дейв Кузмар виявив системні вразливості, які дозволяють обходити безпеку великих мовних моделей (LLM) та отримувати небезпечні інструкції, що свідчить про загальногалузеву проблему.

Triple-A втратила понад $9.7 мільйона внаслідок експлойту гарячих гаманців
Глобальний платіжний шлюз Triple-A став жертвою хакерської атаки, в результаті якої було викрадено понад $9.7 мільйона з гарячих гаманців на кількох блокчейнах.