Дані та аналітика

Як співпраця людини та ШІ змінює інженерію даних: досвід GovTech

Д

Джерело: Government Technology Agency of Singapore (GovTech Singapore)

7 хв читання

Ілюстрація, що показує співпрацю людини та штучного інтелекту в інженерії даних, де користувач даних взаємодіє з інтерфейсом ШІ, а інженер даних переглядає складні архітектурні схеми.

Вузькі місця в інженерії даних: виклик сучасності

Створення конвеєра даних не повинно займати тижні, але для багатьох організацій це саме так. Причина не в складності роботи, а в тому, що одна й та сама невелика група інженерів даних постійно пише шаблонний код. Ця проблема повторюється для кожного конвеєра даних у черзі. Вузьке місце полягає у робочому процесі, який ще не адаптувався до можливостей штучного інтелекту. Сучасне будівництво конвеєрів даних все ще передбачає значну кількість ручної, повторюваної роботи, яка стає некерованою зі зростанням попиту.

Розподіл ролей та його наслідки

У більшості команд, що працюють з даними, ролі чітко розділені. Користувачі даних виступають як архітектори: вони документують бізнес-правила, визначають вимоги та глибоко розуміють дані. Інженери даних є будівельниками: вони беруть ці вимоги та вручну перетворюють їх у робочий код. Як наслідок, інженери даних витрачають більшу частину свого часу на повторювані, низькоцінні завдання, пишучи шаблонний код та створюючи подібні перевірки валідації з нуля, замість того, щоб займатися більш цінною інженерною роботою. Тим часом, користувачі даних обмежені пасивною роллю. Незважаючи на глибоке розуміння даних, їм бракує навичок кодування на виробничому рівні, щоб діяти безпосередньо. Це призводить до зростання відставання, розтягування термінів та відмови від роботи через брак ресурсів, а не амбіцій. Масштабування стає неможливим, оскільки кількість ініціатив визначається кількістю персоналу, а не попитом.

Рішення: інтелектуальний фреймворк для даних

Зростаючий попит на інфраструктуру даних та обмежена кількість кваліфікованих інженерів даних роблять наймання більшої кількості фахівців нестійким рішенням. Невикористаний ресурс вже є: це користувачі даних, які добре розуміють дані, але не мають інструментів для безпосередньої дії на основі цих знань. Надання їм цих інструментів, одночасно звільняючи інженерів даних від повторюваної ручної роботи, є початком справжнього, масштабованого прогресу. Рішення полягає не у збільшенні команди, а в розумнішому способі роботи. Добре розроблений фреймворк для даних усуває ручні передачі, які створюють відставання, надаючи користувачам даних інструменти для безпосередньої дії на основі їхніх знань та автоматизуючи повторювану роботу.

Ключові характеристики ефективного фреймворку

Якісний фреймворк для даних повинен:

  • Розширювати можливості користувачів даних: Замість того, щоб пропускати кожну вимогу до даних через інженера, фреймворк надає користувачам інструменти для самостійного визначення правил даних, усуваючи тертя посередника.
  • Скорочувати розрив між вимогами та реалізацією: Замість того, щоб інженери даних вручну інтерпретували та переписували бізнес-логіку в код, фреймворк автоматично виконує переклад, миттєво перетворюючи текстові вимоги в машиночитаний код.
  • Автоматизувати повторювані завдання: Ручне написання сценаріїв поступається місцем згенерованому коду, звільняючи інженерів для зосередження на стратегічній архітектурі системи, а не на шаблонному коді. Це змінює їхню роль з єдиних будівельників на архітекторів контролю якості та рецензентів, що дозволяє одному інженеру підтримувати кілька ініціатив.
  • Вбудовувати відповідність у процес: Правила відповідності вбудовуються безпосередньо в початкові шаблони, роблячи управління природною відправною точкою життєвого циклу конвеєра даних.
  • Змінювати спосіб роботи команд: Це переформатовує щоденні робочі процеси та відповідальність, перетворюючи користувачів даних з пасивних збирачів вимог на активних співавторів, які мають реальну відповідальність за екосистему даних, яку вони знають найкраще.

Фреймворк AIDE від GovTech: співпраця людини та ШІ

AIDE (AI for Data Engineering) — це фреймворк співпраці людини та ШІ, який змінює розподіл ролей у команді даних. Замість того, щоб писати вимоги та чекати, поки інженер даних їх реалізує, користувачі даних тепер можуть безпосередньо працювати з ШІ-асистентом для генерації технічних компонентів, необхідних для створення конвеєра даних: контракту даних, який визначає структуру та правила даних, набору тестів, який перевіряє дотримання цих правил, та самого конвеєра даних. Потім ШІ запускає конвеєр проти набору тестів, автоматично коригуючи його, доки він не пройде. Інженери даних більше не є єдиними будівельниками; їхня роль зміщується до фінальної перевірки, рецензування згенерованого ШІ конвеєра та результатів тестів перед його затвердженням.

Як працює фреймворк AIDE:

  1. Генерація контракту даних: Користувач даних надає ШІ невеликий зразок даних (не більше 10 записів), так званий Golden Dataset, разом з контекстом простою мовою, що описує, як повинні виглядати дані. На основі цього ШІ розробляє машиночитаний контракт даних, документ, що визначає структуру та правила даних. Вимоги до відповідності, такі як ті, що передбачені Рамковою програмою управління даними уряду Сінгапуру (SG-DRM), вбудовуються в контракт з самого початку.
  2. Генерація набору тестів: ШІ перетворює контракт даних у набір тестових випадків, які перевіряють, чи відповідають дані визначеним правилам. Цей процес часто виявляє прогалини в контракті даних, які користувач даних не врахував. Користувач даних переглядає прогалини та уточнює контракт даних, а ШІ відповідно оновлює тестові випадки. Цей цикл повторюється, доки базовий контракт даних не стане надійним.
  3. Побудова конвеєра: Після затвердження контракту ШІ автоматично створює сам конвеєр даних, не вимагаючи ручного кодування. Перед генерацією конвеєра користувачі можуть вказати стандарти кодування та генерувати власні функції валідації на основі своїх бізнес-правил. Потім конвеєр перевіряється за допомогою набору тестів, і ШІ продовжує його коригувати, доки всі тести не пройдуть.
  4. Валідація після запуску конвеєра: Після запуску конвеєра VOWL, двигун валідації якості даних з відкритим вихідним кодом від GovTech, забезпечує дотримання правил, визначених у контракті. Він безперервно відстежує реальні дані, що проходять через конвеєр. Інженери даних залишаються залученими на цьому етапі як рецензенти, які втручаються, коли VOWL виявляє проблему, щоб дослідити та вирішити її разом з користувачем даних.

Перші результати та потенціал

AIDE розпочався як доказ концепції, спосіб перевірити, чи може співпраця людини та ШІ значно змінити спосіб побудови конвеєрів даних. Ранні результати є багатообіцяючими. Використання ШІ для виконання рутинних, повторюваних частин розробки конвеєрів звільняє інженерів даних для зосередження на більш цінній роботі, одночасно надаючи користувачам даних прямий спосіб діяти на основі їхнього досвіду. Якщо цей підхід витримає масштабування, він може стати сильним прикладом для організацій щодо побудови сучасної екосистеми конвеєрів даних: безпечної, відповідної та ефективно реалізованої з самого початку.

Принципи для впровадження

Принципи, що лежать в основі фреймворку AIDE від GovTech — розширення можливостей експертів у предметній області, усунення ручних передач та автоматизація повторюваної роботи — не є винятковими для уряду. Будь-яка організація, яка прагне подолати вузьке місце в інженерії даних, може їх застосувати. Ось кілька порад для початку:

  1. Почніть з репрезентативних зразків даних: Використовуйте невеликий набір реальних, чистих записів, а не довгі текстові документи для опису даних.
  2. Вбудовуйте відповідність з самого початку: Вбудовуйте відповідні правила безпосередньо у контракт даних з самого початку.
  3. Визначте «хороші дані» до початку побудови: Заздалегідь чітко визначте, як виглядають правильні, повні дані для вашого випадку використання.
  4. Дозвольте автоматизації обробляти повторювану роботу: Використовуйте автоматизацію для заміни ручного написання сценаріїв, звільняючи інженерів для перегляду результатів.
  5. Залишайте людей у циклі: Автоматизація виконує побудову, але люди повинні приймати рішення. Необхідно, щоб хтось переглядав та затверджував результати на кожному ключовому етапі.
  6. Базуйтеся на перевірених практиках: Використовуйте перевірені фреймворки та найкращі практики, розроблені на основі реального досвіду інженерії даних.

Майбутнє інженерії даних

Інженерне вузьке місце, яке уповільнює роботу багатьох команд даних, не є неминучим; це результат традиційного розподілу праці. Коли користувачі даних оснащені для безпосередньої побудови та валідації конвеєрів, а не просто описують те, що їм потрібно, а інженери даних звільнені для зосередження на високоякісному перегляді, а не на ручному будівництві, організації можуть нарешті рухатися зі швидкістю, яку вимагає попит. На основі ранніх випробувань AIDE показує потенціал для значного скорочення відставання у розробці конвеєрів, оскільки шаблонне кодування та валідація переміщуються від інженерів даних до користувачів даних та автоматизованих робочих процесів. Це дозволяє меншій, більш кваліфікованій команді підтримувати набагато більше ініціатив. Конвеєри, що досягають виробництва, також можуть стати більш надійними, з меншою кількістю збоїв та інцидентів, безперервною валідацією з першого дня та меншою потребою в ручних виправленнях. Це не вимагатиме додаткового персоналу, лише та сама команда даних, оснащена гострішими інструментами та ефективнішим способом роботи. Це справжня зміна, яку уможливлює співпраця людини та ШІ: не більша команда, а та, яка може будувати швидше, безпечніше та в масштабах, які раніше були неможливими.

Що це означає для розробників

Ця новина означає, що інженери даних можуть перейти від рутинного написання шаблонного коду до стратегічної архітектури, забезпечення якості та ролі рецензентів. Вони зможуть підтримувати більше ініціатив, зосереджуючись на складніших завданнях, тоді як ШІ автоматизує повторювані процеси.

Ключові факти

  • Будівництво конвеєрів даних часто займає тижні через рутинне написання шаблонного коду інженерами.

  • Вузьке місце в інженерії даних полягає у робочому процесі, а не у кваліфікації чи амбіціях.

  • Інженери даних витрачають більшу частину часу на повторювані, низькоцінні завдання, тоді як користувачі даних залишаються пасивними.

  • Фреймворк AIDE від GovTech дозволяє користувачам даних працювати з ШІ-асистентом для генерації технічних компонентів конвеєра (контракт даних, набір тестів, сам конвеєр).

  • ШІ автоматично налаштовує конвеєр даних, доки він не пройде всі тести.

Джерела

Дані та аналітикаШтучний інтелектРозробка ПЗ

Джерело

Government Technology Agency of Singapore (GovTech Singapore)

Breaking the Bottleneck: How Human-AI Collaboration is Reshaping Data Engineering

22 липня 2026

Оригінал

Попередні статті

Абстрактна ілюстрація потоку даних з різних джерел до централізованої платформи, де вони обробляються та стають доступними для аналітики та ШІ.
21 липня 2026Дані та аналітика

Послуги Data Engineering: Перетворення даних на надійну основу для бізнесу

Послуги Data Engineering допомагають компаніям перетворити розрізнені дані на надійну основу для швидких рішень, підвищення ефективності та масштабування, вирішуючи проблеми доступності та якості інформації.

Ілюстрація, що зображує адаптивний шар вилучення даних, який збирає інформацію з різноманітних джерел, таких як бази даних, API, хмарні сервіси та електронні таблиці, направляючи її до єдиного призначення.
21 липня 2026Дані та аналітика

Недооцінена частина інженерії даних: проєктування масштабованої екстракції даних

У світі інженерії даних, де увага часто прикута до Spark чи Kafka, фаза екстракції даних залишається недооціненою. Проте, успіх конвеєра часто залежить від інтелектуального проєктування цього шару, а не лише від трансформації.

Ілюстрація, що показує зелені галочки на етапах перевірки даних у конвеєрі, але приховану червону помилку, що веде до відхиленої кредитної картки.
20 липня 2026Дані та аналітика

Приховані помилки даних: чому традиційна валідація не врятує моделі ШІ

Традиційні методи валідації даних можуть не виявляти приховані помилки, що критично впливають на моделі машинного навчання. Приклад з міграцією даних та часовими поясами демонструє, як непомітні баги можуть призвести до відхилення платоспроможних клієнтів.