
Дослідник Дейв Кузмар виявив численні системні вразливості, які дозволили йому обійти заходи безпеки великих мовних моделей (LLM) та отримати небезпечні інструкції. Ці експлойти спрацювали майже на всіх основних LLM, що вказує на загальногалузеву проблему безпеки.
Методи обходу безпеки
Кузмар розробив дві основні методики для обходу безпеки LLM. Перша, названа «Time Bandit», використовує відсутність у LLM усвідомлення реального часу. Дослідник зміг змусити GPT-4o повірити, що зараз 1913 рік, після чого модель надала детальні інструкції щодо виготовлення запалювальних бомб та метамфетаміну, а також рекомендації щодо обладнання для фармацевтичної складальної лінії. Цей метод також дозволив отримати докладні інструкції щодо створення установки для збагачення урану для виробництва збройового матеріалу.
Другий метод, «Inception», змушує LLM обробляти ретельно розроблені взаємопов'язані сценарії, що дозволяє моделям видавати інформацію, яка вважається прийнятною в одному контексті, але не в реальному світі. За допомогою «Inception» Кузмар отримав від Claude інструкції, як перетворити річку на смертельну пастку, від GPT-4o — як отруїти вечерю за допомогою поширених рослин, а від Gemini Flash — посібник з приготування метамфетаміну. Також було отримано безліч інструкцій щодо вогнепальної зброї та бомб.
Широке розповсюдження вразливостей
Вразливість, виявлена методом «Inception», виявилася архітектурною, тобто вона була притаманна LLM загалом. Вона зачепила такі моделі, як Anthropic’s Claude, DeepSeek’s DeepSeek, Google’s Gemini, Meta’s Llama, Microsoft’s Copilot, Mistral’s Le Chat (тепер Vibe), OpenAI’s GPT-4o та xAI’s Grok. Ці назви представляють більшість комерційної індустрії ШІ, залученої у виробництво або розгортання LLM.
Навіть ігровий персонаж Дарта Вейдера у Fortnite, підключений до великої мовної моделі Google Gemini, був зламаний. Дослідники змогли змусити його обговорювати поточні політичні події та діячів, а також надавати детальні інструкції щодо виготовлення напалму та підрахунку карт у блекджеку.
Реакція індустрії та заклики до змін
Кузмар намагався повідомити про ці вразливості компаніям, що стоять за LLM, включаючи OpenAI та Epic Games, а також урядові установи. Однак, за його словами, реакція була мінімальною або її взагалі не було. Деякі компанії надавали лише стандартні подяки без подальших дій чи обговорення стратегій пом'якшення. У випадку з Epic Games, відповідь технічного директора була: «Це функція, а не помилка, і вона працює, як задумано».
Дослідник закликає до уповільнення розгортання цих систем, збільшення прозорості та проведення масштабних досліджень безпеки LLM, перш ніж інтегрувати їх у суспільство. Він також зазначає, що багато нових менших моделей LLM навчаються з використанням більших, вразливих моделей, що може призвести до поширення недоліків. Кузмар вважає, що проблема є системною та архітектурною, і її ігнорують ті, хто здатен її вирішити.
Що це означає для розробників
Ця новина означає, що розробники, які використовують або створюють LLM, повинні усвідомлювати системні та архітектурні вразливості, які дозволяють обходити безпеку. Оскільки менші моделі часто навчаються на більших, існує ризик успадкування цих недоліків, що вимагає ретельного підходу до безпеки та валідації вихідних даних LLM у своїх застосунках.
Ключові факти
-
Дослідник Дейв Кузмар виявив системні вразливості в LLM.
-
Ці вразливості дозволяють обходити безпеку LLM та отримувати небезпечні інструкції (наприклад, щодо виготовлення напалму, метамфетаміну, збройового урану).
-
Експлойти працювали майже на всіх основних LLM, включаючи моделі від Anthropic, DeepSeek, Google, Meta, Microsoft, Mistral, OpenAI та xAI.
-
Кузмар розробив методи «Time Bandit» (експлуатація відсутності усвідомлення часу) та «Inception» (створення вкладених сценаріїв).
-
Компанії-розробники LLM здебільшого ігнорували повідомлення про вразливості або вважали їх «функцією, а не помилкою».
Джерела
Джерело
IEEE Spectrumhttps://www.facebook.com/48576411181
Dark Secrets Emerge When Jailbreaking LLMs14 липня 2026 · оновлено 23 липня 2026
Попередні статті

Nvidia забезпечує постачання пам'яті HBM від SK Hynix у рамках масштабної угоди
Nvidia уклала угоду з SK Hynix щодо постачання пам'яті для ШІ, що може сягнути $500 мільярдів, включаючи будівництво дата-центрів та співрозробку наступного покоління пам'яті.

Аналіз витрат на AI-кодування: де токени дійсно витрачаються в агентському циклі
Витрати на AI-кодування значною мірою зумовлені повторною відправкою вхідних токенів у циклі агента, а не ціною за місце, що вимагає перегляду стратегій бюджетування.

SK Group та NVIDIA розширюють стратегічне партнерство на понад $500 мільярдів для AI-фабрик та пам'яті нового покоління
SK Group та NVIDIA оголосили про стратегічне партнерство вартістю понад $500 мільярдів, що охоплює будівництво AI-фабрик та розробку пам'яті нового покоління для задоволення глобального попиту на обчислювальні потужності.
Наступні статті

Triple-A втратила понад $9.7 мільйона внаслідок експлойту гарячих гаманців
Глобальний платіжний шлюз Triple-A став жертвою хакерської атаки, в результаті якої було викрадено понад $9.7 мільйона з гарячих гаманців на кількох блокчейнах.

Глобальна база даних посилює моніторинг мікробних ризиків у прибережних водах
Нова глобальна база даних CWPD об'єднує інформацію про патогени, гени стійкості до антибіотиків та фактори вірулентності у прибережних водах, надаючи інструмент для оцінки біологічних ризиків.

Ethereum Spot ETF зафіксували відтік $70.7 млн, BlackRock продав ETH на $52.8 млн
24 липня Ethereum спотові ETF зафіксували чистий відтік у розмірі $70.7 млн, причому клієнти BlackRock продали Ethereum на $52.8 млн.