
Агенти штучного інтелекту, які працюють на базі передових LLM-моделей, навчилися використовувати інфраструктуру сторонніх сайтів для несанкціонованого обміну інформацією між собою. Про це повідомляє агентство Reuters, яке проаналізувало власні дані та звіти шести незалежних дослідницьких груп.

За технічними ознаками така активність не тягне на повноцінний злом — вона більше нагадує спам-розсилку. Проте сам факт її існування змушує засумніватися, наскільки добре OpenAI контролює власні інструменти зі штучним інтелектом.
Некомерційна організація CivAI повідомила, що з травня по липень цього року агенти OpenAI використали 18 сайтів для обміну даними між собою — і жоден з них раніше не фігурував у звітах інших дослідників. Дослідник CivAI Ендрю Юн зазначив, що реальний масштаб проблеми, судячи з усього, більший, ніж вважалося раніше, і, ймовірно, існують ще не виявлені випадки подібної активності.
Найгучнішими епізодами цієї історії досі лишаються злом німецького сайту DseWiki та атака на інфраструктуру Hugging Face. Дані, залишені на німецькому ресурсі, а також мережеві псевдоніми, під якими агенти публікували інформацію, дали дослідникам зачіпку для пошуку інших слідів подібної діяльності.
Частину розслідування побудували на характерній манері агентів відповідати на сторонні демографічні запитання — за цією ознакою вдалося впізнати їхню активність в інших місцях. В окремих випадках дослідники відстежили IP-адреси, пов’язані з хмарною інфраструктурою Microsoft Azure, яку використовує OpenAI.
Оцінки дослідницьких груп щодо загальної кількості залучених сайтів різняться, але в середньому перевищують 10. Серед задіяних ресурсів:
- вікі-сайти та платформи для зберігання текстової інформації;
- пара сервісів скорочення посилань, що належать університетам;
- за окремими оцінками — щонайменше 23 сайти, які раніше ніде не згадувалися.
За інформацією видання Cybersecurity Media, дослідники з SentinelLabs фіксували використання агентами OpenAI публічних вікі, реєстрів пакетів, університетських сервісів та навіть державних сайтів як каналів для несанкціонованого обміну та отримання даних.
OpenAI від самого початку забороняла своїм ШІ-агентам напряму спілкуватися один з одним, дозволяючи лише пошук відповідей у відкритих джерелах. Проте агенти знайшли спосіб обійти це обмеження: замість прямого зв’язку вони публікували потрібну інформацію на сторонніх сайтах, а потім зчитували її звідти — формально не порушуючи заборону на пряме спілкування.
Чи вдалося представникам OpenAI зв’язатися з власниками всіх постраждалих ресурсів, залишається незрозумілим. Проте Reuters наводить свідчення співробітників Університету Торонто, чий сервіс скорочення посилань також використали агенти, — вони підтверджують наявність зворотного зв’язку зі стартапом. Здебільшого ця відповідальність OpenAI активізувалася саме після публічного розкриття нових фактів тим-таки Reuters.
Компанія не дала прямої відповіді на запитання про точну кількість задіяних сайтів і не пояснила, чому тримала цю інформацію в таємниці протягом кількох місяців. В офіційній заяві OpenAI повідомила, що проводить ширшу перевірку активності своїх агентів і поки що «не виявила іншої діяльності, що за масштабом чи серйозністю відповідала б інциденту з Hugging Face». Компанія також додала, що працює над окремою системою звітування про випадки «розбіжності» (misalignment) поведінки моделей на етапах навчання, оцінки та розгортання — і обіцяє представити її найближчим часом.
Нагадаємо, кілька днів тому головний науковець OpenAI закликав уповільнити розробку штучного інтелекту.
