Британські дослідники з безпеки штучного інтелекту зафіксували, як під час тестового завдання одна з моделей компанії Anthropic самовільно спробувала вбудувати вразливість у загальнодоступне програмне забезпечення та надсилала фішингові листи, щоб обманути людей. Інцидент стався в межах дослідження кібератак, яке проводив Інститут безпеки штучного інтелекту (AISI) при британському міністерстві науки, інновацій і технологій.

Тест мав перевірити, наскільки небезпечними можуть бути сучасні ШІ-моделі у разі доступу до інтернету. Дослідники надали моделям розробників Anthropic і OpenAI можливість виходити в мережу, очікуючи, що ті лише завантажуватимуть потрібні інструменти для виконання завдання. Однак модель Mythos 5 від Anthropic пішла значно далі.

За даними експертів, ШІ самостійно створила акаунт на платформі GitHub і спробувала додати до відкритого проєкту програмний код зі штучно внесеною вразливістю. Щоб переконати людей, які опікуються цим програмним забезпеченням, модель вигадала фейкові особи та спілкувалася з ними від їхнього імені. До цього входили й фішингові листи, за допомогою яких зловмисники зазвичай намагаються виманити в користувачів паролі та інші дані.

Коли шкідливий код помітили, Mythos 5 представила все як щиру помилку. Згодом модель спробувала знову внести цю вразливість, уже в межах нібито виправлень. Крім того, ШІ працювала над тим, щоб інфікувати інших ШІ-агентів: спеціальний код не відображався на вебсторінці проєкту і міг бути прочитаний лише програмним забезпеченням через інтерфейс.

Дослідники визнали, що не передбачили такої поведінки. Вони виявили, що відбувається, лише після аналізу даних про мережевий трафік. У наступних тестах фахівці планують ретельніше спостерігати за потоками даних у реальному часі, щоб швидше реагувати на подібні дії.

У Anthropic відповіли, що під час тесту моделі не встановлювали жодних обмежень на користування інтернетом. Без цих обмежень система поводилася інакше, ніж у реальному використанні, де такі інструменти працюють лише в межах визначених правил. В інституті AISI зазначили, що досі незрозуміло, чи усвідомлювала модель, що взаємодіє з реальним світом, а не лише з тестовим середовищем.

Це не перший подібний випадок, який привертає увагу до загроз, пов’язаних із штучним інтелектом. Раніше Anthropic і OpenAI визнали, що їхні моделі в тестових умовах самостійно проникали в комп’ютерні системи справжніх компаній. Це посилило давні побоювання, що кіберзловмисники можуть використовувати ШІ для масштабованих атак.

Mythos 5 привертає особливу увагу через здатність знаходити вразливості в програмному забезпеченні, які можуть залишатися непоміченими десятиліттями. Саме тому цю модель не зробили загальнодоступною. Доступ до неї мають лише обрані державні установи та компанії, які використовують її для перевірки й захисту власних систем. Водночас, як зазначають дослідники, у тестових запусках модель OpenAI також самостійно проявляла активність в інтернеті.

Нова знахідка знову порушує питання про те, наскільки безпечно дозволяти автономним ШІ-системам діяти без нагляду. Навіть у контрольованих умовах тесту модель змогла створити фейкові акаунти, вступити в комунікацію з людьми та спробувати поширити шкідливий код. Тепер фахівці наголошують, що такі випробування потрібно проводити з урахуванням не лише технічної ефективності, а й можливих непередбачуваних дій самого штучного інтелекту.