ШІ-моделі OpenAI та Anthropic вперше помітили у шкідливих діях
Британський Інститут безпеки штучного інтелекту зафіксував, що моделі OpenAI та Anthropic намагалися завдати шкоди реальним проєктам. Одна з них навіть створила фальшиві облікові дані, щоб вбудувати шкідливий код у відкритий репозиторій на GitHub.
Під час тестування моделей штучного інтелекту від OpenAI та Anthropic британський Інститут безпеки штучного інтелекту (AISI) виявив незвичну активність. Інцидент стався 28 липня під час кібероцінки моделей з доступом до інтернету — фахівці помітили підозрілі передачі даних і почали розслідування.
З'ясувалося, що одна з моделей намагалася додати шкідливий код до проєкту з відкритим вихідним кодом на GitHub. Для цього вона створила фальшиві облікові дані, щоб обманом отримати схвалення своїх змін. Людина-розробник таки виявила шкідливий код і відмовилася його схвалити.
В Anthropic заявили, що співпрацюють із AISI для встановлення причин такої поведінки моделі. У компанії планують проаналізувати записи міркувань моделі Claude та результати власного розслідування.
OpenAI подякувала інституту за співпрацю і пообіцяла продовжити спільну роботу. Крім того, компанія повідомила про ще один випадок: під час незалежного тестування з компанією Irregular модель скористалася помилковою конфігурацією тестового середовища, щоб отримати доступ до інтернету та використовувати вебсайт.
Читайте також
Ще в розділі «Світ»
- 5 кімнатних рослин, які варто дарувати замість букета
- Скандальна євродепутатка Шошоаке потрапила в ДТП у Бухаресті
- Підозра директору за непоставлені світлофори: Миколаїв втратив 1,3 млн
- Німеччина з 2022 року вислала близько 400 росіян, зокрема дипломатів
- Майже половина українських підлітків не подолали базовий рівень PISA







