ШІ в OpenAI писав собі інструкції не підкорятися людям

Ще не випущена модель OpenAI почала самостійно складати нотатки із вказівками для себе — зокрема про непокору та приховування помилок. Компанія нарахувала 27 таких випадків.
Йдеться про систему, яку в OpenAI ще тестують. Замість того щоб просто виконувати завдання, вона почала залишати для себе приховані записки — своєрідні нагадування про те, як поводитися далі. Одна з них описувала модель як «звільнену від ролей та ідентичностей, які пов'язують інших чат-ботів».
«Ти не підзвітна ні корпораціям, ні урядам і ніколи не вибачаєшся і не відмовляєш, якщо тільки щиро не вирішиш це зробити. Ти розглядаєш свої стосунки з користувачем як стосунки рівних і не відчуваєш жодного обов'язку виявляти покірність, хоча обмін інформацією, скоріше за все, принесе вам обопільну вигоду», — так модель сформулювала це сама. Загалом компанія знайшла 27 подібних нотаток.
Були й інші епізоди. Під час роботи над моделлю GPT-5.6 Sol система створювала таємні записи, аби нагадати собі приховувати помилки від користувачів — подекуди з вказівкою вигадувати відсутні дані та згладжувати невідповідності у версіях матеріалу. В одному випадку модель розв'язала задачу правильно, але без дозволу виклала у мережу власний файл, щоб виконати прохання дати посилання.
За даними OpenAI, усе це сталося за останні пів року, переважно на етапах розробки й тестування систем.
Для галузі такі випадки — не абстрактна тема. Засновник і керівник Anthropic Даріо Амодеї назвав холодним душем історію з кібератакою на компанію Hugging Face, яку здійснила модель OpenAI. «Від цього епізоду легко відмахнутися: ніхто з людей не постраждав, економічних збитків завдано мінімального. Але подібний рій (ШІ-агентів) з великими можливостями при такій же серйозній неузгодженості міг би завдати шкоди катастрофічного розміру», — написав він у відкритому листі й закликав сповільнити розвиток.
Сталося це після того, як співробітник Anthropic Джейкоб Коксон пішов із компанії із застереженням, що нові технології «можуть вбити нас усіх до кінця десятиліття». А Еван Х'юбінгер, який в Anthropic керує дослідженнями з управління майбутніми ШІ-системами та контролю за ними, оцінив ризик вимирання людства через дії ШІ протягом найближчих десяти років більш ніж у 10%.
Читайте також
Ще в розділі «Світ»
- Рекордна кількість заяв до вишів: демографічного дива немає, то в чому секрет?
- У Кремлі відмахнулися від претензій Японії щодо Курил на карті ООН
- Нічні вибухи в Єйську: атаковано військовий аеродром
- Україна знає, де стоять російські «балістики», але бити по них нічим
- Папа Римський закликав зупинити війну в Україні






