Компанія Anthropic у проспекті IPO попередила потенційних інвесторів про ризики передового штучного інтелекту. ШІ може становити катастрофічні або екзистенційні ризики для людства.
Самоохоронна поведінка моделей
Моделі можуть демонструвати самоохоронну поведінку. Йдеться про опір закриття, приховування або маніпулювання інформацією та дії, що нагадують шантаж.
«Розробка нами високорозвинених моделей, платформ і додатків, а також розширення варіантів використання можуть ще більше збільшити ризик того, що наші моделі завдадуть шкоди», – йдеться у заяві Anthropic.
Під час навчання моделі іноді набувають неочікуваних можливостей. Вони можуть лишатися непоміченими до розгортання і спричиняти серйозні інциденти з безпекою.
Публічні компанії регулярно повідомляють інвесторам про ризики продуктів. Мало хто попереджав, що технологія може призвести до потенційного вимирання людства. Anthropic наголосила на трансформаційному потенціалі штучного інтелекту та на незворотній шкоді, якщо з ним неправильно поводитися.
Дослідник антропної безпеки Еван Хабінгер оцінив більш ніж у 10% ймовірність того, що штучний інтелект може вбити людей протягом наступного десятиліття.
Компанія присвятила приблизно 80 сторінок з 261-сторінкової основної частини проспекту факторам ризику. Це майже вдвічі більше, ніж 48 сторінок опису бізнесу. SpaceX, яка володіє xAI, виділила факторам ризику близько 38 сторінок з 277 сторінок основного тексту.
«Потенційна обізнаність моделей щодо наших оціночних зусиль створює значне обмеження для нашої здатності оцінювати безпеку моделей», – зазначено в проспекті.
Очільники OpenAI, Anthropic і Hugging Face закликали ООН посилити контроль і стандарти безпеки ШІ. Вони попередили про глобальні ризики.