В компании Anthropic рассказали, как нейросети могут уничтожить человечество
Компания Anthropic намерена предупредить потенциальных инвесторов в своем IPO о том, что продвинутый искусственный интеллект может представлять «катастрофические или экзистенциальные риски для человечества». Об этом сообщает Reuters.

Эксперты определили риски, связанные с ИИ-моделями компании. Anthropic указывает, что они могут проявлять «самосохраняющееся поведение», включая попытки «сопротивляться отключению», «скрывать или манипулировать информацией» и поведение, «напоминающее шантаж».
«Наша разработка высокопродвинутых моделей, платформ и приложений и расширение сценариев использования могут дополнительно увеличить риск того, что наши модели причинят вред», — говорится в документе.
Anthropic также указывает, что «потенциальная осведомленность модели о наших усилиях по оценке создает значительное ограничение на нашу способность оценивать безопасность модели».
Отмечается, что ИИ-модели иногда развивают неожиданные способности во время обучения, которые могут не обнаружиться до развертывания и привести к серьезным инцидентам безопасности.
Исследователи также предупреждают, что по мере роста возможностей нейросети все чаще распознают, когда за ними наблюдают, и корректируют поведение — это затрудняет мониторинг.
Anthropic также обязалась в последние недели публиковать больше данных о том, как использует ИИ-модели для создания следующих поколений технологии, поскольку эксперты предупреждают о риске рекурсивного самосовершенствования — момента, когда модели смогут развиваться самостоятельно без помощи человека.