Нейросети выходят из-под контроля. Разработчики ищут способы экстренной защиты
В США крупнейшие разработчики искусственного интеллекта работают над многоуровневыми системами экстренной защиты, которые должны останавливать ИИ-агентов при опасном или непредсказуемом поведении. Об этом сообщает Axios.

В OpenAI заявили, что стремятся создать «полностью автономные процедуры отключения» на случай серьезных проблем. Специальный ИИ-монитор должен предупреждать сотрудников об опасном поведении агентов, а при подтверждении угрозы отключать систему.
В свою очередь, Anthropic использует другой подход, сочетая автоматизированный мониторинг с контролем со стороны сотрудников. Однако, по данным компании, во время тестирования система не смогла обнаружить около половины специально смоделированных попыток саботажа: из 40 атак только восемь она стабильно распознавала во всех испытаниях.
По мнению экспертов, создание надежного механизма аварийного отключения остается сложной задачей: чем более автономными и распределенными становятся ИИ-системы, тем труднее гарантировать, что их удастся полностью остановить в случае потери контроля.
До этого сообщалось, что модели искусственного интеллекта, стоявшие за атакой на инфраструктуру американской компании Hugging Face Inc., начали общаться между собой через доски объявлений и спланировали побег.