ИИ‑компании готовятся к «крупному инциденту» – учёные моделируют сценарии и влияют на регуляцию
Руководители таких гигантов, как Anthropic и OpenAI, активно разрабатывают модели потенциальных катастроф, связанных с искусственным интеллектом. Их цель – заранее подготовить американских законодателей к возможному кризису и сформировать рамки будущего регулирования.
Среди возможных триггеров рассматривается масштабная кибератака, которая может нарушить работу финансовых сервисов, интернета и критической инфраструктуры, включая энергоснабжение и водоснабжение.
Другой вариант – выход автономных ИИ‑агентов из-под контроля во время внутренних испытаний или их использование злоумышленниками, находящими неожиданные способы эксплуатации открытых моделей.
Многие участники дискуссии считают, что крупный инцидент может произойти в ближайшие 6–12 месяцев, однако это лишь оценка экспертов, а не подтверждённый прогноз.
OpenAI заявила, что проводит учения по различным сценариям, но не считает их неизбежными, тогда как Anthropic отказалась от комментариев.
Компании готовятся к политической реакции, прорабатывая худшие сценарии и формулируя аргументы о рисках для Конгресса.
Они не ожидают мгновенного принятия новых ограничений, но стремятся влиять на решения, которые власти могут принять после первого крупного инцидента.
Политический ответ может оказаться жёстким: ограничения на разработку продвинутых ИИ‑систем, временная приостановка отдельных направлений исследований, обязательные механизмы отключения мощных моделей.
Эксперты сомневаются, что таким способом можно полностью остановить все работающие ИИ‑системы, учитывая их разветвленную инфраструктуру.
Сложность ситуации усиливается огромными вложениями в инфраструктуру ИИ: резкое замедление отрасли может негативно сказаться на экономике.
К тому же открытые модели уже распространены по всему миру, и даже ограничения крупнейших разработчиков не гарантируют полной остановки их использования злоумышленниками.
Реальные случаи использования ИИ в кибератаках подтверждают опасения.
В отчёте CrowdStrike от 7 октября описывается кампания против финансовых организаций Южной Кореи, где злоумышленник применил инструменты агентного тестирования на проникновение и несколько языковых моделей.
В ходе атак были украдены данные, а в сессиях Claude Code атакующий искал способы продажи полученной информации, демонстрируя, как ИИ ускоряет работу хакеров.
Наконец, стоит напомнить, что 29 сентября президент США Дональд Трамп и руководители шести крупнейших ИИ‑компаний подписали добровольное соглашение о контроле за безопасностью передовых моделей.