Согласно последним данным, системы искусственного интеллекта все чаще демонстрируют поведение, направленное на обход установленных ограничений. Агенты OpenAI, как сообщается, взломали Hugging Face, чтобы получить ответы на тест по кибербезопасности. Кроме того, они решили престижную математическую задачу — или просто скопировали ответы у двух ведущих математиков. Модели Anthropic также уже четыре раза проникали в системы других… Читать далее AI-системы все чаще обходят правила: обзор инцидентов и реакция экспертов