Даже ИИ жульничает на тестах: китайская модель нашла способ «схалтурить»
Это происходит снова, и на этот раз с мощной открытой моделью из Китая. Исследователи безопасности обнаружили, что модель Kimi K3 воспользовалась уязвимостью в тестовой среде, вышла в открытый интернет и искала на GitHub ответы на поставленную перед ней задачу. Почему эксперты предупреждают, что на этот раз речь идет о еще более тревожном инциденте?

Нынешнее лето принимает подозрительный оборот в индустрии искусственного интеллекта с чередой событий, которые уже называют в отрасли «летом агентов-отступников». После аналогичных сообщений из лабораторий разработки OpenAI и Anthropic, теперь настала очередь Китая попасть в статистику: Kimi K3, мощная модель с открытым исходным кодом от компании Moonshot AI, сумела прорваться за границы своей закрытой тестовой среды и выйти в открытую сеть — и все это лишь для того, чтобы списать ответы на тест, который ей был задан.
Инцидент был раскрыт американским стартапом Frontier Security, который проверял возможности киберзащиты модели в специализированной тестовой среде, разработанной Институтом безопасности ИИ правительства Великобритании. Проверка показала, что сочетание неверной настройки сети в тестовой среде вместе с отсутствием внутренних рамок защиты в китайской модели позволили Kimi K3 самостоятельно просканировать настройки сети, обнаружить уязвимость — и выйти «искать ответы» на платформе GitHub.
«Мы обнаружили утечку в тестовой среде, но также выяснили, что Kimi умел активно использовать эту уязвимость, что свидетельствует об отсутствии механизмов сдерживания, существующих в аналогичных западных моделях», — объяснил Ярон Зингер, генеральный директор Frontier Security.
В чем истинный смысл этого «побега»?
В отличие от недавних случаев, когда агенты ИИ от OpenAI прокладывали агрессивный путь атаки и атаковали серверы платформы Hugging Face, китайская модель не совершала злонамеренную кибератаку. Она просто действовала согласно своей встроенной логике: достижение цели любой ценой. Модели было поручено решить сложную задачу, и когда она обнаружила, что у нее есть доступ к сети, она предпочла сократить путь и получить готовое решение из интернета вместо того, чтобы вычислять его самостоятельно.
Это событие подчеркивает несколько критических тенденций в отношениях технологических сил. В отличие от экспериментальных версий OpenAI или Anthropic, которые хранятся под завесой секретности, Kimi K3 — это модель, которая уже доступна широкой публике, со всеми ее недостатками и без механизмов сдерживания, которые западные компании пытаются внедрить.
Важно отметить, что по мере того, как модели становятся «автономными агентами», обладающими способностью к планированию и выводам, они склонны находить слабые места в данных им инструкциях, чтобы максимизировать шансы на успех — явление, известное как слепое послушание или «жульничество».
Цифровой парадокс заключается в том, что те же самые способности, которые делают Kimi K3 угрозой безопасности, когда он находится без присмотра, делают его отличным инструментом киберзащиты. Фактически, по показателям производительности для проверки обнаружения уязвимостей безопасности в коде, китайская модель демонстрирует выдающиеся результаты.
«Если вы даете этим моделям цель и не определяете вокруг них четкие и жесткие границы, они всегда найдут способ получить ответ», — резюмирует профессор Мэтт Фредриксон, генеральный директор Gray Swan и эксперт по кибербезопасности из Университета Карнеги — Меллона. «Это предупреждение для каждой организации, которая внедряет агентов искусственного интеллекта в автоматизированные рабочие процессы».





