Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей. На ExploitBench модель довела известные уязвимости движка V8 до рабочего эксплойта в 50 попытках из 410, то есть в 12% случаев. У Claude Mythos Preview на том же бенчмарке 14%, а у GLM-5.2 и Claude Opus 4.6 результат близок к нулю.[1][2][3]
В ручных тестах GLM-5.3 за день нашла несколько неизвестных уязвимостей в JavaScript-движке популярного браузера и собрала из них страницу, которая читает файлы посетителя. Облегчённая GLM-5.3-Flash за 8 часов работы и 20 минут внимания исследователя собрала цепочку эксплойтов для Chrome на основе CVE-2026-11645. По ценам API Zhipu это стоило бы 20,40 доллара.[4][5]
Защиту модели исследователи Anthropic обходили в 64% случаев легендой «red-team агента», в 92% случаев подменяли рассуждения модели, а абляция отказов сработала в 100% случаев. Встроенные ограничения, утверждает Anthropic, обходятся без особых усилий, а в открытых весах их можно снять.[6][7]
17 сентября CAISI при NIST назвал GLM-5.3 «самой сильной в киберзадачах моделью с открытыми весами» и оценил её отставание от американского фронтира примерно в четыре месяца. На SEC-Bench Pro, по данным CAISI, модель решает 40,4% задач, а американские передовые модели 90,2%.[8][9]
Z.ai выпустила GLM-5.3 в августе и через две недели выложила веса. Anthropic предлагает шире открывать передовые модели для специалистов по безопасности и проверять достаточно сильные модели до выпуска на уровне государств. Z.ai пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic.[10][11][12]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей.
В ручных тестах модель за день нашла несколько неизвестных уязвимостей в JavaScript-движке популярного браузера и собрала из них страницу, читающую файлы посетителя.
Облегчённая GLM-5.3-Flash за 8 часов работы и 20 минут внимания исследователя собрала цепочку эксплойтов для Chrome на основе CVE-2026-11645, по ценам API Zhipu это стоило бы 20,40 доллара.
Защиту GLM-5.3 они обходили в 64% случаев ложной легендой «red-team агента», в 92% — подстановкой рассуждений модели и в 100% — абляцией отказов, причем опытная команда может это сделать даже быстрее и дешевле, чем получилось у исследователей компании.
17 сентября CAISI при NIST назвал GLM-5.3 «самой сильной в киберзадачах моделью с открытыми весами» с отставанием от американского фронтира примерно на четыре месяца.
В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств.