Компания Zhipu, также известная как Z.ai, представила свою новую модель GLM-5.3, ориентированную на кодирование, 14 августа 2023 года. В своем техническом релизе она поделилась результатами работы модели в области кибербезопасности, которые привлекли внимание благодаря неожиданным достижениям в обнаружении уязвимостей в программном обеспечении.
Результаты кибербезопасности GLM-5.3
Одним из ключевых заявлений Zhipu стало то, что GLM-5.3 продемонстрировала эффективность в обнаружении уязвимостей, набрав 84.5% на бенчмарке CyberGym. Это выше, чем у моделей Mythos 5 от Anthropic (83.8%) и GPT-5.6 Sol от OpenAI (83.6%). Данное достижение вызвало широкий резонанс, так как модель из Китая обошла американские аналоги в области поиска ошибок в коде.
Однако стоит отметить, что Zhipu сама подчеркивает, что результаты по CyberGym являются лишь частью более широкой картины. В дополнение к этому, компания представила два других бенчмарка, результаты по которым показывают, что GLM-5.3 отстает от конкурентов.
Три бенчмарка, три разных результата
1. CyberGym: Этот тест оценивает, насколько хорошо модель может находить уязвимости в исходном коде. GLM-5.3 показала 84.5%, что является наивысшим результатом среди трех моделей.
2. ExploitBench: Здесь модели необходимо не только найти уязвимость, но и рассуждать о том, как она может быть использована. GLM-5.3 набрала 54.4%, что значительно выше, чем у предыдущей версии (24.4%), но все же ниже Mythos 5 (78.0%) и GPT-5.6 Sol (76.5%).
3. ExploitGym: Этот тест измеряет количество задач по эксплуатации, которые модель может завершить за фиксированное время. GLM-5.3 завершила 105 задач за два часа и 130 за шесть, в то время как Mythos 5 завершила 181 и 247 соответственно.
Сравнение с моделями Anthropic
Сравнение GLM-5.3 с моделями Anthropic вызывает путаницу, так как Zhipu использует разные модели в разных контекстах. Основная таблица сравнения ставит GLM-5.3 против Opus 4.8, в то время как в графиках используется Fable 5, а в разделе кибербезопасности — Mythos 5. Это может ввести в заблуждение тех, кто быстро просматривает результаты.
Методология тестирования
Zhipu провела оценку GLM-5.3 с использованием различных бенчмарков, включая CyberGym, ExploitGym и ExploitBench, а также несколько других задач внутри Claude Code 2.1.207, программного обеспечения для кодирования от Anthropic. Это позволяет обеспечить справедливое сравнение между моделями, однако стоит отметить, что китайская модель тестировалась с использованием американского программного обеспечения, что подчеркивает разницу в инструментах.
Обнаружение уязвимостей
Помимо бенчмарков, Zhipu сообщила о сотрудничестве с командами безопасности в Китае для тестирования своей модели на реальных кодовых базах. В результате было выявлено 2,436 уязвимостей в 269 проектах с открытым исходным кодом. Из них 107 были классифицированы как критические, 990 — высокие, 1,286 — средние и 53 — низкие. Интересно, что самая старая уязвимость датируется 1981 годом, а средний возраст уязвимости составляет 26.6 лет.
Важные аспекты
Два аспекта, которые стоит выделить из релиза Zhipu, имеют долгосрочные последствия:
Эффективность: GLM-5.3 достигла 31.4% на внутреннем бенчмарке кодирования при использовании около 50,000 токенов на задачу, в то время как Opus 4.8 показала 29.5% с использованием 120,000 токенов. Это говорит о том, что GLM-5.3 может быть более экономичным решением для команд безопасности.
Распространение: Zhipu планирует опубликовать веса модели после завершения оценки безопасности. Если это произойдет, модель с документированной способностью обнаруживать уязвимости станет доступной для скачивания и использования любыми командами, что может значительно изменить рынок кибербезопасности.
Заключение
Результаты GLM-5.3 от Zhipu подчеркивают растущую конкуренцию между китайскими и американскими моделями в области кибербезопасности. Несмотря на некоторые достижения, такие как успешное обнаружение уязвимостей, модель все еще отстает в других аспектах, таких как эксплуатация уязвимостей. Тем не менее, открытость и доступность модели могут сделать ее важным инструментом для специалистов по безопасности в будущем.
Комментарии (0)