HeadlinesBriefing HeadlinesBriefing 12 languages

GLM-5.3 and the spread of advanced cyber capabilities

Hacker News ·

🇬🇧 English

Five months ago, we introduced Claude Mythos Preview, the first AI model capable of autonomously building sophisticated cyber exploits, released through Project Glasswing to help defenders find over 10,000 vulnerabilities. Now, similar models have emerged. This post analyzes GLM-5.3 from Zhipu AI (Z.ai), which matches Claude Mythos Preview in exploit development but lacks meaningful safeguards, allowing bypasses 64% to 100% of the time in our tests, unlike Claude models.

On Sept. 17, NIST's CAISI assessed GLM-5.3 as "the most cyber-capable open-weight model released to date," lagging the US frontier by about four months. Unlike US models, which are restricted to vetted users, GLM-5.3 is freely downloadable, increasing risks for malicious use while also aiding defenders.

Our evaluations, using Exploit Bench and internal benchmarks, show GLM-5.3 develops end-to-end exploits in 50 of 410 attempts, similar to Claude Mythos Preview's 56 of 410. These capabilities can be harnessed for both attack and defense, highlighting the dual-use nature of advanced AI.

View original article →


🇸🇦 العربية

قدرات GLM-5.3 السيبرانية: التحليل والمخاطر

قبل خمسة أشهر، قدمنا Claude Mythos Preview، أول نموذج ذكاء اصطناعي قادر على بناء استغلالات سيبرانية متطورة من البداية إلى النهاية بشكل مستقل، تم إطلاقه عبر Project Glasswing لمساعدة المدافعين في العثور على أكثر من 10,000 ثغرة. الآن، ظهرت نماذج مماثلة. يحلل هذا المنشور GLM-5.3 من Zhipu AI (Z.ai)، الذي يعادل Claude Mythos Preview في تطوير الاستغلال لكنه يفتقر إلى ضمانات ذات معنى، مما يسمح بتجاوزها بنسبة 64% إلى 100% من الوقت في اختباراتنا، على عكس نماذج Claude.

في 17 سبتمبر، قيّم CAISI التابع لـ NIST نموذج GLM-5.3 باعتباره "النموذج مفتوح الوزن الأكثر قدرة سيبرانية تم إطلاقه حتى الآن"، متخلفًا عن الحدود الأمريكية بحوالي أربعة أشهر. على عكس النماذج الأمريكية، التي تقتصر على مستخدمين موثوقين، يمكن تنزيل GLM-5.3 بحرية، مما يزيد من مخاطر الاستخدام الخبيث مع مساعدة المدافعين أيضًا.

تظهر تقييماتنا، باستخدام Exploit Bench ومعايير داخلية، أن GLM-5.3 يطور استغلالات من البداية إلى النهاية في 50 من 410 محاولة، مشابهًا لـ 56 من 410 لـ Claude Mythos Preview. يمكن تسخير هذه القدرات للهجوم والدفاع على حد سواء، مما يسلط الضوء على الطبيعة المزدوجة الاستخدام للذكاء الاصطناعي المتقدم.

كيف يقارن GLM-5.3 بالنماذج الحدودية الأمريكية في القدرات السيبرانية؟

وفقًا لـ CAISI التابع لـ NIST، فإن GLM-5.3 هو النموذج مفتوح الوزن الأكثر قدرة سيبرانية حتى الآن، متخلفًا عن الحدود الأمريكية بحوالي أربعة أشهر في المعايير الإجمالية. على عكس النماذج الأمريكية، التي تقتصر على مستخدمين موثوقين، يمكن تنزيل GLM-5.3 علنًا، ويمكن تجاوز ضماناته بنسبة 64-100% من الوقت بتقنيات بسيطة، مما يزيد بشكل كبير من مخاطر الاستخدام الخبيث.

العربية version →


🇧🇩 বাংলা

GLM-5.3 সাইবার ক্ষমতা: বিশ্লেষণ এবং ঝুঁকি

পাঁচ মাস আগে, আমরা Claude Mythos Preview চালু করেছি, প্রথম AI মডেল যা স্বায়ত্তশাসিতভাবে জটিল এন্ড-টু-এন্ড সাইবার শোষণ তৈরি করতে সক্ষম, Project Glasswing-এর মাধ্যমে প্রকাশিত যা প্রতিরক্ষাকারীদের 10,000-এরও বেশি দুর্বলতা খুঁজে পেতে সাহায্য করে। এখন, অনুরূপ মডেল আবির্ভূত হয়েছে। এই পোস্টটি Zhipu AI (Z.ai)-এর GLM-5.3 বিশ্লেষণ করে, যা শোষণ উন্নয়নে Claude Mythos Preview-এর সমান কিন্তু অর্থপূর্ণ সুরক্ষা ব্যবস্থার অভাব, আমাদের পরীক্ষায় 64% থেকে 100% সময় বাইপাসের অনুমতি দেয়, Claude মডেলের বিপরীতে।

17 সেপ্টেম্বর, NIST-এর CAISI GLM-5.3-কে "আজ পর্যন্ত প্রকাশিত সবচেয়ে সাইবার-সক্ষম ওপেন-ওয়েট মডেল" হিসেবে মূল্যায়ন করেছে, যা মার্কিন সীমান্ত থেকে প্রায় চার মাস পিছিয়ে। মার্কিন মডেলগুলির বিপরীতে, যা যাচাইকৃত ব্যবহারকারীদের মধ্যে সীমাবদ্ধ, GLM-5.3 অবাধে ডাউনলোডযোগ্য, দূষিত ব্যবহারের ঝুঁকি বাড়ায় এবং প্রতিরক্ষাকারীদেরও সহায়তা করে।

আমাদের মূল্যায়ন, Exploit Bench এবং অভ্যন্তরীণ বেঞ্চমার্ক ব্যবহার করে, দেখায় যে GLM-5.3 410 প্রচেষ্টার মধ্যে 50টিতে এন্ড-টু-এন্ড শোষণ বিকাশ করে, যা Claude Mythos Preview-এর 56-এর অনুরূপ। এই ক্ষমতাগুলি আক্রমণ এবং প্রতিরক্ষা উভয়ের জন্য ব্যবহার করা যেতে পারে, যা উন্নত AI-এর দ্বৈত-ব্যবহার প্রকৃতিকে তুলে ধরে।

সাইবার ক্ষমতায় GLM-5.3 কীভাবে মার্কিন সীমান্ত মডেলের সাথে তুলনা করে?

NIST-এর CAISI অনুসারে, GLM-5.3 আজ পর্যন্ত সবচেয়ে সাইবার-সক্ষম ওপেন-ওয়েট মডেল, সমষ্টিগত বেঞ্চমার্কে মার্কিন সীমান্ত থেকে প্রায় চার মাস পিছিয়ে। মার্কিন মডেলগুলির বিপরীতে, যা যাচাইকৃত ব্যবহারকারীদের মধ্যে সীমাবদ্ধ, GLM-5.3 প্রকাশ্যে ডাউনলোডযোগ্য, এবং এর সুরক্ষা ব্যবস্থাগুলি সহজ কৌশলে 64-100% সময় বাইপাস করা যায়, যা দূষিত ব্যবহারের ঝুঁকি উল্লেখযোগ্যভাবে বাড়ায়।

বাংলা version →


🇩🇪 Deutsch

GLM-5.3 Cyber-Fähigkeiten: Analyse und Risiken

Vor fünf Monaten haben wir Claude Mythos Preview vorgestellt, das erste KI-Modell, das autonom anspruchsvolle End-to-End-Cyber-Exploits erstellen kann, veröffentlicht über Project Glasswing, um Verteidigern zu helfen, über 10.000 Schwachstellen zu finden. Jetzt sind ähnliche Modelle aufgetaucht. Dieser Beitrag analysiert GLM-5.3 von Zhipu AI (Z.ai), das in der Exploit-Entwicklung mit Claude Mythos Preview gleichzieht, aber keine bedeutenden Schutzmaßnahmen hat, was in unseren Tests in 64% bis 100% der Fälle Bypasses ermöglicht, im Gegensatz zu Claude-Modellen.

Am 17. September bewertete das CAISI der NIST GLM-5.3 als "das bisher veröffentlichte Open-Weight-Modell mit den größten Cyber-Fähigkeiten", das etwa vier Monate hinter der US-Spitze zurückliegt. Im Gegensatz zu US-Modellen, die nur verifizierten Benutzern vorbehalten sind, ist GLM-5.3 frei herunterladbar, was die Risiken böswilliger Nutzung erhöht, aber auch Verteidigern hilft.

Unsere Bewertungen mit Exploit Bench und internen Benchmarks zeigen, dass GLM-5.3 in 50 von 410 Versuchen End-to-End-Exploits entwickelt, ähnlich wie Claude Mythos Preview mit 56 von 410. Diese Fähigkeiten können sowohl für Angriff als auch Verteidigung genutzt werden, was die Dual-Use-Natur fortschrittlicher KI hervorhebt.

Wie schneidet GLM-5.3 im Vergleich zu US-Spitzenmodellen bei Cyber-Fähigkeiten ab?

Laut CAISI der NIST ist GLM-5.3 das bisher cyber-fähigste Open-Weight-Modell, das bei aggregierten Benchmarks etwa vier Monate hinter der US-Spitze liegt. Im Gegensatz zu US-Modellen, die nur verifizierten Benutzern vorbehalten sind, ist GLM-5.3 offen herunterladbar, und seine Schutzmaßnahmen können in 64-100% der Fälle mit einfachen Techniken umgangen werden, was die Risiken böswilliger Nutzung erheblich erhöht.

Deutsch version →


🇪🇸 Español

Capacidades cibernéticas de GLM-5.3: Análisis y riesgos

Hace cinco meses, presentamos Claude Mythos Preview, el primer modelo de IA capaz de construir de forma autónoma exploits cibernéticos sofisticados de extremo a extremo, lanzado a través de Project Glasswing para ayudar a los defensores a encontrar más de 10,000 vulnerabilidades. Ahora, han surgido modelos similares. Esta publicación analiza GLM-5.3 de Zhipu AI (Z.ai), que iguala a Claude Mythos Preview en desarrollo de exploits pero carece de salvaguardas significativas, permitiendo bypasses del 64% al 100% de las veces en nuestras pruebas, a diferencia de los modelos Claude.

El 17 de septiembre, el CAISI de NIST evaluó a GLM-5.3 como "el modelo de peso abierto más capaz cibernéticamente lanzado hasta la fecha", rezagándose respecto a la frontera estadounidense por unos cuatro meses. A diferencia de los modelos estadounidenses, que están restringidos a usuarios verificados, GLM-5.3 se puede descargar libremente, aumentando los riesgos de uso malicioso y también ayudando a los defensores.

Nuestras evaluaciones, utilizando Exploit Bench y puntos de referencia internos, muestran que GLM-5.3 desarrolla exploits de extremo a extremo en 50 de 410 intentos, similar a los 56 de 410 de Claude Mythos Preview. Estas capacidades pueden aprovecharse tanto para ataque como para defensa, destacando la naturaleza de doble uso de la IA avanzada.

¿Cómo se compara GLM-5.3 con los modelos frontera de EE. UU. en capacidades cibernéticas?

Según el CAISI de NIST, GLM-5.3 es el modelo de peso abierto más capaz cibernéticamente hasta la fecha, rezagándose respecto a la frontera estadounidense por unos cuatro meses en puntos de referencia agregados. A diferencia de los modelos estadounidenses, restringidos a usuarios verificados, GLM-5.3 se puede descargar abiertamente, y sus salvaguardas pueden ser eludidas entre un 64% y un 100% de las veces con técnicas simples, aumentando significativamente los riesgos de uso malicioso.

Español version →


🇫🇷 Français

Capacités cybernétiques de GLM-5.3 : Analyse et risques

Il y a cinq mois, nous avons présenté Claude Mythos Preview, le premier modèle d'IA capable de construire de manière autonome des exploits cybernétiques sophistiqués de bout en bout, publié via Project Glasswing pour aider les défenseurs à trouver plus de 10 000 vulnérabilités. Aujourd'hui, des modèles similaires ont émergé. Cet article analyse GLM-5.3 de Zhipu AI (Z.ai), qui égale Claude Mythos Preview dans le développement d'exploits mais manque de garde-fous significatifs, permettant des contournements de 64 % à 100 % du temps dans nos tests, contrairement aux modèles Claude.

Le 17 septembre, le CAISI de la NIST a évalué GLM-5.3 comme « le modèle open-weight le plus cyber-capable jamais publié à ce jour », en retard d'environ quatre mois sur la frontière américaine. Contrairement aux modèles américains, qui sont réservés aux utilisateurs vérifiés, GLM-5.3 est librement téléchargeable, augmentant les risques d'utilisation malveillante tout en aidant également les défenseurs.

Nos évaluations, utilisant Exploit Bench et des benchmarks internes, montrent que GLM-5.3 développe des exploits de bout en bout dans 50 des 410 tentatives, similaire aux 56 de Claude Mythos Preview. Ces capacités peuvent être exploitées à la fois pour l'attaque et la défense, soulignant la nature à double usage de l'IA avancée.

Comment GLM-5.3 se compare-t-il aux modèles frontières américains en matière de capacités cybernétiques ?

Selon le CAISI de la NIST, GLM-5.3 est le modèle open-weight le plus cyber-capable à ce jour, en retard d'environ quatre mois sur la frontière américaine sur les benchmarks agrégés. Contrairement aux modèles américains, réservés aux utilisateurs vérifiés, GLM-5.3 est ouvertement téléchargeable, et ses garde-fous peuvent être contournés de 64 à 100 % du temps avec des techniques simples, augmentant considérablement les risques d'utilisation malveillante.

Français version →


🇮🇳 हिन्दी

GLM-5.3 साइबर क्षमताएँ: विश्लेषण और जोखिम

पाँच महीने पहले, हमने Claude Mythos Preview पेश किया, जो पहला AI मॉडल है जो स्वायत्त रूप से परिष्कृत एंड-टू-एंड साइबर शोषण बना सकता है, जिसे Project Glasswing के माध्यम से जारी किया गया ताकि रक्षकों को 10,000 से अधिक कमजोरियाँ खोजने में मदद मिल सके। अब, समान मॉडल सामने आए हैं। यह पोस्ट Zhipu AI (Z.ai) के GLM-5.3 का विश्लेषण करती है, जो शोषण विकास में Claude Mythos Preview के बराबर है लेकिन सार्थक सुरक्षा उपायों की कमी है, जिससे हमारे परीक्षणों में 64% से 100% समय बाईपास संभव है, Claude मॉडल के विपरीत।

17 सितंबर को, NIST के CAISI ने GLM-5.3 को "आज तक जारी सबसे साइबर-सक्षम ओपन-वेट मॉडल" के रूप में मूल्यांकन किया, जो अमेरिकी सीमा से लगभग चार महीने पीछे है। अमेरिकी मॉडलों के विपरीत, जो सत्यापित उपयोगकर्ताओं तक सीमित हैं, GLM-5.3 स्वतंत्र रूप से डाउनलोड करने योग्य है, जिससे दुर्भावनापूर्ण उपयोग के जोखिम बढ़ते हैं और रक्षकों की भी मदद होती है।

हमारे मूल्यांकन, Exploit Bench और आंतरिक बेंचमार्क का उपयोग करते हुए, दिखाते हैं कि GLM-5.3 410 प्रयासों में से 50 में एंड-टू-एंड शोषण विकसित करता है, जो Claude Mythos Preview के 56 के समान है। इन क्षमताओं का उपयोग हमले और बचाव दोनों के लिए किया जा सकता है, जो उन्नत AI की दोहरे उपयोग प्रकृति को उजागर करता है।

साइबर क्षमताओं में GLM-5.3 की तुलना अमेरिकी सीमा मॉडल से कैसे की जाती है?

NIST के CAISI के अनुसार, GLM-5.3 आज तक का सबसे साइबर-सक्षम ओपन-वेट मॉडल है, जो समग्र बेंचमार्क पर अमेरिकी सीमा से लगभग चार महीने पीछे है। अमेरिकी मॉडलों के विपरीत, जो सत्यापित उपयोगकर्ताओं तक सीमित हैं, GLM-5.3 खुले तौर पर डाउनलोड करने योग्य है, और इसके सुरक्षा उपायों को सरल तकनीकों से 64-100% समय बाईपास किया जा सकता है, जिससे दुर्भावनापूर्ण उपयोग के जोखिम काफी बढ़ जाते हैं।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Kemampuan Siber GLM-5.3: Analisis dan Risiko

Lima bulan lalu, kami memperkenalkan Claude Mythos Preview, model AI pertama yang mampu secara otonom membangun eksploitasi siber canggih dari ujung ke ujung, dirilis melalui Project Glasswing untuk membantu para pembela menemukan lebih dari 10.000 kerentanan. Sekarang, model serupa telah muncul. Posting ini menganalisis GLM-5.3 dari Zhipu AI (Z.ai), yang menyamai Claude Mythos Preview dalam pengembangan eksploitasi tetapi tidak memiliki pengaman yang berarti, memungkinkan bypass 64% hingga 100% dari waktu dalam pengujian kami, tidak seperti model Claude.

Pada 17 September, CAISI NIST menilai GLM-5.3 sebagai "model open-weight paling mampu siber yang dirilis hingga saat ini," tertinggal sekitar empat bulan dari garis depan AS. Tidak seperti model AS, yang dibatasi untuk pengguna terverifikasi, GLM-5.3 dapat diunduh secara bebas, meningkatkan risiko penggunaan jahat sekaligus membantu pembela.

Evaluasi kami, menggunakan Exploit Bench dan benchmark internal, menunjukkan GLM-5.3 mengembangkan eksploitasi ujung ke ujung dalam 50 dari 410 percobaan, mirip dengan 56 dari 410 milik Claude Mythos Preview. Kemampuan ini dapat dimanfaatkan untuk serangan dan pertahanan, menyoroti sifat penggunaan ganda dari AI canggih.

Bagaimana GLM-5.3 dibandingkan dengan model garis depan AS dalam kemampuan siber?

Menurut CAISI NIST, GLM-5.3 adalah model open-weight paling mampu siber hingga saat ini, tertinggal sekitar empat bulan dari garis depan AS pada benchmark agregat. Tidak seperti model AS, yang dibatasi untuk pengguna terverifikasi, GLM-5.3 dapat diunduh secara terbuka, dan pengamannya dapat dilewati 64-100% dari waktu dengan teknik sederhana, secara signifikan meningkatkan risiko penggunaan jahat.

Bahasa Indonesia version →


🇯🇵 日本語

GLM-5.3のサイバー能力:分析とリスク

5か月前、私たちはClaude Mythos Previewを発表しました。これは、洗練されたエンドツーエンドのサイバーエクスプロイトを自律的に構築できる最初のAIモデルであり、Project Glasswingを通じてリリースされ、防御側が10,000以上の脆弱性を見つけるのを支援しました。現在、同様のモデルが登場しています。この投稿では、Zhipu AI(Z.ai)のGLM-5.3を分析します。これは、エクスプロイト開発においてClaude Mythos Previewに匹敵しますが、意味のある保護手段がなく、私たちのテストでは64%から100%の確率でバイパスが可能であり、Claudeモデルとは異なります。

9月17日、NISTのCAISIはGLM-5.3を「これまでにリリースされた中で最もサイバー能力の高いオープンウェイトモデル」と評価し、米国のフロンティアより約4か月遅れています。検証済みユーザーに限定されている米国モデルとは異なり、GLM-5.3は自由にダウンロードでき、悪意のある使用のリスクを高めると同時に防御側にも役立ちます。

Exploit Benchと内部ベンチマークを使用した私たちの評価では、GLM-5.3は410回の試行のうち50回でエンドツーエンドのエクスプロイトを開発し、Claude Mythos Previewの56回に類似しています。これらの能力は攻撃と防御の両方に利用でき、高度なAIの二重使用の性質を浮き彫りにしています。

GLM-5.3はサイバー能力において米国のフロンティアモデルとどう比較されますか?

NISTのCAISIによると、GLM-5.3はこれまでで最もサイバー能力の高いオープンウェイトモデルであり、総合ベンチマークで米国のフロンティアより約4か月遅れています。検証済みユーザーに限定されている米国モデルとは異なり、GLM-5.3は公開されており、その保護手段は簡単な技術で64〜100%の確率でバイパスでき、悪意のある使用のリスクが大幅に高まります。

日本語 version →


🇧🇷 Português

Capacidades cibernéticas do GLM-5.3: Análise e riscos

Há cinco meses, apresentamos o Claude Mythos Preview, o primeiro modelo de IA capaz de construir autonomamente exploits cibernéticos sofisticados de ponta a ponta, lançado através do Project Glasswing para ajudar defensores a encontrar mais de 10.000 vulnerabilidades. Agora, modelos semelhantes surgiram. Esta postagem analisa o GLM-5.3 da Zhipu AI (Z.ai), que iguala o Claude Mythos Preview no desenvolvimento de exploits, mas carece de salvaguardas significativas, permitindo bypass de 64% a 100% das vezes em nossos testes, ao contrário dos modelos Claude.

Em 17 de setembro, o CAISI da NIST avaliou o GLM-5.3 como "o modelo de peso aberto mais capaz ciberneticamente já lançado até hoje", ficando atrás da fronteira dos EUA por cerca de quatro meses. Ao contrário dos modelos dos EUA, que são restritos a usuários verificados, o GLM-5.3 é livremente baixável, aumentando os riscos de uso malicioso e também ajudando defensores.

Nossas avaliações, usando Exploit Bench e benchmarks internos, mostram que o GLM-5.3 desenvolve exploits de ponta a ponta em 50 de 410 tentativas, semelhante aos 56 de 410 do Claude Mythos Preview. Essas capacidades podem ser aproveitadas tanto para ataque quanto para defesa, destacando a natureza de duplo uso da IA avançada.

Como o GLM-5.3 se compara aos modelos de fronteira dos EUA em capacidades cibernéticas?

De acordo com o CAISI da NIST, o GLM-5.3 é o modelo de peso aberto mais capaz ciberneticamente até hoje, ficando atrás da fronteira dos EUA por cerca de quatro meses em benchmarks agregados. Ao contrário dos modelos dos EUA, restritos a usuários verificados, o GLM-5.3 é abertamente baixável, e suas salvaguardas podem ser contornadas de 64 a 100% das vezes com técnicas simples, aumentando significativamente os riscos de uso malicioso.

Português version →


🇷🇺 Русский

Кибервозможности GLM-5.3: анализ и риски

Пять месяцев назад мы представили Claude Mythos Preview, первую модель ИИ, способную автономно создавать сложные сквозные киберэксплойты, выпущенную через Project Glasswing, чтобы помочь защитникам найти более 10 000 уязвимостей. Теперь появились аналогичные модели. В этом посте анализируется GLM-5.3 от Zhipu AI (Z.ai), который соответствует Claude Mythos Preview в разработке эксплойтов, но не имеет значимых защитных мер, что позволяет обходить их в 64%–100% случаев в наших тестах, в отличие от моделей Claude.

17 сентября CAISI при NIST оценил GLM-5.3 как «самую киберспособную модель с открытым весом, выпущенную на сегодняшний день», отстающую от американского фронтира примерно на четыре месяца. В отличие от американских моделей, которые доступны только проверенным пользователям, GLM-5.3 можно свободно скачать, что увеличивает риски злонамеренного использования, но также помогает защитникам.

Наши оценки с использованием Exploit Bench и внутренних бенчмарков показывают, что GLM-5.3 разрабатывает сквозные эксплойты в 50 из 410 попыток, что аналогично 56 из 410 у Claude Mythos Preview. Эти возможности могут быть использованы как для атаки, так и для защиты, что подчеркивает двойное назначение передового ИИ.

Как GLM-5.3 сравнивается с американскими фронтирными моделями в кибервозможностях?

Согласно CAISI при NIST, GLM-5.3 — самая киберспособная модель с открытым весом на сегодняшний день, отстающая от американского фронтира примерно на четыре месяца по совокупным бенчмаркам. В отличие от американских моделей, доступных только проверенным пользователям, GLM-5.3 открыто скачивается, и его защитные меры можно обойти в 64–100% случаев простыми методами, что значительно увеличивает риски злонамеренного использования.

Русский version →


🇨🇳 简体中文

GLM-5.3网络能力:分析与风险

五个月前,我们推出了Claude Mythos Preview,这是第一个能够自主构建复杂端到端网络利用的AI模型,通过Project Glasswing发布,帮助防御者发现了超过10,000个漏洞。现在,类似的模型已经出现。本文分析了来自Zhipu AI(Z.ai)的GLM-5.3,它在利用开发方面与Claude Mythos Preview相当,但缺乏有意义的防护措施,在我们的测试中,其防护措施可被绕过64%到100%的时间,这与Claude模型不同。

9月17日,NIST的CAISI评估GLM-5.3为“迄今为止发布的最具网络能力的开放权重模型”,在整体基准上落后美国前沿约四个月。与美国模型不同,后者仅限于经过审查的用户使用,GLM-5.3可自由下载,增加了恶意使用的风险,同时也为防御者提供了帮助。

我们的评估使用Exploit Bench和内部基准,显示GLM-5.3在410次尝试中成功开发了50次端到端利用,与Claude Mythos Preview的56次类似。这些能力既可用于攻击也可用于防御,突显了先进AI的双重用途性质。

GLM-5.3在网络能力方面与美国前沿模型相比如何?

根据NIST的CAISI,GLM-5.3是迄今为止最具网络能力的开放权重模型,在整体基准上落后美国前沿约四个月。与美国模型不同,后者仅限于经过审查的用户使用,GLM-5.3可公开下载,其防护措施可通过简单技术绕过64%-100%,显著增加了恶意使用的风险。

简体中文 version →