GLM-5.3: Kodlama ve Siber Güvenlikte Çığır Açan Yapay Zeka Modeli

GLM-5.3 Yapay Zeka Modeli iddiası ne anlatıyor? Za.ai az önce GLM-5.3'ü duyurdu ve bu, bir yapay zeka modelinde gördüğümüz en çarpıcı eğitim sonrası iyileştirmelerden biri. GLM-5.2 ile tamamen aynı temel modeli kullanan GLM-5.3, kodlama kıyaslamalarında %50'lik…

6
Paylaş
GLM-5.3: Kodlama ve Siber Güvenlikte Çığır Açan Yapay Zeka Modeli

GLM-5.3 Yapay Zeka Modeli iddiası ne anlatıyor?

Za.ai az önce GLM-5.3’ü duyurdu ve bu, bir yapay zeka modelinde gördüğümüz en çarpıcı eğitim sonrası iyileştirmelerden biri. GLM-5.2 ile tamamen aynı temel modeli kullanan GLM-5.3, kodlama kıyaslamalarında %50’lik bir iyileşme, birden fazla aracılı kıyaslamada en son teknoloji performansı ve – en şaşırtıcı olanı – Za.ai’nin beklentilerini bile aşan yeni ortaya çıkan siber güvenlik yeteneklerini elde ediyor.

Model, Hacker News’e bir saatten kısa sürede 212 puanla ulaştı. Here’s what happened and why it matters. Temel Bilgi: Eğitim Sonrası Her Şeydir GLM-5.3’ün en dikkat çekici yönü değişmeyen şeydi: temel model. GLM-5.3 uses the same foundation as GLM-5.2. Her bir iyileştirme, eğitim sonrasından gelir; temel modelin önceden eğitilmesinden sonra gerçekleşen pekiştirmeli öğrenme ve ince ayar.

Bu, yapay zeka topluluğunda ilgi çeken bir tezi doğruluyor: Eğitim öncesi ölçeğin başarabileceği sınırlara yaklaşıyor olabiliriz, ancak eğitim sonrası eğitim daha yeni başlıyor.

Tasarım ve teknik ayrıntılar

Z.ai üç şeyi ölçeklendirdi: Daha fazla ortam — kodlama egzersizlerine daha az benzeyen ve daha çok gerçek uzman çalışma birimlerine benzeyen görev ortamları Daha çeşitli görevler — modelin darboğazları teşhis ettiği, optimizasyonları uyguladığı ve deneyler yürüttüğü çok adımlı makine öğrenimi altyapı görevleri dahil Daha fazla bilgi işlem — bu uzun ufuklu ortamlar üzerinde harcanan eğitim Ortamlar o kadar karmaşıktır ki bazıları temsil eder several days of work for an experienced engineer.

Bir makine öğrenimi altyapı görevinde modele, bir insan mühendisle aynı çalışma ortamı (bilgi işlem kümeleri, depolama sistemleri, dahili belgeler, kod tabanları ve deney sonuçları) verilir ve modele, doğruluğu korurken ölçülebilir bir uçtan uca hızlanma sağlaması gerekir.

Yapay Zeka

Karşılaştırma Sonuçları: Numbers GLM-5.3’ün kıyaslamalardaki performansı net bir hikaye anlatıyor: Kodlama: Terminal Bench 3.0: 28,3 (4,6’dan yukarı — 6 kat iyileştirme) DeepSWE v1.1: 66,9 (46,2’den yukarı) Z.ai Code Bench: Her çaba seviyesinde GLM-5.2’ye göre %50 iyileşme, daha az token tüketirken Maksimum çabada: ~75 bin çıkış tokeninde %34,5, GLM-5.2 ise 96 bin tokende %23,4 Agentic: Agents’ Son Sınavı: 28,5 (23,8’den yukarı) AutomationBench v1.0.6: 48,2 (26,2’den yukarı — neredeyse iki katına çıktı) Toolathlon Doğrulandı: 73,0 (59,9’dan yukarı) Bağlam açısından, GLM-5.3 at High effort reaches 31.4% on Z.ai Code Bench at ~50K tokens, surpassing Claude Opus 4.8’s 29.5% at 120K tokens.

Bugünden bakınca ne kadar güvenilir?

Sadece iyileşmekle kalmıyor, token verimliliği de artıyor. Şaşırtıcı Kısım: Ortaya Çıkan Siber Yetenekler Hikayenin ilginçleştiği yer burası. Eğitim sonrası eğitimin bir parçası olarak Z.ai, güvenlik açığı keşif verilerini ve ortamlarını eğitim karışımına ekledi. They expected this to improve the model’s ability to find and reason about vulnerabilities.

What they didn’t expect was how quickly the capability would d eğitim ölçeklendikçe gelişir. GLM-5.3 yalnızca izole kusurları tespit etmede daha iyi olmakla kalmadı, aynı zamanda birden fazla kullanım aşaması boyunca mantık yürütmeye başladı ve kullanım zincirlerinin tamamı için tutarlı planlar oluşturmaya başladı.

Sonuçlar: CyberGym (güvenlik açığı tespiti): %77,2’den %84,5’e yükseldi — sınıfının en iyisi, GPT-5.6 Sol’un (%83,6) önünde ExploitBench (daha derin yararlanma gerekçesi): %54,4, GLM-5.2’nin %24,4’ünün iki katından fazla ExploitGym (zamana göre normalleştirilmiş yararlanma): 2 saatte 105 görev, 6 saatte 130 görev — 29 ve 39’dan yukarı Model tutarlıdır: Kullanım zinciri ne kadar yukarıya çıkarsa, GLM-5.2’den elde edilen kazanç da o kadar büyük olur.

Okuyucu için pratik anlamı

Yetenek, tam olarak modelin en geride olduğu noktada en hızlı şekilde büyüyor. Gerçek Dünya Etkisi: 2.436 Güvenlik Açıkları Bulundu Bu yalnızca karşılaştırmalı performans değildir. Z.ai, Çin’deki çeşitli güvenlik ekipleriyle GLM-5.3’ü gerçek dünyadaki kod tabanlarına karşı çalıştırıyor.

Uzman incelemesi ve veri tekilleştirme sonrasında model şunları tespit etti: 269 açık kaynaklı projede 2.436 güvenlik açığı 1.097 orta ila yüksek önem derecesine sahip sorun Bulgular sistem çekirdeklerini, işletim sistemlerini, tarayıcı motorlarını, web uygulamalarını ve ağ protokollerini kapsıyor Birçoğu yıllardır fark edilmemişti – en eskisi yaklaşık 40 yıl öncesine dayanıyor Z.ai, ifşa sürecinde ilerledikçe bu bulguları takip etmek için bir kamu Güvenlik İfşa Defteri oluşturdu.

Açıklama itibarıyla: 53’ü kamuya açıklandı, 2.383’ü ambargo altında. Nasıl Ölçeklendirilmiş Ortamlar En ilginç teknik ayrıntılardan biri, Z.ai’nin eğitim ortamlarını nasıl ölçeklendirdiğidir. Yararlı bir görev ortamının yürütülebilir, doğrulanabilir ve gerçek profesyonel çalışmaya yakın olması gerekir ve bunların çoğuna ihtiyacınız vardır. Za.ai, ortamları uçtan uca sentezleyen boru hatları inşa etti.

Araştırma aracıları, gerçek işten görev modellerini toplar ve bunları çok adımlı bağımlılıklara ve gizli duruma sahip, çalıştırılabilir uzun ufuklu ortamlara dönüştürür. Daha sonra bir yargıç temsilcisi her görevin gerçekten çözülebilir olduğunu doğrulamaya çalışır. Doğrulayıcılar referans çözümüne erişim olmadan sentezlenirken, çözücü yörüngeleri ödül kısayollarını keşfetmek ve kapatmak için kullanılır.

Bu aslında yapay zekaya yönelik eğitim ortamlarını oluşturmak için yapay zekayı kullanmaktır; eğitim sonrası ölçeklendirmeyi önemli ölçüde hızlandırabilecek yinelenen bir iyileştirme döngüsü. Geliştiriciler İçin Bunun Anlamı Kodlama için: GLM-5.3 artık kodlama görevleri için en yetenekli açık ağırlık modelidir.

Yapay zeka kodlama aracıları kullanıyorsanız bu model, açık ağırlıklarla sınır düzeyinde performans sunar (güvenlik değerlendirmesinden sonra iki hafta içinde yayınlanır). Güvenlik için: Ortaya çıkan siber yetenekler iki ucu keskin bir kılıç gibidir. Bir yandan, bu ölçekte otomatik güvenlik açığı keşfi, yazılım güvenliğini önemli ölçüde artırabilir. Öte yandan aynı yetenekler kötüye kullanılabilir.

Z.ai, özellikle güvenliği güçlendirmek için iki hafta boyunca ağırlıkları saklıyor G. Yapay zeka endüstrisi için: GLM-5.3, yapay zeka gelişiminin bir sonraki sınırının daha büyük eğitim öncesi çalışmalar değil, daha karmaşık eğitim sonrası çalışmalar olduğunun güçlü bir kanıtıdır. Aynı temel model, daha iyi ortamlarda daha iyi RL yoluyla vasattan en son teknolojiye doğru ilerledi.

Açık kaynak için: Açık ağırlıklı bir modelin belirli yetenekler (CyberGym SOTA, rekabetçi kodlama) açısından kapalı modellerle eşleşebilmesi veya onları geçebilmesi, açık/kapalı farkın beklenenden daha hızlı daralabileceğini gösteriyor. Rekabet Ortamı GLM-5.3 her konuda en iyisi değil. Claude Fable 5, Z.ai Code Bench’te (Maksimum eforda %39,5, GLM-5.3’te ise %34,5) ve kullanım kriterlerinde hâlâ lider durumda.

GPT-5.6 Sol her alanda rekabet gücünü koruyor. Ancak GLM-5.3’ün açık ağırlıklar, güçlü kodlama ve muhtemelen daha düşük maliyetle ortaya çıkan güvenlik yeteneklerinin birleşimi, onu birçok kullanım durumu için cazip bir seçenek haline getiriyor. Model şu anda Z.ai’nin kodlama planı ve ZCode platformu aracılığıyla mevcut ve ağırlıklar iki hafta içinde yayınlanacak.

Sonuç olarak GLM-5.3, eğitim sonrası eğitimin yeni ufuk olduğunun kanıtıdır. Aynı model, önemli ölçüde farklı yetenekler; tamamen daha gerçekçi ortamlarda daha iyi takviyeli öğrenme yoluyla elde edilir. Ortaya çıkan siber güvenlik yetenekleri hem etkileyici hem de eğitim sonrası ölçeklendirdiğimizde ne olacağını hâlâ tam olarak anlamadığımızı hatırlatıyor.

Geliştiriciler için bu, başka bir güçlü açık w Kodlama ve ajansal görevler için sekizli seçenek. Yapay zeka endüstrisi için bu, ölçeklendirme hikayesinin henüz bitmediğinin bir işareti; sadece farklı bir bölüme taşındı.

Ek okuma: OpenAI Blog

Editörün Notu

GLM-5.3’ün eğitim sonrası iyileştirmeleri, yapay zeka modellerinde temel yapıyı değiştirmeden performans artışının mümkün olduğunu gösteriyor; özellikle kodlama ve siber güvenlik alanlarında pratik uygulamalarda önemli avantajlar sunuyor.

Emre Demir
Yazar

Yazılım Editörü

Yazılım editörü ve full-stack geliştirici. Uygulama incelemeleri, kodlama rehberleri ve verimlilik araçları üzerine yazıyor. Açık kaynak projelere katkıda bulunuyor; karmaşık konuları yeni başlayanların anlayacağı şekilde anlatmaya özen gösteriyor.

Tüm yazıları gör →