Microsoft, güvenlik açıklarını bulup kapatmaya yönelik MDASH sisteminde kullandığı yeni modeli MAI-Cyber-1-Flash ile CyberGym üzerinde yüzde 95,95 puana ulaştığını açıkladı. Şirket, bu kurulumun mevcut en iyi MDASH kombinasyonuna kıyasla maliyeti yarıya indirdiğini de söylüyor.
Microsoft’un paylaştığı bilgilere göre sonuç, MDASH içinde MAI-Cyber-1-Flash ile GPT-5.4 birlikte çalıştırıldığında elde edildi. Model, şirketin anlatımına göre MDASH görevlerinin yaklaşık yüzde 90’ını üstlenebilecek şekilde tasarlandı; en zor kalan yüzde 10’luk bölüm ise GPT-5.4’e bırakılıyor. Erişim şu anda yalnızca onaylı MDASH müşterilerine açık ve Azure AI Foundry üzerindeki özel önizleme programı üzerinden veriliyor.
95,95’lik skor modelin değil, sistemin
Microsoft’un özellikle altını çizdiği nokta, başlıktaki 95,95 puanın tek başına yeni modele ait olmaması. Bu skor, MDASH sisteminin MAI-Cyber-1-Flash ile GPT-5.4 birlikte çalışırken ulaştığı seviye; modelin bağımsız, genel kullanıma açık bir ürün olarak ölçülen performansı değil.
CyberGym’in Level 1 testi, bilinen bir açığın yeniden üretimini ölçüyor. Sisteme bir zafiyet açıklaması ve yamalanmamış kaynak kod veriliyor, ardından bir ajan programının çalışan bir proof-of-concept üretip üretemediğine bakılıyor. Test, körlemesine açık keşfini ya da üretilen yamanın gerçekten doğru olup olmadığını ölçmüyor.
28 Temmuz 2026 tarihinde kontrol edilen kamuya açık CyberGym liderlik tablosunda Microsoft’un 95,95 sonucuna yer verilmedi. Listede 27 Temmuz tarihli kayıtta Wiz’in Atlas ajanı yüzde 90,9 ile ilk sırada görünürken, Microsoft’un 12 Mayıs tarihli MDASH gönderimi yüzde 88,4 seviyesinde kalmıştı. Microsoft’un yayımladığı kamuya açık materyaller, 95,95 sonucunun bu tabloya gönderilip gönderilmediğini netleştirmiyor.
Şirketin daha önce duyurduğu yüzde 96,55’lik MDASH sonucu da karşılaştırmayı bütünüyle açıklamıyor. Haziran ayındaki bu skor, hedef dışı açıklar da dahil olmak üzere herhangi bir çökme durumunu sayıyordu. Temmuzda paylaşılan 95,95 sonucunda aynı ölçütün kullanılıp kullanılmadığı belirtilmediği için iki rakamı doğrudan önceki ve sonraki performans artışı olarak okumak mümkün değil.
Modelin teknik yapısı ve sınırları
Microsoft’un model kartına göre MAI-Cyber-1-Flash, sparse mixture-of-experts mimarisine sahip bir transformer. Modelin toplam parametre sayısı 137 milyar, aktif parametre sayısı ise 5 milyar olarak veriliyor. Bağlam penceresi 256.000 token seviyesinde ve model, MAI-Code-1-Flash tabanlı bir siber güvenlik ince ayarı olarak tanımlanıyor. Bu sürümün de MAI-Thinking-1 ara eğitim noktasından geliştirildiği belirtiliyor.
Model kartı, değerlendirilen yapılandırmanın MDASH içindeki mevcut modellerin yüzde 80’inin yerini aldığını ve CyberGym sonucunu yüzde 88,4’ten yüzde 95,95’e taşıdığını söylüyor. Buradaki yüzde 80, değiştirilen model oranını ifade ediyor. Microsoft’un ayrı olarak verdiği yüzde 90 ise küçük modelin üstlenebileceği görev payının üst sınırı.
Şirket, tasarımın merkezinde yönlendirme yaklaşımının bulunduğunu açıkça gösteriyor: MAI-Cyber-1-Flash görevlerin büyük kısmını üstleniyor, GPT-5.4 ise en zor kalan işleri devralıyor. Microsoft’un açıkladığı sonuç da tek bir modelin değil, MDASH sisteminin toplam çıktısı olarak sunuluyor.
Microsoft, maliyet karşılaştırmasını MDASH’ın mevcut en iyi model karması olan GPT-5.4, GPT-5.4 mini ve GPT-5.3 Codex ile yaptı. Ürün sayfasında sistemin “önde gelen modellere kıyasla benzer performansı maliyetin yüzde 50’siyle” sunduğu da yazıyor. Ancak şirket, token kullanımı, çağrı hacmi, gecikme süresi, görev dağılımı ya da hesaplama kaynağı paylaşmadığı için bu oranı bağımsız olarak yeniden üretmek mümkün değil.
Haziran ayında MDASH’ı anlatırken Microsoft’un ajan güvenliğinden sorumlu başkan yardımcısı Taesoo Kim, “Model bir girdi, asıl ürün etrafındaki sistemdir” demişti. Şirketin model kartında yer alan başka testlerde de sonuçlar parçalı görünüyor. Light terminal harness altında model, CVEBench’te 0,314, CyberSecEval4 tehdit istihbaratı testinde 0,553, kötü amaçlı yazılım analizi testinde 0,33 ve CRSBench’te POV=1200 için 0,651 puan aldı.
Öte yandan model, ExploitGym’in çekirdek, kullanıcı alanı ve tarayıcı kategorilerinin tamamında sıfır puan aldı. Bu test, verilen zafiyetleri ve çökme girdilerini çalışır kod yürütme açığına dönüştürmeyi istiyor. Ancak bu sonuçlar farklı görevler ve farklı puanlama ölçeklerine ait; bu nedenle hiçbiri MAI-Cyber-1-Flash için tek başına CyberGym skoru sayılmıyor.
Microsoft, tüm benchmark çalışmalarının ağdan izole bir ortamda yürütüldüğünü; üretim sistemlerine, açık internete ve dış servislere erişim olmadığını da bildirdi. Model kartında ayrıca üretilen metin ve kodun hatalı ya da eksik olabileceği, önemli kullanım öncesinde mutlaka gözden geçirilmesi gerektiği uyarısı yer alıyor.
MAI-Cyber-1-Flash’ın MDASH içinde yazılım zafiyeti yönetiminde kullanılması, Microsoft’un daha geniş çaplı savunma ajanlarını koordine etmeye yönelik Project Perception için duyurduğu ilk senaryo oldu. Projenin 3 Ağustos’ta genel önizlemeye açılması planlanıyor; şirket, modeli daha sonra yazılım açıkları dışındaki güvenlik iş akışlarına da taşımayı hedefliyor.
