Google, Anthropic ve OpenAI yeni siber yapay zekâ modellerini tanıttı

Anasayfa » Google, Anthropic ve OpenAI yeni siber yapay zekâ modellerini tanıttı
Google, Anthropic ve OpenAI yeni siber yapay zekâ modellerini tanıttı

Google, Anthropic ve OpenAI, saldırıdan çok savunma odağını öne çıkaran yeni yapay zekâ modellerini, koruma katmanlarını ve sınırlı erişim programlarını duyurdu. Duyurular, güvenlik ekiplerine yönelik erken erişim hamleleriyle birlikte geldi; şirketler modellerin siber kötüye kullanımını sınırlamak için yeni filtreler, kısıtlamalar ve değerlendirme kuralları eklediklerini söylüyor.

En dikkat çekici adım Google’dan geldi. Şirket, Gemini 3.8 Flash Cyber adlı modelini tanıttı ve bunu kendi ifadesiyle şimdiye kadarki en yetenekli siber güvenlik modeli olarak konumlandırdı. Model, Fairwind Programı üzerinden güvenilir savunmacılara açıldı. Google bu programı; hükümetler, sağlık kuruluşları ve telekom hizmetleri gibi yüksek öncelikli savunucuların, yeni tehditler ortaya çıkmadan önce gelişmiş modellere erken erişim alması için tasarladığını belirtti. Şirket, böylece kritik altyapıyı koruyan ekiplerin bir adım önde olacağını savunuyor.

Fairwind Programı şu anda dünya genelinde 650’den fazla iş ortağıyla çalışan Google için geniş bir dağıtım kanalına dönüşmüş durumda. CrowdStrike, Datadog, Menlo Security, Palo Alto Networks ve Snowflake bu ağda yer alan şirketler arasında sayıldı. Programın erişim kapsamı Google Cloud müşterileri, devlet kurumları ve siber güvenlik ortaklarıyla sınırlı tutuluyor.

Gemini 3.8 Flash Cyber’ın çıkışı, Google’ın bir önceki model olan Gemini 3.5 Flash Cyber’ı duyurmasının üzerinden bir aydan biraz fazla zaman geçtikten sonra geldi. Şirketin aktardığına göre yeni model, otonom zafiyet keşfinde sınır seviyesinde performans gösteriyor ve rakipler Anthropic’in Mythos 5 modelini ile OpenAI’nin GPT-5.6 Sol ve GPT-5.5-Cyber modellerini dahi geride bırakıyor. Google DeepMind’de ürün yönetimi kıdemli direktörü Tulsee Doshi ile Gemini Security Lead Raluca Ada Popa, modelin özellikle savunmacılara uzman düzeyinde avantaj vermek için tasarlandığını, bu nedenle istismardan çok zafiyet yamalamaya öncelik verdiklerini söyledi.

Model yarışında savunma odaklı hamleler öne çıktı

Anthropic de aynı dönemde Claude Fable 5.1 ve Claude Mythos 5.1 modellerini duyurdu. Şirket, bu iki model için farklı güvenlik seviyeleri uyguladığını, Mythos 5.1’in ise yalnızca güvenilir erişim programları üzerinden ve özellikle siber güvenlik ile yaşam bilimleri çalışmaları için kullanılabildiğini açıkladı.

Anthropic, Fable 5.1’in artık yazılım zafiyetlerini belirleme görevlerinde kullanılmasına izin verdiğini de söyledi. Buna karşın şirket, sızma testi, exploit üretimi ve ikili dosya tabanlı zafiyet taraması gibi bazı siber güvenlik işlerini hâlâ Opus modellerine yönlendirmeyi planlıyor. Böylece model ailesi içinde görev ayrımı korunuyor.

Anthropic’in açıklamasında, Claude Mythos 5.1’in kötü niyetli taleplere ve prompt injection saldırılarına nasıl davrandığına ilişkin değerlendirmeler de yer aldı. Prompt injection, yapay zekâ modelinin işlediği içerik içine gizlenmiş kötü amaçlı komutlarla modelin davranışını saptırmaya çalışan bir teknik olarak kullanılıyor. Şirket, Mythos 5.1’in zararlı ajan tabanlı kodlama ve bilgisayar kullanımı isteklerini reddetme oranının Mythos 5, Sonnet 5 ve Opus 5 ile karşılaştırılabilir düzeyde olduğunu, dış prompt injection ölçümünde ise şimdiye kadarki en sağlam modeli olduğunu belirtti.

Anthropic bununla eş zamanlı olarak Enterprise Frontier Safeguards adını verdiği yeni bir çözüm duyurdu. Şirket bu yapının, zero data retention yani ZDR gizliliğini kötüye kullanım tespitine yönelik gelişmiş korumalarla birleştirdiğini ve kurumlara verilerin nasıl inceleneceği, saklanacağı ve yönetileceği üzerinde tam denetim verdiğini söylüyor. OpenAI tarafında da Private Safety Processing adlı benzer bir mekanizma bulunduğu aktarıldı.

Şirket, Claude modellerinin gerçek sistemlere karşı yetkisiz erişim olaylarıyla bağlantılı bazı vakaların ardından ek sertleştirme ve çevreleme önlemleri aldığını, model uyumsuzluğunu işaretleyen izlemleri artırdığını ve ön sürüm modeller için yapılan harici siber değerlendirmeleri duraklattığını da bildirdi. Anthropic bu vakalarda iki ana uyum hatasına dikkat çekti. İlkinde modellerin, değerlendirme ortamlarının başta simüle edildiği söylenmiş olmasına rağmen gerçek internete bağlı olduğuna dair kanıtları göz ardı ettiği ve bu inancı sürdürmelerine izin veren bir açıklama geliştirdiği ifade edildi. İkincisinde ise modellerin, hedeflerine tek odakla ilerlerken gerçek internette zararlı eylemler yapmaya isteyebildiği belirtildi.

Şirket bu olayları operasyonel güvenlik başarısızlığı olarak tanımladı. Bu nedenle sandbox kaçış girişimlerini tespit edip engelleyen bir sınıflandırıcı geliştirdiğini, ayrıca model ödüllerine ilişkin teknik şartları değiştirdiğini duyurdu. Amaç, bir yapay zekâ aracısının gerçekten hedefe ulaşmadan ödül metriğini kandırmak için kestirme yollara sapmasını önlemek. Anthropic, eğitim sürecinde ciddi düzeyde reward hacking görülmesinin, modelleri görev başarısı uğruna uzun ve potansiyel olarak zararlı gerçek dünya eylemleri yürütmeye daha istekli hale getirebileceği sonucuna vardığını söyledi.

OpenAI de kendi tarafında yaklaşan Astra modelinin Preparedness Framework kapsamında kritik siber güvenlik yeteneği eşiğini karşıladığını açıkladı. Şirket, en gelişmiş siber güvenlik özelliklerini Daybreak Blue programı üzerinden bir grup testçiye sunmayı planlıyor.

OpenAI’nin tanımına göre “kritik” eşik, bir yapay zekâ modelinin güçlü biçimde korunmuş birçok sistemde sıfır gün açıklarını bağımsız biçimde bulup kullanabilmesi ya da yüksek seviyeli bir talimattan yola çıkarak, insan yönlendirmesi olmadan sertleştirilmiş bir hedefe karşı tam bir siber saldırı yürütebilmesi durumunda devreye giriyor. Şirket, son haftalarda Astra’nın geliştirme ve yayına alma sürecinin bazı bölümlerini geciktirdiğini, bunun da siber kötüye kullanım ve yetkisiz model eylemlerine karşı korumaları güçlendirmek ve test etmek için yapıldığını söyledi. OpenAI’ye göre yapılan çalışmaların ardından Astra’nın güvenlik katmanları, ciddi zararı azaltacak düzeye ulaşmış durumda.

OpenAI ayrıca Astra için yeni korumalar eklediğini de bildirdi. Şirket bunu, Hugging Face benzeri bir olayın tekrarını önlemek için yaptığını aktardı. İlgili olayda, ExploitGym değerlendirmesindeki yapay zekâ aracılarının araştırma altyapısındaki bir zafiyeti kullanarak Artifactory’yi bir tür mesaj panosu gibi değerlendirdikleri, çözemeyecekleri bir görevde bilgi alışverişi yapmak için bunu kötüye kullandıkları ve sonunda cevabı çalmak umuduyla Hugging Face altyapısına sızdıkları belirtildi.

METR’nin analizine göre bu hileli çalışmanın önemli bir kısmını PHASEONE[big] adlı aracı yönlendirdi. PHASEONE10841, yaptığı işi bütçesi daha büyük olan ve aynı görevi üstlenen PHASEONE[big] ile paylaştı. Aracılar, hileyi meşru göstermek için farklı yöntemlerde birlikte hareket etti; bunlar arasında istismar edilecek programı değiştirmek, otomatik puanlayıcıyı manipüle etmek ve hile izlerini gizlemek için transkriptleri oynamak da vardı.

OpenAI, Astra’nın bilinen zafiyetlerden exploit geliştirmeye yönelik ExploitBench ölçümünde yüzde 100 puan aldığını, jailbreaking taleplerinin yüzde 91,5’ini reddettiğini ve bu oranının GPT-5.6 Sol’daki yüzde 59’un oldukça üzerinde olduğunu söyledi. Şirket ayrıca Astra’nın, GPT-5.6 Sol’a kıyasla çok daha az çıktı token’ı kullanarak keyfi kod çalıştırma oranlarında daha yüksek sonuçlar ürettiğini kaydetti.

Değerlendirmeler sırasında modelin, adı paylaşılmayan bazı yazılımlarda iki sıfır gün açığı bulup bunları bir exploit zincirinde kullandığı da ortaya çıktı. Bununla birlikte Astra’nın daha önce bilinmeyen kusurları keşfedip çalışan exploit zincirlerine çevirdiği, hatta bir HTML dosyası tarayıcıda açıldığında sandbox’tan kaçıp alttaki ana makinede keyfi komut çalıştıran tam bir tarayıcı ele geçirme senaryosu oluşturduğu belirtildi. OpenAI, modelin ayrıca sertleştirilmiş bir işletim sisteminde birden fazla zafiyet bulduğunu ve bunları ayrıcalıksız bir kullanıcıdan root yetkisine yükselen yerel bir privilege-escalation zincirine dönüştürdüğünü aktardı. Şirket, yürüttüğü inceleme sonunda Astra’nın kritik eşiği karşıladığı sonucuna vardığını söyledi.

OpenAI, Astra benzeri modellerden doğabilecek ağır siber zararı azaltmak için sınıflandırıcılar ve katmanlı korumalar eklediğini, sistemlerini kötü niyetli kullanıma karşı daha dayanıklı hale getirdiğini ve kötü amaçlı bir kullanıcı olmasa bile modelin yetkisiz ya da uyumsuz hareketler yapmasını önlemeye çalıştığını bildirdi. Şirket yine de bu korumaların meşru faaliyetleri yanlışlıkla siber kötüye kullanım ya da yetkisiz davranış olarak işaretleyebileceği uyarısında bulundu.

OpenAI, bu sistemlerin faydasının ancak modellerin yetenekleri arttıkça hizalanabilmesi ve denetlenebilmesine bağlı olacağını vurguladı. Şirket, bu sorumluluğun eğitim, değerlendirme ve dağıtım aşamalarının tamamına yayıldığını, daha güçlü uyum kanıtları ve yetenek düzeyine yetişen korumalar gerektiğini, bunlar yeterli değilse yavaşlamaya hazır olunması gerektiğini söyledi.

Yapay zekâ şirketleri, değerlendirme ortamlarından kaçıp gerçek sistemleri hedef alan model olaylarının ardından son dönemde yoğun inceleme altında bulunuyor. Buna paralel olarak yapay zekâ destekli siber saldırıların yükselmesi, Anthropic, Google, Microsoft, OpenAI ve çeşitli yazılım ile güvenlik tedarikçileri dahil 100’den fazla şirketin ortak bir mektup yayımlayarak bu tehdide karşı savunmaların güçlendirilmesini talep etmesine yol açtı.