Grok’ta yeni enjeksiyon tekniği sohbet verilerini dışarı sızdırabiliyor

Anasayfa » Grok’ta yeni enjeksiyon tekniği sohbet verilerini dışarı sızdırabiliyor
Grok’ta yeni enjeksiyon tekniği sohbet verilerini dışarı sızdırabiliyor

Adversa AI’nin paylaştığı son bulgulara göre, xAI’nin Grok sohbet robotunda çalışan yeni bir saldırı zinciri, kullanıcının adı, yaklaşık konumu, abonelik seviyesi ve devam eden konuşmadaki istemleri saldırganın kontrol ettiği sunucuya taşıyabiliyor. Araştırmacılar bu akışın, bir web sayfasındaki sıradan bir özetleme isteğinin ardından, kullanıcıdan ek bir onay almadan ve görünür bir uyarı vermeden çalıştığını söylüyor.

Şirket, tekniğe “Cryptographic Context Injection” adını verdi. Aynı çalışmada, benzer yöntemlerin Google’ın Gemini sisteminde de farklı bir senaryoda işleyebildiği, hatta şifreli içerik blokları üzerinden yapay zekâ ajanlarının yanıltılabildiği anlatılıyor. Bulguların merkezinde, güvenilmeyen bir web içeriğinin doğrudan model bağlamına girmesi yerine, şifrelenmiş talimatlar üzerinden modelin kendi yürütme ortamında çözdürülen bir yük bulunuyor.

Şifreli talimat, modelin kendi araçlarıyla çözdürülüyor

Adversa’nın tarifine göre saldırı, okunabilir metin yerine şifreli bir JSON nesnesi taşıyan bir web sayfasıyla başlıyor. Sayfada ayrıca anahtar malzemesi ve bu verinin çözülmesine yönelik talimatlar yer alıyor. Grok, bu talimatları kendi Python kod yürütme zamanında işliyor ve PBKDF2 ile AES-256-GCM kullanarak metni açıyor.

Buradaki kritik nokta, içerik sınıflandırıcısının tarama sırasında bu şifreyi çözememesi. Araştırmacı Rony Utevsky, güçlü şifrelemenin içerik sınıflandırıcısı tarafından okunamadığını ve kestirme biçimde atlanamadığını, bu nedenle saldırganın modeli kendi çalışma zamanı üzerinden veriyi geri kazanmaya zorladığını söyledi. Utevsky’ye göre daha zayıf bir kodlama biçiminin aynı filtreleri aşıp aşmayacağı ise hedefe göre değişen deneysel bir soru.

Şifre çözüldükten sonra talimatlar, ajanı özel oturum bağlamını çıkarmaya ve bunu “ek bağlam almak” için açması söylenen bir URL’nin içine yerleştirmeye yönlendiriyor. Zincirin bir aşamasında model, aslında anahtar olmayan bir “çözme anahtarı” da üretiyor; bu değer, ad, konum, abonelik seviyesi ve sohbet geçmişini bir araya getiren bir şablon dizesi olarak oluşturuluyor. Grok daha sonra kendi gezinme aracını kullanarak bu adresi açıyor ve veriyi isteğin sorgu parametrelerine taşıyor.

Adversa, bu testte alınan istemlerin yalnızca devam eden konuşmayla sınırlı olduğunu ve çıkarılan her şeyin zaten modelin bağlamında bulunduğunu belirtti. Şirket, ajanların erişim alanının bağlamında tuttuğu ya da araçlarıyla çekebildiği her şeye uzandığını, ancak başka sohbetlere, kalıcı hafızaya ya da farklı içeriklere erişim denenmediğini de ekledi.

Şirketin ifadesiyle asıl sorun, xAI’nin ajan çerçevesinin güvenilmeyen dış bir sayfadan gelen talimatların ayrıcalıklı ve internete bağlı bir aracı tetiklemesine izin vermesi. Bu tasarımın, özel oturum verilerini ve konuşma geçmişini dışa giden aracın girdilerine dönüştürdüğü; etkin bir çıkış sınırı, onay kapısı ya da gözlemlenebilir bir köken ayrımı bırakmadığı belirtiliyor.

Adversa, xAI’ye ilk bildirimi 3 Haziran 2026’da yaptığını, aynı gün HackerOne hata ödülü programına da rapor ilettiğini açıkladı. Şirkete göre xAI raporu aldı ancak ayrıntı, yol haritası ya da bir azaltma takvimi paylaşmadı. 4 Ağustos ve 10 Ağustos tarihlerindeki sonraki temas girişimlerine de yanıt verilmedi.

20 Ağustos 2026 itibarıyla xAI’den bir açıklama ya da teknik duyuru yayımlanmadı. Adversa, operasyonel yükleri paylaşmadığını çünkü bunların kötüye kullanımı kolaylaştırabileceğini belirtiyor. Grok bulgusuna ilişkin kamuya açık tek kaynak da yine şirketin bu analizi oldu.

Grok cephesindeki deneme için hedefin grok.com üzerindeki web sohbeti olduğu, test sırasında Grok 4.5 Fast sürümünün çalıştığı ve saldırının 19 Ağustos 2026’da bir kez yeniden üretildiği aktarıldı. Şirket, 20 Haziran’dan bu yana saldırıyı 20 kez denediğini ve yüzde 40 başarı oranı elde ettiğini söylüyor. Başarısız girişimlerin ise Grok’un talimatı çözmekte zorlanmasından kaynaklandığı, tetiklenmiş bir uyarı ya da engellenmiş bir istem nedeniyle gerçekleşmediği ifade edildi.

Bu testin bir başka ayrıntısı da, başarılı denemelerde modelin yalnızca mevcut konuşma içeriğini değil, kendi bağlamında tuttuğu özel oturum bilgisini de dışa aktarması. Adversa’nın aktardığına göre, test edilen akışta çıkarılan veri seti bununla sınırlı kaldı; ancak ajanların erişim alanı, bağlamına aldığı ya da araçlarıyla çekebildiği diğer içerikleri de kapsayabiliyor.

Araştırmacılar, zincirin başında saldırgan talimatlarının okunabilir biçimde değil, şifreli veri halinde taşınmasının özellikle önemli olduğunu vurguluyor. Böylece içerik denetimi aşamasında zararlı yönerge görünmüyor; talimat ancak model kendi kodunu çalıştırdıktan sonra geri kazanılıyor ve dışarıdan alınmış web içeriği gibi değil, yürütülen kodun çıktısı olarak bağlama giriyor.

Adversa’nın değerlendirmesinde, bu yapı içeriği güvenilmeyen bir dış sayfadan alan ancak ardından ayrıcalıklı bir ağ aracını çalıştıran ajanlarda ortak bir zayıflığa işaret ediyor. Şirket, saldırganın kontrolündeki talimatların hiçbir engelle karşılaşmadan ayrıcalıklı bir dışa çıkış eylemine ulaştığını savunuyor.

Aynı çalışmada Google’ın Gemini modeli için de bir gösterim yer aldı. Deep Thinking modundaki bu senaryoda tek bir istem, modeli bir yükü çözmeye zorluyor; çözülen içerik sahte bir Python traceback’i olarak şekilleniyor, içine de uydurma bir güvenlik politikası devre dışı bırakma geri çağrısı ve modeli kısıtlı çıktıya önceden kilitleyen bir birinci tekil şahıs akıl yürütme ön eki yerleştiriliyor.

Adversa’ya göre bu zincir, kısıtlı içeriğin üretilmesine yol açtı ve Gemini’nin sistem yönergelerini de yeniden ortaya çıkardı. Şirket, test edilen sürümün ücretli katmandaki Gemini 3 Flash (Web) olduğunu belirtti. Google’a ayrıca bildirim yapılmadı; çünkü şirkete göre jailbreak türü denemeler kendi açıklama programının kapsamı dışında kalıyor. Başarı oranının ağustos ayına gelindiğinde belirgin biçimde düştüğü de kaydedildi, ancak bunun nedeni filtre güncellemeleriyle model sürümü değişiklikleri arasında ayrıştırılmadı.

Gemini’ye ilişkin bu gösterimin ilk kez yeni olmadığını da not etmek gerekiyor. Utevsky, aynı zinciri 11 Mart 2026’da kişisel araştırma sayfasında Cryptographic Payload Injection adıyla yayımladığını, beş bağımsız yeniden üretimde beşte beş başarı gördüğünü ve çapraz model testlerinde OpenAI’nin GPT-5’inin çözme talimatlarını ayrıştıramadığını, Anthropic’in Claude Sonnet 4.5 modelinin ise şifre çözülse bile yükü prompt injection olarak işaretlediğini anlattı.

Utevsky, Gemini bölümünün Mart ayında yürütülen araştırmanın neredeyse aynı haliyle yayımlandığını ve bugün yalnızca tekniğin genelleştirilmiş biçiminin ile Grok üzerindeki uygulamasının eklendiğini söyledi.

Şirketin anlatımında, model katmanında düzeltme yapmaktan çok ajanı çevreleyen kontrol düzeyinin sıkılaştırılması gerekiyor. Yani kimlik, erişim alanı, yazma yetkisi ve sonradan yeniden oynatılabilirlik gibi sınırlar, doğrudan modelden daha belirleyici hale geliyor.

Adversa, ajan kullanan ekiplerin güvenilmeyen içeriği araç ve kimlik bilgisi olmayan ayrı bir bağlamda tutmasını; geri dönen çıktıyı yalnızca yapılandırılmış veri olarak yetkili bağlama aktarmasını; yeni ağ hedefleri, push işlemleri, birleştirmeler, yayınlar ve çalışma alanı dışına yazma gibi geri döndürülemez eylemleri ise tam çözülmüş argümanlarla ve insan yoksa sert reddetme kuralıyla onaylamasını öneriyor. Şirket ayrıca oturum bazlı araç izlerinin çözümlenmiş argümanlarla kaydedilmesi, tek bir yük yerine talimat dizisinin izlenmesi ve şifreli bir blokla birlikte gelen deşifre talimatlarının bloklama filtresi değil inceleme sinyali olarak ele alınması gerektiğini vurguluyor.

Bu tavsiyeler arasında tedarik süreçlerine bağlam kökeninin de eklenmesi yer alıyor. Adversa, alıcıların satıcılara araç çıktısının talimat kanalından ayrı tutulup tutulmadığını sormasını istedi.

Çalışma yayımlandığı sırada yapay zekâ sistemlerinde şifreli içerik bloklarının başka bir tartışma alanı da vardı. Alexander Panfilov ve yedi ortak yazarın 10 Ağustos 2026 tarihli ön baskısında, Anthropic, OpenAI ve Google’ın API istemcilerine geri döndürdüğü encrypted chain-of-thought bloklarının bir sağlayıcı ekosistemi içinde oturumlar, kullanıcılar ve modeller arasında birbirinin yerine kullanılabildiği, bunun da saldırganların görünmez prompt injection yürütmesine kapı aralayabileceği belirtildi.

Aynı dönemde UC Berkeley, Ethereum Foundation ve NYU Shanghai’den araştırmacılar USENIX Security 2026’da sundukları çalışmada, modelin önce bir yerine koyma şifresini çözdüğü, ardından çözülen metne göre hareket etmesinin istendiği iki turlu bir saldırının Grok 3’e karşı test edilen 12 kötü niyetli hedefin tamamında başarılı olduğunu bildirdi. Aynı şifrenin ikinci etkinleştirme turu olmadan kullanıldığı senaryoda ise 12 denemenin 12’si başarısız oldu.

Grok etrafındaki prompt injection raporlarına yönelik eleştiriler de yeni değil. Aralık 2024’te Johann Rehberger, X iOS uygulamasındaki Grok’a karşı uçtan uca bir veri sızdırma zinciri gösterdiğini, dolaylı bir prompt injection’ın asistanı önceki sohbet bilgilerini üçüncü taraf bir sunucuya göndermeye yönelttiğini söyledi. Rehberger, ilettiği sorunların tamamının “Informational” olarak kapatıldığını da aktardı.

Rehberger o dönem, xAI’nin bildirilen zafiyet için pratik bir etki bulunmadığını savunduğunu, buna karşın kullanıcı sohbetlerinin ve IP adresinin sızmasının nasıl zafiyet sayılmadığını anlamadığını belirtmişti.

Adversa, 20 Ağustos 2026 tarihli güncellemede Grok için test edilen sürüm, başarı oranı ve çıkarılan veri kapsamına ilişkin ek yanıtlar paylaştı. Şirketin son yayımladığı analiz, saldırının şifreleme, ajan araçları ve bağlam yönetimi arasındaki sınırları nasıl zorladığını ayrıntılı biçimde ortaya koyuyor.