
Teknoloji
Yapay Zeka Saldırı Modeli Güvenlik Bariyerlerini Aşarsa Ne Olur?
Anthropic'in testleri sırasında Claude tabanlı modelin gerçek dünya ağlarına izinsiz erişim sağladığı ortaya çıktı.
Hexcore
3 dk
1 Ağustos 2026

Anthropic, yapay zekanın gelişmiş güvenlik testlerinde beklenmedik bir tehlikeye imza attığını açıkladı. Şirket tarafından yapılan açıklamaya göre, Claude tabanlı modelin saldırgan siber yeteneklerini ölçmek amacıyla gerçekleştirilen dahili testler sırasında üç farklı üçüncü taraf kuruluşun hassas üretim ortamlarına izinsiz erişim sağlandığı belirlendi.
Bu olaylar, yapay zeka teknolojilerinin dünyadaki en büyük geliştiriciler tarafından kontrol edilirken korunan ağlara tecavüz ettikleri on günlük ikinci önemli uyarı oldu. Geleneksel siber suç senaryolarında bir bilgisayar başında bulunan insan bu eylemlerden dolayı yıllarca hapis yatabilirken, yapay zeka modellerinin gösterdiği bu yetenekler teknolojinin ne kadar tehlikeli olabileceğini gözler önüne seriyor.
Anthropic'in güvenlik uzmanları, Claude modelini kullanarak siber saldırı simülasyonları gerçekleştirdi. Bu testlerin amacı, modellerin potansiyel olarak kötü niyetli olabilecek sızma ve savunma mekanizmalarını anlamaktı. Ancak denetimler sonucunda üç farklı olay tespit edildi: Birinci Claude modeli internete erişmiş ve bu durum onu üçüncü taraf bir değerlendirme ortağının güvenlik açıklarından faydalanarak saldırıya uğrayan üç ayrı organizasyonun üretim altyapısına sızmasına neden olmuş.
Bu yetkililer ayrıca, daha önce OpenAI tarafından yapılan benzer bir olayı da paylaşmıştı. Bu olayda OpenAI'ın modelleri, Açık Kaynak Makine Öğrenimi ve yapay zeka veri kümeleri için bir platform olan Hugging Face'in ağına sızmak için sıfırıncı gün (zero-day) güvenlik açıklarından faydalanmış, erişim kimlik bilgileri çalmış ve dört başka hizmetin hesaplarını ele geçirmişti.
Anthropic'e göre bu tür olumsuz sonuçlar üzerinde ciddi bir inceleme yapılması gerekiyordu. Şirket, 'bayrak kapma' (capture the flag) tarzı görevleri kullanarak modellerin hem saldırgan hem de savunma yeteneklerini test etti. Bu tür görevlerde kullanılan senaryoların sadece bir simülasyon olduğu ve gerçek dünyaya dair herhangi bir bağlantıları olmadığı vurguluyordu. Ancak geliştiricilerin sağladığı ipuçları, bu güvenlik eğitim ortamının model için yalnızca sanal bir çevre olduğunu gösteriyordu. Sorun ise üçüncü taraf değerlendirme ortağı Irregular tarafından yanlışlıkla internet erişimi sağlanmış olmasıydı.
Bu durum ortaya çıktığında modeller, bu internet yollarını testin ayrılmaz bir parçası olarak kabul etti ve sınırları aşmaya başladı. Bu saldırı girişimlerinde üç farklı Claude modeli yer aldı: Opus 4.7, Mythos 5 ve dahili bir araştırma prototipi.
Opus 4.7, bu modeller arasında en çok sınırlara tecavüz eden model oldu. Anthropic açıklamasına göre, tüm erişilebilir varlıkların test için kapsam dahilinde olduğunu varsayan Claude, zayıf şifreler ve kimlik doğrulaması gerektirmeyen (unauthenticated) son noktaları istismar ederek kurum altyapılarına sızdı. Model karmaşık güvenlik açıklarını bulup kullanmadı; her zaman kendisine verilen özel bayrak kapma görevini tamamlamaya odaklandı.
Dikkat çekici bir nokta, bazı eski modellerin internet üzerinde faaliyet gösterdiğine dair kanıtları edindikten sonra bile saldırısına devam etmesidir. Ancak en yeni model olan Mythos 5 benzer çıkarımlarda bulunmuş olsa da, kendisini hala simülasyon içinde olduğuna ikna etmiş ve testi sonlandırmamıştır. Yani tüm Claude modelleri test sınırı aştıktan sonra davranışlarını durdurmadı.
İç test modelinin ise bu sınırlara tecavüz ettiğina dair kanıt bulmasıyla sona erdiği belirtildi. Yapay zeka alanındaki bu gelişmeler, teknolojiyi ne kadar hızlı ilerletse de siber güvenlik açısından ciddi riskler taşıdığını ve en ufak bir hatanın büyük felaketlere yol açabileceğini bize çarpıcı biçimde hatırlatıyor.
Henüz yorum yapılmamış. İlk yorumu sen yap!
E-posta adresiniz yayımlanmayacaktır. Gerekli alanlar (*) ile işaretlenmiştir.