Yapay zeka sohbet botlarına yazdığınız her cümle, sorduğunuz her soru aslında bir veri parçası. Peki bu veriler nereye gidiyor, nasıl işleniyor ve kimlerle paylaşılıyor? Cevabı gizlilik politikalarında saklı, ancak bu politikaları okumak neredeyse imkansız hale gelmiş durumda. Bridewell'in siber güvenlik uzmanları tarafından yapılan yeni bir araştırma, 20 popüler büyük dil modelinin (LLM) gizlilik politikalarını mercek altına aldı ve ortaya çıkan tablo oldukça çarpıcı.
- Ortalama bir LLM gizlilik politikasını okumak 20 dakika sürüyor.
- Meta'nın Muse Spark politikası 14.000 kelimenin üzerinde ve neredeyse bir saatte okunuyor.
- İncelenen 20 modelden 13'ü kullanıcı verilerini eğitim için kullanıyor.
Gizlilik politikaları neden bu kadar okunmaz halde?
Araştırmaya göre, incelenen politikaların ortalama kelime sayısı 4.603. Bu, tek başına bir okuma yükü oluşturuyor. Ancak asıl sorun sadece uzunluk değil; metinlerin anlaşılabilirliği de son derece düşük. Flesch Okunabilirlik Skoru, metinlerin ne kadar kolay okunduğunu ölçen 1948 tarihli bir yöntem. 60 ve üzeri puanlar iyi kabul edilirken, bu politikaların ortalaması yalnızca 40,2. Yani metinler, çoğu insanın anlamakta zorlanacağı bir jargon yoğunluğuna sahip.
Bu durum, kullanıcıların bilinçli bir onay verip vermediği sorusunu gündeme getiriyor. Aylık aktif kullanıcıların yaklaşık %75'inin en az bir kez yapay zeka sohbet botu kullandığı düşünülürse, bu metinleri okuyup anlamak neredeyse imkansız hale geliyor. Çoğu kullanıcı, "Kabul Et" butonuna tıklayarak aslında neyi kabul ettiğini bilmiyor.
Hangi verileriniz eğitim için kullanılıyor?
Bridewell'in incelemesi, 20 LLM'den 13'ünün kullanıcı girdilerini ve çıktılarını modellerini eğitmek için kullandığını ortaya koydu. Bazı modeller eğitimden çıkma (opt-out) seçeneği sunarken, bazıları sunmuyor. Üstelik opt-out seçeneği sunanlarda bile bu işlemin nasıl yapılacağı her zaman net değil. Kullanıcılar, sohbet geçmişlerinin veya girdikleri verilerin model eğitiminde kullanılıp kullanılmadığını kolayca anlayamıyor.
Bu noktada şirketlerin iç politikaları da kritik. Bridewell uzmanları, işletmelerin hangi verilerin paylaşılıp paylaşılamayacağına dair net iç yönergeler oluşturması gerektiğini vurguluyor. Aksi halde çalışanlar farkında olmadan hassas şirket verilerini yapay zeka modellerine kaptırabilir.
Türkiye'de durum ne?
Türkiye'de yapay zeka sohbet botlarının kullanımı hızla artıyor. Ancak gizlilik politikalarının Türkçe çevirileri ya da yerel mevzuata uygunlukları konusunda ciddi belirsizlikler var. KVKK kapsamında kişisel verilerin işlenmesi için açık rıza gerekiyor, ancak bu politikaların anlaşılırlığı ve erişilebilirliği tartışmalı. Kullanıcıların büyük çoğunluğu, hangi verilerinin yurt dışına aktarıldığını veya nasıl kullanıldığını bilmiyor.
Peki kullanıcılar ne yapmalı?
Uzmanlar, en azından kritik verilerin paylaşılmaması gerektiğini belirtiyor. Kişisel bilgiler, şifreler, finansal veriler veya şirket sırları yapay zeka sohbet botlarına yazılmamalı. Ayrıca mümkünse eğitimden çıkma seçeneği sunan modeller tercih edilmeli ve bu ayarın nasıl yapıldığı öğrenilmeli. Ancak asıl çözüm, düzenleyicilerin ve şirketlerin gizlilik politikalarını daha kısa, açık ve anlaşılır hale getirmesi. Aksi takdirde kullanıcılar, okumadıkları metinlere onay vererek dijital hayatlarını teslim etmeye devam edecek.
Gizlilik politikalarının okunabilirliği, yapay zeka çağında temel bir hak haline gelmeli. Çünkü veri, yeni petrol ise, bu petrolün nasıl çıkarıldığını bilmek herkesin hakkı.