İScience dergisinde yayımlanan yeni bir araştırmada, yapay zeka sistemi GPT-4'ün farklı kaynaklardan oluşturduğu kişilik testlerinin katılımcı yanıtlarını anket yapılmadan önce yüksek doğrulukla tahmin edebildiği ortaya kondu.
Maddi olarak bilimsel dayanakları birbirinden çok uzak olabilecek iki metin temel alınarak kişilik envanterleri hazırlanmış ve GPT-4 bu soruların hangi sonuçlara yol açacağını analiz etmiş oldu. Bu çalışma, büyük dil modellerinin eğitim verileri aracılığıyla insan kişiliğinin karmaşık örüntülerini dolaylı yoldan öğrendiğini gösteriyor.
Yapay Zeka Kişilik Özelliklerini Nasıl Analiz Ediyor?
GPT-4'ün analiz ettiği ve tahmini yüksek korelasyonla sonuçlanan iki farklı kaynak temel alınmıştır: Psikiyatride kullanılan DSM-5’in kişilik bozuklukları bölümü ile bilimsel geçerliliği bulunmayan bir astroloji kitabıdır.
Bu araştırmada elde edilen veriler şunlardır:
- Kullanılan Modeller ve Kaynaklar: GPT-4
- Temel Kişilik Rehberleri: DSM-5 (Psikiyatri) ve Astroloji Kitabı
- Çalışmanın Amacı: LLM'lerin toplam yanıt eğilimlerini önceden tahmin etme kabiliyetini ölçmek.
Maddi olarak modelin bu öngörü yeteneği, sadece soruları sormakla kalmayıp insanların onlara vereceği toplu tepkileri istatistiksel bir yaklaşımla tahmin edebildiğini kanıtladı. Araştırmacılar, büyük dil modellerinin kapsamlı eğitimleri sayesinde insan davranışlarının genel eğilimlerini modelleyebilecek bir seviyeye geldiğini belirtiyor.
Testlerde Hangi Tahmin Başarı Oranları Ölçüldü?
Geniş ölçekli anketler sonucunda GPT-4'ün tahmin yeteneklerinin korelasyon değerleri ölçülmüştür ve sonuçlar dikkat çekicidir. Modelin farklı parametrelerdeki başarı oranı aşağıdaki gibi ortaya çıkmıştır:
Test türüne göre modelin genel yanıt eğilimlerini tahmin etme performansı (Korelasyon):
- DSM-5 Temelli Anket: 0,71
- Astroloji Temelli Anket: 0,85
- Soru İçi İlişkileri Tahmin Etme Performansı:
- DSM-5 Tabanlı Testler İçin: 0,74
- Astroloji Temelli Testler İçin: 0,69
Maddi olarak model, astroloji kitabından üretilen testlerde sorular arasındaki ilişkileri tahmin etmede (0.69), daha az başarılı olsa da genel yanıt eğilimlerini önceden görmek konusunda DSM-5 tabanlı testlere göre çok daha yüksek bir başarı göstermiştir.
Psikiyatri ve Astroloji Testleri Nasıl Karşılaştırıldı?
Düşünce yapısı tamamen farklı olan bu iki kaynak, GPT-4 üzerinde benzer psikolojik sonuçlar üretmiştir. Kullanılan anketler 600 yetişkine uygulanırken katılımcıların Beş Büyük Kişilik Envanteri testi de doldurulmuştur.
Maddi olarak DSM-5 temel alınarak hazırlanan ankette kaçınma ve bağımlılık gibi gerçek hayatla ilişkili kişilik özellikleri birbirini destekleyici yanıtlar üretirken; astroloji anketinden çıkan maddeler daha çok burç veya elementler altında bir araya getirilmiş genel eğilimleri yansıtmıştır.
Maddi olarak her iki testin de kendi içindeki ayrı ayrı soruları, depresyon seviyesi, kaygı ve genel iyilik hali gibi önemli psikolojik sonuçlarla anlamlı ilişkiler kurabilme yeteneğine sahip olduğu gözlemlenmiştir. Bu durum, metnin bilimsel geçerliliği ne olursa olsun modelin bu kavramları bir arada tutabildiğini göstermektedir.
Bu Sonuçlar Kimler İçin Önem Taşıyor?
Gelişmiş dil modellerinin toplu davranış eğilimlerini öngörebilme kapasitesi ciddi akademik ve teknolojik imkansızlıklara işaret etmektedir. Ancak araştırmacılar bu bulgular karşısında kesin bir uyarıda bulunmuşlardır.
Maddi olarak modelin tahmin yeteneği, bireysel kullanıcıların kendine nasıl tepki vereceğini veya tek bir kişinin kişiliğini tam olarak bildiği anlamına gelmemektedir; odak noktası yalnızca 600 kişilik örneklem grubunun ortak eğilimleri ve sorular arasındaki istatistiksel bağlantılar üzerine yoğunlaşmaktadır.
Maddi olarak bu çalışma, GPT-4 gibi sistemlerin profesyonel klinik değerlendirmelerin yerini alabileceği yönünde hiçbir kanıt sunmamaktadır; zira modelin yeteneği hala belirli bir grup içindeki ortalama davranışları öngörme düzeyindedir.