Google, yapay zeka modeli Gemini'yi eğitmek için milyonlarca kitap ve akademik makaleyi izinsiz kopyalamakla suçlanıyor. Hachette Book Group, Cengage Learning, Elsevier, yazar Scott Turow ve şirketi S.C.R.I.B.E., 10 Temmuz'da New York Güney Bölgesi ABD Bölge Mahkemesi'nde toplu dava açtı. Dava, Google'ın Google Books, Play Books ve Scholar hizmetleri aracılığıyla elde ettiği eserlerin yanı sıra internetten kazıdığı korsan siteler ve ücretli kütüphanelerden kopyaladığı içerikleri de kapsıyor. Davacılar, bu eserlerin belirli amaçlar için sağlandığını ve ticari bir yapay zeka modelini eğitmek için kullanılmasının bu amaçlar arasında olmadığını savunuyor.
Şikayette dört ayrı ihlal iddiası yer alıyor. Üçü, Google Books ve diğer Google hizmetleri, web kazıma indirmeleri ve eğitim sırasında kopyalama yoluyla Telif Hakkı Yasası kapsamında izinsiz çoğaltma yapıldığını öne sürüyor. Dördüncü iddia ise Google'ın Dijital Binyıl Telif Hakkı Yasası'nı (DMCA) ihlal ederek telif hakkı yönetim bilgilerini kaldırdığı yönünde. Davacılar, tazminat, ihtiyati tedbir, Gemini'nin eğitiminde kullanılan eserlerin detaylı bir dökümü ve izinsiz kopyaların silinmesi için mahkeme kararı talep ediyor.
Dava dosyasında, Google'ın dahili belgelerinden alıntılar yer alıyor. Bir belgede, Google Play Books'tan kitapların yapay zeka için kullanılmasının 'Google için son derece sorunlu' olduğu ve potansiyel para cezalarının '10 milyar dolar ile 100 milyar dolar arasında' olabileceği belirtiliyor. Başka bir alıntıda ise Gemini'nin baş mühendisinin meslektaşlarına 'zaten sahip olduğumuz veriler için anlaşma yapmayız' dediği aktarılıyor. Ancak bu belgeler kamuya açık değil ve alıntılar yalnızca davacıların dosyasına dayanıyor.
Google'ın robot.txt kontrolü olan Google-Extended, yalnızca web sitelerinden taranan içeriklerin Gemini eğitiminde kullanılmasını sınırlıyor. Ancak davaya konu olan kitaplar doğrudan anlaşmalar yoluyla Google'a sağlandığı için robot.txt bu süreci etkilemiyor. Web kazıma iddiaları ise korsan siteler ve abonelik kütüphanelerinde barındırılan kopyaların Common Crawl'da görünmesiyle ilgili; bu kopyalar farklı alan adlarında olduğu için robot.txt ile düzenlenemiyor.
Google, 25 Haziran'da yayımladığı bir politika belgesinde, kamuya açık web verileriyle eğitimin adil kullanım kapsamında 'dönüştürücü, ifade edici olmayan bir kullanım' olduğunu savundu. Belgede ayrıca web sitelerinin Google-Extended gibi makine tarafından okunabilir kontrollerle devre dışı kalabileceği belirtiliyor. Ancak davaya konu materyalin farklı kanallardan geldiği iddia ediliyor. Geçen ay Digital Content Next, Common Crawl Vakfı'na bir ihtarname göndererek telif hakkı yasasının bir devre dışı bırakma sistemi olarak işlemediğini belirtti.
Bu dava, izin ve adil kullanım sorularını gündeme getiriyor. Adil kullanım, kullanımı yetkilendiren bir anlaşma olmasa bile uygulanabilir ve dava bu iki konuyu da çözüme kavuşturmuyor. Ocak ayında BuzzStream verileri, en iyi haber sitelerinin %79'unun en az bir yapay zeka eğitim botunu engellediğini gösteriyor; bu, Google-Extended'ın ele aldığı kanal. Ancak bu davada incelenen kopyaların bu ayarlardan etkilenmeyen yollardan geldiği iddia ediliyor.
Önümüzdeki dönemde, 2025'te Kuzey Kaliforniya'da verilen iki karar, eğitim kullanımlarını adil buldu. Anthropic davasında mahkeme, korsan kütüphane kopyaları için özet kararı reddederken, Meta davasında yargıç kararının yalnızca o davacılara ve kayıtlara özgü olduğunu vurguladı. Yayıncılar, başlangıçta Kaliforniya'daki In re Google Generative AI Copyright Litigation davasına müdahale etmeyi planladıklarını ancak New York'ta dava açtıklarını ve bu yeni davanın, önerilen sınıfın dışında kaldığına inandıkları iddiaları koruduğunu belirtti. Bir sonraki adım, Google'ın yanıtı veya davanın reddi talebi olacak.
Kaynak: searchenginejournal.com