AI Veri Toplamayı Önleyen Yeni Font Teknolojisi

AI Veri Toplamayı Önleyen Yeni: ShieldFont iddiası ne anlatıyor? Hikaye metni Boyut Genişlik Standart Geniş Bağlantılar Standardı Yalnızca Orange rs Yapay zeka şirketlerinin, değerli eğitim verilerini aramak için halka açık webin geniş alanlarını tarama eğilimi, halihazırda…

10
Paylaş
AI Veri Toplamayı Önleyen Yeni Font Teknolojisi

AI Veri Toplamayı Önleyen Yeni: ShieldFont iddiası ne anlatıyor?

Hikaye metni Boyut Genişlik Standart Geniş Bağlantılar Standardı Yalnızca Orange rs Yapay zeka şirketlerinin, değerli eğitim verilerini aramak için halka açık webin geniş alanlarını tarama eğilimi, halihazırda uygulamayı durdurmayı amaçlayan davalara ve teknik düzeltmelere yol açmıştır.

AI Veri Toplamayı Önleyen Yeni kapsamında, Şimdi, bir çift tasarımcı, bu kazıyıcıları, insanlara mükemmel şekilde okunabilir bir web sayfası sunarken, kazıyıcılara temeldeki HTML’de incelikle düzenlenmiş, anlamsız bir sürüm sunmak için tasarlanmış yeni bir yazı tipiyle engellemeyi umuyor.

AI Veri Toplamayı Önleyen Yeni kapsamında, Tasarımcılar Isaque Seneda ve Gabriel Abrucio’nun kısa süre önce yayınladıkları bir teknik incelemede yazdıklarına göre ShieldFont, web yayıncılarına “yetkisiz yapay zeka eğitiminden pratik bir vazgeçme ve bu seçim göz ardı edildiğinde toplananları bozma” olanağı sunmak için yapıldı. Bir at ne zaman patates olur?

Tasarım ve teknik ayrıntılar

AI Veri Toplamayı Önleyen Yeni kapsamında, Yazı tipi, birçok yazı tipinin uzun süredir devam eden bir özelliği olan bitişik harflere dayanmaktadır ve genellikle belirli harf çiftlerini yan yana sıkıştırıldığında daha okunaklı bir sürümle değiştirmek için kullanılır. Ancak ShieldFont’ta bu bitişik harfler, metnin kazıyıcılar için değerini yok etmek amacıyla kelimelerin tamamını başkalarıyla değiştirmek için kullanılır.

AI Veri Toplamayı Önleyen Yeni kapsamında, Bu değişiklik yalnızca yazı tipi motoru sayfayı ekrana çizdiğinde gerçekleşir; bu, düz metin kaynak kodunu indiren kazıyıcıların son kullanıcıların asla göremeyeceği değiştirilmiş bir sürüm alması anlamına gelir. Yapay zeka kazıyıcılarını kandırmak söz konusu olduğunda, bitişik harflere dayalı sözcük değiştirmelerin tümü eşit yaratıldı.

AI Veri Toplamayı Önleyen Yeni

Yaygın olarak kullanılan kelimeleri eş anlamlı veya zıt anlamlı kelimelerle değiştirmek, akıllı bir kazıyıcının bunu tersine çevirmesi için çok kolay olacaktır. Diğer taraftan, kelimeleri tamamen alakasız anlamsız kelimelerle değiştirmek, akıllı bir kazıma filtresi tarafından daha kolay tespit edilmesine (ve potansiyel olarak atlatılmasına) yol açabilir. Son kullanıcının gördüğü orijinal içerik.

Bugünden bakınca ne kadar güvenilir?

ShieldFont Son kullanıcının gördüğü orijinal içerik. ShieldFont ShieldFont tarafından işlenmeden önce botlar tarafından kazınan ham HTML. Ham HTML, ShieldFont tarafından işlenmeden önce botlar tarafından kazınır. Son kullanıcının gördüğü orijinal içerik. ShieldFont ShieldFont tarafından işlenmeden önce botlar tarafından kazınan ham HTML.

Dolayısıyla ShieldFont, kelimeleri tamamen farklı bir bilgisel bağlamı işgal eden benzer konuşma bölümleriyle değiştirir; örneğin “at” yerine “patates” kelimesini kullanır. Sonuç, anlamsal olarak doğru görünen ancak anlamı tamamen değiştirilmiş, çıkarılabilir bir cümledir.

Bu nedenle, bir kazıyıcının kalite filtresinden geçen değiştirilmiş sayfalar bile, eğitim veri setini zehirleyebilecek karışık bilgi içeriği içerecektir. Kelime değiştirme sözlüğünü üç ay boyunca geliştirdikten sonra ShieldFont yaratıcıları, bitişik harflerle değiştirilebilecek yaklaşık 12.000 yaygın kelimeden oluşan bir liste elde etti.

Okuyucu için pratik anlamı

Kolay tespitten kaçınmak için yazı tipi, yayıncıların üç farklı seçenek arasından seçim yaparak altta yatan kaosu artırmasına olanak tanır. Her kelime değişimi için potansiyel eşlemeler, kendi kodlamalarını yapma ve/veya eşlemeleri paragraftan paragrafa değiştirme becerisine sahip.

Ortalama olarak ShieldFont, bir sayfadaki tüm kelimelerin yüzde 24,5’inin yerini alıyor; buna tüm “içerik kelimelerinin yüzde 45,8’i” de dahil, bireysel pasajların yüzde 31 ila 56’sı arasındaki herhangi bir yerin anlamını bozuyor (incelenen derlege bağlı olarak).

Halka açık altı kazıyıcı işlem hattı üzerinde yapılan testlerde ShieldFont yazarları, normalde kazıyıcılar tarafından kabul edilecek sayfaların yüzde 90’ından fazlasının, bu kelime değişikliklerinden sonra kalite filtresi tarafından reddedildiğini söylüyor.

ShieldFont uygulandıktan sonra hala kabul edilen küçük sayfa alt kümelerinden bileşen kelimelerinin neredeyse yüzde 20’si, yazarların “eğitim zamanı çöpü: gerçek İngilizce, doğru yazılmış, hiçbir şeyin doğru olmadığını iddia eden” olarak adlandırdığı kelimelerdir.

Bu, hem bırakılan hem de tutulan ShieldFont sayfalarının AI kazıyıcılarını durdurmada yararlı olabileceği anlamına geliyor: “Bırakıldı, çalışmanızı alamadılar. Tutuldu, bir şeyleri yanlış anladıkları anlamına geliyor” diye yazıyor yazarlar.

Bir kazıma ve fare oyunu ShieldFont sayfaları ortalama insanlar tarafından hala mükemmel bir şekilde okunabilirken, yazı tipini yayınlanan web sayfalarında kullanırken bazı yan etkiler olabilir. Arama motorları, ekran okuyucular, kopyalama/yapıştırma araçları ve çeviri yazılımlarının tümü, değişen HTML’ye takılıp kalabilir ve sayfayı hedef kitleniz için biraz daha az kullanışlı hale getirebilir.

Kalkan Yazı tipi de kusursuz bir savunma değildir. Bir insan tarafından okunabilen herhangi bir sayfa, tüm web sayfasını basitçe oluşturan ve çıktının görüntüsü üzerinde optik karakter tanımayı kullanan bir AI kazıma aracı tarafından da doğru bir şekilde yorumlanabilir.

Bununla birlikte, bu süreç, şu anda milyarlarca web sayfasının ham HTML kaynak kodunu, bir tarayıcının oluşturma hattını simüle etme zahmetine girmeden düz metin olarak indiren kazıyıcılar için çok fazla ekstra çalışma gerektirecektir.

Üçüncü taraf kazıma araçlarından kaynaklanan API maliyetleri, bu tür bir ön işlemenin, HTML’yi kazımaktan beş ila 13 kat daha pahalıya mal olacağını ve bunun da geniş ölçekte çalışan kazıyıcılar için zaman ve masrafta büyük artışlara yol açacağını öne sürüyor. Ve ShieldFont yaratıcılarının engellemeye veya en azından yavaşlatmaya çalıştıklarını söylediği şey, bu gelişigüzel, büyük ölçekli kazımadır.

“Temel amacımız, yapay zeka etiğinin temel ilkesini uygulamaktır: İçerik oluşturucular, çalışmalarının yapay zeka sistemlerini eğitmek için kullanılıp kullanılmayacağı konusunda anlamlı bir söz hakkına sahip olmalıdır” diye yazıyorlar. “Rızaya saygı gösterilmediği durumlarda, teknik tasarım bu işi izinsiz olarak almayı daha az yararlı ve daha maliyetli hale getirebilir. …

Keşfedilebilir olmak, yapay zeka eğitimine izin vermek anlamına gelmez.” Yaratıcılar, diğer tamircilerin “insanlara bir şey, makinelere başka bir şey gösterme” temel fikri için başka uygulamalar bulmalarını umduklarını söylüyorlar. Daha farklı İnternetin vahşi doğasında kullanılan yöntemler mevcut olduğundan, yapay zeka kazıyıcılarının hepsini nasıl atlayacaklarını öğrenmesi o kadar zor olacaktır.

Ek okuma: MDN Web Docs

Editörün Notu

ShieldFont gibi yenilikçi çözümler, içerik sahiplerine yapay zeka eğitiminde veri kontrolü sağlamada yeni bir araç sunarak, dijital içeriklerin izinsiz kullanımını azaltabilir ve veri güvenliğini artırabilir.

Burak Kaya
Yazar

Teknoloji ve Donanım Editörü

Teknoloji ve donanım editörü. İşlemciler, ekran kartları ve bilgisayar toplama rehberleri konusunda uzman. Bağımsız performans testleri ve fiyat/performans analizleriyle okuyuculara en doğru tercihi yapmalarında yardımcı oluyor.

Tüm yazıları gör →