Mobil Proxy Yapay Zeka Eğitim Verileri
Açık web, veri kümesi toplama konusunda giderek kapanıyor: Cloudflare artık yapay zeka tarayıcılarını varsayılan olarak engelliyor ve ücretsiz taramanın yerini ücretli erişim sunan platformlar alıyor. Bu kılavuz, bir proxy’nin neleri çözdüğünü ve neleri çözemediğini, ayrıca hangi coğrafi bölgelerde kapsama alanının hâlâ önemli olduğunu dürüstçe ele alıyor.
- Bildirilen tarayıcılar adlarına göre engellenir — IP adresini değiştirmek, dürüstçe bildirmiş olduğunuz bir kullanıcı aracısının engellemesini kaldırmaz; aksini iddia etmek ise aylarca zaman kaybına neden olur.
- 2,5 milyondan fazla site bu uygulamadan vazgeçti — Ağustos 2025 itibarıyla yapay zeka eğitimine yönelik tam yasaklama bu kadar yaygın hale gelmişti ve bu eğilim devam etti.
- Ücretli erişim artık gerçek bir kanal haline geldi — 402 Ödeme Gerekiyor hatası ve kullanım başına lisanslama, teklif aşamasından üretim aşamasına geçti.
- Yerel kapsam, asıl vekil sorunudur — tek bir ülkeden derlenen bir metin külliyatı, o ülkeyle ilgili bir metin külliyatıdır.
Pazarın içinden o dili konuşan birini bulun.
Yalnızca mobil web'de bulunan içeriğe erişin.
Yapay Zeka Eğitim Verileri Gereksinimleri
Başlangıçta açık sözlü olmakta fayda var, çünkü bu konuyla ilgili sayfaların çoğu öyle değil. Eğer beyan edilmiş bir AI tarayıcısı kullanıyorsanız, bir proxy, şu anda onu engelleyen kontrolleri aşmanıza yardımcı olmaz. Bu kontroller, tarayıcının geldiği adrese değil, yayınladığınız tarayıcı kimliğine odaklanır. Aynı tarayıcıyı beyan etmeye devam ederken çıkış IP adresini değiştirmek, reddedilmenin kaynağını tespit etmeyi ne kadar zorlaştıracağı dışında hiçbir şeyi değiştirmez.
Bir proxy’nin veri kümesi çalışmalarında meşru bir şekilde çözdüğü sorun coğrafyadır. İnternetin çok büyük bir kısmı bölgelere göre sunulur — yerel haberler, bölgesel kataloglar, pazara özgü belgeler, büyük yayınların ülke sürümleri — ve bunların büyük bir kısmı kendi pazarı dışında erişilemez, kısaltılmış veya farklı bir şekilde yazılmıştır. Tek bir ülkeden bir metin külliyatı toplamak, her konunun o ülke tarafından çerçevelenmiş halini aşırı derecede temsil eden bir külliyat ortaya çıkarır. Bu, her şeyden önce bir veri kalitesi sorunudur ve dağıtık toplama yönteminin aslında ele aldığı sorun da budur.
| Gereklilik | Bunun gerçek anlamı nedir? | Vekil yardımcı olur mu? |
|---|---|---|
| Toplama izni | Robotlar yönergeleri, site şartları ve giderek yaygınlaşan ücretli lisans | Hayır. Bu, ağla ilgili bir sorun değil; politika ve sözleşmeyle ilgili bir konudur. |
| Yerel ayar ve dil desteği | Yerel bir okuyucuya sunulan bölgesel baskıya ulaşmak | Evet. Bu, temel örnek. |
| Mobil cihazlarda görüntülenen içerik | Bazı pazarlarda yalnızca mobil web'de bulunan içerik | Evet, uygun bir istemciyle eşleştirildiğinde |
| Menşe kayıtları | Kaynak, zaman damgası, yürürlükteki yönerge, belirtilen lisans, pazar | Dolaylı olarak — bu pazar alanını ancak kontrolünüz altındaysa kayıt altına alabilirsiniz |
Tarayıcınızı dürüstçe beyan edin ve size verilen talimatlara uyun. Bu, savunulabilir tek tutum olmasının ötesinde, yayıncıların açıkça belirttiği isteklere aykırı olarak oluşturulan bir metin külliyatı, nasıl oluşturulduğu sorulduğu anda ticari açıdan kullanılamaz hale gelir — ve giderek daha sık olarak, bu soru sorulmaya başlanmaktadır.
Engellenenler, proxy'ler değil, adı belirtilen tarayıcılardır
Yayıncılar aslında adları belirli botlar yazmaktadır: GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot ve giderek uzayan diğer botlar; bunların her biri robots.txt dosyasında bağımsız olarak kontrol edilebilir. Bir site, genel taramaya izin verirken bu botların her birini adıyla engelleyebilir; bu, şu anda çoğu büyük haber ve forum sitesinin yaptığı şeydir. Bu listedeki hiçbir kontrol IP tabanlı değildir; bu nedenle, aynı beyan edilmiş kullanıcı aracısını farklı bir çıkış noktası üzerinden yönlendirmek, robots.txt dosyasındaki hangi satırın ona uygulanacağını değiştirmez. Çıkış IP’siyle birlikte değişen şey, tamamen ayrı bir istek sınıfıdır: genel bir istemcinin asla göremeyeceği bölgesel bir sürüme ulaşmak için yapılan, eğitim amaçlı bir tarayıcıdan ziyade bir tarayıcı olarak tanımlanan sıradan bir veri alma işlemi.
Büyük Ölçekte Veri Kümelerinin Çıkarılması
Veri kümesi toplamanın ekonomik yönleri 2025 ile 2026 yılları arasında önemli ölçüde değişti ve neyin değiştiğini anlamak, herhangi bir teknikten daha faydalıdır. Cloudflare, kararı tek tek sitelere bırakma uygulamasından vazgeçerek, varsayılan olarak yapay zeka tarayıcılarını engellemeye geçti ve her yeni etki alanına önceden yapay zeka tarayıcılarına izin verilip verilmediğini sordu. Eylül 2026’dan itibaren bu varsayılan ayar daha da genişletilerek, reklam içeren herhangi bir sayfada arama, ajan ve eğitim davranışlarını bir araya getiren karma kullanımlı tarayıcıları da kapsayacak.
Engellemenin yanı sıra bir ödeme kanalı da ortaya çıktı. Pay Per Crawl, bir isteğe 402 Payment Required yanıtını vererek yayıncıların bir ücret belirlemesine ve tarayıcıların ödeme yapıp yapmayacağına karar vermesine olanak tanıdı. Bu sistemin halefi ise tetikleme mekanizmasını değiştirdi: Yayıncılara, bir botun sayfayı alması anında değil, içeriklerinin bir yanıtta fiilen kullanıldığı anda ödeme yapılıyor. Her iki durumda da, "kamuya açık" ifadesinin içeriğin ücretsiz olarak alınabileceği anlamına geldiği varsayımı, artık altyapının işleyiş şekliyle uyuşmamaktadır.
Bu değişimin boyutu, trafikte açıkça görülüyor. Haziran 2026 itibarıyla, Cloudflare ağındaki AI bot trafiğinin %50,6’sını eğitim amaçlı tarayıcılar oluştururken, arama botlarının payı %10,7’ye düşmüştü; ayrıca, Ağustos 2025 gibi erken bir tarihte 2,5 milyondan fazla site, AI eğitimini tamamen engellemeyi tercih etmişti. Yayıncılar, yapay zeka taramasını arama trafiğindeki bir yuvarlama hatası olarak görmeyi bıraktı ve bunu ayrı bir unsur olarak fiyatlandırmaya başladı.
source_url … fetched_at 2026-08-24T09:14:02Z robots_directive … # what was in force at fetch time, not today stated_licence … # as published on the page market FR # the exit country you fetched from language fr content_hash … # for deduplication across markets
Veri Çeşitliliği ve Kalitesi
Eğitim külliyatındaki çeşitlilik genellikle bir adalet özelliği olarak ele alınır. Daha yalın bir ifadeyle, bu aynı zamanda bir doğruluk özelliğidir. Tamamen tek bir ülkeden toplanan materyallerle eğitilen bir model, ölçü birimlerinden tarih biçimlerine ve bir tartışmada hangi tarafın tarafsız kabul edildiğine kadar her konuda o ülkenin varsayılan ayarlarını devralır. Bunların hiçbiri kasıtlı değildir; sadece örneklemde ne varsa o yansıyan bir durumdur.
- Sadece dili değil, yerel kültürü de deneyimleyin — Sadece İspanya’dan derlenen İspanyolca, İspanyolca değildir. Bölgesel basımlar, kelime dağarcığı, konu ve yayınlanan içerik açısından birbirinden farklılık gösterir.
- Tekrarlanan verileri pazarlar arasında, pazarlar içinde değil, birleştirin — Aynı yayının ülkeye özgü sürümleri, metinlerinin büyük bir kısmını ortaklaşa kullanır. Tüm metin kümesinde içerik hash işlemi uygulanması, tek bir sendikasyon makalesinin kırk kez yer almasını engeller.
- Piyasayı bir alan olarak kaydedin — Bu olmadan, kendi kapsama alanınızı ölçemez, portföyünüzü yeniden dengeleyemez ya da olaydan sonra temsil ile ilgili bir soruyu yanıtlayamazsınız.
- Genel yedek seçeneğe dikkat edin — Bölge dışından bölgesel bir sürüm talep edildiğinde, genellikle uluslararası varsayılan sürüm sunulur. Bunun geniş ölçekte toplanması, içerik olmadan sadece kapsama alanı varmış gibi bir izlenim yaratır.
- Derinlikten ziyade genişliği tercih edin — Zaten elinizde bulunan bir kaynaktan gelen bin belge daha, elinizde olmayan bir pazardan gelen ilk yüz belge kadar değer katmaz.
Toplama Sırasında Engelleri Önlemek
Sizin için erişilebilir olan koleksiyon için, izlenmesi gereken kurallar diğer büyük ölçekli tarama işlemleri ile aynıdır ve bu kurallar veri toplama kılavuzlarında ayrıntılı olarak ele alınmıştır. Her bir ana bilgisayar başına istek sıklığını, yayıncıya gerçek bir maliyet yüklemeyecek bir seviyede tutun. 429 hatasını bir engel olarak görmeyin; bunun yerine Retry-After kuralına uyun. Aşırı derecede önbellekleme yapın ve koşullu istekler kullanın; böylece yeniden taramanın kaynağa maliyeti neredeyse sıfır olur.
Unutulmaması gereken ayrım, “engelleme” ile “reddetme” arasındadır. Hız sınırlaması, hızı düşürme talebidir ve hızı düşürmek doğru tepkidir. Bir robots yönergesi veya lisanslama kapısı ise izinle ilgili bir karardır ve buradaki doğru tepki, bu karara saygı göstermek ya da erişim için müzakere etmektir — yanıt değişene kadar adresleri değiştirmek değildir. Bu ikisini birbirine karıştırmak, veri kümesi programlarının, oluşturuldukları modelin ömrünü aşan hukuki sorunlarla karşılaşmasına neden olur.
Büyük bir tarama işlemini nazik bir şekilde yürütmenin teknik ayrıntıları için bkz. web veri toplama konusunda en iyi uygulamalar, ve bir cevabı tepki vermeden önce doğru bir şekilde okumak için, yaygın bloklar ve bunların nasıl okunacağı.
Her bir yerel ayarı kendi içinden topla
Canlı PXM2 konumları — metin kümenizin temsil etmeyi amaçladığı her dil ve pazar için bir gözlem noktası ekleyin:
Amerika Birleşik Devletleri
Birleşik Krallık
Fransa
Sık Sorulan Sorular
Bir proxy, AI tarayıcılarının engellemesini aşmamı sağlar mı?
Not if you are declaring an AI crawler, and you should be. Those controls key on the declared user agent and on published crawler identities, so changing the exit address does not change the outcome — it just makes the refusal harder to attribute. What a proxy legitimately solves is geography: reaching the regional and language-specific version of material that is open to ordinary visitors, which is a different problem and a real one.
Veri kümesi toplama konusunda aslında ne değişti?
Infrastructure-level defaults changed. Cloudflare began blocking AI crawlers by default rather than leaving it to each site, and from September 2026 the default extends to mixed-use crawlers on ad-bearing pages. Alongside that, paid access moved from theory to production: Pay Per Crawl answered a fetch with a 402 Payment Required, and its successor pays publishers when their content is actually used in an answer rather than when a bot reads the page.
Trafik açısından bu değişim ne kadar büyük?
Haziran 2026 itibarıyla, Cloudflare ağındaki yapay zeka bot trafiğinin yüzde 50,6’sını eğitim amaçlı tarayıcılar oluştururken, arama botlarının payı yüzde 10,7’ye gerilemişti. Bu tersine dönüş, yayıncıların yapay zeka taramasını arama trafiğindeki bir yuvarlama hatası olarak görmeyi bırakıp, buna ayrı bir fiyatlandırma uygulamaya başlamalarının nedenidir.
Bir veri kümesini sadece büyük olmaktan öte, savunulabilir kılan nedir?
Toplama anında kaydettiğiniz kaynak bilgisi. Kaynak URL’si, alma zaman damgası, veri alımı sırasında geçerli olan robots yönergesi, sayfada belirtilen lisans veya kullanım koşulları ve verinin alındığı platform. Bunları daha sonra yeniden oluşturmak genellikle imkânsızdır; kaynak bilgisi gösterilemeyen bir veri kümesi ise, ne kadar iyi olursa olsun ticari olarak kullanılması oldukça zordur.
Yerel çeşitlilik neden dağıtık veri toplama gerektirir?
Because a great deal of the web is served per region. Local news, regional catalogues, market-specific documentation and country editions of large sites are frequently unavailable, abridged or differently written outside their market. Collect everything from one country and your corpus over-represents that country’s framing of every subject — which is a quality problem long before it is an ethics one.
İlgili Mobil Proxy Kılavuzları
Veri kümesi çalışmaları, veri toplama yöntemlerini veri kazıma kümesinden, örnekleme mantığını ise pazar araştırmasından alır.
İş dünyasındaki kullanım örnekleri
Temel mobil proxy kılavuzları
İçinden Her Yerel Ayarı Topla
Sınırsız bant genişliği ve sınırsız rotasyona sahip özel 4G/5G modemler — veri kümenizin temsil etmesi amaçlanan dil ve içeriğe sahip pazarlardaki operatör IP’leri.
Mobil Proxy Alın