Telegram üzerinden Fransa , Birleşik Krallık veya Singapur adreslerinden ücretsiz test hizmetinden yararlanabilirsiniz. Telegram'a katılın
Yapay Zeka Eğitim Verileri

Mobil Proxy Yapay Zeka Eğitim Verileri

Açık web, veri kümesi toplama konusunda giderek kapanıyor: Cloudflare artık yapay zeka tarayıcılarını varsayılan olarak engelliyor ve ücretsiz taramanın yerini ücretli erişim sunan platformlar alıyor. Bu kılavuz, bir proxy’nin neleri çözdüğünü ve neleri çözemediğini, ayrıca hangi coğrafi bölgelerde kapsama alanının hâlâ önemli olduğunu dürüstçe ele alıyor.

PXM2 Proxies August 24, 2026 Okuma süresi: 10 dakika
yüzde 50,6 AI bot trafiğinin bir kısmı eğitim amaçlıdır
2,5 milyon+ Yapay zeka eğitimine izin vermeyen siteler
402 Bir taramaya verilen yeni yanıt
7+ Seçilebilir ülkeler
  • Bildirilen tarayıcılar adlarına göre engellenir — IP adresini değiştirmek, dürüstçe bildirmiş olduğunuz bir kullanıcı aracısının engellemesini kaldırmaz; aksini iddia etmek ise aylarca zaman kaybına neden olur.
  • 2,5 milyondan fazla site bu uygulamadan vazgeçti — Ağustos 2025 itibarıyla yapay zeka eğitimine yönelik tam yasaklama bu kadar yaygın hale gelmişti ve bu eğilim devam etti.
  • Ücretli erişim artık gerçek bir kanal haline geldi — 402 Ödeme Gerekiyor hatası ve kullanım başına lisanslama, teklif aşamasından üretim aşamasına geçti.
  • Yerel kapsam, asıl vekil sorunudur — tek bir ülkeden derlenen bir metin külliyatı, o ülkeyle ilgili bir metin külliyatıdır.
4G / 5G Mobil Proxy'ler Bölgesel Metin Külliyatının Kapsamı
Çıkış türüGerçek taşıyıcı IP adresi
Oturum türüSabit veya dönen
Bant genişliğiSınırsız
DonanımÖzel 4G/5G modem
Yerel Dil

Pazarın içinden o dili konuşan birini bulun.

Mobil Yüzey

Yalnızca mobil web'de bulunan içeriğe erişin.

Yapay Zeka Eğitim Verileri Gereksinimleri

Başlangıçta açık sözlü olmakta fayda var, çünkü bu konuyla ilgili sayfaların çoğu öyle değil. Eğer beyan edilmiş bir AI tarayıcısı kullanıyorsanız, bir proxy, şu anda onu engelleyen kontrolleri aşmanıza yardımcı olmaz. Bu kontroller, tarayıcının geldiği adrese değil, yayınladığınız tarayıcı kimliğine odaklanır. Aynı tarayıcıyı beyan etmeye devam ederken çıkış IP adresini değiştirmek, reddedilmenin kaynağını tespit etmeyi ne kadar zorlaştıracağı dışında hiçbir şeyi değiştirmez.

Bir proxy’nin veri kümesi çalışmalarında meşru bir şekilde çözdüğü sorun coğrafyadır. İnternetin çok büyük bir kısmı bölgelere göre sunulur — yerel haberler, bölgesel kataloglar, pazara özgü belgeler, büyük yayınların ülke sürümleri — ve bunların büyük bir kısmı kendi pazarı dışında erişilemez, kısaltılmış veya farklı bir şekilde yazılmıştır. Tek bir ülkeden bir metin külliyatı toplamak, her konunun o ülke tarafından çerçevelenmiş halini aşırı derecede temsil eden bir külliyat ortaya çıkarır. Bu, her şeyden önce bir veri kalitesi sorunudur ve dağıtık toplama yönteminin aslında ele aldığı sorun da budur.

Gereklilik Bunun gerçek anlamı nedir? Vekil yardımcı olur mu?
Toplama izni Robotlar yönergeleri, site şartları ve giderek yaygınlaşan ücretli lisans Hayır. Bu, ağla ilgili bir sorun değil; politika ve sözleşmeyle ilgili bir konudur.
Yerel ayar ve dil desteği Yerel bir okuyucuya sunulan bölgesel baskıya ulaşmak Evet. Bu, temel örnek.
Mobil cihazlarda görüntülenen içerik Bazı pazarlarda yalnızca mobil web'de bulunan içerik Evet, uygun bir istemciyle eşleştirildiğinde
Menşe kayıtları Kaynak, zaman damgası, yürürlükteki yönerge, belirtilen lisans, pazar Dolaylı olarak — bu pazar alanını ancak kontrolünüz altındaysa kayıt altına alabilirsiniz

Tarayıcınızı dürüstçe beyan edin ve size verilen talimatlara uyun. Bu, savunulabilir tek tutum olmasının ötesinde, yayıncıların açıkça belirttiği isteklere aykırı olarak oluşturulan bir metin külliyatı, nasıl oluşturulduğu sorulduğu anda ticari açıdan kullanılamaz hale gelir — ve giderek daha sık olarak, bu soru sorulmaya başlanmaktadır.

Engellenenler, proxy'ler değil, adı belirtilen tarayıcılardır

Yayıncılar aslında adları belirli botlar yazmaktadır: GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot ve giderek uzayan diğer botlar; bunların her biri robots.txt dosyasında bağımsız olarak kontrol edilebilir. Bir site, genel taramaya izin verirken bu botların her birini adıyla engelleyebilir; bu, şu anda çoğu büyük haber ve forum sitesinin yaptığı şeydir. Bu listedeki hiçbir kontrol IP tabanlı değildir; bu nedenle, aynı beyan edilmiş kullanıcı aracısını farklı bir çıkış noktası üzerinden yönlendirmek, robots.txt dosyasındaki hangi satırın ona uygulanacağını değiştirmez. Çıkış IP’siyle birlikte değişen şey, tamamen ayrı bir istek sınıfıdır: genel bir istemcinin asla göremeyeceği bölgesel bir sürüme ulaşmak için yapılan, eğitim amaçlı bir tarayıcıdan ziyade bir tarayıcı olarak tanımlanan sıradan bir veri alma işlemi.

Büyük Ölçekte Veri Kümelerinin Çıkarılması

Veri kümesi toplamanın ekonomik yönleri 2025 ile 2026 yılları arasında önemli ölçüde değişti ve neyin değiştiğini anlamak, herhangi bir teknikten daha faydalıdır. Cloudflare, kararı tek tek sitelere bırakma uygulamasından vazgeçerek, varsayılan olarak yapay zeka tarayıcılarını engellemeye geçti ve her yeni etki alanına önceden yapay zeka tarayıcılarına izin verilip verilmediğini sordu. Eylül 2026’dan itibaren bu varsayılan ayar daha da genişletilerek, reklam içeren herhangi bir sayfada arama, ajan ve eğitim davranışlarını bir araya getiren karma kullanımlı tarayıcıları da kapsayacak.

Engellemenin yanı sıra bir ödeme kanalı da ortaya çıktı. Pay Per Crawl, bir isteğe 402 Payment Required yanıtını vererek yayıncıların bir ücret belirlemesine ve tarayıcıların ödeme yapıp yapmayacağına karar vermesine olanak tanıdı. Bu sistemin halefi ise tetikleme mekanizmasını değiştirdi: Yayıncılara, bir botun sayfayı alması anında değil, içeriklerinin bir yanıtta fiilen kullanıldığı anda ödeme yapılıyor. Her iki durumda da, "kamuya açık" ifadesinin içeriğin ücretsiz olarak alınabileceği anlamına geldiği varsayımı, artık altyapının işleyiş şekliyle uyuşmamaktadır.

Bu değişimin boyutu, trafikte açıkça görülüyor. Haziran 2026 itibarıyla, Cloudflare ağındaki AI bot trafiğinin %50,6’sını eğitim amaçlı tarayıcılar oluştururken, arama botlarının payı %10,7’ye düşmüştü; ayrıca, Ağustos 2025 gibi erken bir tarihte 2,5 milyondan fazla site, AI eğitimini tamamen engellemeyi tercih etmişti. Yayıncılar, yapay zeka taramasını arama trafiğindeki bir yuvarlama hatası olarak görmeyi bıraktı ve bunu ayrı bir unsur olarak fiyatlandırmaya başladı.

Her belgeye eklenecek menşe bilgisi
source_url        …
fetched_at        2026-08-24T09:14:02Z
robots_directive  …          # what was in force at fetch time, not today
stated_licence    …          # as published on the page
market            FR         # the exit country you fetched from
language          fr
content_hash      …          # for deduplication across markets
Bunların herhangi birini sonradan yeniden oluşturmak genellikle imkânsızdır. Özellikle “robots” yönergesi sürekli değişen bir hedeftir.

Veri Çeşitliliği ve Kalitesi

Eğitim külliyatındaki çeşitlilik genellikle bir adalet özelliği olarak ele alınır. Daha yalın bir ifadeyle, bu aynı zamanda bir doğruluk özelliğidir. Tamamen tek bir ülkeden toplanan materyallerle eğitilen bir model, ölçü birimlerinden tarih biçimlerine ve bir tartışmada hangi tarafın tarafsız kabul edildiğine kadar her konuda o ülkenin varsayılan ayarlarını devralır. Bunların hiçbiri kasıtlı değildir; sadece örneklemde ne varsa o yansıyan bir durumdur.

  • Sadece dili değil, yerel kültürü de deneyimleyin — Sadece İspanya’dan derlenen İspanyolca, İspanyolca değildir. Bölgesel basımlar, kelime dağarcığı, konu ve yayınlanan içerik açısından birbirinden farklılık gösterir.
  • Tekrarlanan verileri pazarlar arasında, pazarlar içinde değil, birleştirin — Aynı yayının ülkeye özgü sürümleri, metinlerinin büyük bir kısmını ortaklaşa kullanır. Tüm metin kümesinde içerik hash işlemi uygulanması, tek bir sendikasyon makalesinin kırk kez yer almasını engeller.
  • Piyasayı bir alan olarak kaydedin — Bu olmadan, kendi kapsama alanınızı ölçemez, portföyünüzü yeniden dengeleyemez ya da olaydan sonra temsil ile ilgili bir soruyu yanıtlayamazsınız.
  • Genel yedek seçeneğe dikkat edin — Bölge dışından bölgesel bir sürüm talep edildiğinde, genellikle uluslararası varsayılan sürüm sunulur. Bunun geniş ölçekte toplanması, içerik olmadan sadece kapsama alanı varmış gibi bir izlenim yaratır.
  • Derinlikten ziyade genişliği tercih edin — Zaten elinizde bulunan bir kaynaktan gelen bin belge daha, elinizde olmayan bir pazardan gelen ilk yüz belge kadar değer katmaz.

Toplama Sırasında Engelleri Önlemek

Sizin için erişilebilir olan koleksiyon için, izlenmesi gereken kurallar diğer büyük ölçekli tarama işlemleri ile aynıdır ve bu kurallar veri toplama kılavuzlarında ayrıntılı olarak ele alınmıştır. Her bir ana bilgisayar başına istek sıklığını, yayıncıya gerçek bir maliyet yüklemeyecek bir seviyede tutun. 429 hatasını bir engel olarak görmeyin; bunun yerine Retry-After kuralına uyun. Aşırı derecede önbellekleme yapın ve koşullu istekler kullanın; böylece yeniden taramanın kaynağa maliyeti neredeyse sıfır olur.

Unutulmaması gereken ayrım, “engelleme” ile “reddetme” arasındadır. Hız sınırlaması, hızı düşürme talebidir ve hızı düşürmek doğru tepkidir. Bir robots yönergesi veya lisanslama kapısı ise izinle ilgili bir karardır ve buradaki doğru tepki, bu karara saygı göstermek ya da erişim için müzakere etmektir — yanıt değişene kadar adresleri değiştirmek değildir. Bu ikisini birbirine karıştırmak, veri kümesi programlarının, oluşturuldukları modelin ömrünü aşan hukuki sorunlarla karşılaşmasına neden olur.

Büyük bir tarama işlemini nazik bir şekilde yürütmenin teknik ayrıntıları için bkz. web veri toplama konusunda en iyi uygulamalar, ve bir cevabı tepki vermeden önce doğru bir şekilde okumak için, yaygın bloklar ve bunların nasıl okunacağı.

Her bir yerel ayarı kendi içinden topla

Canlı PXM2 konumları — metin kümenizin temsil etmeyi amaçladığı her dil ve pazar için bir gözlem noktası ekleyin:

🇺🇸

Amerika Birleşik Devletleri

3 Operatör 20-150 Mbps
Şu tarihten itibaren
$4.35 1 saat boyunca
4G 5G
Kullanılabilir Operatörler:
T-Mobile Verizon AT&T
🇬🇧

Birleşik Krallık

2 Operatör 20-60 Mbps
Şu tarihten itibaren
$3.64 1 saat boyunca
4G
Kullanılabilir Operatörler:
O2 EE
🇫🇷

Fransa

3 Operatör 20-100 Mbps
Şu tarihten itibaren
$4.34 1 saat boyunca
4G
Kullanılabilir Operatörler:
Orange Bouygues SFR
Tüm konumları görüntüle →

Sık Sorulan Sorular

Bir proxy, AI tarayıcılarının engellemesini aşmamı sağlar mı?

Not if you are declaring an AI crawler, and you should be. Those controls key on the declared user agent and on published crawler identities, so changing the exit address does not change the outcome — it just makes the refusal harder to attribute. What a proxy legitimately solves is geography: reaching the regional and language-specific version of material that is open to ordinary visitors, which is a different problem and a real one.

Veri kümesi toplama konusunda aslında ne değişti?

Infrastructure-level defaults changed. Cloudflare began blocking AI crawlers by default rather than leaving it to each site, and from September 2026 the default extends to mixed-use crawlers on ad-bearing pages. Alongside that, paid access moved from theory to production: Pay Per Crawl answered a fetch with a 402 Payment Required, and its successor pays publishers when their content is actually used in an answer rather than when a bot reads the page.

Trafik açısından bu değişim ne kadar büyük?

Haziran 2026 itibarıyla, Cloudflare ağındaki yapay zeka bot trafiğinin yüzde 50,6’sını eğitim amaçlı tarayıcılar oluştururken, arama botlarının payı yüzde 10,7’ye gerilemişti. Bu tersine dönüş, yayıncıların yapay zeka taramasını arama trafiğindeki bir yuvarlama hatası olarak görmeyi bırakıp, buna ayrı bir fiyatlandırma uygulamaya başlamalarının nedenidir.

Bir veri kümesini sadece büyük olmaktan öte, savunulabilir kılan nedir?

Toplama anında kaydettiğiniz kaynak bilgisi. Kaynak URL’si, alma zaman damgası, veri alımı sırasında geçerli olan robots yönergesi, sayfada belirtilen lisans veya kullanım koşulları ve verinin alındığı platform. Bunları daha sonra yeniden oluşturmak genellikle imkânsızdır; kaynak bilgisi gösterilemeyen bir veri kümesi ise, ne kadar iyi olursa olsun ticari olarak kullanılması oldukça zordur.

Yerel çeşitlilik neden dağıtık veri toplama gerektirir?

Because a great deal of the web is served per region. Local news, regional catalogues, market-specific documentation and country editions of large sites are frequently unavailable, abridged or differently written outside their market. Collect everything from one country and your corpus over-represents that country’s framing of every subject — which is a quality problem long before it is an ethics one.

Veri kümesi çalışmaları, veri toplama yöntemlerini veri kazıma kümesinden, örnekleme mantığını ise pazar araştırmasından alır.

İş dünyasındaki kullanım örnekleri

Temel mobil proxy kılavuzları

İçinden Her Yerel Ayarı Topla

Sınırsız bant genişliği ve sınırsız rotasyona sahip özel 4G/5G modemler — veri kümenizin temsil etmesi amaçlanan dil ve içeriğe sahip pazarlardaki operatör IP’leri.

Mobil Proxy Alın