Данные для обучения ИИ с использованием мобильных прокси-серверов
Открытый Интернет становится всё менее доступным для сбора наборов данных: Cloudflare теперь по умолчанию блокирует ИИ-краулеры, а платные платформы заменяют бесплатный сканирование. В этом руководстве честно рассказывается о том, какие проблемы решает прокси, а какие — нет, а также о том, в каких случаях покрытие по регионам по-прежнему имеет значение.
- Зарегистрированные роботы-пауки блокируются по имени — смена IP-адреса не снимает блокировку с пользовательского агента, который вы честно зарегистрировали, а попытки обойти это приведут к потере нескольких месяцев.
- Более 2,5 миллиона сайтов отказались от участия — к августу 2025 года полный отказ от использования данных для обучения ИИ уже получил столь широкое распространение, и эта тенденция сохраняется.
- Платный доступ теперь стал полноценным каналом — статус «402 Payment Required» и лицензирование с оплатой за каждое использование перешли из стадии предложения в стадию внедрения.
- Проблема охвата локалей — это настоящая проблема прокси — корпус, собранный в одной стране, представляет собой корпус, посвящённый одной стране.
Найдите на рынке человека, который говорит на этом языке.
Получите доступ к контенту, доступному только в мобильной версии сайта.
Требования к данным для обучения ИИ
С самого начала стоит высказаться прямо, ведь большинство страниц, посвящённых этой теме, этого не делают. Если вы используете заявленный ИИ-краулер, прокси не поможет вам обойти меры контроля, которые сейчас его блокируют. Эти меры ориентируются на идентификатор краулера, который вы публикуете, а не на адрес, с которого он заходит. Смена выходного IP-адреса при одновременном использовании того же заявленного краулера ничего не меняет, кроме того, насколько сложно будет установить, кому принадлежит отказ.
Прокси-серверы действительно решают проблему географии при работе с наборами данных. Очень большая часть веб-контента ориентирована на конкретные регионы — местные новости, региональные каталоги, документация для конкретных рынков, страновые версии крупных изданий — и значительная часть этого контента недоступна, сокращена или написана иначе за пределами своего рынка. Сбор корпуса из одной страны приводит к тому, что в нём чрезмерно преобладает то, как в этой стране трактуется каждая тема. Это, прежде всего, проблема качества данных, и именно эту проблему и решает распределённый сбор данных.
| Требование | Что это на самом деле означает | Помогает ли прокси? |
|---|---|---|
| Разрешение на сбор | Директивы по роботам, условия использования сайта и, все чаще, платная лицензия | Нет. Это вопрос, касающийся политики и договора, а не сети. |
| Поддержка локалей и языков | Доступ к региональному выпуску, который предоставляется местному читателю | Да. Это типичный случай. |
| Контент для мобильных устройств и настольных компьютеров | Материалы, доступные только в мобильной версии сайта на некоторых рынках | Да, в сочетании с соответствующим клиентом |
| Сведения о происхождении | Источник, временная метка, действующая директива, указанная лицензия, рынок | Косвенно — рыночную сферу можно учесть только в том случае, если вы контролировали её |
Честно задекларируйте свой краулер и соблюдайте полученные указания. Помимо того, что это единственная оправданная позиция, корпус, собранный вопреки заявленным пожеланиям издателей, становится коммерчески непригодным в тот момент, когда кто-нибудь спросит, как он был создан — а такие вопросы задают всё чаще.
Массовый сбор данных
В период с 2025 по 2026 год экономика сбора наборов данных существенно изменилась, и понимание сути этих изменений гораздо полезнее, чем какие-либо технические приёмы. Cloudflare перешла от практики, при которой решение оставлялось за отдельными сайтами, к блокировке ИИ-краулеров по умолчанию, заранее запрашивая у каждого нового домена, разрешены ли ИИ-краулеры. С сентября 2026 года это правило по умолчанию будет расширено и будет распространяться на краулеры смешанного назначения — те, которые сочетают в себе функции поиска, агента и обучения — на любой странице, содержащей рекламу.
Наряду с блокировкой появился канал оплаты. Сервис Pay Per Crawl отвечал на запрос кодом 402 «Требуется оплата», позволяя издателям устанавливать тариф, а сканерам — решать, платить ли. Его преемник изменил механизм срабатывания: издатели получают оплату, когда их контент фактически используется в ответе, а не тогда, когда бот загружает страницу. В любом случае, предположение о том, что «публичный» означает «бесплатный для использования», больше не соответствует тому, как работает инфраструктура.
Масштаб этих изменений прослеживается по трафику. К июню 2026 года обучающие краулеры составляли 50,6% трафика ИИ-ботов в сети Cloudflare, в то время как доля поисковых ботов сократилась до 10,7%, а уже в августе 2025 года более 2,5 миллиона сайтов приняли решение полностью запретить обучение ИИ. Издатели перестали рассматривать сканирование с помощью ИИ как незначительную погрешность в своём поисковом трафике и начали оценивать его как отдельный вид трафика.
source_url … fetched_at 2026-08-24T09:14:02Z robots_directive … # what was in force at fetch time, not today stated_licence … # as published on the page market FR # the exit country you fetched from language fr content_hash … # for deduplication across markets
Разнообразие и качество данных
Разнообразие в обучающем корпусе обычно рассматривается как признак справедливости. В то же время, если говорить проще, это также признак точности. Модель, обученная на материалах, собранных исключительно в одной стране, наследует стандартные настройки этой страны по всем параметрам — от единиц измерения и форматов дат до того, какая сторона в споре считается нейтральной. Ничего из этого не делается намеренно; это просто то, что содержалась в выборке.
- Познакомьтесь с местным колоритом, а не только с языком — Испанский язык, зафиксированный исключительно на территории Испании, не является испанским языком. Региональные варианты отличаются лексикой, тематикой и тем, что вообще публикуется.
- Удаляйте дубликаты между рынками, а не внутри них — В национальных версиях одного и того же издания значительная часть текста повторяется. Использование хэширования контента по всему корпусу текстов позволяет избежать ситуации, когда одна и та же статья появляется сорок раз.
- Запишите «рынок» в поле — Без него невозможно оценить степень охвата, перебалансировать портфель или ответить на вопрос о представительности задним числом.
- Обратите внимание на общий вариант по умолчанию — При запросе региональной версии из-за пределов данного региона часто возвращается международная версия по умолчанию. Сбор таких данных в больших объемах создает видимость охвата без реального содержания.
- Лучше широта, чем глубина — Еще тысяча документов из источника, который у вас уже есть, принесёт гораздо меньшую пользу, чем первая сотня из источника, которого у вас пока нет.
Как избежать блокировок при сборе данных
Что касается доступной вам коллекции, правила здесь такие же, как и при любом другом масштабном сканировании, и они подробно описаны в руководствах по скрапингу. Соблюдайте частоту запросов на каждый хост на уровне, который не налагает реальных затрат на издателя. Учитывайте параметр Retry-After, а не рассматривайте код ошибки 429 как препятствие, которое нужно обойти. Активно используйте кэширование и условные запросы, чтобы повторный скаутинг практически ничего не стоил исходному ресурсу.
Стоит помнить о различии между блокировкой и отказом. Ограничение скорости — это просьба снизить скорость, и снижение скорости является правильной реакцией. Директива для роботов или контроль доступа — это решение о разрешении, и правильная реакция в этом случае заключается в том, чтобы уважать его или договориться о доступе, а не менять адреса до тех пор, пока ответ не изменится. Смешивание этих двух понятий приводит к тому, что программы, работающие с наборами данных, сталкиваются с юридическими проблемами, которые выходят за рамки модели, для которой они были созданы.
О том, как вежливо организовать масштабный краул, см. рекомендации по веб-парсингу, а также за то, что вы внимательно прочитали ответ, прежде чем отреагировать на него, общие блоки и как их читать.
Извлечь каждую локаль изнутри неё
Места съемки Live PXM2 — добавьте точку съемки для каждого языка и рынка, которые должен представлять ваш корпус:
Великобритания
Испания
Индия
Часто задаваемые вопросы
Поможет ли прокси обойти блокировку со стороны ИИ-краулеров?
Нет, если вы заявляете о использовании ИИ-краулера, а вам следует это сделать. Эти меры контроля основаны на заявленном пользовательском агенте и на опубликованных идентификаторах краулера, поэтому изменение адреса выхода не влияет на результат — это лишь затрудняет установление авторства отказа. Прокси-сервер законно решает проблему географического доступа: обеспечение доступа к региональным и языковым версиям материалов, открытым для обычных посетителей, что является отдельной и вполне реальной проблемой.
Что именно изменилось в процессе сбора наборов данных?
Изменились настройки по умолчанию на уровне инфраструктуры. Cloudflare начала по умолчанию блокировать ИИ-краулеры, а не оставлять это на усмотрение каждого сайта, а с сентября 2026 года эта настройка по умолчанию распространяется на краулеры смешанного назначения на страницах, содержащих рекламу. Наряду с этим платный доступ перешел из теории в практику: система «Pay Per Crawl» отвечала на запрос кодом 402 «Требуется оплата», а её преемник выплачивает издателям вознаграждение не тогда, когда бот считывает страницу, а только тогда, когда их контент фактически используется в ответе.
Насколько значительным является этот сдвиг с точки зрения трафика?
К июню 2026 года на долю обучающих роботов-сканеров приходилось 50,6 % трафика ИИ-ботов в сети Cloudflare, в то время как доля поисковых ботов сократилась до 10,7 %. Именно из-за такого переворота в соотношении издатели перестали рассматривать сканирование с помощью ИИ как незначительную погрешность в своем поисковом трафике и начали устанавливать на него отдельные тарифы.
Что делает набор данных обоснованным, а не просто большим?
Происхождение, которое вы зафиксировали во время сбора данных. URL-адрес источника, временная метка запроса, директива robots, действовавшая на момент запроса, лицензия или условия, указанные на странице, а также рынок, с которого был получен контент. Восстановить эту информацию позже, как правило, невозможно, а корпус, происхождение которого невозможно подтвердить, очень сложно использовать в коммерческих целях, каким бы качественным он ни был.
Почему для обеспечения языкового разнообразия необходим распределенный сбор данных?
Поскольку значительная часть веб-контента предоставляется с учетом региональных особенностей. Местные новости, региональные каталоги, документация, ориентированная на конкретный рынок, и страновые версии крупных сайтов за пределами своего рынка часто недоступны, представлены в сокращённом виде или написаны в ином стиле. Если собрать все материалы из одной страны, ваш корпус будет чрезмерно отражать подход этой страны к каждой теме — и это проблема качества задолго до того, как она станет проблемой этики.
Связанные руководства по мобильным прокси-серверам
Работа с наборами данных заимствует методологию сбора данных у кластера веб-парсинга, а логику выборки — у рыночных исследований.
Примеры применения в бизнесе
Основные руководства по мобильным прокси-серверам
Собрать все локали изнутри него
Выделенные модемы 4G/5G с неограниченной пропускной способностью и неограниченным количеством ротаций — IP-адреса операторов на рынках, язык и контент которых должен отражать ваш корпус.
Получить мобильный прокси