Долгие годы открытый интернет держался на довольно простом обмене.
Сайты разрешали поисковым роботам читать страницы. Взамен поисковики показывали ссылки и приводили посетителей. Автор публиковал материал, робот индексировал его, пользователь находил нужную информацию и переходил к первоисточнику.
С появлением генеративного искусственного интеллекта эта схема начала ломаться.
Новые роботы тоже читают сайты. Но результат их работы часто выглядит иначе: нейросеть пересказывает содержимое страницы прямо в ответе, а пользователь уже не переходит к автору.
Для владельца сайта это означает странную сделку. Он оплачивает журналистов, экспертов, серверы и редактуру. Робот забирает результат, создаёт на его основе готовый ответ — и почти не возвращает аудиторию.
Поэтому всё больше сайтов закрывают двери перед ИИ-краулерами.
Но вместе с нежелательными роботами под блокировку попадают поисковики, архивы, исследовательские проекты и полезные цифровые помощники.
Открытый интернет начинает напоминать здание, в котором каждый владелец устанавливает собственный пропускной режим.
Кто такие ИИ-краулеры
Краулер — это программа, которая автоматически переходит по страницам сайтов и собирает информацию.
Такие роботы существовали задолго до современных нейросетей.
Классический пример — поисковый робот. Он читает страницу, добавляет её в индекс и помогает людям найти сайт через поисковую систему.
Сегодня автоматические роботы могут собирать материалы для разных целей:
- создания поискового индекса;
- обучения языковой модели;
- обновления знаний нейросети;
- формирования ответа на запрос пользователя;
- анализа цен и товаров;
- архивирования страниц;
- работы автономного ИИ-агента.
Для владельца сайта эти цели принципиально различаются.
Поисковый робот потенциально приводит посетителей. Архивный сохраняет исчезающие страницы. А бот для обучения модели может забрать миллионы текстов, не возвращая сайту почти ничего.
Проблема в том, что внешне все они совершают примерно одно и то же: отправляют запросы к страницам и скачивают содержимое.

Почему сайты начали массово закрываться
У владельцев ресурсов накопилось сразу несколько претензий.
Роботы забирают контент без согласования
Авторы и издатели считают несправедливой ситуацию, при которой их публикации используются для развития коммерческих ИИ-продуктов без отдельного разрешения или оплаты.
Особенно остро это воспринимают СМИ.
Новости, расследования, обзоры и инструкции не возникают автоматически. За ними стоят зарплаты журналистов, работа редакторов, поездки, экспертиза, фотографии и юридическая проверка.
Если нейросеть создаёт краткий ответ на основе этого материала, пользователь может вообще не открыть исходную статью.
ИИ почти не возвращает посетителей
Традиционный поисковик тоже копирует и анализирует страницы. Но он показывает список ссылок.
ИИ-сервис часто старается сразу дать окончательный ответ.
Исследования трафика показывают огромный разрыв между количеством запросов от ИИ-ботов и числом переходов, которые затем получают сайты. В одном из отраслевых анализов медианный реферальный трафик от ИИ-систем оказался в тысячи раз ниже поискового. Точные показатели зависят от выборки и методики, но общий дисбаланс сохраняется: роботы читают много, возвращают мало.
Автоматические запросы создают нагрузку
Каждое обращение робота требует ресурсов сервера.
Для небольшого сайта несколько дополнительных запросов почти незаметны. Но агрессивный бот может открывать тысячи или миллионы страниц, включая архивы, фильтры и динамически создаваемые адреса.
Это приводит к:
- росту расходов на хостинг;
- перегрузке баз данных;
- замедлению страниц;
- сбоям;
- дополнительным затратам на защиту;
- сложностям с отделением полезных роботов от вредных.
Особенно тяжело приходится сайтам с большими архивами: форумам, энциклопедиям, библиотекам, интернет-магазинам и новостным изданиям.
Почему старого файла robots.txt уже недостаточно
Для общения сайтов с роботами много лет используется файл robots.txt.
Он размещается в корне сайта и содержит инструкции для автоматических программ. Владелец может попросить определённого робота не открывать отдельные разделы или весь ресурс.
Например, смысл правила может быть таким:
«Этот бот не должен читать мои страницы».
Но robots.txt — это не замок.
Это табличка на двери.
Соблюдение указаний остаётся добровольным. Cloudflare прямо предупреждает, что такой файл выражает предпочтения владельца сайта, но технически не мешает роботу получить страницу. Для реальной блокировки нужны дополнительные инструменты.
Исследование поведения 130 заявленных роботов показало, что некоторые скраперы выборочно соблюдают ограничения, а отдельные категории ИИ-краулеров редко проверяют robots.txt. Авторы пришли к выводу, что полагаться только на добровольный протокол рискованно.
Поэтому владельцы сайтов переходят от просьб к технической защите.
Как именно блокируют ИИ-ботов
Самый простой вариант — запретить известных роботов по их имени, указанному в запросе.
Но этот способ работает только с теми, кто честно представляется.
Более серьёзные системы анализируют:
- IP-адрес;
- частоту запросов;
- последовательность переходов;
- технические заголовки;
- скорость загрузки страниц;
- попытки обходить ограничения;
- поведение, нехарактерное для человека.
После этого сайт может:
- полностью отказать в доступе;
- замедлить робота;
- потребовать проверку;
- разрешить только отдельные страницы;
- ограничить количество запросов;
- предложить платный доступ;
- разрешить поиск, но запретить обучение модели.
Cloudflare уже позволяет владельцам отдельно управлять роботами, которые используются для поиска, обучения моделей и работы ИИ-агентов. Это показывает, насколько сложной стала новая система: единой кнопки «запретить искусственный интеллект» уже недостаточно.
Интернет переходит от свободного доступа к разрешительному
Раньше логика открытой Сети выглядела так:
«Если страница доступна без пароля, её можно индексировать, пока владелец явно не запретил это».
Теперь всё чаще появляется обратный принцип:
«Нельзя забирать контент, пока владелец явно не дал разрешение».
В июле 2025 года Cloudflare объявила о модели, при которой владельцы подключённых сайтов могут по умолчанию блокировать ИИ-краулеров и отдельно решать, кому предоставить доступ. Компания также начала тестировать систему Pay Per Crawl, позволяющую требовать оплату за автоматическое чтение контента.
Это важный поворот.
Робот больше не воспринимается как нейтральный технический посетитель. Его доступ становится предметом переговоров.
Платный доступ для роботов: новая экономика контента
Идея выглядит просто.
Человек читает сайт бесплатно или оплачивает подписку. ИИ-компания, которая собирает материалы в промышленных масштабах, платит отдельно.
Такой подход может дать издателям новый источник дохода.
Возможны разные модели:
- оплата за каждый запрос;
- лицензия на определённый архив;
- фиксированная годовая сумма;
- доступ только к выбранным материалам;
- отдельная цена на обучение и на генерацию ответов;
- бесплатный доступ в обмен на переходы и указание источника.
Крупные компании уже заключают лицензионные соглашения с владельцами контента.
Но у этой модели есть очевидный недостаток: договариваться проще крупным платформам и большим издательствам. Небольшой блог, региональная газета или независимый автор редко обладают достаточной переговорной силой.
В результате открытая Сеть рискует разделиться на два уровня.
Большие площадки продают свои архивы. Маленькие либо блокируют всех, либо остаются бесплатным источником данных.
Почему нельзя просто заблокировать всех
Полная блокировка кажется простым решением.
Но под словом «роботы» скрываются совершенно разные инструменты.
Если сайт закроет доступ всем автоматическим программам, он может потерять:
- индексацию в поиске;
- появление в ответах цифровых помощников;
- архивирование;
- сервисы доступности;
- мониторинг безопасности;
- проверку ссылок;
- научное исследование;
- автоматическое сравнение данных;
- полезных агентов, действующих по просьбе пользователя.
Кроме того, многие небольшие сайты сами зависят от поискового трафика.
Они не могут отказаться от роботов полностью, даже если недовольны использованием материалов для ИИ.
Самая сложная ситуация — с Google
Для издателей особенно важен вопрос, можно ли отдельно разрешить традиционный поиск и запретить использование страниц в генеративных ответах.
Если одна и та же инфраструктура участвует и в поисковой индексации, и в работе ИИ-функций, владельцы сайтов оказываются перед неприятным выбором:
- разрешить доступ и сохранить поисковую видимость;
- запретить доступ, рискуя потерять аудиторию.
Руководители некоторых медиакомпаний публично обвиняли Google в том, что подобная связка ограничивает возможность издателей свободно управлять своим контентом.
Крупные издатели уже обсуждают возможность ограничить даже Google, поскольку генеративные ответы уменьшают количество переходов к первоисточникам.
Раньше быть видимым для поисковика почти всегда считалось выгодным.
Теперь этот вопрос впервые стал спорным.

Под удар попал даже Интернет-архив
Один из самых неожиданных последствий новой войны с роботами — ограничения для Internet Archive и его Wayback Machine.
Этот некоммерческий проект сохраняет копии страниц и позволяет увидеть, как сайты выглядели несколько лет назад.
Он важен для:
- журналистов;
- исследователей;
- историков;
- юристов;
- проверки удалённых заявлений;
- сохранения культурного наследия;
- поиска исчезнувшей информации.
Но издатели опасаются, что ИИ-компании могут обходить запреты и получать старые статьи через архивные копии.
В 2026 году более 340 местных новостных сайтов ограничили доступ архивным роботам. Некоторые издания признали, что действовали превентивно, не располагая доказательствами фактического использования их архивов ИИ-компаниями.
Ранее Reddit также ограничил архивирование большинства страниц после заявлений о том, что ИИ-компании получали данные через сохранённые копии.
Получается парадокс.
Пытаясь защитить сегодняшние материалы от нейросетей, сайты уничтожают возможность сохранить их для будущего.
Сеть может потерять собственную память
Интернет кажется вечным, но страницы исчезают постоянно.
Закрываются издания. Меняются адреса. Удаляются посты. Обновляются сайты государственных органов. Компании редактируют старые заявления.
Если архивные роботы не могут сохранять страницы, история интернета становится зависимой от самих владельцев.
Это особенно опасно для новостей и публичных заявлений.
Организация может изменить текст, удалить неудобную информацию или полностью закрыть сайт. Без независимой копии проверить прошлое будет сложно.
Поэтому борьба с ИИ-скрапингом создаёт конфликт между двумя законными интересами:
- правом автора контролировать использование контента;
- общественным интересом к сохранению цифровой истории.
Простого решения здесь пока нет.
Блокировка качественных сайтов может ухудшить сами нейросети
Есть ещё одно неожиданное последствие.
Качественные новостные ресурсы чаще защищают свои материалы, чем сайты с сомнительной информацией.
Исследование конфигураций robots.txt показало, что хотя бы одного ИИ-бота запрещали 60% изученных авторитетных новостных сайтов и лишь 9,1% ресурсов с дезинформацией.
Другое исследование обнаружило, что ограничения особенно распространены среди изданий с высоким уровнем фактологической надёжности, тогда как низкокачественные и гиперпартийные сайты блокируют роботов заметно реже.
Отсюда возникает неприятный сценарий.
Нейросети теряют доступ к профессиональной журналистике, но продолжают собирать:
- непроверенные блоги;
- пропагандистские сайты;
- автоматически созданные тексты;
- копии чужих материалов;
- страницы с ложными сенсациями.
Таким образом, защита качественного контента может непреднамеренно сделать будущие обучающие наборы менее точными и более предвзятыми.
Появится ли интернет только для людей
Некоторые владельцы сайтов пытаются отличать человека от автоматической программы.
Для этого используются:
- CAPTCHA;
- проверка поведения мыши;
- ограничения по частоте запросов;
- вход через аккаунт;
- обязательное выполнение JavaScript;
- цифровые подписи для доверенных роботов.
Но любой такой барьер создаёт неудобства не только для ИИ.
С ним могут столкнуться:
- люди с инвалидностью;
- пользователи старых устройств;
- жители стран с медленным интернетом;
- программы чтения с экрана;
- исследовательские инструменты;
- переводчики;
- сервисы автоматизации.
Защищаясь от машин, сайты рискуют сделать интернет хуже для части людей.
Следующая проблема — ИИ-агенты
Обычный краулер только читает страницы.
ИИ-агент может действовать активнее:
- нажимать кнопки;
- заполнять формы;
- бронировать билеты;
- покупать товары;
- публиковать сообщения;
- управлять аккаунтом;
- взаимодействовать с поддержкой.
Старый robots.txt создавался не для такого поведения.
Он может попросить робота не индексировать страницу, но не объясняет, разрешено ли агенту положить товар в корзину, отменить подписку или отправить заявление.
Исследователи уже предлагают новые форматы разрешений, в которых сайт сможет отдельно указывать допустимые действия для ИИ-агентов. Без таких правил владельцы ресурсов, вероятно, будут чаще использовать полную блокировку и CAPTCHA.
Открытый интернет не обязательно исчезнет
Массовая блокировка роботов не означает, что Сеть завтра полностью закроется.
Скорее всего, вместо прежней простоты появится более сложная система доступа.
Один сайт разрешит поиск, но запретит обучение.
Другой позволит нейросети цитировать материалы при наличии ссылки.
Третий потребует оплату.
Четвёртый откроет специальный API.
Пятый заблокирует всех неизвестных роботов.
Шестой оставит всё как есть, потому что ему важна любая дополнительная видимость.
Открытость перестанет быть одинаковой для всех.
Как может выглядеть новый компромисс
Устойчивой модель станет только тогда, когда выгоду получат обе стороны.
Возможный компромисс включает несколько элементов.
Чёткое разделение целей
Робот должен честно сообщать, зачем он приходит:
- для поисковой индексации;
- для обучения;
- для ответа пользователю;
- для архивирования;
- для выполнения конкретного поручения.
Указание источников
Если ИИ использует информацию сайта, пользователь должен видеть понятную ссылку на оригинал.
Причём не спрятанную среди десятков малозаметных примечаний.
Возможность отказаться
Владелец контента должен иметь технически работающий способ запретить обучение модели, не исчезая при этом из обычного поиска.
Оплата за коммерческое использование
Профессиональный контент не может бесконечно производиться бесплатно для компаний, которые строят на нём платные продукты.
Защита архивирования
Необходим механизм, при котором общественно значимые страницы сохраняются, но архив не превращается в бесплатный обходной путь для коммерческого скрапинга.
Ответственность роботов
ИИ-компании должны контролировать частоту запросов, не перегружать сайты и соблюдать объявленные ограничения.
Что изменится для обычного пользователя
На первый взгляд спор касается только издателей и технологических компаний.
Но последствия почувствуют все.
Пользователь может столкнуться с тем, что:
- нейросеть перестанет видеть часть сайтов;
- ответы ИИ станут менее полными;
- всё больше страниц потребуют входа;
- появится больше CAPTCHA;
- старые материалы исчезнут из архивов;
- качественный контент уйдёт за платные стены;
- поисковая выдача станет беднее;
- доступ к информации будет зависеть от соглашений между крупными компаниями.
Одновременно авторы могут получить больше контроля и новые источники дохода.
Вопрос лишь в том, кто установит правила.
Сеть закрывается не от роботов вообще
Главная причина конфликта не в том, что сайты внезапно возненавидели автоматические программы.
Поисковые, архивные и технические роботы десятилетиями были частью интернета.
Конфликт возник из-за исчезновения взаимности.
Сайты видят, что их материалы забирают в огромных объёмах, используют в коммерческих продуктах и пересказывают без достаточного количества переходов, оплаты или контроля.
Поэтому владельцы ресурсов начинают закрываться.
Не потому, что хотят уничтожить открытый интернет.
А потому, что прежняя открытость стала слишком односторонней.
Останется ли интернет открытым
Вероятнее всего, да. Но уже не в том виде, к которому мы привыкли.
Сеть движется от мира свободно доступных страниц к миру разрешений, лицензий, фильтров и разных уровней доступа.
Для человека страница может оставаться открытой.
Для поисковика — тоже.
Для архивного проекта — частично.
Для нейросети — только по договору.
Для неизвестного робота — полностью закрытой.
Это сделает интернет сложнее и менее универсальным.
Но настоящая опасность заключается не в самих ограничениях.
Гораздо опаснее, если новые правила будут установлены только крупнейшими издателями, платформами и ИИ-компаниями, а интересы небольших сайтов, независимых авторов, исследователей и обычных пользователей останутся за пределами переговоров.
Открытый интернет ещё не исчез.
Сейчас решается, что именно слово «открытый» будет означать в эпоху искусственного интеллекта.
