Краулинговый бюджет — это объём страниц, который поисковый робот готов обойти на вашем сайте за определённое время. Ресурс не бесконечный: робот учитывает, сколько нагрузки выдерживает ваш сервер и насколько сайт вообще заслуживает частых визитов.
Начнём с того, о чём в статьях на эту тему обычно не пишут: большинству сайтов краулинговый бюджет не мешает и заниматься им не нужно. Ниже — как за пять минут понять, ваш это случай или нет, и что делать, если всё-таки ваш.
Что такое краулинговый бюджет
Робот приходит на сайт и обходит страницы по ссылкам и карте сайта. Сколько он их обойдёт за визит, зависит от двух вещей.
Сколько сайт выдерживает. Если сервер отвечает быстро и без ошибок, робот увеличивает темп. Если страницы отдаются медленно или сыплются ошибки, он снижает нагрузку, чтобы не положить сайт.
Насколько сайт интересен. Ресурс, который регулярно обновляется и востребован в поиске, робот посещает чаще. Заброшенный сайт с неизменным содержимым — реже, и это разумно с его стороны.
Отсюда простое следствие: бюджет не выдаётся в виде фиксированного числа и не настраивается. Он складывается из технического состояния сайта и его ценности для поиска.
Кому об этом можно не думать
Если у вас сайт услуг на полсотни страниц, корпоративный сайт или блог, который пополняется парой материалов в неделю, — краулинговый бюджет вам не жмёт. Робот обходит такой сайт целиком и с запасом. Заниматься его оптимизацией вместо работы над содержанием и структурой — потерянное время.
Тема действительно актуальна, если у вас:
- интернет-магазин или каталог на тысячи и десятки тысяч адресов;
- фильтры и сортировки, порождающие URL с параметрами в неограниченном количестве;
- портал или агрегатор с постоянно растущим числом страниц;
- сайт после крупного переезда, где остались сотни редиректов и старых адресов;
- площадка с частыми обновлениями, где важно, чтобы изменения попадали в поиск быстро.
Общий признак прост: страниц много, они постоянно появляются или меняются, и часть из них не имеет самостоятельной ценности. Если это не про вас — можете закрывать статью со спокойной душой, время сэкономлено.
Чем заняться вместо этого, если сайт небольшой
Когда страницы всё-таки долго не попадают в поиск, а сайт маленький, причина почти никогда не в бюджете обхода. Смотреть стоит в другую сторону:
- Страница закрыта от индексации — случайный
noindexв шаблоне или запрет в robots.txt после переноса сайта. Проверяется за минуту. - На страницу нет ссылок — она есть в карте сайта, но ни одна страница на неё не ведёт. Робот такие адреса обходит неохотно.
- Содержимое слишком тонкое — страница обойдена, но в поиск не взята, потому что не несёт ничего своего. Это не проблема обхода, а проблема качества.
- Сайт молодой — первые месяцы поисковики присматриваются к любому новому домену, и очередь на индексацию тут нормальна.
Каждая из этих причин чинится быстрее и даёт больше, чем любая работа с бюджетом обхода на сайте в двести страниц.
Как понять, есть ли проблема у вас
Три признака, которые стоит проверить по порядку.
Признак 1: разрыв между обойденными страницами и страницами в поиске. В Яндекс Вебмастере видно, сколько страниц робот обошёл и сколько из них попало в поиск. Небольшая разница нормальна: служебные адреса, редиректы, закрытые разделы. Тревожно, когда обойдено в разы больше, чем оказалось в поиске, — значит львиная доля обхода уходит на то, что в результат не превращается.
Признак 2: новые страницы неделями не появляются в поиске. При условии, что технически с ними всё в порядке: отдают код 200, не закрыты от индексации, есть в карте сайта и на них ведут внутренние ссылки. Если проверили всё это, а страницы всё равно стоят в очереди — робот, скорее всего, тратит визиты на другое.
Признак 3: робот массово ходит по мусорным адресам. Видно в отчётах обхода Вебмастера и Search Console, а на больших сайтах — в логах сервера. Типичная картина: сотни обращений к адресам с параметрами сортировки при том, что новые товары обойдены один раз за месяц.
Порядок проверки: сначала посмотрите соотношение обойденных и попавших в поиск страниц, затем откройте список обойденных адресов и оцените навскидку, какая доля из них — реальные страницы, а какая мусор. Этого хватит, чтобы понять масштаб. Как читать отчёты индексации подробно, разбирали в статье про индексацию сайта в Яндексе.
Что съедает бюджет
| Причина | Как проверить | Что делать |
|---|---|---|
| URL с параметрами фильтров и сортировок | Список обойденных адресов: много ссылок со знаком вопроса | Закрыть бессмысленные комбинации, оставить фильтры со спросом |
| Дубли и версии одной страницы | Отчёт по дублям в Вебмастере | Указать основную версию через canonical |
| Цепочки редиректов | Прогон краулером: переходы длиной 2+ | Сократить до одного перехода |
| Страницы с ошибками 4xx и 5xx | Отчёт ошибок обхода | Починить или отдать корректный код удаления |
| Медленный ответ сервера | Время ответа в Вебмастере и аналитике | Ускорить сервер, включить кэширование |
| Бесконечные календари и пагинация | Обход уходит вглубь на сотни страниц | Ограничить глубину, закрыть служебные листалки |
| Результаты внутреннего поиска по сайту | В обойденных есть адреса поисковых запросов | Закрыть от индексации полностью |
Отдельно про дубли: они съедают бюджет дважды — робот тратит визит на копию, а потом ещё и выбирает, какую версию показывать. Виды дублей и способы их устранения разбираем в отдельном материале, там же про канонические адреса.
Фильтры и параметры: главный пожиратель бюджета
На магазинах и каталогах девять из десяти проблем с обходом сводятся к одному — комбинациям фильтров. Механика простая: три фильтра по пять значений дают уже больше сотни сочетаний, а с сортировками и постраничной навигацией счёт идёт на тысячи адресов, за каждым из которых стоит почти одинаковый набор товаров.
Соблазн закрыть всё разом велик, и это ошибка. Часть фильтров собирает реальный спрос: «кроссовки женские зимние» — это запрос, по которому люди ищут, и страница фильтра под него должна быть в поиске. Закрыв её вместе с мусором, вы теряете посадочную страницу.
Рабочее разделение выглядит так:
- Открываем сочетания, под которые есть спрос в подборе запросов, и делаем из них полноценные страницы: свой заголовок, описание, понятный адрес.
- Закрываем технические параметры — сортировку, вид отображения, число товаров на странице. Они не меняют содержимое, только его порядок.
- Закрываем глубокие комбинации из трёх и более фильтров: спроса под них нет, а адресов они порождают больше всего.
- Не плодим параметры там, где можно обойтись без них: метки переходов и идентификаторы сессий в адресах сегодня почти всегда лишние.
Проверить, что получилось, можно по списку обойденных адресов: доля ссылок со знаком вопроса должна заметно упасть.
Как посмотреть отчёты обхода
В Яндекс Вебмастере нужный раздел — «Индексирование», где есть статистика обхода: сколько страниц робот посетил, какие коды ответа получил и что исключено из поиска с указанием причины. Там же можно выгрузить список обойденных адресов и просмотреть его глазами — этого достаточно, чтобы оценить долю мусора.
В Google Search Console статистика сканирования лежит в настройках: общее число запросов робота, объём загруженных данных, среднее время ответа сервера и разбивка по кодам ответа и типам файлов. Полезнее всего здесь график времени ответа — по нему сразу видно, упирается ли обход в производительность.
Логи сервера нужны, когда счёт адресов идёт на десятки тысяч и отчётов уже мало. В логах видно каждое обращение робота: какие разделы он посещает чаще всего, куда вообще не заходит и сколько времени тратит на мусорные адреса. Разбирать их вручную не нужно — задача решается выгрузкой за пару недель и группировкой обращений по разделам сайта. Небольшому сайту это не требуется вовсе.
Пример: каталог на 30 тысяч адресов
Как это выглядит на практике. Магазин, около двух тысяч реальных товаров, но в отчётах обхода — больше тридцати тысяч адресов. Новые товары появляются в поиске через три-четыре недели после публикации.
Что показал разбор. Основную массу обойденных адресов дали сочетания фильтров и сортировок, ещё заметная часть — результаты внутреннего поиска, которые оказались открыты для индексации. Отдельно нашлись цепочки редиректов, оставшиеся после смены структуры разделов год назад: робот проходил по два-три перехода, чтобы добраться до товара.
Что сделали. Закрыли внутренний поиск и технические параметры. Оставили открытыми полтора десятка сочетаний фильтров, под которые нашёлся спрос, — и оформили их как посадочные страницы. Сократили редиректы до одного перехода. Убрали из карты сайта адреса удалённых товаров.
Что изменилось. Через месяц доля мусорных адресов в обходе упала в разы, а новые товары стали попадать в поиск за несколько дней вместо трёх недель. Позиции при этом сами по себе не выросли — выросла скорость, с которой новые страницы вообще получали шанс на позиции.
Что делать: работы по приоритету
Списки из двенадцати пунктов вперемешку выглядят солидно, но начинать по ним невозможно. Работы делятся на три уровня, и порядок здесь важен.
Уровень 1. Перестать создавать мусор. Пока сайт продолжает генерировать бесполезные адреса, чистка накопленного бессмысленна — он нарастёт заново. Сюда входит: закрыть от индексации результаты внутреннего поиска, разобраться с параметрами фильтров и сортировок, ограничить генерацию комбинаций, убрать бесконечные календари. Инструменты — robots.txt и карта сайта, canonical, настройки CMS.
Уровень 2. Убрать накопленное. Теперь имеет смысл чистить: сократить цепочки редиректов до одного перехода, починить или корректно закрыть страницы с ошибками, свести дубли к каноническим версиям, удалить из карты сайта адреса, которых давно нет.
Уровень 3. Помочь роботу и ускорить сайт. Когда мусора нет, можно работать с приоритетами: держать карту сайта в актуальном состоянии с честными датами обновления, выстроить внутреннюю перелинковку так, чтобы важные страницы были в двух-трёх кликах от главной, ускорить ответ сервера — это единственный рычаг, который увеличивает объём обхода напрямую. Про скорость подробно писали в материале о скорости загрузки и Core Web Vitals.
Порядок именно такой, потому что каждый следующий уровень работает только на подготовленной почве. Ускорять сервер на сайте, где робот ходит по миллиону параметров, — значит просто дать ему быстрее обходить мусор.
Чем Яндекс отличается от Google
Механика похожа, различаются доступные вам данные.
Google открыто описывает, как формируется бюджет обхода, и отдаёт статистику сканирования в Search Console: сколько запросов сделано, сколько данных загружено, какое было среднее время ответа. Там же видно распределение по типам файлов и по кодам ответа.
Яндекс конкретных формул не публикует, но в Вебмастере есть отчёты обхода: сколько страниц обойдено, какие исключены и по каким причинам. Отдельно Яндекс учитывает обновляемость — сайты, где регулярно появляется новое, он посещает чаще.
Практический вывод: работы по оптимизации для обеих систем одинаковые, отличается только то, где вы смотрите результат. Делать что-то отдельно «под Яндекс» или «под Google» здесь не нужно.
Чего делать не нужно
Закрывать всё подряд в robots.txt. Соблазн понятный: меньше адресов — больше бюджета на нужное. Но массовое закрытие регулярно уносит вместе с мусором посадочные страницы фильтров, которые собирали трафик. Каждое правило должно быть осознанным.
Гнаться за увеличением бюджета как самоцелью. Бюджет — не показатель здоровья сайта и не KPI. Цель другая: чтобы нужные страницы обходились вовремя. Если это уже так, увеличивать нечего.
Удалять страницы ради экономии обхода. Если страница полезна людям и собирает трафик, она остаётся, даже когда их тысячи. Экономят на бесполезном, а не на работающем.
Покупать «ускорители индексации». Сервисы, обещающие загнать сайт в индекс за деньги, либо делают то, что вы можете сделать сами через переобход в Вебмастере, либо не делают ничего.
Как понять, что стало лучше
Смотреть стоит на три вещи, и не раньше чем через две-четыре недели после работ — роботу нужно время, чтобы переобойти сайт.
Соотношение обойденных и попавших в поиск страниц. Главный показатель: разрыв должен сокращаться.
Скорость появления новых страниц. Если раньше свежие товары или статьи ждали в очереди неделями, а теперь появляются за дни — работы дали результат.
Доля ошибок обхода. Уменьшение количества 4xx и 5xx в отчётах означает, что робот перестал тратить визиты впустую.
Чего ждать не стоит — резкого роста позиций. Оптимизация обхода не улучшает страницы, она лишь даёт им шанс вовремя попасть в поиск. Дальше всё решает их содержание.
Отдельно стоит договориться о том, что считать результатом. Число обойденных страниц после чистки обычно падает — и это правильный исход, а не провал: робот перестал ходить по мусору. Смотреть надо не на абсолютную цифру обхода, а на то, какая доля обойденного превращается в страницы в поиске и как быстро это происходит. Сайт, где робот обходит пять тысяч адресов и все пять тысяч в поиске, здоровее того, где обход идёт по тридцати тысячам, а в результате оказывается две.
Чек-лист
- Оценили масштаб сайта: тысячи адресов или сотни.
- Сравнили число обойденных страниц с числом страниц в поиске.
- Просмотрели список обойденных адресов на предмет мусора.
- Проверили, попадают ли новые страницы в поиск за разумный срок.
- Закрыты результаты внутреннего поиска по сайту.
- Разобраны параметры фильтров: со спросом — открыты, бессмысленные — закрыты.
- Цепочки редиректов сокращены до одного перехода.
- Страницы с ошибками починены или корректно закрыты.
- Карта сайта содержит только живые адреса с честными датами.
- Назначена дата повторной проверки через 2–4 недели.
Когда стоит звать на помощь
На каталоге в десятки тысяч адресов разбор обхода — отдельная работа: нужно выгрузить список обойденных URL, сопоставить его со структурой сайта, понять, какие группы адресов не нужны, и аккуратно их закрыть, ничего не потеряв. Ошибка здесь стоит дорого: закрытая по неосторожности группа фильтров может унести заметную часть трафика.
Мы разбираем это в рамках аудита сайта: смотрим, куда уходит обход, что мешает новым страницам попадать в поиск и в каком порядке это чинить. Первичный аудит перед началом работы бесплатный.