В обычном сайте дубли появляются по недосмотру, в интернет-магазине — сами, из-за того, как устроен каталог: один товар лежит в трёх категориях, у него пять вариантов, к адресу добавляются сортировка и метка. Разбираемся, откуда они берутся и как закрывать каждый вид.
Коротко
- Дубли в магазине появляются от самой механики каталога, а не от ошибок.
- Сначала инвентаризация источников, потом закрытие.
- Для каждого источника свой способ: canonical, мета-тег, параметры.
- Главный признак — страниц в индексе кратно больше, чем товаров.
Откуда они берутся
| Источник | Как выглядит |
|---|---|
| Товар в нескольких категориях | Одна карточка доступна по разным адресам |
| Варианты товара | Цвета и размеры как отдельные страницы |
| Сортировки и вид отображения | Тот же список в другом порядке |
| Фильтры | Комбинации параметров в адресе |
| Метки и идентификаторы | Рекламные метки, сессии, партнёрские коды |
| Пагинация | Страницы списка, похожие между собой |
| Версии для печати | Та же карточка в другом оформлении |
Главный признак проблемы. Число страниц в индексе кратно больше числа товаров, категорий и статей вместе взятых. Если товаров три тысячи, а в индексе сорок тысяч страниц, дубли уже есть — остаётся понять, какого вида.
Как провести инвентаризацию
Посмотрите число страниц в индексе
И сравните с реальным числом сущностей на сайте.
Обойдите сайт краулером
Он покажет, какие адреса доступны и сколько их.
Сгруппируйте адреса по шаблонам
С параметром сортировки, с меткой, с идентификатором категории.
Посчитайте каждую группу
Сразу видно, какой источник даёт больше всего.
Проверьте статистику обхода
На что робот реально тратит ресурс.
Начинать нужно с подсчёта, а не с закрытия. Типичная ошибка — закрыть первое, что нашли, и не узнать, что девяносто процентов мусора давал другой источник. Полчаса на инвентаризацию экономят недели бессмысленных правок.
Чем закрывать каждый вид
| Вид | Способ |
|---|---|
| Товар в нескольких категориях | Один основной адрес, остальные ссылаются на него как на каноничный |
| Варианты товара | Одна карточка с выбором либо каноничный на основной вариант |
| Сортировки и вид отображения | Каноничный на страницу без параметров |
| Фильтры | Мета-тег robots, кроме открытого белого списка |
| Метки и идентификаторы | Указание, что параметр не меняет содержимое |
| Пагинация | Каноничный на саму себя, номер страницы в заголовке |
| Версии для печати | Закрыть мета-тегом |
Частая ошибка — закрывать всё подряд в robots.txt. Запрет на обход не выводит страницу из индекса: она может остаться там без описания. Чтобы страница вышла, робот должен зайти и увидеть запрет в мета-теге — значит, в robots.txt её закрывать не надо.
Решения на уровне структуры
Часть дублей проще не закрывать, а не создавать. Это решается один раз при проектировании.
Один товар — один адрес
Независимо от того, в скольких категориях он лежит.
Варианты внутри карточки
Выбор цвета и размера без смены адреса — если под варианты нет отдельного спроса.
Сортировка без изменения адреса
Либо с параметром, помеченным как не меняющий содержимое.
Белый список открытых фильтров
Открыто только перечисленное, остальное закрыто по умолчанию.
Метки не участвуют в адресации
Рекламные параметры не должны порождать новые страницы в индексе.
Про варианты товара. Решение зависит от спроса: если «кроссовки такие-то чёрные» ищут отдельно, вариант заслуживает своей страницы. Если ищут только модель, варианты лучше держать внутри одной карточки. Проверяется это по частотности за пятнадцать минут и избавляет от долгих споров.
Как проверить результат
Через месяц посмотрите число страниц в индексе
Оно должно заметно сократиться.
Проверьте, что нужные страницы остались
Главная ошибка при чистке — закрыть лишнее.
Посмотрите статистику обхода
Робот должен тратить ресурс на товары, а не на сортировки.
Проверьте отчёты панели
Разделы про дубли и исключённые страницы.
Повторяйте после изменений каталога
Новые механизмы порождают новые дубли.
Чего ожидать по срокам. Страницы уходят из индекса не мгновенно: роботу нужно переобойти их и увидеть запрет. Для крупного каталога это недели, иногда месяцы. Если через месяц число страниц не изменилось совсем, стоит проверить, видит ли робот ваши указания — а не добавлять новые запреты поверх старых.
Частые вопросы
Откуда в интернет-магазине берутся дубли?
Из самой механики каталога: товар лежит в нескольких категориях и доступен по разным адресам, варианты создают отдельные страницы, сортировки и фильтры добавляют параметры, рекламные метки порождают новые адреса.
Как понять, что дубли есть?
Сравнить число страниц в индексе с реальным числом товаров, категорий и статей. Если товаров три тысячи, а в индексе сорок тысяч страниц, дубли уже есть — остаётся выяснить, какого вида.
Можно ли закрыть дубли через robots.txt?
Этого недостаточно: запрет на обход не выводит страницу из индекса, она может остаться там без описания. Нужен мета-тег на самой странице, а значит, робот должен иметь возможность её загрузить.
Делать ли отдельные страницы под варианты товара?
Зависит от спроса. Если конкретный цвет или размер ищут отдельно, вариант заслуживает своей страницы. Если ищут только модель, варианты лучше держать внутри одной карточки. Проверяется по частотности за пятнадцать минут.
Продвинем сайт в поиске
Соберём семантику, доведём структуру и текст до уровня топа и будем вести проект до заявок.
Обсудить SEO-продвижение