Что такое внутренние дубли страниц и как с ними бороться?
Url разные, а контент страниц одинаковый. Думаете, ничего страшного? Всего лишь пара одинаковых страниц на сайте. Но одинаковый контент может попасть под фильтры поисковых систем. Чтобы этого не произошло, надо знать, как избавляться от внутренних дублей страниц.
Понятие дублей страниц и их виды
Дубли — это отдельные страницы сайта, контент которых полностью или частично совпадает. По сути, это копии всей страницы или ее определенной части, доступные по уникальным URL-адресам.
Что приводит к появлению дублей на сайте:
- Автоматическая генерация дублирующих страниц движком системой управления содержимым сайта (CMS) веб-ресурса. Например:
https://site.net/press-centre/cat/view/identifier/novosti/
https://site.net/press-centre/novosti/
- Ошибки, допущенные вебмастерами. Например, когда один и тот же товар представлен в нескольких категориях и доступен по разным URL:
https://site.net/category-1/product-1/
https://site.net/category-2/product-1/
- Изменение структуры сайта, когда уже существующим страницам присваиваются новые адреса, но при этом сохраняются их дубли со старыми адресами. Например:
https://site.net/catalog/product
https://site.net/catalog/category/product
Есть два типа дублей: полные и частичные.
Что такое полные дубли
Это страницы с идентичным содержимым, доступны по уникальным, неодинаковым адресам. Примеры полных дублей:
1. URL-адреса страниц со слешами («/», «//», «///») и без них в конце:
https://site.net/catalog///product; https://site.net/catalog//////product.
2. HTTP и HTTPS страницы: https//site.net; http//site.net.
3. Адреса с «www» и без «www»: http//www.site.net; http//site.net.
4. URL страниц с index.php, index.html, index.htm, default.asp, default.aspx, home:
https://site.net/index.html;
https://site.net/index.php;
https://site.net/home.
5. URL-адреса страниц в верхнем и нижнем регистрах:
https://site.net/example/;
https://site.net/EXAMPLE/;
https://site.net/Example/.
6. Изменения в иерархической структуре URL. Например, если товар доступен по нескольким разным URL:
https://site.net/catalog/dir/tovar;
https://site.net/catalog/tovar;
https://site.net/tovar;
https://site.net/dir/tovar.
7. Дополнительные параметры и метки в URL.
- URL с GET параметрами: https://site.net/index.php?example=10&product=25. Страница полностью соответствует следующей: https://site.net/index.php?example=25&cat=10.
- Наличие utm-меток и параметров gclid.
Utm-метки помогают предоставить в систему аналитики информацию для анализа и отслеживания различных параметров трафика. URL целевой страницы, к которой добавляются utm-метки, выглядят так:
https://www.site.net/?utm_source=adsite&utm_campaign=adcampaign&utm_term=adkeyword - Параметры gclid (Google Click Identifier). Пометка целевых URL, которая добавляется автоматически для отслеживания данных о компании, канале и ключевых словах в Google ***ytics. Например, если переходят по вашему объявлению для сайта https://site.net, то адрес перехода посетителя будет выглядеть так: https://site.net/?gclid=123xyz.
- Метка yclid. Помогает отслеживать эффективность рекламных кампаний в Яндекс Метрике. Метка позволяет отследить действия посетителя, который перешел на сайт по рекламному объявлению. Вот как выглядит адрес перехода:
https://site.net/?yclid=321. - Метка openstat. Универсальная и также используется для анализа эффективности рекламных кампаний, анализа посещаемости сайта и поведения пользователей на сайте. Ссылка с меткой «openstat»:
https://site.net/?_openstat=231645789. - Дубли, которые создаются реферальной ссылкой. Реферальная ссылка это специальная ссылка с вашим идентификатором, по которому сайты распознают, от кого пришел новый посетитель. Например:
https://site.net/register/?refid=398992;
https://site.net/index.php?cf=reg-newr&ref=Uncertainty.
8. Первая страница пагинации каталога товаров интернет-магазина или доски объявлений, блога. Она зачастую соответствует странице категории или общей странице раздела pageall: https://site.net/catalog; https://site.net/catalog/page1.
9. Неправильные настройки 404 ошибки приводят к появлению многочисленных дублей. Например: https://site.net/rococro-23489-rocoroc; https://site.net/8888-???.
Выделенный жирным текст может вмещать какие-либо символы и/или цифры. Страницы такого вида должны отдавать код ответа сервера 404 (не 200) или же перенаправлять на актуальную страницу.
Истории бизнеса и полезные фишкиЧто такое частичные дубли
В частично дублирующихся страницах контент одинаковый, но есть небольшие отличия в элементах.
Виды частичных дублей:
1. Дубли на карточках товаров и страницах категорий (каталогов). Здесь дубли возникают из-за описаний товаров, которые представлены на общей странице товаров в каталоге. И те же описания представлены на страницах карточек товаров. Например, в каталоге на странице категории под каждым товаром есть описание этого товара:
И тот же текст на странице с товаром:
Чтобы избежать дубля, не показывайте полную информацию о товарах на странице категории (каталога). Или используйте неповторяющееся описание.
2. Дубли на страницах фильтров, сортировок, поиска и страницах пагинации, где есть похожее содержимое и меняется только порядок размещения. При этом текст описания и заголовки не меняются.
3. Дубли на страницах для печати или для скачивания, данные которых полностью соответствуют основным страницам. Например:
https://site.net/novosti/novost1
https://site.net/novosti/novost1/print
Частичные дубли тяжелее обнаружить. Но последствия от них проявляются систематически и негативно отражаются на ранжировании сайта
К чему приводят дубли страниц на сайте
Дубли могут появиться независимо от возраста и количества страниц на сайте. Посетителю они не помешают получить нужную информацию. Совсем иная ситуация с роботами поисковых систем. Поскольку URL разные, поисковые системы воспринимают такие страницы как разные. Следствием большого количества дублирующегося контента становится:
- Проблемы с индексацией. При генерировании дублирующих страниц увеличивается общий размер сайта. Боты, индексируя «лишние» страницы, неэффективно тратят краулинговый бюджет собственника веб-ресурса. «Нужные» страницы могут вовсе не попасть в индекс. Напомню, что краулинговый бюджет это количество страниц, которое бот может просканировать за один визит на сайт.
- Изменения релевантной страницы в выдаче. Алгоритм поисковика может решить, что дубль больше подходит запросу. Поэтому в результатах выдачи он покажет не ту страницу, продвижение которой планировалось. Другой итог: из-за конкуренции между дубль-страницами, ни одна из них не попадет в выдачу.
- Потеря ссылочного веса страниц, которые продвигаются. Посетители будут ссылаться на дубли, а не на оригиналы страниц. Результат потеря естественной ссылочной массы.
Каталог средств для поиска дублированных страниц
Итак, мы уже выяснили, что такое дубли, какими они бывают и к чему приводят. А теперь перейдём к тому, как их обнаружить. Вот несколько эффективных способов:
Поиск дублей с помощью специальных программ
Netpeak Spider. С помощью сканирования можно обнаружить страницы с дублирующимся содержанием: полные дубли страниц, дубли страниц по содержимому блока
, повторяющиеся теги «Title» и метатеги «Description».Использование поисковых операторов
Для поиска дублей можно проанализировать страницы, которые уже проиндексированы, используя поисковый оператор «site:». Для этого в поисковую строку, например Google, вводим запрос «site:examplesite.net». Он покажет страницы сайта в общем индексе. Так мы увидим количество страниц в выдаче, если оно сильно отличается от количества найденных спайдером страниц или страниц в XML-карте.
Просмотрев выдачу, вы обнаружите повторяющиеся страницы, а также «мусорные» страницы, которые нужно удалить из индекса.
Также можно воспользоваться поиском для анализа выдачи по определенному фрагменту текста со страниц, которые, по вашему мнению, могут иметь дубли. Для этого берём в кавычки часть текста, после него ставим пробел, оператор «site:» и вводим в строку поиска. Необходимо указать ваш сайт, чтобы найти страницы, на которых присутствует именно этот текст. Например:
«Фрагмент текста со страницы сайта, которая может иметь дубли» site:examplesite.net
Если в результатах поиска одна страница, значит у страницы нет дублей. Если же в выдаче несколько страниц, необходимо проанализировать их и определить причины дублирования текста. Возможно, это и есть дубли, от которых необходимо избавиться.
Аналогичным образом, используя оператор «intitle:», анализируем содержимое «Title» на страницах в выдаче. Дублирование «Title» бывает признаком дублирующих страниц. Чтобы проверить, используем поисковый оператор «site:». При этом вводим запрос вида:
site:examplesite.net intitle:полный или частичный текст тега Title.Вот как это выглядит:
Используя операторы «site» и «inurl», можно определить дубли страниц, которые возникли на страницах сортировок (sort) или на страницах фильтров и поиска (filter, search).
Например, для поиска страниц сортировок в поисковой строке нужно прописать: site:examplesite.net inurl:sort.
Для поиска страниц фильтров и поиска: site:examplesite.net inurl:filter, search.
Запомните, поисковые операторы показывают только те дубли, которые уже были проиндексированы. Поэтому нельзя полностью полагаться на этот метод.
Как избавиться от дублей
Мы уже рассмотрели, что такое дубли, виды, последствия дублей и как их найти. Теперь переходим к самому интересному как же сделать так, чтобы они перестали вредить оптимизации. Используем методы устранения дублей страниц:
301 редирект
Считается основным методом устранения полных дублей. 301 редирект выполняет автоматическое переадресование с одной страницы сайта на другую. По настроенному редиректу боты видя, что по данному URL страница больше не доступна и перенесена на другой адрес.
301 редирект позволяет передать основной странице ссылочный вес с дублирующей страницы.
Этот метод актуален для устранения дублей, которые появляются из-за:
- URL в разных регистрах;
- иерархии URL;
- определения основного зеркала сайта;
- проблем с использованием слешей в URL.
Например, 301 редирект используют для перенаправления со страниц https://site.net/catalog///product;
https://site.net/catalog//////product;
https://site.net/product на страницу https://site.net/catalog/product.
Файл robots.txt
С помощью метода мы рекомендуем поисковым ботам, какие страницы или файлы не стоит сканировать.
Для этого необходимо использовать директиву «Disallow», которая запрещает поисковым ботам заходить на ненужные страницы.
User-agent: *
Disallow: /stranica
Отметим, если страница указана в robots.txt с директивой Disallow, эта страница все равно может оказаться в выдаче. Почему? Она была проиндексирована ранее, или же на нее есть внутренние или внешние ссылки. Инструкции robots.txt носят рекомендательный хаpaктер для поисковых ботов. Они не могут гарантировать удаление дублей.
Что такое robots.txt и зачем вообще нужен индексный файл Рекомендуем детальнее ознакомиться с
Метатег и
Метатег указывает роботу не индексировать документ и не переходить по ссылкам. В отличие от robots.txt, этот метатег — прямая комaнда, и она не будет игнорироваться поисковыми роботами.
Метатег указывает роботу не индексировать документ, но при этом переходить по ссылкам размещенным в нем.
Но, как сообщает представитель Google Джон Мюллер, рано или поздно метатег \"noindex, follow\" воспринимается поисковой системой как \"noindex, nofollow\".
То есть, если бот заходит впервые и видит директиву \"noindex, follow\", то он не индексирует страницу, но вероятность перехода по внутренним ссылкам еще остается. Но если бот возвращается через некоторое время и опять видит \"noindex, follow\", то страница полностью удаляется из индекса, бот перестает на нее заходить и учитывать размещенные ссылкам на этой странице. Это значит, что в долгосрочном периоде нет разницы между мета тегами \"noindex, follow\" и \"noindex, nofollow\".
Для использования метода необходимо разместить на дублирующих страницах в блоке
один из метатегов:или же аналогичный: ; .
Атрибут rel=\"canonical\"
Используйте метод, когда удалять страницу нельзя и её нужно оставить открытой для просмотра.
Тег для устранения дублей на страницах фильтров и сортировок, страницах с get-параметрами и utm-метками. Применяется для печати, при использовании одинакового информационного содержания на разных языковых версиях и на разных доменах. Атрибут rel=\"canonical\" для разных доменов поддерживается не всеми поисковыми системами. Для Google он будет понятен, Яндекс его проигнорирует.
Указывая каноническую ссылку, мы указываем адрес страницы, предпочтительной для индексации. Например, на сайте есть категория «Ноутбуки». В ней фильтры, которые показывают разные параметры выбора. А именно: бренд, цвет, разрешение экрана, материал корпуса и т.д. Если эти страницы фильтров не будут продвигаться, то для них канонической указываем общую страницу категории.
Как задать каноническую страницу? В HTML-код текущей страницы помещаем атрибут rel=\"canonical\" между тегами
.... Например, для страниц:https://site.net/index.php?example=10&product=25;
https://site.net/example?filtr1=%5b%25D0%,filtr2=%5b%25D0%259F%;
https://site.net/example/print.
Канонической будет страница https://site.net/example.
В HTML коде это будет выглядеть так:
Выводы
1. Дубли — отдельные страницы сайта, контент которых полностью или частично совпадает.
2. Причины возникновения дублей на сайте: автоматическая генерация, ошибки, допущенные вебмастерами, изменение структуры сайта.
3. К чему приводят дубли на сайте: индексация становится хуже; изменения релевантной страницы в поисковой выдаче; потеря естественной ссылочной массы продвигаемыми страницами.
4. Методы поиска дублей: использование программ-парсеров (Netpeak Spider) ; поискового оператора site.
5. Инструменты устранения дублей: соответствующие комaнды в файле robots.txt; тег meta name=\"robots\" content=\"noindex, nofollow\"; тег rel=\"canonical\"; 301 редирект.
Устранили дублирующий контент? Теперь необходимо проверить сайт ещё раз. Так вы увидите эффективность проведенных действий, оцените результативность выбранного метода. Анализ сайта на дубли рекомендуем проводить регулярно. Только так можно вовремя определить и устранить ошибки.
Комментарии:
Охват и средняя цена за клик в самых популярных тематиках....
19 07 2025 11:22:51
10 заданий, которые заставят пошевелить мозгами и придумать нестандартные решения. Используйте их (видоизмените, адаптируйте) под свой продукт или услугу. Создайте крутую кампанию, креатив или предложите это своей комaнде....
18 07 2025 0:46:36
Дейли — ежедневный комaндный митинг, на котором комaнда синхронизируется по ключевым моментам работы и по текущим задачам. Делимся чек-листом агентства Netpeak по организации дейли на удалёнке....
17 07 2025 0:20:29
Каждому бизнесу в интернете важно продумать систему оплаты для своих товаров или услуг. При этом следует учитывать объемы и нишу бизнеса. Узнать больше!...
16 07 2025 5:45:35
Здесь не нужно часами собирать семантику, прописывать уйму расширений и создавать максимально релевантные объявления под каждый товар, а потому вам нужен этот понятный и короткий мануал! Читайте дальше!...
15 07 2025 11:22:13
Важно: понимания стоимость конверсии и необходимое количество конверсий, вы можете прогнозировать, сколько денег на рекламу нужно выделить. Вот почему вам может быть полезно это исследование. Читать....
14 07 2025 2:10:40
Как сохранить статистику переходов из органики Google, а также автоматизировать отчетность: подробное руководство для технического специалиста....
13 07 2025 8:52:48
Реклама мобильных приложений. Хотите показывать рекламу в играх? Вам сюда. Узнайте как правильно настроить показ рекламы на мобильных устройствах....
12 07 2025 18:54:43
Всё что нужно знать про SMM...
11 07 2025 21:18:34
Оптимизация и оформление вордовских текстов, переводчик, совместное редактирование, возможность залить картинку... Эти и много других опций дают дополнения для Google Документов....
10 07 2025 13:40:48
Как считать конверсии из Facebook, когда они происходят в Jivosite и Битрикс24....
09 07 2025 13:14:52
Как помешать фейковым 404 страницам испортить статистику вашего сайта?...
08 07 2025 17:59:14
Сет по контекстной рекламе в тематике «разработка программного обеспечения»: снижение стоимости клика на 89%....
07 07 2025 6:24:30
Мануал для SEO-специалистов, как автоматизировать сбор данных из блока People also ask (Пользователи также ищут). Это блок, который показывается в верхней части страницы результатов поиска. Он нужен, чтобы уточнить запрос пользователя....
06 07 2025 21:20:42
Что постить предпринимателям в соцсетях. Несколько примеров уместной работы SMM- и PR-специалистов, которые прямо и четко помогают озвучить позицию бизнеса в период карантина. Узнайте больше, чем действовать правильно!...
05 07 2025 22:35:21
Подробно рассказываем, как создать, внедрить и проверить XML-карту сайта....
04 07 2025 8:44:54
Как эффективно распределять бюджет и ресурсы на обучение сотрудников. Статья будет полезной для собственников бизнеса и HR-специалистов....
03 07 2025 8:35:51
Андрей Чумаченко про будни топ-менеджера, постановку, декомпозицию, помощь и контроль выполнения задач сотрудниками комaнд, которые входят в состав департамента маркетинга, а также о регулярных встречах и тонкостях работы. Узнать больше!...
02 07 2025 9:54:29
Оживший бар. О том, как один украинский бренд за полтора месяца получил более 4 000 фанов!...
01 07 2025 20:22:44
За 10 месяцев сотрудничества увеличили небрендовый на 99%, а общий трафик — в два раза. Рассказываем не только о результатах, но и подходе создания реалистичного прогноза SEO-продвижения сайта. Читать дальше!...
30 06 2025 3:52:16
Как делать мгновенный мониторинг изменений на сайтах? Марина Демьяненко предложила простое решение вопроса с помощью Kimono и таблиц Google....
29 06 2025 23:28:35
LinkedIn хороший инструмент для достижения B2B целей. Пока его редко используют в СНГ, что делает LinkedIn еще привлекательней. В этой социальной сети возможности рекламных форматов и таргетингов почти безграничны. Узнать больше....
28 06 2025 13:39:39
Анализ содержимого сайта показывает: Url разные, а контент страниц одинаковый. Думаете, ничего страшного? Но одинаковый контент может попасть под фильтры поисковых систем. Чтобы этого не произошло, надо знать, как избавляться от внутренних дублей...
27 06 2025 5:21:22
Аналитик Алексей Селезнев описал простой алогритм прогнозирования поисковой активности пользователей в Яндексе....
26 06 2025 12:14:47
На скорость и полноту результатов продвижения влияют конкретные риски. И некоторые из них можно выделить еще до начала сотрудничества. Рассказываем, какие именно....
25 06 2025 2:23:36
Новая инструкция, которую можно применять к любым задачам в Google Таблицах....
24 06 2025 21:49:37
Инструкция для трудоголиков для тех, кто старается выполнить как можно больше заданий, а заметного прогресса при этом нет. Работать много и эффективно не всегда полезно. Если бы эффективная работа была залогом успеха, каждому хомяку воздвигли бы памятник...
23 06 2025 11:41:37
Решили перейти на Google ***ytics 4? Предлагаем разобраться, чем отличается инструмент от предыдущей версии и изучить новинки в отчетах «Демография» и «Технология»....
22 06 2025 10:20:17
Расширяем возможности визуализации данных из Google ***ytics c помощью пакета RGA и Power BI...
21 06 2025 20:40:54
Базовые знания, которые нужны, чтобы ресурс понравился поисковикам и пользователям....
20 06 2025 18:46:43
О том, как сделать сайты интереснее и эффективнее. Гeймификация — применение игровых сценариев и элементов вне игровых контекстов. Это не про создание игр, это про поиск решений, которые помогут сделать любую работу интереснее. Читайте дальше!...
19 06 2025 1:41:30
Николь Лаззаро из XEODesign провела исследование о том, почему мы играем или не играем в игры....
18 06 2025 19:35:18
Как Netpeak работал с сайтом филиала крупного бренда и добился результатов, несмотря на то, что сервера проекта находятся в другой стране....
17 06 2025 11:29:50
Как рекламировать смартфоны в YouTube — советы крупному бизнесу по настройке и запуску эффективной рекламы. Важно: корректный анализ результатов. Узнайте как его сделать!...
16 06 2025 5:59:35
Продвижение музыкальной библиотеки. Со старта сотрудничества, трафик и основной ключ сайта клиента вырос в 10 раз. Регион продвижения — США....
15 06 2025 16:18:48
Недавно у нас появился свой генератор мемов :) Во многих компаниях смешные слова и фразы стараются запомнить и передать следующим поколениям сотрудников. В Netpeak же долго работали над секретным проектом и... Читайте!...
14 06 2025 19:52:37
Как создавать интеpaктивные рассылки-сайты и чем они хороши...
13 06 2025 1:24:43
Динамический ремаркетинг — один из самых эффективных способов продаж для любой группы товаров. В этой статье мы поделимся тонкостями технической подготовки к запуску динамического ремаркетинга в Facebook....
12 06 2025 0:31:49
Проверяем, есть ли разница в ранжировании при наличии/отсутствии этих слов в метаданных. Эксперимент....
11 06 2025 20:41:15
Кейсы с наибольшим количеством комментариев, репостов, оценок и дочитываний; по контекстной рекламе, поисковому продвижению, аналитике, SMM и другие. Узнать больше!...
10 06 2025 0:27:56
Правильное продвижение сайта и нестандартные предложения по привлечению трафика...
09 06 2025 16:35:26
Нужно ли начинать работу с Google Marketing Platform, и если да, то на каком этапе развития бизнеса?...
08 06 2025 10:54:13
Бренды поделились инсайтами на ДиВи Конф — фишки от MEGOGO, Google, TikTok, Banda, McCann, I am IDEA, AIR Brands, Rocket и Фокстрот...
07 06 2025 16:22:19
Человеку стало плохо, он теряет сознание. Те, кто рядом, хотят помочь, но не знают, как это сделать. Давайте разбираться....
06 06 2025 8:38:26
Пиксель Facebook — инструмент аналитики рекламной системы, который можно использовать и для Instagram....
05 06 2025 16:45:46
Лихие девяностые и самые ужасные сайты интернета: образцы, примеры, оформление....
04 06 2025 9:41:18
Как поможет Regex Engines в работе с Google ***ytics и преимущества использования Regex в Диспетчере тегов Google. Узнать больше....
03 06 2025 12:49:43
Как посты и ролики Reels становятся первыми в ленте, сториз, попадают в рекомендации. Instagram впервые напрямую рассказали о том, как оценивают контент....
02 06 2025 5:12:22
Данные по 33,5 миллионов кликов в 26 тематиках и 394 городах...
01 06 2025 9:39:14
Денис Бигус, Bihus.info: с 13 до 457 000 подписчиков на YouTube за четыре года....
31 05 2025 4:14:47
Еще:
понять и запомнить -1 :: понять и запомнить -2 :: понять и запомнить -3 :: понять и запомнить -4 :: понять и запомнить -5 :: понять и запомнить -6 :: понять и запомнить -7 ::