Контент (англ. content — содержимое) - информация, а именно, текст, изображения, видео, файлы, которые расположены на сайте.
Дублирование контента можно наблюдать не только при размещении данных на разных сайтах, но и при повторении информации на двух и более URL-адресов одного веб-проекта. Вот эксперимент на devvver.ru о негативе внутренних дубликатов и как этим могут воспользоваться конкуренты.
Рассмотрим какие инструменты у нас есть в борьбе с этим недугом.
Ссылки на страницу
Единственный стопроцентный способ не дать проиндексироваться странице - не размещать на неё ссылки, пусть даже текстовые и не добавлять её в аддурилки Яндекса, Google и т.п.
Файл robots.txt
Текстовый файл robots.txt (например, для моего блога) прекрасный инструмент для управления индексацией. Справка Yandex, Google. Но если Гугл найдёт ссылку на закрытый в robots.txt URL, то он добавит его в выдачу.
Из-за этого здесь нужно вписывать только те веб-документы, до которых нельзя добраться иным путём, например, фид сайта. И, конечно, sitemap для более качественной и быстрой индексации востребованных страниц.
HTTP заголовок
URL не будет проиндексирован, если код статуса HTTP показывает 404 или 301. А для Google, ещё и когда присутствует строка
X-Robots-Tag: noindex
Мета-теги robots
Это главный инструмент, потому что работает он и для Яндекса и для Гугла одинаково. На странице, доступ к содержимому которой должен быть запрещён, указывается:
<meta name="robots" content="noindex"/>
Атрибут rel="canonical"
Обязательный атрибут rel="canonical" подсказывает предпочитаемый из нескольких web-документов с очень похожим содержанием, например, http://shpargalkablog.ru/2010/07/kontent.html и http://shpargalkablog.ru/2010/07/kontent.html?showComment. Второй поисковая система проигнорирует, поскольку подчинится строке:
<link href='http://shpargalkablog.ru/2010/07/kontent.html' rel='canonical'/>
Для изображений сайта rel="canonical" можно указать в файле .htaccess.
Яндекс.Вебмастер
В Яндекс.Вебмастере-"Настройки индексирования"-"Главное зеркало" необходимо указать основной домен, а именно с www или без него.
Инструменты для вебмастеров Google
Такую же процедуру необходимо сделать в Инструментах для вебмастеров Гугла-"Конфигурация"-"Настройки".
В "Конфигурация"-"Параметры URL" можно заблокировать индексацию страниц, которые содержат в своём URL-адресе определённые фрагменты, например, "default". Эта функция разработана в основном для интернет-магазинов, где навигация реализуется с помощью URL, и где один продукт относится к двум или трём категориям. (подробнее).

media="print"
Не нужно создавать отдельную версию для печати
. Стили можно скорректировать с помощью media="print".
Удаление дубликатов, находящихся в индексе по ошибке
Несмотря на предпринятые меры, поисковые роботы могут проиндексировать нежелательную страницу. Задав запрос
site:shpargalkablog.ruпросмотрите всю выдачу, особенно с опущенными результатами в Гугле. В идеале этой надписи не должно быть:
Опущенные результаты надо убирать вручную. Для Yandex воспользуемся формой удаления страницы, а для Google нужно зайти в "Инструменты для веб-мастеров"-"Оптимизация"-"Удалить URL-адреса"-"Создать новый запрос на удаление".
171 комментарий:
Согласно приведенному коду, будут проиндексированы гл.страница, стат.страницы и сообщения? тогда зачем добавить мета-теги для отдельно взятой страницы??
Или возможны другие ситуации. У меня Яндекс в сниппет (текст под title в выдаче поисковой системе) пишет только так называемые "хлебные крошки" ("С нуля" до знатока→Оптимизация→Дублирование контента Blogger. Пути решения). Я даю ему description для наиболее интересных мне страниц. А то выглядит как-то совсем непривлекательно для пользователей.
на Яндексе посмотрела, что робот уже несколько месяцев не посещал блог. Добавление < meta content='2 days' name='revisit'/> должно повлиять на него?
Насчёт Яндекса очень сомневаюсь. Я делала это - http://shpargalkablog.ru/2010/08/indeksatsiya-yandex.html. Также попробуйте публиковать анонсы в социальных сетях. Здесь главное показать поисковику, что ресурс часто обновляется. Для чего писать статью через/каждый день.
То есть если я через rss или поиск указываю на конретный пост, меня перенаправляют не на отдельну страничку с постом, а в архив, скажем, за сентябрь, где помимо искомого поста висят все сентябрьские.
Возможно причиной этому послужило, что я запретил отображение заголовков постов??
не помог даже откат к стандартному шаблону.
все адреса постов имеют вид типа:
http://tvor-jour.blogspot.com/2009_08_01_archive.html#6871703990490694361
то есть эта ссылка на архив месяца и место на странице. конкретной страницы для поста нет, хотя раньше всё было в порядке...
помогите пожалуйста
"инерция" движка, видимо
спасибо за отклик!
Подскажите пути решения.
И можно ли как ни будь переиндексировать сайт?
Решение: частота обновления сайта. Чем чаще будете писать новые сообщения, тем чаще вас будет посещать бот поисковой системы и, следовательно, переиндексироваться страница.
Я правильно понял, если я не хочу закрывать никакие страницы, то эту часть предложенного кода я убираю и себе не вставляю
правильно?
И всё же я советую сделать как у меня, иначе дубликатов будет не избежать.
уже все вставляю по вашему шаблону, все равно выдает ошибку:
Не удалось проанализировать ваш шаблон, так как он неправильно сформирован. Убедитесь, что все элементы XML правильно закрыты.
Сообщение об ошибке в XML: The processing instruction must begin with the name of the target.
Теперь буду пробовать еще добавить отдельно индексацию других страниц.
СпасибО!
Я использую этот вариант не часто и только для некоторых из.
Спасибо!
Будем ждать результатов!
Какие стоит там изменить параметры?
noindex - запрещаем индексацию текста,
follow - разрешаем переходить по ссылкам на странице и индексировать ссылки. Это улучшит индексацию всего блога.
http://www.blogger.com/profile/13678598579086551999
Вопрос1: А когда нужно ставить мета-теги для отдельной страницы или сообщения? И стоит ли это делать, если ключевые слова повторяют те, что на главной? Описание чуть конкретизировано (прописан город заказов)
Вопрос2:Удалила ненужные страницы из индексации. Но там такие странные остались.
Название блога_месяц и год опубликования постов (показывает все сообщения, как в архиве).
Название блога (показывает 1ую страницу)
Название блога_первое приклеенное сообщение (та же страница)
А некоторые посты отдельно проиндексированы.
Вопрос2: страницы архива нужно убирать из кэша
http://имя.blogspot.com/2011_12_01_archive.html.
У вас уже расставлены правильные мета-теги, поэтому осталось зайти в вебмастер.
Должны остаться только Главная и посты каждый на своей странице.
2) ссылки оформлять как заголовки h2, чтоб на их название был акцент? (если я правильно все понимаю)
http://www.blogger.com/profile/13678598579086551999
2) На Главной для блога неминуемо оформление заголовка статьи в ссылку. Это делается в первую очередь для удобства пользователей. В других случаях не рекомендуется теги h1-h6 заключать в ссылку (тег a).
P.S. у меня смутное чувство, что не смогла раскрыть ответ на ваш вопрос и поняла его не верно.
по 1) В рубрике Заказать платье у меня есть несколько постов, но индексируется только первый. Остальные нет, хотя я уже ссылки внутренние организовала. Может их считают одинаковым контентом. Я старалась разнообразить, но....где же мои посты))
3) Я прописала в description для определенного поста (http://bestcrochetdress.blogspot.com/2011/03/gde-kupitzakazat-platie.html) то, что я хочу, чтоб высвечивалось как описание статьи, а у меня все равно там описание блога. Не прравильно что-то сделала?
Спасибо Вам! Вы - герой! Я разобралась как не индексировать статьи и страницы! Ура!
3) Это несколько разные понятия. Мета-тег - его показывают в сниппете в поисковой выдаче, он является служебной информацией и не виден внутри страницы. Его не стоит делать таким длинным - 1-2 предложения.
И "Описание блога", которое видит читатель под заголовком. В шаблоне можно его прописать так:
<div class='descriptionwrapper'><b:if cond='data:blog.url == "http://bestcrochetdress.blogspot.com/2011/03/gde-kupitzakazat-platie.html"'>
<p class='description'><span>ваш текст.</span></p><b:else/><p class='description'><span><data:description/></span></p>
</b:if></div>
</b:includable>
В выдаче поисковой системы в сниппете всегда описание блога, а я хочу, чтоб по определенным статьям, например (gde kupit...) в спиппет попадало то, что я хочу. Это я прописала в description для этой статьи. но в сниппете по этой статье все равно описание блога.
< meta content='noindex,follow' name='robots'/>
< title>
точно стоит noindex,follow , а не noindex,nofollow ??
и Яндекс меня все равно не любит, блог уже давно добавлен в т.н. аддурилку
Я вот отказался от ярлыков и от содержания(карты блога). Я сделал отдельно скрытые страницы вместо ярлыков и прописал там текстовые ссылки на каждое сообщение(каждый пост). Также вместо гаджета ярлыки я использовал гаджет для HTML-кода и прописал там ссылки на скрытые страницы, на которых ссылки на каждый пост. (Скрытые - они есть на самом деле, только не стоят во вкладках). 1) Это, конечно, добавляет мне много ручной работы, но как вы думаете, я избавлюсь таким образом от дублирующего контента? Ещё я ссылки скрытых страниц прописал в шаблоне для поисковиков. Да, и запрет на индексацию архива сделал с помощью такого кода:
< b:if cond='data:blog.pageType == "archive"' >
< meta content='noindex,follow' name='robots'/ >
< /b:if>
< b:if cond='data:blog.url != data:blog.homepageUrl' >
< meta content='noindex,follow' name='robots'/ >
< /b:if >
< /b:if >
(поставил пробелы < код > )
2) Вы не знаете, актуален этот код?
Теперь собираюсь сделать главную страницу статической, т.е. неизменной. 3) Необходимо на неё ставить запрет на индексацию? Если, конечно, она дублируется.
Спасибо!!!
Саша
Можете посмотреть здесь:
http://litobzory.blogspot.com/
Саша
Да, сообщение, которое в этом случае будет на главной нужно закрыть от индексации (http://shpargalkablog.ru/2010/07/vsegda-sverhu.html)
Спасибо. Как сделай главную, закрою её от индексации.
Можно я ещё вам задан один вопрос?
На блогспоте можно купить доменное имя для своего блога. Вы не знаете, это имя будет единично только для одного блога, или с этим доменным именем можно будет, допустим, сделать свой сайт на платном хостинге?
Заблокировано по строке 5: Disallow: /search
Осталось удалить их из индекса.
А если у меня прописан такой вот код:
< title >: < /title >
< title >< /title >
- чтобы сначала в поиске стояло название статьи, а потом название блога.
Тогда, чтобы запретить индексацию главной, мне просто нужно этот код вставить вместо строчки:
< title >< /title >
А остальное как у вас прописать?
Я запутался)))
Конечно, один раз прописано.
Всё, больше не буду вас отвлекать своими дурацкими вопросами.
Спасибо!
Не, закрывать от индексации Главную не нужно. На неё идёт больше всего ссылок как внешних, так и внутренних. Будем закрывать внутреннюю и удалять все ссылки на неё ведущие.
<b:if cond='data:blog.url == "http://адрес_вашей_строницы/"'>
<meta content='noindex,nofollow' name='robots'/>
</b:if>
просто я врач-психотерапевт, и поэтому, даже когда я наблюдаю что-то понятное, мой мозг мгновенно дифференцирует это на множество возможных переменных.
издержки профессии:)
Нет никаких противопоказаний для этого?
1) на содержание больше нет ссылок со странице, например, в боковом или верхнем меню. Здесь не действует правило: 1+1=2. Вес каждой последующей ссылки ниже.
2) Страница с оглавлением должно хорошо индексироваться, а следовательно не оформлена скриптом. Иначе теряется её ценность для поисковиков.
По-поводу вопроса, я напишу в ближайшее время отдельный пост. У меня уже по блогу раскиданы определённые моменты. Думаю, интересно их будет объединить.
И ссылка на комменты, достаточно удалить дату комментария?
По поводу комментариев их может закрыть noindex,nofollow?!
Я просто сейчас понять не могу что у меня дублируется, страниц 702 а в гугл 1904)))
Это скорее всего страницы архива, страницы "След"-"Пред" или ярлыков. Дубликаты нужно обязательно убирать.
Может что то ещё?!
Мне мета помогли, более ничего не делала. Хотя на ярлыки у меня нет ссылок.
Какой скрипт? Google из скриптов ссылки выделяет.
И со страницами ярлыков все-таки что-то не то. В результатах поиска их не показывает, но в веб-мастере они все-равно есть. Хотя я даже убрал эти ярлыки со страниц. Оставил только 26 ярлыков, а ввеб-мастер показывает 120.(
И в новых страницах www автоматом появляется...
Спасибо.
Май, июнь, июль...
Это как-то можно убрать? :)
site:olegabramov.ru
Ой, как все сложно, когда не знаешь, как нужно)
У меня вопрос в связи со сменой домена: в коде html нужно ззаново прописывать все для нового адреса?
Старайтесь отдавать предпочтение официальным данным.
<b:if cond='data:blog.url == "http://адрес_страницы/"'>
.................
</b:if>
Новый сайт (подобие интернет-магазина) пока проиндексирован google так: страница КАТАЛОГ и внутренние страницы каталога. Причем, одна страница проиндексирована в разных вариациях: сортировка по цене, по названию, списком, таблицей. Куча одинаковой инфо в разных вариациях. Прописывать noindex для всех ненужных страниц? Их так много получится!!!
"http://shpargalkablog.ru/2011/05/float-left-div-css.html#comments"
у Вас я смотрю она не индексируется. У меня же после краткой новости яша сразу ее индексирует и сама статья вылетает из индекса
Пример: После новости стоит 0 коммент., или 5 комментариев и по ней идет ссылка например у вас она как-то закрыта http://shpargalkablog.ru/2011/05/float-left-div-css.html#comments
<span class='post-comment-link'>
<b:if cond='data:blog.pageType != "item"'>
<b:if cond='data:blog.pageType != "static_page"'>
<b:if cond='data:post.allowComments'>
<a class='comment-link' expr:href='data:post.addCommentUrl' expr:onclick='data:post.addCommentOnclick'><b:if cond='data:post.numComments == 1'>1 <data:top.commentLabel/><b:else/><data:post.numComments/> <data:top.commentLabelPlural/></b:if></a>
</b:if>
</b:if>
</b:if>
</span>
удаляем два фрагмента:
<a class='comment-link' expr:href='data:post.addCommentUrl' expr:onclick='data:post.addCommentOnclick'>
</a>
вот скрин блога, при просмотре блога после каждого сообщения стоит 0 или 5 комментариев и эта ссылка имеет вид типа http://www.interview-blog.ru/2011/05/blog-post_1415.html#comments зайдите к примеру на главную блога interview-blog.ru
ее яша и индексирует более месяца, а саму статью выбрасывает из индекса
Иначе надо RSS перевести на Feedburner - http://shpargalkablog.ru/2010/07/zarabotok-na-rss-s-nulya.html. Тогда будет осуществляться автоматическая переадресация. В Feedburner вкладка "Публикуй"-"NoIndex" укажите оба флажка.
Спасибо.
у меня какая-то ерунда начала происходить - в исходном коде исчезли теги RSS
link rel="alternate"
link rel="service.post"
и эти, не знаю, относятся они к RSS или нет:
link rel="EditURI"
link rel="me"
link rel="openid.server"
хотя я ничего не менял и не удалял. почему так, не знаете?
Саша. http://www.a-s-petrov.ru/
<b:include data='blog' name='all-head-content'/>
из шаблона HTML после <head>. Проверьте, пожалуйста, наличие данной строки.
Нет, не относятся.
вот я растяпа, даже не заметил, как удалил:))
<title>Секрет красоты: Мой бизнес</title>
<title>Секрет красоты</title>
Точное написание как у вас я не знаю, нужен код шаблона. Ищите лишний
<title><data:blog.title/></title>
Постоянно пользуюсь советами с вашего сайта, все очень доходчиво и понятно даже такому "чайнику" как мне:) Но в этом вопросе я совсем запуталась :(
Разъясните мне, пожалуйста, если я для блога в файле robots оставлю открытыми только главную и статические страницы, то как поисковик проиндексирует остальные страницы(они у меня еще далеко не все в индексе)? По внутренним ссылкам и ссылкам Следующая-Предыдущая с Главной страницы? Или надо создать отдельную статическую страницу с картой сайта, как я видела на многих блогах? Но ведь тогда она, по-моему, все равно дублирует содержание и является просто аналогом ярлыков?
Таня http://ta-vi-ka.blogspot.com/
Гугл черпает информацию из RSS-ленты, Яндекс из твитера (по моим предположениям). У меня в индекс статьи залетают в основном после их передачи в RSS ленту, из которой идёт трансляция в твитер.
Следующая-Предыдущая будет закрыта от индексации.
Да, по внутренним ссылкам, с Главной или ссылкам с гаджетов в боковой панели. Справа у меня гаджеты с последними опубликованными сообщениями.
Не в индексе какой поисковой системы у вас страницы?
У меня в Яндексе только одна страница. А в Гугле 256 из 323 (и скорее всего из них много повторяющихся)
Дело в том, что я, похоже, сделала большую ошибку, создав блог в январе этого года, а посты перенеся из моей странички на форуме и некоторых других ресурсов в блог "задним числом" аж до 2009. Поэтому сообщений много, но поисковики их не индексировали. Если я "закрою" архив и ярлыки, то проиндексируются ли эти сообщения когда-нибудь вообще?
Заранее спасибо за ответ.
В Гугл можно через форму загнать http://www.google.ru/intl/ru/addurl.html , но он обычно всё в индекс подбирает, мета и robots.txt ему не всегда указ, особенно при наличии кнопки +1, просто эти страницы реже в индекс залетают.
А так ничего хорошего, если страницы, с которых вы переносили материал уже есть в индексе - они будут приняты за первоисточник, а ваш блог получится наполненным копипастом. Если переносили, то нужно было всё же добиваться уникальности, то есть заново писать материал другими словами, а вот мысли могли быть идентичными.
LinkWithin - не проверяла, но не думаю, что он их увидит. Это только для удобства читателей.
Страны разные, всем не угодишь: что дозволено Юпитеру не дозволено быку. Поэтому и были созданы копии для разных стран.
description не сохраняется в настройках. При перезагрузке странице( даже нажав Сохранить настройки) description исчезает
пробовала несколько раз и ничего не сохраняется. Подскажите, как быть?
<b:if cond='data:blog.metaDescription != ""'>
<meta expr:content='data:blog.metaDescription' name='description'/>
</b:if>
Не сохраняются в редакторе или отсутствует на странице?
а сейчас я в него просто влюбился
Спасибо огромное
напишу три статьи в alltoday c ссылкой на ваш блог, чтоб хоть как-то вас отблагодарить
спасибо, а то просто ужас... Такое некоторые насоветовали
Я же не веб маньяк, я таких и слов не знаю
а у вас все по человечески
Просто счастлив
простите за захламление эфира
напишите на почту мою bercut13@yandex.ru какие три анкора мне применить для ссылок на ваш блог. Будет три статьи с одной ссылкой в каждую. Про заработок могу написать и интернет. Естественно, 100% уникальности.
Я не гонюсь за ссылочным (хотя приятно и полезно для блога когда оно увеличивается), поэтому на ваше усмотрение, чтобы в тексте лаконично было. Естественные ссылки намного трудней заполучить и ценятся они выше.
Я бы убрала. По опыту знаю - Гугл может давать трафика поболее Яндекса (до прихода Пингвина)))).
Гугл в индекс забирает всё подряд. Тем более если robots.txt запрещает, а мета-тег разрешает. Проверьте мета-теги, на этих страницах у вас index,follow.
1) проблемы с региональными доменами blogspot, когда в индексе оказываются и blogspot.ru, и blogspot.com (более вероятный),
2) angel-mans.blogspot.ru был признан аффилированным сайтом fotovknige.ru.
Обратитесь к http://webmaster.yandex.ru/site/feedback.xml за более подробными разъяснениями.
Попробуйте обратиться к Эльдусу http://blogger.omg-linux.ru/2013/01/regionalnie-zerkala.html Он сейчас активно интересуется проблемой региональных доменов.
У меня такой вопрос. Я по старинке пишу название поста на транслите, а после публикации переименовываю. Понимаю, что с появлением нового интерфейса необходимость писать на транслите отпала, но если я этого не делаю, то получаю вот такое angel-mans.blogspot.ru/2013/02/blog-post.html. То есть названия нет по сути. Что я делаю ни так, подскажите пожалуйста.
Некоторые предлагают такой вариант:
User-agent: Mediapartners-Google
Disallow:
User-agent: *
Disallow: /search
Disallow: /*archive
Allow: /
ЧТо на это скажете?
Sitemap я прописала только для Гугла, так как домен не совпадает. Если бы он был http://shpargalkablog.ru/sitemap.xml, то сделала бы для всех поисковиков.
Собственно говоря вам нужна эта статья http://shpargalkablog.ru/2010/09/optimizatsiya-blogger.html
User-agent: *
Allow: /
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/
Disallow: /trackback/
Disallow: /feed/
Disallow: /comments/
Disallow: */trackback/
Disallow: */feed/
Disallow: */comments/
Disallow: /?feed=
Disallow: /cgi-bin/
Sitemap: http://ritabk.ru/sitemap.xml
Sitemap: http://ritabk.ru/sitemap.xml.gz
Disallow: /vse-stat-i-bloga/
User-agent: Yandex
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/
Disallow: /trackback/
Disallow: /feed/
Disallow: /comments/
Disallow: */trackback/
Disallow: */feed/
Disallow: */comments/
Disallow: /?feed=
Disallow: /cgi-bin/
Host: ritabk.ru