Шингл (shingle, от англ. to shingle — крыть гонтом) — метод сравнения текстовых документов путём разбиения текста на перекрывающиеся фрагменты фиксированной длины (шинглы) и последующего сравнения наборов таких фрагментов. Метод широко применяется для обнаружения дублированного контента, плагиата и близких текстов.
В SEO-практике шинглинг лежит в основе алгоритмов проверки уникальности текста, которые используют как поисковые системы, так и специализированные сервисы (Text.ru, Advego Plagiatus, Etxt.ru). Понимание принципа работы шинглов помогает осознанно работать с уникальностью контента.
Как работает метод шинглов
Алгоритм разбивает текст на последовательные группы слов — шинглы. Например, для шинглов размером 5 слов текст «Как продвинуть сайт в поиске Google и Яндексе» превращается в:
- «Как продвинуть сайт в поиске»
- «продвинуть сайт в поиске Google»
- «сайт в поиске Google и»
- «в поиске Google и Яндексе»
Для каждого шингла вычисляется хеш (числовое представление). Уникальность двух текстов определяется как доля несовпадающих хешей:
Уникальность = (число уникальных шинглов / общее число шинглов) × 100%
Размер шингла и его влияние на оценку
Размер шингла — ключевой параметр, влияющий на чувствительность алгоритма:
- Малый шингл (2–3 слова) — очень чувствительный. Даже обычные речевые обороты («в данном случае», «необходимо учитывать») совпадают у разных текстов. Даёт ложные срабатывания.
- Средний шингл (5–7 слов) — оптимальный баланс. Используется большинством сервисов проверки уникальности.
- Большой шингл (10+ слов) — слабо чувствительный. Обнаруживает только дословное копирование больших фрагментов.
Шинглинг в поисковых системах
Google использует шинглинг или аналогичные методы для определения дублированного контента между страницами. Когда поисковик обнаруживает, что значительная часть шинглов страницы совпадает с уже проиндексированными документами, он может:
- Выбрать «оригинальную» страницу для показа в выдаче, игнорируя дубли.
- Снизить оценку страницы за неоригинальный контент.
- Применить фильтр Panda при систематическом дублировании по всему сайту.
Практические выводы для SEO
- Уникальность 80%+ достаточна для большинства коммерческих страниц. 95%+ нужна для информационного контента, претендующего на лидерство.
- «Рерайт» через синонимайзер не работает — замена слов при сохранении структуры предложений даёт низкий процент уникальности по шинглам. Алгоритм определяет похожие структуры даже при другом словаре.
- Смысловое переосмысление лучше дословного рерайта — полностью переписанный текст с теми же фактами, но другой структурой и подачей, будет уникальным.
Часто задаваемые вопросы
Какой процент уникальности нужен для SEO?
Нет единого порога. Text.ru и другие сервисы ориентировочно считают уникальным текст с 80%+. Для продающих страниц и карточек товаров 70–80% обычно достаточно — полностью оригинальные описания сотен похожих товаров практически нереальны. Для информационных статей, претендующих на топ по конкурентным запросам, рекомендуется 90–95%. Важнее другое: низкая уникальность — симптом, что контент дублирован. Лечите причину, а не симптом.
Используют ли поисковики те же сервисы проверки уникальности, что и SEO-специалисты?
Нет. Google и Яндекс используют собственные, значительно более мощные алгоритмы сравнения документов, основанные на нейросетевых эмбеддингах — они понимают семантическое сходство текстов, а не только лексическое. Поэтому текст может показывать 95% уникальности в Text.ru, но при этом быть «семантически дублированным» с точки зрения Google. И наоборот — тексты могут быть лексически похожи, но Google понимает, что они о разном.
Влияет ли уникальность контента на позиции напрямую?
Не напрямую как метрика, но через следствия. Дублированный контент → поисковик выбирает «оригинал» и игнорирует дубль → страница не ранжируется. Уникальный контент → нет проблемы дублей → страница оценивается по другим факторам. Уникальность — необходимое, но не достаточное условие для ранжирования. Уникальная, но бесполезная страница всё равно не будет в топе.
Как проверить, есть ли дублированный контент на сайте?
Несколько методов: 1) Google Search Console → Покрытие: статус «Дублирующаяся страница» укажет на явные дубли. 2) Screaming Frog: анализирует все страницы сайта и выявляет одинаковые Title, Description и текстовый контент. 3) Siteliner.com: специализированный инструмент для обнаружения внутреннего дублирования. 4) Ручная проверка: запрос site:вашсайт.ru «уникальная фраза из подозрительной страницы» покажет, есть ли дубли.