Уникальность текста и «человечность»: чем отличаются и как проверять

«У нас требование: уникальность не ниже 95% и человечность не ниже 90%».
Такая формулировка в техническом задании встречается всё чаще, и почти всегда она означает, что заказчик считает эти два числа одной шкалой. Это не так. Метрики разные, измеряют разное, и текст спокойно бывает стопроцентно уникальным с высокой оценкой машинности — или наоборот.
Разберёмся, что каждая из них показывает, какие цифры разумны и что действительно стоит проверять перед тем, как нажать «опубликовать».
Что вы узнаете из статьи
- Что именно сравнивает проверка уникальности и с чем
- Почему честный авторский текст показывает 82% и это нормально
- Какие цифры разумно требовать для разных типов материалов
- Как отличить настоящую проблему от особенности жанра
- В каком порядке проверять материал перед публикацией
Две метрики и две разные задачи
Начнём с определений, потому что путаница именно в них.
Уникальность — доля текста, которая не совпадает с уже опубликованным в сети. Сервис разбивает ваш материал на фрагменты, ищет совпадения в проиндексированных источниках и считает процент. Задача метрики — поймать копирование.
Оценка машинного происхождения — вероятностное суждение о том, насколько статистические характеристики текста похожи на типичные для языковых моделей. Задача метрики — предположить, как текст создавался. Подробно о том, как работают AI-детекторы, стоит почитать отдельно: там много нюансов, и главный из них — это оценка, а не факт.
Ключевое различие: первая сравнивает вас с другими текстами, вторая — с моделью языка. Пересечения между ними почти нет.
Практический пример. Вы диктуете голосом историю с объекта, расшифровываете и правите — уникальность будет под сто процентов, потому что такого текста в сети нет. Оценка машинности при этом может оказаться высокой, если речь получилась ровной и структурированной. И наоборот: текст, целиком собранный из цитат нормативных документов, покажет низкую уникальность и низкую машинность одновременно.
Откуда берутся низкие проценты у честных текстов
Автор написал материал сам, от первого слова до последнего. Проверка показывает 79%. Дальше начинается нервотрёпка и переписывание того, что переписывать не нужно.
Причины почти всегда в одном из шести мест.
Цитаты и нормативные формулировки. Пункт закона нельзя пересказать своими словами — это исказит смысл. Он совпадёт с сотней источников, и это правильно.
Термины и названия. «Двухтактный двигатель внутреннего сгорания», «ЛДСП толщиной 16 мм», названия стандартов и марок. Уникальными они не будут никогда.
Технические характеристики. Параметры, размеры, температурные режимы. Совпадают, потому что описывают одну и ту же реальность.
Устойчивые обороты профессии. В каждой нише есть фразы, которыми говорят все, и заменять их синонимами — верный способ выглядеть чужаком.
Ваш же текст в другом месте. Материал опубликован на площадке-агрегаторе, продублирован в соцсети или скопирован кем-то без вашего ведома. Проверка честно находит совпадение.
Короткие универсальные фразы. «Что делать, если», «в этом случае стоит», «на практике это означает». Из таких совпадений набирается пара процентов у любого текста.
Роман, который ведёт блог по проектированию систем отопления, полгода бился за 95% и переписывал технические разделы, пока не понял: совпадения давали названия стандартов и формулы теплового расчёта. Убрать их означало сделать материал бесполезным.
Какие цифры разумны
Универсального порога нет, но по типам материалов ориентиры устойчивы.
| Тип материала | Разумная уникальность | Почему так |
|---|---|---|
| Информационная статья в блог | 85–95% | Часть совпадений даёт терминология |
| Технический разбор с нормативами | 75–90% | Цитаты и стандарты неизбежны |
| Юридический материал | 70–85% | Формулировки закона не пересказываются |
| Личная история, кейс | 95–100% | Такого текста в сети быть не может |
| Пост в соцсети | 90–100% | Короткий, без цитат |
Требовать 100% от технической статьи — значит требовать выбросить из неё нормативы. Требовать 100% от юридического материала — требовать исказить формулировки закона.
Отдельно про влияние на поиск. Прямой зависимости позиций от процента уникальности нет. Поиск борется не с процентами, а с бессмысленным дублированием: копия чужой статьи не займёт позиций никогда, а материал с 87% из-за цитат вполне может стоять в первой пятёрке. Если позиций нет, причина почти наверняка в другом — стоит посмотреть, почему статьи не растут в поиске, там двенадцать причин, и уникальности среди них нет.
Когда низкий процент — реальная проблема
Чтобы не впасть в обратную крайность, стоит понимать, где показатель действительно сигнализирует о беде.
- Совпадения идут крупными блоками. Не отдельные фразы, а абзацы целиком, совпадающие с одним источником. Это копирование, как бы оно ни называлось.
- Совпадения с одним сайтом. Если пятнадцать процентов текста совпадают с одной статьёй конкурента, дело не в терминологии.
- Совпадения в тех местах, где должна быть ваша практика. Разделы с примерами и рекомендациями обязаны быть уникальными: если они совпадают, значит, в них нет вас.
- Уникальность падает от материала к материалу. Признак того, что работа идёт по накатанной и материалы начинают повторять друг друга.
Последний пункт — самый недооценённый. Он ловит проблему, которую не видно на одном тексте: блог, где статьи всё сильнее похожи одна на другую, теряет и читателя, и позиции.
Порядок проверки перед публикацией
Метрики полезны, но занимают в этом порядке не первое место. Разумная последовательность выглядит так.
- Факты, цифры, источники. Единственная категория с реальной ценой ошибки.
- Соответствие вашей практике. То, что не проверит ни один сервис.
- Полнота ответа. Закрывает ли материал вопрос, ради которого писался.
- Уникальность. С разбором, откуда взялись совпадения, а не по одному проценту.
- Оценка машинности. Как подсказка, где перечитать внимательнее.
- Читаемость вслух. Ловит то, что глазами пропускается.
Первые три пункта дают восемьдесят процентов пользы. Четвёртый и пятый — вспомогательные сигналы, и относиться к ним стоит соответственно: они показывают, куда посмотреть, а не выносят вердикт.
Полный разбор того, что смотреть в пунктах один-три, собран в материале про чек-лист редактуры из 15 пунктов — там же и про обороты, которые чаще всего портят впечатление.
Что делать, когда заказчик требует невозможного
Ситуация частая: в задании стоит «уникальность 100%, человечность 100%», и обсуждению это не подлежит.
Что помогает в разговоре:
- Показать источник совпадений. Отчёт проверки с подсветкой обычно снимает вопрос: видно, что совпали название стандарта и цитата закона.
- Предложить проверяемый критерий вместо процента. Например: отсутствие блочных совпадений с одним источником больше определённой длины.
- Объяснить цену требования. Стопроцентная уникальность в техническом тексте достигается искажением терминов, а это ошибка, за которую отвечать вам обоим.
- Договориться о сервисе заранее. Разные проверки дают разные цифры на одном тексте, и спорить об этом после сдачи бессмысленно.
Последний пункт стоит закреплять в задании письменно. Он снимает больше конфликтов, чем все остальные вместе взятые.
Часто задаваемые вопросы
Чем уникальность отличается от проверки на машинность?
Первая сравнивает с опубликованными текстами, вторая — со статистикой языковых моделей. Это разные шкалы.
Какая уникальность нормальна для блога?
85–95% для информационной статьи. В технических и юридических темах ниже — из-за цитат и терминов.
Почему честный текст показывает 79%?
Обычно из-за цитат, нормативов, терминов или того, что ваш материал уже опубликован где-то ещё.
Влияет ли процент на позиции?
Прямо — нет. Поиск борется с бессмысленным дублированием, а не с процентами.
Что проверять в первую очередь?
Факты, цифры и источники. Метрики полезны, но идут после них.
Заключение
Уникальность и оценка машинного происхождения — разные инструменты с разными задачами, и требовать от обеих ста процентов означает не понимать, что они измеряют. В технических и юридических текстах низкий процент уникальности часто означает добросовестность автора, а не его недобросовестность: он процитировал норму, а не пересказал её своими словами с искажением.
Читать эти цифры стоит с разбором, а не по итоговому числу. Блочные совпадения с одним источником — проблема. Совпавшее название стандарта — нет. И ни одна из метрик не покажет главного: указана ли в тексте действующая норма и не противоречит ли совет тому, что вы говорите клиентам.
В кабинете ДоброКод есть инструменты для текста — проверка, сокращение под лимиты площадки, SEO-переработка. Мы не обещаем определённых процентов у сторонних сервисов: обещать это невозможно, потому что алгоритмы у них разные и меняются. Что устроено надёжно — сам путь: вы описываете проект в анкете, платформа подбирает ключевые фразы, собирает контент-план и готовит материалы, каждый приходит к вам на проверку, наш контроль качества смотрит длину, лимиты и вхождение ключевых фраз, а публикация уходит только после вашего согласования. Подробнее о платформе: dobro-code.ru.
Читайте также
- AI-детекторы: как они работают и чему верить — подробнее о второй метрике из этой пары
- Как редактировать текст, созданный ИИ: чек-лист из 15 пунктов
- Почему статьи не растут в поиске: 12 причин
Ещё в рубрике «ИИ в контенте»
Виртуальный ведущий в кадре: как это выглядит на самом деле и когда уместно
Разбираем без рекламного тумана: как выглядит ИИ-ведущий в ролике, где зритель этого даже не замечает, а где формат проваливается. И что делать, если хочется, чтобы в кадре было именно ваше лицо.
ИИ в контентеГде ИИ ускоряет работу, а где решение обязан принимать человек: граница ответственности
Какие задачи в контенте разумно ускорять инструментами, а какие остаются за человеком всегда: разбор по типам работы, зоны запрета, признаки того, что границу перешли, и как выстроить процесс.
ИИ в контентеПравила бренда для ИИ: как задать стиль, чтобы все материалы звучали одинаково
Как описать голос бренда так, чтобы им можно было пользоваться: из чего состоят правила, почему прилагательные не работают, как собрать словарь и запреты и что проверять при потоке материалов.