
С 1 марта 2026 года действует федеральный закон № 168-ФЗ о защите русского языка: он запрещает использовать иностранные слова в публичных текстах, если у них есть общеупотребительные русские аналоги. Под запрет попадают не только слова, написанные латиницей, но и транслитерации кириллицей. Контроль разделён между двумя ведомствами — Роспотребнадзор занимается нарушениями в связке с законом о защите прав потребителей, ФАС проверяет рекламные тексты с иностранными словами.
Открытых практик предписаний по сайтам пока нет: закон слишком свежий. Но проверки, скорее всего, начнутся не по инициативе регуляторов, а по жалобам — а к 2027 году правительство планирует запустить систему «Национальный словарный фонд», которая может стать основой для массовых автоматических проверок. Для владельца сайта, интернет-магазина или рекламной площадки это означает, что вопрос «как проверить контент на соответствие закону» рано или поздно встанет независимо от масштаба бизнеса. Разберём, какими способами это можно сделать и где у каждого есть предел.
Что именно требует закон
Юристам, которые переводили текст 168-ФЗ в техническое задание для разработки, пришлось выделить три конкретных правила.
Первое — идентификация недопустимых заимствований. Слово нужно сверить с четырьмя словарями, утверждёнными РАН: орфографическим, орфоэпическим, толковым и словарём иностранных слов. Если аналог в этих словарях уже устоялся, использовать иностранный вариант нельзя.
Второе — исключения. Закон требует заменять или пояснять иностранные слова, но не трогает зарегистрированные товарные знаки, фирменные наименования и термины без русских аналогов. Значит, любая проверка должна сверяться не только со словарями, но и с реестром Роспатента и внутренним белым списком компании.
Третье — контекстуальная замена. Механическая подстановка слова из словаря может исказить смысл фразы. Пример из практики: «У нас лучший оффер на рынке» нельзя автоматически превратить в «лучшее предложение работы», если компания продаёт товары, а не вакансии. Замена должна согласовываться по роду, числу и падежу и сохранять исходный смысл.
Эти три правила — не формальность, а критерий, по которому можно оценить, справится ли выбранный способ проверки с задачей вообще.
Три варианта и где заканчиваются их возможности
Ручная проверка. Контент-менеджер читает страницу, ищет заимствования, подбирает замену вручную. На тестовых данных одна страница занимала около часа — с учётом объёма текста и числа спорных слов. Для сайта-визитки из десяти страниц это разумный вариант: неделя работы закроет весь объём. Для портала на сотни страниц это уже недели или месяцы, за которые часть контента успеет обновиться и потребовать повторной проверки.
Обычный AI-чат вроде ChatGPT. Кажется очевидным решением — скормить текст модели и попросить найти заимствования. На практике здесь накапливается сразу несколько ограничений.
Ответ модели вероятностный: при одинаковом запросе она может по-разному интерпретировать один и тот же спорный случай, а для юридически значимой проверки нужен воспроизводимый результат. У чатов есть лимит на объём текста за один запрос — попытка отправить полный HTML-код страницы в большинстве случаев упрётся в отказ, и текст придётся дробить на части вручную. По деньгам без предварительной фильтрации каждая страница потребует оплаты токенов за весь текст, включая слова, которые заведомо не требуют проверки, потому что уже есть в нормативных словарях — при сотнях страниц счёт быстро растёт. Отдельный риск — выгрузка контента из CMS в сторонний чат: там могут оказаться непубличные и staging-страницы, внутренние документы, а если в тексте есть персональные данные, добавляется вопрос трансграничной передачи по 152-ФЗ. И наконец, дисклеймер любого AI-чата о том, что модель может ошибаться, не станет аргументом в суде или при разбирательстве в ФАС — ответственность за контент всё равно на владельце сайта.
Есть и более техническая проблема: нормативные словари РАН — это издания и веб-доступ, а не машиночитаемый датасет со свободной лицензией. Модель общего назначения не знает, какие заимствования уже стали нормой, а какие требуют замены, и не знает, какие слова конкретной компании входят в белый список — товарные знаки, фирменные термины. Без такого списка в промпте проверка даст ложные срабатывания.
Специализированный pipeline. В качестве примера показателен пилотный сервис одной комплаенс-команды, который построен на многоступенчатой фильтрации, а не на прямой отправке текста в модель.
Работа идёт в пять этапов. Сначала сервис извлекает из HTML-страницы только текстовый контент, отбрасывая разметку и код. Затем первичный фильтр исключает слова из нормативных словарей, пользовательского белого списка и зарегистрированные названия — объём текста для дальнейшего анализа сокращается в несколько раз. На третьем этапе формируется список потенциально проблемных слов: то, чего нет в словарях, что похоже на англицизм из внутренней базы, что написано латиницей. И только этот отфильтрованный остаток — обычно небольшой фрагмент — передаётся в LLM, которая решает задачи, плохо поддающиеся формализации: оценивает контекст, подбирает точный синоним, отбраковывает случаи, где предложенная замена сама оказывается заимствованием. В пилоте использовался GigaChat API, но архитектура не привязана к конкретному провайдеру. Последний этап — отчёт с готовыми рекомендациями, которые контент-менеджер утверждает и вносит на сайт.
Отдельная часть конвейера — распознавание текста на изображениях через Yandex Cloud Vision, потому что заимствования могут скрываться в баннерах и иллюстрациях, а не только в тексте страницы. Чтобы не тратить ресурсы впустую, изображения кешируются по хешу, мелкие иконки отсеиваются по размеру, а логотипы и товарные знаки автоматически уходят в исключения.
Результат тестирования: адаптация одной страницы вручную занимала около часа, через сервис — от двух до десяти минут. Итоговая разница — примерно в 20 раз.
Как выбрать между вариантами
Критерий здесь не в том, какой способ современнее, а в том, какому объёму и какому уровню риска он соответствует.
Для сайта-визитки на 10–20 страниц ручная проверка по словарям обычно быстрее, чем настройка автоматизированного pipeline: разово потратить день на вычитку дешевле, чем разворачивать сервис.
Обычный AI-чат имеет смысл как черновой инструмент для отдельной страницы или статьи — быстро прикинуть, есть ли явные заимствования, — но не как система проверки для публикации без последующей ручной сверки со словарями и белым списком.
Для порталов от сотен страниц, а тем более для сайтов финтеха, фармы и крупного e-commerce весы смещаются в сторону специализированного решения. Здесь дополнительно накладывается требование хранить данные на российской инфраструктуре — это не пожелание, а законодательная норма для ряда отраслей, и она сама по себе исключает выгрузку контента в зарубежные сервисы. Для таких сайтов даже небольшая экономия времени на странице умножается на объём и оборачивается ощутимой разницей в сроках приведения контента в порядок.
Пока практики штрафов по 168-ФЗ не накопилось, у бизнеса есть время выбрать способ проверки осознанно, а не в спешке после первой жалобы. Но с запуском «Национального словарного фонда» к 2027 году проверки, вероятно, станут массовыми и автоматическими — и тогда разница между разовой вычиткой и настроенным процессом перестанет быть вопросом удобства.
Обсудить проект
Остались вопросы? Напишите нам
Оставьте имя и телефон — перезвоним в течение часа, разберём задачу и предложим решение.