Анализ когнитивной токсичности
Вставьте юридический текст или загрузите файл (PDF, DOCX, TXT). Система рассчитает Вальтер-Индекс, выделит проблемные места и даст конкретные рекомендации.
Исходный текст
Подсветка проблемных мест
Результат появится после анализа...
Длинные предложения
Пассивный залог
Канцеляризмы
Двойные отрицания
Цепочки род. падежа
Сравнение: до и после доработки
Вставьте исходный текст и его улучшенную версию — система покажет изменение Вальтер-Индекса и всех классических индексов.
📄 До доработки
—
✅ После доработки
—
6 классических индексов удобочитаемости
Справочная информация о каждом индексе: что измеряет, формула, шкала интерпретации, адаптация для русского языка. Все 6 индексов показываются как справочный блок рядом с Вальтер-Индексом.
Флеш-ОбФлеш–Оборнева
Оценивает общую читаемость текста через среднюю длину предложений (ASL) и среднее количество слогов на слово (ASW). Чем выше значение — тем проще текст. Наиболее распространённая формула для русского языка в академической среде. Коэффициенты пересчитаны Оборневой на основе анализа учебных текстов.
FRE_RU = 206,835 − 1,52 × ASL − 65,14 × ASW
Шкала (выше = проще):
0 — Очень сложно30507090100 — Очень просто
⚠ Калибровка на учебных текстах, не на юридических. Абсолютные значения для правовых актов занижены — воспринимайте как ориентир.
ARIARI–Бегтин
Автоматизированный индекс удобочитаемости. Использует количество символов на слово вместо слогов — это делает его устойчивым к ошибкам слогового разбора. Адаптирован Бегтиным на наборе из 68 русских текстов, классифицированных по уровню образования (от 3 класса до 6 курса вуза). Результат интерпретируется как класс образования читателя.
ARI_RU = 6,26 × (символы/слова) + 0,2805 × (слова/предложения) − 31,04
Шкала (класс образования читателя):
6 кл.8 кл.10 кл.12 кл.14 кл.Вуз
⚠ Приближение для русского. Юридические тексты, как правило, попадают в диапазон 12–16 классов.
CLColeman–Liau
Индекс, основанный исключительно на символах и предложениях — без подсчёта слогов. Это делает его особенно устойчивым при автоматической обработке. Формула рассчитывает условный класс образования на основе средней длины слов и плотности предложений. Для русского применяется без изменения формулы, но с пониманием, что русские слова в среднем длиннее английских.
CLI = 5,89 × (символы/слова) − 30 × (предложения/слова) − 15,8
Шкала (класс образования):
6 кл.8 кл.10 кл.12 кл.Вуз
⚠ Значения для русского систематически завышены из-за большей длины слов. Используйте в сравнении, а не абсолютно.
LIXLIX (Läsbarhetsindex)
Шведский индекс читаемости. Прост в расчёте и не зависит от слогового анализа. Складывается из двух составляющих: средней длины предложения и доли длинных слов (более 6 букв). Хорошо работает с русским языком без дополнительной адаптации, поскольку не требует ни морфологии, ни слогов — только буквы.
LIX = (слова / предложения) + (слова > 6 букв / слова) × 100
Шкала:
<30 Очень легко30–40 Легко40–50 Средне50–60 Сложно>60 Очень сложно
✓ Наиболее универсальный из 6 индексов. Рекомендуется как основной ориентир при первичной оценке.
SMOGSMOG Index
Simple Measure of Gobbledygook — «простое измерение тарабарщины». Оценивает долю многосложных слов (≥ 3 слогов). Для вычисления требуется минимум 3 предложения. Считается одним из наиболее надёжных предикторов реальной трудности восприятия. Для русского порог слогов сохранён (≥ 3), хотя русские слова в среднем многосложнее английских.
SMOG = 1,043 × √(слова ≥ 3 слогов × 30 / предложения) + 3,1291
Шкала (класс образования):
6 кл.8 кл.10 кл.12 кл.14+ кл.
⚠ Приближение для русского: порог 3 слога не калиброван на русских юридических текстах. Требует ≥ 3 предложений.
FogGunning Fog
Индекс туманности текста. Оценивает, сколько лет образования нужно читателю. Учитывает длину предложений и долю «сложных» слов. Для русского языка порог сложности повышен до 4 слогов (против 3 в оригинале) и добавлен коэффициент коррекции 0,78 — поскольку русские слова длиннее. Всё равно остаётся приближением.
FOG_RU = 0,78 × 0,4 × (слова/предложения + слова≥4слогов/слова × 100)
Шкала:
≤6 Легко≤9≤12 Средне≤14>14 Специалисты
⚠ Помечаем как приближение. Адаптация неполная из-за отсутствия калибровки на русском корпусе.
Вальтер-Индекс: методология
Индекс Когнитивно-Правовой Сложности Вальтера (ИКПС-В) — комплексная метрика когнитивной токсичности юридических текстов.
VIКонцепция: когнитивная токсичность
Вальтер-Индекс измеряет когнитивную токсичность юридического текста — количество умственных усилий, необходимых читателю для его обработки. Чем выше балл (ближе к 100), тем ниже токсичность и выше качество текста. В отличие от существующих инструментов, ориентированных только на синтаксис, Вальтер-Индекс трёхмерный: синтаксис, лексика и семантика.
VI = 0,50 × S + 0,25 × L + 0,25 × M (0–100, выше = лучше)
Градации качества:
76–100
Высокое
Высокое
51–75
Среднее
Среднее
26–50
Низкое
Низкое
0–25
Критическое
Критическое
⚠ Весовые коэффициенты (0,50 / 0,25 / 0,25) — экспертный приор. Финальная калибровка выполняется на корпусе RusLawOD (281 413 документов, 1991–2023). До перекалибровки значения предварительные.
SКомпонент 1: Синтаксис (вес 0,50)
Оценивает структурную сложность предложений. Вычисляется через синтаксический парсер spaCy (ru_core_news_md) + pymorphy2. Основан на общих признаках синтаксиса зависимостей из теории Гибсона (Dependency Locality Theory).
Признаки:
1. Средняя длина предложения (слов) — норма ≤ 25
2. Доля длинных предложений (> 40 слов)
3. Доля пассивных конструкций — норма < 20%
4. Частота причастных оборотов (на предложение)
5. Частота деепричастных оборотов (на предложение)
6. Цепочки родительного падежа — норма ≤ 2 слов подряд
7. Расстояние между зависимыми словами (DLT-прокси, внутренний)
1. Средняя длина предложения (слов) — норма ≤ 25
2. Доля длинных предложений (> 40 слов)
3. Доля пассивных конструкций — норма < 20%
4. Частота причастных оборотов (на предложение)
5. Частота деепричастных оборотов (на предложение)
6. Цепочки родительного падежа — норма ≤ 2 слов подряд
7. Расстояние между зависимыми словами (DLT-прокси, внутренний)
Источник: Gibson E. Linguistic complexity: locality of syntactic dependencies // Cognition. 1998. Vol. 68. P. 1–76.
LКомпонент 2: Лексика (вес 0,25) — ядро фишки
Оценивает доступность словарного состава. Это основная область оригинальности — классические формулы удобочитаемости этого не делают в готовом виде.
Признаки:
1. Средняя частотность лемм по словарю Ляшевской–Шарова (ipm) → редкость лексики
2. Плотность юридической терминологии (доля терминов)
3. Канцеляризмы — словарь ~200 единиц
4. Средняя длина слова (слоги)
1. Средняя частотность лемм по словарю Ляшевской–Шарова (ipm) → редкость лексики
2. Плотность юридической терминологии (доля терминов)
3. Канцеляризмы — словарь ~200 единиц
4. Средняя длина слова (слоги)
Источник: Ляшевская О.Н., Шаров С.А. Частотный словарь современного русского языка. М.: Азбуковник, 2009. 1087 с.
MКомпонент 3: Семантика (вес 0,25) — ядро фишки
Оценивает логическую связность, однозначность деонтических операторов и прозрачность ссылок. Тоже свободная ниша — этого нет ни у кого из аналогов.
Признаки:
1. Двойные / тройные отрицания
2. Деонтическая неоднозначность («может», «надлежит», «не допускается»)
3. Когезия — перекрытие существительных между соседними предложениями
4. Имплицитные ссылки (местоимения без явного антецедента)
1. Двойные / тройные отрицания
2. Деонтическая неоднозначность («может», «надлежит», «не допускается»)
3. Когезия — перекрытие существительных между соседними предложениями
4. Имплицитные ссылки (местоимения без явного антецедента)
Источник: ISO 24495-1:2023. Plain language — Part 1: Governing principles and guidelines. Geneva: ISO, 2023.
TechТехническая реализация
Стек: Python · FastAPI · spaCy ru_core_news_md · pymorphy2
Морфология: spaCy (полный парсер): падежи, залог, причастия, деепричастия, синтаксические зависимости
Советы: статичные шаблоны, детерминированно, без LLM, без переписывания текста
Файлы: PDF (текстовый слой + OCR), DOCX, TXT
Морфология: spaCy (полный парсер): падежи, залог, причастия, деепричастия, синтаксические зависимости
Советы: статичные шаблоны, детерминированно, без LLM, без переписывания текста
Файлы: PDF (текстовый слой + OCR), DOCX, TXT