Как я посчитал свой словарный запас по книге и ТГ-каналу

Почему 5 581 слово — не весь мой словарь, откуда взялась близость к «Войне и миру» и при чём тут Терри Пратчетт

+1
Пожаловаться

Маркетолог, предприниматель, преподаватель — и человек, который решил посчитать собственные слова

Роман Ковалёв

НАЧАЛО

Я написал книгу. А потом мне стало интересно: сколько разных слов мне понадобилось, чтобы эту книгу написать?

Книга называется «Отстань от себя: руководство по построению личного бренда для умных и стеснительных». Она не про «успешный успех» и не про то, как за три дня превратиться в человека, которого зовут на все сцены страны. Это мой маршрут: от синдрома самозванца — к своей теме, своему голосу, контенту, нетворкингу, выступлениям и монетизации экспертности.

В ней много историй, упражнений, чек-листов, юмора и слов «спикер», «выступление» и «аудитория». Последнее я теперь могу утверждать: я всё посчитал.

Сразу сложности: словарный запас нельзя измерить одной кнопкой

КОРПУС ИССЛЕДОВАНИЯ: 143 839 русских словоупотреблений: Книга + 859 авторских поста из ТГ

Фраза «мой словарный запас N слов» почти всегда скрывает методологический зоопарк. Один исследователь считает словоформы — и тогда «выступаю», «выступал» и «выступить» становятся тремя словами. Другой сводит их к начальной форме «выступать» — лемме. Третий добавляет имена собственные, англицизмы и опечатки. Четвёртый анализирует один роман, пятый — собрание сочинений, письма и записки на полях.

Поэтому мои 5 581 слов, разобранных ниже, это число разных словарных лемм, которые я реально использовал в конкретном корпусе. Иными словами, измеряется не весь пассивный запас в голове, а наблюдаемое лексическое разнообразие текста. 

Мне этот метод понравился больше.

Как я считал

Из книги взял основной авторский текст: убрал титульные страницы, оглавление и гостевую главу Светланы Ковалёвой. Таблицы и мой эпилог оставил.

Из выгрузки моего телеграмм-канала я взял 859 моих поста с русским текстом за период с 9 июня 2021 года по 3 сентября 2026 года. Пересланные посты, служебные блоки, ссылки и сообщения без русского текста не учитывал.

Оставил русские слова, привёл их к нижнему регистру, заменил «ё» на «е» и свёл формы к леммам с помощью морфологического словаря.

Для главного сравнения считал среднее число разных словарных лемм в скользящих окнах по 10 000 слов. Так длинный текст не получает автоматическую медаль просто за длину.

Я также проверил более короткие окна по 1 000 слов и показатель MTLD, который меньше зависит от длины текста. Они дали ту же общую картину. Формулой MTLD мучить не буду: у нас всё-таки тут веселье, а не научное изыскание с претензией на нобелевку.

Что получилось в книге

Насчитал 5581 словарных лемм

Именно столько разных слов, распознанных словарём, встретилось в моём авторском тексте книги. Ещё 352 леммы алгоритм не признал уверенно: там в основном имена, бренды, термины, разговорные формы и опечатки.

В книге 60 031 русское словоупотребление и 12 302 разные словоформы. После приведения к начальным формам осталось 5 933 леммы, из них 5 581 — словарные. В среднем на каждые 10 000 слов приходится 2 129 разных словарных лемм.

Самые частые смысловые слова хорошо пересказывают книгу без аннотации: «выступление» — 375 раз, «человек» — 353, «спикер» — 226, «тема» — 196, «аудитория» — 192, «конференция» — 166, «контент» — 153, «эксперт» — 135. 

Telegram оказался разнообразнее

Корпус Словоупотребления Разные словоформы Словарные леммы Лемм на 10 000 слов
Книга 60 031 12 302 5 581 2 129
Telegram 83 808 16 085 6 560 2 241

Экспорт telegram охватывает период с 9 июня 2021 года по 3 сентября 2026 года. В канале у меня на 39,6% больше словоупотреблений, чем в книге. Поэтому напрямую сравнивать общее число найденных лемм не совсем корректно. В Telegram их оказалось 6 560 — на 979 больше, чем в книге, но часть этой разницы объясняется бо́льшим объёмом текста.

Правильнее сравнивать равные отрезки по 10 000 слов. Здесь Telegram тоже оказался разнообразнее: в среднем 2 241 лемма против 2 129 у книги. Разница составляет примерно 5,3%.

Это не значит, что книгу надо срочно переписать. У практического нон-фикшна есть задача: последовательно объяснить одну тему. Повторять ключевые понятия там полезно — читатель должен узнавать «личный бренд», «контент», «аудиторию» и «выступление», а не разгадывать каждый раз новый синоним. Канал жил больше пяти лет, перескакивал между SEO, сайтами, рекламой, нейросетями, агентством, конференциями, курсами и личными наблюдениями. Разнообразие тем закономерно принесло разнообразие слов.

Контрольный MTLD подтвердил результат: около 145 у книги и 153 у Telegram.

А со временем я не стал писать беднее?

После истории Терри Пратчетта — к ней ещё вернусь — этот вопрос меня стал волновать. Для каждого года я взял окна по 1 000 слов

Год Слов в выборке Разных словарных лемм на 1 000 слов
2021 11 392 472
2022 13 012 499
2023 10 652 492
2024 16 317 505
2025 19 424 506
2026* 13 011 494

* 2026 год неполный
Устойчивого обеднения словаря не видно. Самым низким оказался первый, неполный 2021 год. Начиная с 2022-го показатель держится в довольно узком коридоре — от 492 до 506 лемм на 1 000 слов.

Контрольный MTLD тоже не показывает последовательного снижения: 154,2 в 2025 году и 154,5 в 2026-м. То есть мой Telegram со временем не стал заметно беднее — скорее, разнообразие колеблется вслед за темами и форматом публикаций.

Но и умнее за этот период я не стал - что грустно)

Есть предложение: если вы хотите поучаствовать со своим ТГ-каналом в рейтинге-сравнении, пишите ссылку в комментарии. Сравним друг друга с известными ТГ-блогерами в нашей нише.

К кому из известных писателей я ближе

Вот тут интернет обычно предлагает немедленно выбрать между Пушкиным, Толстым, Достоевским и Шекспиром. Но сравнивать мой один нон-фикшн с полным собранием сочинений — всё равно что выяснять, кто сильнее, по общему числу поднятых килограммов за всю жизнь. Чем больше корпус и разнообразнее жанры, тем больше новых слов он накопит.

Академический «Словарь языка Пушкина» описывает более 20 000 слов из художественных и публицистических произведений, писем и деловых бумаг. Частотный словарь художественных произведений Достоевского включает более 35 000 единиц. Это огромные корпуса и другая задача, поэтому мои 5 581 рядом с ними ничего не говорят о том, сколько слов я потенциально знаю.

С Шекспиром ещё веселее. В знаменитой работе Брэдли Эфрона и Рональда Тистеда статистически оценивался не только наблюдаемый словарь пьес и стихов, но и слова, которые автор мог знать, хотя ни разу не употребил в сохранившихся текстах. Получившиеся около 66,5 тысячи — модельная оценка скрытого словаря, а не результат кнопки «посчитать уникальные слова». Такой «мировой топ» нельзя ставить в одну колонку с моей книгой без крупной надписи «осторожно, разные единицы измерения».

Сверяю равные куски

На «Лаборатории фантастики» есть рейтинг удельного активного словаря: сколько разных словарных единиц встречается в 10 000 слов текста. Это уже похоже на мою метрику, хотя алгоритмы всё равно не идентичны, поэтому значения ниже — ориентиры.

Текст / корпус Разных слов на 10 000 Что важно помнить
Моя книга 2 129 Нон-фикшн; мой расчёт по леммам
Мой Telegram 2 241 Разные темы; мой расчёт по леммам
Л. Толстой, «Война и мир», том IV 2 214 Данные FantLab; близкая, но не та же процедура
Среднее в рейтинге FantLab 2 848 Большая база преимущественно художественных текстов
Г. Л. Олди, «Шутиха» 4 341 Лидер рейтинга FantLab по этой метрике

Если очень хочется громкого имени, то ближайший найденный ориентир — четвёртый том «Войны и мира»: 2 214 против 2 129 у книги и 2 241 у канала. Это означает только то, что в одной узкой нормированной метрике наши числа оказались соседями. Жанр, эпоха, редактура и алгоритм различаются.

А безусловного чемпиона вообще не существует. Если зафиксировать правила рейтинга FantLab, лидер на момент проверки — роман Генри Лайона Олди «Шутиха» с 4 341 словарной единицей на 10 000 слов. Но стоит сменить язык, корпус, словарь или способ лемматизации — и пьедестал переедет. Поэтому правильный «топ» всегда начинается словами «по такой-то методике».

Поэтому по моей методике – я собой доволен)

Как «Плоский мир» заметил болезнь раньше людей

Теперь к Терри Пратчетту, автору замечательного цикла «Плоский мир». В 2007 году ему диагностировали заднюю корковую атрофию — редкую форму болезни Альцгеймера. Исследователи позже проанализировали 33 романа цикла: 29 написаны до диагноза и четыре после. Они смотрели прежде всего на разнообразие существительных и прилагательных и отдельно контролировали длину книг.

Результат получился одновременно красивым для науки и грустным для читателя. После диагноза книги в среднем стали длиннее и общее число разных слов даже могло расти, но относительное разнообразие существительных и прилагательных снижалось. То есть простой счётчик «уникальных слов во всей книге» маскировал изменение, а нормированный показатель его показывал.

Особенно выделился роман TheLastContinent («Последний континент»): в опубликованной работе его показатель разнообразия прилагательных оказался ниже установленной авторами границы примерно за девять лет и семь месяцев до официального диагноза. Лафборский университет описывает это как тонкий прогрессирующий сдвиг, который обычный читатель мог и не заметить.

ВАЖНАЯ ОГОВОРКА
Исследование Пратчетта — ретроспективный анализ творчества одного человека. Оно показывает потенциальный маркер для дальнейших исследований, но не превращает подсчёт слов в домашнюю диагностику деменции.

Что я вынес из этого эксперимента

Во-первых, одна книга уже даёт заметный отпечаток активного словаря: 5 581 словарная лемма на 60 тысяч слов текста. Будет с чем сравнивать будущие книги и следить за своим ментальным здоровьем)

Во-вторых, канал оказался лексически разнообразнее книги примерно на 5,8% в равных десяти тысячах слов.

В-третьих, сравнение с великими авторами полезно не столько для самолюбия, сколько для гигиены цифр. Можно честно написать, что показатель моей книги находится рядом с опубликованным показателем четвёртого тома «Войны и мира». Нельзя честно написать, что у меня «словарный запас почти как у Толстого». Между этими фразами пропасть.

И, наконец, повторение — не всегда бедность языка. В руководстве повторяются слова, которые держат конструкцию: выступление, аудитория, тема, контент, эксперт. Если каждый раз заменять их метафорой, получится литературнее, но пользоваться книгой станет сложнее. Иногда хороший автор должен не продемонстрировать весь словарь, а выбрать самые понятные слова и оставить читателю силы на действие.

И да, книгу можно забрать бесплатно

Если после всех этих цифр вам захотелось проверить, как именно 5 581 лемма складывается в руководство по личному бренду для умных и стеснительных, электронную версию можно получить бесплатно:

Скачать электронную книгу бесплатно

А если желание поддержать автора особенно велико, кошелёк достаточно толстый, а бумага вызывает приятное чувство надёжности, можно заказать печатную чёрно-белую версию всего за 1 000 рублей:

Заказать печатную версию на Ridero

Читать можно в любом формате. Главное — не ждать, пока исчезнет страх, и не пытаться сначала стать идеальным.

Иногда достаточно отстать от себя.

+1
10 просмотров Нет комментариев Пожаловаться


Нет комментариев

Комментарии доступны после входа

Войти в аккаунт