
Маркетолог, предприниматель, преподаватель — и человек, который решил посчитать собственные слова
НАЧАЛО
Я написал книгу. А потом мне стало интересно: сколько разных слов мне понадобилось, чтобы эту книгу написать?
Книга называется «Отстань от себя: руководство по построению личного бренда для умных и стеснительных». Она не про «успешный успех» и не про то, как за три дня превратиться в человека, которого зовут на все сцены страны. Это мой маршрут: от синдрома самозванца — к своей теме, своему голосу, контенту, нетворкингу, выступлениям и монетизации экспертности.
В ней много историй, упражнений, чек-листов, юмора и слов «спикер», «выступление» и «аудитория». Последнее я теперь могу утверждать: я всё посчитал.
Сразу сложности: словарный запас нельзя измерить одной кнопкой
КОРПУС ИССЛЕДОВАНИЯ: 143 839 русских словоупотреблений: + 859 авторских поста из
Фраза «мой словарный запас N слов» почти всегда скрывает методологический зоопарк. Один исследователь считает словоформы — и тогда «выступаю», «выступал» и «выступить» становятся тремя словами. Другой сводит их к начальной форме «выступать» — лемме. Третий добавляет имена собственные, англицизмы и опечатки. Четвёртый анализирует один роман, пятый — собрание сочинений, письма и записки на полях.
Поэтому мои 5 581 слов, разобранных ниже, это число разных словарных лемм, которые я реально использовал в конкретном корпусе. Иными словами, измеряется не весь пассивный запас в голове, а наблюдаемое лексическое разнообразие текста.
Мне этот метод понравился больше.
Как я считал
Из книги взял основной авторский текст: убрал титульные страницы, оглавление и гостевую главу Светланы Ковалёвой. Таблицы и мой эпилог оставил.
Из выгрузки моего телеграмм-канала я взял 859 моих поста с русским текстом за период с 9 июня 2021 года по 3 сентября 2026 года. Пересланные посты, служебные блоки, ссылки и сообщения без русского текста не учитывал.
Оставил русские слова, привёл их к нижнему регистру, заменил «ё» на «е» и свёл формы к леммам с помощью морфологического словаря.
Для главного сравнения считал среднее число разных словарных лемм в скользящих окнах по 10 000 слов. Так длинный текст не получает автоматическую медаль просто за длину.
Я также проверил более короткие окна по 1 000 слов и показатель MTLD, который меньше зависит от длины текста. Они дали ту же общую картину. Формулой MTLD мучить не буду: у нас всё-таки тут веселье, а не научное изыскание с претензией на нобелевку.
Что получилось в книге
Насчитал 5581 словарных лемм
Именно столько разных слов, распознанных словарём, встретилось в моём авторском тексте книги. Ещё 352 леммы алгоритм не признал уверенно: там в основном имена, бренды, термины, разговорные формы и опечатки.
В книге 60 031 русское словоупотребление и 12 302 разные словоформы. После приведения к начальным формам осталось 5 933 леммы, из них 5 581 — словарные. В среднем на каждые 10 000 слов приходится 2 129 разных словарных лемм.
Самые частые смысловые слова хорошо пересказывают книгу без аннотации: «выступление» — 375 раз, «человек» — 353, «спикер» — 226, «тема» — 196, «аудитория» — 192, «конференция» — 166, «контент» — 153, «эксперт» — 135.
Telegram оказался разнообразнее
| Корпус | Словоупотребления | Разные словоформы | Словарные леммы | Лемм на 10 000 слов |
| Книга | 60 031 | 12 302 | 5 581 | 2 129 |
| Telegram | 83 808 | 16 085 | 6 560 | 2 241 |
Экспорт telegram охватывает период с 9 июня 2021 года по 3 сентября 2026 года. В канале у меня на 39,6% больше словоупотреблений, чем в книге. Поэтому напрямую сравнивать общее число найденных лемм не совсем корректно. В Telegram их оказалось 6 560 — на 979 больше, чем в книге, но часть этой разницы объясняется бо́льшим объёмом текста.
Правильнее сравнивать равные отрезки по 10 000 слов. Здесь Telegram тоже оказался разнообразнее: в среднем 2 241 лемма против 2 129 у книги. Разница составляет примерно 5,3%.
Это не значит, что книгу надо срочно переписать. У практического нон-фикшна есть задача: последовательно объяснить одну тему. Повторять ключевые понятия там полезно — читатель должен узнавать «личный бренд», «контент», «аудиторию» и «выступление», а не разгадывать каждый раз новый синоним. Канал жил больше пяти лет, перескакивал между SEO, сайтами, рекламой, нейросетями, агентством, конференциями, курсами и личными наблюдениями. Разнообразие тем закономерно принесло разнообразие слов.
Контрольный MTLD подтвердил результат: около 145 у книги и 153 у Telegram.
А со временем я не стал писать беднее?
После истории Терри Пратчетта — к ней ещё вернусь — этот вопрос меня стал волновать. Для каждого года я взял окна по 1 000 слов
| Год | Слов в выборке | Разных словарных лемм на 1 000 слов |
| 2021 | 11 392 | 472 |
| 2022 | 13 012 | 499 |
| 2023 | 10 652 | 492 |
| 2024 | 16 317 | 505 |
| 2025 | 19 424 | 506 |
| 2026* | 13 011 | 494 |
* 2026 год неполный
Устойчивого обеднения словаря не видно. Самым низким оказался первый, неполный 2021 год. Начиная с 2022-го показатель держится в довольно узком коридоре — от 492 до 506 лемм на 1 000 слов.
Контрольный MTLD тоже не показывает последовательного снижения: 154,2 в 2025 году и 154,5 в 2026-м. То есть мой Telegram со временем не стал заметно беднее — скорее, разнообразие колеблется вслед за темами и форматом публикаций.
Но и умнее за этот период я не стал - что грустно)
Есть предложение: если вы хотите поучаствовать со своим ТГ-каналом в рейтинге-сравнении, пишите ссылку в комментарии. Сравним друг друга с известными ТГ-блогерами в нашей нише.
К кому из известных писателей я ближе
Вот тут интернет обычно предлагает немедленно выбрать между Пушкиным, Толстым, Достоевским и Шекспиром. Но сравнивать мой один нон-фикшн с полным собранием сочинений — всё равно что выяснять, кто сильнее, по общему числу поднятых килограммов за всю жизнь. Чем больше корпус и разнообразнее жанры, тем больше новых слов он накопит.
Академический «Словарь языка Пушкина» описывает более 20 000 слов из художественных и публицистических произведений, писем и деловых бумаг. Частотный словарь художественных произведений Достоевского включает более 35 000 единиц. Это огромные корпуса и другая задача, поэтому мои 5 581 рядом с ними ничего не говорят о том, сколько слов я потенциально знаю.
С Шекспиром ещё веселее. В знаменитой работе Брэдли Эфрона и Рональда Тистеда статистически оценивался не только наблюдаемый словарь пьес и стихов, но и слова, которые автор мог знать, хотя ни разу не употребил в сохранившихся текстах. Получившиеся около 66,5 тысячи — модельная оценка скрытого словаря, а не результат кнопки «посчитать уникальные слова». Такой «мировой топ» нельзя ставить в одну колонку с моей книгой без крупной надписи «осторожно, разные единицы измерения».
Сверяю равные куски
На «Лаборатории фантастики» есть рейтинг удельного активного словаря: сколько разных словарных единиц встречается в 10 000 слов текста. Это уже похоже на мою метрику, хотя алгоритмы всё равно не идентичны, поэтому значения ниже — ориентиры.
| Текст / корпус | Разных слов на 10 000 | Что важно помнить |
| Моя книга | 2 129 | Нон-фикшн; мой расчёт по леммам |
| Мой Telegram | 2 241 | Разные темы; мой расчёт по леммам |
| Л. Толстой, «Война и мир», том IV | 2 214 | Данные FantLab; близкая, но не та же процедура |
| Среднее в рейтинге FantLab | 2 848 | Большая база преимущественно художественных текстов |
| Г. Л. Олди, «Шутиха» | 4 341 | Лидер рейтинга FantLab по этой метрике |
Если очень хочется громкого имени, то ближайший найденный ориентир — четвёртый том «Войны и мира»: 2 214 против 2 129 у книги и 2 241 у канала. Это означает только то, что в одной узкой нормированной метрике наши числа оказались соседями. Жанр, эпоха, редактура и алгоритм различаются.
А безусловного чемпиона вообще не существует. Если зафиксировать правила рейтинга FantLab, лидер на момент проверки — роман Генри Лайона Олди «Шутиха» с 4 341 словарной единицей на 10 000 слов. Но стоит сменить язык, корпус, словарь или способ лемматизации — и пьедестал переедет. Поэтому правильный «топ» всегда начинается словами «по такой-то методике».
Поэтому по моей методике – я собой доволен)
Как «Плоский мир» заметил болезнь раньше людей
Теперь к Терри Пратчетту, автору замечательного цикла «Плоский мир». В 2007 году ему диагностировали заднюю корковую атрофию — редкую форму болезни Альцгеймера. Исследователи позже проанализировали 33 романа цикла: 29 написаны до диагноза и четыре после. Они смотрели прежде всего на разнообразие существительных и прилагательных и отдельно контролировали длину книг.
Результат получился одновременно красивым для науки и грустным для читателя. После диагноза книги в среднем стали длиннее и общее число разных слов даже могло расти, но относительное разнообразие существительных и прилагательных снижалось. То есть простой счётчик «уникальных слов во всей книге» маскировал изменение, а нормированный показатель его показывал.
Особенно выделился роман TheLastContinent («Последний континент»): в опубликованной работе его показатель разнообразия прилагательных оказался ниже установленной авторами границы примерно за девять лет и семь месяцев до официального диагноза. Лафборский университет описывает это как тонкий прогрессирующий сдвиг, который обычный читатель мог и не заметить.
ВАЖНАЯ ОГОВОРКА
Исследование Пратчетта — ретроспективный анализ творчества одного человека. Оно показывает потенциальный маркер для дальнейших исследований, но не превращает подсчёт слов в домашнюю диагностику деменции.
Что я вынес из этого эксперимента
Во-первых, одна книга уже даёт заметный отпечаток активного словаря: 5 581 словарная лемма на 60 тысяч слов текста. Будет с чем сравнивать будущие книги и следить за своим ментальным здоровьем)
Во-вторых, канал оказался лексически разнообразнее книги примерно на 5,8% в равных десяти тысячах слов.
В-третьих, сравнение с великими авторами полезно не столько для самолюбия, сколько для гигиены цифр. Можно честно написать, что показатель моей книги находится рядом с опубликованным показателем четвёртого тома «Войны и мира». Нельзя честно написать, что у меня «словарный запас почти как у Толстого». Между этими фразами пропасть.
И, наконец, повторение — не всегда бедность языка. В руководстве повторяются слова, которые держат конструкцию: выступление, аудитория, тема, контент, эксперт. Если каждый раз заменять их метафорой, получится литературнее, но пользоваться книгой станет сложнее. Иногда хороший автор должен не продемонстрировать весь словарь, а выбрать самые понятные слова и оставить читателю силы на действие.
И да, книгу можно забрать бесплатно
Если после всех этих цифр вам захотелось проверить, как именно 5 581 лемма складывается в руководство по личному бренду для умных и стеснительных, электронную версию можно получить бесплатно:
А если желание поддержать автора особенно велико, кошелёк достаточно толстый, а бумага вызывает приятное чувство надёжности, можно заказать печатную чёрно-белую версию всего за 1 000 рублей:
Читать можно в любом формате. Главное — не ждать, пока исчезнет страх, и не пытаться сначала стать идеальным.
Иногда достаточно отстать от себя.
Нет комментариев
Комментарии доступны после входа