Доли, проценты и процентные пункты
Почти любая цифра в отчёте аналитика — это доля чего-то в чём-то, и большинство споров о цифрах возникает не из-за арифметики, а из-за того, что стороны молча выбрали разные основания.
Суть
Доля — это ответ на вопрос «какую часть целого занимает интересующая нас часть». Она получается делением: берём величину, которая нас интересует, и делим её на величину, внутри которой она находится. Результат деления — число от 0 до 1, если часть действительно лежит внутри целого. Это число неудобно произносить вслух, поэтому его умножают на 100 и добавляют знак процента. Процент — не отдельная сущность, а та же доля, записанная в других единицах: 0,26 и 26% — одно и то же число, как 1,5 метра и 150 сантиметров.
Из этого определения сразу следует важное свойство. Процент не имеет смысла без указания целого. Фраза «конверсия 26%» неполна: 26% от чего — от отправленных писем, от доставленных, от открытых. Каждый из этих знаменателей даёт свою цифру, и все три законны, но отвечают на разные вопросы. Дисциплина аналитика начинается с привычки называть знаменатель вслух и записывать его в заголовок столбца.
Как это считается
Возьмём рассылку. Отправлено 12 500 писем, открыли 3 250 человек, кликнули по ссылке 780. Открываемость — это 3 250 / 12 500 = 0,26, то есть 26%. Кликабельность можно посчитать двумя способами. От всех отправленных: 780 / 12 500 = 0,0624, то есть 6,24%. От тех, кто открыл письмо: 780 / 3 250 = 0,24, то есть 24%. Обе цифры верны и обе полезны, но описывают разные вещи. Первая говорит, насколько эффективна рассылка целиком. Вторая — насколько убедительно письмо для человека, который его уже открыл. Если в отчёте написано «CTR 24%» без пояснения, читатель, скорее всего, подумает про 6,24% и переоценит результат вчетверо.
Когда целое разбито на непересекающиеся категории, доли этих категорий в сумме дают ровно 100%. Например, отправления делятся на документы (62%), посылки до 5 кг (29%) и тяжёлые отправления (9%): 62 + 29 + 9 = 100. Если сумма не сходится, у вас либо категории пересекаются, либо часть объектов не попала ни в одну корзину, либо где-то потеряно округление. Проверка «сходится ли до ста» — самая дешёвая проверка структуры данных, которую стоит делать автоматически.
Проценты от процентов и процентные пункты
Отдельный источник путаницы — изменение самой доли. Допустим, доля заказов, доставленных в срок, выросла с 92% до 94%. Насколько выросла? Есть два корректных ответа, и они звучат по-разному. Разница в абсолютном выражении составляет 2 процентных пункта: 94 − 92 = 2. Относительный рост составляет 2 / 92 ≈ 2,2%. Процентный пункт — это единица измерения разницы между двумя процентами. Процент — единица измерения отношения. Смешивать их нельзя, и именно на этом строятся самые убедительные манипуляции в презентациях.
Тот же сдвиг можно описать и с другой стороны. Доля опозданий упала с 8% до 6%: минус 2 процентных пункта, но минус 25% относительно (2 / 8 = 0,25). Одно и то же событие даёт три разных заголовка: «плюс 2 пункта», «плюс 2%» и «минус 25%». Все три честны, но выбор формулировки определяет впечатление. В отчёте стоит указывать оба числа: пункты дают масштаб, относительное изменение — динамику.
Где конструкция ломается
Проценты нельзя складывать и усреднять напрямую, если у них разные знаменатели. Об этом подробно говорится в теме «Взвешенное среднее и парадокс Симпсона», но базовое правило запомните здесь: чтобы сложить две доли, нужно вернуться к исходным числителям и знаменателям, сложить их отдельно и поделить заново.
Второе место поломки — последовательные изменения. Процентные изменения перемножаются, а не складываются. Если тариф вырос на 20%, а потом упал на 20%, вы не вернулись в исходную точку: 250 × 1,2 = 300, затем 300 × 0,8 = 240. Итог на 4% ниже старта. Симметрично: величина, упавшая на 30%, требует роста на 43%, чтобы восстановиться, потому что 100 → 70 → 70 × 1,3 = 91, а не 100.
Кампания на 12 500 адресов: 3 250 открытий (26%), 780 кликов. В отчёте маркетолог пишет: «открываемость 26%, кликабельность 24%». Руководитель складывает и делает вывод, что половина базы как-то отреагировала. На деле 24% — это доля от открывших, а не от базы; от всей базы кликнули 780 / 12 500 = 6,24%. Корректная формулировка: «26% открыли, из них 24% кликнули, что даёт 6,2% от всей базы».
В отчёте пишут «конверсия выросла на 2%», имея в виду сдвиг с 4% до 6%. Это не 2%, а 2 процентных пункта, то есть рост в полтора раза (на 50%). Заметить подмену помогает один вопрос к автору: «два процента — от четырёх или от ста?» Если в таблице соседствуют столбцы «было, %», «стало, %» и «изменение», требуйте, чтобы у третьего столбца в заголовке стояло «п.п.» или «%», иначе читатели будут интерпретировать его каждый по-своему.
- Процент бессмыслен без знаменателя: всегда пишите, от чего считаете, прямо в заголовке столбца.
- Разница двух процентов измеряется в процентных пунктах; относительное изменение — в процентах от исходного значения.
- Доли непересекающихся категорий обязаны давать 100% — это бесплатная проверка данных.
- Последовательные изменения перемножаются: −20%, затем +20% не возвращает к исходной величине.
Пропорции и нормировка: как сравнивать группы разного размера
Абсолютные числа отвечают на вопрос «сколько», а решения обычно требуют ответа на вопрос «насколько интенсивно», и переход от первого ко второму называется нормировкой.
Суть
Нормировка — это деление величины на ту величину, которая порождает её масштаб. Крупный регион даёт больше опозданий, чем мелкий, ровно потому, что он крупный, а не потому, что там хуже работают. Чтобы сравнение стало содержательным, число опозданий нужно поделить на число заказов. Полученное отношение уже не зависит от размера региона и годится для сопоставления.
Выбор базы — главное решение в этой теме, и оно содержательное, а не техническое. База должна быть тем, что даёт возможность событию произойти. Для опозданий это отправления. Для жалоб — доставленные заказы. Для выручки курьера — отработанные часы или смены. Для стоимости перевозки — килограммы или километры. Неверно выбранная база даёт цифру, которая выглядит убедительно и при этом не измеряет ничего.
Как это считается
Северный регион: 4 000 заказов за месяц, 120 опозданий. Южный: 25 000 заказов, 500 опозданий. В абсолютных числах Юг выглядит катастрофой — там опозданий вчетверо больше. После нормировки картина переворачивается: 120 / 4 000 = 0,03, то есть 3%, против 500 / 25 000 = 0,02, то есть 2%. Север опаздывает в полтора раза чаще. Абсолютное число опозданий говорит, где больше пострадавших клиентов; нормированное — где хуже процесс. Оба вопроса законны, но операционное решение о вмешательстве принимается по второму.
| Регион | Заказов | Опозданий | Доля опозданий | На 1000 заказов |
|---|---|---|---|---|
| Север | 4 000 | 120 | 3,0% | 30 |
| Юг | 25 000 | 500 | 2,0% | 20 |
Форма «на 1000» удобна, когда доли получаются мелкими и в них теряется различие. Сказать «30 опозданий на тысячу заказов» нагляднее, чем «0,03». Знаменатель выбирают так, чтобы типичное значение оказалось в диапазоне от единиц до сотен: на 100, на 1 000, на 10 000. Единственное требование — единый знаменатель для всех строк таблицы, иначе колонка перестаёт быть сравнимой.
Другие виды нормировки
Нормировать можно не только на количество. Тариф 340 рублей за отправление в 2 кг и 1 100 рублей за 10 кг сравниваются после деления на вес: 170 и 110 рублей за килограмм. Второй тариф выгоднее на единицу веса, хотя в абсолютных рублях дороже. Выручка регионов сравнивается через деление на численность курьеров: 4 800 000 при 40 курьерах — это 120 000 на курьера, а 2 100 000 при 15 курьерах — 140 000. Меньший регион продуктивнее, хотя суммарно приносит меньше.
Отдельный приём — индексация к базовому периоду. Значение базового месяца принимают за 100, остальные пересчитывают как отношение к нему, умноженное на 100. Это позволяет положить на один график ряды с несовместимыми единицами: число отправлений, средний вес и выручку. Смысл индекса — «во сколько раз относительно старта», а не «сколько».
Где нормировка обманывает
Первая опасность — маленький знаменатель. Филиал, обработавший 12 заказов и опоздавший один раз, показывает 8,3% опозданий и возглавляет антирейтинг. Но одно событие тут ничего не доказывает: убери его — станет 0%. При маленьких базах доля скачет от случайности. Практическое правило: вводите порог минимального объёма (например, не показывать в рейтинге строки с базой меньше 100) и всегда выводите знаменатель рядом с долей.
Вторая опасность — расхождение знаменателей между строками таблицы. Если для одного региона доля опозданий считается от принятых заказов, а для другого — от доставленных, разница показателей отражает разницу в определениях, а не в работе. Проверяется это сложением: сумма знаменателей по строкам должна давать общий знаменатель по компании.
Рассылка отправлена на 50 000 адресов, из них доставлено 48 000, открыто 12 000, кликов 1 500. Кликабельность равна 1 500 / 50 000 = 3,0% от отправленных, 1 500 / 48 000 ≈ 3,1% от доставленных и 1 500 / 12 000 = 12,5% от открытых. Три законные цифры от одних и тех же данных. При сравнении двух кампаний между собой обязательно берите один и тот же знаменатель для обеих, иначе выигрыш может целиком объясняться разницей в доставляемости.
Рейтинг филиалов по доле опозданий возглавляют самые мелкие точки, и руководство едет разбираться именно туда. Причина не в качестве, а в размере базы: при 12 заказах один сбой даёт 8,3%. Признак проблемы виден сразу, если рядом с процентом вывести знаменатель и отсортировать таблицу по нему: если все лидеры и все аутсайдеры оказались в хвосте по объёму, вы смотрите на шум, а не на процесс.
- Нормировка делит событие на то, что порождает его масштаб: заказы, килограммы, часы, адреса.
- Долю всегда показывайте вместе со знаменателем — без него невозможно оценить надёжность цифры.
- Формат «на 1000» подбирают так, чтобы значения читались как единицы или десятки.
- Строки одной таблицы обязаны использовать одинаково определённый знаменатель.
Взвешенное среднее и парадокс Симпсона
Среднее из средних почти всегда неверно, и та же ошибка в более острой форме превращается в парадокс Симпсона, когда общий вывод противоречит выводам по всем подгруппам сразу.
Суть
Обычное среднее считает все слагаемые равноправными. Но показатели групп равноправны только тогда, когда группы одинакового размера. Если в одной категории 9 000 заказов, а в другой 1 000, их доли опозданий вносят в общий результат вклад в отношении девять к одному, а не один к одному. Учёт этого различия и есть взвешенное среднее: каждому значению приписывается вес, пропорциональный размеру группы.
Если веса заранее нормированы так, что их сумма равна единице (то есть выражены как доли), знаменатель исчезает и формула превращается в сумму произведений «доля группы × показатель группы». Обычное арифметическое среднее — частный случай взвешенного, где все веса одинаковы.
Как это считается
Пять регионов дали за месяц 3 000 заказов: 1 200 со средним сроком доставки 2 дня, 800 по 3 дня, 450 по 4 дня, 300 по 5 дней и 250 по 6 дней. Наивное среднее по колонке сроков даёт (2 + 3 + 4 + 5 + 6) / 5 = 4,0 дня. Взвешенное по числу заказов: (1 200 × 2 + 800 × 3 + 450 × 4 + 300 × 5 + 250 × 6) / 3 000 = (2 400 + 2 400 + 1 800 + 1 500 + 1 500) / 3 000 = 9 600 / 3 000 = 3,2 дня. Разница в 0,8 дня возникает потому, что медленные регионы малы. Клиент компании в среднем ждёт 3,2 дня, а не 4,0 — и именно эта цифра описывает клиентский опыт.
Правило выбора весов: вес должен быть тем самым знаменателем, по которому считался показатель группы. Если доля опозданий считалась от числа заказов, взвешивать надо по числу заказов. Если средний чек считался по числу оплаченных отправлений, вес — число оплаченных отправлений. Проверка результата тоже механическая: взвешенное среднее обязано совпасть с числом, полученным «в лоб» — сложить все числители, сложить все знаменатели, поделить одно на другое.
Парадокс Симпсона
Теперь усилим ситуацию. Сравним две курьерские службы по доле доставок в срок, разделив заказы на документы и негабарит.
| Служба | Документы | Негабарит | Всего |
|---|---|---|---|
| A | 9 000 заказов, 95% в срок | 1 000 заказов, 70% в срок | 10 000 заказов, 92,5% |
| B | 1 000 заказов, 96% в срок | 9 000 заказов, 72% в срок | 10 000 заказов, 74,4% |
Проверим арифметику. У службы A в срок доставлено 9 000 × 0,95 = 8 550 документов и 1 000 × 0,70 = 700 негабаритных отправлений, всего 9 250 из 10 000, то есть 92,5%. У службы B: 1 000 × 0,96 = 960 и 9 000 × 0,72 = 6 480, всего 7 440 из 10 000, то есть 74,4%. Получается, что B лучше A в каждой из двух категорий (96 против 95 и 72 против 70), но заметно хуже в целом. Противоречия здесь нет: службы работают с разной структурой заказов. У A девять десятых объёма — лёгкая категория, у B — тяжёлая. Общий показатель смешивает качество работы и состав портфеля.
Что с этим делать
Первый шаг — всегда смотреть на структуру групп, а не только на итог. Если веса категорий у сравниваемых объектов различаются в разы, итоговое число сравнивать нельзя без оговорок. Второй шаг — стандартизация: пересчитать оба объекта на одну и ту же структуру. Возьмём условную структуру «половина документов, половина негабарита». Тогда A даёт 0,5 × 95 + 0,5 × 70 = 82,5%, а B — 0,5 × 96 + 0,5 × 72 = 84,0%. При одинаковом составе заказов B впереди, что согласуется с покатегорийными данными.
Стандартизованный показатель отвечает на вопрос «кто работает лучше при прочих равных», а сырой итог — на вопрос «что фактически получил клиент». Обе цифры нужны, но подписывать их нужно разными словами и не подменять одну другой в выводах.
Тендерная презентация службы B честно показывает: «в срок доставляем 96% документов и 72% негабарита — по обеим категориям мы лучше конкурента A». Презентация A столь же честно показывает: «наш общий уровень сервиса 92,5% против 74,4%». Оба утверждения арифметически верны по данным выше. Решение принимается по третьему вопросу: какова структура заказов у самого заказчика. Если он отправляет преимущественно документы, ему релевантны 96% и 95%, и выбирать следует B.
В сводной таблице по регионам колонку «конверсия, %» усредняют функцией среднего арифметического, и получают цифру, не совпадающую с общей конверсией компании. Заметить это можно одной проверкой: посчитайте показатель напрямую из суммарных числителя и знаменателя и сравните с усреднённой колонкой. Если числа расходятся, среднее посчитано без весов. Правило для таблиц: строку «Итого» никогда не получают усреднением строк выше — её считают заново из исходных сумм.
- Вес группы — это знаменатель, по которому считался её показатель; взвешивать надо именно по нему.
- Строку «Итого» считают из суммарных числителя и знаменателя, а не усреднением колонки процентов.
- Парадокс Симпсона возникает, когда сравниваемые объекты имеют разную структуру подгрупп.
- Стандартизация на общую структуру отвечает на вопрос о качестве, сырой итог — на вопрос о фактическом результате.
Степени, корни, логарифмы и логарифмическая шкала
Логарифм — это инструмент, который превращает умножение в сложение, и именно поэтому он нужен везде, где величины меняются в разы, а не на единицы.
Суть
Степень — это повторное умножение: 2² = 4, 2³ = 8, 2¹⁰ = 1 024. Корень — обратная операция к степени: он отвечает на вопрос «какое число нужно возвести в такую-то степень, чтобы получить данное». Логарифм — тоже обратная операция, но с другой стороны: он отвечает на вопрос «в какую степень нужно возвести основание, чтобы получить данное число». Три записи ниже описывают один и тот же факт, но неизвестное в них разное.
Основание логарифма — это то число, которое возводится в степень. В аналитике встречаются три: 10 (удобно для порядков величин, log₁₀ 1000 = 3), 2 (удобно для удвоений, log₂ 1024 = 10) и число e ≈ 2,718 (натуральный логарифм, стандарт в статистике и в формулах роста). Переход между основаниями — умножение на константу, поэтому форма графиков от выбора основания не меняется, меняется только разметка оси.
Главное свойство
Ценность логарифма для аналитика держится на одном свойстве: логарифм произведения равен сумме логарифмов.
Проверьте на числах: 100 × 1000 = 100 000, и при этом log₁₀ 100 + log₁₀ 1000 = 2 + 3 = 5 = log₁₀ 100 000. Умножение свелось к сложению. Отсюда следуют два практических вывода. Первый: ряд, который растёт умножением (каждый месяц в 1,04 раза), после логарифмирования становится рядом, растущим сложением, — то есть прямой линией. Второй: показатель степени можно вынести множителем вперёд, и это даёт способ извлекать темпы роста из данных.
Корень как средний темп
Пусть база подписчиков выросла с 10 000 до 40 000 за четыре года. Суммарный множитель равен 40 000 / 10 000 = 4. Средний годовой множитель — это не 4 / 4 = 1, а корень четвёртой степени из 4, потому что годовые множители перемножаются, а не складываются. Корень четвёртой степени из 4 равен приблизительно 1,414, то есть примерно 41,4% в год. Проверка: 1,414⁴ ≈ 4, и 10 000 × 4 = 40 000. Это и есть среднегодовой темп роста, который в отчётах обозначают как CAGR.
Обратная задача — время удвоения — решается логарифмом. При росте 10% в месяц удвоение наступает через log(2) / log(1,1) ≈ 7,3 месяца. Отсюда известное приближение: разделите 70 на темп в процентах и получите примерное число периодов до удвоения (70 / 10 = 7). Приближение работоспособно при темпах примерно до 15% за период.
Логарифмическая шкала на графике
На обычной оси равные отрезки означают равные разности: от 0 до 10 столько же, сколько от 90 до 100. На логарифмической оси равные отрезки означают равные множители: расстояние от 1 до 10 равно расстоянию от 10 до 100 и от 100 до 1 000. Это меняет то, что видно на графике. Вес отправлений в курьерской компании меняется от 0,1 кг до 200 кг; на линейной оси все лёгкие отправления слипаются у нуля, а на логарифмической распределение раскрывается и становится читаемым. Точно так же логарифмическая ось по вертикали превращает экспоненциальный рост в прямую: если ряд на такой оси лёг прямой линией, темп роста постоянен, а наклон прямой и есть этот темп.
Где логарифм неприменим
Логарифм определён только для положительных чисел. Ноль и отрицательные значения не логарифмируются, и это регулярная проблема в операционных данных: у филиала бывает ноль заказов за день, у категории — ноль возвратов. Стандартный обходной приём — логарифмировать величину, увеличенную на единицу, но он меняет форму распределения в области малых значений, и об этом нужно писать в примечании к графику, а не умалчивать.
Второе ограничение: логарифм суммы не равен сумме логарифмов. Запись log(a + b) не раскладывается никак. И третье: среднее логарифмов, возвращённое обратно в исходную шкалу, даёт геометрическое среднее, которое всегда меньше или равно арифметическому. Для темпов роста это правильная величина, для сумм денег — нет.
Гистограмма веса отправлений на линейной оси показывает один высокий столбец у нуля и почти пустое поле справа: 95% отправлений легче 5 кг, но диапазон тянется до 200 кг. После перехода к логарифмической шкале по весу проявляются три отчётливых скопления — документы около 0,2 кг, потребительские посылки около 1–3 кг и коммерческие грузы около 20–50 кг. Данные не изменились, изменилась шкала, на которой их рассматривают.
График с логарифмической вертикальной осью подписывают как обычный, и читатель воспринимает пологую линию как замедление роста, хотя на такой оси прямая означает ровно постоянный темп. Обратная ошибка не менее частая: логарифмическую ось используют, чтобы «сгладить» неприятный скачок в отчёте. Признак проблемы — неравномерные подписи оси (1, 10, 100, 1000) при отсутствии явной пометки о шкале. Правило: если ось логарифмическая, это должно быть написано в подписи оси словами.
- Логарифм превращает умножение в сложение, а рост в разы — в прямую линию.
- Средний темп за несколько периодов извлекается корнем, а не делением суммарного прироста.
- Время удвоения приблизительно равно 70, делённым на темп в процентах за период.
- Логарифм не определён для нуля и отрицательных чисел, а log(a + b) не раскладывается на слагаемые.
Линейный и экспоненциальный рост
Прогноз почти целиком определяется тем, какую из двух моделей роста вы выбрали, и на коротком горизонте они выглядят одинаково, что и делает ошибку выбора дорогой.
Суть
Есть два принципиально разных способа расти. Линейный рост добавляет одинаковую величину за период: плюс 500 подписчиков каждый месяц, плюс 40 заказов в день. Экспоненциальный рост умножает на одинаковый коэффициент за период: плюс 4% ежемесячно, то есть умножение на 1,04. Разница в том, зависит ли прирост от уже достигнутого уровня. У линейного роста не зависит, у экспоненциального — прямо пропорционален ему.
Здесь y₀ — значение в начальный момент, t — число прошедших периодов, b — постоянный прирост за период, r — постоянный темп за период в долях. Обратите внимание: в линейной формуле t стоит множителем, в экспоненциальной — показателем степени. Всё поведение модели заключено в этой разнице.
Как это считается
Сравним два сценария развития базы подписчиков, начиная с 10 000 человек. Сценарий A: постоянный приток 500 человек в месяц. Сценарий B: рост 4% в месяц. Через 12 месяцев A даёт 10 000 + 500 × 12 = 16 000. B даёт 10 000 × 1,04¹² ≈ 10 000 × 1,601 ≈ 16 010. Разница за год — около десяти человек, то есть на глаз сценарии неразличимы, и любая из двух моделей одинаково хорошо описывает годовые данные.
Продлим до 36 месяцев. A даёт 10 000 + 500 × 36 = 28 000. B даёт 10 000 × 1,04³⁶ ≈ 10 000 × 4,104 ≈ 41 039. Расхождение — почти полтора раза. Модель, откалиброванная на годе наблюдений, через три года ошибается на 13 000 человек, и никакая аккуратность в вычислениях этого не компенсирует: ошибка не в арифметике, а в выборе формы кривой.
Отсюда практическое требование: горизонт прогноза не должен намного превышать горизонт наблюдений, а если превышает, в отчёте нужно показывать оба сценария как коридор, а не одну линию.
Как отличить одно от другого
Возьмите ряд наблюдений и посчитайте две производные величины. Первая — разности соседних значений: y₂ − y₁, y₃ − y₂ и так далее. Вторая — отношения соседних значений: y₂ / y₁, y₃ / y₂. Если примерно постоянны разности, рост линейный. Если примерно постоянны отношения, рост экспоненциальный. Это самая быстрая диагностика, и она делается двумя формулами в таблице.
Графический способ описан в теме «Степени, корни, логарифмы и логарифмическая шкала»: постройте ряд на логарифмической вертикальной оси. Экспоненциальный рост станет прямой, линейный — кривой, загибающейся вниз. Именно поэтому логарифмическая ось — стандартный инструмент проверки гипотезы о постоянном темпе.
Затухание и чистый рост
Экспоненциальная модель описывает не только рост, но и убывание — достаточно взять множитель меньше единицы. При месячном оттоке 3% база из 10 000 подписчиков без притока за год сожмётся до 10 000 × 0,97¹² ≈ 10 000 × 0,694 ≈ 6 938 человек. Заметьте: 3% в месяц — это не 36% за год, а примерно 30,6% потерь, потому что каждый месяц процент берётся от уже уменьшившейся базы.
Реальная база живёт под действием двух процессов сразу: приток обычно ближе к линейному (столько-то новых адресов в месяц из рекламы), отток — экспоненциальный (процент от текущего размера). Их сочетание даёт кривую, которая растёт, замедляется и выходит на плато: база стабилизируется на уровне, где абсолютный отток сравнялся с притоком. При притоке 500 в месяц и оттоке 3% плато достигается около 500 / 0,03 ≈ 16 700 подписчиков. Понимание этого предела важнее точного прогноза: оно говорит, что без снижения оттока или увеличения притока база дальше не вырастет.
Отдел маркетинга показывает рост базы за 12 месяцев с 10 000 до 16 000 и планирует бюджет на три года вперёд, продлевая прямую: 28 000 к концу третьего года. Проверка отношений соседних значений показывает, что они держатся около 1,04, то есть рост ближе к экспоненциальному, и тот же ряд ведёт к 41 000. Прежде чем выбирать сценарий, стоит проверить механизм: если приток обеспечивается фиксированным рекламным бюджетом, линейная модель правдоподобнее; если новые подписчики приходят по рекомендациям от уже существующих, правдоподобнее экспоненциальная.
Месячный темп умножают на 12, чтобы получить годовой: «растём на 4% в месяц, значит на 48% в год». Верное значение — 1,04¹² − 1 ≈ 60,1%. Та же ошибка в обратную сторону встречается с оттоком: 3% в месяц превращают в 36% в год вместо фактических 30,6%. Признак: в отчёте годовой темп в точности равен месячному, умноженному на 12. Темпы за периоды перемножаются, а складывать их допустимо лишь как грубую оценку при малых значениях.
- Линейный рост добавляет постоянную величину, экспоненциальный — умножает на постоянный коэффициент.
- На горизонте одного года модели почти неразличимы, на горизонте трёх лет расходятся в разы.
- Диагностика: постоянны разности — линия, постоянны отношения — экспонента.
- Темпы за периоды перемножаются: месячный темп нельзя умножать на 12 для получения годового.
Знак суммы, индексы и чтение формул
Знак Σ и индексы — это не украшение учебников, а компактная запись цикла по строкам таблицы, и умение читать её вслух снимает большую часть страха перед формулами.
Суть
Когда у вас есть набор однотипных чисел, им дают одно имя и различают номером: x₁, x₂, x₃ и так далее до xₙ. Буква x — это столбец таблицы, нижний индекс — номер строки, n — общее число строк. Обозначение xᵢ читается как «элемент номер i», где i пробегает значения от 1 до n. Знак Σ означает «сложи всё, что стоит справа, перебрав i от нижнего значения до верхнего».
Иначе говоря, Σ — это оператор SUM в таблице или в SQL-запросе, записанный математическим шрифтом. Под знаком указано, откуда начинается перебор, над знаком — где он заканчивается, справа — выражение, которое вычисляется для каждой строки перед сложением. Если ограничения перебора понятны из контекста, их часто опускают и пишут короткое Σ xᵢ.
Как читать формулу вслух
Любую формулу с суммой разбирают в четыре шага. Первый: назвать индекс и его диапазон — «i пробегает регионы с первого по пятый». Второй: назвать, что стоит внутри суммы, — «для каждого региона берём число заказов». Третий: назвать саму операцию — «складываем». Четвёртый: назвать, что делается со всей суммой снаружи, — «делим на n». Проговорив это, вы получаете определение среднего.
Тот же приём применим к более сложным конструкциям. Разберём сумму квадратов отклонений, которая встретится в теме про разброс данных.
Читаем: i пробегает все наблюдения; для каждого наблюдения берём его значение, вычитаем среднее, возводим разность в квадрат; складываем все полученные числа. Никакой дополнительной сложности здесь нет: внутри суммы стоит не одна переменная, а выражение из трёх операций.
Веса, условия и второй индекс
Взвешенное среднее из темы «Взвешенное среднее и парадокс Симпсона» в этой записи выглядит так.
Числитель и знаменатель — две разные суммы по одному и тому же индексу. Проверим на числах: пять регионов с числом заказов 1 200, 800, 450, 300, 250 и средними сроками 2, 3, 4, 5, 6 дней. Числитель равен 2 400 + 2 400 + 1 800 + 1 500 + 1 500 = 9 600, знаменатель равен 1 200 + 800 + 450 + 300 + 250 = 3 000, результат 9 600 / 3 000 = 3,2 дня.
Суммирование бывает условным: складывают не все элементы, а те, что удовлетворяют требованию. Записывают это подписью под знаком, например «i: регион = Юг». На языке инструментов это SUMIF в таблице или SUM с условием WHERE в запросе. И, наконец, индексов может быть два: xᵢⱼ означает значение в строке i и столбце j — скажем, число заказов в регионе i за месяц j. Двойная сумма Σᵢ Σⱼ xᵢⱼ складывает всю матрицу. Порядок суммирования на результат не влияет, но влияет на смысл промежуточных итогов: сначала по j — это итоги по регионам, сначала по i — итоги по месяцам.
Соглашения, о которых стоит знать
Индексация в математике начинается с единицы, а в большинстве языков программирования — с нуля. Это источник смещений на один элемент при переносе формулы в код. Далее, буквы индексов условны: i, j, k — сложившаяся традиция, и переименование ничего не меняет. Заглавные и строчные буквы, наоборот, различаются: часто заглавной обозначают общее число (N — количество наблюдений), строчной — текущий номер. Наконец, знак Π (заглавная «пи») означает не сложение, а перемножение всех элементов; он встречается в формулах, связанных с темпами роста, где множители перемножаются.
В отчёте написано: «средний срок доставки по компании = Σ (wᵢ × xᵢ) / Σ wᵢ, где wᵢ — число заказов в регионе i, xᵢ — средний срок в регионе i». Читаем по шагам: i пробегает регионы; для каждого перемножаем число заказов и средний срок; складываем произведения; отдельно складываем числа заказов; делим первое на второе. По данным выше получаем 9 600 / 3 000 = 3,2 дня. Формула из трёх символов оказалась описанием двух столбцов таблицы и одного деления.
Сумма берётся не по тому измерению: в сводной таблице «регионы на месяцы» складывают по строкам, получая итоги по регионам, а подписывают их как динамику по месяцам. Вторая версия той же ошибки — суммирование по таблице после соединения с другой таблицей, где строки размножились: один заказ, у которого три позиции, попадает в сумму трижды. Заметить обе помогает контрольная проверка: итоговая сумма по любому измерению обязана совпадать с общим итогом, посчитанным из исходной таблицы без соединений. Если общая сумма выросла после join, вы считаете дубликаты.
- Σ — это SUM по строкам: под знаком начало перебора, над знаком конец, справа выражение для каждой строки.
- Формулу читают в четыре шага: индекс и диапазон, выражение внутри, операция, действие снаружи.
- Двойной индекс xᵢⱼ адресует ячейку матрицы; порядок суммирования меняет смысл промежуточных итогов, но не общий результат.
- Контроль корректности: сумма по любому измерению должна совпадать с общим итогом исходной таблицы.
Теория без задач не держится
Восемь задач по этому модулю: выбор ответа и расчёт, с разбором каждого решения. Задачи, в которых вы ошиблись, вернутся в следующий заход.
Перейти к тренажёру