Типы переменных и шкалы измерения
Тип переменной определяет, какие вычисления над ней имеют смысл, а какие дают число без содержания.
Суть
Любая колонка в таблице заказов — это результат измерения: некоторому свойству объекта приписано значение. Код региона, срок доставки в днях, оценка курьера по пятибалльной шкале, признак «письмо открыто» — всё это записано числами или текстом, но природа у них разная. Компьютер не различает эти случаи: он одинаково охотно посчитает среднее по срокам доставки и среднее по кодам регионов. Разницу должен видеть аналитик.
Классификация, которой пользуются до сих пор, была предложена психологом Стэнли Стивенсом в 1946 году. Идея такая: измерение — это отображение свойств объектов в числа, и у каждого способа отображения свой набор преобразований, которые ничего не портят. Если значения можно переименовать любым способом и смысл не пострадает, то это одна шкала. Если переименовывать нельзя, но можно сдвинуть начало отсчёта — другая. Из этого набора допустимых преобразований и вытекает, какие операции над данными законны. Отсюда следует рабочее правило: перед тем как считать статистику, определите шкалу, а потом уже выбирайте формулу.
Отдельно от шкалы стоит различать дискретные и непрерывные величины. Дискретная принимает отдельные значения и обычно получается счётом: число отправлений за день, количество попыток вручения. Непрерывная в принципе может принимать любое значение внутри интервала: вес посылки, время в пути. На практике непрерывные величины всегда округлены до шага измерения, и это нормально, но природа их другая — между 1,2 кг и 1,3 кг есть бесконечно много значений, а между 3 и 4 попытками вручения ничего нет.
Четыре шкалы измерения
| Шкала | Что различает | Пример из доставки и рассылок | Что допустимо считать |
|---|---|---|---|
| Номинальная | Только «одинаково или нет» | Город, тип отправления, статус заказа, домен адресата | Частоты, доли, мода |
| Порядковая | Порядок «больше или меньше», но не величину разрыва | Тариф эконом / стандарт / экспресс, оценка курьера от 1 до 5 | Плюс медиана, перцентили, ранговые методы |
| Интервальная | Величину разрыва, но ноль условный | Дата отправки, температура в кузове | Плюс среднее, разности, стандартное отклонение |
| Отношений | Разрывы и отношения, ноль настоящий | Вес посылки, срок доставки в часах, выручка, число открытий письма | Плюс отношения «в два раза больше», коэффициент вариации |
Граница между интервальной шкалой и шкалой отношений проходит по нулю. У даты отправки ноль условный: 1 января не означает «отсутствия времени», поэтому фраза «эта дата в два раза больше той» бессмысленна, хотя разность дат в днях считать можно. У веса ноль настоящий: 2 кг действительно вдвое тяжелее 1 кг. Практически весь операционный учёт курьерской компании живёт в шкале отношений, и это удобно — там работают все инструменты описательной статистики.
Доли, флаги и переменные, меняющие шкалу
Отдельного разговора заслуживает бинарный признак: письмо открыто или нет, заказ доставлен в срок или нет. Формально это номинальная шкала с двумя категориями. Но если закодировать значения нулём и единицей, то среднее по колонке превращается в долю, и это уже осмысленное число.
Именно поэтому конверсия рассылки, доля доставок в срок и процент возвратов — это средние по колонке из нулей и единиц. Такой приём законен только для двух категорий. Для признака с тремя и более категориями кодирование числами 1, 2, 3 не даёт ничего: среднее между «Москвой» и «Казанью» не существует.
Полезно помнить и то, что переменная меняет шкалу при агрегации. Статус отдельного заказа — номинальная переменная. Доля заказов со статусом «доставлен» по региону за неделю — уже величина в шкале отношений, с ней можно считать среднее, разброс и корреляции. Одни и те же исходные данные на разных уровнях агрегации требуют разных методов, и путаница здесь — источник большинства бессмысленных графиков.
В выгрузке заказов есть колонки: order_id (номинальная, хоть и числовая — это идентификатор), region_code (номинальная), tariff со значениями эконом / стандарт / экспресс (порядковая), created_at (интервальная), weight_kg и delivery_hours (шкала отношений), delivered_on_time со значениями 0 и 1 (бинарная). Корректный набор метрик: доли по регионам и тарифам, медиана и перцентили по срокам доставки, среднее и стандартное отклонение по весу, средняя по колонке delivered_on_time как процент соблюдения срока. Среднее по order_id и по region_code в этот набор не входит.
Усреднение порядковой шкалы и подача результата как точного числа. В отчёте пишут «средняя оценка курьеров 3,0 из 5» — и это выглядит как «стабильно средний уровень сервиса». Между тем оценки десяти клиентов были 1, 1, 1, 1, 1, 5, 5, 5, 5, 5: сумма 30, среднее 30 / 10 = 3,0, но оценку 3 не поставил никто. Реальность здесь — два полярных лагеря, а не серая середина. Заметить ошибку помогает привычка: рядом со средним по любой шкале от 1 до 5 всегда показывайте распределение по баллам. Если столбики выстроены буквой U или все прижаты к краю, среднее из отчёта нужно убрать и заменить на долю оценок 4 и 5.
- Шкала измерения, а не тип данных в базе, определяет допустимые операции: числовой код региона остаётся категорией.
- Номинальная шкала — частоты и мода; порядковая — плюс медиана и перцентили; интервальная и шкала отношений — плюс среднее и разброс.
- Бинарный признак, закодированный нулём и единицей, даёт долю через обычное среднее; для трёх и более категорий этот приём не работает.
- При агрегации шкала меняется: статус заказа — категория, доля доставленных в срок по региону — полноценная числовая величина.
Среднее, медиана, мода: что выбирать и когда
Три меры центра отвечают на разные вопросы, и выбор между ними меняет вывод отчёта сильнее, чем сами данные.
Суть
Когда набор из тысяч значений нужно свернуть в одно число, мы отвечаем на вопрос «где находится центр распределения». Оказывается, у слова «центр» есть минимум три разных определения, и каждое минимизирует свою меру ошибки.
Среднее арифметическое — это точка, относительно которой сумма отклонений равна нулю, а сумма квадратов отклонений минимальна. Физическая аналогия: если разложить наблюдения по числовой оси как грузики одинакового веса, среднее окажется точкой равновесия рычага. Отсюда его главное свойство: одно очень далёкое наблюдение тянет точку равновесия за собой, и тянет сильно.
Медиана — это значение, которое делит упорядоченный ряд пополам: половина наблюдений не больше её, половина не меньше. Она минимизирует не квадраты, а сумму модулей отклонений. Медиане безразлично, насколько далеко улетело крайнее значение: важно только, что оно с одной стороны. Именно поэтому медиана устойчива к выбросам.
Мода — самое частое значение. Она отвечает на вопрос «какой исход типичен», а не «где центр». У непрерывной величины мода в чистом виде почти не встречается, поэтому её ищут по гистограмме как вершину столбика. Распределение может иметь две моды, и это важный сигнал: скорее всего, в данных смешаны две разные группы.
Как это считается
Среднее: сложить все значения и разделить на их количество. Медиана: отсортировать ряд по возрастанию; при нечётном n взять значение в позиции (n + 1) / 2; при чётном — среднее двух центральных значений, в позициях n / 2 и n / 2 + 1. Мода: построить таблицу частот и взять значение с максимальной частотой.
Сортировка обязательна. Медиана неотсортированного ряда — это медиана порядка загрузки строк, то есть ничего.
Взвешенное среднее и ловушка усреднения долей
Если наблюдения представляют группы разного размера, обычное среднее по группам искажает картину. Нужна взвешенная версия, где вес — размер группы.
Это правило особенно жёстко работает с процентами. Конверсия, доля доставок в срок, средний чек — всё это дроби, и усреднять дроби напрямую нельзя. Корректный путь один: сложить числители, сложить знаменатели, поделить одно на другое.
Что выбирать в отчёте
Если распределение примерно симметрично и без длинного хвоста — среднее и медиана почти совпадут, берите среднее: оно понятнее и с ним удобнее считать дальше. Если распределение скошено — сроки доставки, стоимость заказа, выручка на клиента, время до первого клика, — используйте медиану как основную метрику, а среднее показывайте рядом. Разрыв между ними сам по себе информативен: он измеряет длину хвоста. Для порядковых шкал (тариф, балл оценки) среднее недопустимо, остаются медиана и мода. Для номинальных — только мода и доли.
Разумный формат строки в отчёте — не одно число, а три: медиана, среднее и объём выборки. Так читатель видит и типичное значение, и влияние хвоста, и надёжность оценки.
Девять отправлений в новый регион доставлены за 1, 1, 2, 2, 2, 3, 3, 4 и 14 дней. Сумма равна 32, значит среднее 32 / 9 ≈ 3,6 дня. Ряд уже отсортирован, n = 9 нечётное, центральная позиция (9 + 1) / 2 = 5, поэтому медиана равна 2 дням. Самое частое значение — 2 дня (три раза), это мода. Клиенту, который спрашивает «за сколько дойдёт», честный ответ — около 2 дней, а не 3,6: восемь отправлений из девяти доставлены не дольше чем за 4 дня, а среднее подтянуло вверх единственное застрявшее на 14 дней. При этом среднее не бесполезно: если умножить 3,6 на число отправлений, получится суммарная нагрузка на курьеров в днях, а медиана такого свойства не имеет.
Среднее по средним. В отчёте по рассылке два региона: в первом отправлено 8000 писем и получено 240 конверсий, то есть 3,0%; во втором отправлено 2000 писем и получено 100 конверсий, то есть 5,0%. Аналитик пишет «средняя конверсия по кампании 4,0%» — это (3,0 + 5,0) / 2. Правильное значение считается по сумме: (240 + 100) / (8000 + 2000) = 340 / 10000 = 3,4%. Ошибка в 0,6 процентного пункта здесь возникла из-за того, что маленький регион получил тот же вес, что и большой. Заметить проблему помогает проверка: посчитайте метрику двумя способами — усреднением по группам и по общей сумме. Если числа разошлись, группы неравного размера, и верна вторая цифра. В отчётах с процентами всегда держите рядом колонку с размером знаменателя.
- Среднее — точка равновесия и минимум суммы квадратов отклонений; оно чувствительно к выбросам. Медиана делит ряд пополам и к ним устойчива.
- Разрыв между средним и медианой измеряет длину хвоста: если среднее заметно больше, распределение вытянуто вправо.
- Проценты и доли усредняются только через сумму числителей и сумму знаменателей, а не как среднее процентов.
- В отчёте показывайте медиану, среднее и размер выборки вместе — одно число из трёх всегда что-то скрывает.
Дисперсия, стандартное отклонение и коэффициент вариации
Разброс отвечает на вопрос, который среднее не задаёт: насколько можно полагаться на типичное значение.
Суть
Два региона с одинаковым средним сроком доставки могут работать совершенно по-разному. В одном все отправления идут около трёх дней, в другом половина приходит за сутки, а половина застревает на неделю. Среднее одинаковое, обещание клиенту — разное. Чтобы измерить эту разницу, нужна мера разброса.
Начать логично с отклонения каждого наблюдения от среднего: xᵢ − x̄. Но усреднить эти отклонения не получится: по определению среднего их сумма всегда равна нулю, плюсы и минусы гасят друг друга. Нужен способ убрать знак. Можно взять модули — получится среднее абсолютное отклонение, вполне рабочая величина. Но исторически и математически удобнее оказалось возводить в квадрат: квадрат дифференцируем, у него хорошие алгебраические свойства, дисперсии независимых величин складываются. Средний квадрат отклонения и называется дисперсией.
У дисперсии есть неудобство: она измеряется в квадратах единиц. Дисперсия сроков доставки выражается в «днях в квадрате», и объяснить это в отчёте невозможно. Поэтому из дисперсии извлекают корень и получают стандартное отклонение — величину в тех же единицах, что и сами данные.
Содержательно стандартное отклонение — это типичный размер отклонения наблюдения от среднего. Для распределений, близких к колоколообразным, работает грубый ориентир: примерно две трети наблюдений лежат в пределах одного σ от среднего, около 95% — в пределах двух σ. Для произвольных распределений действует более слабое, но универсальное неравенство Чебышёва: доля наблюдений дальше k стандартных отклонений от среднего не превышает 1 / k².
n или n − 1
В формуле дисперсии знаменатель бывает двух видов. Если данные — вся генеральная совокупность (все заказы за месяц, и других не существует), делят на n. Если данные — выборка, по которой оценивают разброс во всей совокупности, делят на n − 1. Причина в том, что отклонения считаются не от истинного среднего, а от выборочного, которое само подстроено под эти же данные и потому лежит к ним ближе, чем истинное. Сумма квадратов получается систематически заниженной, и деление на n − 1 вместо n эту заниженность компенсирует. Это поправка Бесселя.
При n больше сотни разница между двумя вариантами практически незаметна. На выборке из пяти-десяти значений она существенна, и её стоит указывать в примечании к отчёту. Дальше в примерах используется выборочный вариант с n − 1.
Коэффициент вариации
Стандартное отклонение нельзя сравнивать между величинами разной природы и разного масштаба. σ = 2 дня для сроков доставки и σ = 2 кг для веса посылок — числа несопоставимые. Даже внутри одной величины сравнение хромает: разброс в 2 дня при среднем 3 дня и при среднем 30 дней означает совершенно разную стабильность. Коэффициент вариации решает эту задачу, приводя разброс к относительному виду.
CV — безразмерная величина, поэтому им можно сравнивать стабильность сроков доставки, веса отправлений и конверсии рассылок в одной таблице. Практический ориентир: CV ниже 20–25% означает довольно однородный процесс, выше 50% — процесс, где типичное значение мало что предсказывает. Ограничения жёсткие: CV имеет смысл только для шкалы отношений с настоящим нулём и только при положительном среднем. Для величин, среднее которых близко к нулю или меняет знак (например, изменение выручки к прошлому месяцу), CV взрывается и становится бессмысленным.
Регион A, пять отправлений: 2, 3, 3, 4, 3 дня. Сумма 15, среднее 15 / 5 = 3. Отклонения: −1, 0, 0, 1, 0; их квадраты 1, 0, 0, 1, 0, сумма квадратов 2. Выборочная дисперсия 2 / 4 = 0,5, стандартное отклонение √0,5 ≈ 0,71 дня, CV = 0,71 / 3 × 100% ≈ 23,6%. Регион B, тоже пять отправлений: 1, 2, 4, 7, 6 дней. Сумма 20, среднее 20 / 5 = 4. Отклонения: −3, −2, 0, 3, 2; квадраты 9, 4, 0, 9, 4, сумма 26. Дисперсия 26 / 4 = 6,5, стандартное отклонение √6,5 ≈ 2,55 дня, CV ≈ 63,7%. Средние отличаются на день, а предсказуемость — втрое. Региону A можно обещать срок в договоре, региону B — нет, пока разброс не сокращён.
Подача интервала «среднее ± стандартное отклонение» как диапазона, в который попадают значения, при сильно скошенных данных. Для сроков доставки со средним 3,6 дня и стандартным отклонением 4,03 дня такой интервал даёт от −0,5 до 7,6 дня, а отрицательного срока доставки не бывает. Появление невозможного значения на нижней границе — надёжный индикатор того, что распределение не симметрично и правило ±σ к нему неприменимо. Проверка занимает секунду: посчитайте x̄ − 2σ и посмотрите, не ушло ли оно ниже физически возможного минимума. Если ушло, замените в отчёте пару «среднее ± σ» на пару перцентилей, например от 10-го до 90-го, — они всегда лежат внутри реального диапазона данных.
- Отклонения возводят в квадрат, потому что их обычная сумма всегда равна нулю; корень из дисперсии возвращает величину в исходные единицы.
- Делите на n − 1, когда данные — выборка, и на n, когда это вся совокупность; на малых выборках разница заметна.
- Коэффициент вариации делает разброс сопоставимым между разными величинами, но требует положительного среднего и шкалы отношений.
- Интервал «среднее ± σ» осмыслен только для примерно симметричных данных; проверяйте его нижнюю границу на физическую возможность.
Перцентили, квартили, IQR и боксплот
Перцентили описывают распределение без предположений о его форме и лежат в основе почти всех обязательств по срокам доставки.
Суть
Среднее и стандартное отклонение — это характеристики, вычисленные из значений. Перцентили — характеристики, вычисленные из позиций в упорядоченном ряду. Такой подход ничего не предполагает о форме распределения и потому работает одинаково для симметричных и для сильно скошенных данных.
P-й перцентиль — это значение, ниже которого лежит примерно P процентов наблюдений. 50-й перцентиль — уже знакомая медиана. 90-й перцентиль срока доставки означает: девять из десяти отправлений пришли не позже этого срока. Именно в такой форме формулируются соглашения об уровне сервиса, потому что среднее в договоре ничего не гарантирует конкретному клиенту, а фраза «90% отправлений — не дольше 5 дней» гарантирует.
Квартили — это три частных перцентиля, делящих ряд на четыре равные части: Q₁ (25-й перцентиль), Q₂ (медиана, 50-й) и Q₃ (75-й). Расстояние между первым и третьим квартилями называется межквартильным размахом.
IQR — это ширина диапазона, в который попадает центральная половина данных. Он играет ту же роль, что стандартное отклонение, но устойчив к выбросам: чтобы сдвинуть Q₁ или Q₃, нужно изменить не одно крайнее наблюдение, а четверть выборки.
Как это считается
Самый прямой способ — метод ближайшего ранга. Отсортируйте ряд по возрастанию, вычислите позицию и округлите её вверх до целого.
Здесь важно предупреждение. Общепринятого единственного определения перцентиля не существует: разные реализации по-разному поступают с дробной позицией. Одни округляют вверх, другие интерполируют между соседними значениями, третьи используют сдвинутые формулы позиции. Библиотека NumPy по умолчанию интерполирует, Excel предлагает две разные функции, а в SQL-диалектах встречаются оба поведения. На больших выборках разница пренебрежима, на выборке из десяти-двадцати значений она заметна. Практический вывод: фиксируйте метод расчёта в описании метрики и не сравнивайте перцентили, посчитанные разными инструментами.
Правило усов и выбросы
IQR даёт формальный критерий для подозрительных наблюдений. Границы, предложенные Джоном Тьюки, отстоят от квартилей на полтора межквартильных размаха.
Значения за этими границами помечаются как выбросы. Коэффициент 1,5 — соглашение, а не закон природы: для нормального распределения за границы попадает около 0,7% наблюдений, что делает правило разумно строгим. Для сильно скошенных данных, таких как сроки доставки, правило почти всегда пометит длинный правый хвост, и это не повод удалять эти заказы — это повод пойти и разобраться, что с ними случилось.
Как читать боксплот
Боксплот — это графическая запись пяти чисел. Прямоугольник тянется от Q₁ до Q₃, то есть его ширина равна IQR. Линия внутри прямоугольника — медиана. Усы дотягиваются до самых далёких наблюдений, которые ещё не вышли за границы Тьюки. Точки за усами — выбросы, каждая рисуется отдельно.
Читать нужно так: положение прямоугольника показывает, где сосредоточена основная масса; его ширина — разброс; смещение медианы внутри прямоугольника — скошенность (если медиана прижата к левому краю, распределение вытянуто вправо); длина усов и количество точек — поведение хвостов. Главная сила боксплота — сравнение групп: десять регионов на одном графике сразу показывают, где процесс стабилен, а где нет. Главная слабость — боксплот не показывает двугорбость: распределение с двумя пиками и распределение с одним дадут одинаковую картинку. Поэтому для одной группы предпочтительнее гистограмма, а боксплоты — для сравнения многих.
Одиннадцать отправлений доставлены за 1, 2, 2, 3, 3, 4, 4, 5, 6, 8 и 20 дней; ряд уже отсортирован. Медиана — значение в позиции (11 + 1) / 2 = 6, то есть 4 дня. Нижняя половина без медианы — это 1, 2, 2, 3, 3, её середина Q₁ = 2 дня. Верхняя половина — 4, 5, 6, 8, 20, её середина Q₃ = 6 дней. Тогда IQR = 6 − 2 = 4 дня. Границы Тьюки: нижняя 2 − 1,5 × 4 = −4, верхняя 6 + 1,5 × 4 = 12. Заказ на 20 дней выходит за верхнюю границу и помечается как выброс. Для SLA считаем 90-й перцентиль методом ближайшего ранга: 0,9 × 11 = 9,9, округляем вверх до 10, десятое значение равно 8. В договор идёт формулировка «90% отправлений — не дольше 8 дней». Для сравнения: среднее по этому ряду равно 58 / 11 ≈ 5,3 дня, и оно не описывает ни типичный заказ, ни обязательство.
Обещание срока доставки по среднему вместо перцентиля. В отчёте написано «средний срок доставки 5,3 дня», отдел продаж переносит эту цифру в коммерческое предложение как «доставим за 5 дней». По данным примера выше за 5 дней или быстрее доставлены 8 отправлений из 11, то есть около 73%: каждая четвёртая посылка приходит позже обещанного, и претензии появятся неизбежно. Признак ошибки виден сразу — посчитайте, какая доля наблюдений фактически укладывается в обещанный срок. Если это не 90% и не 95%, а примерно 70%, значит в обещание попало среднее. Обязательства всегда формулируйте через перцентиль и всегда называйте его вслух: не «5 дней», а «P90 = 8 дней».
- Перцентиль считается по позиции в отсортированном ряду и не требует никаких предположений о форме распределения.
- IQR = Q₃ − Q₁ — устойчивый аналог стандартного отклонения; границы выбросов по Тьюки отстоят от квартилей на 1,5 × IQR.
- Разные инструменты считают перцентили по разным формулам — фиксируйте метод и не смешивайте источники.
- Боксплот хорош для сравнения групп, но скрывает двугорбость; для одной группы берите гистограмму.
Форма распределения: скошенность и тяжёлые хвосты
Форма распределения объясняет, почему привычные метрики начинают врать, и подсказывает, чем их заменить.
Суть
Центр и разброс не описывают распределение полностью. Третья характеристика — форма: симметрично ли распределение относительно центра и насколько тяжелы его хвосты.
Симметричное распределение выглядит одинаково слева и справа от центра; среднее, медиана и мода у него совпадают. Скошенное вправо (положительная асимметрия) имеет короткий левый край и длинный правый хвост: масса наблюдений прижата к малым значениям, немногие значения улетают далеко вверх. Скошенное влево — зеркальная картина, встречается заметно реже.
Практически все операционные метрики курьерской компании скошены вправо, и на то есть структурная причина. У срока доставки, веса отправления, суммы заказа и времени до открытия письма есть жёсткий нижний предел (быстрее нуля не доставишь, легче нуля не отправишь) и нет верхнего. Асимметрия здесь — не аномалия данных, а свойство процесса, и её не нужно «исправлять». Нужно перестать применять инструменты, рассчитанные на симметрию.
Быстрый диагностический признак не требует формул: сравните среднее и медиану. Если среднее заметно больше медианы — распределение вытянуто вправо. Если меньше — влево. Если они близки — распределение примерно симметрично.
Как измерить скошенность
Формальная мера строится на третьей степени отклонений. Куб сохраняет знак: отклонения вправо дают плюс, влево — минус, и они не гасятся, как при обычном суммировании, а взвешиваются по величине. Деление на куб стандартного отклонения делает результат безразмерным.
Ориентиры для чтения: значение около нуля — симметрия; примерно от 0,5 до 1 — умеренная правая скошенность; больше 1 — сильная. Знак важнее точной величины: на выборках меньше сотни значений оценка асимметрии сама по себе очень неустойчива, поэтому в отчёте разумнее опираться на разрыв между средним и медианой.
Родственная характеристика — эксцесс, построенный на четвёртой степени отклонений. Он измеряет не асимметрию, а тяжесть хвостов: насколько часто встречаются наблюдения, далеко удалённые от центра.
Почему тяжёлые хвосты ломают отчётность
Тяжёлый хвост означает, что заметная доля суммарной величины сосредоточена в малом числе наблюдений. Это тот самый принцип Парето, который в логистике и маркетинге проявляется постоянно: небольшая часть клиентов даёт основную выручку, небольшая часть маршрутов — основные затраты, небольшая часть писем — основной отклик.
Последствия для аналитики три. Во-первых, среднее теряет устойчивость: оно определяется хвостом и скачет от месяца к месяцу вслед за появлением или отсутствием нескольких крупных заказов. Во-вторых, стандартное отклонение перестаёт быть интерпретируемым, а правило «два сигма» даёт границы, не имеющие отношения к реальности. В-третьих, выборочные оценки сходятся медленно: чтобы средний чек стабилизировался, нужно кратно больше наблюдений, чем подсказывает привычка.
Что делать с такими данными
Первое — сменить набор метрик. Медиана вместо среднего, перцентили вместо интервала «среднее ± σ», IQR вместо стандартного отклонения. Это самый дешёвый и самый надёжный ход.
Второе — усечённое среднее: отбросить по 5% наблюдений с каждого края и усреднить остаток. Правило усечения нужно зафиксировать и не менять от отчёта к отчёту.
Третье — логарифмирование. Замена x на log(x) сжимает правый хвост и часто делает распределение почти симметричным, потому что многие процессы мультипликативны по природе. Работает только для строго положительных величин, и результат нужно возвращать в исходные единицы перед подачей бизнесу.
Четвёртое — разделить смесь. Часто длинный хвост — это не «редкие значения одной популяции», а вторая популяция: негабаритные отправления, доставка в труднодоступные районы, корпоративные клиенты. Разделив данные на сегменты, вы получаете два распределения приличной формы вместо одного уродливого, и каждое можно описывать обычными средствами.
Возьмём пять значений веса отправлений в килограммах: 1, 2, 2, 3, 7. Сумма 15, среднее 3. Отклонения: −2, −1, −1, 0, 4. Квадраты: 4, 1, 1, 0, 16, сумма 22, дисперсия 22 / 5 = 4,4, σ = √4,4 ≈ 2,098, σ³ ≈ 9,23. Кубы отклонений: −8, −1, −1, 0, 64, сумма 54, третий момент 54 / 5 = 10,8. Асимметрия A = 10,8 / 9,23 ≈ 1,17 — сильная правая скошенность. Тот же вывод виден без формул: среднее 3 больше медианы 2. Теперь масштаб побольше. За месяц 100 отправлений: 95 обычных с себестоимостью доставки 300 рублей и 5 негабаритных по 5000 рублей. Средняя себестоимость равна (95 × 300 + 5 × 5000) / 100 = (28500 + 25000) / 100 = 535 рублей, медиана — 300 рублей. Пять отправлений из ста формируют почти половину всех затрат: 25000 из 53500. Планировать бюджет по среднему в 535 рублей означает планировать по числу, которого не встречается ни в одном заказе.
Вывод «средний чек вырос» по скошенным данным без проверки медианы. В отчёте видно, что средняя стоимость отправления за месяц поднялась с 480 до 535 рублей, и это подаётся как рост среднего чека. На деле медиана осталась на 300 рублях, а весь прирост дали два дополнительных негабаритных заказа. Никакого сдвига в поведении массового клиента не произошло. Проверка занимает одну строку кода: посчитайте медиану и, например, 90-й перцентиль за оба периода. Если медиана стоит на месте, а среднее и P90 растут, изменился хвост, а не типичный клиент, и формулировка в отчёте должна быть именно такой. Дополнительный контроль — доля суммы, которую дают верхние 5% заказов: если она заметно выросла, вывод о «росте среднего чека» неверен.
- Среднее больше медианы — правая скошенность; это норма для сроков, весов и сумм, у которых есть нижний предел и нет верхнего.
- Асимметрия считается по кубам отклонений; на малых выборках доверяйте её знаку, а не величине.
- При тяжёлом хвосте среднее нестабильно от периода к периоду, а правило «два сигма» даёт границы вне реальности.
- Лечение: медиана и перцентили, усечённое среднее, логарифм или разделение данных на сегменты.
Корреляция: Пирсон, Спирмен и почему это не причинность
Коэффициент корреляции измеряет согласованность двух величин и не говорит ничего о том, что на что влияет.
Суть
Связь двух величин начинается с ковариации. Для каждого наблюдения берут отклонения от средних по обеим переменным и перемножают их. Если обе величины одновременно выше своих средних или обе ниже, произведение положительно; если одна выше, а другая ниже — отрицательно. Сумма этих произведений показывает, преобладает ли согласованное поведение.
У ковариации та же беда, что у дисперсии: её величина зависит от единиц измерения. Ковариация веса в килограммах и стоимости в рублях изменится в тысячу раз при переходе к граммам, хотя связь останется прежней. Решение — поделить на произведение стандартных отклонений обеих величин. Получается безразмерное число, всегда лежащее между −1 и 1: коэффициент корреляции Пирсона.
Значение 1 означает точную прямую с положительным наклоном, −1 — с отрицательным, 0 — отсутствие линейной связи. Ключевое слово здесь «линейной»: Пирсон измеряет, насколько хорошо облако точек описывается прямой, и ничего больше. Квадрат коэффициента, r², читается как доля разброса одной переменной, объяснённая линейной связью с другой.
Как это считается
Пять отправлений с весом 1, 2, 3, 4 и 5 кг и тарифом 150, 180, 240, 260 и 320 рублей. Среднее по весу равно 3, среднее по тарифу равно 1150 / 5 = 230. Отклонения по весу: −2, −1, 0, 1, 2; по тарифу: −80, −50, 10, 30, 90. Произведения отклонений: 160, 50, 0, 30, 180, их сумма 420. Сумма квадратов по весу: 4 + 1 + 0 + 1 + 4 = 10. Сумма квадратов по тарифу: 6400 + 2500 + 100 + 900 + 8100 = 18000. Тогда r = 420 / √(10 × 18000) = 420 / √180000 ≈ 420 / 424,3 ≈ 0,99. Связь почти идеально линейная, что для тарифной сетки ожидаемо.
Спирмен: корреляция рангов
Когда связь монотонна, но не линейна, Пирсон занижает её силу. Коэффициент Спирмена решает это радикально: значения заменяются на их ранги в упорядоченном ряду, и Пирсон считается уже по рангам. Если рангов-дубликатов нет, есть короткая формула, где dᵢ — разность рангов i-го объекта по двум переменным.
Спирмен измеряет монотонность: растёт ли одна величина при росте другой, безразлично, по прямой или по кривой. Он устойчив к выбросам, потому что ранг самого большого значения равен n независимо от того, насколько оно велико. И он применим к порядковым шкалам, где Пирсон неуместен.
Пример контраста. Номер недели рассылки 1, 2, 3, 4, 5 и число переходов 2, 4, 9, 17, 60. Ранги по обеим переменным совпадают полностью, все разности рангов равны нулю, поэтому ρ = 1 − 0 = 1. Пирсон на тех же данных даёт около 0,85: рост есть, но он не линейный, а ускоряющийся, и прямая описывает его посредственно. Правило выбора: линейная связь и примерно симметричные данные без выбросов — Пирсон; монотонная связь, скошенные данные, выбросы или порядковые шкалы — Спирмен.
Почему это не причинность
Корреляция — утверждение о совместном поведении двух колонок таблицы. Причинность — утверждение о том, что произойдёт, если вмешаться и изменить одну из величин. Из первого второе не следует, и причин тому несколько.
Общая причина: обе величины растут вслед за третьей, скрытой. Обратное направление: связь есть, но влияние идёт в другую сторону. Отбор: связь порождена тем, как собраны данные, а не самими процессами. Случайность: при переборе десятков пар метрик несколько высоких корреляций возникнут сами собой. Наконец, эффект агрегации — корреляция, посчитанная по регионам, может иметь другой знак, чем посчитанная по отдельным заказам.
Единственный надёжный способ перейти от связи к причине — эксперимент со случайным распределением объектов по группам. Всё остальное — гипотезы.
По 30 городам посчитана корреляция между числом курьеров и числом жалоб: r ≈ 0,8. Вывод «курьеры создают жалобы» абсурден, но формально следует из числа. Скрытая переменная — объём заказов: где заказов больше, там и курьеров больше, и жалоб больше. Проверка: перейти к нормированным величинам — числу жалоб и числу курьеров на тысячу заказов. Если после нормировки корреляция исчезает, исходная связь объяснялась масштабом города. Второй сюжет: клиенты, получившие больше писем, приносят больше выручки. Направление здесь скорее обратное — активные покупатели чаще попадают в сегменты для рассылок. Отличить одно от другого можно только экспериментом: случайно выбрать половину сегмента, отправить ей дополнительную серию писем и сравнить выручку групп.
Публикация коэффициента корреляции без взгляда на диаграмму рассеяния. Возьмите пять точек: x = 1, 2, 3, 4, 20 и y = 5, 4, 3, 2, 20. Первые четыре точки связаны строго убывающе, но пятая, далеко отстоящая от остальных, разворачивает результат: средние равны 6 и 6,8, сумма произведений отклонений равна 226, суммы квадратов равны 250 и 222,8, и r = 226 / √(250 × 222,8) ≈ 0,96. Коэффициент рапортует о сильной прямой связи, которой в основной массе данных нет. Спирмен на тех же данных даёт 0: ранги x равны 1, 2, 3, 4, 5, ранги y — 4, 3, 2, 1, 5, разности рангов −3, −1, 1, 3, 0, сумма их квадратов 20, и ρ = 1 − 6 × 20 / (5 × 24) = 1 − 1 = 0. Правило работы: любой коэффициент корреляции сопровождайте диаграммой рассеяния и считайте оба коэффициента. Сильное расхождение между ними — сигнал выброса или нелинейности, и разбираться нужно до того, как число попадёт в отчёт.
- Пирсон измеряет только линейную связь и меняется от −1 до 1; r² показывает долю объяснённого разброса.
- Спирмен работает с рангами: он ловит любую монотонную связь, устойчив к выбросам и применим к порядковым шкалам.
- Расхождение между Пирсоном и Спирменом почти всегда указывает на выброс или нелинейность — смотрите диаграмму рассеяния.
- Связь может объясняться общей причиной, обратным влиянием, отбором или случайностью; причинность подтверждает только эксперимент.
Теория без задач не держится
Восемь задач по этому модулю: выбор ответа и расчёт, с разбором каждого решения. Задачи, в которых вы ошиблись, вернутся в следующий заход.
Перейти к тренажёру