Что естественно — то не сверхъестественно: нормальное распределение
Александр Сойнов & Александр Кулябин
Дисклеймер: некоторые понятия, упоминаемые далее, были описаны в наших предыдущих статьях. Вот они, кстати:
- Для чего придумали P-value
- Зачем нужен Hazard Ratio
- Как доверять доверительному интервалу
- Что такое генеральная совокупность
- Как понять, какие данные мы используем
- Что измеряют меры центральной тенденции
- Квартили распределения
Без этого можешь даже не пытаться читать эту статью, заходить на наш паблик в принципе, и вообще, наверно, тебе стоило бы уйти из медицины. Шутка.
Прочитали все статьи? Нет? Ну хотя бы в глоссарий загляните.
Введение
Ну что ж. В прошлых статьях мы попытались разобраться с основными понятиями описательной статистики (скажу еще раз - повторите понятия мер центральной тенденции и мер изменчивости) и теперь можем описать имеющиеся данные как с точки зрения выраженности, так и с точки зрения изменчивости переменных. В этот раз мы посмотрим как наши данные распределяются в популяции.
Спойлер: в основном, нормально.В этот раз мы опять отойдем от лирики к физике. Да, тут будут формулы (на самом деле одна) и непонятные символы. Готовьтесь.
Сегодня мы познакомимся с таким понятием как нормальное распределение. Данный термин описывает частоту встречаемости проявлений признака в популяции.
Почему распределение нормальное? Что такое норма? Что мы можем считать нормальным? На самом деле, данные понятия не нуждаются в сложных трактовках.
С точки зрения статистики, да и вообще науки в целом, нормальность - это соответствие, как ни странно, общепринятой норме, то есть показателям подавляющего большинства измерений. Однозначных критериев нормы не существует и в каждом отдельном случае критерии нормы могут варьировать в широком диапазоне. Но для подавляющего большинства популяций, количественные переменные какого бы то ни было признака укладываются в следующий график:
На нем мы видим, что большинство признаков будет располагаться на расстоянии 2 сигм от среднего (для тех, кто так и не прочитал предыдущие статьи и не знает, что такое сигма - то это квадратный корень из дисперсии. Надеюсь, вам стало понятнее, лентяи).
Так что такое нормальное распределение?
Нормальное распределение - это унимодальное, симметричное распределение, в котором отклонения от среднего подчиняются определенному вероятностному закону.
Закон этот зовется правило “двух” и “трех” сигм и говорится в нем что:
- 68% наблюдений находится в диапазоне плюс/минус одна сигма;
- 95% наблюдений находится в диапазоне плюс/минус две сигмы;
- почти 100% наблюдений находится в диапазоне плюс/минус три сигмы.
Почему нам важно понимать этот закон? Потому что, к счастью, мы живем в скучном и предсказуемом мире, где все протекает по подобным этому правилам, что позволяет нам быть уверенными в познаваемости мира в принципе (или хотя бы тщетно убеждать себя в этом).
Любые количественные параметры в совокупности, такие как рост, вес, количество потребляемой еды и прочие характеристики распределены в основном нормально, что позволяет нам предполагать выраженность изменчивости в описываемой популяции, и не видя ее всю, судить о репрезентативности выборки. А еще мы можем, увидев график распределения, даже судить о таких казалось бы философских понятиях, как норма (даже если Елена Малышева уже все сделала за нас).
Все это здорово, но пока была лишь лирика, скажете вы, где обещанные формулы (которая одна)?
Давайте познакомимся еще с одной штукой и после этого вы поймете насколько могущественную силу вы обрели.
Мы поговорим о Z-стандартизации.
Что за Z-стандартизация?
Z-стандартизация - это такое преобразование данных, которое позволяет перевести любую нашу шкалу в следующий тип, где среднее значение будет равняться 0, а стандартное отклонение 1.
Какой бы мы признак не измеряли, мы всегда можем представить наши данные таким образом. Для чего это нужно - будет понятно позднее.
Зачем это нужно, расскажем позднее, а пока для того, чтобы преобразовать наши данные в Z шкалу нам поможет вот такая формула:
Xi - значение показания конкретного исследуемого;
X - среднее значение по выборке;
S - стандартное отклонение по выборке.
Выглядит не сложно, правда? Но для чего она нам?
Чтобы лучше понять, давайте разберемся на конкретном примере:
Представим ситуацию, у нас есть некоторое общество веселых людей (разумеется, живущих в Петербурге), в котором средний объем потребления огненной воды равен 40 литрам в год.
Допустим, нам стало интересно, какой процент людей из нашей выборки употребляет более 44 литров в год, потому что по данным некоторых исследований при данном объеме значимо увеличивается вероятность развития цирроза печени (или алкогольного делирия).
Пользуясь знаниями из предыдущих статей, мы вычислили, что стандартное отклонение (sd, или σ) равно для нашей выборки 8.
А теперь, исходя из определения Z-преобразования, сделаем график таким, чтобы среднее значение было равно нулю, а стандартное отклонение — единице.
Далее подставим значения в нашу формулу:
Z = (44-40)/8= 0,5.
Отлично, считаем мы очень профессионально. А что нам это дает?
А это дает самое прекрасное, что есть в статистике. Это дает нам универсальный ответ на вопрос, в каком проценте выборки лежат интересующие нас значения. Ведь таким образом мы подводим абсолютно любые возможные числовые выражения какого-либо признака под единый стандарт, для которого великие и занудные ученые умы уже давно сделали таблички расчета.
Они легко гуглятся, одну можно найти вот тут. На примере ниже вы можете посмотреть, как ими пользоваться. В первой колонке выбираем получившееся значения до десятых. А в первой графе указываем сотые (на тот случай, если у нас получилось бы не 0,5, а 0,51 или 0,59).
Нам подходит число 0,3085.
Это говорит нам о том, что вероятность встретить значение, которое больше 0,5 сигм в Z шкале составляет приблизительно 0,3085.
А если перейти с языка статистики на русский, это значит, что в процент людей, потребляющих более 44 литров огненной воды в неназванной, но отчего-то родной сердцу стране составляет 30,85% процентов.
Ну, а что делать дальше с полученными данными, как с ними жить и как использовать в науке - решать уже непосредственно вам.
Выводы
- Нормальное распределение - это закон, которому подчиняются большинство количественно измеряемых признаков.
- Нормальное распределение прямо соответствует правилу “двух” и “трех” сигм,
- Z стандартизация представляет собой шкалу, в которой для любых данных среднее значение принимается за 0, а стандартное отклонение за 1.
- Z стандартизация позволяет нам ответить на вопрос, какой процент наблюдений в абсолютно любой выборке находится в интересующем нас диапазоне.
Глоссарий:
- Нормальное распределение - это закон, которому подчиняются большинство количественно измеряемых признаков. Нормальное распределение подчиняется правилу “двух” и “трех” сигм, то есть 68% наблюдений находится в диапазоне плюс/минус одна сигма; 95% наблюдений находится в диапазоне плюс/минус две сигмы; почти 100% наблюдений находится в диапазоне плюс/минус три сигмы.
- Z стандартизация представляет собой шкалу, в которой для любых данных при нормальном распределении среднее значение принимается за 0, а стандартное отклонение за 1. Z стандартизация позволяет нам ответить на вопрос, какой процент наблюдений в абсолютно любой выборке находится в интересующем нас диапазоне.
