Что посчитаешь, то и пожнешь: параметрические и непараметрические тесты
Выбор адекватного теста для того, чтобы сравнивать данные - достаточно сложное мероприятие для исследователя, особенно без знаний основ статистики. Будьте готовы, что этот пост не самый легкий, и возможно его придется повторно перечитывать (будет много новых терминов и, о боже, фамилий). Но вы не пугайтесь - полученные знания того стоят.
Сегодня рассмотрим выбор метода анализа для количественных переменных (если еще не знаете, что это, то бегом читать этот наш пост).
P.S. А еще — обязательны к прочтению все наши предыдущие посты по статистике (мы не шутим)! Иначе вы рискуете не постичь мастерство Силы:
- Для чего придумали P-value
- Зачем нужен Hazard Ratio
- Как доверять доверительному интервалу
- Что такое генеральная совокупность
- Как понять, какие данные мы используем
- Что измеряют меры центральной тенденции
- Квартили распределения
- Нормальное распределение
Начинаем с малого
Основное решение, влияющее на результат (а точнее на его правдивость) – это выбор между двумя типами тестов: параметрическими и непараметрическими (без паники, чуть ниже мы узнаем их получше). Эти тесты, которые позволяют узнать, насколько различаются данные в группах и получить заветный р-уровень.
Почему-то в медицинских ВУЗах в основном изучаются статистические тесты, которые базируются на предположении, что данные были получены на выборке, имеющей нормальное распределение (что это такое и как его определить можно почитать в этой статье и а также в нашем посте). Эти тесты обозначаются как параметрические. Наиболее часто используемые параметрические тесты: t-тест Стьюдента и дисперсионный анализ (ANOVA).
Тесты, которые не базируются на таких допущениях о распределении популяции, называются непараметрическими. В основном, это критерии Уилкоксона, Манна-Уитни и Краскела-Уоллиса. Они также иногда называются тестами, не зависящими от распределения.
Но как понять, какой именно тест нужен тебе?
Это вообще бывает легко?
Выбор между параметрическими и непараметрическими тестами иногда достаточно прост.
Если вкратце, вы должны проверить распределение вашей выборки (лучше проверять тестами Шапиро-Уилка и Колмогорова-Смирнова, а также всегда приятно посмотреть графически).
И если вы уверены, что ваши данные имеют нормальное распределение, то смело используйте параметрические тесты.Но иногда нужно выбирать непараметрический тест, а именно в следующих ситуациях:
- Результат является ранговым или оценочным значением, не имеющим нормального распределения никогда
Например, шкала Апгар, которая измеряет здоровье новорожденных от 0 до 10 и все значения являются целыми, визуальная аналоговая шкала боли (ВАШ), где 0 - это отсутствие боли и 10 - это непереносимая боль и другие);
- Данные, которые достаточно точно оценены, и вы уверены, что популяция не соответствует нормальному распределению.
Сложные ситуации (или наша повседневная практика)
Не всегда легко определить, подходит ли наша выборка Гауссовой генеральной совокупности (т.е. имеет нормальное распределение). Поэтому стоит обращать внимание на следующие моменты:
- Когда у вас есть только небольшое количество наблюдений (точного критерия нет, но условно принято до 100), надо достаточно подробно проверять распределение (тесты, графическое представление). Однако если количество наблюдений до 30 (вероятность нормального распределения таких данных стремится к нулю), то следует всегда использовать непараметрические тесты;
- Посмотрите, как анализируют такие же данные другие исследователи (в статьях можно узнать как представлены данные и какие указаны методы анализа данных);
- Обратитесь к спеуиалисту по статистике (необязательно, но желательно медицинскому) или знакомому, кто разбирается в статистике, за помощью с выбором.
А это действительно на что-то влияет?
Когда люди сомневаются, то некоторые выбирают параметрические тесты, а другие выбирают непараметрические тесты, но надо ли на самом деле задумываться о выборе? Ответ зависит от размера выборки.
Можно выделить четыре ситуации, когда действительно нужно задуматься:
Большая выборка + параметрические тесты
Что произойдет, если использовать параметрический тест с данными, имеющими нормальное распределение? Центральная предельная теорема гарантирует, что параметрический тест будет хорошо работать с большими выборками. Проще говоря, параметрические тесты нужны, если выборка достаточно большая. Однако, проблема заключается в том, что невозможно сказать, когда выборка является достаточно большой (точных критериев не существует);
Большая выборка + непараметрические тесты
Что произойдет, если использовать непараметрический тест с данными из такой выборки? Они работают достаточно хорошо с этими выборками. р-уровень имеет тенденцию быть немножко завышеным, но различия очень небольшие. И проще говоря, т.е. результаты анализа разными тестами (параметрическими и непараметрическими) не будут различаться;
Небольшие выборки + параметрические тесты
На маленьких выборках иногда сложно сказать какое распределение имеют данные, поэтому у исследователей и возникают проблемы. Что произойдет, если Вы будете использовать параметрический тест с такими данными? Вы не можете полагаться на центральную предельную теорему и поэтому значение р-уровня будет неправильным. И результатам вашей работы вы доверять не сможете. Других вариантов нет.
Небольшие выборки + непараметрические тесты
А если использовать непараметрические тесты? Здесь тоже не все просто. В этом случае р-оценка имеет тенденцию быть крайне высокой (что может привести к ошибке II-рода). Непараметрический тест не обладает достаточной силой на небольших выборках.
Поэтому наиболее трудный выбор возникает на небольших выборках, где решение надо основывать на "наименьшем зле" (потому что трудно точно определить распределение данных). В итоге все сводится к тому, что практически во всех случаях лучше использовать непараметрические тесты, т.к. устойчивость к ложным результатам важнее силы. Но не забывайте об их ограничениях.
Итоги
- В вашей работе нужно знать методы проверки распределения (тесты, графики);
- Если вы уверены в типе распределения ваших данных, то это значительно облегчает выбор (нормальное – параметрические, ненормальное – непараметрические тесты);
- Большие наборы данных не представляют крупной проблемы, поскольку разницы в результатах тестов практически нет;
- Небольшие наборы данных как раз и приносят наибольшую головную боль, т.к. непараметрические тесты при небольшом объеме данных недостаточно сильны, а параметрические тесты не являются устойчивыми,
- На малых выборках рекомендуется использовать непараметрические тесты (“наименьшее зло”);
- Если выборка меньше 30 наблюдений, то можно уверенно выбирать непараметрические тесты.
Список литературы (что еще почитать):
- А. М. Гржибовский. Типы данных, проверка распределения и описательная статистика. Экология человека. 2008. №1. 52-58 с.
- А. М. Гржибовский. Анализ количественных данных для двух независимых групп. Экология человека. 2008. №2. 54-61 с.
- А. М. Гржибовский. Анализ трех и более независимых групп количественных данных. Экология человека. 2008. №3. 50-58 с.
- М. Ш. Мухаматзанова, М. А. Захарова, В. А. Вельш. О выборе метода статистической обработки данных для медико-социологических исследований. Бюллетень Волгоградского научного центра РАМН. 2009. №2.51-53 с.
- Ramakrishna H.K. Medical Statistics. For Beginners. 2017.
- Стентон Гланц. Медико-биологическая статистика. 1998.
- Charan Singh Rayat. Statistical Methods in Medical Research. 2018.
