Больше — не значит лучше: для чего придумали P-value

Александр Сойнов & Александр Кулябин

Почему это важно?

Думаю, каждый из нас, читая научные статьи, сталкивался с загадочным сочетанием цифр и букв: P<0.001 или P<0.05 и тому подобное. Если не для большинства, то для значимой части юных исследователей эти обозначения остаются загадочными и неизвестными, так что сегодня мы постараемся разобраться, что это за загадочное P и почему больше — не значит лучше.

Бывает так - исследуешь влияние отвара ольховых шишек на продолжительность заболевания, результаты потрясающие и очевидны казалось бы для всех, ты открываешь шампанское, чтобы праздновать, но тут приходит твой самый нелюбимый друг и говорит

– Слушай, а если ты продолжишь набирать людей из той же генеральной совокупности в свое исследование, то картина может поменяться.

Разумеется, ты прогоняешь этого невежду. Но решаешь все-таки проверить его слова.

Твои результаты до прихода друга
Твои результаты до прихода друга
Твои результаты после
Твои результаты после

Как видно, прямая зависимость превратилась в полнейшую случайность.

Что же произошло? Почему четкая взаимосвязь исчезла на глазах?

Перед нами встает вопрос, а была ли вообще связь между лечением ольховыми шишками и длительностью заболевания?

Для этого нам необходимо обратиться к статистике, ведь по сути статистика занимается проверкой гипотез.

Как обычно проверяют гипотезы

Обычно любые научные гипотезы проверяются следующим образом:

  1. Выдвигается нулевая гипотеза (для нас бы она звучала как «Отвар ольховых шишек никак не влияет на продолжительность заболевания»);
  2. Проводятся исследования, в ходе которых нулевая гипотеза опровергается;
  3. Подтверждается или отвергается альтернативная гипотеза Отвар ольховых шишек снижает продолжительность заболевания»).

В ходе наших исследований могут возникнуть 4 варианта:

  1. Мы можем принять нулевую гипотезу, когда в действительности она верна;
  2. Мы можем отвергнуть нулевую гипотезу, когда в действительности она не верна;
  3. Мы можем отвергнуть нулевую гипотезу, когда в действительности она будет верна и это будет ошибка первого рода (обозначается буквой α);
  4. Мы можем принять гипотезу, когда в действительности она будет неверна и это будет ошибкой второго рода (обозначается буквой β).

Вы спросите меня: зачем нам все это и где уже про P-значение?

Больше — не значит лучше: для чего придумали P-value, image #3

На что я отвечу: нельзя так просто взять и понять P-value

Чтобы понять — лучше разберемся на примере

Мы знаем, что на выздоровление от болезни N требуется в среднем 15 дней. Мы разработали отвар ольховых шишек и хотим проверить, сократится ли срок болезни при его принятии. Для нашего воображаемого исследования критически значимый уровень альфа меньше 0,05 [пока возьмем ее из головы, а откуда эта цифра расскажем в другой раз]. То есть шанс ошибки первого рода менее 5%.

Мы опробовали отвар на некотором количестве пациентов и, о чудо, оказалось, что срок болезни в среднем сократился до, предположим, 12 дней.

Интерпретировать результаты можно двояко. Либо отвар ольховых шишек действительно работает, либо такой результат мог быть получен случайно вне зависимости от действия отвара.

Для решения этой дилеммы необходимо введение двух понятий:

1) Нулевая гипотеза (H0) – говорит нам о том, что наш отвар не работает, никакого взаимодействия не оказывает и в среднем все наши пациенты болеют столько же дней, сколько болеют в среднем все люди, то есть 15 дней. H0=15.

2) Альтернативная гипотеза (H1) – говорит о том, что наш отвар влияет на выздоровление, а значит и среднее количество дней болезни меньше того сколько болеют все люди, то есть не равно 15. H1<15

Вот здесь и появляется Р-value

P-значение (p-value) – это вероятность того, что мы получим наблюдаемые или еще более значимые показатели абсолютно случайно. Или же что вероятность получить такие же результаты возможна при верной нулевой гипотезе, а это абсурдно, потому как она, напомню, противоречит тому, что мы пытаемся доказать. Запомните это, потому что именно так мы будем сравнивать этот показатель с уровнем альфа.

Итак, для нашего исследования P-значение говорит, насколько случайно снизилось количество дней болезни при приеме отвара ольховых шишек.

Пусть P-значение для нашего случая будет меньше 0,03 [P-значение высчитывается по ряду формул, которые мы разберем в следующих статьях, пока мы берем его условно из головы].

Это значит, что при P<0,03 вероятность того, что средняя продолжительность болезни случайно составит 12 дней при приеме отвара из шишек менее 3%. Уровень альфа, напомню, был взят за 0,05, то есть 5%.

Если говорить просто, то при нашем P-значении менее 0,05 мы можем смело отвергать нулевую гипотезу, и отвар ольховых шишек действительно работает.

Если наше P-значение более 0,05, то у нас недостаточно оснований, чтобы отвергнуть нулевую гипотезу, и, возможно, наш отвар никак не влияет на продолжительность заболевания.

Почему мы можем это сделать?

Тут вспомним наши циферки и предыдущие определения. Вероятность ошибки первого рода, а именно вероятность отвергнуть нулевую гипотезу (то есть гипотезу о неэффективности отвара) при том, что она верна, у нас принята за 5%. Назовем это вероятностью ложно-подтвержденной эффективности. Вероятность же получить наши результаты при нулевой гипотезе 3%. То есть вероятность полученных нами результатов при уверенности в неэффективности отвара.

Другими словами, шанс получить случайный эффект при уверенности в неэффективности лечения ниже, чем шанс получить доказанный эффект при ложно-подтвержденном лечении.

Да, получилось сложновато, но, думаю, прочитав пару раз и разобравшись в терминах, вы все поймете.

Больше — не значит лучше: для чего придумали P-value, image #4

На практике это значит, что если по условиям задачи у нас критически значимый уровень альфа <0,05 - это фиксированное значение вероятности ошибки первого рода.

Чем меньше P-значение, тем меньше вероятность допустить ошибку первого рода и при P< 0,05 мы не допустим ошибку первого рода, а значит, нулевую гипотезу можно отвергнуть.

Но если P больше 0,05 - у нас недостаточно данных, чтобы быть уверенным в том, что мы не допустим ошибку первого порядка, а это значит, что мы не можем отвергнуть нулевую теорию.

Так на графике выглядит соотношение вероятности ошибки первого рода (α) и вероятности получения случайных показателей (p-value) при нормальном распределении.

Интервал А – обратите внимание, P-значение не указывает только на наш результат, оно продолжается дальше, то есть включает все значение от 12 до 0, именно поэтому в определении говорится , что это вероятность получения наблюдаемых (12 дней) или еще более экстремальные( от 11,9 до 0); Отрезок Б – включает вероятные P-значения, при которых так же отвергается нулевая гипотеза.
Интервал А – обратите внимание, P-значение не указывает только на наш результат, оно продолжается дальше, то есть включает все значение от 12 до 0, именно поэтому в определении говорится , что это вероятность получения наблюдаемых (12 дней) или еще более экстремальные( от 11,9 до 0); Отрезок Б – включает вероятные P-значения, при которых так же отвергается нулевая гипотеза.

Таким образом, в нашем случае мы можем сказать, что прием отвара ольховых шишек с высокой вероятностью влияет на длительность заболевания.

Итоги:

  1. P-value показывает лишь вероятность того, что мы получили наблюдаемые или еще более значимые показатели абсолютно случайно;
  2. Если P-уровень значимости больше уровня альфа, то у нас недостаточно данных, чтобы отвергнуть нулевую теорию;
  3. Но если P-уровень значимости ниже уровня альфа, то мы можем отвергнуть нулевую гипотезу в пользу альтернативной и подтвердить нашу теорию;
  4. P-уровень значимости не позволяет ничего нам сказать о том, с какой вероятностью верна нулевая гипотеза;
  5. P-уровень значимости ничего не говорит ни о правильности, ни о значимости, ни о ценности, ни о научности получаемых результатов!
  6. Следует всегда представлять само значение p-value, а не только показывать, что оно больше или меньше порогового.

Для тех, кто хочет углубиться в тему

1) Гринхальх Триша: Основы доказательной медицины.

2) Владимир Савельев: Статистика и котики.

3) Стентон Гланц: Медико-биологическая статистика.

4) Петр Талантов: 0,05. Доказательная медицина от магии до поисков бессмертия.

5) Курс от Stepik и Института биоинформатики

6) Чарльз Уиллан: Голая статистика

7) Архивный материал от Cancer Club СПбГУ: https://vk.com/wall-178806594_59

3191 views·58 shares