Имя мне легион, потому что нас много: что такое генеральная совокупность

Александр Сойнов & Александр Кулябин

В предыдущих наших статьях мы описали такие понятия, как p-value, доверительный интервал и hazard ratio. Это такие прикладные вещи, изучив которые вы уже сможете понимать большу́ю часть научных публикаций.

Начиная с этой статьи, мы будем освещать основы статистики, которые вы все проходили или еще пройдете в медицинском вузе (ха-ха, на самом деле нет), а мы лишь попробуем сделать эти темы чуть понятнее.

Генеральная и выборочная совокупность

Генеральная совокупность (популяция исследования) – это все объекты, подходящие под критерии включения нашего исследования. Другими словами это те, про кого мы делаем исследование и на кого мы бы хотели обобщить наши результаты.

Она может быть как колоссальных размеров (например, в исследовании влияния курения на продолжительность жизни генеральной совокупностью могут быть все люди страны или даже мира), так и очень ограниченной (например, при исследовании препаратов для лечения спинальной мышечной атрофии (СМА) генеральная совокупность составит всего несколько тысяч человек).

Конечно, лучшим методом было бы исследование всех элементов генеральной совокупности. И если в случае СМА мы еще можем представить себе такое, то исследовать вред курения на примере всех курящих и некурящих людей мира не сможет позволить себе никто. И как раз в этот момент к нам приходит на помощь такое понятие как выборочная совокупность.

Выборочная совокупность (выборка) – это непосредственно те, кто вошел в наше исследование. Иными словами это условно небольшая группа людей, выбранных из генеральной совокупности, которая должна максимально точно (репрезентативно) отразить свойства этой самой совокупности. Да, все мы уникальны и неповторимы, но каким бы хаотичным и непознаваемым был бы мир, если бы это было правдой.

Для нашего исследования отвара ольховых шишек генеральной совокупностью были бы все люди, кто болел той болезнью, которую лечат данным отваром. Выборкой же станут непосредственно наши участники исследования, на которых мы решили проводить эксперимент.

Как подобрать объекты для своей выборки?

Следует сразу уточнить, что следующие пункты в большей степени описывают корреляционные (экологические) и поперечные (cross sectional) исследования, чаще применяемые при исследованиях эпидемиологии, методом которых является проведение анкетирования и опросов (спойлер: именно такие исследования в основном и проводятся в медицинских вузах). Для других видов дизайна исследования (когортных, случай-контроль или РКИ) подбор данных происходит иначе, и это не совсем соответствует нашей теме.

Итак, как выбрать участников своего исследования? Можно просто выйти на улицу и взять первых попавшихся людей. Но где гарантия, что мимо нас в тот момент не будет проходить группа школьников после занятий или рота солдат? Ни о каком отражении всей совокупности тогда говорить не придется. Значит, надо прибегнуть к каким-то ухищрениям для выбора себе объектов исследования, а именно методам формирования выборки. К ним относятся:

Метод первый: простая одноступенчатая случайная выборка

Тут все понятно из названия. Просто тыкаем в разных локациях в кого-то пальцем и выбираем. На практике, для исключения повторения сценария с ротой солдат, всем исследуемым объектам генеральной совокупности присваивается порядковый номер, и набор таких номеров выбирается генератором случайных чисел.

Имя мне легион, потому что нас много: что такое генеральная совокупность, image #1

Метод второй: систематическая (механическая) выборка

Предусматривает отбор заданного числа респондентов через равные интервалы (шаги). То есть, как и в предыдущем варианте объектам присваивается порядковый номер, а затем выбирается каждый пятый, десятый или сотый.

Имя мне легион, потому что нас много: что такое генеральная совокупность, image #2

Метод третий: стратифицированная выборка

Для этого на первой ступени необходимо разделить генеральную совокупность на группы или страты, различные по природе (пол, возрастная группа, стаж курения, подтипы рака молочной железы), а затем снова провести простую случайную выборку, но уже в получившихся стратах. Таким образом, мы гарантируем себе точное качественное отражение интересующих нас свойств генеральной совокупности.

Имя мне легион, потому что нас много: что такое генеральная совокупность, image #3

Метод четвертый: групповая выборка (кластерная)

По аналогии с предыдущим на первом ступени происходит разделение на кластеры, которые отличаются от страт тем, что, разделение происходит не по качественному признаку, а, например, по месту проживания, подразумевая, что данная локация сама по себе является отражением генеральной совокупности.

Имя мне легион, потому что нас много: что такое генеральная совокупность, image #4

Есть еще другие виды формирования выборок, но для медицинской статистики они не имеют особого смысла.

Как понятно, при любом методе формирования выборки для нас важным является соответствие состава выборочной совокупности составу генеральной совокупности. Иными словами выборка должна быть репрезентативной.

Что такое репрезентативность

Репрезентативность – несколько философское понятие, подразумевающее соответствие характеристик выборки характеристикам популяции или генеральной совокупности в целом. Репрезентативность определяет, насколько возможно обобщать результаты исследования с привлечением определённой выборки на всю генеральную совокупность.

К сожалению, определенных критериев и формул для определения репрезентативности не существует. Однако есть некоторые варианты ее выражения, а именно качественный и количественный.

  • Качественная репрезентация обязывает включить в выборку все возможные варианты респондентов, подходящие нашей генеральной совокупности, для чего нам служат описанные выше методы формирования выборок.
  • Количественное же выражение определяется при расчете размера выборки. И вот это уже используется абсолютно при любом дизайне исследования. Нас всегда интересует, сколько объектов нам включить в исследование, будь то опрос, анкетирование или РКИ. Эта тема заслуживает отдельной статьи, и, хотя в жизни большинство из нас с ней и не столкнется, возможно, когда-нибудь мы до нее и дойдем.
Но если в двух словах, то на дворе 21 век и у всех есть интернет, где вы можете найти калькулятор для любого статистического параметра, например STATA или Epi Info, а для расчета размера выборки корреляционных и поперечных исследований хватит и онлайн-калькуляторов.
Главное, перед тем, как начать считать размеры ваших возможных исследований, вам нужно определить дизайн планируемого исследования и тип переменных, выбрать базовые параметры для исследования, то есть статистические константы - вероятность ошибок первого и второго рода, и, соответственно, p-value и мощность. Также в зависимости от выбранного дизайна исследования помимо констант, вам могут понадобиться такие переменные, как размер генеральной совокупности, стандартное отклонение, размеры ожидаемого эффекта, которые вы можете найти либо в уже проведенных аналогичных исследованиях, либо посоветовавшись с экспертом в данной теме.

Итоги

  • Генеральная совокупность – это те люди, ради кого было проведено исследование.
  • Выборка – это те, кто вошел в исследование.
  • Существует несколько методов формирования выборки:

Простая случайная выборка - выбор объектов исследования происходит случайно волей исследователя или генератором случайных чисел.

Систематическая выборка - выбирается каждый n-ный объект генеральной совокупности (каждый пятый, десятый, сотый)

Стратифицированная выборка - на первом этапе происходит разделение генеральной совокупности на страты с определенными интересующими нас характеристиками, после чего проводится случайная выборка из каждой страты.

Групповая выборка (кластерная) - на первом этапе происходит разделение генеральной совокупности на группы (кластеры), отражающие генеральную совокупность (например, по району проживания), после чего проводится случайная выборка в некоторых кластерах или они берутся целиком.

  • Репрезентативность – отражение выборкой свойств генеральной совокупности.
698 views·16 shares