Краткий экскурс в научную статистику

Доброго времени суток, уважаемые читатели! Каждый человек, начинающий заниматься научной работой рано или поздно сталкивается с проблемой статистики. Вы собрали все данные, провели большую работу, а как это все посчитать и красиво вставить в статью? Сегодня поговорим про основные показатели, которые желательно применять в расчетах, а также разберемся со смыслом всего этого.

ПО. Для начала стоит определиться с программой, которую Вы будете использовать. Наиболее простым и доступным вариантом является Microsoft Exel. Он позволяет посчитать самые основные показатели, которых может хватить для статьи. SPSS Scatistics - замечательное программное обеспечение, обладает огромным функционалом и позволяет рассчитать любой показатель. Из минусов: новичкам может быть сложно разобраться; платная подписка. Однако если Вы студент, то можно получить бесплатную пробную версию на месяц, а если Вы не хотите платить, то всегда можно найти бесплатную взломанную версию на просторах интернета (опасайтесь вирусов!). Более подробно про алгоритм работы в этих программах поговорим в отдельном посте.

Перед тем как начать анализ данных, полученных Вами в результате исследования, важно определить какими они являются качественные (то что нельзя посчитать) или количественные (выражается в конкретных цифрах: возраст, рост, гемоглобин и т.д.).

Следующим этапом является определение распределения количественного признака в генеральной совокупности. Это необходимо, чтобы понять являются данные закономерными или нет. Если распределение является НОРМАЛЬНЫМ, то это будет значить, что приблизительно у всех людей будут такие показатели, например средний рост в определенной возрастной группе и т.д. Также здесь можно привести пример из маркетинга, при опросе 1000 человек можно получить представление о мнении большого количества населения. Чтобы определить тип распределения можно воспользоваться двумя критериями:

1) Шапиро-Уилка - при условии, что у Вас выборка менее 50.

2) Колмогорова-Смирнова - для больших выборок.

При использовании данных критериев за нулевую принимается гипотеза о том, что изучаемое распределение не отличается от нормального. Поэтому вывод о типе распределения делаем на основании значений P: если p<0,05 - распределение отличается от нормального; если p>0,05 - распределение является нормальным. Для описания количественных данных с нормальным распределением можно использовать среднюю (М) и стандартное отклонение (SD), их совершенно очень легко посчитать в экселе. Если же количественные данные отличаются от закона нормального распределения, то можно использовать медиану (Me) и процентили. Чаще рассчитываются 25-й (Р25) и 75-й (Р75) процентили, которые также называются квартилями Q1 и Q3 соответственно). Для интервальной оценки медианы также можно рассчитать доверительный интервал, по которому можно судить, в каких пределах находится медианное значение для популяции при заданном уровне доверительной вероятности (чаще всего 95 %).

Для описания качественных показателей необходимо использовать частоты и доли (%), с которыми те или иные значения качественных признаков встречаются в выборке. Например, распределение по полу: Мужчины - 40%, Женщины -60% и т.д.

Статистические критерии для оценки различий между средними значениями в группе.

При нормальном распределении данных используются параметрические критерии, в то время как при асимметричном распределении — непараметрические.

Для сравнения средних значений в двух независимых группах (например, в группе мужчин и группе женщин), в случае, если данные в обеих группах подчиняются закону нормального распределения, используется двухвыборочный (непарный) критерий Стьюдента. Если распределение данных в обеих группах или хотя бы в одной группе является асимметричным, то для сравнения средних значений (в данном случае медианных) следует использовать непараметрические критерии — Манна — Уитни или двухвыборочный Вилкоксона.

Если необходимо сравнить средние значения количественного признака в трех и более независимых группах (например, уровень артериального давления в трех группах пациентов с разными методами лечения), то при нормальном распределении данных во всех группах используется однофакторный дисперсионный анализ (ANOVA). В случае, если нужно сравнить средние значения в трех и более зависимых выборках (например, уровень артериального давления в группе пациентов до воздействия, через 10 минут и через 30 минут после воздействия), при нормальном распределении количественного признака во всех группах используется однофакторный дисперсионный анализ для повторных измерений (Repeated Measures ANOVA).

При интерпретации результатов дисперсионного анализа следует принимать во внимание, что выявление статистически значимых различий говорит только о том, что различия между средними существуют, но не о том, какие из групп различаются между собой. Поэтому следующим шагом после того, как по данным дисперсионного анализа выявлены статистически значимые различия, являются апостериорные сравнения (сравнивание групп между собой попарно). Для сравнения трех и более независимых групп, в которых данные не подчиняются закону нормального распределения, следует применять критерий Краскела — Уоллиса, являющийся непараметрическим аналогом однофакторного дисперсионного анализа. Как и дисперсионный анализ, критерий Краскела— Уоллиса позволяет в целом оценить наличие различий между группами и не позволяют судить о том, какие группы различаются между собой. Поэтому после обнаружения статистически значимых различий между группами в целом, необходимо провести попарные сравнения. Для попарного сравнения независимых выборок можно использовать критерий Манна — Уитни или двухвыборочный критерий Вилкоксона, а для попарного сравнения зависимых выборок — одновыборочный критерий Вилкоксона. Соответственно на наличие или отсутствия различий будет указывать значение P.

Результаты всех проделанных действий необходимо оформить в виде таблицы, графика или диаграммы (зависит от конкретного признака) и вставить в Вашу статью.

ПРО КОРРЕЛЯЦИЮ

При анализе количественных данных, кроме сравнения средних значений в группах, иногда стоит задача выявления взаимосвязи между переменными. Если обе переменные (х и у) количественные, подчиняются закону нормального распределения и между ними существует линейная зависимость, то для выявления взаимосвязи между этими переменными используется коэффициент линейной корреляции Пирсона. Но если распределение переменных является асимметричным или связь между переменными нелинейная, то корреляционный анализ выполняется с помощью коэффициента ранговой корреляции Спирмена. Коэффициент Спирмена также можно использовать для выявления связи, когда одна из переменных (х или у) является порядковой (ранговой). Предъявляя результаты корреляционного анализа, обязательно нужно представлять не только значение коэффициента корреляции (с указанием, что это за коэффициент), но и статистическую значимость выявленной связи между переменными (P).

376 views·5 shares