Поиск объектов указанием связей между шаблонами. Корреляционный метод

Чтобы преодолеть ограничения метода клинических случаев, исследователи личности часто используют альтернативную стратегию, известную как корреляционный метод . Этот метод стремится установить взаимосвязи между событиями (переменными) и внутри них. Переменная - любая величина, которая может быть измерена и чье количественное выражение может варьировать в переделах того или иного континуума. Например, тревожность - переменная, потому что ее можно измерить (с помощью шкалы самооценки тревоги) и потому что люди различаются по степени выраженности у них тревожности. Сходным образом точность выполнения задания, требующего определенного навыка, тоже является переменной, которую можно измерить. Корреляционное исследование можно провести, просто измерив уровень тревожности у некоторого числа людей, а также уровень точности действий каждого из них при выполнении группой сложного задания. Если опубликованные результаты подтвердятся в другом исследовании, то можно будет считать, что субъекты с более низкими показателями тревожности имеют более высокие показатели точности выполнения задания. Поскольку на точность выполнения задания, вероятно, влияют и другие факторы (например, прежний опыт его выполнения, мотивация, интеллект), связь между точностью действий и тревожностью не будет безупречной, но она будет заслуживать внимания.

Переменными в корреляционном исследовании могут быть данные тестирования, демографические характеристики (такие как возраст, порядок рождения и социально - экономический статус), результаты измерения черт характера по методу самооценки, мотивы, ценности и установки, физиологические реакции (такие как частота сердечных сокращений, артериальное давление и кожно - гальваническая реакция), а также стили поведения. При использовании корреляционного метода психологи хотят получить ответы на такие специфические вопросы, как: влияет ли высшее образование на профессиональный успех в будущем? имеет ли отношение стресс к коронарной болезни сердца? есть ли взаимосвязь между самооценкой и одиночеством? есть ли связь между порядковым номером рождения и мотивацией достижения? Корреляционный метод не только позволяет ответить «да» или «нет» на эти вопросы, но также дать количественную оценку соответствия значений одной переменной значениям другой переменной. Для решения этой задачи психологи вычисляют статистический индекс, называемый коэффициентом корреляции (известен также как коэффициент линейной корреляции по Пирсону). Коэффициент корреляции (обозначается маленькой буквой r ) показывает нам две вещи: 1) степень зависимости двух переменных и 2) направление этой зависимости (прямая или обратная зависимость).

Численное значение коэффициента корреляции варьирует от–1 (полностью отрицательная, или обратная зависимость) через 0 (отсутствие связи) до +1 (полностью положительная, или прямая зависимость). Коэффициент, близкий по значению к нулю, означает, что две измеряемые переменные не связаны сколько - нибудь заметным образом. То есть большие или малые значения переменной X не имеют значимой связи с большими или малыми значениями переменной Y . В качестве примера приведем связь между двумя переменными: массой тела и интеллектом. В целом, полные люди не являются значимо более интеллектуальными или значимо менее интеллектуальными, чем более худощавые люди. И, наоборот, коэффициент корреляции +1 или–1 говорит о полном, однозначном соответствии между двумя переменными. Корреляции, близкие к полным, почти никогда не встречаются в исследовании личности, и это заставляет предположить, что хотя многие психологические переменные и связаны друг с другом, степень связи между ними не является столь уж сильной. Значение коэффициента корреляции в пределах между ±0,30 и ±0,60 является общераспространенным в исследовании личности и представляет практическую и теоретическую ценность для научного прогнозирования. К значениям коэффициента корреляции между 0 и ±0,30 следует относиться с осторожностью - их ценность для научных предсказаний минимальна. На рис. 2–2 представлены графики распределения значений двух переменных при двух различных значениях коэффициента корреляции. По горизонтали расположены значения одной переменной, а по вертикали - другой. Каждая точка означает баллы, полученные одним испытуемым по двум переменным.

Рис. 2–2. Каждая из диаграмм иллюстрирует различную степень зависимости значений двух переменных. Каждая точка па диаграмме представляет собой показатели испытуемого по двум переменным: a - полная положительная корреляция (r = +1); b - полная отрицательная корреляция (r = -1); с - умеренная положительная корреляция (r = +0,71); d - корреляция отсутствует (r = 0).

Положительная корреляция означает, что большие значения одной переменной имеют тенденцию быть связанными с большими значениями другой переменной или малые значения одной переменной - с малыми значениями другой переменной. Другими словами, две переменные увеличиваются или уменьшаются вместе. Например, существует положительная корреляция между ростом и массой тела людей. В целом, у более высоких людей есть тенденция иметь большую массу тела, чем у более низких. Другой пример положительной корреляции - связь между количеством сцен насилия, которые видят дети в телевизионных передачах и их тенденцией вести себя агрессивно. В среднем, чем чаще дети наблюдают насилие по телевизору, тем чаще они демонстрируют агрессивное поведение. Отрицательная корреляция означает, что высокие значения одной переменной связаны с низкими значениями другой переменной и наоборот.

Примером отрицательной корреляции может служить связь между частотой отсутствия студентов в аудитории и успешностью сдачи ими экзаменов. В целом, студенты, имевшие большее количество пропущенных занятий, проявляют тенденцию к получению более низких оценок на экзаменах. Студенты, имевшие меньшее количество пропусков, получали более высокие экзаменационные баллы. Другой пример - отрицательная корреляция между робостью и напористым поведением. Лица, получившие высокие баллы по показателю робости, имели склонность к нерешительному поведению, в то время как лица с низкими показателями робости проявляли себя решительными и напористыми. Чем ближе значение коэффициента корреляции к +1 или к–1, тем сильнее связь между двумя изучаемыми переменными. Так, коэффициент корреляции +0,80 отражает наличие более сильной зависимости между двумя переменными, чем коэффициент корреляции +0,30. Сходным образом, коэффициент корреляции–0,65 отражает более сильную взаимосвязь переменных, чем коэффициент корреляции–0,25. Надо иметь в виду, что величина корреляции зависит только от числового значения коэффициента, в то время как знак «+» или «-», стоящий перед коэффициентом, просто обозначает положительная это корреляция или отрицательная. Так, значение r = +0,70 отражает наличие такой же сильной зависимости, как и значение r = -0,70. Но первый пример указывает на положительную зависимость, а второй - на отрицательную. Далее, коэффициент корреляции–0,55 указывает на более сильную зависимость, чем коэффициент корреляции +0,35. Понимание этих аспектов корреляционной статистики поможет вам оценивать результаты исследований такого рода.

Оценка корреляционного метода

Корреляционный метод обладает некоторыми уникальными преимуществами. Наиболее важным является то, что он позволяет исследователям изучать большой набор переменных, которые недоступны проверке с помощью экспериментальных исследований. Например, когда речь идет об установлении связи между сексуальным насилием, перенесенным в детстве, и эмоциональными проблемами в более поздние годы жизни, корреляционный анализ может стать единственным этически приемлемым способом исследования. Аналогично, чтобы изучить, как демократический и авторитарный стили родительского воспитания соотносятся с ценностными ориентациями человека, стоит выбрать этот метод, поскольку этические соображения не дают возможности экспериментально контролировать стиль родительского воспитания.

Второе преимущество корреляционного метода состоит в том, что он дает возможность изучать многие аспекты личности в естественных условиях реальной жизни. Например, если мы хотим оценить влияние развода родителей на адаптацию и поведение детей в школе, мы должны систематически отслеживать социальные и академические успехи детей из распавшихся семей в течение определенного периода времени. Проведение подобного естественного наблюдения потребует времени и усилий, но позволит дать вполне реалистичную оценку сложного поведения. По этой причине корреляционный метод является предпочтительной исследовательской стратегией для персонологов, заинтересованных в изучении индивидуальных различий и феноменов, поддающихся экспериментальному контролю. Третье преимущество корреляционного метода заключается в том, что иногда с его помощью становится возможным предсказать некое событие, зная другое. Например, в исследовании получена умеренно высокая положительная корреляция между оценками по SAT у старшеклассников и их же оценками, полученными позднее в колледже (Hargadon, 1981). Поэтому, зная баллы студентов по SAT, приемная комиссия в колледже может достаточно точно предсказать их последующую успеваемость. Подобные предсказания никогда не бывают совершенными, но часто оказываются полезными для решения вопроса о приеме в учебное заведение. Тем не менее, все исследователи личности признают два серьезных недостатка этой стратегии. Во - первых, применение корреляционного метода не позволяет исследователям выделять причинно - следственные отношения. Суть проблемы состоит в том, что корреляционное исследование не может дать окончательное заключение о том, что две переменные причинно связаны . Например, во многих корреляционных исследованиях подтверждается связь между просмотром телевизионных программ с эпизодами насилия и агрессивным поведением у части детей и взрослых зрителей (Freedman, 1988; Huston, Wright, 1982). Какой вывод можно сделать из этих работ? Одно из возможных заключений таково: просмотр в течение длительного времени сцен насилия по телевидению ведет к возрастанию у зрителя агрессивных побуждений. Но возможен и противоположный вывод: агрессивные по складу своего характера субъекты или те, кто совершали агрессивные действия, предпочитают смотреть телевизионные программы со сценами насилия. К сожалению, корреляционный метод не позволяет установить, какое из этих двух объяснений верно. В то же время, корреляционные исследования, в которых устанавливается сильная корреляционная зависимость между значениями двух переменных, поднимает вопрос о возможности наличия причинно обусловленной связи между этими переменными. Что касается, например, связи между просмотром сцен насилия по телевидению и агрессией, то экспериментальное исследование, проведенное вслед за полученными результатами корреляционного анализа, привело ученых к заключению, что экспозиция программ, содержащих сцены насилия, может быть причиной агрессивного поведения (Eron, 1987).

Второй недостаток корреляционного метода - возможная путаница, вызванная действием третьей переменной. Для иллюстрации рассмотрим зависимость между употреблением наркотиков подростками и их родителями. Означает ли наличие корреляционной зависимости, что подростки, видя, как родители принимают наркотики, сами начинают употреблять их в еще большем количестве? Или это значит, что беспокойство при виде того, как их дети - подростки принимают наркотики, заставляет самих родителей прибегать к наркотикам, чтобы тем самым уменьшить свою тревогу? Или какой - то третий фактор сходным образом толкает подростков и взрослых к употреблению наркотиков? Может быть, подростки и их родители принимают наркотики, чтобы смириться с угнетающей нищетой, в которой они живут? То есть истинной причиной, обусловливающей наркоманию, может быть социально - экономический статус семей (например, бедность). Вероятность того, что третья переменная, которая не измеряется и о которой, может быть, даже и не подозревают, в действительности оказывает причинное влияние на обе измеряемые переменные, нельзя исключать при интерпретации результатов, полученных с помощью корреляционного метода.

Хотя корреляционный метод не предполагает установления причинно - следственной связи, из этого не следует, что причинно - следственные отношения в определенных случаях не могут быть четко установлены. Последнее особенно верно в отношении лонгитюдных корреляционных исследований - где, например, интересующие нас переменные, измеренные в одно время, коррелируют с другими переменными, о которых известно, что они появляются вслед за первыми. Рассмотрим, например, хорошо известную положительную корреляцию между курением сигарет и раком легких. Несмотря на возможность того, что какая - то третья неизвестная переменная (например, генетическая предрасположенность) может служить причиной и курения, и рака легких, мало кто сомневается, что весьма вероятная причина рака - курение, так как по времени курение предшествует заболеванию раком легких. Подобная стратегия (измерение двух переменных, разделенное определенным промежутком времени) дает возможность исследователям устанавливать причинно - следственные отношения в случаях, когда невозможно провести эксперимент. Например, на основе клинических наблюдений исследователи в течение долгого времени подозревали, что хронический стресс способствует развитию многих физиологических и психологических проблем. Недавние работы по измерению силы стресса (с использованием шкал самооценки) позволили проверить эти предположения с применением корреляционного метода. В области физиологических расстройств, например, накопленные данные свидетельствуют о следующем: стресс значимо связан с возникновением и развитием сердечно - сосудистых заболеваний, диабета, рака и различных типов инфекционных заболеваний (Elliott, Eisdorfer, 1982; Friedman, Booth - Kelley, 1987; Jemmott, Locke, 1984; Smith, Anderson, 1986; Williams, Deffenbacher, 1983). Корреляционный анализ также показал, что стресс может способствовать формированию зависимости от наркотиков (Newcomb, Harlow, 1986), сексуальных расстройств (Malatesta, Adams, 1984), а также возникновению многочисленных психических нарушений (Neufeld, Mothersill, 1980). Тем не менее, критики корреляционного подхода справедливо замечают, что могут существовать и другие факторы, искусственно усиливающие предположительную связь между стрессом и болезнью (Schroeder, Costa, 1984). Таким образом, одно предостережение остается: хотя иногда при наличии сильной корреляционной зависимости между двумя переменными напрашивается вывод о наличии причинной связи между ними, в действительности установить причинно - следственные отношения можно только экспериментальными методами.

Корреляционный анализ (от лат. «соотношение», «связь») применяется для проверки гипотезы о статистической зависимости значений двух или нескольких переменных в том случае, если исследователь может их регистрировать (измерять), но не контролировать (изменять).

Когда повышение уровня одной переменной сопровождается повышением уровня другой, то речь идет о положительной корреляции. Если же рост одной переменной происходит при снижении уровня другой, то говорят об отрицательной корреляции. При отсутствии связи переменных мы имеем дело с нулевой корреляцией.

При этом переменными могут быть данные тестирований, наблюдений, экспериментов, социально-демографические характеристики, физиологические параметры, особенности поведения и т. д. К примеру, использование метода позволяет нам дать количественно выраженную оценку взаимосвязи таких признаков, как: успешность обучения в вузе и степень профессиональных достижений по его окончании, уровень притязаний и стресс, количество детей в семье и качества их интеллекта, черты личности и профессиональная ориентация, продолжительность одиночества и динамика самооценки, тревожность и внутригрупповой статус, социальная адаптированность и агрессивность при конфликте...

В качестве вспомогательных средств, процедуры корреляции незаменимы при конструировании тестов (для определения валидности и надежности измерения), а также как пилотажные действия по проверке пригодности экспериментальных гипотез (факт отсутствия корреляции позволяет отвергнуть предположение о причинно-следственной связи переменных).

Усиление интереса в психологической науке к потенциалу корреляционного анализа обусловлено целым рядом причин. Во-первых, становится допустимым изучение широкого круга переменных, экспериментальная проверка которых затруднена или невозможна. Ведь по этическим соображениям, к примеру, нельзя провести экспериментальные исследования самоубийств, наркомании, деструктивных родительских воздействий, влияния авторитарных сект. Во-вторых, возможно получение за короткое время ценных обобщений данных о больших количествах исследуемых лиц. В-третьих, известно, что многие феномены изменяют свою специфику во время строгих лабораторных экспериментов. А корреляционный анализ предоставляет исследователю возможность оперировать информацией, полученной в условиях, максимально приближенных к реальным. В-четвертых, осуществление статистического изучения динамики той или иной зависимости нередко создает предпосылки к достоверному прогнозированию психологических процессов и явлений.

Однако следует иметь в виду, что применение корреляционного метода связано и с весьма существенными принципиальными ограничениями.

Так, известно, что переменные вполне могут коррелировать и при отсутствии причинно-следственной связи между собой.

Это иногда возможно в силу действия случайных причин, при неоднородности выборки, из-за неадекватности исследовательского инструментария поставленным задачам. Такая ложная корреляция способна стать, скажем, «доказательством» того, что женщины дисциплинированнее мужчин, подростки из неполных семей более склонны к правонарушениям, экстраверты агрессивнее интровертов и т. п. Действительно, стоит отобрать в одну группу мужчин, работающих в высшей школе, и женщин, предположим, из сферы обслуживания, да еще и протестировать тех и других на знание научной методологии, то мы получим выражение заметной зависимости качества информированности от пола. Можно ли доверять такой корреляции?

Еще чаще, пожалуй, в исследовательской практике встречаются случаи, когда обе переменные изменяются под влиянием некоей третьей или даже нескольких скрытых детерминант.

Если мы обозначим цифрами переменные, а стрелками - направления от причин к следствиям, то увидим целый ряд возможных вариантов:

1→ 2→ 3→ 4

1← 2← 3→ 4

1← 2→ 3→ 4

1← 2← 3← 4

Невнимание к воздействию реальных, но неучтенных исследователями факторов позволило представить обоснования того, что интеллект - сугубо наследуемое образование (психогенетический подход) или, напротив, что он обусловлен лишь влиянием социальных составляющих развития (социогенетический подход). В психологии, следует заметить, нераспространены феномены, имеющие однозначную первопричину.

Кроме того, факт наличия взаимосвязи переменных не дает возможности выявить по итогам корреляционного исследования причину и следствие даже в тех случаях, когда промежуточных переменных не существует.

Например, при изучении агрессивности детей было установлено, что склонные к жестокости дети чаще сверстников смотрят фильмы со сценами насилия. Означает ли это, что такие сцены развивают агрессивные реакции или, наоборот, подобные фильмы привлекают самых агрессивных детей? В рамках корреляционного исследования дать правомерный ответ на этот вопрос невозможно.

Необходимо запомнить: наличие корреляций не является показателем выраженности и направленности причинно-следственных отношений.

Другими словами, установив корреляцию переменных, мы можем судить не о детерминантах и производных, а лишь о том, насколько тесно взаимосвязаны изменения переменных и каким образом одна из них реагирует на динамику другой.

При использовании данного метода оперируют той или иной разновидностью коэффициента корреляции. Его числовое значение обычно изменяется от -1 (обратная зависимость переменных) до +1 (прямая зависимость). При этом нулевое значение коэффициента соответствует полному отсутствию взаимосвязи динамики переменных.

Например, коэффициент корреляции +0,80 отражает наличие более выраженной зависимости между переменными, чем коэффициент +0,25. Аналогично, зависимость между переменными, характеризуемая коэффициентом -0,95, гораздо теснее, чем та, где коэффициенты имеют значения +0,80 или + 0,25 («минус» указывает нам только на то, что рост одной переменной сопровождается уменьшением другой).

В практике психологических исследований показатели коэффициентов корреляции обычно не достигают +1 или -1. Речь может идти только о той или иной степени приближения к данному значению. Часто корреляция считается выраженной, если ее коэффициент выше ±0,60. При этом недостаточной корреляцией, как правило, считаются показатели, располагающиеся в интервале от -0,30 до +0,30.

Однако, сразу следует оговорить, что интерпретация наличия корреляции всегда предполагает определение критических значений соответствующего коэффициента. Рассмотрим этот момент более подробно.

Вполне может получиться так, что коэффициент корреляции равный +0,50 в некоторых случаях не будет признан достоверным, а коэффициент, составляющий +0,30, окажется при определенных условиях характеристикой несомненной корреляции. Многое здесь зависит от протяженности рядов переменных (т. е. от количества сопоставляемых показателей), а также от заданной величины уровня значимости (или от принятой за приемлемую вероятность ошибки в расчетах).

Ведь, с одной стороны, чем больше выборка, тем количественно меньший коэффициент будет считаться достоверным свидетельством корреляционных отношений. А с другой стороны, если мы готовы смириться со значительной вероятностью ошибки, то можем посчитать за достаточную небольшую величину коэффициента корреляции.

Существуют стандартные таблицы с критическими значениями коэффициентов корреляции. Если полученный нами коэффициент окажется ниже, чем указанный в таблице для данной выборки при установленном уровне значимости, то он считается статистически недостоверным.

Работая с такой таблицей, следует знать, что пороговой величиной уровня значимости в психологических исследованиях обычно считается 0,05 (или пять процентов). Разумеется, риск ошибиться будет еще меньше, если эта вероятность составляет 1 на 100 или, еще лучше, 1 на 1000.

Итак, не сама по себе величина подсчитанного коэффициента корреляции служит основанием для оценки качества связи переменных, а статистическое решение о том, можно ли считать вычисленный показатель коэффициента достоверным.

Зная это, обратимся к изучению конкретных способов определения коэффициентов корреляции.

Значительный вклад в разработку статистического аппарата корреляционных исследований внес английский математик и биолог Карл Пирсон (1857-1936), занимавшийся в свое время проверкой эволюционной теории Ч. Дарвина.

Обозначение коэффициента корреляции Пирсона (r) происходит от понятия регрессии - операции по сведению множества частных зависимостей между отдельными значениями переменных к их непрерывной (линейной) усредненной зависимости.

Формула для расчета коэффициента Пирсона имеет такой вид:

где x, y - частные значения переменных, S - (сигма) - обозначение суммы, а - средние значения тех же самых переменных. Рассмотрим порядок использования таблицы критических значений коэффициентов Пирсона. Как мы видим, в левой ее графе указано число степеней свободы. Определяя нужную нам строчку, мы исходим из того, что искомая степень свободы равна n -2, где n - количество данных в каждом из коррелируемых рядов. В графах же, расположенных с правой стороны, указаны конкретные значения модулей коэффициентов.

Причем, чем правее расположен столбик чисел, тем выше достоверность корреляции, увереннее статистическое решение о её значимости.

Если у нас, например, коррелируют два ряда цифр по 10 единиц в каждом из них и получен по формуле Пирсона коэффициент, равный +0,65, то он будет считаться значимым на уровне 0,05 (так как больше критического значения в 0,632 для вероятности 0,05 и меньше критического значения 0,715 для вероятности 0,02). Такой уровень значимости свидетельствует о существенной вероятности повторения данной корреляции в аналогичных исследованиях.

Теперь приведем пример вычисления коэффициента корреляции Пирсона. Пусть в нашем случае необходимо определить характер связи между выполнением одними и теми же лицами двух тестов. Данные по первому из них обозначены как x , а по второму - как y .

Для упрощения расчетов введены некоторые тождества. А именно:

При этом мы имеем следующие результаты испытуемых (в тестовых баллах):

Заметим, что число степеней свободы равно в нашем случае 10. Обратившись к таблице критических значений коэффициентов Пирсона, узнаем, что при данной степени свободы на уровне значимости 0,999 будет считаться достоверным любой показатель корреляции переменных выше, чем 0,823. Это дает нам право считать полученный коэффициент свидетельством несомненной корреляции рядов x и y .

Применение линейного коэффициента корреляции становится неправомерным в тех случаях, когда вычисления производятся в пределах не интервальной, а порядковой шкалы измерения. Тогда используют коэффициенты ранговой корреляции. Разумеется, результаты при этом получаются менее точными, так как сопоставлению подлежат не сами количественные характеристики, а лишь порядки их следования друг за другом.

Среди коэффициентов ранговой корреляции в практике психологических исследований довольно часто применяют тот, который предложен английским ученым Чарльзом Спирменом (1863-1945), известным разработчиком двухфакторной теории интеллекта.

Используя соответствующий пример, рассмотрим действия, необходимые для определения коэффициента ранговой корреляции Спирмена.

Формула его вычисления выглядит следующим образом:

где d - разности между рангами каждой переменной из рядов x и y ,

n - число сопоставляемых пар.

Пусть x и y - показатели успешности выполнения испытуемыми некоторых видов деятельности (оценки индивидуальных достижений). При этом мы располагаем следующими данными:

Заметим, что вначале производится раздельное ранжирование показателей в рядах x и y . Если при этом встречается несколько равных переменных, то им присваивается одинаковый усредненный ранг.

Затем осуществляется попарное определение разности рангов. Знак разности несущественен, так как по формуле она возводится в квадрат.

В нашем примере сумма квадратов разностей рангов ∑d 2 равна 178. Подставим полученное число в формулу:

Как мы видим, показатель коэффициента корреляции в данном случае составляет ничтожно малую величину. Тем не менее, сопоставим его с критическими значениями коэффициента Спирмена из стандартной таблицы.

Вывод: между указанными рядами переменных x и y корреляция отсутствует.

Надо заметить, что использование процедур ранговой корреляции предоставляет исследователю возможность определять соотношения не только количественных, но и качественных признаков, в том, разумеется, случае, если последние могут быть упорядочены по возрастанию выраженности (ранжированы).

Нами были рассмотрены наиболее распространенные, пожалуй, на практике способы определения коэффициентов корреляции. Иные, более сложные или реже применяемые разновидности данного метода при необходимости можно найти в материалах пособий, посвященных измерениям в научных исследованиях.

В научных исследованиях часто возникает необходимость в нахождении связи между результативными и факторными переменными (урожайностью какой-либо культуры и количеством осадков, ростом и весом человека в однородных группах по полу и возрасту, частотой пульса и температурой тела и т.д.).

Вторые представляют собой признаки, способствующие изменению таковых, связанных с ними (первыми).

Понятие о корреляционном анализе

Существует множество Исходя из вышеизложенного, можно сказать, что корреляционный анализ — это метод, применяющийся с целью проверки гипотезы о статистической значимости двух и более переменных, если исследователь их может измерять, но не изменять.

Есть и другие определения рассматриваемого понятия. Корреляционный анализ — это метод обработки заключающийся в изучении коэффициентов корреляции между переменными. При этом сравниваются коэффициенты корреляции между одной парой или множеством пар признаков, для установления между ними статистических взаимосвязей. Корреляционный анализ — это метод по изучению статистической зависимости между случайными величинами с необязательным наличием строгого функционального характера, при которой динамика одной случайной величины приводит к динамике математического ожидания другой.

Понятие о ложности корреляции

При проведении корреляционного анализа необходимо учитывать, что его можно провести по отношению к любой совокупности признаков, зачастую абсурдных по отношению друг к другу. Порой они не имеют никакой причинной связи друг с другом.

В этом случае говорят о ложной корреляции.

Задачи корреляционного анализа

Исходя из приведенных выше определений, можно сформулировать следующие задачи описываемого метода: получить информацию об одной из искомых переменных с помощью другой; определить тесноту связи между исследуемыми переменными.

Корреляционный анализ предполагает определение зависимости между изучаемыми признаками, в связи с чем задачи корреляционного анализа можно дополнить следующими:

выявление факторов, оказывающих наибольшее влияние на результативный признак;
выявление неизученных ранее причин связей;
построение корреляционной модели с ее параметрическим анализом;
исследование значимости параметров связи и их интервальная оценка.

Связь корреляционного анализа с регрессионным

Метод корреляционного анализа часто не ограничивается нахождением тесноты связи между исследуемыми величинами. Иногда он дополняется составлением уравнений регрессии, которые получают с помощью одноименного анализа, и представляющих собой описание корреляционной зависимости между результирующим и факторным (факторными) признаком (признаками). Этот метод в совокупности с рассматриваемым анализом составляет метод

Условия использования метода

Результативные факторы зависят от одного до нескольких факторов. Метод корреляционного анализа может применяться в том случае, если имеется большое количество наблюдений о величине результативных и факторных показателей (факторов), при этом исследуемые факторы должны быть количественными и отражаться в конкретных источниках. Первое может определяться нормальным законом — в этом случае результатом корреляционного анализа выступают коэффициенты корреляции Пирсона, либо, в случае, если признаки не подчиняются этому закону, используется коэффициент ранговой корреляции Спирмена.

Правила отбора факторов корреляционного анализа

При применении данного метода необходимо определиться с факторами, оказывающими влияние на результативные показатели. Их отбирают с учетом того, что между показателями должны присутствовать причинно-следственные связи. В случае создания многофакторной корреляционной модели отбирают те из них, которые оказывают существенное влияние на результирующий показатель, при этом взаимозависимые факторы с коэффициентом парной корреляции более 0,85 в корреляционную модель предпочтительно не включать, как и такие, у которых связь с результативным параметром носит непрямолинейный или функциональный характер.

Отображение результатов

Результаты корреляционного анализа могут быть представлены в текстовом и графическом видах. В первом случае они представляются как коэффициент корреляции, во втором — в виде диаграммы разброса.

При отсутствии корреляции между параметрами точки на диаграмме расположены хаотично, средняя степень связи характеризуется большей степенью упорядоченности и характеризуется более-менее равномерной удаленностью нанесенных отметок от медианы. Сильная связь стремится к прямой и при r=1 точечный график представляет собой ровную линию. Обратная корреляция отличается направленностью графика из левого верхнего в нижний правый, прямая — из нижнего левого в верхний правый угол.

Трехмерное представление диаграммы разброса (рассеивания)

Помимо традиционного 2D-представления диаграммы разброса в настоящее время используется 3D-отображение графического представления корреляционного анализа.

Также используется матрица диаграммы рассеивания, которая отображает все парные графики на одном рисунке в матричном формате. Для n переменных матрица содержит n строк и n столбцов. Диаграмма, расположенная на пересечении i-ой строки и j-ого столбца, представляет собой график переменных Xi по сравнению с Xj. Таким образом, каждая строка и столбец являются одним измерением, отдельная ячейка отображает диаграмму рассеивания двух измерений.

Оценка тесноты связи

Теснота корреляционной связи определяется по коэффициенту корреляции (r): сильная — r = ±0,7 до ±1, средняя — r = ±0,3 до ±0,699, слабая — r = 0 до ±0,299. Данная классификация не является строгой. На рисунке показана несколько иная схема.

Пример применения метода корреляционного анализа

В Великобритании было предпринято любопытное исследование. Оно посвящено связи курения с раком легких, и проводилось путем корреляционного анализа. Это наблюдение представлено ниже.

Исходные данные для корреляционного анализа

Профессиональная группа		смертность
Фермеры, лесники и рыбаки
Шахтеры и работники карьеров
Производители газа, кокса и химических веществ
Изготовители стекла и керамики
Работники печей, кузнечных, литейных и прокатных станов
Работники электротехники и электроники
Инженерные и смежные профессии
Деревообрабатывающие производства
Кожевенники
Текстильные рабочие
Изготовители рабочей одежды
Работники пищевой, питьевой и табачной промышленности
Производители бумаги и печати
Производители других продуктов
Строители
Художники и декораторы
Водители стационарных двигателей, кранов и т. д.
Рабочие, не включенные в другие места
Работники транспорта и связи
Складские рабочие, кладовщики, упаковщики и работники разливочных машин
Канцелярские работники
Продавцы
Работники службы спорта и отдыха
Администраторы и менеджеры
Профессионалы, технические работники и художники

Начинаем корреляционный анализ. Решение лучше начинать для наглядности с графического метода, для чего построим диаграмму рассеивания (разброса).

Она демонстрирует прямую связь. Однако на основании только графического метода сделать однозначный вывод сложно. Поэтому продолжим выполнять корреляционный анализ. Пример расчета коэффициента корреляции представлен ниже.

С помощью программных средств (на примере MS Excel будет описано далее) определяем коэффициент корреляции, который составляет 0,716, что означает сильную связь между исследуемыми параметрами. Определим статистическую достоверность полученного значения по соответствующей таблице, для чего нам нужно вычесть из 25 пар значений 2, в результате чего получим 23 и по этой строке в таблице найдем r критическое для p=0,01 (поскольку это медицинские данные, здесь используется более строгая зависимость, в остальных случаях достаточно p=0,05), которое составляет 0,51 для данного корреляционного анализа. Пример продемонстрировал, что r расчетное больше r критического, значение коэффициента корреляции считается статистически достоверным.

Использование ПО при проведении корреляционного анализа

Описываемый вид статистической обработки данных может осуществляться с помощью программного обеспечения, в частности, MS Excel. Корреляционный предполагает вычисление следующих парамет-ров с использованием функций:

1. Коэффициент корреляции определяется с помощью функции КОРРЕЛ (массив1; массив2). Массив1,2 — ячейка интервала значений результативных и факторных переменных.

Линейный коэффициент корреляции также называется коэффициентом корреляции Пирсона, в связи с чем, начиная с Excel 2007, можно использовать функцию с теми же массивами.

Графическое отображение корреляционного анализа в Excel производится с помощью панели «Диаграммы» с выбором «Точечная диаграмма».

После указания исходных данных получаем график.

2. Оценка значимости коэффициента парной корреляции с использованием t-критерия Стьюдента. Рассчитанное значение t-критерия сравнивается с табличной (критической) величиной данного показателя из соответствующей таблицы значений рассматриваемого параметра с учетом заданного уровня значимости и числа степеней свободы. Эта оценка осуществляется с использованием функции СТЬЮДРАСПОБР (вероятность; степени_свободы).

3. Матрица коэффициентов парной корреляции. Анализ осуществляется с помощью средства «Анализ данных», в котором выбирается «Корреляция». Статистическую оценку коэффициентов парной корреляции осуществляют при сравнении его абсолютной величины с табличным (критическим) значением. При превышении расчетного коэффициента парной корреляции над таковым критическим можно говорить, с учетом заданной степени вероятности, что нулевая гипотеза о значимости линейной связи не отвергается.

В заключение

Использование в научных исследованиях метода корреляционного анализа позволяет определить связь между различными факторами и результативными показателями. При этом необходимо учитывать, что высокий коэффициент корреляции можно получить и из абсурдной пары или множества данных, в связи с чем данный вид анализа нужно осуществлять на достаточно большом массиве данных.

После получения расчетного значения r его желательно сравнить с r критическим для подтверждения статистической достоверности определенной величины. Корреляционный анализ может осуществляться вручную с использованием формул, либо с помощью программных средств, в частности MS Excel. Здесь же можно построить диаграмму разброса (рассеивания) с целью наглядного представления о связи между изучаемыми факторами корреляционного анализа и результативным признаком.

Не со всеми проблемами можно справиться экспериментальным методом. Существует множество ситуаций, когда исследователь не может контролировать, какие испытуемые попадают в те или иные условия. Например, если надо проверить гипотезу, что люди с анорексией более чувствительны к изменениям вкуса, чем люди с нормальным весом, то не можем же мы собрать группу испытуемых с нормальным весом и потребовать, чтобы у половины из них появилась анорексия! На самом деле нам придется отобрать людей, уже страдающих анорексией, и тех, у кого вес в норме, и проверить, различаются ли они также по вкусовой чувствительности. Вообще говоря, можно использовать метод корреляций, чтобы определить связана ли некоторая переменная, которую мы не можем контролировать, с другой интересующей нас переменной, или, иначе говоря, коррелируют ли они между собой.

В вышеприведенном примере у переменной веса есть только два значения -- нормальный и анорексичный. Чаще случается, что каждая из переменных может принимать много значений, и тогда надо определить, насколько величины одной и другой переменной коррелируют между собой. Определить это может статистический параметр, называемый коэффициентом корреляции и обозначаемый буквой r. Коэффициент корреляции позволяет оценить, насколько связаны две переменные, и выражается числом от -1 до +1. Ноль означает отсутствие связи; полная связь выражается единицей (+1, если отношение положительное, и -1, если оно отрицательное). По мере увеличения r от 0 до 1 сила связи возрастает.

Рис.6.

Эти гипотетические данные принадлежат 10 пациентам, каждый из которых имеет некоторое повреждение участков мозга, ответственных, насколько известно, за узнавание лиц. На рис. 6а пациенты располагаются вдоль горизонтали соответственно объему повреждения мозга, причем самая левая точка показывает пациента с наименьшим повреждением (10%), а самая правая точка показывает пациента с наибольшим повреждением (55%). Каждая точка на графике отражает показатель для отдельного пациента в тесте на узнавание лиц. Корреляция положительная и равна 0,90. На рис. 6б изображены те же самые данные, но теперь они показывают долю правильных ответов, а не ошибок. Здесь корреляция отрицательная, равная -0,90. На рис..6в успехи пациентов в тесте на распознавание отображены в зависимости от их роста. Здесь корреляция равна нулю.

Суть коэффициента корреляции можно пояснить на примере графического представления данных гипотетического исследования. Как показано на рис. 6а, в исследовании участвуют пациенты, о которых заранее известно, что у них поврежден мозг, и это вызвало разной степени трудности в узнавании лиц (прозопагнозия). Предстоит выяснить, возрастает ли трудность, или ошибка узнавания лиц, с увеличением процента поврежденной мозговой ткани. Каждая точка на графике 6а показывает результат для отдельного пациента при его тестировании на узнавание лиц. Например, пациент с 10%-ным повреждением ошибался в тесте на распознавание лиц в 15% случаев, а пациент с 55%-ным повреждением делал ошибки в 95% случаев. Если бы ошибка узнавания лиц постоянно возрастала с увеличением процента повреждения мозга, точки на графике располагались бы все время выше при движении слева направо; если бы они размещались на диагонали рисунка, коэффициент корреляции был бы r = 1,0. Однако несколько точек расположены по разные стороны этой линии, поэтому корреляция составляет около 90%. Корреляция 90% означает очень сильную связь между объемом поврежденного мозга и ошибками узнавания лиц. Корреляция на рис. 6а -- положительная, поскольку большее повреждение мозга вызывает больше ошибок.

Если бы вместо ошибок мы решили отобразить долю правильных ответов в тесте на распознавание, то получили бы график, изображенный на рис. 6б. Здесь корреляция отрицательная (равная примерно -0,90), поскольку с увеличением повреждения мозга доля правильных ответов уменьшается. Диагональ на рис. 6б -- это просто инверсный вариант той, что на предыдущем рисунке.

Наконец, обратимся к графику на рис. 6в. Здесь отображена доля ошибок пациентов в тесте на распознавание лиц в зависимости от их роста. Разумеется, нет оснований считать, что доля узнанных лиц связана с ростом пациента, и график подтверждает это. При движении слева направо точки не проявляют согласованного движения ни вниз, ни вверх, а разбросаны вокруг горизонтальной линии. Корреляция равна нулю.

Числовой метод вычисления коэффициента корреляции описан в Приложении II. Сейчас, однако, мы сформулируем несколько элементарных правил, которые помогут вам разобраться с коэффициентом корреляции, когда вы встретитесь с ним в последующих главах.

Корреляция бывает положительной (+) и отрицательной (-). Знак корреляции показывает, связаны ли две переменные положительной корреляцией (величина обеих переменных растет или уменьшается одновременно) или отрицательной корреляцией (одна переменная растет при уменьшении другой). Предположим, например, что количество пропусков занятий студентом имеет корреляцию -0,40 с баллами в конце семестра (чем больше пропусков, тем меньше баллов). С другой стороны, корреляция между полученными баллами и количеством посещенных занятий будет +0,40. Прочность связи одна и та же, но знак ее зависит от того, считаем ли мы пропущенные или посещенные занятия.

По мере усиления связи двух переменных r увеличивается от 0 до 1. Чтобы лучше это представить, рассмотрим несколько известных положительных коэффициентов корреляции:

Коэффициент корреляции между баллами, полученными в первый год обучения в колледже, и баллами, полученными на втором году, составляет около 0,75.

Корреляция между показателями геста на интеллект в возрасте 7 лет и при повторном тестировании в 18 лет составляет примерно 0,70.

Корреляция между ростом одного из родителей и ростом ребенка во взрослом возрасте, составляет около 0,50.

Корреляция между результатами теста на способность к обучению, полученными в школе и в колледже, равна примерно 0,40.

Корреляция между баллами, полученными индивидуумами в бланковых тестах, и суждением психолога-эксперта об их личностных качествах составляет около 0,25.

В психологических исследованиях коэффициент корреляции 0,60 и выше считается достаточно высоким. Корреляция в диапазоне от 0,20 до 0,60 имеет практическую и теоретическую ценность и полезна при выдвижении предсказаний. К корреляции от 0 до 0,20 следует относиться осторожно, при выдвижении предсказаний ее польза минимальна.

Тесты. Знакомый пример использования корреляционного метода -- тесты по измерению некоторых способностей, достижений и других психологических качеств. При тестировании группе людей, различающихся по какому-нибудь качеству (например, математическим способностям, ловкости рук или агрессивности), предъявляют некоторую стандартную ситуацию. Затем можно вычислить корреляцию между изменениями показателей данного теста и изменением другой переменной. Например, можно установить корреляцию между показателями группы студентов в тесте на математические способности и их оценками по математике при дальнейшем обучении в колледже; если корреляция значительная, то на основе результатов этого теста можно решить, кого из нового набора студентов можно перевести в группу с повышенными требованиями.

Тестирование -- важный инструмент психологических исследований. Оно позволяет психологам получать большое количество данных о людях с минимальным отрывом их от повседневных дел и без применения сложного лабораторного оборудования. Построение тестов включает множество этапов, которые мы подробно рассмотрим в последующих главах.

Корреляция и причинно-следственные связи. Между экспериментальными и корреляционными исследованиями есть важное различие. Как правило, в экспериментальном исследовании систематически манипулируют одной переменной (независимой) с целью определить ее причинное воздействие на некоторые другие переменные (зависимые). Такие причинно-следственные связи нельзя вывести из корреляционных исследований. Ошибочное понимание корреляции как причинно-следственного отношения можно проиллюстрировать на следующих примерах. Может существовать корреляция между мягкостью асфальта на улицах города и количеством солнечных ударов, случившихся за день, но отсюда не следует, что размягченный асфальт выделяет какой-то яд, приводящий людей на больничную койку. На самом деле изменение обеих этих переменных -- мягкости асфальта и числа солнечных ударов -- вызывается третьим фактором -- солнечным теплом. Еще один простой пример -- высокая положительная корреляция между большим количеством аистов, гнездящихся во французских деревнях, и высокой рождаемостью, зарегистрированной там же. Предоставим изобретательным читателям самим догадываться о возможных причинах такой корреляции, не прибегая к постулированию причинно-следственной связи между аистами и младенцами. Эти примеры служат достаточным предостережением от понимания корреляции как причинно-следственного отношения. Если между двумя переменными есть корреляция, изменение одной может вызывать изменения другой, но без специальных экспериментов такой вывод будет неоправданным.

Все явления в природе и обществе находятся во взаимной связи. Выяснение

наличия связей между изучаемыми явлениями ― одна из важных

задач статистики. Многие медико-биологические и медико-социальные

исследования требуют установления вида связи (зависимости) между

случайными величинами. Сама постановка большого круга задач

в медицинских исследовательских работах предполагает построение

и реализацию алгоритмов «фактор ― отклик», «доза ― эффект».

Зачастую нужно установить наличие эффекта при имеющейся дозе

и оценить количественно полученный эффект в зависимости от дозы. Решение

этой задачи напрямую связано с вопросом прогнозирования определенного

эффекта и дальнейшего изучения механизма возникновения именно такого

Как известно, случайные величины X и Y могут быть либо независимыми,

либо зависимыми. Зависимость случайных величин подразделяется на

функциональную и статистическую (корреляционную).

Функциональная зависимость ― такой вид зависимости, когда каждому

значению одного признака соответствует точное значение другого.

В математике функциональную зависимость переменной X от переменной

Y называют зависимостью вида X= f (Y), где каждому допустимому значению

Y ставится в соответствие по определенному правилу единственно возможное

значение X.

Например: взаимосвязь площади круга (S) и длины окружности (L). Известно,

что площадь круга и длина окружности связаны вполне определенным

отношением S = r L, где r – радиус круга. Умножив длину окружности

на половину ее радиуса, можно точно определить площадь крута. Такую

изменение одного признака изменением другого. Этот вид связи характерен

для объектов, являющихся сферой приложения точных наук.

В медико-биологических исследованиях сталкиваться с функциональной

связью приходится крайне редко, поскольку объекты этих исследований

имеют большую индивидуальную вариабельность (изменчивость). С

другой стороны, характеристики биологических объектов зависят,

как правило, от комплекса большого числа сложных взаимосвязей и не могут

быть сведены к отношению двух или трех факторов. Во многих

медицинских исследованиях требуется выявить зависимость какой-либо

величины, характеризующей результативный признак, от нескольких

факториальных признаков.

Дело в том, что на формирование значений случайных величин X и Y

оказывают влияние различные факторы. Обе величины ― и X, и

Y ― являются случайными, но так как имеются общие факторы, оказывающие

влияние на них, то X и Y обязательно будут взаимосвязаны. И связь эта

уже не будет функциональной, поскольку в медицине и биологии часто

бывают факторы, влияющие лишь на одну из случайных величин и

разрушающие прямую (функциональную) зависимость между значениями

X и Y. Связь носит вероятностный, случайный характер, в численном выражении

меняясь от испытания к испытанию, но эта связь определенно присутствует

и называется корреляционной.

Корреляционной является зависимость массы тела от роста, поскольку

на нее влияют и многие другие факторы (питание, здоровье,

наследственность и т.д.). Каждому значению роста (X) соответствует множество

значений массы (Y), причем, несмотря на общую тенденцию, справедливую

для средних: большему значению роста соответствует и большее

значение массы, ― в отдельных наблюдениях субъект с большим ростом

может иметь и меньшую массу. Корреляционной будет зависимость

заболеваемости от воздействия внешних факторов, например

запыленности, уровня радиации, солнечной активности и т.д. Имеется

корреляционная зависимость между дозой ионизирующего излучения и

числом мутаций, между пигментом волос человека и цветом глаз, между

показателями уровня жизни населения и смертностью, между числом

пропущенных студентами лекций и оценкой на экзамене.

Именно корреляционная зависимость наиболее часто встречается в

природе в силу взаимовлияния и тесного переплетения огромного множества

самых разных факторов, определяющих значение изучаемых показателей.

Корреляционная зависимость ― это зависимость, когда при изменении

одной величины изменяется среднее значение другой.

Строго говоря, термин «зависимость» при статистической обработке

материалов медико-биологических исследований должен использоваться

весьма осторожно. Это связано с природой статистического анализа,

который сам по себе не может вскрыть истинных причинно-следственных

отношений между факторами, нередко опосредованными третьими факторами,

причем эти третьи факторы могут лежать вообще вне поля зрения

исследователя. С помощью статистических критериев можно дать только

формальную оценку взаимосвязей. Попытки механически

перенести данные статистических расчетов в объективную реальность

могут привести к ошибочным выводам. Например, утверждение: «Чем

громче утром кричат воробьи, тем выше встает солнце», несмотря на явную

несуразность, с точки зрения формальной статистики вполне правомерно.

Таким образом, термин «зависимость» в статистическом анализе подразумевает

только оценку соответствующих статистических критериев.

Корреляционные связи называют также статистическими (например,

зависимость уровня заболеваемости от возраста населения). Эти связи

непостоянны, они колеблются от нуля до единицы. Ноль означает отсутствие

зависимости между признаками, а единица ― полную, или функциональную,

связь, когда имеется зависимость только от одного признака.

Мерой измерения статистической зависимости служат раз личные

коэффициенты корреляции. Выбор метода для определения взаимосвязей

обусловлен видом самих признаков и способами их группировки.

Для количественных данных применяют линейную регрессию и

коэффициент линейной корреляции Пирсона. Для качественных признаков

применяются таблицы сопряженности и рассчитываемые на их основе

коэффициенты сопряженности (С и Ф), Чупрова (К). Для при знаков,

сформированных в порядковой (ранговой, балльной) шкале, можно применять

ранговые коэффициенты корреляции Спирмена или Кендэла.

Любую существующую зависимость по направлению связи можно

подразделить на прямую и обратную. Прямая зависимость

― это зависимость, при которой увеличение или уменьшение значения

одного признака ведет, соответственно, к увеличению или уменьшению второго.

Например: при увеличении температуры возрастает давление газа

(при его неизменном объеме), при уменьшении температуры снижается

и давление. Обратная зависимость имеется тогда, когда при увеличении

одного признака второй уменьшается, и наоборот: при уменьшении

одного второй увеличивается. Обратная зависимость, или обратная

связь, является основой нормального регулирования почти

всех процессов жизнедеятельности любого организма.

Оценка силы корреляционной связи проводится в соответствии со шкалой тесноты.

Если размеры коэффициента корреляции от ±0,9(9) до ±0,7, то связь

сильная, коэффициенты корреляции от ±0,31 до ±0,69 отражают связь средней

силы, а коэффициенты от ±0,3 до нуля характеризуют слабую связь.

Известное представление о наличии или отсутствии корреляционной связи

между изучаемыми явлениями или признаками (например, между массой тела и

ростом) можно получить графически, не прибегая к специальным расчетам. Для

этого достаточно на чертеже в системе прямоугольных координат отложить,

например,

на оси абсцисс величины роста, а на оси ординат ― массы тела и нанести ряд точек,

каждая из которых соответствует индивидуальной величине веса при данном

росте обследуемого. Если полученные точки располагаются кучно по наклонной

прямой к осям ординат в виде овала (эллипса) или по кривой линии,

то это свидетельствует о зависимости между явлениями. Если же точки

расположены беспорядочно или на прямой, параллельной абсциссе либо ординате,

то это говорит об отсутствии зависимости.

По форме корреляционные связи подразделяются на прямолинейные, когда

наблюдается пропорциональное изменение одного признака в зависимости от

изменения другого (графически эти связи изображаются в виде прямой линии или

близкой к ней), и криволинейные, когда одна величина признака