Стимульный контроль и градиент генерализации
Перевод главы «Pilares empíricos para a compreender controle de estímulos» Полы Деберт и Герсона Юкио Томанари из второй части сборника «Experimentos Clássicos em Análise do Comportamento» про классические эксперименты поведенческих аналитиков.
Организмы не ведут себя беспорядочно, а, напротив, поступают согласно конкретным обстоятельствами окружающей среды, включая приватные события. Примеров множество, но поведенческих аналитиков больше интересуют социально-значимые ситуации, например, нежелательные реакции в контексте определенных сигналов. Многие несчастные случаи происходят именно потому, что в критические моменты не случается ожидаемой активности. Например, автомобильные аварии случаются, когда реакции водителя не находятся под контролем знаков или разметки.
Для некоторых поведенческих расстройств типична демонстрация реакций в присутствии очень специфических стимулов (например, расстройство аутистического спектра — РАС), а для других — неспецифичное реагирование на слишком широкий спектр стимулов (например, шизофрения). Некоторые люди с РАС, когда их просят взять грушу, расположенную рядом с яблоком, всегда берут фрукт справа, независимо от того, яблоко это или груша. Выбор фрукта контролирует только относительная позиция фрукта, а не его цвет или форма. В противоположность, у страдающих шизофренией неадекватная реакция — убежать из дома, опасаясь агрессии со стороны членов семьи, — может возникнуть без каких-либо признаков опасности. Во всех этих ситуациях мы имеем дело с нежелательным контролем со стороны стимула.
Согласно Вернеру Террасу, «стимульный контроль является степенью, в которой стимул-антецедент определяет вероятность возникновения выученной реакции». Для Терраса термин «стимульный контроль» казался более интересным, чем «дискриминация» и «генерализация», поскольку последние исторически использовались для описания гипотетических процессов, а не резюмирования наблюдений. Для исследователя XX века утверждение, что организм, который был обучен реагировать на звук 1000 Гц, будет с меньшей вероятностью реагировать на звуки с другими частотами, отличалось от утверждения, что происходит генерализация реакции на 1000 Гц на другие частоты. Введение нового термина для описания отношений антецедента и поведения запустило дискуссию, каким конкретно образом должно происходить обучение, чтобы сформировались эти отношения.
Классической работой в экспериментальном изучении стимульного контроля стала статья Нормана Гуттмана и Гарри Калиша 1956 года. Первые теоретические дебаты касались попыток объяснить эмпирические результаты, которые показали, что после подкрепления реакции в присутствии определённого стимула другие стимулы с аналогичными физическими характеристиками, представленные в тестовых ситуациях без сопряжения с подкреплением, также вызывают эту реакцию (позже это стало известно как генерализация). Некоторые авторы утверждали, что вероятность реакции на тестовый стимул будет функцией различий между тестовым стимулом и стимулом, коррелирующим с подкреплением, что можно определить как «функцию дискриминации» в психофизическом смысле. Предполагалось, что эта вероятность может быть определена математически, то есть акцент делался на среде или организме, а не на их взаимоотношениях. Другими словами, объяснение возникновения контроля антецедентов над реакцией, как считалось в этой модели, в большей степени зависит от характеристик антецедента, чем от оперантных отношений реакции и ее последствий.
Согласно психофизической модели, известной как теория Халла-Спенса, мы могли бы предположить, как будет происходить обучение реакции новых ситуациях, основываясь исключительно на физическом сходстве между ситуацией подкрепления и новым контексте. Для этого достаточно повторяющегося недифференцированного подкрепления реакции в присутствии стимула. Карл Лэшли и Марк Уэйд утверждали обратное: для стимульного контроля необходимо ввести другой стимул, который никогда не будет коррелировать с подкреплением или будет коррелировать хуже. Следовательно, процедура дифференцированного подкрепления (т.е. подкрепление реакции в присутствии одного стимула и отсутствие подкрепления в присутствии другого стимула) является основополагающей для установления стимульного контроля. Согласно Лэшли и Уэйду, установление стимульного контроля при недифференцированном подкреплении является ошибкой наблюдений, в которых просто не было обнаружено непреднамеренное предшествующее дифференцированное подкрепление.
Необходимо ли дифференцированное подкрепление, а не просто подкрепление, для установления стимульного контроля? Может ли контроль со стороны антецедента быть установлен только путём многократного подкрепления реакции в присутствии антецедента? Исследование этих вопросов началось с работы Гуттмана и Калиша.
Первоначальные попытки экспериментально проверить, что важно для установления стимульного контроля, приводили к несогласующимся результатам, не воспроизводившимся между испытуемыми, и с трудом подтверждались в последующих тестах на гашение. Эксперимент, разработанный Гуттманом и Калишем, позволил получать надежные и стабильные данные. Первоначальной целью Гуттмана и Калиша была оценка взаимосвязи между градиентом генерализации и «дискриминативностью» стимулов. Другими словами, авторы хотели оценить, каким будет градиент генерализации реакции клевания у голубей в контексте света разных длин электромагнитных волн (определённых цветов), полученный после подкрепления клевков только при излучении определенного цвета, чтобы сравнить эти градиенты с психофизическими функциями, уже известными для голубей. Соответствие или несоответствие градиентов генерализации и функции «дискриминативности», измеряемой разницей между порогами, указывало бы на то, какую роль предыдущий опыт играет в установлении стимульного контроля.
Описание эксперимента и результаты
Гуттман и Калиш проанализировали градиенты генерализации, полученные в результате тестов на гашение с голубями, в которых излучение различных длин волн последовательно предъявлялись в течение 60 секунд. Каждая выбранная длина волны имела свою «дискриминируемость», известную как функция физических различий.
Процедура Гуттмана и Калиша включала в периодическое подкрепление пищей клевания полупрозрачного пластикового диска, который подсвечивался разными цветами (т.е. излучением с разной длиной волны). Для каждой экспериментальной группы голубей в качестве S+ использовались разные длины волн. Во время обучения диск для клевания и экспериментальная камера погружалась в темноту на 10 сек. каждые 60 сек. Пока в камере не было света, реакции не подкреплялись. В тесте на генерализацию последовательно предъявляли одиннадцать новых цветов, включая цвет, коррелирующий с подкреплением во время обучения. Стимулы предъявлялись в 12 случайных последовательностях. Каждый стимул предъявлялся в течение 30 сек., и ни одна реакция не подкреплялась во время теста, т.е. действовало гашение.
По меньшей мере два параметра были основополагающими для преодоления ранее существовавших методологических барьеров:
- использование периодического подкрепления (например, режима с переменными интервалами) в процессе обучения повышало устойчивость к гашению, что было необходимо для того, чтобы животное дольше продолжало реагировать в тестах на гашение и предоставляло больше данных;
- большая продолжительность предъявления стимулов в тестах, чтобы протестировать зависимость количества реакций от ранее показанных стимулов.
Коррелирующие с подкреплением стимулы выбирались из длин волн с наиболее высокой различимостью. Таким образом, можно было оценить, совпадают ли градиенты генерализации с психофизическими кривыми.
Результаты, полученные Гуттманом и Калишем, показаны на рисунке 1 и чётко демонстрируют, что пики градиентов генерализации соответствовали длине волны, специфически коррелирующей с подкреплением для каждой группы голубей. Степень, в которой тестовый стимул контролировал реакции, уменьшалась по мере увеличения расстояния между стимулом, коррелирующим с подкреплением, и тестовым стимулом. Индивидуальные показатели соответствовали среднему значению по группе, представленному на графике. При сопоставлении графиков реакции как функции длины волны и психофизической кривой не было выявлено корреляции «дискриминативности» стимулов и формы градиента генерализации.
На первый взгляд, результаты Гуттмана и Калиша подтверждают гипотезу, что контроль стимулов может быть установлен только при недифференцированном подкреплении, поскольку градиенты обобщения для всех групп испытуемых имели пики в тех длинах волн, которые функционировали как S+ при обучении, проводимом только с недифференцированным подкреплением. Однако возникновению непреднамеренного дифференцированного подкрепления могли способствовать и другие факторы. Дифференцированное подкрепление могло произойти, если принять во внимание следующие три аспекта:
- в 10-секундных интервалах между предъявлением разных длин волн свет был выключен и действовала процедура гашения;
- в доэкспериментальной истории голубей могли быть ситуации с использованием разных длин волн, при которых действовало гашение клевания;
- за клевками мимо диска следовало гашение, и эти области не освещались ни одним из цветов.
Дальнейшее развитие
Тот факт, что пики градиента генерализации следовали за длиной волны стимула, коррелирующего с подкреплением, позволил выявить важность подкрепления для установления стимульного контроля. Однако последующий анализ непреднамеренных параметров, которые могли привести к дифференциации подкрепления, стал основополагающим для появления дальнейших исследований, которые выявили необходимость дифференцированного подкрепления для установления стимульного контроля.
Исследование Нила Петерсона показало, что доэкспериментальная история с дифференцированным подкреплением очень важна для установления стимульного контроля. Петерсон с рождения выращивал утят под монохроматическим светом определенной длины волны. Их обучали клевать диск, освещённый той же длиной волны согласно режиму периодического подкрепления. После 15 дней обучения были проведены тесты на гашение, в которых уткам последовательно предъявлялась эта длина волны и другие длины волн, которые никогда не предъявлялись. Никаких признаков присутствия стимульного контроля получено не было. Утки одинаково реагировали на все стимулы, предъявляемые в тестах. Стимульный контроль был установлен в другой группе уток, которых вырастили в условиях белого света и затем подвергли тому же обучению и тестам, что и уток из предыдущей группы. Доэкспериментальная история с белым светом, вероятно, позволила добиться дифференцированного подкрепления, необходимого для установления стимульного контроля в одной из групп. Другие повторные исследования проводились, например, путём смены вида животных и изменения стимулов. Во всех этих случаях дифференцированное подкрепление оказывалось необходимым условием установления стимульного контроля.
Выявление роли дифференцированного подкрепления послужило основой для развития различных областей исследований и приложений, которые были и остаются связанными с лучшим пониманием стимульного контроля в зависимости от манипуляций со средой. В качестве примера можно привести первоначальные экспериментальные исследования безошибочной дискриминации, разработанные Вернером Террасом, которые послужили фундаментальной основой для развития более поздних исследований, включая фундаментальные и прикладные. Следует также отметить, что многие из техник, используемых в прикладных контекстах, включают процедуры безошибочной дискриминации, такие как подсказки, гашение и шейпинг.
Благодаря разработанной Гуттманом и Калишем процедуре последующим исследователям получилось продемонстрировать, что дифференцированное подкрепление является основополагающим для установления стимульного контроля. Иногда об этом забывают, и использование недифференцированного подкрепления приводит к неудачам в формировании желательного поведения. Эта неудача часто объясняется причинами, отличными от отсутствия дифференцированного подкрепления, такими как неизвестная история индивида, физиологические или когнитивные аспекты, которые невозможно изменить. Если принять во внимание примеры, приведенные в начале этой главы, то несчастные случаи, связанные с появлением нежелательных реакций в критические моменты, поведенческие расстройства, связанные с демонстрацией реакций в присутствии очень специфической части окружающей среды или в нежелательных ситуациях — всё это поведение, которое можно изменить, если успешно контролировать нежелательные стимулы с помощью дифференцированного подкрепления.
Гуттман и Калиш сблизили оперантные методы исследования и психофизические. Благодаря им стало возможным интегрировать эти области — как это сделал, например, Дональд Блаф, когда оперантно продемонстрировал пороги зрительного восприятия (статья не.психологии). В 1987 году Дэвид Любински и Трэвис Томпсон с помощью разработанной Гуттманом и Калишем процедуры смогли сформировать стимульный контроль со стороны интероцептивных стимулов (еще одна статья).
Переводил Артем Ефремов, редактировал Иван Чистяков, иллюстрации Вероники Романовой. Подписывайтесь на не.психологию, чтобы не пропустить новые материалы!
