《別斃了那隻狗》

下载本书

添加书签

別斃了那隻狗- 第4部分


按键盘上方向键 ← 或 → 可快速上下翻页,按键盘上的 Enter 键可回到本书目录页,按键盘上方向键 ↑ 可回到本页顶部!
鶇崭呤鞔远ザ说亩韵螅侵还吩诘孛嫠蜒昂芫玫嚼臀薰Γ缓蟮睜銮砂淹诽Ц呤保返鄯虬聪铝讼炱侵还妨⒖套嵛磐凡扛叨鹊目掌醯侥勘甓韵蟮钠叮缓蚩纪蚰诮细叩牡胤剿蜒捌叮踔烈院蠼耪玖⑵鹄葱嵛牛谑窃谑返鄯蛎挥性俣瘸鍪中拢瑺业搅硕韵笪恢茫吞绞鞔远ト〉昧苏庀疃韵蟆�

「继续加油!」 (p。51)

(The。“Keep。Going”。Signal。–。p。17)。

以刚刚史帝夫在和他的狗沟通时的例子来看,他们之间的沟通有另一个特点,史帝夫的响片声并不是作为一个终结讯号,而是一个「继续加油!」的讯号,由于狗儿尚未发现目标对象,响片的适时出现不但是增强了往上方嗅闻的行为,也让狗儿继续出现搜寻的行为。我在本书初版中曾写道,我们可以多次使用制约增强物但不给予真正的增强物,直到最后再给予即可。我之所以这么说是因为,有时候在训练海洋生物世界的海豚出现长时性行为或连锁行为时会这么做,但是我当初写书时并没有意识到,我们事实上使用了(至少)两种的制约增强物(或标定讯号)一种是正常音量的哨音,代表「这就对了!食物随后就到,过去那边取食,完毕了!」另一种则是较轻的哨音,代表「这就对了,但是还没达到目标!」

我在九○年代曾与许多响片训练新手共事,训犬书籍作家摩根。史贝克特(Morgan Spector)称这些人为「跨域训练者」(crossover trainers),指精通处罚式训练,但正试图改用塑形法和正增强的人。当时我发现他们都很愿意按响片,但却极不愿意给食,甚至到了已经让响片意义不复存在的地步。对此我必须强调,唯有遵循「按一次响片,给一次零食」的通则才能教会人们如何有效塑造行为。

不过,在许多现实状况中,有些「过渡性的增强刺激」可能非常好用,如同上述史帝夫与巡逻犬的例子所示,另择一个增强刺激,并藉由这个刺激告知训练对象「那就对了,继续加油!」是个解决方法。「继续加油!」的讯号并不需要直接联结初级增强物,只要在响片终结声出现之前插入这个讯号即可,学习者很快就可以理解到,它只是一个引领至最终增强物的讯号。

接下来你便可以好好运用这个「过渡性的增强刺激」,在连锁行为当中利用它作为蕴含讯息的标定讯号,不必让进行中的行为停下来;举例来说,敏捷赛中狗儿进行障碍竞速,主人必须在狗儿迅速移动之下指示牠下一个障碍是什么,我曾见过狗儿在达成某项障碍后,表现出不知所措的样子,彷佛没听清楚指示,不知该穿入隧道还是跨栏,牠的头在两项障碍之问来回摆动着,当狗儿朝跨栏望过去,主人大喊「没错!」时,狗儿才立刻跑向正确的障碍项目。

如同最终才出现的响片声一样,这种过渡性的讯号可以是任何刺激(响片、哨音、大喊一声或挥一下手),但要注意的是,这个刺激并不能只是怀抱希望的鼓励或加油打气(这么做可能使动物分心或不小心增强其它行为),它也必须是一种意义明确、精确使用的制约增强物。

习得厌恶刺激 (p。53)

(Conditioned。Aversive。Signlas。–。p。18)。

及时发出的「习得正面讯号」是告知接收者「你现在的行为很好,将为你带来好处,所以多出现这个行为吧!」,而你也可以建立「习得厌恶刺激」(conditioned aversive signals,或称为「惩罚物」【punisher】),它告诉接收者的讯息是「你现在的行为不好,你要是不停止这个行为的话,不好的事就会验生。」

习得厌恶刺激比起威胁史为有效,有些动物  我想到的是猫咪  对于大喊大叫和责骂没有反应,不过我有一位朋友有次却意外治好了她家猫咪爱抓沙发的毛病,事实是因为她大喊出的「不!」变成了习得厌恶刺激。有天她在厨房里失手掉落一个铸铜大托盘,正好就掉在猫咪身旁,而当托盘掉下时,她大喊「不!」,下一秒托盘即落地发出巨响,猫味被吓得跳起来,全身毛都竖了起来。之后当猫味抓沙发时,主人一喊「不!」,猫咪便看来一副惊惧样,立即停止动作,在重复两次之后这个行为便永远消失了。

训斥是生活中必要存在的一部分,以正增强作为教导的主要工具,这并不代表必要时不能说「不!」(例如幼儿拿东西戳入插座时),然而,一些训练者拿这种现实状况为例认为无论什么状况,教导时经常作「纠正」是很合理的,事实上他们犯了两个错:第一、他们似乎认为纠正的好处和正增强一样多,却没考虑到它对学习者产生的其它影响(请见第四章「处罚」)。第二、他们使用训斥和处罚,但并未建立警告讯号(即习得厌恶刺激)。

要让「不!」产生效果的诀窍在于必须让它成为制约负增强物(conditioned negative reinforcer),举例来说,如果你觉得有必要使用P字链(收缩链),你便应该在狗儿犯错的同时说出「不!」,然后在拉扯链子之前稍等一会儿,给牠机会修正行为以避免处罚。如果你只是直接拉扯P字链但没给牠警告,这个拉扯的动作就只是纯粹沦为处罚,将无可预期它对未来行为的影响,而且这个处罚的累积效应可能会影响狗儿的工作饮望。另一个常犯错误是,当狗儿回到位置上时依然继续猛扯链子,这使牠的两个行为都受到处罚。

如果纠正式训练方法缺乏了制约负增强物,实际用到厌恶刺激的机会将会增加,也将使学习速度变慢。有时候传统训练师为了获得可靠稳定的行为,必须比应用增强训练的训练师多花费许多时间进行训练,也许花上数个月或甚至数年以上,这不只是因为他们所依赖的处罚方式会让行为消失,也因为他们使用处罚时缺少了制约负增强物,必须重复训练之后,动物才能归纳出牠们应该出现的行为。

近来有一类特殊的制约负增强物颇受训犬人士欢迎,这种「无奖励标定(确定)讯号」通常是以平淡语气说出「错!」这个字,概念是当狗儿表现不同行为试图猜测你想要什么时,你可以利用一个表示「那个行为不会得到增强」的讯号告诉牠哪些行为没用。

根据史金纳博士对「处罚」的定义  把动物想要的事物取走,这表示当「错!」这个字代表动物将无法获得增强物时,它无可避免地成为一个习得厌恶刺激,而它是否也因提供讯息而变得具有增强作用呢?我在训犬界里看过一些「错!」可派上用场的特殊情况,如果你的狗已经知道很多塑型完成的行为和指示讯号也就是说,牠对训练极富经验你便可以利用「错!」这个口令作为要牠改变行为的讯号,意思是:「省省力气,那么做没用,试试别的。」

要让这个作法奏效必须符合以下条件: 训练对象过去为了获得响片声而变化行为或主动尝试新行为时常获得增强的经验。使用这种必须巧妙运用的讯号时之所以出现问题,通常是因为人们把它用在没有经验、不明白人们想要什么的狗儿身上,这时人们很容易把这个讯号比照P字链使用:叫狗儿坐下,牠没坐下,立刻喊:「错!」如果这个讯号确实带有「不会获得增强物」的意义,那么「没有坐下」的行为即遭到处罚。但是这并不代表坐下的行为现在即将发生,事实上它的后果很可能与其它处罚一样无可预料,狗儿可能完全不再反应并低头怯怯地偷偷溜走,或者牠会放弃你,开始自己寻求增强物,因而出现不当行为,例如吠叫、暴冲、嗅闻地面或抓痒,把注意力移到他处。

无法预料的奖励更具吸引力变化的强化 (p。56)

(Schedules。of。Reinforcement。–。p。20)。

有个广为流传的错误观念是,当开始以正增强训练某个行为时,便必须在训练对象的余生里一直使用正增强物,如果不这么做,这个行为将会消失。这个说法并不正确,事实上只有在学习的阶段才需要持续使用增强物。你可能会经常称赞幼儿使用马桶的行为,但是一旦这个行为完成学习,它将自行获得增强。我们应该常常给予初学者增强物,例如教小孩骑自行车时可能需要不断告诉他:「那就对了,现在骑稳,你做到了,很好!」如果当他学会骑车而你却仍不断称赞他,这时你就很蠢了(小孩也会以为你发神经了)。

为了使学成的行为维持一定的可靠程度,非但没有必要每次都增强这个行为,而且极为重要的是,不可以经常增强这个行为,而要改为偶尔增强,而且是随机性(无法预测)的增强。

心理学家称这种增强方式为「变化性增强时制」(variable schedule of reinforcement),它维持行为的效果比起持续性、可预测的增强方式更好。一位心理学家曾跟我这么解释:假设你的新车总是很容易岭动,某天当你坐上车后把车钥匙一转,它却没发动,你可能会再试着发动几次,但是你很快就会判断这辆车出了问题而打电话给修车厂,由于转动车钥匙的行为没有立即带来期待的增强结果,这个转动钥匙岭动车子的行为很快便会消失。相反地,如果这是台老旧的破车,几乎很少在第一次就发动,而且通常还得花很久时间发动,这时候你便可能花上半个小时不断试图启动,因为这个转动车钥匙的行为长期以来一直受到变化性增强,因而能稳定维持着这个行为。

如果海豚每次跳跃都一定有鱼吃,牠跳跃的动作将很快变得马虎敷衍,过得去就好,然后要是不给鱼了,海豚跳跃的动作很快就会消失。不过,如果在牠学会跳跃就有鱼吃的概念后,我现在开始只增强第一次跳跃、第三次跳跃,接着便随机增强牠的跳跃动作,这个行为就会稳定维持下来,当动物没获得奖励时,牠们反而会更常跳跃,期盼下次中奖的机会,而且跳跃时甚至可能变得更有活力。如此一来,我便能够选择增强较具活力的跳跃动作。

利用变化性增强时制可以塑造出较佳的表现。不过即使是专业动物训练师,有些人仍法善用变化时制的正增强方法,它对许多人似乎都是个特别难以理解与接受的概念,我们都知道当错误行为停止时,我们就不必再继续处罚,可是我们往往无法理解为何没有必要继续奖励好的行为或甚至不应该这么做。这其实是因为我们想以正增强训练出进退有礼的良好行为时,我们自己也不太确定应该怎么做。

变化性增强时制的威力正是赌博的本质,要是每次投一块硬币到吃角子老虎里就会有十块硬币掉出来,你很快就会丧失兴趣,虽然你的钱会越来越多,但是这种方式实在很无趣。人们之所以爱玩吃角子老虎正是因为他们无法预料将出现什么:可能空空如也、可能掉下一些钱、也可能掉下很多钱。我们不在这里讨论为什么有些人会沉迷赌博,而有些人能够拍拍袖子走人,不过对于那些好赌成瘾的人来说,变化性增强的作用就是让他们上瘾的原因。

变化性增强出现的时间间隔越长,它所维持行为的效果就越强,不过如果你想设法消除某项行为,把时间间隔拉长的变化性增强就对你很不利。所有未获增强的行为都有自行消失的倾向,但是如果它不时获得增挂,尽管只是偶发事件  抽根烟、喝杯酒或者对不断唠叨或哀求的人梢事让步  这个行为不仅不会消失,事实上它可能反而被这种间隔拉长的变化性增强时制维持得更好,这就是为什么已经戒烟的人若偶尔偷偷抽根烟,在一天内即可能又变回大烟枪。

我们都看过一些遭配偶或情人施虐的人,难以理解他们为何依然留在这些人身边,这种爱上恶劣、毫不体贴、自私甚至很残忍的人却执迷不侮的情况,传统以为只发生于女性,但实际上这也发生于男性。大家都认识这类人,如果他们以离婚或其它方式离开恶劣的另一半,他们旋及又会找到同类型的对象重蹈覆辙。

这些长期成为受害者的人是否具有严重的心理问题呢?有这个可能,不过他们也可能是长间隔变化性增强时制的受害者。常你刚开始与对方交往时,认为对方迷人、性感、风趣你的钱会越来越多,但是这种方式实在很无趣又无微不至,即使这个人日后逐渐变得难以相处,甚至施暴,但偶尔还是会对你展现好的一面,即使获得这些美好增强物的时光变得越来越罕见,它却成了你的人生寄托。从常理来看,这似乎是十分反常的现象,但是从训练观点的角度看来却显而易见:这些美好时光出现得越少、越无可预测,它的增强作用越强大,而且你的基本行为也将越为持久。此外,也不难理解为什么曾经有过这类关系的人会再度寻求同类对象,因为他们与和善正派的正常人交往时可能就是少了那种增强物极少出现、令人渴盼、因而增强效果加倍所带来的快感。

从操纵者的角度来看,想任意使唤某个人、并且让他随时言听计从,只要偶尔给他他想要的东西就可以达到目的了,这便是皮条客管理手下妓女的手法之一。它的确是个极为有效的方法,但是一旦受害者理解到操纵者的强烈「魅力」至少有部分来自这种变化性增强时制,他们通常便能冷静离开这种关系,找寻不同的对象。

不适用变化性增强的情况 (p。59)

(Exceptions。to。Variable。Reinforcement。–。p。23)。

在行为学成后不应该采用变化性增强的情况只有一种,那就是当这个行为牵涉到解答问题的时候。高级服从训练要求狗儿从一堆杂七杂八的东西里找出主人摸过且带有气味的对象,每当狗儿选对对象时都必须让牠知道,这样牠才知道下次该怎么做。进行分辨测验(例如找出两个声音之频率较高者)时,动物每次答对都必须获得增强,这样牠才能一直获知要求牠回答的问题是什么(当然,这时可以使用制约增强物)。我们在玩填字游戏或拼图时,每次猜对就会被增强,因为只有正确的字或拼图片才能放入对应的空格或位置里,如果每个空洞都可放入多片拼图,你便得不到因正确选择带来的正增强,这种回锁对于多数选择性测验的情境都是必要�

小提示:按 回车 [Enter] 键 返回书目,按 ← 键 返回上一页, 按 → 键 进入下一页。 赞一下 添加书签加入书架