第十二章 奖励性误判与成瘾回路
人会重复被奖励的行为。 这句话简单,但极其重要。 很多人以为自己是按照道理行动的。 实际上,人常常是按照奖励行动的。 什么东西让他立刻舒服,他就更容易重复。 什么东西让他获得认可,他就更容易重复。 什么东西让他缓解痛苦,他就更容易重复。 什么东西让他快速看到结果,他就更容易重复。 奖励会塑造行为。 更隐蔽的是,奖励还会塑造判断。 人会逐渐相信那些让自己得到奖励的解释。
一、奖励会训练注意力 被奖励过的东西,会更容易被注意到。 交易中,一个人曾经靠短线赚过钱,他就会更关注短期波动。 社交媒体中,一个人某种表达获得过点赞,他就会更关注能引发反馈的话题。 关系中,一个人通过拉扯获得过关注,他就会更关注能制造情绪波动的方式。 公司中,一个员工通过包装数据获得过表扬,他就会更关注如何包装,而不是如何创造真实价值。 奖励不只是给结果。 奖励会训练注意力。 久而久之,人会看见那些能带来奖励的东西,而忽略那些真正重要但反馈慢的东西。 这就是奖励性误判的第一层: 人会把被奖励的东西误认为重要的东西。
二、短反馈会压倒长反馈 人天然喜欢短反馈。 短反馈快、清楚、刺激。 长反馈慢、模糊、需要等待。 但现实中,很多真正重要的东西,反馈都很慢。 健康是慢反馈。 关系质量是慢反馈。 公司文化是慢反馈。 投资能力是慢反馈。 写作能力是慢反馈。 认知升级是慢反馈。 而很多有害的东西,反馈很快。 刷短视频很快。 频繁交易很快。 情绪拉扯很快。 炫耀表达很快。 短期业绩冲刺很快。 这就产生一个危险结构: 坏东西给快奖励,好东西给慢奖励。 如果一个人没有长期结构,他很容易被短反馈训练坏。 不是因为他不知道长期重要,而是因为短反馈在不断重塑他的行为系统。
三、奖励会制造自我合理化 当一个错误行为带来奖励,人会自动为它找理由。 频繁交易赚了钱,他会说自己反应快。 情绪控制别人有效,他会说这是解决问题。 过度工作带来成果,他会说自己能扛。 迎合别人获得认可,他会说这是成熟。 数据造假换来绩效,他会说大家都这样。 奖励越强,合理化越强。 因为人不愿意承认: 我被奖励训练了。 他更愿意相信: 这是我的能力。 这是我的方法。 这是现实需要。 这是我看得清。 所以奖励性误判不只是行为问题。 它会污染自我理解。
四、成瘾回路:从奖励到失控 当一个奖励足够快、足够强、足够不确定,就容易形成成瘾回路。 成瘾不一定只发生在物质上。 交易可以成瘾。 社交反馈可以成瘾。 关系拉扯可以成瘾。 工作成就可以成瘾。 信息摄入可以成瘾。 AI 生成也可以成瘾。 成瘾回路有几个特点: 第一,短期缓解痛苦。 第二,快速带来刺激。 第三,结果不稳定,反而让人更想重复。 第四,长期损害系统。 第五,人会为重复行为找理由。 比如,一个人焦虑时刷信息。 刷的时候舒服一点。 但刷完更乱、更疲惫、更焦虑。 于是他又刷。 这就是典型回路。 它不解决问题,只是短期降低不适。 但短期降低不适,本身就是奖励。
五、奖励性误判的识别信号 奖励性误判参与判断时,通常有几个信号。 第一,我知道这件事长期不好,但还是想做。 第二,我做完之后短期舒服,长期更乱。 第三,我不断找理由证明这件事有必要。 第四,我越来越难停下来。 第五,我把刺激感误认为价值感。 第六,我把被奖励过的方法,当成长期正确的方法。 一旦出现这些信号,就要问: 这是真正有价值,还是只是奖励很快?
六、反制奖励性误判 反制奖励性误判,不能只靠意志力。 因为奖励回路本身就是训练系统。 要反制它,必须改变环境、反馈和动作结构。 第一,拉长反馈。 不要只看今天舒服不舒服,要看一周后、一个月后、一年后系统变成什么样。 第二,降低短奖励暴露。 减少高刺激、高频反馈、强不确定奖励源。 第三,设计慢奖励。 把健康、学习、写作、长期投资这类慢变量,设计成可见进度。 第四,增加摩擦。 对容易成瘾的行为,加一道暂停机制。 第五,回到真实价值。 这件事是在创造长期价值,还是只是在提供即时奖励? 奖励不是错。 但奖励必须服务长期系统。 一旦奖励反过来训练系统,误判就会稳定发生。
本章小结 奖励性误判的核心,是人会把被奖励的东西误认为重要的东西,把短期舒服误认为长期正确,把即时刺激误认为真实价值。 成瘾回路不是意志薄弱那么简单。 它是奖励、痛苦、刺激、不确定性和自我合理化共同形成的系统。 一句话: 人不是按道理重复行为,而是按奖励重复行为;所以要想少误判,必须先看清自己被什么训练。