← 返回概念解读

Concept Fable精修版

强化学习

Reinforcement Learning, RL · Machine Learning

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

小船学会靠岸

山脚马戏团训练一只小猴走迷宫取果。最早训猴师拿着路线图教它:左转、右转、跳木箱。小猴记住了这一座迷宫,换个入口就乱。

训猴师改了办法。他不再每一步都指挥,只在小猴拿到果子时给甜枣,撞到铃铛或走进死巷时不给。小猴开始乱试:有时爬墙,有时推箱,有时绕远路。

掌柜嫌它浪费时间,想直接把正确路线背给它。老训猴师说,若只背这一条路,它永远不知道不同动作会带来什么后果。让它试,是为了学会在环境里选择。

试久了,小猴发现某些动作更常接近果子,某些捷径看似快却会触发铃铛。训猴师偶尔改变果子位置,小猴不再完全崩溃,会先探索几步,再利用熟悉的线索。

奖励也要小心。有次只奖励最快到达,小猴学会撞倒木栏抢路,差点弄伤同伴。训猴师把奖励改成既看拿果,也看是否避开铃铛和木栏。

一开始小猴只会碰运气。训猴师若每次都急着拉它回正路,它就又变成听口令;若完全不管,它会学会撞翻箱子也能偷果子。奖励给得太粗,会长出歪办法。

训猴师于是重新安排奖惩。拿到果子有甜枣,碰响铃铛扣掉,走得更短多给一点,推坏木箱不给。小猴仍靠尝试发现路线,但每次结果都会改变它下次的倾向。久而久之,它不是背一张图,而是学会在新迷宫里寻找能带来好结果的动作。训猴师也学会观察坏奖励。若小猴为了甜枣学会撞开旁门,就要改奖惩;目标给错了,学得越快越麻烦。

后来小猴能在新迷宫里慢慢摸索。它不是从讲解里学会每条路线,而是从行动、反馈、再行动中学会策略。给什么回报、允许怎样探索,决定了它最终学成什么样的本事。

揭示

这个故事讲的是:强化学习

智能体在环境中观察状态、选择动作、获得奖励或惩罚,并通过多次试错学习一套能最大化长期收益的策略。

强化学习的核心元素包括智能体、环境、状态、动作、奖励、策略和长期回报。它特别强调延迟后果:眼前得分高的动作,不一定带来最终最好的结果。

隐喻映射

  • 划船学徒:智能体
  • 湖面、码头和水流:环境与状态
  • 左划右划停船:动作
  • 加分扣分:奖励信号
  • 绕圈拿小分:奖励设计错误导致的投机行为

Soloharness 判断

强化学习提醒我们,目标设计会塑造行为。业务 Agent 若奖励错了,会学会完成指标,而不是完成客户真正要的结果。

agentenvironmentrewardpolicyRLHF