← 返回概念解读

Concept Fable精修版

分层学习率

Layer-wise Learning Rate · Fine-tuning

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

老墙轻刷,新门重漆

修复古塔时,匠头发现塔基的青石经历多年风雨,塔顶的新瓦却刚铺不久。年轻匠人主张全塔一起重整,拿同样的锤子、用同样的力道,觉得这样最快也最公平。

几天后,塔顶松动的新瓦仍未贴牢,塔基旧石反而被震出裂缝。匠头明白,各处承受改动的能力不同;把同一种修补施给所有位置,并不会带来同一种结果。

他改在小范围内逐层试验:塔基只补缝固角,中层替换破损构件,塔顶则重新校正瓦列。每一层的改动都记录在册,若发现裂纹扩大,便退回上一步。

入秋时古塔既保住了根基,也换好了屋顶。匠头告诉学徒,修一座有历史的塔,先要分清哪里该轻动、哪里能大胆调整。

概念落点

这个故事讲的是:分层学习率

Layer-wise Learning Rate 是在微调时给不同模型层设置不同学习率,常见做法是底层较小、高层或任务相关层较大。它有助于保留通用表示,同时让模型适应新任务,降低灾难性遗忘和过拟合风险。企业微调小数据、专业领域任务或迁移学习时尤其需要关注。

它的价值在于把一个抽象术语落到可观察的机制、约束和取舍上,便于在真实系统中判断适用范围。

故事对应

  • 老药铺根基:模型底层通用表示
  • 前厅:任务相关高层或输出头
  • 同样力道打磨:所有层使用同一学习率
  • 分层处理:layer-wise learning rate
  • 保留旧知识并适应新流程:稳定迁移与微调

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

discriminative fine-tuningcatastrophic forgettingULMFiT