← 返回概念解读

Concept Fable精修版

词表

Vocabulary · Tokenization

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

城门口那本只认编号的名册

灯塔镇有一台老分拣机,它不看整封信,只看木片上的编号。每个编号对应名册里的一个字块,守门人按编号把木片送进机器。

早年镇上来信少,名册够用。后来外地商队带来新地名、新货名和新姓氏,守门人找不到对应编号,只好把陌生词拆成零碎木片。分拣机能读,却常把意思切得很怪。

镇长先让守门人临时编号。几天后,同一个地名被三个人编成三套号码,旧信和新信对不上。第二次修补是把所有新词都整块加入名册,名册很快膨胀,常用编号也被挤乱。

老书记重修名册:常见字块保留稳定编号,新增词要经过登记,太罕见的词按规则拆分,常用新词再升格成独立条目。名册既不能太小,也不能任意扩张。

新规矩让分拣机稳定许多。遇到陌生货名,它能按已知字块处理;遇到高频新词,名册再正式收录。守门人也知道,编号一旦改变,过去积累的许多对应关系都会受影响。

灯塔镇终于明白,名册不是普通词典,而是把文字切成可处理单位并分配编号的边界。它决定机器能看见哪些字块、怎样组合输入,以及陌生词会以什么形态进入系统。

老书记还保留旧名册版本。若新名册改变了切分方式,过去的信件需要知道当时用的是哪一版,否则新旧编号会错位。名册看似基础,却牵动整套处理秩序。

后来灯塔镇教新人时,不先讲机器多聪明,而是让他们亲手切几封外地信。切得太碎,意思散;切得太大,名册撑不住。合适的词表,就是在表达力、稳定性和规模之间做取舍。后来外地新词越来越多,名册也定期更新。每次更新前,书记都会测试旧信是否还能正确送入机器。能稳定承载变化的名册,才是分拣机真正的入口。名册稳,后面的处理才不会在第一步就乱掉。后来每次新增字块,书记都会问它是否足够常见、是否会破坏旧编号。

揭示

这个故事讲的是:词表

Vocabulary 是 tokenizer 或模型可识别 token 的集合,通常包含子词片段、符号、特殊 token 及其 token ID。它决定文本如何被编码、哪些片段可以高效表示、同一文本会占用多少上下文空间。企业在做模型选型、成本估算、领域术语适配、多语言支持或 tokenizer 迁移时,必须关注 vocabulary 差异,因为它会影响 token 数、速度、召回质量和特殊格式的稳定性。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 名册:token vocabulary
  • 编号木片:token IDs
  • 分拣机:大模型
  • 名册太厚:过大 vocabulary 带来的训练和维护成本
  • 名册太薄:过度切分导致 token 膨胀和领域表达受损
  • 特殊标记:BOS、EOS、padding、工具调用等 special tokens
  • 最后洞察:Vocabulary 是文本到模型之间的接口边界,不只是术语清单

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

tokentokenizerBPEunknown tokentoken ID