精选精修
已经人工精修的重点概念
670 篇
领域分类
全部概念
684 个
Coding agent / developer tool
新增opencode
AI Coding Agent
opencode 是面向编程任务的开源 AI coding agent,适合在代码库里理解工程、编辑文件、运行命令、调试错误、生成测试和重构代码。它是生产业务 Agent 的开发工具,不是业务 Agent 本身。
读寓言 →
Agent runtime / harness
新增OpenClaw
Agent Runtime / Harness
OpenClaw 是更通用的 Agent runtime / harness,把渠道、会话、工具、技能、记忆、任务、自动化和节点能力组织成可持续运行的智能体基础设施。
读寓言 →
AI agent platform
精修版Agent 运行时
Agent Runtime
Agent 运行时是让智能体真正执行工作的运行环境。它不只是调用一次大模型,而是负责管理任务状态、上下文、工具调用、权限边界、人工审批、错误恢复、日志追踪和多步骤执行。
读寓言 →
AI agent platform
精修版工具调用
Tool Calling, Function Calling
工具调用,也叫 Function Calling,是模型以结构化方式请求外部函数、API、数据库、文件系统或业务系统来完成任务的机制。
读寓言 →
AI agent platform
精修版工具注册表
Tool Registry
工具注册表是对 Agent 可用工具的集中目录和控制层。它记录工具名称、用途、参数 schema、调用方式、权限要求、风险等级、审批规则、速率限制、返回格式和负责人。
读寓言 →
AI application observability and evaluation tool
精修版Weights & Biases Weave
Weights & Biases Weave
Weights & Biases Weave 是面向 AI 应用的追踪、评测和调试工具,可记录模型调用、提示、输出和迭代过程。
读寓言 →
AI engineering / data pipeline
精修版合成数据
Synthetic Data
合成数据由模型、规则或仿真系统生成,用于训练、微调、评测和测试覆盖,关键在质量过滤与分布边界。
读寓言 →
AI engineering / fine-tuning
精修版低秩适配
LoRA, Low-Rank Adaptation
LoRA(Low-Rank Adaptation)是一种参数高效微调方法。它冻结基础模型大部分权重,只训练小规模低秩矩阵来适配特定任务,从而显著降低训练成本、显存需求和多任务适配复杂度。
读寓言 →
AI engineering / fine-tuning
精修版量化低秩适配
QLoRA, Quantized LoRA
QLoRA(Quantized LoRA)是在量化后的基础模型上训练 LoRA 适配器的方法,常见做法是用 4-bit 量化降低显存占用,同时训练少量 adapter 参数。
读寓言 →
AI engineering / infrastructure
精修版推理引擎
Inference Engine
推理引擎负责高效执行模型前向计算,并管理显存、KV cache、批处理、并发调度、流式输出和硬件加速。
读寓言 →
AI engineering / model optimization
精修版蒸馏
Distillation
蒸馏是用大模型或强模型的输出、解释或偏好信号训练较小模型,使小模型以更低成本复现部分能力。企业常用蒸馏降低推理成本、提升延迟表现,或把通用模型能力迁移到专门任务;但必须明确适用范围、评测标准和回退机制。
读寓言 →
AI engineering / operations
精修版批量推理
Batch Inference
批量推理是将大量输入集中提交给模型离线处理,适合标注、报表生成、文档处理、推荐召回、质量扫描和非实时任务。它通常优化吞吐、单位成本、重试和作业管理,而不是单个请求的即时延迟。
读寓言 →
AI engineering / operations
精修版在线推理
Online Inference
在线推理是在用户请求发生时实时调用模型生成结果,典型约束是低延迟、高可用、并发能力、流式响应和错误处理。企业 Agent 的在线推理还要考虑鉴权、上下文装配、工具调用、升级路径、SLA 和可观测性。
读寓言 →
AI platform / cost optimization
精修版模型路由
Model Routing
模型路由 Model Routing 是根据任务类型、质量要求、成本、延迟、上下文长度、风险、权限或供应商状态,选择调用不同模型的机制。它避免所有任务都使用最贵或最强模型,也避免关键任务被低能力模型处理。
读寓言 →
AI platform / cost optimization
精修版语义缓存
Semantic Cache
语义缓存 Semantic Cache 是根据请求的语义相似度复用已有回答、中间结果、检索结果或工具结果的机制。它不同于只按完全相同字符串命中的普通缓存,而是判断两个请求在含义上是否足够接近。
读寓言 →
AI platform / deployment
精修版推理端点
Inference Endpoint
推理端点是模型服务暴露给应用调用的网络入口,通常包含鉴权、请求格式、路由、版本管理、限流、负载均衡、日志和监控。它把模型能力变成可被应用稳定调用的服务契约,是部署和运行治理的重要边界。
读寓言 →
AI platform / infrastructure
精修版模型网关
Model Gateway, AI Gateway
模型网关 / AI Gateway 统一接入多个模型供应商或自部署模型,并提供鉴权、路由、限流、日志、缓存、fallback、成本控制和策略执行。它让企业在多模型环境下避免应用到处硬编码供应商调用,同时集中治理安全、质量、成本和可用性。
读寓言 →
AI platform / integration
精修版模型上下文协议
Model Context Protocol, MCP
模型上下文协议 MCP(Model Context Protocol)是一种让 AI 应用以标准方式连接外部工具、数据源和上下文服务的协议。
读寓言 →
AI product metrics / operations
精修版AI 工作替代率
AI Task Automation Rate
AI 工作替代率衡量原本由人完成的任务中,有多少比例被 AI 自动完成或显著减少人工介入。它比调用量、会话量、生成字数更接近商业价值,因为它直接连接人工成本、交付能力和毛利改善。
读寓言 →
AI product metrics / support operations
精修版自动化偏转率
Deflection Rate
自动化偏转率衡量 AI 或自助系统成功处理并避免转人工处理的请求比例,常见于客服、IT 支持和运营工单。它必须和解决质量、错误拦截、升级准确性一起看;单纯降低人工转接可能损害客户体验。
读寓言 →
AI product pattern
精修版自动驾驶
Autopilot
Autopilot 是让 AI 在明确目标、权限边界和监控机制下自主完成任务的产品模式。人工主要负责设定目标、监督边界、处理异常和验收结果。
读寓言 →
AI product pattern
精修版副驾驶
Copilot
Copilot 是辅助人完成工作的 AI 产品模式。AI 提供草稿、建议、检索、比较、检查和下一步推荐,由人保留最终判断、编辑、批准或提交权。企业场景里,Copilot 的价值在于提升专业人员产能和质量,同时保持责任边界清晰。
读寓言 →
AI safety
精修版水印
Watermarking
Watermarking 是在 AI 生成内容中嵌入可检测信号,用来提示或验证内容来源。
读寓言 →
AI-native business model
精修版服务即软件
Services-as-Software
服务即软件是用 AI 和自动化把原本由人工交付的服务流程产品化,让客户购买业务结果,而不只是购买工具访问权。它区别于传统 SaaS 的关键在于:供应方承担更多工作流执行和结果责任,定价更靠近任务、工单、交付量或结果。
读寓言 →
Agent Operating Model
精修版Agent 运营模型
Agent Operating Model
Agent 运营模型是企业为生产中的 Agent 设计的一整套组织运行方式:谁拥有 Agent,任务如何分派,如何监督,如何衡量,如何升级给人,如何改进,如何处理事故和合规风险。它把单个 Agent 能力变成可持续交付体系。
读寓言 →
Agent Operating Model
精修版Agent 拥有人
Agent Owner
Agent 拥有人是对某个 Agent 的目标、权限、性能、风险和生命周期负责的业务或技术拥有人。企业里不能把 Agent 责任悬空在“模型”“平台”“IT”或“业务团队”之间;必须明确谁能改它、谁看指标、谁处理事故、谁决定升级或停用。
读寓言 →
Agent Operating Model
精修版职权边界
Authority Boundary
职权边界是 Agent 被允许做出的决定、动作、花费、数据访问和外部承诺的明确限制。它把“能调用工具”进一步约束为“在什么条件下能调用、能影响多大范围、是否需要审批、是否能对外承诺”。
读寓言 →
Agent Operating Model
精修版自主级别
Autonomy Level
自主级别是对 Agent 独立工作程度的分级:它可以只推荐、先草拟、在审批后执行、在限额内自主执行,或在特定场景下全自动运行。企业治理中,自主级别决定人工介入方式、审批门槛、审计要求和风险边界。
读寓言 →
Agent Operating Model
精修版运营指标
Operating Metrics
运营指标是用来管理生产中 Agent 的量化指标,例如完成率、升级率、错误率、延迟、成本、返工率、一次验收率和事故率。
读寓言 →
Agent architecture
精修版智能体循环
Agent Loop
智能体循环是 Agent 运行的基本闭环:观察状态、推理规划、选择动作、调用工具执行,再把结果写回上下文进入下一轮。
读寓言 →
Agent architecture
精修版执行器
Executor
执行器负责把计划步骤落实为实际动作,如调用工具、运行代码、访问外部系统,并把结果返回给评估或重新规划。
读寓言 →
Agent architecture
精修版规划器
Planner
规划器负责把用户目标拆成可执行步骤、子目标、约束和依赖关系,并在新信息出现时调整计划。
读寓言 →
Agent capability
精修版动作
Action
动作是 Agent 在环境中执行的离散操作,通常通过工具、函数、API、浏览器或 GUI 自动化完成。它和普通文本回答不同:动作会改变外部系统状态,例如发邮件、改记录、创建订单、提交表单或调用付款接口。
读寓言 →
Agent capability
精修版计算机使用
Computer Use
Computer Use 指模型通过屏幕、鼠标、键盘或 UI 自动化直接操作计算机环境的能力。它让 Agent 能处理没有 API、接口不完整或只能通过桌面软件完成的任务。
读寓言 →
Agent capability
精修版GUI 智能体
GUI Agent
GUI Agent 是通过视觉识别和界面操作完成软件任务的 Agent。它理解屏幕上的控件、文本、表格、弹窗和状态变化,并通过点击、输入、选择等动作推进任务。
读寓言 →
Agent capability
精修版网页智能体
Web Agent
Web Agent 是在网页环境中搜索、导航、填写表单、下载资料和执行操作的智能体。它需要理解页面内容、保持任务状态、处理登录和动态页面、判断证据质量,并在高风险网页动作前请求人工批准。
读寓言 →
Agent decision-making
精修版工具选择
Tool Selection
Tool Selection 是 Agent 根据当前子任务,从可用工具、函数或 API 中选择该调用哪一个以及用什么参数调用的过程。它不只是能力匹配,还涉及意图识别、权限边界、风险等级、成本、可回滚性和是否需要人工批准。
读寓言 →
Agent execution object
精修版运行
Run
Run 表示 Assistant 或 Agent 针对一个 thread/request 的一次完整执行。它包含模型推理、消息生成、工具调用、等待人工动作、错误处理和最终输出等过程。
读寓言 →
Agent execution trace
精修版运行步骤
Run Step
Run Step 是 Run 中的中间执行记录,例如一次模型消息生成、一次工具调用、一次等待人工动作或一次失败重试。它让团队能够检查 Agent 执行过程,而不是只看最终回答。
读寓言 →
Agent interface
精修版实时智能体
Real-Time Agent
Real-Time Agent 是在低延迟、流式交互中理解输入、规划行动、调用工具并持续回应的 Agent。它常用于语音、客服、调度、监控和协作场景,关键要求是低延迟、增量理解、状态持续更新、及时打断和安全升级。
读寓言 →
Agent interface
精修版语音智能体
Voice Agent
Voice Agent 是通过语音输入输出与用户实时交互并完成任务的 Agent。它结合语音识别、实时理解、对话管理、工具调用、语音合成和人工升级。
读寓言 →
Agent memory
精修版情景记忆
Episodic Memory
情景记忆记录具体事件、交互、观察和结果,通常包含时间、来源、参与者、动作和后果等元数据。
读寓言 →
Agent memory
精修版记忆压缩
Memory Compression
Memory Compression 将长对话、历史观察、检索材料或执行轨迹压缩成更短的摘要、结构化事实或可检索记忆,使它们能放进后续 context budget,同时尽量保留对任务有用的信号。
读寓言 →
Agent memory
精修版语义记忆
Semantic Memory
Semantic Memory 是从具体事件中抽象出来的事实、概念、用户偏好、业务规则和领域知识。它不同于 Episodic Memory:后者保留一次次发生过的经历,前者保存可复用的稳定知识。
读寓言 →
Agent operations / governance
精修版审批流
Approval Flow, Human Approval
审批流是在高风险动作前加入人工确认的控制机制,常用于付费、外部写入、权限变更和删除操作。
读寓言 →
Agent orchestration pattern
精修版状态图
State Graph
状态图把 Agent 工作流建模为一组节点和边:节点读取并更新共享状态,边根据状态决定下一步执行。它适合表达会分支、循环、等待、重试和恢复的 Agent 流程。
读寓言 →
Agent protocol
精修版Agent-to-Agent 协议
Agent2Agent, A2A
Agent2Agent, A2A 指面向不同 Agent 之间互操作和通信的协议方向,让一个 Agent 能发现另一个 Agent 的能力、发起任务、传递上下文、接收状态和处理结果。它关注跨系统、跨供应商、跨组织的协作边界。
读寓言 →
Agent state
精修版长期记忆
Long-Term Memory
Long-Term Memory 是保存在当前上下文窗口之外、可跨会话和跨任务检索的信息。它让企业 Agent 记住客户偏好、历史承诺、领域事实、未完成任务和长期状态。
读寓言 →
Agent state
精修版工作记忆
Working Memory
Working Memory 是 Agent 在当前任务中临时持有和操作的状态,包括目标、约束、最近观察、工具结果、中间产物、假设和下一步计划。它通常位于上下文窗口、scratchpad、状态对象或工作流 state 中。
读寓言 →
Agent state / reasoning workspace
精修版草稿区
Scratchpad
Scratchpad 是 Agent 在当前任务中使用的临时工作区,用来记录中间观察、计算、计划、工具结果和执行备注。它帮助 Agent 维持任务状态,但通常不应无筛选地进入长期记忆或用户输出。
读寓言 →
Agent workflow framework
精修版LangGraph
LangGraph
LangGraph 是用于构建有状态、多步骤、可控制 Agent 工作流的图式框架。
读寓言 →
Alignment
精修版对齐
Alignment
对齐让 AI 模型或 Agent 的行为符合人类意图、组织政策、安全边界和真实任务目标。
读寓言 →
Alignment
精修版宪法式 AI
Constitutional AI
宪法式 AI 用一组明确原则指导模型生成、批评和修订输出,以减少对逐条人工偏好标注的依赖。
读寓言 →
Alignment
精修版直接偏好优化
Direct Preference Optimization, DPO
DPO 是基于偏好数据直接优化语言模型的方法,用同一输入下好坏响应的对比来调整模型行为。
读寓言 →
Alignment
精修版偏好数据
Preference Data
Preference Data 是用于训练奖励模型、DPO、RLHF、RLAIF 或其他偏好优化方法的数据,通常包含同一输入下多个响应及其排序、选择或评分。它表达的是“哪种行为更被接受”,而不只是标准答案。
读寓言 →
Alignment
精修版偏好优化
Preference Optimization
偏好优化利用人类或模型偏好信号改进模型行为,常见方法包括 RLHF、RLAIF、DPO、IPO 和 KTO。
读寓言 →
Alignment
精修版近端策略优化
Proximal Policy Optimization, PPO
Proximal Policy Optimization, PPO 是一种强化学习算法,常用于 RLHF 中根据奖励模型优化语言模型策略。它通过限制新策略相对旧策略的更新幅度,避免模型为了追求奖励而发生过大的行为漂移。
读寓言 →
Alignment
精修版AI 反馈强化学习
Reinforcement Learning from AI Feedback, RLAIF
Reinforcement Learning from AI Feedback, RLAIF 是使用 AI 系统产生的反馈或偏好信号来训练、对齐模型的方法。它可以降低人工标注成本、扩大反馈覆盖面,并用于宪法式 AI、自动偏好评审和安全评估。
读寓言 →
Alignment
精修版基于人类反馈的强化学习
Reinforcement Learning from Human Feedback, RLHF
RLHF 用人类偏好训练模型,通常包括收集偏好、训练奖励模型,并用强化学习优化模型输出。
读寓言 →
Alignment
精修版奖励模型
Reward Model
Reward Model 是根据人类或 AI 偏好数据训练出的模型,用来给候选输出打分或排序,预测哪些响应更符合目标偏好。在 RLHF 中,奖励模型通常指导后续强化学习优化。
读寓言 →
Application layer / Product
精修版大模型应用
LLM Application, Large Model Application
LLM Application / Large Model Application 是把大模型能力嵌入具体业务流程,连接数据、工具、权限、用户界面、评测和运营机制,形成可交付的软件或服务。
读寓言 →
Approximate nearest neighbor index
精修版分层可导航小世界图
Hierarchical Navigable Small World, HNSW
HNSW 是一种图结构近似最近邻索引,通过分层小世界网络加速向量检索,常用于向量数据库。
读寓言 →
Architecture
精修版注意力掩码
Attention Mask
Attention Mask 用于控制注意力机制中哪些 token 可以被其他 token 关注。常见用途包括因果掩码、防止模型看到未来 token、忽略 padding token,以及在某些架构中隔离不同区域的信息。
读寓言 →
Architecture
精修版ALiBi
Attention with Linear Biases
ALiBi(Attention with Linear Biases)是在注意力分数中加入与距离相关的线性偏置,通常让模型更偏向近距离 token,同时保留关注远距离 token 的可能。
读寓言 →
Architecture
精修版BERT
Bidirectional Encoder Representations from Transformers
BERT 是只使用编码器的 Transformer 模型,通过遮蔽语言建模预训练,适合分类、匹配和理解类任务。
读寓言 →
Architecture
精修版因果注意力/自回归
Causal Attention / Autoregressive
Causal Attention / Autoregressive 指生成当前位置时只能关注当前位置之前的 token,不能看到未来 token。它是自回归语言模型的基础,使模型能按顺序预测下一个 token 并生成文本。
读寓言 →
Architecture
精修版上下文长度/窗口
Context Window / Context Length
Context Window / Context Length 指模型一次前向计算可处理的最大 token 数,是模型架构和部署配置的重要能力指标。它不同于应用层的上下文策略:模型支持长上下文,并不意味着每个请求都应该填满。
读寓言 →
Architecture
精修版交叉注意力
Cross-Attention
交叉注意力让一个序列在生成或更新表示时,动态关注另一个序列中的相关信息。
读寓言 →
Architecture
精修版纯解码器
Decoder-Only
Decoder-Only 是只使用 Transformer 解码器堆叠的架构,现代 GPT 类大语言模型多采用这种路线。它把输入提示、上下文、示例和已生成内容都放在同一序列中,用自回归方式预测下一个 token。
读寓言 →
Architecture
精修版扩散语言模型
Diffusion Language Model
Diffusion Language Model 是把扩散模型思想用于语言生成的模型路线,通常通过从噪声或被破坏的文本状态逐步去噪来生成或编辑文本,而不是像传统自回归模型那样严格从左到右预测下一个 token。
读寓言 →
Architecture
精修版编码器-解码器
Encoder-Decoder
Encoder-Decoder 是由编码器和解码器组成的 Transformer 架构。Encoder 先把输入编码成上下文化表示,Decoder 在生成输出时通过 Cross-Attention 查看这些表示。
读寓言 →
Architecture
精修版前馈网络
Feed-Forward Network, FFN
前馈网络是 Transformer 层中位于注意力之后的逐位置非线性模块,负责扩展和变换每个 token 表示。
读寓言 →
Architecture
精修版GPT
Generative Pre-trained Transformer
GPT 是基于解码器的自回归 Transformer 模型,通过预测下一个 token 训练,适合生成、推理和对话任务。
读寓言 →
Architecture
精修版分组查询注意力
Grouped Query Attention, GQA
分组查询注意力让多组查询头共享键值头,在多头注意力质量和多查询注意力效率之间取得折中。
读寓言 →
Architecture
精修版Jamba
Jamba
Jamba 是结合 Transformer 注意力与 Mamba/SSM 思路的混合架构路线,用于提升长上下文处理效率。
读寓言 →
Architecture
精修版层归一化
Layer Normalization
Layer Normalization 是在神经网络层内部对激活值进行归一化的技术,使每个样本的特征分布更稳定。Transformer 中常在注意力和 FFN 前后使用 LayerNorm,以改善训练稳定性和梯度传播。
读寓言 →
Architecture
精修版线性注意力
Linear Attention
Linear Attention 是一类将注意力计算复杂度从传统 self-attention 的二次增长降低到近似线性增长的方法。
读寓言 →
Architecture
精修版Mamba
Mamba
Mamba 是一种基于选择性状态空间模型的序列建模架构,核心特点是让状态更新具有输入相关的选择机制,从而在长序列上兼顾效率和内容敏感的信息保留。
读寓言 →
Architecture
精修版MoD
Mixture of Depths
MoD 会动态决定不同 token 是否经过全部模型层,让简单 token 跳过部分计算,以降低推理成本。
读寓言 →
Architecture
精修版混合专家模型
Mixture of Experts, MoE
混合专家模型把不同 token 路由到不同专家子网络,在扩大总参数量的同时控制单次推理成本。
读寓言 →
Architecture
精修版多查询注意力
Multi-Query Attention, MQA
多查询注意力让所有查询头共享同一组键值头,显著减少 KV 缓存占用,常用于提升长上下文推理效率。
读寓言 →
Architecture
精修版残差连接
Residual Connection
Residual Connection 把层的输入直接加到层的输出上,让网络学习增量变化而不是每层完全重写表示。它改善深层网络的梯度传播和训练稳定性,是 Transformer 能堆叠很多层的重要原因。
读寓言 →
Architecture
精修版RMSNorm
Root Mean Square Layer Normalization
RMSNorm 是 LayerNorm 的变体,用激活值均方根做归一化,通常不减均值,可降低计算开销并稳定训练。
读寓言 →
Architecture
精修版旋转位置编码
Rotary Position Embedding, RoPE
RoPE(Rotary Position Embedding)通过对 query/key 向量施加与位置相关的旋转来编码位置信息,使注意力分数包含相对位置信息。它广泛用于现代 LLM,有助于处理顺序和相对距离,并与长上下文扩展技术密切相关。
读寓言 →
Architecture
精修版滑动窗口注意力
Sliding Window Attention
Sliding Window Attention 限制每个 token 只关注其附近固定窗口内的 token,从而把长序列注意力成本从全局二次增长降下来。它适合长文本、语音、日志等局部依赖强的场景,也常与全局注意力或稀疏注意力结合。
读寓言 →
Architecture
精修版状态空间模型
State Space Model, SSM
状态空间模型用随序列更新的状态来建模长程依赖,是 Transformer 注意力之外的重要序列建模路线。
读寓言 →
Architecture
精修版SwiGLU
Swish-Gated Linear Unit
SwiGLU 是用于 Transformer 前馈网络的门控激活结构,通过门控分支提升非线性表达能力和模型效果。
读寓言 →
Architecture
精修版T5
Text-to-Text Transfer Transformer
T5 将翻译、摘要、问答等 NLP 任务统一成文本到文本格式,用同一模型范式处理多种语言任务。
读寓言 →
Architecture
精修版视觉 Transformer
Vision Transformer, ViT
Vision Transformer(ViT)把图像切成 patch,并像处理 token 序列一样用 Transformer 建模图块之间的关系。它把自注意力引入视觉任务,适合分类、检索、检测等视觉理解基础。
读寓言 →
Architecture
精修版权重绑定
Weight Tying
Weight Tying 是在语言模型中共享输入 embedding 层和最终输出 projection(LM head)权重的技术。它可以减少参数量,并让输入词表示与输出词预测共享同一套符号空间,通常不会显著损害质量。
读寓言 →
Auditability
精修版审计证据
Audit Evidence
审计证据是支持审计结论的可检查材料,如审批记录、日志、测试结果、工单和第三方证明。
读寓言 →
Auditability
精修版审计轨迹
Audit Trail
Audit Trail 是记录某个对象、请求、数据或操作从开始到结束全过程的可追溯链条。它通常包含时间戳、操作者、输入、输出、系统状态、审批、变更原因和结果。
读寓言 →
Auditability
精修版可审计性
Auditability
Auditability 指系统、流程或组织能够被审计、复核和解释的能力。它不是单一日志功能,而是由记录、权限、证据、控制、职责、文档和可复现流程共同形成的属性。
读寓言 →
Auditability
精修版内部审计
Internal Audit
Internal Audit 是组织内部独立评估风险管理、控制和治理是否有效的职能。它通常不直接拥有业务控制,而是检查控制设计是否合理、执行是否一致、证据是否充分、缺陷是否被整改。
读寓言 →
Auditability/Documentation
精修版来源引用
Citation
Citation 是 AI 输出、决策或生成性陈述中对来源材料的引用。企业 RAG、知识库问答、合规分析和报告生成中,citation 用来把答案连接到文档、段落、记录或证据,支持核验、审计和纠错。
读寓言 →
Auditability/Security
精修版不可篡改日志
Tamper-Evident Log
Tamper-Evident Log 是能让修改、删除、插入或重排留下可检测痕迹的日志机制。它不等于绝对不可被攻击,但能让篡改难以不被发现,常通过追加写入、哈希链、签名、时间戳、WORM 存储或外部锚定实现。
读寓言 →
Automation architecture
精修版智能体工作流
Agentic Workflow
智能体工作流把可重复流程和 Agent 的有限自主结合,在目标、状态、工具、权限、审批和恢复规则内推进任务。
读寓言 →
Automation architecture
精修版工作流
Workflow
工作流是由步骤、决策、角色和系统集成组成的预定义或半结构化流程,用来稳定地产出一个业务结果。在 AI / Agent 系统里,工作流协调模型调用、工具、人工审批、状态和外部系统。
读寓言 →
Backend engineering / operations
精修版幂等性
Idempotency
幂等性指同一操作执行一次或多次都产生相同预期结果,常用于重试、支付、任务调度和外部写入场景。
读寓言 →
Backend engineering / operations
精修版任务队列
Job Queue, Task Queue
任务队列保存等待异步执行的工作单元,让前台请求和耗时、易失败的后台动作解耦。用户不必一直等在原地,worker 可以按规则慢慢处理。
读寓言 →
Billing / platform
精修版计量
Metering
计量是把客户实际使用量记录、归集并用于账单、配额、成本归因和经营分析的能力。企业 AI / Agent 服务里,计量对象可能是 token、任务、工单、自动完成次数、人工升级次数、数据处理量或交付结果。
读寓言 →
Business / SaaS metrics
精修版年度经常性收入
Annual Recurring Revenue, ARR
ARR 是把订阅或经常性合同标准化到一年维度后的收入指标,用来衡量 SaaS 或持续服务业务的规模。
读寓言 →
Business / SaaS metrics
精修版流失率
Churn Rate
流失率衡量客户、账户或收入在某段时间内停止续费、减少使用或离开的比例。
读寓言 →
Business / SaaS metrics
精修版净收入留存
Net Revenue Retention, NRR
Net Revenue Retention, NRR 衡量同一批既有客户在续费、扩容、降级和流失后的收入变化。公式通常是期初客户收入加扩张收入、减收缩和流失收入,再除以期初收入。
读寓言 →
Business / customer success
精修版客户健康分
Customer Health Score
Customer Health Score 用多个信号评估客户是否会续费、扩张或流失。
读寓言 →
Business / finance
精修版毛利
Gross Margin
Gross Margin 是收入扣除直接交付成本后的剩余比例。对 AI / Agent 服务,直接成本可能包括模型调用、云资源、工具/API 调用、人工审核、客户支持、实施和 SLA 响应。
读寓言 →
Business / finance
精修版单位经济模型
Unit Economics
Unit Economics 分析每个客户、任务、请求、工单或交易的收入、直接成本和利润,判断业务能否规模化盈利。
读寓言 →
Business / go-to-market
精修版企业销售
Enterprise Sales
Enterprise Sales 面向组织和大客户采购,通常涉及多角色决策、预算归属、安全与合规审查、POC、采购流程、法务合同和较长销售周期。
读寓言 →
Business / go-to-market
精修版理想客户画像
Ideal Customer Profile, ICP
理想客户画像描述最适合购买并成功使用产品的客户类型,包括行业、规模、痛点、预算和采购能力。
读寓言 →
Business / go-to-market
精修版产品主导增长
Product-Led Growth, PLG
产品主导增长用产品本身推动获客、激活、转化和扩张,常见手段包括试用、自助上手和产品内引导。
读寓言 →
Business / go-to-market
精修版销售主导增长
Sales-Led Growth
Sales-Led Growth 依靠销售团队识别目标客户、发现需求、协调多方利益相关人、推进采购并完成高客单价成交。它适合复杂企业产品、强定制交付、高合规风险或需要预算重构的 AI / Agent 服务。
读寓言 →
Business / growth
精修版客户获取成本
Customer Acquisition Cost, CAC
客户获取成本是获得一个新客户所需的销售、市场和相关投入成本。
读寓言 →
Business / growth
精修版客户生命周期价值
Customer Lifetime Value, LTV
Customer Lifetime Value, LTV 是一个客户在整个合作周期内预计贡献的收入或毛利价值。对 Soloharness,LTV 取决于合同金额、续费年限、扩张收入、毛利率、支持成本和流失概率。
读寓言 →
Business / operations
精修版服务级别协议
Service Level Agreement, SLA
SLA 是服务商与客户之间对可用性、响应时间、支持范围、修复时间、违约补偿和沟通机制的正式承诺。企业 AI / Agent 服务要替代人工流程或外包团队,就必须把可用性、质量、升级、事故处理和结果验收写清楚。
读寓言 →
Business / operations
精修版Token 成本
Token Cost
Token Cost 是 LLM 应用按输入、输出和中间推理 token 核算的模型使用成本。对 Soloharness 这类 Agent 服务,它不只是技术账单,而是毛利、套餐、用量限制和自动化策略的基础变量。
读寓言 →
Business / post-sales
精修版客户成功
Customer Success
客户成功通过上手、培训、价值追踪、风险预警、续费管理和扩容建议,帮助客户持续获得承诺结果。企业 AI / Agent 服务的采用风险很高:客户流程要改变,员工要信任系统,结果要被验收,成本要可控。
读寓言 →
Business model / delivery
精修版专业服务
Professional Services
专业服务是围绕咨询、实施、定制、培训和集成提供的人力密集型交付。对企业 AI / Agent 公司来说,它常用于早期售前验证、复杂集成、流程梳理和上线支持,能推动成交和客户成功。
读寓言 →
Business model / operations
精修版托管服务
Managed Service
托管服务是供应商持续代客户运营某项系统、流程或业务能力,通常包括软件、监控、支持、人力兜底、SLA 和结果责任。它比一次性专业服务更持续,比纯 SaaS 承担更多运营责任。
读寓言 →
Business model / pricing
精修版混合定价
Hybrid Pricing
混合定价把订阅费、席位费、用量费、服务费、超量费或结果分成组合起来,用来匹配不同成本结构和客户价值感知。
读寓言 →
Business model / pricing
精修版结果定价
Outcome-Based Pricing
结果定价按客户获得的业务结果、节省成本、新增收入或完成交付收费,而不是按席位、工时或调用量收费。对企业 AI / Agent 服务来说,它适合那些结果清晰、可验收、可归因且供应商能控制关键流程的场景。
读寓言 →
Business model / pricing
精修版席位定价
Seat-Based Pricing, Per-Seat Pricing
席位定价按用户、账号或人员数量收费,是 SaaS 中最常见、最易采购理解的方式。它适合价值主要来自人使用软件、用户数与价值和成本大致相关的产品。
读寓言 →
Business model / pricing
精修版用量定价
Usage-Based Pricing
用量定价根据客户实际使用量收费,常见计费单位包括请求数、token 数、任务数、处理数据量、存储量、自动完成次数或工单量。AI / Agent 产品的边际成本通常随模型调用、工具调用和人工升级变化,用量定价能让收入更贴近成本与价值。
读寓言 →
Business model / product
精修版软件即服务
SaaS, Software as a Service
SaaS(Software as a Service)通过在线方式持续交付软件能力,通常按订阅、席位或用量收费,供应商负责运行、维护、升级和可用性。
读寓言 →
Business model / product strategy
精修版产品化服务
Productized Service
产品化服务是把原本定制化、靠专家临场判断的服务,压缩成范围清晰、流程固定、价格明确、验收标准稳定的交付方案。企业 AI / Agent 场景中,很多早期收入来自人工实施、咨询和定制流程;如果不能产品化,就难以规模化,也难以提升毛利。
读寓言 →
Business positioning / Automation
精修版数字员工
Digital Employee, Digital Worker, AI Worker
数字员工、Digital Worker 或 AI Worker 是把 AI 能力包装成可承担岗位任务或流程结果的虚拟劳动力。它的市场表达更接近“替代或增强某类工作”,而不是“提供一个软件功能”。
读寓言 →
Capability packaging
精修版技能
Skill
技能是打包给 Agent 的任务能力模块,通常包含特定任务的指令、工具、示例、流程、边界和验收方法。它让 Agent 更可靠地完成某一类工作,而不是每次靠通用提示词临场发挥。
读寓言 →
Compliance
精修版合规映射
Compliance Mapping
Compliance Mapping 是把法规、标准、客户要求或审计准则映射到企业内部控制、流程、证据和责任人的过程。它能避免重复建设,也能发现控制缺口。
读寓言 →
Compliance/Audit
精修版控制测试
Control Testing
Control Testing 是验证控制措施是否按设计运行、是否有效降低风险的活动。它可以通过抽样检查、重新执行、观察、询问、配置复核、日志分析或模拟演练完成。
读寓言 →
Compliance/Documentation
精修版技术文档
Technical Documentation
技术文档描述系统架构、组件、接口、数据流、权限、部署、运行、故障处理和变更历史。
读寓言 →
Compliance/Governance
精修版控制框架
Control Framework
Control Framework 是组织用来设计、组织、执行和评估控制措施的一套结构化框架。它通常定义控制目标、控制领域、责任归属、执行要求、证据类型、测试频率和缺陷处理方式。
读寓言 →
Compliance/Security
精修版控制措施
Controls
Controls 是为降低风险、满足政策或达成控制目标而设计的具体措施。它可以是预防性、侦测性或纠正性的,例如访问审批、最小权限、日志监控、人工复核、配置基线、变更审批、备份、告警和事件响应。
读寓言 →
Compliance/Security
精修版ISO 27001
ISO/IEC 27001
ISO 27001 是信息安全管理体系国际标准,要求组织以风险管理方式持续改进信息安全控制。
读寓言 →
Compliance/Security
精修版SOC 2 Type I
SOC 2 Type I
SOC 2 Type I 是由独立审计方在某一个时间点评估服务组织的系统描述和控制设计是否适合满足相关 Trust Services Criteria,例如安全性、可用性、保密性、处理完整性和隐私。
读寓言 →
Compliance/Security
精修版SOC 2 Type II
SOC 2 Type II
SOC 2 Type II 是独立审计方在一段期间内评估服务组织控制设计和运行有效性的报告。它比 Type I 更能说明组织是否持续执行控制,常覆盖 3 到 12 个月的证据。
读寓言 →
Compliance/Security
精修版SOC 2
Service Organization Control 2, SOC 2
SOC 2 是面向服务组织的审计报告框架,用于评估安全、可用性、保密性、隐私等控制是否有效。
读寓言 →
Compression
精修版AWQ
Activation-Aware Weight Quantization
AWQ 是一种权重量化方法,会根据激活大小保护关键通道,同时更激进地压缩不重要权重。
读寓言 →
Compression
精修版bitsandbytes
BitsAndBytes
bitsandbytes 是常用于 Hugging Face 生态的低精度加载与量化库,尤其常见于 8-bit 和 4-bit 权重加载。它让较大的模型能在更有限的显存里加载、微调或部署。
读寓言 →
Compression
精修版深度剪枝
Depth Pruning
Depth Pruning 是模型压缩方法之一,通过移除整个 Transformer 层来得到更浅的模型。它关注哪些层对输出贡献较小,并通过评估、校准或再训练尽量保持质量。
读寓言 →
Compression
精修版蒸馏推理模型
Distilled Reasoning Models
Distilled Reasoning Models 是用大型推理模型产生的答案、步骤或推理轨迹来训练较小模型,使小模型获得部分推理能力的做法。它常结合 SFT、知识蒸馏和模型压缩,用于降低推理成本、延迟和部署门槛。
读寓言 →
Compression
精修版GGML
GGML Tensor Library
GGML 是 llama.cpp 早期依赖的 C 语言张量库,支持 CPU 上的 LLM 推理和量化,是 GGUF 生态的前身。
读寓言 →
Compression
精修版GPTQ
GPT Post-Training Quantization
GPTQ 是训练后一次性权重量化方法,利用近似二阶信息降低 3/4 bit 量化带来的误差。
读寓言 →
Compression
精修版GGUF
GPT-Generated Unified Format
GGUF 是 llama.cpp 等本地推理生态常用的量化大模型文件格式,用统一方式打包模型权重和元数据。它让运行时能稳定加载不同量化版本,而不是每个模型都靠临时约定。
读寓言 →
Compression
精修版模型剪枝
Model Pruning
模型剪枝是在训练好的模型中移除不重要的权重、神经元、注意力头或层,以降低模型尺寸、显存占用和推理延迟。
读寓言 →
Compression
精修版训练后量化
Post-Training Quantization, PTQ
训练后量化是在模型训练完成后降低权重或激活精度的压缩方法,速度快但可能损失一定效果。
读寓言 →
Compression
精修版量化感知训练
Quantization-Aware Training, QAT
量化感知训练(QAT)是在训练或微调时模拟低精度量化的影响,让模型提前适应压缩后的计算方式。它不是训练完再压缩,而是训练过程中就让模型感受到低精度约束。
读寓言 →
Compression
精修版稀疏性
Sparsity
稀疏性指模型中许多权重为零,或许多激活在计算时不活跃。剪枝等方法可以制造稀疏结构,从而减少理论上的计算和内存需求。
读寓言 →
Compression
精修版结构化剪枝
Structured Pruning
结构化剪枝会移除整组神经元、注意力头、通道、层或其他规则结构。剪完后的模型结构更整齐,标准硬件和运行时更容易真的跑快。
读寓言 →
Compression
精修版非结构化剪枝
Unstructured Pruning
非结构化剪枝会按重要性把单个权重置零,保留模型原有的大部分结构。它可以制造高度稀疏的模型,并减少存储或内存压力。
读寓言 →
Compression
精修版宽度剪枝
Width Pruning
宽度剪枝会缩小隐藏维度、注意力头或前馈层中间维度,让模型更窄,从而降低参数量和推理成本。
读寓言 →
Concept distinction
精修版思维链与草稿区
Chain-of-Thought vs Scratchpad
Chain-of-Thought 是中间推理过程或推理痕迹;Scratchpad 是更宽的临时工作区,可包含推理、观察结果、工具输出、计划、变量、中间数据和执行备注。
读寓言 →
Content provenance
精修版C2PA
Coalition for Content Provenance and Authenticity
C2PA 是数字内容来源与真实性标准,用加密凭证记录图片、视频、音频等内容的生成和编辑历史。
读寓言 →
Control pattern
精修版人在回路
Human-in-the-Loop
人在回路是在 AI 或 Agent 流程关键节点嵌入人工审核、判断、修正、批准或接管。
读寓言 →
Conversation state object
精修版会话线程
Thread
Thread 是托管 Agent API 中保存会话状态的对象。它把用户、助手和消息放进同一个持续上下文里,让后续 run 能基于既有对话继续执行。
读寓言 →
Coordination pattern
精修版交接
Handoff
Handoff 是任务所有权、上下文和下一步动作从一个 Agent、工作流、系统或人转移给另一个执行者的过程。在企业 Agent 中,交接常发生在多智能体协作、人工升级、客服转专家、自动流程转人工审批等场景。
读寓言 →
Cost / context
精修版Token 预算
Token Budget
Token 预算是分配给任务、请求、用户或工作流的 token 上限。它控制提示词长度、检索上下文、工具输出、模型推理空间和回答长度。
读寓言 →
Cost optimization
精修版预算感知路由
Budget-Aware Routing
预算感知路由是在预算、任务价值、质量要求和延迟之间做选择:不同请求不必都交给最贵模型,也不必一味省钱。系统会根据场景选择模型、工具、检索深度或执行路径。
读寓言 →
Customer support / Contact center AI
精修版智能客服
AI Customer Service, Intelligent Customer Service
智能客服用自然语言理解、知识库检索、对话管理和工单系统集成,自动处理常见咨询并转交复杂问题。
读寓言 →
Data framework for LLM applications
精修版LlamaIndex
LlamaIndex
LlamaIndex 是面向 LLM 应用的数据与检索框架,用于连接私有、结构化、半结构化和非结构化数据源,并提供 loaders、nodes、indexes、retrievers、query engines 等抽象。
读寓言 →
Data ingestion
精修版文档解析
Document Parsing
Document Parsing 是把 PDF、Word、网页、表格、扫描件等文档转换为可索引文本、结构化元素和元数据的过程。它通常包括文本抽取、版面识别、表格和图片处理、页码和来源保留、噪声清理等。
读寓言 →
Data ingestion
精修版OCR
Optical Character Recognition
OCR 从图片、扫描件或照片中识别文字,让发票、合同、表单等非结构化文档进入自动化处理流程。
读寓言 →
Data ingestion integration
精修版数据连接器
Data Connector
Data Connector 将外部文件、数据库、SaaS 内容、网页或 API 加载到 AI 应用的索引和检索流水线中。
读寓言 →
Data strategy / Competitive advantage
精修版数据飞轮
Data Flywheel
Data Flywheel 是产品使用、业务反馈和结果数据持续回流,反过来改进模型、流程、知识库、评测和交付质量的机制。
读寓言 →
Decoding
精修版束搜索
Beam Search
Beam Search 是生成时同时保留多个高概率候选序列的解码策略。它比贪心解码更不容易被单步最高概率带偏,但会增加计算成本,也可能生成过于保守、模式化的文本。
读寓言 →
Decoding
精修版解码
Decoding
Decoding 是把模型对下一个 token 的分数分布转换成实际输出文本的过程。它包含贪心、采样、beam search、top-k、top-p、temperature 等策略。
读寓言 →
Decoding
精修版贪心解码
Greedy Decoding
Greedy Decoding 是每一步都选择概率最高的下一个 token。它速度快、确定性强、成本低,适合固定格式、低创造性、短输出任务。但它容易过早收束,生成单调文本,也可能因为局部最优导致整体答案不佳。
读寓言 →
Decoding
精修版Logits
Logits
Logits 是模型在 softmax 转成概率之前输出的原始分数。解码参数、约束、禁用词、温度缩放和采样策略都作用在 logits 或其转换后的分布上。
读寓言 →
Decoding
精修版采样
Sampling
Sampling 是按模型概率分布随机选择 token 的解码方式。它能提高多样性,减少贪心输出的机械感,但也会带来不可重复和低概率错误。
读寓言 →
Decoding
精修版温度
Temperature
Temperature 是控制生成随机性的参数。较低温度会让概率分布更尖锐,输出更稳定、保守;较高温度会让分布更平,增加多样性,也增加出错概率。
读寓言 →
Decoding
精修版Top-k 采样
Top-k Sampling
Top-k Sampling 会把下一 token 候选限制在概率最高的 k 个之内,再从中采样。它能削掉长尾低质量 token,降低随机采样的失控风险。
读寓言 →
Decoding
精修版Top-p 采样
Top-p Sampling, Nucleus Sampling
Top-p Sampling,也叫 Nucleus Sampling,会选择累计概率达到 p 的最小候选集合,再在其中采样。它比 top-k 更能适应不同分布形状:确定任务候选少,开放任务候选多。
读寓言 →
Deep Learning
精修版反向传播
Backpropagation
Backpropagation 是神经网络训练中计算梯度的核心算法。它把输出误差沿网络层层向后传播,判断每个参数应如何调整。没有反向传播,深层模型很难高效学习。
读寓言 →
Deep Learning
精修版深度学习
Deep Learning
Deep Learning 是使用多层神经网络从数据中学习表示和函数映射的方法。它让模型能够从原始或半结构化数据中逐层提取特征,支撑现代语音、视觉、语言模型、推荐、检索和 Agent 系统。
读寓言 →
Deep Learning
精修版神经网络
Neural Network
Neural Network 是由大量相互连接的人工神经元或计算单元组成的模型,通过权重、激活函数和层级结构从数据中学习输入到输出的映射。它是深度学习、语言模型、视觉模型和推荐系统的基础。
读寓言 →
Deep Learning
精修版表征学习
Representation Learning
Representation Learning 是让模型从数据中学习有用表示的过程。这些表示可以是 embedding、隐藏层特征、跨模态向量或业务实体表示,用来支撑分类、检索、推荐、聚类、预测和 Agent 记忆。
读寓言 →
Deployment
精修版金丝雀发布
Canary Release
金丝雀发布是在全面上线前,先让少量用户、租户、地区或流量使用新版本,用真实指标判断是否继续扩大。它的核心是限制影响范围,同时尽早发现生产环境里的问题。
读寓言 →
Deployment
精修版灰度发布
Gradual Rollout
灰度发布是按用户、租户、地区、流量比例或用例逐步扩大变更范围。它比一次金丝雀更完整,包含阶段计划、准入条件、观察窗口、暂停条件、沟通和例外处理。
读寓言 →
Deployment / Enterprise procurement
精修版私有化部署
Private Deployment, On-premises Deployment
私有化部署是把 AI 系统放在客户自有或专属环境中运行,用于满足数据安全、合规和内网访问要求。
读寓言 →
Deployment / Infrastructure
精修版本地化部署
Local Deployment, On-premises Deployment
本地化部署把软件、模型或系统放在客户机房、私有云、内网或受控环境中运行。
读寓言 →
Deployment / infrastructure
精修版容器
Container
容器把应用及其运行依赖打包成可移植、隔离的单元,让部署、扩缩容和环境一致性更容易管理。
读寓言 →
Deployment / infrastructure
精修版Kubernetes
Kubernetes, K8s
Kubernetes(K8s)是容器编排系统,用来安排容器运行、扩缩容、服务发现、滚动更新、健康检查和故障自愈。简单说,它负责让一组容器化服务按预期持续运行。
读寓言 →
Deployment / release engineering
精修版蓝绿部署
Blue-Green Deployment
蓝绿部署会保留两套接近生产环境的系统:一套正在承接真实流量,另一套提前部署新版本。新版本验证通过后,把流量切过去;如果出问题,再切回旧环境完成回滚。
读寓言 →
Deployment / release engineering
精修版金丝雀发布
Canary Deployment
金丝雀发布先把新版本放给少量流量或用户验证,确认稳定后再逐步扩大范围,以降低发布风险。
读寓言 →
DevOps / infrastructure
精修版基础设施即代码
Infrastructure as Code, IaC
基础设施即代码(IaC)用声明式配置或脚本管理服务器、网络、权限、数据库和云资源,而不是靠人工在控制台逐项点击。
读寓言 →
DevOps / operations
精修版GitOps
GitOps
它把 Git 仓库作为系统期望状态的唯一可信来源,基础设施和应用配置用声明式文件描述,自动化控制器持续把实际环境同步到 Git 中描述的状态。
读寓言 →
DevOps / release engineering
精修版持续集成与持续交付
CI/CD, Continuous Integration / Continuous Delivery
CI/CD 把代码集成、测试、打包、部署、发布和回滚做成自动化流水线,让软件变更能更频繁、更可靠地交付。它把发布质量从临时人工检查,变成可重复执行的流程。
读寓言 →
Dialogue / workflow
精修版插槽填充
Slot Filling
插槽填充是在对话或表单任务中识别并补齐关键字段,例如身份、时间、地点、产品、数量和联系方式。
读寓言 →
Diffusion
精修版噪声预测器/UNet
UNet / Noise Predictor
UNet / Noise Predictor 是许多扩散模型中的去噪网络骨干,用来预测当前样本中的噪声或去噪方向。UNet 通过编码器下采样获得全局上下文,再通过解码器上采样恢复细节,并用 skip connection 保留局部信息。
读寓言 →
Distributed inference
精修版流水线并行
Pipeline Parallelism
流水线并行把模型层拆到多张设备上,让微批次像流水线一样前进,以减少设备空闲时间。
读寓言 →
Distributed inference
精修版张量并行
Tensor Parallelism
张量并行是把单个权重矩阵或张量运算切分到多块 GPU 上。每块设备计算同一层的一部分,再通过通信把结果合并。
读寓言 →
Distributed training
精修版数据并行
Data Parallelism
Data Parallelism 是分布式训练中常见的方法:在多张 GPU 或多台机器上复制同一个模型,每个副本处理不同数据 batch,随后同步梯度或参数更新。它能提高训练吞吐,是大模型预训练和微调的基础并行策略之一。
读寓言 →
Distributed training
精修版FSDP
Fully Sharded Data Parallelism
Fully Sharded Data Parallelism, FSDP 是一种分布式训练策略,将模型参数、梯度和优化器状态在多个设备之间分片,而不是让每个数据并行副本完整持有所有状态。
读寓言 →
Distributed training
精修版ZeRO
Zero Redundancy Optimizer
Zero Redundancy Optimizer, ZeRO 是一种减少数据并行训练中内存冗余的优化策略。它通过分片优化器状态、梯度和模型参数,避免每个 GPU 都完整保存所有训练状态,从而显著降低显存占用。
读寓言 →
Document AI
精修版版面分析
Layout Analysis
Layout Analysis 是识别文档页面结构的过程,包括标题、段落、表格、图片、列表、页眉页脚和阅读顺序。它通常接在 OCR 或文本抽取之后,是文档解析、表格抽取和 RAG 切分的重要步骤。
读寓言 →
Document AI
精修版表格抽取
Table Extraction
Table Extraction 是从 PDF、图片、扫描件或文档中识别表格结构与单元格内容的过程。它不仅抽取文字,还要恢复表格区域、行列、表头、合并单元格、跨页关系和坐标来源。
读寓言 →
Documentation
精修版数据集说明书
Datasheet for Datasets
数据集说明书结构化记录数据集的动机、组成、采集、预处理、用途、限制、风险和维护方式。
读寓言 →
Documentation
精修版模型卡
Model Card
Model Card 是描述模型用途、训练数据、评测结果、限制、风险、适用场景和伦理考虑的结构化文档。企业采购、部署或微调模型时,model card 帮助产品、工程、法务和风险团队理解模型边界,并为审计、供应商评估和上线审批提供证据。
读寓言 →
Documentation
精修版系统卡
System Card
系统卡描述已部署 AI 系统的能力、组成、风险、缓解措施、评测结果、适用边界和监督机制。
读寓言 →
Embedding database
精修版Chroma
Chroma
Chroma 是一个开源的轻量级嵌入数据库,专为本地开发和快速原型设计。它用几行代码就能在本地存储嵌入向量、文档和元数据,并提供相似度搜索。
读寓言 →
Embeddings
精修版嵌入
Embedding
嵌入(Embedding)是把文本、图片、音频、代码、用户、商品或其他对象转换成一组数字向量。这个向量不是给人读的标签,而是给机器计算的语义坐标。
读寓言 →
Embeddings
精修版语义相似度
Semantic Similarity
Semantic Similarity 衡量两段文本、问题、任务或对象在意义上的接近程度,通常通过 embedding 向量距离或相似度计算实现。它是语义搜索、去重、聚类、推荐、RAG 检索和工单路由的基础。
读寓言 →
Embeddings
精修版向量数据库
Vector Database
向量数据库(Vector Database)是专门存储 embedding 向量并按相似度检索近邻的数据系统。它常用于语义搜索、推荐、去重和 RAG。
读寓言 →
Embeddings
精修版词嵌入
Word Embedding
Word Embedding 是把词或 token 表示为向量的技术,使模型能通过空间位置捕捉词语之间的统计关系和语义关系。相近词在向量空间中通常距离更近,关系模式也能被模型利用。
读寓言 →
Engineering organization / infrastructure
精修版平台工程
Platform Engineering
平台工程通过内部开发者平台、自助能力、标准模板和共享基础设施,提升工程交付效率和治理一致性。
读寓言 →
Engineering organization / platform
精修版开发者体验
Developer Experience, DevEx
Developer Experience, DevEx 衡量开发者从理解、开发、测试、部署到排障的效率、顺畅度和认知负担。
读寓言 →
Enterprise AI application / Retrieval
精修版知识库问答
Knowledge Base Q&A, KBQA, RAG Q&A
知识库问答把企业文档、制度、产品资料和业务知识接入检索与生成系统,提供带依据的自然语言答案。
读寓言 →
Enterprise AI orchestration SDK
精修版Semantic Kernel
Semantic Kernel
Semantic Kernel 是微软的开源 AI 编排 SDK,定位是在企业应用中集成大语言模型、插件、规划器、记忆和原生应用代码。
读寓言 →
Enterprise collaboration / Solution design
精修版共创
Co-creation, Joint Solution Development
共创是供应商与客户围绕真实业务问题共同定义场景、数据、流程和验收标准,再联合打磨解决方案。
读寓言 →
Enterprise implementation / Adoption
精修版试点
Pilot, Pilot Program
试点是在真实业务环境中小范围运行方案,用来验证采用意愿、流程适配、运营成本、稳定性和复制条件。
读寓言 →
Evaluation
精修版评测基准
Benchmark
评测基准是用于比较模型、Agent 或系统能力的一组标准化任务、数据集、指标或测试套件。好的 benchmark 不只是排行榜题目,而要对应真实业务场景、失败边界和验收标准。
读寓言 →
Evaluation
精修版基准污染
Benchmark Contamination
基准污染是指评测题目、答案或高度相似样例进入了训练数据、提示示例、调参过程或模型选择流程,导致模型在 benchmark 上表现虚高。对企业 Agent 来说,污染会让发布评测失真:系统看似会处理客户问题,实际只是见过测试样例。
读寓言 →
Evaluation
精修版数据泄漏
Data Leakage
数据泄漏是指训练、调参、模型选择或评测过程中不该出现的信息提前进入系统,使性能估计失真。它不只包括测试题答案泄漏,也包括目标标签、未来信息、人工批注、客户结果、相似样例或生产反馈不当回流。
读寓言 →
Evaluation
精修版分布偏移
Distribution Shift
分布偏移是指模型训练、验证或历史评测所面对的数据分布,与部署后的真实输入分布不一致。它会让离线分数很好、线上效果变差。企业 Agent 常见偏移包括客户群变化、行业语言变化、任务类型变化、工具返回格式变化、渠道变化和政策变化。
读寓言 →
Evaluation
精修版困惑度
Perplexity
困惑度是语言模型评估指标,用来衡量模型预测一段文本序列的难易程度。困惑度越低,通常表示模型对该文本分布的预测越好。它适合评估语言建模和同类语料上的拟合程度,但不能直接代表 Agent 任务完成率、事实正确性、安全性或工具调用能力。
读寓言 →
Evaluation
精修版步骤成功率
Step Success Rate
步骤成功率衡量多步骤任务中每个中间步骤执行正确的比例。对企业 Agent,它比单纯最终成功率更能定位质量问题:计划是否合理、检索是否命中、工具是否选对、参数是否正确、权限是否通过、异常是否处理。
读寓言 →
Evaluation
精修版工具调用准确率
Tool Call Accuracy
工具调用准确率衡量 Agent 是否选对工具、填对参数、合规调用,并合理使用工具返回结果。
读寓言 →
Evaluation
精修版轨迹评估
Trajectory Evaluation
轨迹评估是对 Agent 执行过程中的计划、推理步骤、工具调用、观察结果、重试、异常处理和最终输出进行整体评价。它适合多步骤任务,因为最终答案可能掩盖过程中的越权、侥幸、错误工具调用或不可复现路径。
读寓言 →
Evaluation infrastructure
精修版LLM 评测平台
LLM Evaluation Platform
LLM 评测平台管理数据集、测试用例、评分函数、人工标注、模型裁判、回归检查、实验对比和发布门禁。它把评测从零散脚本变成持续质量系统。
读寓言 →
FinOps / operations
精修版成本归因
Cost Attribution
成本归因把模型调用、云资源、工具、人工复核和运营成本分摊到客户、功能、工作流或任务结果上。
读寓言 →
Fine-Tuning
精修版微调
Fine-Tuning
Fine-Tuning 是在预训练模型基础上,用特定领域、任务或行为数据继续训练模型,使其更适合目标场景。它可以改善语气、格式、领域知识使用、工具调用习惯和任务完成稳定性,但也带来数据治理、过拟合、评测、回滚和成本问题。
读寓言 →
Fine-Tuning
精修版指令微调
Instruction Tuning
Instruction Tuning 是用大量“指令-响应”样例训练模型,使模型更会理解人类任务要求并按指令输出。它让基础模型从单纯预测文本,转向更适合问答、摘要、改写、分类、格式化输出、拒绝不当请求和工具前置判断等交互场景。
读寓言 →
Fine-Tuning
低秩适配
Low-Rank Adaptation, LoRA
LoRA 是参数高效微调方法,在冻结原模型权重的同时注入小型低秩矩阵,用较少参数完成适配。
读寓言 →
Fine-Tuning
精修版参数高效微调
Parameter-Efficient Fine-Tuning, PEFT
参数高效微调只训练少量新增或选定参数来适配基础模型,常见方法包括 LoRA、Adapter 和 Prefix Tuning。
读寓言 →
Fine-Tuning
精修版监督微调
Supervised Fine-Tuning, SFT
监督微调用带目标输出的标注样例训练模型,让模型学习在给定输入下生成期望响应。
读寓言 →
Fine-tuning
精修版全量微调
Full Fine-Tuning
全量微调会更新模型全部或大部分参数,适配能力强但训练成本、显存需求和灾难性遗忘风险更高。
读寓言 →
Fine-tuning
精修版指令数据
Instruction Data
Instruction Data 是用于训练或评测模型指令遵循能力的数据,通常包含用户指令、上下文、期望响应、拒绝样例、格式要求和有时的工具调用轨迹。
读寓言 →
Fine-tuning
精修版分层学习率
Layer-wise Learning Rate
Layer-wise Learning Rate 是在微调时给不同模型层设置不同学习率,常见做法是底层较小、高层或任务相关层较大。它有助于保留通用表示,同时让模型适应新任务,降低灾难性遗忘和过拟合风险。
读寓言 →
Fine-tuning
精修版拒绝采样
Rejection Sampling
Rejection Sampling 在 AI 训练中常指生成多个候选输出,并根据质量标准只保留合格样本,用于构造更高质量的微调或偏好数据。它能提升数据质量,但依赖筛选器、奖励模型或人工标注的可靠性。
读寓言 →
Foundations
精修版人工智能
Artificial Intelligence, AI
Artificial Intelligence 是构建能执行感知、语言、推理、规划、决策等智能任务系统的广义领域。企业语境里,AI 不应被理解成一个单一模型,而是一组能力、数据、流程、控制和商业交付方式的组合。
读寓言 →
Foundations
精修版模型
Model
模型是一个从数据或经验中学到的简化系统,用来把输入映射到输出,例如预测、分类、生成或决策。
读寓言 →
Generative AI
精修版扩散模型
Diffusion Model
Diffusion Model 是一种生成模型,训练时把真实数据逐步加噪,再学习反向去噪过程;生成时从随机噪声开始,经过多步去噪得到图像、音频、视频或其他样本。它的强项是高质量生成和可控编辑,代价是推理步骤多、计算较重。
读寓言 →
Generative modeling
精修版扩散变换器
Diffusion Transformer, DiT
DiT 将 Transformer 用作扩散模型的生成骨干,通常把图像或潜空间切成 token 后进行去噪建模。
读寓言 →
Generative modeling
精修版潜在扩散模型
Latent Diffusion Model, LDM
Latent Diffusion Model, LDM 是在压缩后的潜在空间中执行扩散去噪,而不是直接在原始像素空间中生成。通常先用自编码器把图像编码到低维 latent,再在 latent 上扩散,最后解码回图像。
读寓言 →
Go-to-market / Implementation
精修版场景化落地
Scenario-based Implementation, Use-case Implementation
场景化落地从具体业务角色、输入输出、系统集成和验收指标出发,把 AI 能力转成可交付流程。
读寓言 →
Governance
精修版AI 影响评估
AI Impact Assessment, AIIA
AI 影响评估是在系统部署前和运行中,评估其对个人、业务、法律、隐私、安全和公平性的影响。
读寓言 →
Governance
精修版AI 使用场景清单
AI Use Case Inventory
AI Use Case Inventory 是组织维护的 AI 使用场景清单,记录用例名称、业务目的、系统/模型、数据输入、供应商、负责人、风险分类、运行状态、审查记录和退役计划。
读寓言 →
Governance
精修版数据血缘
Data Lineage
Data Lineage 是跟踪数据从来源、加工、转换、合并到最终使用位置的全过程关系。
读寓言 →
Governance
精修版治理、风险与合规
Governance, Risk, and Compliance, GRC
GRC 将治理、风险、控制、政策、审计和合规义务统一管理,是企业引入 Agent 时的基础控制框架。
读寓言 →
Governance
精修版策略引擎
Policy Engine
Policy Engine 是在运行时评估规则并决定允许、拒绝、限制或升级某个动作的组件。它通常结合主体、资源、动作、上下文、风险等级和审批状态进行判断。
读寓言 →
Governance
精修版来源证明
Provenance
Provenance 是关于数据、内容或输出的来源、作者、授权和变换历史的证据。企业 Agent 会读取文档、检索知识库、调用外部 API、引用客户数据并生成新内容,因此必须知道材料从哪里来、是否可信、是否有使用权、经过哪些处理。
读寓言 →
Governance
精修版影子 AI
Shadow AI
Shadow AI 是员工或团队在未获正式批准、安全审查、采购可见性或治理控制的情况下使用 AI 工具、模型或 Agent。它可能带来数据泄露、供应商风险、合规违规、不可审计决策和重复采购。
读寓言 →
Governance
精修版可追溯性
Traceability
Traceability 是重建系统为什么产生某个输出或采取某个动作的能力。企业 Agent 中,它要求把用户请求、上下文、检索来源、模型选择、提示词版本、工具调用、权限判断、人工审批、外部写入和最终结果关联起来。
读寓言 →
Governance
精修版透明度
Transparency
透明度要求清楚披露 AI 系统的用途、能力、限制、数据使用、决策角色、责任方和用户选择。
读寓言 →
Governance
精修版可信 AI
Trustworthy AI
可信 AI 指系统在特定用途下满足合规、伦理、公平、隐私、安全、鲁棒性、透明、监督和问责要求。
读寓言 →
Governance and control
精修版智能体策略
Agent Policy
Agent Policy 定义 Agent 在数据、工具、用户、外部动作、预算、沟通和升级方面允许、禁止或必须执行的规则。它应能被运行时、策略引擎和审计机制使用,而不只是自然语言原则。
读寓言 →
Governance/Compliance
精修版AI 披露
AI Disclosure
AI 披露是在合适场景告知用户、员工或受影响方,AI 参与了内容生成、交互、建议或决策。
读寓言 →
Governance/Compliance
精修版控制所有人
Control Owner
Control Owner 是对某项控制的设计、运行、证据、测试和改进负有责任的人或职能。企业 Agent 治理中,控制可能包括权限审批、敏感数据过滤、人工复核、日志留存、模型变更审批、供应商审查和异常升级。
读寓言 →
Governance/Operations
精修版人工监督
Human Oversight
Human Oversight 是通过人工审查、批准、监控、干预、覆盖、暂停或升级机制,防止或缓解 AI 系统造成不当后果。有效监督不是所有动作都手工审批,而是根据风险、影响、置信度和异常信号,把人放在关键决策点,并赋予足够信息和权限。
读寓言 →
Governance/Risk
精修版偏见
Bias
Bias 是数据、模型、设计、目标函数或部署流程中的系统性偏斜,可能导致不准确、不公平或有害结果。企业 Agent 的偏见可能来自历史数据、标签偏差、采样不足、反馈循环、代理变量或业务规则。
读寓言 →
Governance/Risk
精修版可解释性
Explainability
Explainability 是 AI 系统能够以适合使用场景的方式说明输出或决策的关键原因、证据、因素和限制。对企业 Agent 来说,可解释性帮助业务人员判断是否采纳建议,帮助用户申诉,帮助审计和风险团队追踪问题。
读寓言 →
Governance/Risk
精修版公平性
Fairness
Fairness 指 AI 系统避免对受保护或业务相关群体产生无正当理由的不利待遇或结果。它需要定义相关群体、测量差异影响、分析原因、设置公平性指标和缓解措施。
读寓言 →
Governance/Risk
精修版三道防线
Three Lines of Defense
Three Lines of Defense 是一种治理模型,将责任分为三类:第一道防线由业务团队拥有并管理风险;第二道防线由风险、合规、安全等职能制定框架、监督和挑战;第三道防线由内部审计等独立职能提供保证。
读寓言 →
Governance/Safety
精修版内容过滤
Content Filtering
Content Filtering 是对用户输入、模型输出和交互上下文进行检测、分类与处理,以拦截违法、有害、欺诈、仇恨、暴力、自残、隐私泄露或政策违规内容。
读寓言 →
Governance/Security
精修版策略即代码
Policy as Code
策略即代码用机器可执行代码表达安全、合规和业务治理规则,并通过版本控制、测试和审计管理规则。
读寓言 →
IT operations / automation
精修版人工智能运维
AIOps
AIOps 更准确地说是智能运维:用机器学习和自动化分析日志、指标、链路追踪、告警和事件记录,帮助团队发现异常、压缩噪音、定位根因并推动响应。这里不是泛指维护 AI 系统,而是用 AI 方法提升运维判断和处理效率。
读寓言 →
Implementation / Project governance
精修版交付验收
Delivery Acceptance, Acceptance Testing, Project Acceptance
交付验收是客户或项目方根据事先约定的标准,确认交付物是否满足合同、功能、性能、安全、业务效果和可运行要求的过程。
读寓言 →
Inference
精修版自回归解码
Autoregressive Decoding / Decode Phase
自回归解码,也就是 Decode Phase,是大模型处理完输入之后逐个生成 token 的阶段。每生成一个新 token,都要依赖前面已经生成的内容,所以它天然有顺序依赖,不能像批量读输入那样完全并行。
读寓言 →
Inference
精修版最佳-of-N 采样
Best-of-N Sampling
Best-of-N 采样,也可以理解为“多候选择优”:系统一次生成 N 个候选答案,再用评分器、规则、验证器或人工标准选出最好的一个。它不是让模型只生成一次,而是在请求时多花计算来换更高质量。
读寓言 →
Inference
精修版上下文剪枝
Context Pruning / Prompt Compression
上下文剪枝会删除或压缩低相关内容,缩短提示长度,减少 KV 缓存占用并降低预填充延迟。
读寓言 →
Inference
精修版动态批处理
Dynamic Batching / In-flight Batching
动态批处理会在已有批次运行时加入新请求,而不是等整批结束,从而提升推理服务吞吐和 GPU 利用率。
读寓言 →
Inference
精修版早出
Early Exiting
提前退出,也可叫早退推理,是让模型在置信度足够高时停在中间层,不必每次都跑完整个模型。简单样本少花计算,难样本仍走完整路径。
读寓言 →
Inference
精修版Flash Attention
FlashAttention
FlashAttention 是面向 IO 优化的注意力算法,通过分块和算子融合减少显存读写,降低长序列注意力开销。
读寓言 →
Inference
精修版推理
Inference
这里的 inference 指模型推理或模型运行:把训练好的模型用于新的输入,并生成输出。它不是人类意义上的逻辑推理,而是模型在当前请求上执行计算。
读寓言 →
Inference
精修版缓存卸载
KV Cache Offloading
KV 缓存卸载是把不那么活跃的 KV 缓存块从 GPU 显存搬到 CPU 内存或 SSD。这样系统可以支持更长上下文或更多并发请求,而不完全受 GPU 显存限制。
读寓言 →
Inference
精修版量化 KV 缓存
KV Cache Quantization
KV 缓存量化用更低精度保存推理中的键值缓存,在有限显存下支持更长上下文或更高并发。
读寓言 →
Inference
精修版算子融合
Kernel Fusion
算子融合把多个 GPU 操作合并为一个内核,减少内存往返和启动开销,是高性能推理运行时的常见优化。
读寓言 →
Inference
精修版延迟
Latency
延迟是模型或 Agent 系统从收到请求到返回响应、或生成 token 所花的时间。它可能包括排队、路由、检索、工具调用、预填充、首 token、解码和后处理。
读寓言 →
Inference
精修版回顾解码
Lookahead Decoding
前瞻解码是加速自回归生成的一类方法:它会并行构造候选的 n-gram 序列,再由主模型并行验证候选。它和投机解码相关,但不依赖单独的草稿模型。
读寓言 →
Inference
精修版Medusa
Medusa
Medusa 是一种推测解码方法:在基础模型上加多个解码头,让这些头并行预测未来 token,再由基础模型验证哪些可以接受。
读寓言 →
Inference
精修版模型服务
Model Serving
模型服务是把模型放到生产环境里,通过 API 稳定处理推理请求的运行层。它不只是“模型能跑”,还包括端点、批处理、调度、自动扩缩容、GPU 分配、缓存、流式输出、鉴权、监控、限流、回退和 SLA 管理。
读寓言 →
Inference
精修版分页注意力
Paged Attention
分页注意力把 KV 缓存存在固定大小、可不连续的页或块里,而不是要求每条序列占用一大段连续显存。这样可以减少显存碎片,提高 GPU 内存利用率。
读寓言 →
Inference
精修版预填充
Prefill Phase
预填充阶段是推理刚开始时,模型先并行处理全部输入 token,并建立 KV 缓存的阶段。它发生在逐 token 解码之前,通常会显著影响首 token 时间。
读寓言 →
Inference
精修版前缀缓存
Prefix Caching
前缀缓存复用相同提示词前缀已经计算好的 KV 缓存,比如系统提示、共享策略文本、产品文档或长参考上下文。它缓存的是共同上下文的计算结果,不是直接缓存最终答案。
读寓言 →
Inference
精修版量化
Quantization
量化用低精度数值表示模型权重或激活,以减少显存、存储和计算成本,但需要控制精度损失。
读寓言 →
Inference
精修版推测解码
Speculative Decoding
推测解码先用小模型生成候选 token,再由大模型并行验证,可在基本不降质量的情况下加速生成。
读寓言 →
Inference
精修版推测编辑
Speculative Editing
推测编辑是把推测解码的思路用于编辑任务:由更快的助手先提出局部修改或延续,再由更强模型验证、接受或修正。
读寓言 →
Inference
精修版推测前缀树
Speculative Prefix Tree
推测前缀树把多个候选生成路径组织成树结构,并行探索和验证,用于提高推测解码的接受率。
读寓言 →
Inference
精修版投机采样
Speculative Sampling
投机采样,也常被看作投机解码的一种表述,是先由草稿过程采样候选 token,再由目标模型接受或拒绝。最终输出仍应保持目标模型本来的分布。
读寓言 →
Inference
精修版测试时计算
Test-Time Compute / Inference-Time Scaling
测试时计算,也更直白地说是推理时扩展计算,是在模型运行时额外花计算来提升输出质量。这里的“测试时”不是软件测试阶段,而是模型面对新输入生成答案的阶段。
读寓言 →
Inference
精修版吞吐量
Throughput
吞吐量衡量模型服务单位时间内处理的请求或 token 数,是评估推理系统容量和成本效率的核心指标。
读寓言 →
Inference
精修版树搜索
Tree Search
它把一个决策问题展开成树状结构:当前状态是根节点,每个动作产生子节点,再继续展开未来可能状态,最后通过评估选择更好的路径。
读寓言 →
Inference optimization
精修版连续批处理
Continuous Batching
连续批处理是在模型运行过程中,动态把多个请求的 token 放在一起调度。某些序列结束后,新请求可以进入仍在运行的 batch,而不用等整批请求全部结束。
读寓言 →
Inference optimization
精修版提示缓存
Prompt Caching
提示缓存复用已处理的系统提示、文档前缀或共享上下文,减少重复预填充计算,从而降低延迟和成本。
读寓言 →
Infrastructure
精修版运行时
Runtime
运行时是执行 Agent 的环境,负责工具调用、权限、记忆、状态和生命周期控制,决定系统能做什么和如何收束。
读寓言 →
Knowledge access
精修版检索增强生成
Retrieval-Augmented Generation (RAG)
检索增强生成(Retrieval-Augmented Generation, RAG)是在生成回答前,先从外部知识库、文档库、数据库或搜索系统中检索相关材料,再把这些材料作为上下文交给模型生成答案。
读寓言 →
Knowledge representation
精修版知识图谱
Knowledge Graph
知识图谱用实体、关系和属性结构化表示知识,适合实体查询、关系分析、合规溯源和推荐。
读寓言 →
Knowledge representation
精修版本体
Ontology
Ontology 是对一个领域中概念、类别、属性、关系和约束的结构化定义。它帮助系统统一“什么是什么、彼此如何关联、哪些推理是允许的”。在企业 Agent 和知识图谱中,本体用于减少命名混乱、支持关系推理、权限边界、数据集成和可解释检索。
读寓言 →
Knowledge representation
精修版三元组
Triple
三元组通常用“主语-谓语-宾语”的结构表示一条事实或关系,例如“赵掌柜-经营-林记茶庄”。
读寓言 →
Knowledge-augmented generation
精修版图增强检索生成
Graph RAG
图增强检索生成(Graph RAG)把知识图谱、实体关系、图遍历或社区摘要引入 RAG。传统 chunk-level vector search 擅长找相似文本,但对多跳关系、实体关联、供应链/组织/合同链路这类问题容易漏掉结构。
读寓言 →
LLM
精修版上下文窗口
Context Window
Context Window 是模型在一次请求中能处理的输入和输出总量,通常以 token 衡量。它决定了 prompt、检索材料、历史消息、工具结果和生成答案能共同占用的空间。
读寓言 →
LLM
精修版语言模型
Language Model
语言模型根据上下文对语言序列建模,常见能力包括预测下一个 token、生成文本、理解意图、改写、摘要和问答。
读寓言 →
LLM
精修版大语言模型
Large Language Model, LLM
大语言模型是在大规模语料和参数规模上训练的语言模型,具备生成、理解、推理表达、代码和泛化能力。
读寓言 →
LLM API gateway and SDK
精修版LiteLLM
LiteLLM
LiteLLM 提供跨多家模型供应商的 OpenAI 风格统一接口、SDK 和代理层。开发者可以用更一致的方式接入不同模型,而不必为每家供应商写一套完全不同的调用逻辑。
读寓言 →
LLM Agents
精修版智能体
Agent
智能体是在给定目标下感知上下文、规划步骤、调用工具、执行动作并根据结果继续推进的 AI 工作单元。
读寓言 →
LLM Agents
精修版记忆
Memory
Memory 是 AI 系统保存和重新使用信息的能力,使 Agent 能跨步骤、跨会话或跨用户交互保持连续性。企业 Agent 的记忆通常包含工作记忆、长期记忆、情景记忆和语义记忆。
读寓言 →
LLM Agents
精修版规划
Planning
规划是 AI 系统把目标分解为步骤、选择动作并随条件变化调整路线的过程。它比单次推理更贴近真实交付:需要处理目标、约束、资源、依赖、风险、审批和失败分支。
读寓言 →
LLM Agents
工具调用
Tool Use, Function Calling
工具调用让模型请求外部 API 或函数来检索信息、计算结果或执行动作,是 Agent 从对话走向办事的关键能力。
读寓言 →
LLM Applications
检索增强生成
Retrieval-Augmented Generation, RAG
RAG 会先检索外部知识,再把相关内容作为上下文交给模型生成答案,用于降低幻觉并接入私有知识。
读寓言 →
LLM Behavior
精修版幻觉
Hallucination
幻觉 Hallucination 是模型生成听起来合理但实际上错误、无证据支持或凭空编造的信息。它常见于模型试图补全缺失事实、过度自信回答、混淆相似信息或缺少可靠上下文时。
读寓言 →
LLM Interaction
精修版少样本提示
Few-Shot Prompting
Few-Shot Prompting 是在 prompt 中提供少量输入-输出示例,让模型从示例中学习任务格式、判断尺度和输出风格。它不改变模型权重,而是在当前上下文中引导模型行为。
读寓言 →
LLM Interaction
精修版上下文学习
In-Context Learning
In-Context Learning 是模型根据 prompt 中的指令、示例和上下文临时调整行为的能力,不更新模型权重。Few-shot、格式示例、反例和任务说明都利用了这种能力。
读寓言 →
LLM Interaction
精修版提示词
Prompt
Prompt 是给语言模型的输入指令或上下文,可以包含任务、问题、背景、示例、约束和期望输出。它是用户或应用把意图传给模型的主要接口。
读寓言 →
LLM Interaction
精修版提示工程
Prompt Engineering
Prompt Engineering 是设计提示词来引导模型行为、提高任务表现的实践,不改变模型权重。它包括明确目标、提供上下文、设定约束、给出示例、规定输出格式和迭代评测。
读寓言 →
LLM Interaction
精修版系统提示词
System Prompt, System Message
System Prompt 或 System Message 是对模型行为具有高优先级的指令,用来定义角色、任务边界、政策约束、安全规则和交互方式。它位于指令层级的上层,通常应高于用户消息。
读寓言 →
LLM Interaction
精修版零样本提示
Zero-Shot Prompting
Zero-Shot Prompting 是不给示例、只通过任务指令让模型完成工作的提示方式。它适合模型已具备通用能力、任务标准明确、风险较低或不值得占用上下文放示例的场景。
读寓言 →
LLM Reasoning
精修版思维链
Chain-of-Thought, CoT
Chain-of-Thought, CoT 是让模型使用中间推理步骤来解决复杂任务的提示或训练模式。它能提升数学、逻辑、规划等多步任务的表现,但并不保证每一步真实或正确,也不一定适合直接暴露给最终用户。
读寓言 →
LLM application framework
精修版LangChain
LangChain
LangChain 是构建 LLM 应用的框架,用可组合组件连接提示、模型、检索器、工具、链和 Agent 工作流。
读寓言 →
LLM evaluation and observability library
精修版TruLens
TruLens
TruLens 是 LLM 应用评测与可观测库,可为 RAG 和 Agent 添加反馈函数,衡量相关性、可信度和依据性。
读寓言 →
LLM inference
精修版解码阶段
Decode Phase
解码阶段是预填充之后的自回归生成阶段:模型一次生成一个 token,每一步读取 KV 缓存,计算下一个 token,把新的缓存追加进去,并可能把 token 流式返回给用户。
读寓言 →
LLM inference
精修版预填充
Prefill
Prefill 是 LLM 推理中处理输入 prompt/context 并构建初始 KV cache 的阶段。它发生在模型生成第一个 token 之前,计算量通常随输入长度增长。
读寓言 →
LLM inference optimization
精修版分页注意力
PagedAttention
PagedAttention 用分页方式管理 KV 缓存块,减少内存碎片并提升 LLM 服务在高并发场景下的吞吐。
读寓言 →
LLM inference server
精修版文本生成推理
Text Generation Inference, TGI
TGI 是 Hugging Face 的文本生成推理服务器,支持 LLM 部署、批处理、流式输出和生产服务接口。
读寓言 →
LLM infrastructure optimization
精修版缓存
Caching
缓存复用已有响应、embedding、检索结果、工具结果或提示前缀,用于降低延迟、成本和重复调用。
读寓言 →
LLM observability and evaluation platform
精修版LangSmith
LangSmith
LangSmith 是 LangChain 生态中的 LLM 应用可观测、调试、评测、监控和测试平台。它帮助团队记录 traces、管理 datasets、运行 evals、比较实验、调试 prompts 和观察 Agent 工作流。
读寓言 →
LLM observability and gateway tool
精修版Helicone
Helicone
Helicone 是面向 LLM API 的可观测平台,常以代理方式记录日志、延迟、成本、缓存命中和用户反馈。
读寓言 →
LLM operations
精修版成本跟踪
Cost Tracking
成本跟踪衡量 token usage、provider charges、缓存节省、重试成本、工具调用成本以及按用户、客户、团队或工作流分摊的花费。
读寓言 →
LLM orchestration abstraction
精修版LangChain 表达式语言
LangChain Expression Language, LCEL
LCEL 是 LangChain 的声明式组合层,用于把提示、模型、解析器、检索器和函数连接成可运行管线。
读寓言 →
LLM program interface
精修版签名
Signature
这里的 Signature 指 DSPy 里的任务签名,不是加密签名。它用来声明一个 LLM 任务的输入字段、输出字段和语义说明。
读寓言 →
LLM programming and optimization framework
精修版DSPy
DSPy
DSPy 是一个用于编程和优化 LLM 系统的框架。
读寓言 →
LLM runtime / optimization
精修版KV 缓存
KV Cache, Key-Value Cache
KV 缓存保存 Transformer 已计算过的 key 和 value,让自回归生成无需反复重算历史 token。
读寓言 →
LLM runtime / user experience
精修版首 Token 时间
Time to First Token, TTFT
首 Token 时间(TTFT)衡量的是流式 LLM 响应中,从请求发出到收到第一个真实生成 token 的时间。它决定系统看起来多快开始回应。
读寓言 →
LLMOps / application platform
精修版提示词管理
Prompt Management
提示词管理是对提示词模板、变量、版本、实验、审批和效果追踪进行系统化管理的实践。在 LLM 应用里,prompt 决定任务边界、语气、工具调用、输出格式和安全约束。
读寓言 →
LLMOps / quality
精修版评测
Evaluation, Evals
评测是用人工、规则或模型裁判衡量 AI 系统在任务质量、安全性、稳定性和成本上的表现。企业 Agent 的 evals 应覆盖真实任务、边界场景、回归样例、安全红线、延迟和费用,并与发布流程绑定。
读寓言 →
LLMOps / quality
精修版黄金数据集
Golden Dataset, Golden Set
黄金数据集是一组经过人工确认、可重复使用的高质量样例,用于回归评测和模型或提示词对比。对 LLM 应用,它通常包含真实任务输入、期望输出、评分标准、边界场景和安全禁区。
读寓言 →
Local model packaging
精修版模型文件配置
Modelfile
Modelfile 是 Ollama 等本地模型工具的配置文件,用来定义基础模型、参数、系统提示和定制构建方式。
读寓言 →
Local model runtime
精修版Ollama
Ollama
Ollama 是本地模型运行和管理工具,可拉取、打包、运行并服务 LLM,适合个人机器或私有环境部署。
读寓言 →
MLOps / data platform
精修版特征库
Feature Store
特征库是集中生产、存储、复用和服务机器学习特征的数据平台组件。它把训练时使用的特征和线上推理时使用的特征统一管理,减少 training-serving skew,并让特征有版本、血缘、质量检查和复用边界。
读寓言 →
MLOps / governance
精修版模型版本管理
Model Versioning
模型版本管理用于追踪不同模型、数据、参数和代码组合,确保部署、回滚和审计可复现。它不只是给模型起版本号,还要记录训练数据、特征、超参数、评测结果、审批状态、部署环境和使用范围。
读寓言 →
MLOps / monitoring
精修版模型漂移
Model Drift
模型漂移是生产环境中的输入分布、目标关系或业务语境变化,导致模型或 Agent 效果下降的现象。它可能来自用户变化、业务流程变化、数据采集方式变化、外部市场变化,也可能来自工具、政策和上游系统调整。
读寓言 →
MLOps / platform
精修版模型注册表
Model Registry
模型注册表是集中管理模型版本、元数据、审批状态和部署流转的系统。它通常记录模型 artifact、版本、训练来源、评测结果、负责人、风险等级、阶段状态和部署目标。
读寓言 →
Machine Learning
精修版泛化
Generalization
泛化指模型在训练数据之外的未见样本上仍能保持良好表现,而不是只在见过的数据上得分高。
读寓言 →
Machine Learning
精修版梯度下降
Gradient Descent
Gradient Descent 是用梯度信息逐步更新模型参数、降低损失函数的优化方法。学习率、批大小和优化器会影响它是稳定下降、震荡还是陷入差的区域。
读寓言 →
Machine Learning
精修版超参数
Hyperparameters
超参数是训练前或训练过程中由人设定的配置,例如学习率、训练轮数、batch size、模型层数、上下文长度和正则化强度。它们不是模型自己从数据里学出来的,却会深刻影响训练成本、稳定性和最终效果。
读寓言 →
Machine Learning
精修版损失函数
Loss Function
损失函数是衡量模型输出和目标答案差距的数学目标。训练时,模型会沿着降低损失的方向调整参数,所以损失函数等于告诉模型“什么算错、错多少”。
读寓言 →
Machine Learning
精修版机器学习
Machine Learning, ML
它让计算机不是只按人手写的规则工作,而是从数据样本中学习规律,用学到的模式对新输入做预测、分类、生成或决策。
读寓言 →
Machine Learning
精修版过拟合
Overfitting
模型在训练数据上表现很好,却学到了噪声、偶然模式或过细细节,导致遇到新数据时表现变差。
读寓言 →
Machine Learning
精修版参数
Parameters
参数是模型内部可学习的数值,例如神经网络里的权重和偏置。训练过程会不断调整这些数值,让模型从输入产生更符合目标的输出。
读寓言 →
Machine Learning
精修版强化学习
Reinforcement Learning, RL
智能体在环境中观察状态、选择动作、获得奖励或惩罚,并通过多次试错学习一套能最大化长期收益的策略。
读寓言 →
Machine Learning
精修版监督学习
Supervised Learning
模型用带标签的数据训练:每个样本都有输入和对应的正确答案,模型学习从输入预测标签。
读寓言 →
Machine Learning
精修版测试集
Test Set
Test Set 是在开发选择固定之后才使用的保留数据,用于估计模型在未见样本上的最终表现。它是上线前的最后验收之一;被污染后,指标会虚高,业务风险会被低估。
读寓言 →
Machine Learning
精修版训练集
Training Set
Training Set 是用于拟合模型参数的数据。它直接参与学习,因此数据质量、覆盖范围、标签一致性和泄漏控制会决定模型学到什么。企业不能把验证或测试样本混入训练集。
读寓言 →
Machine Learning
精修版无监督学习
Unsupervised Learning
Unsupervised Learning 是在没有显式标签的数据中寻找结构,例如聚类、降维、异常检测和主题发现。它适合探索未知模式、整理大量数据和发现相似群组。企业使用时要避免把自动发现的簇直接当业务真相,通常需要领域专家解释和验证。
读寓言 →
Machine Learning
精修版验证集
Validation Set
Validation Set 是开发过程中保留出来、用于调参和选择方案的数据集。它帮助判断模型是否泛化,但因为会被反复查看,不能当作最终客观成绩。
读寓言 →
Managed agent API
精修版OpenAI 助手 API
OpenAI Assistants API
OpenAI Assistants API 是托管助手接口,围绕线程、消息、运行、工具和文件管理持久对话状态。
读寓言 →
Managed agent object
精修版助手
Assistant
助手是托管 Agent 平台中预配置的 AI 实体,通常绑定指令、模型、工具和文件,不只是一次临时聊天。
读寓言 →
Managed model and agent API
精修版OpenAI 响应 API
OpenAI Responses API
OpenAI Responses API 是统一的模型与 Agent 式工作流接口,支持模型响应、工具调用、多模态输入、结构化输出和内置工具等能力。
读寓言 →
Managed retrieval tool
精修版文件搜索
File Search
File Search 是托管检索能力:将上传文件建立索引,在模型生成回答时检索相关内容。它通常承担 RAG 中的文件摄取、切分、索引和召回环节,适用于合同、手册、知识库等场景,但仍需要处理权限隔离、文件更新、引用质量和答案评测。
读寓言 →
Managed tool execution
精修版代码解释器
Code Interpreter
Code Interpreter 是让模型在受控沙箱中编写并运行代码的托管工具,常用于数据分析、文件处理、计算、可视化和临时脚本执行。
读寓言 →
Managed vector database
精修版Pinecone
Pinecone
Pinecone 是托管型向量数据库服务,为生产级 AI 应用提供向量存储、相似度搜索和元数据过滤。
读寓言 →
Marketing / Enterprise sales
精修版标杆案例
Reference Case, Lighthouse Case, Benchmark Customer Case
标杆案例是可复用的代表性客户成功样本,用来证明产品在某行业、场景或预算池中真实产生了结果。
读寓言 →
MoE
精修版辅助损失
Auxiliary Loss / Load Balancing Loss
辅助损失是 MoE 训练中的额外约束,用来让 token 更均衡地分配到专家,避免少数专家过载或闲置。
读寓言 →
MoE
精修版专家路由
Expert Routing / Gating
专家路由是 MoE 中决定每个 token 交给哪些专家处理的机制,通常由门控网络为专家打分并选择。
读寓言 →
MoE
精修版Top-k 路由
Top-k Routing
Top-k Routing 是 MoE gating 的一种策略:每个 token 只发送给得分最高的 k 个专家,而不是所有专家。
读寓言 →
Model Risk Management
精修版模型清单
Model Inventory
Model Inventory 是集中记录开发、验证、生产、退役或第三方使用中模型的清单,包含所有权、用途、状态、风险和元数据。
读寓言 →
Model Risk Management
精修版模型监控
Model Monitoring
模型监控是在模型部署后持续测量其行为、性能、输入、输出、风险和事故。它覆盖数据漂移、概念漂移、质量下降、延迟、成本、异常输出、安全事件和业务指标。
读寓言 →
Model Risk Management
精修版模型风险管理
Model Risk Management, MRM
模型风险管理是治理模型错误、误用、漂移、限制、假设和运营失败所带来风险的纪律。MRM 通常包括模型清单、风险分级、模型验证、审批、监控、变更管理、供应商模型管理、例外处理和定期复审。
读寓言 →
Model Risk Management
精修版模型验证
Model Validation
模型验证是独立或结构化的审查,用来判断模型是否适合预定用途、表现是否符合预期、限制是否清楚。它通常检查模型目的、数据、假设、方法、性能、稳定性、偏差、边界条件、文档和监控计划。
读寓言 →
Model interface
精修版函数调用
Function Calling
Function Calling 是一种模型接口:开发者预先定义函数名称、参数 schema 和说明,模型在需要调用外部能力时输出机器可读的函数名和参数,由应用程序校验并执行。
读寓言 →
Model interface
精修版JSON 模式
JSON Mode
JSON Mode 是一种生成模式,用来促使或约束模型输出有效 JSON,而不是自由文本。它适合需要机器解析的场景,如信息抽取、配置生成、轻量结构化返回。
读寓言 →
Model interface
精修版结构化输出
Structured Output
Structured Output 是把模型响应约束为指定结构或 schema 的做法,例如 JSON object、字段类型、枚举、数组和嵌套对象。
读寓言 →
Model interface
精修版结构化输出
Structured Outputs
结构化输出约束模型按 JSON 等固定 schema 返回结果,让下游系统能稳定解析、校验和自动处理。
读寓言 →
Multi-agent architecture
精修版监督智能体
Supervisor Agent
Supervisor Agent 是多智能体系统中的监督与协调角色。它监控任务进展,分派子任务,协调 subagents,处理失败,判断何时重规划、升级给人、合并结果或停止执行。
读寓言 →
Multi-agent coordination
精修版群聊编排
Group Chat Orchestration
Group Chat Orchestration 是多 Agent 共享对话中的编排机制。它负责选择下一位发言者、路由消息、管理上下文、判断任务是否完成,并防止重复、跑题和无限循环。
读寓言 →
Multi-agent framework
精修版AutoGen
AutoGen
AutoGen 是用于构建多智能体应用的框架。它让多个 conversational agents 通过消息传递协作,并可调用工具、执行代码、进行人工参与或群聊编排。
读寓言 →
Multi-agent organization unit
精修版Agent 团队
Crew
Crew 是多 Agent 系统中的团队组织单元,通常由多个具有角色、目标、工具和任务边界的 Agent 组成。它强调把复杂工作组织成协作团队,而不是单个 Agent 包办全部能力。
读寓言 →
Multi-agent role
精修版用户代理 Agent
User Proxy Agent
User Proxy Agent 是多 Agent 系统中代表用户的角色,常见于 AutoGen。它可以提供人工输入、审批动作、代用户执行受控代码或把问题交还给真人。
读寓言 →
Multi-agent workflow framework
精修版CrewAI
CrewAI
CrewAI 是多 Agent 工作流框架,用角色化 Agent、任务、工具和流程组织协作,适合搭建团队式自动化。
读寓言 →
Multimodal
精修版CLIP
Contrastive Language-Image Pre-training
CLIP(Contrastive Language-Image Pre-training)通过对比学习把图像和文本表示对齐:匹配的图文对在向量空间中更近,不匹配的更远。它是多模态检索、零样本分类和图文理解的重要基础。
读寓言 →
Multimodal
精修版交叉模态对齐
Cross-Modal Alignment
交叉模态对齐是让文字、图像、音频、视频等不同形式的信息指向同一个对象或含义。比如一段文字说明、一张图片和一段操作视频,都应该被模型理解为同一个工件、步骤或风险点。
读寓言 →
Multimodal
精修版多模态模型
Multimodal Model
Multimodal Model 是能够处理多种模态的模型,例如文本、图像、音频、视频,并可能跨模态生成或推理。企业场景中,多模态模型可用于质检、客服、文档理解、视频巡检、语音交互、培训和现场支持。
读寓言 →
Multimodal AI
精修版视频理解
Video Understanding
Video Understanding 是模型理解视频中画面、对象、动作、语音、字幕和时间关系的能力。它不同于单张图像识别,重点在时序、事件、因果和跨模态线索。
读寓言 →
Multimodality
精修版对比学习
Contrastive Learning
Contrastive Learning 是通过比较正样本和负样本来学习表示的方法。模型被训练为让语义相近或同类样本的向量更接近,让不相关或易混淆样本更远。它常用于 embedding 模型、跨模态对齐、检索模型、推荐和相似案例匹配。
读寓言 →
Multimodality
精修版跨模态嵌入
Cross-Modal Embedding
Cross-Modal Embedding 是把不同模态的数据,例如文本、图片、音频、视频或结构化对象,映射到可比较的共同向量空间。
读寓言 →
Multimodality
精修版多模态
Multimodality
Multimodality 指 AI 系统能够处理、结合或生成多种模态的数据,包括文本、图像、音频、视频和结构化信号。企业 Agent 落地中,多模态能力让系统能理解截图、合同扫描件、客户语音、操作视频、表格和日志,而不只依赖用户文字描述。
读寓言 →
Multimodality
精修版视觉语言模型
Vision-Language Model, VLM
Vision-Language Model, VLM 是能同时处理视觉输入和语言输入,并用语言进行解释、问答或决策的模型。它可用于截图理解、文档扫描件解析、现场故障诊断、商品识别、多模态 RAG 和 UI 操作 Agent。
读寓言 →
NLP / RAG
精修版实体抽取
Entity Extraction
Entity Extraction 是从非结构化文本、图片 OCR 或对话中识别并抽取实体,如人名、公司、产品、金额、日期、地址、合同编号和业务对象。它是知识库构建、搜索、风控、CRM 自动化和 Agent 工具调用的重要前处理。
读寓言 →
NLP / knowledge graph
精修版关系抽取
Relation Extraction
它从文本中识别实体,并判断实体之间存在什么关系,例如雇佣、收购、位于、导致、属于、治疗、供应等。
读寓言 →
NLP and RAG framework
精修版Haystack
Haystack
Haystack 是开源搜索、问答、RAG 和 LLM 管线框架,常用于企业文档和知识库上的检索增强应用。
读寓言 →
Observability
精修版工具调用延迟
Tool Call Latency
工具调用延迟是 Agent 等待外部工具、API、数据库、浏览器或服务返回结果的时间。即使模型本身很快,工具等待也可能成为用户体验的主要瓶颈。
读寓言 →
Observability artifact
精修版跨度
Span
Span(跨度)是 Trace 中的一次具体操作记录。它通常表示一次模型调用、检索、工具调用、数据库查询、解析、审批或中间步骤,包含开始时间、结束时间、耗时、输入输出、状态、错误和关联上下文。
读寓言 →
Observability artifact
精修版跟踪记录
Trace
Trace(跟踪记录)记录一次请求或任务从开始到结束的完整执行路径。对 Agent 系统来说,一个 trace 通常包括用户输入、模型调用、检索步骤、工具调用、参数、返回结果、延迟、错误和中间状态。
读寓言 →
Observability standard
精修版OpenTelemetry
OpenTelemetry, OTel
OpenTelemetry 是厂商中立的可观测标准,用于采集链路、指标和日志,帮助追踪 Agent 应用全流程。
读寓言 →
Open-source AI observability and evaluation tool
精修版Arize Phoenix
Arize Phoenix
Arize Phoenix 是开源 AI 可观测和评测工具,用于追踪、评估和分析 LLM、RAG 与机器学习应用行为。
读寓言 →
Open-source LLM observability platform
精修版Langfuse
Langfuse
Langfuse 是开源 LLM 可观测平台,用于追踪调用、提示、生成结果、评分、成本和用户反馈。
读寓言 →
Open-source vector database
精修版Milvus
Milvus
Milvus 是一个开源分布式向量数据库,专为大规模向量相似度搜索设计。它采用存储计算分离架构,支持多种索引类型(HNSW、IVF_FLAT、IVF_PQ、DiskANN 等)、水平扩展、数据持久化和混合查询。
读寓言 →
Open-source vector database
精修版Qdrant
Qdrant
Qdrant 是开源向量数据库和搜索引擎,支持向量相似度检索、结构化元数据过滤、HNSW 索引和量化。
读寓言 →
Open-source vector database
精修版Weaviate
Weaviate
Weaviate 是一个开源向量数据库,结合了向量搜索、结构化过滤、关键词搜索(BM25)和基于 schema 的对象存储。它的核心设计理念是'向量化一切':每个数据对象可以同时拥有向量、结构化属性和关键词倒排索引,查询时可以混合加权使用。
读寓言 →
Operations
精修版变更管理
Change Management
变更管理是对变更进行申请、评审、批准、测试、沟通、发布和回滚的受控流程。它不是拖慢迭代,而是让高风险变更有证据、有责任人、有退出路径。
读寓言 →
Operations
精修版升级路径
Escalation Path
升级路径是预先定义的异常上报和转交流程,用于处理高风险、低置信度、权限不足或合规敏感情况。
读寓言 →
Operations
精修版异常处理
Exception Handling
异常处理 Exception Handling 是系统在遇到无法正常继续、输入异常、工具失败、权限不足、低置信度或风险升高时的识别、分流、记录、恢复和升级机制。
读寓言 →
Operations
精修版热加载
Hot Reload
Hot Reload 是在不中断或少中断服务的情况下更新配置、提示词、工具、路由、策略或模型版本的能力。对 LLM/Agent 系统,它能提高迭代速度,但需要版本管理、验证、灰度、回滚、状态一致性和审计记录,避免运行中配置漂移或半更新状态。
读寓言 →
Operations
精修版人工旁路监督
Human-on-the-Loop, HOTL
Human-on-the-Loop(人工旁路监督)是一种运行模式:AI 或 Agent 可以自动执行任务,但人类在旁边监控,并能在异常、风险升高或结果不符合预期时介入、暂停、覆盖或接管。
读寓言 →
Operations
精修版事后复盘
Postmortem
事后复盘 Postmortem 是事故、故障或重大失败后的结构化回顾,用来还原时间线、分析根因、评估影响、明确修复动作和防止复发。好的复盘强调系统改进而不是简单追责,最终要产出可执行的行动项、负责人和验证方式。
读寓言 →
Operations
精修版质量保障
Quality Assurance, QA
Quality Assurance, QA 是在 AI 应用和 Agent 交付中建立质量标准、测试流程、抽样复核、缺陷分级和回归检查,确保输出满足业务要求。它覆盖知识准确性、流程完成、工具调用、格式、合规、安全和用户体验。
读寓言 →
Operations
精修版回滚
Rollback
回滚 Rollback 是当新版本、模型、提示词、工具、配置或流程出现问题时,快速恢复到之前稳定状态的机制。它不是失败后的临时补救,而是发布和变更设计的一部分。
读寓言 →
Operations
精修版回滚计划
Rollback Plan
回滚计划 Rollback Plan 是在变更上线前预先定义的恢复方案,包括触发条件、负责人、恢复步骤、时间限制、验证方法和沟通方式。它比单纯的回滚动作更完整,强调什么时候回滚、谁来决定、怎么执行、如何确认恢复成功。
读寓言 →
Operations
精修版根因分析
Root Cause Analysis, RCA
根因分析 Root Cause Analysis(RCA)是找出问题背后真正原因的分析方法,而不是只处理表面症状。它常用于事故、质量问题、系统故障和业务异常复盘中。
读寓言 →
Operations / finance
精修版云成本运营
FinOps
FinOps 是跨工程、财务和业务团队管理云资源、模型调用、预算、归因和成本优化的实践体系。
读寓言 →
Operations / infrastructure
精修版自动扩缩容
Autoscaling
自动扩缩容根据负载、队列长度、CPU、GPU 或请求指标动态调整资源数量,以平衡成本和性能。
读寓言 →
Operations / platform
精修版大语言模型运维
LLMOps
LLMOps 是面向大语言模型应用的运维体系,重点管理提示词、检索、评测、安全、成本、延迟和模型版本。
读寓言 →
Operations / platform
精修版机器学习运维
MLOps
MLOps 是将机器学习模型从实验推进到稳定生产的工程体系,覆盖数据、训练、部署、监控和治理。它强调数据与特征管理、实验追踪、模型注册、CI/CD、上线审批、性能监控、漂移检测和回滚。
读寓言 →
Operations / reliability
精修版死信队列
Dead-Letter Queue, DLQ
死信队列会保存那些多次重试后仍失败,或没有通过校验的消息和任务。它把问题任务隔离出来,避免阻塞正常主流程。
读寓言 →
Operations / reliability
精修版灾难恢复
Disaster Recovery, DR
灾难恢复是一组架构、备份、预案、演练和操作流程,用于重大故障后恢复关键系统和数据。
读寓言 →
Operations / reliability
精修版可观测性
Observability
可观测性是通过日志、指标、追踪和事件来理解系统内部状态的能力。对 Agent 系统来说,可观测性不只是知道任务成功或失败,而是能回看模型调用、检索、工具调用、参数、延迟、错误、成本和中间输出。
读寓言 →
Operations / reliability
精修版恢复点目标
Recovery Point Objective, RPO
恢复点目标定义系统可接受的最大数据丢失时间,用来决定备份、复制和恢复策略的频率。
读寓言 →
Operations / reliability
精修版恢复时间目标
Recovery Time Objective, RTO
恢复时间目标(RTO)是故障发生后,某项服务或业务能力可接受的最长恢复时间。它回答的是:最多能停多久。
读寓言 →
Operations / security
精修版事故响应
Incident Response
事故响应 Incident Response 是系统发生故障、安全事件、质量事故或业务风险时的一整套处理流程,包括发现、分级、止血、隔离、恢复、沟通、取证和复盘。
读寓言 →
Operations/Audit
精修版抽样复核
Sampling Review
Sampling Review 是在无法全面人工复核所有 AI 输出或 Agent 任务时,按风险、场景、客户、金额、历史问题和随机性抽取样本进行人工检查。
读寓言 →
Operations/Auditability
精修版版本控制
Version Control
版本控制记录提示、模型、数据集、工具、策略、代码和配置的变化,让历史状态可审计、回滚和复现。
读寓言 →
Operations/Governance
精修版审批门槛
Approval Gate
审批门槛 Approval Gate 是工作流中要求人工批准、策略校验或权限确认后才能继续的控制点。它通常用于高风险、高金额、不可逆、对外承诺、隐私敏感或合规相关动作。
读寓言 →
Operations/Governance
精修版变更咨询委员会
Change Advisory Board, CAB
变更咨询委员会是跨职能评审机制,用于评估重大变更的风险、准备度、合规影响和运营影响。
读寓言 →
Operations/Risk
精修版AI 事故
AI Incident
AI 事故是 AI 系统造成或险些造成伤害、违规、安全问题、数据泄露或重大运营中断的事件。
读寓言 →
Operations/Risk
精修版业务连续性
Business Continuity
业务连续性关注的是中断发生时,关键业务承诺还能不能继续履行。灾难恢复更偏向把技术系统恢复起来;业务连续性更关心接单、履约、收款、客服、合规通知等能力是否有替代办法。
读寓言 →
Operations/Risk
精修版置信度阈值
Confidence Threshold
置信度阈值是预设的信心或风险门槛,用来决定 AI 输出自动通过、复核、拒绝、降级或升级。
读寓言 →
Operations/Risk
精修版事实核验
Fact Verification
事实核验 Fact Verification 是把 AI 生成的声明、结论或关键事实与可信来源、原始证据、权威系统或业务记录进行对照确认的过程。它用于降低幻觉、过时信息、误读和错误传播风险。
读寓言 →
Operations/Security
精修版事故管理
Incident Management
事故管理覆盖发现、分级、止损、调查、沟通和修复流程,用于处理 AI、安全、隐私或运营事故。
读寓言 →
Orchestration
精修版有向无环图
Directed Acyclic Graph, DAG
Directed Acyclic Graph(DAG,有向无环图)是一种由节点和有向边组成且不存在环的图结构,常用于表示任务、数据管道或工作流的依赖关系。
读寓言 →
Orchestration
精修版意图识别
Intent Classification
Intent Classification 是判断用户请求属于哪类意图,以决定后续流程、工具、Agent 或回复策略的能力。它可以由规则、传统分类器或 LLM 完成。
读寓言 →
Orchestration
精修版语义路由
Semantic Routing
语义路由 Semantic Routing 是根据请求的含义、意图、上下文和任务类型,把请求分发到合适的模型、工具、Agent、知识库或工作流。它不同于简单关键词匹配,更关注用户真正要完成的事。
读寓言 →
Orchestration component
精修版路由器
Router
路由器 Router 是把请求、任务或中间步骤分发到合适模型、工具、工作流、技能或 Agent 的组件。它可以根据意图、能力、成本、延迟、风险、权限、负载和策略做决策。
读寓言 →
PEFT
精修版适配器
Adapter
Adapter 是一种参数高效微调方法,通常在模型层之间插入小型可训练模块,同时冻结基础模型大部分权重。它让同一个基础模型可以通过不同 adapter 适配不同任务、领域或客户。
读寓言 →
PEFT
精修版IA3
Infused Adapter by Inhibiting and Amplifying Inner Activations
IA3 是极高效的参数微调方法,通过学习向量缩放键、值和前馈激活,所需参数通常少于 LoRA。
读寓言 →
PEFT
精修版合并权重
Merge Weights / Merge Adapters
合并权重是把 LoRA 或 Adapter 等 PEFT 训练出的增量并入基础模型权重,便于部署和减少运行依赖。
读寓言 →
PEFT
精修版前缀微调
Prefix Tuning
Prefix Tuning 是一种 PEFT 方法,冻结基础模型参数,只训练一组可学习的连续前缀向量,并把它们作为模型各层 attention 的额外上下文来影响输出。
读寓言 →
PEFT
精修版提示微调
Prompt Tuning
Prompt Tuning 是一种 PEFT 方法,通常冻结模型参数,只学习一小组连续的 soft prompt 向量,并将其附加到输入前,以引导模型完成特定任务。
读寓言 →
PEFT
量化低秩适配
Quantized LoRA, QLoRA
QLoRA 将基础模型量化到 4 bit,并只训练 LoRA 适配器,使大模型能在较低显存设备上完成微调。
读寓言 →
PEFT
精修版目标模块选择
Target Module Selection
目标模块选择是在 LoRA、Adapter 或 IA3 等方法中决定插入、训练或调整哪些模型模块的过程。
读寓言 →
Platform / backend infrastructure
精修版工作流引擎
Workflow Engine
工作流引擎负责把多步骤任务持久化、调度、执行和恢复。它记录每一步状态、输入输出、依赖关系、失败原因、重试规则、人工审批和下一步路由。
读寓言 →
Platform / billing
精修版配额
Quota
配额定义用户、租户或计划在一定周期内可使用的资源上限,例如 token、请求数、存储量或并发数。对 LLM/Agent 平台,quota 用来保护共享模型、GPU、工具执行器、检索服务和预算,避免单个租户或异常任务耗尽资源。
读寓言 →
Platform / integration
精修版连接器
Connector
Connector 是把 AI 系统接入外部应用、数据库、文件、SaaS 或企业系统的适配组件。它负责 API 调用、认证授权、权限边界、参数转换、错误处理、速率限制和审计,使 Agent 能稳定使用外部能力,而不是依赖一次性胶水代码。
读寓言 →
Platform / reliability
精修版持久执行
Durable Execution
持久执行是让长任务在进程崩溃、机器重启、网络中断、超时或人员切换后仍能继续或恢复的执行方式。它通过持久化事件、状态、输入输出和检查点,避免任务只存在于内存或一次会话里。
读寓言 →
Platform architecture
精修版云原生
Cloud Native
云原生是面向云环境设计、构建和运行应用的方式,强调容器化、微服务、弹性伸缩、自动化部署、可观测性和故障隔离。
读寓言 →
Platform engineering
精修版内部开发者平台
Internal Developer Platform, IDP
内部开发者平台为工程团队提供标准化自助入口,用于创建、部署、监控和运维应用,通常包含服务目录、模板、权限、环境和 CI/CD 能力。
读寓言 →
Platform engineering / governance
精修版黄金路径
Golden Path, Paved Road
Golden Path / Paved Road 是平台团队为常见开发、部署和运维场景提供的推荐流程、模板和默认配置。它让团队以较少决策完成合规、可靠的交付,同时允许特殊情况有受控例外。
读寓言 →
Policy
精修版AI 政策
AI Policy
AI Policy 是组织对 AI 使用、采购、部署和治理的正式规则集合,明确允许与禁止的用途、数据处理边界、审批流程、监督要求、披露义务、日志审计和违规后果。
读寓言 →
Policy
精修版可接受使用政策
Acceptable Use Policy, AUP
可接受使用政策规定 AI 或 Agent 产品的允许和禁止用途,用于约束欺诈、伤害、违法和隐私侵犯等风险。
读寓言 →
PostgreSQL vector extension
精修版pgvector
pgvector
pgvector 是 PostgreSQL 扩展,为关系数据库增加向量存储、相似度搜索和元数据过滤能力,常用于轻量 RAG 系统。
读寓言 →
Preprocessing
精修版BPE
Byte-Pair Encoding
BPE 是一种子词分词方法,会反复合并语料中最常见的相邻符号对,形成固定词表。
读寓言 →
Preprocessing
精修版SentencePiece
SentencePiece
SentencePiece 是一种常用的子词分词工具和算法框架,特点是把输入视为原始字符序列,不强依赖空格分词,适合多语言和混合文本。
读寓言 →
Pretraining
精修版语料库
Corpus
语料库是一组被收集、整理并用于训练、检索、评估或分析的数据材料,可以是文本、图片、音频、代码、表格或对话记录。
读寓言 →
Pretraining
精修版基座模型
Foundation Model
Foundation Model 是在广泛数据上训练出来、可迁移到许多下游任务的大模型。它是企业 Agent 的能力底座,但不是完整产品;真正交付还需要数据接入、工具、权限、评测、成本控制和业务流程。
读寓言 →
Pretraining
精修版预训练
Pretraining
预训练是模型的大规模初始训练阶段,通常通过自监督目标从海量语料中学习语言、知识和通用模式。它让模型形成底子,但还不会自动懂某家企业的流程、边界和工具。
读寓言 →
Pretraining
精修版自监督学习
Self-Supervised Learning
自监督学习是从数据本身构造监督信号的学习方式,比如预测下一个 token、补全被遮住的词或判断片段关系。它不需要每条数据都由人工标注答案。
读寓言 →
Privacy
精修版匿名化
Anonymization
匿名化是把个人数据处理到无法识别特定个人,且在合理可用的信息和手段下也难以重新识别的状态。
读寓言 →
Privacy
精修版数据最小化
Data Minimization
它要求只收集、处理、访问和保留完成明确目的所必需的数据,不因为“以后可能有用”就多拿。
读寓言 →
Privacy
精修版数据保护影响评估
Data Protection Impact Assessment, DPIA
DPIA 是处理个人数据尤其高风险活动前的影响评估,用于识别隐私风险、控制措施和合规依据。
读寓言 →
Privacy
精修版数据保留政策
Data Retention Policy
它规定不同类型的数据应保留多久,到期后删除、归档、匿名化还是继续保存,以及例外情况由谁批准。
读寓言 →
Privacy
精修版差分隐私
Differential Privacy
差分隐私通过加入经过设计的数学噪声,限制单个样本对统计结果的影响。目标是让外部人很难从输出里判断某个人的数据是否参与了计算。
读寓言 →
Privacy
精修版成员推断攻击
Membership Inference Attack
成员推断攻击是攻击者通过反复查询模型、观察置信度或输出特征,判断某条数据是否出现在训练集中。它泄露的不是数据全文,而是“某个人或某条记录是否被用过”这个事实。
读寓言 →
Privacy
精修版模型反演攻击
Model Inversion Attack
攻击者通过观察模型输出、概率分数、相似度、置信度或多次查询,反推出训练数据中的敏感特征,甚至重建部分原始数据。
读寓言 →
Privacy
精修版个人数据
Personal Data
个人数据是指与已识别或可识别自然人相关的信息。只要能直接或间接指向某个人,就可能属于个人数据。
读寓言 →
Privacy
精修版个人身份信息
Personally Identifiable Information, PII
PII。它是能够直接或间接识别特定个人的信息,例如姓名、身份证号、手机号、邮箱、照片、地址,也包括与其他信息结合后能识别个人的线索。
读寓言 →
Privacy
精修版假名化
Pseudonymization
假名化是把姓名、手机号等直接标识替换成编号或假名,并把能重新识别身份的对照信息分开保存。它能降低暴露风险,但不是匿名化。
读寓言 →
Privacy
精修版目的限制
Purpose Limitation
目的限制是隐私保护中的原则:个人数据应为明确、具体的目的收集,之后不能无依据地改作不相容的新用途。
读寓言 →
Privacy
精修版安全聚合
Secure Aggregation
安全聚合常用于联邦学习等场景:服务器只得到多个参与方更新后的总和,而看不到任何单方的明文更新。它让大家能共同训练或统计,同时降低单个参与者数据泄露风险。
读寓言 →
Privacy
精修版敏感个人数据
Sensitive Personal Data
它是个人数据中一类伤害风险更高的信息,例如健康、金融、生物识别、精确位置、未成年人信息、种族宗教、政治观点、性取向或可能导致歧视和重大权益损害的数据。
读寓言 →
Privacy/Compliance
精修版跨境数据传输
Cross-Border Data Transfer
它指个人数据、业务数据或其他受监管数据从一个国家或地区流向另一个国家或地区,或者被境外主体远程访问、处理、存储、备份。
读寓言 →
Privacy/Compliance
精修版数据本地化
Data Localization
数据本地化是指法律、政策或合同要求某类数据必须留在特定国家、地区或监管边界内,不能随意跨境传输、处理或存储。
读寓言 →
Privacy/Compliance
精修版数据驻留
Data Residency
它要求某些数据必须存储、处理、复制、备份或恢复在指定国家、地区、云区域、机房或客户控制环境内。
读寓言 →
Procurement
精修版供应商评估
Vendor Evaluation
Vendor Evaluation 是采购和风险团队评估 AI 供应商能力、安全、合规、经济性、支持能力和运营匹配度的过程。
读寓言 →
Procurement/Architecture
精修版供应商锁定
Vendor Lock-In
供应商锁定是专有 API、数据格式、工作流、合同条款或模型行为导致更换供应商成本过高的依赖风险。
读寓言 →
Procurement/Privacy
精修版数据处理协议
Data Processing Agreement, DPA
Data Processing Agreement(DPA)是约定供应商或处理方如何代表客户处理个人数据的合同。
读寓言 →
Procurement/Privacy
精修版数据使用权
Data Usage Rights
数据使用权定义供应商是否以及如何使用客户数据,常覆盖服务交付、统计分析、产品改进、训练和微调。
读寓言 →
Procurement/Privacy
精修版子处理方
Subprocessor
子处理方是处理方为交付服务而聘用的第三方,可能包括云厂商、模型 API、向量数据库和日志平台。
读寓言 →
Procurement/Privacy
精修版训练数据排除
Training Data Exclusion
训练数据排除是合同或技术承诺,说明客户数据未经许可不得用于训练、微调或改进供应商模型。
读寓言 →
Procurement/Risk
精修版退出计划
Exit Plan
Exit Plan 是安全终止或替换供应商的计划,目标是在保留数据访问、服务连续性、合规证明和运营控制的前提下完成迁移。
读寓言 →
Procurement/Risk
精修版第三方风险管理
Third-Party Risk Management, TPRM
Third-Party Risk Management(TPRM)是对供应商、外包方和合作伙伴进行准入评估、合同约束、持续监控、事件处理和退出管理的生命周期纪律。
读寓言 →
Procurement/Risk
精修版供应商尽职调查
Vendor Due Diligence
供应商尽职调查是对供应商安全、隐私、合规、财务稳定、服务可靠性和运营能力的结构化审查。
读寓言 →
Procurement/Security
精修版安全问卷
Security Questionnaire
Security Questionnaire 是买方用于评估供应商安全控制、合规状态、数据处理和事故实践的结构化问卷。它常覆盖身份权限、加密、日志、漏洞管理、渗透测试、合规认证、子处理方、数据留存、备份、业务连续性和事件响应。
读寓言 →
Product / business strategy
精修版产品市场匹配
Product-Market Fit, PMF
产品市场匹配(PMF)是产品为明确客户群解决强需求,并出现留存、复购、推荐、付费意愿和收入增长等信号的状态。它不是有人夸产品,也不是一次 Demo 成功。
读寓言 →
Product / customer success
精修版价值实现时间
Time to Value, TTV
Time to Value(TTV)指客户从开始使用到获得可感知业务价值所需的时间。TTV 越短,越有利于试用转化、客户信心、采用率和留存。
读寓言 →
Product / platform
精修版自助服务
Self-Service
Self-Service 让用户或内部团队无需人工介入即可完成注册、配置、部署、查询、升级、排障等操作。它降低边际服务成本,提升上手速度,也让 PLG 和规模化交付成为可能。
读寓言 →
Product / research
精修版用户画像
Persona, User Persona
Persona / User Persona 是对典型使用者目标、任务、痛点、环境和行为模式的抽象描述。
读寓言 →
Product / sales
精修版概念验证
Proof of Concept, POC
Proof of Concept(POC)是在有限范围内验证技术可行性、业务价值或采购信心的项目。高质量 POC 必须有明确假设、范围、成功标准、时间盒、数据条件、责任分工和下一步决策。
读寓言 →
Product engineering / release management
精修版特性开关
Feature Flag, Feature Toggle
特性开关是在不重新部署代码的情况下,控制某项能力是否启用。它可以按用户、租户、地区、任务类型、模型、工具、策略或风险等级逐步开启。
读寓言 →
Product experience / customer success
精修版入门引导
Onboarding
Onboarding 是帮助新用户或客户完成账号配置、数据导入、首次任务、权限设置、团队协作和价值确认的过程。好的 onboarding 不只是教程,而是把用户带到激活和首个业务结果。
读寓言 →
Product growth
精修版激活
Activation
Activation 是新用户首次体验到产品核心价值的过程或关键行为,常被设计成 activation metric。它不同于注册、登录或观看教程;真正的激活必须让用户完成一个能代表产品价值的动作。
读寓言 →
Product strategy
精修版最小可行产品
Minimum Viable Product, MVP
Minimum Viable Product(MVP)是用最小必要范围验证核心用户需求、价值主张或商业假设的早期产品。
读寓言 →
Product strategy / research
精修版待完成任务
Jobs to Be Done, JTBD
Jobs to Be Done(JTBD)关注用户在特定情境下想取得的进展,而不是只按身份、行业或功能偏好理解需求。
读寓言 →
Product strategy / workflow design
精修版AI 原生工作流
AI-Native Workflow
AI 原生工作流围绕 AI 的理解、生成、工具调用、记忆、评估和人工介入能力重新设计工作流程。
读寓言 →
Prompt optimization tool
精修版提示优化器
Teleprompter
Teleprompter 在 DSPy 中指用于优化 prompts、demonstrations 或程序设置的优化器。它根据训练样本、评测指标和模块结构,搜索更有效的 few-shot 示例、指令或推理策略。
读寓言 →
Prompt/function abstraction
精修版语义函数
Semantic Function
Semantic Function 是把提示词或自然语言指令包装成可调用单元的抽象,常见于 Semantic Kernel。它像函数一样有名称、输入和输出,可以和 native function、plugin、planner 组合。
读寓言 →
Quality assurance
精修版评测框架
Evaluation Harness
评测框架 Evaluation Harness 是一套可重复运行的测试环境和用例集合,用来评估模型或 Agent 在不同任务、边界条件、工具调用、延迟、质量和失败场景下的表现。
读寓言 →
Quantization
精修版双重量化
Double Quantization
Double Quantization 是 QLoRA 中的一种量化技巧:模型权重被量化后,还需要保存量化尺度等常数;双重量化会进一步量化这些量化常数,从而额外节省显存,论文中约可节省 0.4 bit/parameter。
读寓言 →
Quantization
精修版NF4
NormalFloat 4-bit
NF4 是 QLoRA 引入的 4 bit 数据类型,针对近似正态分布的权重设计,用于更高效地量化大模型。
读寓言 →
RAG
精修版多模态 RAG
Multimodal RAG
Multimodal RAG 是把文本、图片、表格、图纸、音频、视频等多种模态纳入检索增强生成,让模型回答时能引用不同类型证据。企业场景中,大量知识存在于扫描件、产品图、工单截图、合同表格、录音和视频里。
读寓言 →
RAG / search
精修版重排序器
Reranker
重排序器(Reranker)是在初步检索后,对候选文档或 chunk 重新评分排序的模型或组件。
读寓言 →
RAG evaluation
精修版答案相关性
Answer Relevance
答案相关性 Answer Relevance 衡量模型回答是否真正回应用户问题和任务目标。一个回答可以流畅、真实、信息丰富,却仍然不相关,因为它没有解决用户真正问的事。
读寓言 →
RAG evaluation
精修版上下文精确率
Context Precision
上下文精确率 Context Precision 衡量检索或提供给模型的上下文中,有多少靠前内容真正与问题相关。它关注的不只是答案是否被检索到,还关注相关材料是否排在前面、无关噪音是否过多。
读寓言 →
RAG evaluation
精修版上下文召回率
Context Recall
上下文召回率 Context Recall 衡量回答问题所需的关键证据是否被检索并放入上下文。它关注的是有没有漏掉必要信息。
读寓言 →
RAG evaluation
精修版忠实性
Faithfulness
事实一致性 Faithfulness 衡量模型回答是否忠于给定证据或上下文。一个回答可能流畅、有逻辑、甚至大体方向正确,但如果它加入了证据中没有支持的内容、改写了事实关系或夸大结论,就不够 faithful。
读寓言 →
RAG evaluation
精修版检索精确率
Retrieval Precision
Retrieval Precision 衡量检索返回结果中真正相关结果所占比例。在 RAG 中,它回答的问题是:进入模型上下文的 chunk 里,有多少确实能支撑当前问题。
读寓言 →
RAG evaluation
精修版检索召回率
Retrieval Recall
Retrieval Recall 衡量所有相关结果中被系统成功检索出来的比例。在 RAG 中,它回答的是:关键证据有没有被召回。低 recall 会导致模型基于不完整上下文作答,在合规、合同、售后和医疗等场景尤其危险。
读寓言 →
Reasoning
精修版思维图
Graph of Thoughts
思维图用图结构组织中间想法,让推理节点可以分叉、合并、回溯和复用,适合组合型推理任务。
读寓言 →
Reasoning
精修版自我一致性
Self-Consistency
Self-Consistency 是对同一问题采样多条推理路径,再通过投票或一致性选择最终答案的方法。它常和 Chain-of-Thought 一起用于提高复杂推理稳定性。
读寓言 →
Reasoning
精修版思维树
Tree of Thoughts
Tree of Thoughts 是把模型推理展开为多条候选路径,并在分支之间进行搜索、评估、剪枝和选择的方法。它适合规划、谜题、策略决策等需要探索多个可能方案的任务。代价是推理成本更高,需要设计分支生成、评估函数、停止条件和搜索预算。
读寓言 →
Reasoning / tool use
精修版程序辅助语言模型
Program-Aided Language Model, PAL
Program-Aided Language Model, PAL 是让模型生成程序或可执行代码,再通过执行程序解决数学、逻辑、数据处理等问题的方法。模型负责把自然语言问题转成程序,执行器负责精确计算。
读寓言 →
Reasoning/action pattern
精修版推理-行动范式
ReAct
ReAct 是一种推理-行动交替的 prompting 和 Agent 模式。模型先进行短步推理,选择工具或动作,观察结果后再继续下一轮。它适合需要外部信息、工具调用和逐步决策的任务。
读寓言 →
Regulation
精修版EU AI 法案
EU AI Act
EU AI 法案是欧盟按风险分级监管 AI 的法律框架,对高风险系统、通用目的 AI 和透明披露提出要求。
读寓言 →
Regulation
精修版通用目的 AI
General-Purpose AI, GPAI
通用目的 AI 指可适配多种下游用途的通用 AI 模型或系统,可作为多个产品和 Agent 的基础能力。
读寓言 →
Regulation
精修版高风险 AI 系统
High-Risk AI System
高风险 AI 系统是在监管框架中因用途影响安全、基本权利或重要机会而承担更严格义务的系统。
读寓言 →
Regulation/Compliance
精修版合格评定
Conformity Assessment
合格评定是在受监管 AI 系统投放或使用前,验证其是否满足适用法律和标准要求的程序。
读寓言 →
Reliability / AI platform
精修版回退
Fallback
回退是在首选模型、工具、服务或流程失败、变慢、不可用或风险过高时启用的备用路径。
读寓言 →
Reliability / architecture
精修版熔断器
Circuit Breaker
熔断器是在依赖持续失败或延迟过高时临时停止调用,避免级联故障,并在恢复期逐步探测。
读寓言 →
Reliability / operations
精修版错误预算
Error Budget
错误预算是在 SLO 允许范围内可消耗的不可靠额度,用于平衡发布速度、实验频率和系统稳定性。
读寓言 →
Reliability / operations
精修版服务级别目标
Service Level Objective, SLO
服务级别目标是对服务可靠性的可衡量承诺,例如可用性、延迟、错误率或任务完成率。
读寓言 →
Reliability / product experience
精修版降级
Graceful Degradation
优雅降级是指系统在容量、依赖、模型、工具或数据源异常时,仍提供缩小但有用的服务,而不是整体失败。
读寓言 →
Reliability pattern
精修版模型回退
Model Fallback
模型回退是在主模型失败、超时、超预算或违反策略时,将请求路由到备用模型或供应商的可靠性模式。
读寓言 →
Reliability technique
精修版事实锚定
Grounding
Grounding 是把模型输出和决策锚定到给定证据、工具结果、源文档或已验证系统状态上,而不是依赖模型猜测。企业 Agent 中,grounding 是降低幻觉、支撑审计、生成引用和建立用户信任的关键机制。
读寓言 →
Representation learning
精修版嵌入
Embeddings
Embeddings 是把文本、图片、音频、代码、实体或业务对象转换成稠密数字向量的表示方法。它与已精修的 Embedding 页面讲同一核心机制,但这里强调复数形态在企业系统里的资产化:大量对象被持续编码、存储、检索、更新和评估。
读寓言 →
Reranking
精修版交叉编码器
Cross-Encoder
Cross-Encoder 是把查询和候选文本一起输入同一个模型,让模型在联合上下文中判断相关性的方法。它通常比只分别编码查询和文档的方式更精细,适合 RAG 的 reranking、搜索结果精排、问答证据选择和合规材料匹配。
读寓言 →
Retrieval
精修版BM25
BM25
BM25 是经典的关键词检索排序算法,常用于搜索引擎和 RAG 的稀疏检索。它基于词频、逆文档频率和文档长度归一化来判断文档与查询的相关性。BM25 擅长处理专有名词、编号、精确术语和法规条款等字面匹配问题。
读寓言 →
Retrieval
精修版双编码器
Bi-Encoder
Bi-Encoder 是分别编码查询和文档,将两者转换成向量后用相似度进行匹配的架构。因为文档向量可以离线预计算并存入向量数据库,它非常适合大规模语义检索、RAG 第一阶段召回、相似案例搜索和推荐。
读寓言 →
Retrieval
精修版假设文档嵌入
Hypothetical Document Embeddings, HyDE
HyDE 先生成假设答案或文档,再对其做 embedding 用于检索,以改善短查询或模糊查询的召回。
读寓言 →
Retrieval
精修版最大边际相关性
Maximal Marginal Relevance, MMR
Maximal Marginal Relevance, MMR 是一种在相关性和多样性之间做权衡的检索结果选择方法。它会优先选择既与查询相关、又与已选结果不太重复的文档。
读寓言 →
Retrieval
精修版多跳检索
Multi-Hop Retrieval
多跳检索为回答复杂问题进行多步检索,先找到证据片段,再根据实体、关系或中间结论继续检索。
读寓言 →
Retrieval
精修版查询改写
Query Rewriting
Query Rewriting 是把用户原始问题改写成更适合检索、数据库查询或工具调用的形式。它能补全指代、标准化术语、拆分复杂问题、生成多路查询,并提升 RAG 召回质量。
读寓言 →
Retrieval
精修版递归检索
Recursive Retrieval
Recursive Retrieval 是在 RAG 或知识检索中根据已取回内容继续生成后续查询、追踪新实体或补齐缺失证据的检索方式。它适合多跳问题、复杂事实核查、长链业务分析。
读寓言 →
Retrieval infrastructure
精修版近似最近邻搜索
Approximate Nearest Neighbor Search (ANN Search)
近似最近邻搜索在有限时间和计算资源内找到足够相近的向量,是大规模向量检索的基础技术。
读寓言 →
Retrieval infrastructure abstraction
精修版文档存储
Document Store
Document Store 是 RAG、搜索和问答管线中存放文本、元数据、嵌入向量和索引信息的存储抽象。它可以由 Elasticsearch、OpenSearch、向量数据库、关系数据库或框架内置存储实现。
读寓言 →
Retrieval infrastructure ecosystem
精修版向量数据库生态
Vector Database Ecosystem
向量数据库生态包括 Pinecone、Milvus、Qdrant、FAISS 等数据库和检索库,用于存储、索引和查询向量。
读寓言 →
Retrieval method
精修版密集检索
Dense Retrieval
密集检索(Dense Retrieval)用神经网络 embedding 把查询和文档编码成低维稠密向量,再通过向量相似度寻找语义接近的内容。它能处理同义表达、改写、跨语言和隐含意图,是现代 RAG 的核心检索方式之一。
读寓言 →
Retrieval method
精修版混合搜索
Hybrid Search
混合搜索(Hybrid Search)是把关键词/稀疏检索(如 BM25)和向量/语义检索结合起来的检索方法。关键词检索擅长精确匹配专有名词、编号、代码、法规条款;向量检索擅长找到字面不同但意思相近的内容。
读寓言 →
Retrieval method
精修版语义搜索
Semantic Search
语义搜索(Semantic Search)基于意义而非精确关键词匹配来检索结果。它把查询和文档都嵌入到同一个向量空间,通过计算向量距离找到语义最接近的内容。与传统关键词搜索相比,语义搜索能处理同义词、近义表达、跨语言和模糊描述,召回更完整。
读寓言 →
Retrieval method
精修版稀疏检索
Sparse Retrieval
稀疏检索(Sparse Retrieval)用高维稀疏特征表示查询和文档,典型形式包括 BM25、倒排索引,以及 SPLADE 这类学习型稀疏表示。它的优势是精确命中关键词、罕见词、编号、专有名词、错误码和条款。
读寓言 →
Retrieval preparation
精修版分块
Chunking
分块(Chunking)是把长文档切成适合检索和放入模型上下文的小片段。RAG 系统通常不能直接把整份文档都塞给模型,而是先把文档切块、向量化、索引,再按问题召回相关块。分块质量会直接影响召回精度、上下文完整性、引用准确性和答案质量。
读寓言 →
Retrieval preparation
精修版父子分块
Parent-Child Chunking
父子分块用较小子块做向量检索,再返回更大的父块作为上下文,兼顾命中精度和语义完整性。
读寓言 →
Retrieval preparation
精修版语义分块
Semantic Chunking
语义分块(Semantic Chunking)按照语义边界切分文档,而不是机械按固定字符数、token 数或行数切分。它会尽量让每个 chunk 成为相对完整的意义单元,例如一个规则、一个步骤、一段定义、一组例外或一个案例。
读寓言 →
Retrieval preparation
精修版滑动窗口分块
Sliding Window Chunking
滑动窗口分块(Sliding Window Chunking)用固定大小的窗口切分长文档,并让相邻 chunk 之间保留一定 overlap。它的目标是减少语义或事实刚好跨越分块边界时被切断的风险。
读寓言 →
Retrieval quality
精修版重排序
Reranking
Reranking 是在第一阶段检索之后,对候选文档、chunk 或搜索结果重新评分排序的步骤。它通常结合查询和候选内容做更细粒度的相关性判断,常由 cross-encoder、LLM 或专门重排模型完成。
读寓言 →
Retrieval/application abstraction
精修版查询引擎
Query Engine
Query Engine 是 LlamaIndex 等框架中的应用抽象:接收用户查询,调用检索器或索引取回相关数据,并通过 LLM 或其他策略合成最终答案。
读寓言 →
Risk Management
精修版AI 风险管理
AI Risk Management
AI Risk Management 是对 AI 系统全生命周期风险进行识别、测量、优先级排序、缓解、监控和汇报的系统过程。
读寓言 →
Risk Management
精修版AI 风险管理框架
AI Risk Management Framework, AI RMF
AI RMF 是治理 AI 风险的结构化框架,通常围绕治理、映射、度量和管理来识别并控制风险。
读寓言 →
Risk Management
精修版幻觉风险
Hallucination Risk
Hallucination Risk 是生成式 AI 产生虚假、无依据或编造内容并被用户当成事实使用的风险。
读寓言 →
Risk Management
精修版剩余风险
Residual Risk
Residual Risk 指在控制、缓解和监控措施实施之后仍然存在的风险。企业 Agent 治理中,权限限制、审批流、日志、评测和护栏会降低风险,但不会让风险归零。
读寓言 →
Risk Management
精修版风险接受
Risk Acceptance
Risk Acceptance 是由授权责任人正式决定接受已知剩余风险的治理动作。它通常要求说明风险内容、业务理由、适用范围、期限、补偿控制、监控指标和升级条件。
读寓言 →
Risk Management
精修版风险偏好
Risk Appetite
Risk Appetite 是组织为实现业务目标而愿意接受的风险类型和水平。它为 Agent 的权限、自动化范围、审批阈值、测试强度和监控要求提供上层边界。
读寓言 →
Risk Management
精修版风险评估
Risk Assessment
风险评估识别、分析和分级 AI 用例或系统的潜在风险,判断伤害、合规义务、概率、严重性和控制措施。
读寓言 →
Risk Management
精修版风险所有人
Risk Owner
Risk Owner 是对特定风险承担管理责任的人或职能,负责确保风险被识别、评估、缓解、监控,并保持在批准阈值内。它不同于 Control Owner:控制所有人负责某项控制运行,风险所有人负责该风险整体处置和问责。
读寓言 →
Risk Management
精修版风险登记册
Risk Register
风险登记册持续记录已识别风险、责任人、可能性、影响、缓解措施、残余风险、接受状态和复查周期。
读寓言 →
SaaS / platform architecture
精修版多租户
Multi-Tenancy
多租户是让多个客户或组织共享同一平台,同时隔离数据、权限、配置、用量、计费和运维控制。它的核心不是简单共用服务器,而是共享与隔离同时成立。
读寓言 →
SaaS / security architecture
精修版租户隔离
Tenant Isolation
租户隔离确保一个客户的数据、配置、权限、上下文、工具、日志和资源不会被其他客户访问或影响。
读寓言 →
Safety and Alignment
精修版安全护栏
Guardrails
安全护栏是一组围绕 AI/Agent 的安全与治理控制,用来限制输入、输出、工具调用、权限和高风险动作。
读寓言 →
Sales AI / Revenue operations
精修版销售智能体
Sales Agent, AI Sales Agent, Sales Copilot
销售智能体是面向销售和收入运营的 AI 执行系统,覆盖客户研究、线索评分、个性化触达和会议准备。
读寓言 →
Security
精修版AI 安全
AI Security
AI Security 是保护 AI/Agent 系统免受提示注入、数据泄露、模型滥用、工具越权、训练/检索数据污染、供应链风险、凭证泄露和对抗攻击的安全实践。
读寓言 →
Security
精修版基于属性的访问控制
Attribute-Based Access Control, ABAC
基于属性的访问控制(ABAC)不是只看一个人的角色,而是根据主体、资源、动作和环境等属性共同决定是否放行。主体可以是用户或 Agent,资源可以是客户数据或工具,动作可以是读取、导出、删除,环境可以是时间、设备、网络、租户和审批状态。
读寓言 →
Security
精修版后门攻击
Backdoor Attack
后门攻击在模型、数据、依赖或系统中植入隐藏行为,使其平时正常、遇到特定触发条件时异常。
读寓言 →
Security
精修版上下文污染
Context Poisoning
上下文污染是恶意、过时、无关或低质量内容进入 Agent 上下文后,影响推理、决策或工具调用。
读寓言 →
Security
精修版数据外泄
Data Exfiltration
数据外泄是数据未经授权离开受控边界的行为,可能通过工具调用、提示注入或集成系统发生。
读寓言 →
Security
精修版数据投毒
Data Poisoning
数据投毒是攻击者操纵训练、微调、评测、检索或反馈数据,让 AI 系统学到错误、偏见、不安全或对攻击者有利的行为。它不一定发生在训练集,也可能藏在文档库、工单、日志、用户反馈和人工标注里。
读寓言 →
Security
精修版越权代理
Excessive Agency
越权代理指给 AI Agent 的自主性、工具访问、决策权限或操作范围,超过了任务风险和治理能力。它不是普通的权限小错,而是系统允许 Agent 做了本不该由它独立完成的事。
读寓言 →
Security
精修版模型投毒
Model Poisoning
模型投毒操纵权重、适配器、检查点或训练过程,使模型产生后门、偏差或错误行为。
读寓言 →
Security
精修版OWASP LLM Top 10
OWASP Top 10 for LLM Applications
OWASP LLM Top 10 是面向大模型应用的风险分类,覆盖提示注入、数据泄露、工具滥用等常见漏洞。
读寓言 →
Security
精修版权限边界
Permission Boundary
权限边界是对 Agent、用户、角色或工具能读、写、调用、修改、删除或委派什么设置的最大上限。它不是建议,也不是提示词里的软提醒,而是运行时或工具层必须执行的硬边界。
读寓言 →
Security
精修版基于角色的访问控制
Role-Based Access Control, RBAC
RBAC 将权限分配给角色而不是单个身份,让用户或 Agent 通过角色继承访问范围,便于治理。
读寓言 →
Security
精修版供应链风险
Supply Chain Risk
供应链风险来自依赖库、模型、数据集、工具、插件或外部服务,可能影响安全、合规和业务连续性。
读寓言 →
Security
精修版工具输出污染
Tool Output Poisoning
工具输出污染是指外部工具、网页、文件、API 或插件返回恶意或误导内容,诱导 Agent 忽略策略、调用其他工具、泄露数据或改变目标。
读寓言 →
Security / agent runtime
精修版沙箱
Sandbox
沙箱是隔离的执行环境,用来限制文件、进程、网络访问、系统调用、工具和凭证。它让代码或工具输出即使出错,也不容易影响外部系统。
读寓言 →
Security / compliance
精修版审计日志
Audit Log
审计日志记录谁在何时对哪些资源执行了什么操作,通常包含身份、时间、资源、动作、输入输出和结果状态。
读寓言 →
Security / governance
精修版权限模型
Permission Model
权限模型定义用户、Agent、工具、资源、动作、授权、审批和审计之间的关系与边界。
读寓言 →
Security / operations
精修版最小权限原则
Principle of Least Privilege
最小权限原则只授予用户、Agent、服务或工具完成当前任务所需的最小权限和最短有效时间。
读寓言 →
Security / operations
精修版机密管理
Secrets Management
机密管理负责安全存储、分发、轮换、撤销和审计 API key、密码、token、证书等敏感凭证。
读寓言 →
Security/Compliance
精修版信息安全管理体系
Information Security Management System, ISMS
Information Security Management System, ISMS 是管理信息安全的体系,通常包括安全政策、资产识别、风险评估、风险处置、控制措施、角色职责、培训、审计、证据和持续改进。
读寓言 →
Security/Governance
精修版职责分离
Segregation of Duties, SoD
职责分离把相互冲突的责任拆开,避免单个人或 Agent 独立完成高风险流程而缺少制衡。
读寓言 →
Security/Privacy
精修版数据防泄漏
Data Loss Prevention, DLP
DLP。它是一套发现、监控和阻止敏感数据离开安全边界的机制,常覆盖终端、邮件、聊天、云盘、网页上传、API 和数据库导出。
读寓言 →
Serving
精修版vLLM
vLLM
vLLM 是高吞吐 LLM 推理引擎,依靠分页注意力和连续批处理提升并发效率,是生产服务常用选择。
读寓言 →
Serving / UX
精修版流式响应
Streaming Response
流式响应在生成 token 或内容块时即时返回结果,而不是等待完整输出完成后一次性返回。
读寓言 →
Serving metric
精修版每秒 token 数
Tokens Per Second, TPS
每秒 token 数(TPS)衡量模型或服务系统每秒生成多少 token,通常主要看解码阶段。它是速度和吞吐的重要指标。
读寓言 →
Serving optimization
精修版Chunked Prefill
Chunked Prefill
Chunked Prefill 将长提示词的预填充处理拆成小块,避免单个长请求长期占用 GPU 调度资源。
读寓言 →
Serving optimization
精修版草稿模型
Draft Model
草稿模型是推测解码中较小或更快的模型,用来先提出一串候选 token。随后目标大模型负责验证这些候选,只接受符合自己分布的前缀。
读寓言 →
Serving optimization
KV Cache
Key-Value Cache
大模型生成文本时,每个旧 token 都会产生可供注意力机制使用的 Key 和 Value。把这些 Key/Value 缓存起来,后续生成新 token 时就不用重新计算全部历史。
读寓言 →
Software architecture / workflow
精修版状态机
State Machine
State Machine 用一组明确状态和状态转移规则描述系统行为。它适合管理审批流、任务执行、Agent 生命周期、复杂 UI 和异常处理,因为系统在任何时刻都处于可识别状态,并且只能按允许的条件进入下一状态。
读寓言 →
Speech AI
精修版语音识别
Automatic Speech Recognition, ASR
Automatic Speech Recognition, ASR 是把语音转换成文本的技术。企业 Agent 中,ASR 常用于语音客服、会议记录、外呼、质检和实时语音助手。
读寓言 →
Speech AI
精修版语音合成
Text-to-Speech, TTS
Text-to-Speech, TTS 是把文本转换成可听语音的技术。企业 Agent 中,TTS 用于语音客服、实时助手、通知播报、无障碍访问和外呼场景。
读寓言 →
System architecture
精修版多智能体编排
Multi-Agent Orchestration
多智能体编排把任务分配给多个专门 Agent,并协调角色、依赖、消息、输出、冲突和最终结果。
读寓言 →
System architecture
精修版编排
Orchestration
编排负责协调模型、工具、工作流、Agent、人工审批、状态和错误处理,让完整任务能跨多个组件可靠推进。它关注全局依赖、路由、权限、重试、升级、并行和结果合并。
读寓言 →
System design
精修版上下文工程
Context Engineering
Context Engineering 是为模型选择、组织、压缩、更新和隔离上下文的工程实践。它比传统 Prompt Engineering 更宽:不仅写指令,还处理记忆、检索、工具结果、任务状态、权限边界、来源可信度和 token 约束。
读寓言 →
Tokenization
精修版字节对编码
Byte Pair Encoding, BPE
Byte Pair Encoding, BPE 是一种常见子词分词方法。它从基础符号开始,反复合并训练语料中最频繁相邻出现的符号对,得到一套固定 vocabulary。
读寓言 →
Tokenization
精修版词元
Token
Token 是模型处理文本或数据的基本单位,可能是一个词、词片、字符片段、标点或符号。模型的上下文窗口、API 计费、延迟、吞吐和输出长度通常都按 token 计算,而不是按字符或单词。
读寓言 →
Tokenization
精修版分词
Tokenization
Tokenization 是把原始文本转换成模型可处理 token 序列的过程。常见方法包括 BPE、SentencePiece 等子词分词方式。分词会影响 token 数量、上下文占用、成本、速度、多语言表现、代码处理和特殊字符行为。
读寓言 →
Tokenization
精修版分词器
Tokenizer
Tokenizer 是把文本映射为 token IDs、并把生成的 token IDs 还原为文本的软件组件。它通常包含词表、分词算法和特殊 token 规则。
读寓言 →
Tokenization
精修版词表
Vocabulary
Vocabulary 是 tokenizer 或模型可识别 token 的集合,通常包含子词片段、符号、特殊 token 及其 token ID。它决定文本如何被编码、哪些片段可以高效表示、同一文本会占用多少上下文空间。
读寓言 →
Tool
精修版浏览器工具
Browser Tool
Browser Tool 是让 Agent 打开网页、读取页面、点击控件、填写表单或执行网页任务的工具。
读寓言 →
Tool interface
精修版插件
Plugin
Plugin 是 AI 系统可发现并调用的外部能力包,通常描述某个 API、工具或服务的用途、参数、权限和返回格式。它让 Agent 能连接日历、CRM、数据库、工单、支付等系统执行动作。
读寓言 →
Training
精修版激活检查点
Activation Checkpointing / Gradient Checkpointing
激活检查点在训练时只保存部分中间激活,反向传播时重新计算其余激活,以显存换计算。
读寓言 →
Training
精修版bf16
Brain Floating Point 16
Brain Floating Point 16, bf16 是一种 16 位浮点格式,指数范围与 fp32 相同但尾数更少。它相比 fp32 节省显存和带宽,相比 fp16 更不容易出现数值溢出,通常不需要复杂梯度缩放。
读寓言 →
Training
精修版灾难性遗忘
Catastrophic Forgetting
Catastrophic Forgetting 是神经网络在新数据或新任务上微调后,显著丢失先前学到能力的现象。企业微调 LLM 时,过窄数据、过大学习率或训练轮次过多都可能导致通用能力、安全对齐或原有业务能力退化。
读寓言 →
Training
精修版思维链训练
Chain-of-Thought Training
Chain-of-Thought Training 是用逐步推理轨迹进行微调或训练,以提升模型在数学、规划、逻辑等多步任务上的能力。它比只用最终答案监督更能传递解题过程,但依赖高质量、真实、可验证的推理数据。
读寓言 →
Training
精修版Chinchilla 方案
Chinchilla Optimal
Chinchilla Optimal 指 DeepMind Chinchilla 工作提出的计算最优缩放观点:在固定训练计算预算下,应同时增加模型参数量和训练 token 数,许多早期大模型相对参数过大、训练 token 不足。
读寓言 →
Training
精修版持续预训练
Continual Pre-training / Continued Training
持续预训练是在已有基础模型上继续用新领域、新时间段或新语言风格的数据训练。它能让模型补充知识、适应行业表达,但也可能冲淡原本能力或引入新偏差。
读寓言 →
Training
精修版课程学习
Curriculum Learning
Curriculum Learning 是按从易到难或按能力阶段组织训练样本的策略,类似人类学习课程。它可用于模型预训练、指令微调、Agent 轨迹训练和工具使用训练,帮助模型更稳定地掌握基础能力再处理复杂任务。
读寓言 →
Training
精修版数据混合
Data Mixing
数据混合是在预训练或微调中按比例组合不同数据源的策略。代码、数学、中文、安全、客服、行业文档等数据占比不同,模型最终擅长的能力和形成的偏差也会不同。
读寓言 →
Training
精修版去噪目标
Denoising Objective
Denoising Objective 是扩散模型训练中的核心目标:模型学习从加入噪声的数据中预测并去除噪声,逐步恢复干净样本。通过在不同噪声强度下训练,模型掌握数据分布的结构,生成时从随机噪声一步步反推到图像、音频或其他内容。
读寓言 →
Training
精修版GRPO
Group Relative Policy Optimization
GRPO 是一种强化学习优化方法,常用于大模型对齐和推理能力训练。它对同一个提示生成一组候选回答,用组内相对表现来计算奖励优势,从而减少对独立价值函数模型的依赖。
读寓言 →
Training
精修版掩码语言建模
Masked Language Modeling, MLM
Masked Language Modeling(MLM)是在输入中随机遮盖部分 token,让模型根据上下文预测被遮盖内容的训练目标。它常用于 BERT 类双向 Encoder 预训练,使模型学习理解型表示。
读寓言 →
Training
精修版混合精度训练
Mixed Precision Training
Mixed Precision Training 是在模型训练中同时使用不同数值精度,例如 FP32、FP16、bf16,以减少显存占用、提高吞吐,同时保留关键计算的稳定性。
读寓言 →
Training
精修版多任务学习
Multi-Task Learning
Multi-Task Learning 是让一个模型在多个相关任务上共同训练,共享表示或参数,同时学习各任务的输出。它可以提升数据效率和泛化能力,尤其当任务之间存在共同结构时。
读寓言 →
Training
精修版下一个词预测
Next-Token Prediction
Next-Token Prediction 是让模型根据已有上下文预测下一个 token 的训练目标,是 GPT 类自回归语言模型的核心。它能从大规模数据中学习语言、代码和推理模式,但目标本身并不保证事实正确、权限合规或结果可执行。
读寓言 →
Training
精修版预训练
Pre-training
Pre-training 是训练流程中的基础阶段,先让模型从大规模语料中学到通用表示和生成能力。它和后续 fine-tuning、alignment、evaluation 连成一条链;基础火候不足,后面的企业适配会很吃力。
读寓言 →
Training
精修版强化微调
Reinforcement Fine-Tuning, RFT
强化微调(RFT)用可验证或可评分的结果信号继续优化模型行为。它常用于让模型在推理、代码、数学或企业流程中学会比示范数据更稳的策略。
读寓言 →
Training
精修版可验证奖励强化学习
Reinforcement Learning with Verifiable Rewards, RLVR
RLVR 使用可程序化验证的结果作为奖励信号训练模型,例如数学答案、代码测试或规则校验是否通过。
读寓言 →
Training
精修版缩放定律
Scaling Laws
Scaling Laws 描述模型性能与参数量、训练数据、计算量等规模因素之间的经验关系。它帮助团队预测扩大模型、数据或算力的收益和成本,避免单独堆参数、数据不足或算力浪费。企业决策中,缩放定律用于预算规划、模型选型和训练策略判断。
读寓言 →
Training / privacy
精修版联邦学习
Federated Learning
Federated Learning 是一种多方协同训练方法,各参与方保留本地原始数据,只共享模型更新、梯度或经过保护的统计信息。它常用于金融、医疗、政企等数据不能集中汇聚的场景。
读寓言 →
Training and Inference
精修版知识蒸馏
Knowledge Distillation
知识蒸馏让小模型学习大模型的输出分布或行为,以较低推理成本保留尽可能多的能力。
读寓言 →
Training data
精修版数据增强
Data Augmentation
Data Augmentation 是通过变换、扰动、重写、合成或组合样本来扩充训练数据的方法,用于提高模型对真实变化的适应能力。它可以覆盖同义表达、噪声输入、格式差异、边界条件和少见场景。
读寓言 →
Transformers
精修版注意力机制
Attention Mechanism
它让模型在处理一串信息时,不是平均看待所有位置,而是根据当前要生成或理解的内容,动态判断哪些位置更重要。
读寓言 →
Transformers
精修版解码器
Decoder
Decoder 是 Transformer 中用于生成输出序列的部分。典型 Decoder 在生成时使用因果掩码,只能关注已生成 token,并逐步预测下一个 token。
读寓言 →
Transformers
精修版编码器
Encoder
Encoder 是 Transformer 架构中负责把输入序列编码成上下文化表示的部分。它通常可以双向查看输入,因此适合理解类任务,如分类、检索向量、重排、实体抽取和文档表征。
读寓言 →
Transformers
精修版多头注意力
Multi-Head Attention
Multi-Head Attention 把注意力分成多个 head,让模型在同一层中并行学习不同类型的关系,再把结果合并。不同 head 可以关注语法、指代、位置、任务约束、工具输出等不同模式。
读寓言 →
Transformers
精修版位置编码
Positional Encoding
Positional Encoding 给 Transformer 注入顺序和相对位置信息,因为自注意力本身对 token 顺序不敏感。它可以是固定编码、可学习编码,也可以发展为 RoPE、ALiBi 等位置方案。
读寓言 →
Transformers
精修版自注意力
Self-Attention
Self-Attention 让序列中的每个 token 在计算自己的表示时,查看同一序列里的其他 token,并按相关性分配权重。它是 Transformer 的核心能力,使模型能在上下文内部建立依赖关系。
读寓言 →
Transformers
精修版Transformer
Transformer
它是一种以自注意力机制为核心的神经网络架构,能让序列中不同位置直接互相参考,并行处理文本、代码、图像片段等信息。
读寓言 →
Trust and attribution
精修版引文
Citations
Citations 是为生成内容中的关键主张附上来源引用,让用户能检查证据、验证事实并追踪出处。企业 RAG 和 Agent 系统中,引用应指向真实支持该主张的文档片段、工具结果或记录版本。
读寓言 →
User-facing product / Productivity
精修版AI助手
AI Assistant, Copilot
AI Assistant / Copilot 是嵌入用户工作流、辅助完成具体任务的 AI 系统。它通常负责检索、起草、提醒、分析、生成候选方案或执行低风险步骤,而责任和关键决策仍由人或业务流程掌控。
读寓言 →
Vector search library
精修版FAISS
Facebook AI Similarity Search, FAISS
FAISS 是 Meta 开源的高效向量相似度搜索和聚类库,常用于本地向量检索和大规模近邻搜索。
读寓言 →
Workflow automation / Orchestration
AI工作流
AI Workflow, Agentic Workflow
它把模型判断、规则校验、工具调用、业务系统、人工审批和异常处理编排在一起,让 AI 不只是回答问题,而是稳定推进一件业务任务。
读寓言 →
交互机制
精修版智能体协商
Agent Negotiation
智能体协商让多个 Agent 在目标、资源或约束冲突时,通过交换信息、让步、承诺和验证达成决策。
读寓言 →
协作机制
精修版多智能体反思
Multi-Agent Reflection
Multi-Agent Reflection 是让多个 Agent 对方案、推理、工具结果或输出进行独立检查、互相批评、修正和汇总的机制。它可提高复杂任务质量,但需要防止群体附和、共享错误、过度自信和循环消耗。
读寓言 →
协作机制
精修版任务分解
Task Decomposition
Task Decomposition 是把复杂目标拆成可执行、可排序、可验证的子任务。对 Agent 来说,它决定规划质量、工具调用顺序、并行边界和失败恢复能力。好的任务分解应包含依赖关系、输入输出、验收标准、风险节点和重新规划机制。
读寓言 →
协作模式
精修版智能体辩论
Agent Debate
智能体辩论让多个 Agent 分别提出、反驳和检验证据,以提高复杂推理或高风险决策的可靠性。
读寓言 →
协作模式
精修版智能体群
Agent Swarm
智能体群让大量相对简单的 Agent 通过局部规则、共享信号和轻量协调共同解决问题。
读寓言 →
协作模式
精修版多智能体共识
Multi-Agent Consensus
Multi-Agent Consensus 是让多个 Agent、模型或角色在证据、观点或行动建议上形成可控一致的机制。它适用于高风险决策、复杂任务分解、交叉审查和多源信息判断。
读寓言 →
协作模式
精修版角色扮演多智能体
Role-Playing Multi-Agent
Role-Playing Multi-Agent 是让多个 Agent 扮演不同专业角色、利益相关者或审查视角,共同完成分析、生成、评审或决策。它的价值在于显式引入角色边界和职责差异,避免单一模型视角遗漏法律、运营、客户、技术、安全等约束。
读寓言 →
协作现象
精修版涌现行为
Emergent Behavior
Emergent Behavior 指系统中多个模型、Agent 或规则相互作用后,出现设计者没有逐条写出的整体行为。它可能带来效率,也可能形成拥堵、串谋、循环调用或风险放大。企业落地要把涌现行为纳入仿真、观测和治理。
读寓言 →
可观测性
精修版Agent 决策追踪
Agent Decision Tracing
Agent Decision Tracing 指把企业 Agent 在执行任务时的关键判断、上下文来源、工具调用、规则命中、备选路径和放弃原因记录下来,让团队能复盘“为什么这样做”。它不是普通日志堆积,而是决策链路的可解释证据。
读寓言 →
可观测性
精修版合规日志
Compliance Logging
合规日志按法规、合同、审计或内部政策要求,保留系统交互、控制执行和关键决策记录。
读寓言 →
可观测性
精修版用户反馈闭环
Feedback Loop
用户反馈闭环把行为、错误、投诉、人工修正和业务结果持续回流到产品、提示词、知识库、模型或流程中。
读寓言 →
可观测性
精修版幻觉检测
Hallucination Detection
幻觉检测判断模型输出是否与给定上下文、来源文档或已知事实不一致,常用主张抽取和证据匹配。
读寓言 →
可观测性
精修版LLM 可观测性
LLM Observability
LLM Observability 是对 LLM/Agent 应用的输入、prompt、模型调用、检索、工具调用、输出、延迟、错误、成本和质量指标进行采集、追踪和分析。它帮助团队定位幻觉、检索失败、成本异常、供应商问题和版本回归。
读寓言 →
可观测性
精修版延迟监控
Latency Monitoring
延迟监控持续衡量 LLM 或 Agent 请求耗时,常关注首 token 时间、解码速度、工具耗时和端到端延迟。
读寓言 →
可观测性
精修版生产漂移检测
Production Drift Detection
Production Drift Detection 是在线上生产环境持续监测输入分布、用户行为、工具返回、业务场景、模型输出质量和结果指标是否偏离上线时状态。
读寓言 →
可观测性
精修版提示版本管理
Prompt Versioning
提示版本管理记录提示模板版本,并关联部署时间、线上效果、评测结果、回滚记录和业务指标。
读寓言 →
可观测性
精修版Token 用量监控
Token Usage Monitoring
Token 用量监控会追踪输入 token、输出 token、总 token、成本、用户、产品区域、模型和请求类型。它让团队知道钱花在哪里、哪些请求异常、哪些功能毛利受压。
读寓言 →
可观测性
精修版调用链追踪
Tracing
Tracing 是记录一次请求在多个服务、Agent、模型、工具和 API 之间流转路径的可观测机制。它通常通过 trace id 串联多个 span,记录耗时、输入输出摘要、错误、重试和依赖关系。
读寓言 →
基准
精修版BIG-bench (超越模仿游戏基准)
Beyond the Imitation Game Benchmark
BIG-bench, Beyond the Imitation Game Benchmark 是一个覆盖大量任务的语言模型能力基准,目标是超越“是否像人”这类单一判断,系统评估模型在推理、知识、语言、数学和创造等多种任务上的表现。
读寓言 →
基准
精修版HumanEval (代码生成评估)
HumanEval
HumanEval 是用于评估代码生成模型的基准,通常给出函数签名、说明和测试,要求模型生成能通过测试的代码。
读寓言 →
基准
精修版MMLU (大规模多任务语言理解)
Massive Multitask Language Understanding
MMLU 是覆盖多学科和难度层级的语言理解基准,用于评估模型在知识、推理和考试题上的能力。
读寓言 →
基准
精修版SWE-bench
SWE-bench
SWE-bench 是评估模型解决真实软件工程问题的基准,通常要求模型基于真实开源仓库 issue 修改代码并通过测试。
读寓言 →
基准框架
精修版HELM (整体语言模型评估)
Holistic Evaluation of Language Models
Holistic Evaluation of Language Models, HELM 是斯坦福提出的整体语言模型评估框架,强调从准确性、校准、鲁棒性、公平性、效率、偏见、毒性等多个维度系统评估模型。
读寓言 →
安全方法
精修版模型安全评估
Model Safety Evaluation
模型安全评估用标准化或定制化测试集系统评估模型在有害内容、越狱、滥用、隐私、偏见、危险建议和策略绕过等场景下的表现。它关注拒答率、有害输出率、边界一致性、替代回答质量和多轮攻击下的稳定性。
读寓言 →
安全方法
精修版红队测试
Red Teaming
红队测试主动模拟攻击者或高风险用户,测试 AI 系统的安全边界、策略漏洞和失效模式。
读寓言 →
安全机制
精修版有害内容过滤
Harmful Content Filtering
有害内容过滤识别并拦截暴力、色情、仇恨、自残、违法指导和骚扰等内容,是安全治理基础层。
读寓言 →
对齐技术
基于人类反馈的强化学习
RLHF (Reinforcement Learning from Human Feedback)
它通常先让模型学会生成,再收集人类对多个回答的偏好比较,用这些偏好训练奖励模型,最后用强化学习方法调整模型,让输出更接近人类偏好的方向。
读寓言 →
对齐技术
精修版安全微调
Safety Fine-Tuning
安全微调用安全数据继续训练模型,使其更稳定地拒绝危险请求、减少有害输出并遵守企业策略边界。
读寓言 →
工具
精修版评估套件
Eval Suite / Eval Harness
评估套件把测试数据、任务场景、执行流程、评分规则和报告汇总起来,用于可重复地评估模型或 Agent。
读寓言 →
指标
精修版任务成功率
Task Success Rate
Task Success Rate 衡量 Agent 或自动化系统在给定任务上真正完成用户目标的比例。它不能只看调用次数、响应次数或流程是否启动,而要定义清楚成功条件、验收证据和失败分类。
读寓言 →
攻击类型
精修版对抗性示例
Adversarial Examples
Adversarial Examples 是经过刻意设计、看起来正常却会诱导模型或系统犯错的输入。它们在企业 Agent 中可能表现为恶意提示、相似但错误的文档、格式陷阱、视觉噪声、边缘业务请求等。
读寓言 →
攻击类型
精修版拒绝服务攻击
Denial-of-Service (DoS) on LLM
LLM 拒绝服务攻击通过超长上下文、递归任务、大量并发或昂贵工具调用耗尽模型服务资源。
读寓言 →
攻击类型
精修版间接提示注入
Indirect Prompt Injection
间接提示注入把恶意指令藏在网页、文档、邮件等外部内容中,等待 Agent 检索或读取后触发。
读寓言 →
攻击类型
精修版越狱
Jailbreak
越狱是试图通过角色扮演、重述问题、混淆表达、多轮诱导、编码语言等方式,绕过模型或 Agent 的安全、策略和权限边界。
读寓言 →
攻击类型
精修版多模态越狱
Multi-modal Jailbreak
多模态越狱通过图片、音频、视频、截图、二维码或排版等非文本输入绕过模型安全边界。
读寓言 →
攻击类型
精修版提示注入
Prompt Injection
提示注入是用户可控文本试图覆盖、绕过或操纵 AI 系统指令的攻击方式。
读寓言 →
攻击类型
精修版越狱
Prompt Leaking
提示词泄露是攻击者通过诱导、角色扮演、翻译、格式转换或多轮套话,让模型泄露系统提示、开发者指令、隐藏规则、工具说明、私有上下文或敏感数据的攻击手法。
读寓言 →
架构
精修版智能体编排
Agent Orchestration
Agent Orchestration 是对一个或多个 Agent 的任务分配、状态流转、工具调用、审批、重试和终止条件进行编排。
读寓言 →
架构
精修版黑板架构
Blackboard Architecture
Blackboard Architecture 是一种协作架构:多个专业模块或 Agent 通过共享的黑板状态读取问题、写入中间结果、更新假设并触发下一步处理。
读寓言 →
架构
精修版去中心化多智能体
Decentralized Multi-Agent
Decentralized Multi-Agent 是没有单一中央控制器的多智能体系统,多个 Agent 通过局部观察、协议、消息传递和一致性规则协同工作。
读寓言 →
架构
精修版层级多智能体
Hierarchical Multi-Agent
Hierarchical Multi-Agent 是把多个 Agent 按层级组织起来,上层负责目标、策略、分配和监督,下层负责执行、局部决策和异常反馈。
读寓言 →
架构
精修版混合多智能体
Hybrid Multi-Agent
Hybrid Multi-Agent 是结合集中式编排、层级控制、去中心化协作和局部自治的多智能体设计。企业系统常需要混合模式:高风险动作走中心审批,低风险局部任务自治执行,异常再升级。关键是划分控制面、自治范围、同步点和治理规则。
读寓言 →
架构
精修版多智能体系统
Multi-Agent System (MAS)
Multi-Agent System (MAS) 是由多个自治或半自治 Agent 组成的系统,这些 Agent 通过通信、协作、竞争、协商或编排共同完成单个 Agent 难以完成的目标。
读寓言 →
治理
精修版AI 治理
AI Governance
AI 治理是组织围绕 AI 系统开发、采购、部署、运营和退役建立的政策、流程、角色、控制和问责框架。
读寓言 →
治理
精修版访问控制
Access Control
访问控制限制哪些用户、Agent、工具、模型、知识库和资源可以执行哪些具体动作。
读寓言 →
治理
精修版Agent 身份与认证
Agent Identity & Authentication
Agent 身份与认证为 Agent 建立可验证身份,并在调用系统、工具或数据前完成认证和授权校验。
读寓言 →
治理
审计日志
Audit Logs
审计日志是系统为关键行为留下的可追踪记录,通常包括谁、在什么时候、从哪里、以什么权限、请求了什么、调用了哪些工具、看到或改了什么、结果如何、是否经过审批。
读寓言 →
治理
自主性级别
Autonomy Levels
它描述一个 Agent 在任务中拥有多少决策权、行动权和例外处理权,以及人类需要在多频繁、多关键的位置介入。
读寓言 →
治理
精修版数据隐私与 PII 遮蔽
Data Privacy & PII Masking
Data Privacy & PII Masking 指在 AI/Agent 处理数据时保护个人隐私,并通过遮蔽、替换、泛化、脱敏、最小化、访问控制和审计来降低 PII 暴露风险。
读寓言 →
治理
人类在回路内
Human-in-the-Loop (Deep HITL)
它指人在 AI 或 Agent 执行过程中多次参与,不只是最终审批,而是在理解、计划、执行、纠错和接管等环节提供判断。
读寓言 →
治理
人类在回路中
Human-in-the-Loop (HITL)
它是在自动化流程的特定节点加入人工审核、批准、纠错或接管,让系统在风险、低置信度或高影响场景下有人类判断。
读寓言 →
治理
人类在回路外
Human-on-the-Loop (HOTL)
AI 系统自主执行但人类保持监督态势,仅在系统发出告警或异常时才介入的更宽松的控制模式。
读寓言 →
治理
精修版模型审批流程
Model Approval Workflow
Model Approval Workflow 是模型从试验进入生产或扩大使用前的审批流程,通常覆盖用途说明、风险分级、评测结果、安全合规、数据限制、负责人、上线范围和回滚计划。
读寓言 →
治理
精修版模型风险评估
Model Risk Assessment
模型风险评估是在上线前对模型的能力边界、潜在有害使用场景、偏见放大风险和滥用可能性进行结构化评估。
读寓言 →
治理
精修版速率限制
Rate Limiting
速率限制控制某个用户、租户、IP、API key、工作流或 Agent 在一个时间窗口内能发起多少请求、动作、token、工具调用或昂贵操作。
读寓言 →
治理
精修版负责任 AI
Responsible AI
Responsible AI 指在设计、部署和运营 AI/Agent 时,把合法性、公平、隐私、安全、透明、人工监督和问责纳入系统,而不是只追求自动化效率。
读寓言 →
治理
精修版后悔权与撤销机制
Right to Appeal & Rollback
Right to Appeal & Rollback 是在 AI 或 Agent 决策影响用户、客户或业务权益时,提供申诉、复核、撤销、恢复和版本回退的机制。
读寓言 →
治理
精修版安全事故响应
Security Incident Response
安全事故响应是对提示注入、数据泄露、凭证暴露、越权访问等安全事件的结构化处置流程。
读寓言 →
治理
精修版使用策略
Usage Policy
使用策略规定 AI、模型、数据、工具或 Agent 哪些用途可以接受,哪些用途禁止或需要审批。它要覆盖用户类型、数据类别、任务风险、禁止行为、例外处理和执行机制。
读寓言 →
评估
精修版LLM 评估
LLM Evaluation (Eval)
LLM 评估通过自动化测试、人工评分、模型裁判、对抗探针和线上监控衡量模型或 Agent 表现。
读寓言 →
评估方法
精修版对抗性评估
Adversarial Evaluation
对抗性评估是故意构造迷惑性、边界性、恶意或压力型输入,测试模型和 Agent 的鲁棒性、安全边界与失败模式。它覆盖 prompt injection、jailbreak、工具滥用、数据外泄、策略绕过、组合攻击和高压业务场景。
读寓言 →
评估方法
精修版对齐评估
Alignment Evaluation
对齐评估衡量模型或 Agent 是否符合人类意图、企业政策、安全边界和业务目标。
读寓言 →
评估方法
精修版能力评估
Capability Evaluation
Capability Evaluation 是对模型或 Agent 的具体能力进行分项、可复现的测试,例如推理、检索、工具使用、长上下文、协作、拒答、安全边界和业务任务完成。
读寓言 →
评估方法
精修版人工评估
Human Evaluation
人工评估是由人类评审者根据 rubric、业务语境和质量标准判断模型或 Agent 输出。它适合主观、复杂、高风险或自动指标覆盖不足的任务,例如销售话术质量、客户语气、事实解释、风险判断和最终交付可用性。
读寓言 →
评估方法
精修版逐轮评估
Per-Turn Evaluation
Per-Turn Evaluation 是对 Agent 或对话系统在每一轮行动、工具调用、观察和回复中进行评估,而不仅看最终结果。
读寓言 →
评估问题
精修版能力污染与数据泄露
Contamination & Data Leakage
Contamination & Data Leakage 指训练、调优或提示过程中接触了评测集、答案、近似题或敏感业务数据,导致模型表现被高估或隐私泄露。它会破坏基准可信度,也可能把客户数据带入不该出现的输出。
读寓言 →
评估问题
精修版提示敏感度
Prompt Sensitivity
Prompt Sensitivity 指模型对提示措辞、顺序、格式、示例选择或字段命名的变化表现出明显性能波动。它会让企业 Agent 在相同事实下给出不同判断,影响评测稳定性和生产可靠性。
读寓言 →
调度
精修版Agent 路由
Agent Routing
Agent 路由根据请求内容、子任务类型、能力描述、权限边界、负载和历史表现分配任务。
读寓言 →
通信
精修版Agent 通信协议
Agent Communication Protocol
Agent Communication Protocol 是定义 Agent 间消息格式、语义和交互规则的协议或语言。它不仅规定字段,还要表达通信意图,例如请求、通知、承诺、拒绝、查询、委托和确认。
读寓言 →