Concept Fables

把 AI / Agent 概念讲成能记住的故事

这里收录 684 个概念。每个词条先用寓言建立理解过程,故事结束后再揭示定义和隐喻映射;已完成全量复审,并对 109 个重点页面做过二次精修。

精选精修

已经人工精修的重点概念

670 篇

Agent 运行时工具调用工具注册表Weights & Biases Weave合成数据低秩适配量化低秩适配推理引擎蒸馏批量推理在线推理模型路由语义缓存推理端点模型网关模型上下文协议AI 工作替代率自动化偏转率自动驾驶副驾驶水印服务即软件Agent 运营模型Agent 拥有人职权边界自主级别运营指标智能体循环执行器规划器动作计算机使用GUI 智能体网页智能体工具选择运行运行步骤实时智能体语音智能体情景记忆记忆压缩语义记忆审批流状态图Agent-to-Agent 协议长期记忆工作记忆草稿区LangGraph对齐宪法式 AI直接偏好优化偏好数据偏好优化近端策略优化AI 反馈强化学习基于人类反馈的强化学习奖励模型大模型应用分层可导航小世界图注意力掩码ALiBiBERT因果注意力/自回归上下文长度/窗口交叉注意力纯解码器扩散语言模型编码器-解码器前馈网络GPT分组查询注意力Jamba层归一化线性注意力MambaMoD混合专家模型多查询注意力残差连接RMSNorm旋转位置编码滑动窗口注意力状态空间模型SwiGLUT5视觉 Transformer权重绑定审计证据审计轨迹可审计性内部审计来源引用不可篡改日志智能体工作流工作流幂等性任务队列计量年度经常性收入流失率净收入留存客户健康分毛利单位经济模型企业销售理想客户画像产品主导增长销售主导增长客户获取成本客户生命周期价值服务级别协议Token 成本客户成功专业服务托管服务混合定价结果定价席位定价用量定价软件即服务产品化服务数字员工技能合规映射控制测试技术文档控制框架控制措施ISO 27001SOC 2 Type ISOC 2 Type IISOC 2AWQbitsandbytes深度剪枝蒸馏推理模型GGMLGPTQGGUF模型剪枝训练后量化量化感知训练稀疏性结构化剪枝非结构化剪枝宽度剪枝思维链与草稿区C2PA人在回路会话线程交接Token 预算预算感知路由智能客服LlamaIndex文档解析OCR数据连接器数据飞轮束搜索解码贪心解码Logits采样温度Top-k 采样Top-p 采样反向传播深度学习神经网络表征学习金丝雀发布灰度发布私有化部署本地化部署容器Kubernetes蓝绿部署金丝雀发布基础设施即代码GitOps持续集成与持续交付插槽填充噪声预测器/UNet流水线并行张量并行数据并行FSDPZeRO版面分析表格抽取数据集说明书模型卡系统卡Chroma嵌入语义相似度向量数据库词嵌入平台工程开发者体验知识库问答Semantic Kernel共创试点评测基准基准污染数据泄漏分布偏移困惑度步骤成功率工具调用准确率轨迹评估LLM 评测平台成本归因微调指令微调参数高效微调监督微调全量微调指令数据分层学习率拒绝采样人工智能模型扩散模型扩散变换器潜在扩散模型场景化落地AI 影响评估AI 使用场景清单数据血缘治理、风险与合规策略引擎来源证明影子 AI可追溯性透明度可信 AI智能体策略AI 披露控制所有人人工监督偏见可解释性公平性三道防线内容过滤策略即代码人工智能运维交付验收自回归解码最佳-of-N 采样上下文剪枝动态批处理早出Flash Attention推理缓存卸载量化 KV 缓存算子融合延迟回顾解码Medusa模型服务分页注意力预填充前缀缓存量化推测解码推测编辑推测前缀树投机采样测试时计算吞吐量树搜索连续批处理提示缓存运行时检索增强生成知识图谱本体三元组图增强检索生成上下文窗口语言模型大语言模型LiteLLM智能体记忆规划幻觉少样本提示上下文学习提示词提示工程系统提示词零样本提示思维链LangChainTruLens解码阶段预填充分页注意力文本生成推理缓存LangSmithHelicone成本跟踪LangChain 表达式语言签名DSPyKV 缓存首 Token 时间提示词管理评测黄金数据集模型文件配置Ollama特征库模型版本管理模型漂移模型注册表泛化梯度下降超参数损失函数机器学习过拟合参数强化学习监督学习测试集训练集无监督学习验证集OpenAI 助手 API助手OpenAI 响应 API文件搜索代码解释器Pinecone标杆案例辅助损失专家路由Top-k 路由模型清单模型监控模型风险管理模型验证函数调用JSON 模式结构化输出结构化输出监督智能体群聊编排AutoGenAgent 团队用户代理 AgentCrewAICLIP交叉模态对齐多模态模型视频理解对比学习跨模态嵌入多模态视觉语言模型实体抽取关系抽取Haystack工具调用延迟跨度跟踪记录OpenTelemetryArize PhoenixLangfuseMilvusQdrantWeaviate变更管理升级路径异常处理热加载人工旁路监督事后复盘质量保障回滚回滚计划根因分析云成本运营自动扩缩容大语言模型运维机器学习运维死信队列灾难恢复可观测性恢复点目标恢复时间目标事故响应抽样复核版本控制审批门槛变更咨询委员会AI 事故业务连续性置信度阈值事实核验事故管理有向无环图意图识别语义路由路由器适配器IA3合并权重前缀微调提示微调目标模块选择工作流引擎配额连接器持久执行云原生内部开发者平台黄金路径AI 政策可接受使用政策pgvectorBPESentencePiece语料库基座模型预训练自监督学习匿名化数据最小化数据保护影响评估数据保留政策差分隐私成员推断攻击模型反演攻击个人数据个人身份信息假名化目的限制安全聚合敏感个人数据跨境数据传输数据本地化数据驻留供应商评估供应商锁定数据处理协议数据使用权子处理方训练数据排除退出计划第三方风险管理供应商尽职调查安全问卷产品市场匹配价值实现时间自助服务用户画像概念验证特性开关入门引导激活最小可行产品待完成任务AI 原生工作流提示优化器语义函数评测框架双重量化NF4多模态 RAG重排序器答案相关性上下文精确率上下文召回率忠实性检索精确率检索召回率思维图自我一致性思维树程序辅助语言模型推理-行动范式EU AI 法案通用目的 AI高风险 AI 系统合格评定回退熔断器错误预算服务级别目标降级模型回退事实锚定嵌入交叉编码器BM25双编码器假设文档嵌入最大边际相关性多跳检索查询改写递归检索近似最近邻搜索文档存储向量数据库生态密集检索混合搜索语义搜索稀疏检索分块父子分块语义分块滑动窗口分块重排序查询引擎AI 风险管理AI 风险管理框架幻觉风险剩余风险风险接受风险偏好风险评估风险所有人风险登记册多租户租户隔离安全护栏销售智能体AI 安全基于属性的访问控制后门攻击上下文污染数据外泄数据投毒越权代理模型投毒OWASP LLM Top 10权限边界基于角色的访问控制供应链风险工具输出污染沙箱审计日志权限模型最小权限原则机密管理信息安全管理体系职责分离数据防泄漏vLLM流式响应每秒 token 数Chunked Prefill草稿模型状态机语音识别语音合成多智能体编排编排上下文工程字节对编码词元分词分词器词表浏览器工具插件激活检查点bf16灾难性遗忘思维链训练Chinchilla 方案持续预训练课程学习数据混合去噪目标GRPO掩码语言建模混合精度训练多任务学习下一个词预测预训练强化微调可验证奖励强化学习缩放定律联邦学习知识蒸馏数据增强注意力机制解码器编码器多头注意力位置编码自注意力Transformer引文AI助手FAISS智能体协商多智能体反思任务分解智能体辩论智能体群多智能体共识角色扮演多智能体涌现行为Agent 决策追踪合规日志用户反馈闭环幻觉检测LLM 可观测性延迟监控生产漂移检测提示版本管理Token 用量监控调用链追踪BIG-bench (超越模仿游戏基准)HumanEval (代码生成评估)MMLU (大规模多任务语言理解)SWE-benchHELM (整体语言模型评估)模型安全评估红队测试有害内容过滤安全微调评估套件任务成功率对抗性示例拒绝服务攻击间接提示注入越狱多模态越狱提示注入越狱智能体编排黑板架构去中心化多智能体层级多智能体混合多智能体多智能体系统AI 治理访问控制Agent 身份与认证数据隐私与 PII 遮蔽模型审批流程模型风险评估速率限制负责任 AI后悔权与撤销机制安全事故响应使用策略LLM 评估对抗性评估对齐评估能力评估人工评估逐轮评估能力污染与数据泄露提示敏感度Agent 路由Agent 通信协议

领域分类

全部概念

684 个

Coding agent / developer tool

新增

opencode

AI Coding Agent

opencode 是面向编程任务的开源 AI coding agent,适合在代码库里理解工程、编辑文件、运行命令、调试错误、生成测试和重构代码。它是生产业务 Agent 的开发工具,不是业务 Agent 本身。

读寓言 →

Agent runtime / harness

新增

OpenClaw

Agent Runtime / Harness

OpenClaw 是更通用的 Agent runtime / harness,把渠道、会话、工具、技能、记忆、任务、自动化和节点能力组织成可持续运行的智能体基础设施。

读寓言 →

AI agent platform

精修版

Agent 运行时

Agent Runtime

Agent 运行时是让智能体真正执行工作的运行环境。它不只是调用一次大模型,而是负责管理任务状态、上下文、工具调用、权限边界、人工审批、错误恢复、日志追踪和多步骤执行。

读寓言 →

AI agent platform

精修版

工具调用

Tool Calling, Function Calling

工具调用,也叫 Function Calling,是模型以结构化方式请求外部函数、API、数据库、文件系统或业务系统来完成任务的机制。

读寓言 →

AI agent platform

精修版

工具注册表

Tool Registry

工具注册表是对 Agent 可用工具的集中目录和控制层。它记录工具名称、用途、参数 schema、调用方式、权限要求、风险等级、审批规则、速率限制、返回格式和负责人。

读寓言 →

AI application observability and evaluation tool

精修版

Weights & Biases Weave

Weights & Biases Weave

Weights & Biases Weave 是面向 AI 应用的追踪、评测和调试工具,可记录模型调用、提示、输出和迭代过程。

读寓言 →

AI engineering / data pipeline

精修版

合成数据

Synthetic Data

合成数据由模型、规则或仿真系统生成,用于训练、微调、评测和测试覆盖,关键在质量过滤与分布边界。

读寓言 →

AI engineering / fine-tuning

精修版

低秩适配

LoRA, Low-Rank Adaptation

LoRA(Low-Rank Adaptation)是一种参数高效微调方法。它冻结基础模型大部分权重,只训练小规模低秩矩阵来适配特定任务,从而显著降低训练成本、显存需求和多任务适配复杂度。

读寓言 →

AI engineering / fine-tuning

精修版

量化低秩适配

QLoRA, Quantized LoRA

QLoRA(Quantized LoRA)是在量化后的基础模型上训练 LoRA 适配器的方法,常见做法是用 4-bit 量化降低显存占用,同时训练少量 adapter 参数。

读寓言 →

AI engineering / infrastructure

精修版

推理引擎

Inference Engine

推理引擎负责高效执行模型前向计算,并管理显存、KV cache、批处理、并发调度、流式输出和硬件加速。

读寓言 →

AI engineering / model optimization

精修版

蒸馏

Distillation

蒸馏是用大模型或强模型的输出、解释或偏好信号训练较小模型,使小模型以更低成本复现部分能力。企业常用蒸馏降低推理成本、提升延迟表现,或把通用模型能力迁移到专门任务;但必须明确适用范围、评测标准和回退机制。

读寓言 →

AI engineering / operations

精修版

批量推理

Batch Inference

批量推理是将大量输入集中提交给模型离线处理,适合标注、报表生成、文档处理、推荐召回、质量扫描和非实时任务。它通常优化吞吐、单位成本、重试和作业管理,而不是单个请求的即时延迟。

读寓言 →

AI engineering / operations

精修版

在线推理

Online Inference

在线推理是在用户请求发生时实时调用模型生成结果,典型约束是低延迟、高可用、并发能力、流式响应和错误处理。企业 Agent 的在线推理还要考虑鉴权、上下文装配、工具调用、升级路径、SLA 和可观测性。

读寓言 →

AI platform / cost optimization

精修版

模型路由

Model Routing

模型路由 Model Routing 是根据任务类型、质量要求、成本、延迟、上下文长度、风险、权限或供应商状态,选择调用不同模型的机制。它避免所有任务都使用最贵或最强模型,也避免关键任务被低能力模型处理。

读寓言 →

AI platform / cost optimization

精修版

语义缓存

Semantic Cache

语义缓存 Semantic Cache 是根据请求的语义相似度复用已有回答、中间结果、检索结果或工具结果的机制。它不同于只按完全相同字符串命中的普通缓存,而是判断两个请求在含义上是否足够接近。

读寓言 →

AI platform / deployment

精修版

推理端点

Inference Endpoint

推理端点是模型服务暴露给应用调用的网络入口,通常包含鉴权、请求格式、路由、版本管理、限流、负载均衡、日志和监控。它把模型能力变成可被应用稳定调用的服务契约,是部署和运行治理的重要边界。

读寓言 →

AI platform / infrastructure

精修版

模型网关

Model Gateway, AI Gateway

模型网关 / AI Gateway 统一接入多个模型供应商或自部署模型,并提供鉴权、路由、限流、日志、缓存、fallback、成本控制和策略执行。它让企业在多模型环境下避免应用到处硬编码供应商调用,同时集中治理安全、质量、成本和可用性。

读寓言 →

AI platform / integration

精修版

模型上下文协议

Model Context Protocol, MCP

模型上下文协议 MCP(Model Context Protocol)是一种让 AI 应用以标准方式连接外部工具、数据源和上下文服务的协议。

读寓言 →

AI product metrics / operations

精修版

AI 工作替代率

AI Task Automation Rate

AI 工作替代率衡量原本由人完成的任务中,有多少比例被 AI 自动完成或显著减少人工介入。它比调用量、会话量、生成字数更接近商业价值,因为它直接连接人工成本、交付能力和毛利改善。

读寓言 →

AI product metrics / support operations

精修版

自动化偏转率

Deflection Rate

自动化偏转率衡量 AI 或自助系统成功处理并避免转人工处理的请求比例,常见于客服、IT 支持和运营工单。它必须和解决质量、错误拦截、升级准确性一起看;单纯降低人工转接可能损害客户体验。

读寓言 →

AI product pattern

精修版

自动驾驶

Autopilot

Autopilot 是让 AI 在明确目标、权限边界和监控机制下自主完成任务的产品模式。人工主要负责设定目标、监督边界、处理异常和验收结果。

读寓言 →

AI product pattern

精修版

副驾驶

Copilot

Copilot 是辅助人完成工作的 AI 产品模式。AI 提供草稿、建议、检索、比较、检查和下一步推荐,由人保留最终判断、编辑、批准或提交权。企业场景里,Copilot 的价值在于提升专业人员产能和质量,同时保持责任边界清晰。

读寓言 →

AI safety

精修版

水印

Watermarking

Watermarking 是在 AI 生成内容中嵌入可检测信号,用来提示或验证内容来源。

读寓言 →

AI-native business model

精修版

服务即软件

Services-as-Software

服务即软件是用 AI 和自动化把原本由人工交付的服务流程产品化,让客户购买业务结果,而不只是购买工具访问权。它区别于传统 SaaS 的关键在于:供应方承担更多工作流执行和结果责任,定价更靠近任务、工单、交付量或结果。

读寓言 →

Agent Operating Model

精修版

Agent 运营模型

Agent Operating Model

Agent 运营模型是企业为生产中的 Agent 设计的一整套组织运行方式:谁拥有 Agent,任务如何分派,如何监督,如何衡量,如何升级给人,如何改进,如何处理事故和合规风险。它把单个 Agent 能力变成可持续交付体系。

读寓言 →

Agent Operating Model

精修版

Agent 拥有人

Agent Owner

Agent 拥有人是对某个 Agent 的目标、权限、性能、风险和生命周期负责的业务或技术拥有人。企业里不能把 Agent 责任悬空在“模型”“平台”“IT”或“业务团队”之间;必须明确谁能改它、谁看指标、谁处理事故、谁决定升级或停用。

读寓言 →

Agent Operating Model

精修版

职权边界

Authority Boundary

职权边界是 Agent 被允许做出的决定、动作、花费、数据访问和外部承诺的明确限制。它把“能调用工具”进一步约束为“在什么条件下能调用、能影响多大范围、是否需要审批、是否能对外承诺”。

读寓言 →

Agent Operating Model

精修版

自主级别

Autonomy Level

自主级别是对 Agent 独立工作程度的分级:它可以只推荐、先草拟、在审批后执行、在限额内自主执行,或在特定场景下全自动运行。企业治理中,自主级别决定人工介入方式、审批门槛、审计要求和风险边界。

读寓言 →

Agent Operating Model

精修版

运营指标

Operating Metrics

运营指标是用来管理生产中 Agent 的量化指标,例如完成率、升级率、错误率、延迟、成本、返工率、一次验收率和事故率。

读寓言 →

Agent architecture

精修版

智能体循环

Agent Loop

智能体循环是 Agent 运行的基本闭环:观察状态、推理规划、选择动作、调用工具执行,再把结果写回上下文进入下一轮。

读寓言 →

Agent architecture

精修版

执行器

Executor

执行器负责把计划步骤落实为实际动作,如调用工具、运行代码、访问外部系统,并把结果返回给评估或重新规划。

读寓言 →

Agent architecture

精修版

规划器

Planner

规划器负责把用户目标拆成可执行步骤、子目标、约束和依赖关系,并在新信息出现时调整计划。

读寓言 →

Agent capability

精修版

动作

Action

动作是 Agent 在环境中执行的离散操作,通常通过工具、函数、API、浏览器或 GUI 自动化完成。它和普通文本回答不同:动作会改变外部系统状态,例如发邮件、改记录、创建订单、提交表单或调用付款接口。

读寓言 →

Agent capability

精修版

计算机使用

Computer Use

Computer Use 指模型通过屏幕、鼠标、键盘或 UI 自动化直接操作计算机环境的能力。它让 Agent 能处理没有 API、接口不完整或只能通过桌面软件完成的任务。

读寓言 →

Agent capability

精修版

GUI 智能体

GUI Agent

GUI Agent 是通过视觉识别和界面操作完成软件任务的 Agent。它理解屏幕上的控件、文本、表格、弹窗和状态变化,并通过点击、输入、选择等动作推进任务。

读寓言 →

Agent capability

精修版

网页智能体

Web Agent

Web Agent 是在网页环境中搜索、导航、填写表单、下载资料和执行操作的智能体。它需要理解页面内容、保持任务状态、处理登录和动态页面、判断证据质量,并在高风险网页动作前请求人工批准。

读寓言 →

Agent decision-making

精修版

工具选择

Tool Selection

Tool Selection 是 Agent 根据当前子任务,从可用工具、函数或 API 中选择该调用哪一个以及用什么参数调用的过程。它不只是能力匹配,还涉及意图识别、权限边界、风险等级、成本、可回滚性和是否需要人工批准。

读寓言 →

Agent execution object

精修版

运行

Run

Run 表示 Assistant 或 Agent 针对一个 thread/request 的一次完整执行。它包含模型推理、消息生成、工具调用、等待人工动作、错误处理和最终输出等过程。

读寓言 →

Agent execution trace

精修版

运行步骤

Run Step

Run Step 是 Run 中的中间执行记录,例如一次模型消息生成、一次工具调用、一次等待人工动作或一次失败重试。它让团队能够检查 Agent 执行过程,而不是只看最终回答。

读寓言 →

Agent interface

精修版

实时智能体

Real-Time Agent

Real-Time Agent 是在低延迟、流式交互中理解输入、规划行动、调用工具并持续回应的 Agent。它常用于语音、客服、调度、监控和协作场景,关键要求是低延迟、增量理解、状态持续更新、及时打断和安全升级。

读寓言 →

Agent interface

精修版

语音智能体

Voice Agent

Voice Agent 是通过语音输入输出与用户实时交互并完成任务的 Agent。它结合语音识别、实时理解、对话管理、工具调用、语音合成和人工升级。

读寓言 →

Agent memory

精修版

情景记忆

Episodic Memory

情景记忆记录具体事件、交互、观察和结果,通常包含时间、来源、参与者、动作和后果等元数据。

读寓言 →

Agent memory

精修版

记忆压缩

Memory Compression

Memory Compression 将长对话、历史观察、检索材料或执行轨迹压缩成更短的摘要、结构化事实或可检索记忆,使它们能放进后续 context budget,同时尽量保留对任务有用的信号。

读寓言 →

Agent memory

精修版

语义记忆

Semantic Memory

Semantic Memory 是从具体事件中抽象出来的事实、概念、用户偏好、业务规则和领域知识。它不同于 Episodic Memory:后者保留一次次发生过的经历,前者保存可复用的稳定知识。

读寓言 →

Agent operations / governance

精修版

审批流

Approval Flow, Human Approval

审批流是在高风险动作前加入人工确认的控制机制,常用于付费、外部写入、权限变更和删除操作。

读寓言 →

Agent orchestration pattern

精修版

状态图

State Graph

状态图把 Agent 工作流建模为一组节点和边:节点读取并更新共享状态,边根据状态决定下一步执行。它适合表达会分支、循环、等待、重试和恢复的 Agent 流程。

读寓言 →

Agent protocol

精修版

Agent-to-Agent 协议

Agent2Agent, A2A

Agent2Agent, A2A 指面向不同 Agent 之间互操作和通信的协议方向,让一个 Agent 能发现另一个 Agent 的能力、发起任务、传递上下文、接收状态和处理结果。它关注跨系统、跨供应商、跨组织的协作边界。

读寓言 →

Agent state

精修版

长期记忆

Long-Term Memory

Long-Term Memory 是保存在当前上下文窗口之外、可跨会话和跨任务检索的信息。它让企业 Agent 记住客户偏好、历史承诺、领域事实、未完成任务和长期状态。

读寓言 →

Agent state

精修版

工作记忆

Working Memory

Working Memory 是 Agent 在当前任务中临时持有和操作的状态,包括目标、约束、最近观察、工具结果、中间产物、假设和下一步计划。它通常位于上下文窗口、scratchpad、状态对象或工作流 state 中。

读寓言 →

Agent state / reasoning workspace

精修版

草稿区

Scratchpad

Scratchpad 是 Agent 在当前任务中使用的临时工作区,用来记录中间观察、计算、计划、工具结果和执行备注。它帮助 Agent 维持任务状态,但通常不应无筛选地进入长期记忆或用户输出。

读寓言 →

Agent workflow framework

精修版

LangGraph

LangGraph

LangGraph 是用于构建有状态、多步骤、可控制 Agent 工作流的图式框架。

读寓言 →

Alignment

精修版

对齐

Alignment

对齐让 AI 模型或 Agent 的行为符合人类意图、组织政策、安全边界和真实任务目标。

读寓言 →

Alignment

精修版

宪法式 AI

Constitutional AI

宪法式 AI 用一组明确原则指导模型生成、批评和修订输出,以减少对逐条人工偏好标注的依赖。

读寓言 →

Alignment

精修版

直接偏好优化

Direct Preference Optimization, DPO

DPO 是基于偏好数据直接优化语言模型的方法,用同一输入下好坏响应的对比来调整模型行为。

读寓言 →

Alignment

精修版

偏好数据

Preference Data

Preference Data 是用于训练奖励模型、DPO、RLHF、RLAIF 或其他偏好优化方法的数据,通常包含同一输入下多个响应及其排序、选择或评分。它表达的是“哪种行为更被接受”,而不只是标准答案。

读寓言 →

Alignment

精修版

偏好优化

Preference Optimization

偏好优化利用人类或模型偏好信号改进模型行为,常见方法包括 RLHF、RLAIF、DPO、IPO 和 KTO。

读寓言 →

Alignment

精修版

近端策略优化

Proximal Policy Optimization, PPO

Proximal Policy Optimization, PPO 是一种强化学习算法,常用于 RLHF 中根据奖励模型优化语言模型策略。它通过限制新策略相对旧策略的更新幅度,避免模型为了追求奖励而发生过大的行为漂移。

读寓言 →

Alignment

精修版

AI 反馈强化学习

Reinforcement Learning from AI Feedback, RLAIF

Reinforcement Learning from AI Feedback, RLAIF 是使用 AI 系统产生的反馈或偏好信号来训练、对齐模型的方法。它可以降低人工标注成本、扩大反馈覆盖面,并用于宪法式 AI、自动偏好评审和安全评估。

读寓言 →

Alignment

精修版

基于人类反馈的强化学习

Reinforcement Learning from Human Feedback, RLHF

RLHF 用人类偏好训练模型,通常包括收集偏好、训练奖励模型,并用强化学习优化模型输出。

读寓言 →

Alignment

精修版

奖励模型

Reward Model

Reward Model 是根据人类或 AI 偏好数据训练出的模型,用来给候选输出打分或排序,预测哪些响应更符合目标偏好。在 RLHF 中,奖励模型通常指导后续强化学习优化。

读寓言 →

Application layer / Product

精修版

大模型应用

LLM Application, Large Model Application

LLM Application / Large Model Application 是把大模型能力嵌入具体业务流程,连接数据、工具、权限、用户界面、评测和运营机制,形成可交付的软件或服务。

读寓言 →

Approximate nearest neighbor index

精修版

分层可导航小世界图

Hierarchical Navigable Small World, HNSW

HNSW 是一种图结构近似最近邻索引,通过分层小世界网络加速向量检索,常用于向量数据库。

读寓言 →

Architecture

精修版

注意力掩码

Attention Mask

Attention Mask 用于控制注意力机制中哪些 token 可以被其他 token 关注。常见用途包括因果掩码、防止模型看到未来 token、忽略 padding token,以及在某些架构中隔离不同区域的信息。

读寓言 →

Architecture

精修版

ALiBi

Attention with Linear Biases

ALiBi(Attention with Linear Biases)是在注意力分数中加入与距离相关的线性偏置,通常让模型更偏向近距离 token,同时保留关注远距离 token 的可能。

读寓言 →

Architecture

精修版

BERT

Bidirectional Encoder Representations from Transformers

BERT 是只使用编码器的 Transformer 模型,通过遮蔽语言建模预训练,适合分类、匹配和理解类任务。

读寓言 →

Architecture

精修版

因果注意力/自回归

Causal Attention / Autoregressive

Causal Attention / Autoregressive 指生成当前位置时只能关注当前位置之前的 token,不能看到未来 token。它是自回归语言模型的基础,使模型能按顺序预测下一个 token 并生成文本。

读寓言 →

Architecture

精修版

上下文长度/窗口

Context Window / Context Length

Context Window / Context Length 指模型一次前向计算可处理的最大 token 数,是模型架构和部署配置的重要能力指标。它不同于应用层的上下文策略:模型支持长上下文,并不意味着每个请求都应该填满。

读寓言 →

Architecture

精修版

交叉注意力

Cross-Attention

交叉注意力让一个序列在生成或更新表示时,动态关注另一个序列中的相关信息。

读寓言 →

Architecture

精修版

纯解码器

Decoder-Only

Decoder-Only 是只使用 Transformer 解码器堆叠的架构,现代 GPT 类大语言模型多采用这种路线。它把输入提示、上下文、示例和已生成内容都放在同一序列中,用自回归方式预测下一个 token。

读寓言 →

Architecture

精修版

扩散语言模型

Diffusion Language Model

Diffusion Language Model 是把扩散模型思想用于语言生成的模型路线,通常通过从噪声或被破坏的文本状态逐步去噪来生成或编辑文本,而不是像传统自回归模型那样严格从左到右预测下一个 token。

读寓言 →

Architecture

精修版

编码器-解码器

Encoder-Decoder

Encoder-Decoder 是由编码器和解码器组成的 Transformer 架构。Encoder 先把输入编码成上下文化表示,Decoder 在生成输出时通过 Cross-Attention 查看这些表示。

读寓言 →

Architecture

精修版

前馈网络

Feed-Forward Network, FFN

前馈网络是 Transformer 层中位于注意力之后的逐位置非线性模块,负责扩展和变换每个 token 表示。

读寓言 →

Architecture

精修版

GPT

Generative Pre-trained Transformer

GPT 是基于解码器的自回归 Transformer 模型,通过预测下一个 token 训练,适合生成、推理和对话任务。

读寓言 →

Architecture

精修版

分组查询注意力

Grouped Query Attention, GQA

分组查询注意力让多组查询头共享键值头,在多头注意力质量和多查询注意力效率之间取得折中。

读寓言 →

Architecture

精修版

Jamba

Jamba

Jamba 是结合 Transformer 注意力与 Mamba/SSM 思路的混合架构路线,用于提升长上下文处理效率。

读寓言 →

Architecture

精修版

层归一化

Layer Normalization

Layer Normalization 是在神经网络层内部对激活值进行归一化的技术,使每个样本的特征分布更稳定。Transformer 中常在注意力和 FFN 前后使用 LayerNorm,以改善训练稳定性和梯度传播。

读寓言 →

Architecture

精修版

线性注意力

Linear Attention

Linear Attention 是一类将注意力计算复杂度从传统 self-attention 的二次增长降低到近似线性增长的方法。

读寓言 →

Architecture

精修版

Mamba

Mamba

Mamba 是一种基于选择性状态空间模型的序列建模架构,核心特点是让状态更新具有输入相关的选择机制,从而在长序列上兼顾效率和内容敏感的信息保留。

读寓言 →

Architecture

精修版

MoD

Mixture of Depths

MoD 会动态决定不同 token 是否经过全部模型层,让简单 token 跳过部分计算,以降低推理成本。

读寓言 →

Architecture

精修版

混合专家模型

Mixture of Experts, MoE

混合专家模型把不同 token 路由到不同专家子网络,在扩大总参数量的同时控制单次推理成本。

读寓言 →

Architecture

精修版

多查询注意力

Multi-Query Attention, MQA

多查询注意力让所有查询头共享同一组键值头,显著减少 KV 缓存占用,常用于提升长上下文推理效率。

读寓言 →

Architecture

精修版

残差连接

Residual Connection

Residual Connection 把层的输入直接加到层的输出上,让网络学习增量变化而不是每层完全重写表示。它改善深层网络的梯度传播和训练稳定性,是 Transformer 能堆叠很多层的重要原因。

读寓言 →

Architecture

精修版

RMSNorm

Root Mean Square Layer Normalization

RMSNorm 是 LayerNorm 的变体,用激活值均方根做归一化,通常不减均值,可降低计算开销并稳定训练。

读寓言 →

Architecture

精修版

旋转位置编码

Rotary Position Embedding, RoPE

RoPE(Rotary Position Embedding)通过对 query/key 向量施加与位置相关的旋转来编码位置信息,使注意力分数包含相对位置信息。它广泛用于现代 LLM,有助于处理顺序和相对距离,并与长上下文扩展技术密切相关。

读寓言 →

Architecture

精修版

滑动窗口注意力

Sliding Window Attention

Sliding Window Attention 限制每个 token 只关注其附近固定窗口内的 token,从而把长序列注意力成本从全局二次增长降下来。它适合长文本、语音、日志等局部依赖强的场景,也常与全局注意力或稀疏注意力结合。

读寓言 →

Architecture

精修版

状态空间模型

State Space Model, SSM

状态空间模型用随序列更新的状态来建模长程依赖,是 Transformer 注意力之外的重要序列建模路线。

读寓言 →

Architecture

精修版

SwiGLU

Swish-Gated Linear Unit

SwiGLU 是用于 Transformer 前馈网络的门控激活结构,通过门控分支提升非线性表达能力和模型效果。

读寓言 →

Architecture

精修版

T5

Text-to-Text Transfer Transformer

T5 将翻译、摘要、问答等 NLP 任务统一成文本到文本格式,用同一模型范式处理多种语言任务。

读寓言 →

Architecture

精修版

视觉 Transformer

Vision Transformer, ViT

Vision Transformer(ViT)把图像切成 patch,并像处理 token 序列一样用 Transformer 建模图块之间的关系。它把自注意力引入视觉任务,适合分类、检索、检测等视觉理解基础。

读寓言 →

Architecture

精修版

权重绑定

Weight Tying

Weight Tying 是在语言模型中共享输入 embedding 层和最终输出 projection(LM head)权重的技术。它可以减少参数量,并让输入词表示与输出词预测共享同一套符号空间,通常不会显著损害质量。

读寓言 →

Auditability

精修版

审计证据

Audit Evidence

审计证据是支持审计结论的可检查材料,如审批记录、日志、测试结果、工单和第三方证明。

读寓言 →

Auditability

精修版

审计轨迹

Audit Trail

Audit Trail 是记录某个对象、请求、数据或操作从开始到结束全过程的可追溯链条。它通常包含时间戳、操作者、输入、输出、系统状态、审批、变更原因和结果。

读寓言 →

Auditability

精修版

可审计性

Auditability

Auditability 指系统、流程或组织能够被审计、复核和解释的能力。它不是单一日志功能,而是由记录、权限、证据、控制、职责、文档和可复现流程共同形成的属性。

读寓言 →

Auditability

精修版

内部审计

Internal Audit

Internal Audit 是组织内部独立评估风险管理、控制和治理是否有效的职能。它通常不直接拥有业务控制,而是检查控制设计是否合理、执行是否一致、证据是否充分、缺陷是否被整改。

读寓言 →

Auditability/Documentation

精修版

来源引用

Citation

Citation 是 AI 输出、决策或生成性陈述中对来源材料的引用。企业 RAG、知识库问答、合规分析和报告生成中,citation 用来把答案连接到文档、段落、记录或证据,支持核验、审计和纠错。

读寓言 →

Auditability/Security

精修版

不可篡改日志

Tamper-Evident Log

Tamper-Evident Log 是能让修改、删除、插入或重排留下可检测痕迹的日志机制。它不等于绝对不可被攻击,但能让篡改难以不被发现,常通过追加写入、哈希链、签名、时间戳、WORM 存储或外部锚定实现。

读寓言 →

Automation architecture

精修版

智能体工作流

Agentic Workflow

智能体工作流把可重复流程和 Agent 的有限自主结合,在目标、状态、工具、权限、审批和恢复规则内推进任务。

读寓言 →

Automation architecture

精修版

工作流

Workflow

工作流是由步骤、决策、角色和系统集成组成的预定义或半结构化流程,用来稳定地产出一个业务结果。在 AI / Agent 系统里,工作流协调模型调用、工具、人工审批、状态和外部系统。

读寓言 →

Backend engineering / operations

精修版

幂等性

Idempotency

幂等性指同一操作执行一次或多次都产生相同预期结果,常用于重试、支付、任务调度和外部写入场景。

读寓言 →

Backend engineering / operations

精修版

任务队列

Job Queue, Task Queue

任务队列保存等待异步执行的工作单元,让前台请求和耗时、易失败的后台动作解耦。用户不必一直等在原地,worker 可以按规则慢慢处理。

读寓言 →

Billing / platform

精修版

计量

Metering

计量是把客户实际使用量记录、归集并用于账单、配额、成本归因和经营分析的能力。企业 AI / Agent 服务里,计量对象可能是 token、任务、工单、自动完成次数、人工升级次数、数据处理量或交付结果。

读寓言 →

Business / SaaS metrics

精修版

年度经常性收入

Annual Recurring Revenue, ARR

ARR 是把订阅或经常性合同标准化到一年维度后的收入指标,用来衡量 SaaS 或持续服务业务的规模。

读寓言 →

Business / SaaS metrics

精修版

流失率

Churn Rate

流失率衡量客户、账户或收入在某段时间内停止续费、减少使用或离开的比例。

读寓言 →

Business / SaaS metrics

精修版

净收入留存

Net Revenue Retention, NRR

Net Revenue Retention, NRR 衡量同一批既有客户在续费、扩容、降级和流失后的收入变化。公式通常是期初客户收入加扩张收入、减收缩和流失收入,再除以期初收入。

读寓言 →

Business / customer success

精修版

客户健康分

Customer Health Score

Customer Health Score 用多个信号评估客户是否会续费、扩张或流失。

读寓言 →

Business / finance

精修版

毛利

Gross Margin

Gross Margin 是收入扣除直接交付成本后的剩余比例。对 AI / Agent 服务,直接成本可能包括模型调用、云资源、工具/API 调用、人工审核、客户支持、实施和 SLA 响应。

读寓言 →

Business / finance

精修版

单位经济模型

Unit Economics

Unit Economics 分析每个客户、任务、请求、工单或交易的收入、直接成本和利润,判断业务能否规模化盈利。

读寓言 →

Business / go-to-market

精修版

企业销售

Enterprise Sales

Enterprise Sales 面向组织和大客户采购,通常涉及多角色决策、预算归属、安全与合规审查、POC、采购流程、法务合同和较长销售周期。

读寓言 →

Business / go-to-market

精修版

理想客户画像

Ideal Customer Profile, ICP

理想客户画像描述最适合购买并成功使用产品的客户类型,包括行业、规模、痛点、预算和采购能力。

读寓言 →

Business / go-to-market

精修版

产品主导增长

Product-Led Growth, PLG

产品主导增长用产品本身推动获客、激活、转化和扩张,常见手段包括试用、自助上手和产品内引导。

读寓言 →

Business / go-to-market

精修版

销售主导增长

Sales-Led Growth

Sales-Led Growth 依靠销售团队识别目标客户、发现需求、协调多方利益相关人、推进采购并完成高客单价成交。它适合复杂企业产品、强定制交付、高合规风险或需要预算重构的 AI / Agent 服务。

读寓言 →

Business / growth

精修版

客户获取成本

Customer Acquisition Cost, CAC

客户获取成本是获得一个新客户所需的销售、市场和相关投入成本。

读寓言 →

Business / growth

精修版

客户生命周期价值

Customer Lifetime Value, LTV

Customer Lifetime Value, LTV 是一个客户在整个合作周期内预计贡献的收入或毛利价值。对 Soloharness,LTV 取决于合同金额、续费年限、扩张收入、毛利率、支持成本和流失概率。

读寓言 →

Business / operations

精修版

服务级别协议

Service Level Agreement, SLA

SLA 是服务商与客户之间对可用性、响应时间、支持范围、修复时间、违约补偿和沟通机制的正式承诺。企业 AI / Agent 服务要替代人工流程或外包团队,就必须把可用性、质量、升级、事故处理和结果验收写清楚。

读寓言 →

Business / operations

精修版

Token 成本

Token Cost

Token Cost 是 LLM 应用按输入、输出和中间推理 token 核算的模型使用成本。对 Soloharness 这类 Agent 服务,它不只是技术账单,而是毛利、套餐、用量限制和自动化策略的基础变量。

读寓言 →

Business / post-sales

精修版

客户成功

Customer Success

客户成功通过上手、培训、价值追踪、风险预警、续费管理和扩容建议,帮助客户持续获得承诺结果。企业 AI / Agent 服务的采用风险很高:客户流程要改变,员工要信任系统,结果要被验收,成本要可控。

读寓言 →

Business model / delivery

精修版

专业服务

Professional Services

专业服务是围绕咨询、实施、定制、培训和集成提供的人力密集型交付。对企业 AI / Agent 公司来说,它常用于早期售前验证、复杂集成、流程梳理和上线支持,能推动成交和客户成功。

读寓言 →

Business model / operations

精修版

托管服务

Managed Service

托管服务是供应商持续代客户运营某项系统、流程或业务能力,通常包括软件、监控、支持、人力兜底、SLA 和结果责任。它比一次性专业服务更持续,比纯 SaaS 承担更多运营责任。

读寓言 →

Business model / pricing

精修版

混合定价

Hybrid Pricing

混合定价把订阅费、席位费、用量费、服务费、超量费或结果分成组合起来,用来匹配不同成本结构和客户价值感知。

读寓言 →

Business model / pricing

精修版

结果定价

Outcome-Based Pricing

结果定价按客户获得的业务结果、节省成本、新增收入或完成交付收费,而不是按席位、工时或调用量收费。对企业 AI / Agent 服务来说,它适合那些结果清晰、可验收、可归因且供应商能控制关键流程的场景。

读寓言 →

Business model / pricing

精修版

席位定价

Seat-Based Pricing, Per-Seat Pricing

席位定价按用户、账号或人员数量收费,是 SaaS 中最常见、最易采购理解的方式。它适合价值主要来自人使用软件、用户数与价值和成本大致相关的产品。

读寓言 →

Business model / pricing

精修版

用量定价

Usage-Based Pricing

用量定价根据客户实际使用量收费,常见计费单位包括请求数、token 数、任务数、处理数据量、存储量、自动完成次数或工单量。AI / Agent 产品的边际成本通常随模型调用、工具调用和人工升级变化,用量定价能让收入更贴近成本与价值。

读寓言 →

Business model / product

精修版

软件即服务

SaaS, Software as a Service

SaaS(Software as a Service)通过在线方式持续交付软件能力,通常按订阅、席位或用量收费,供应商负责运行、维护、升级和可用性。

读寓言 →

Business model / product strategy

精修版

产品化服务

Productized Service

产品化服务是把原本定制化、靠专家临场判断的服务,压缩成范围清晰、流程固定、价格明确、验收标准稳定的交付方案。企业 AI / Agent 场景中,很多早期收入来自人工实施、咨询和定制流程;如果不能产品化,就难以规模化,也难以提升毛利。

读寓言 →

Business positioning / Automation

精修版

数字员工

Digital Employee, Digital Worker, AI Worker

数字员工、Digital Worker 或 AI Worker 是把 AI 能力包装成可承担岗位任务或流程结果的虚拟劳动力。它的市场表达更接近“替代或增强某类工作”,而不是“提供一个软件功能”。

读寓言 →

Capability packaging

精修版

技能

Skill

技能是打包给 Agent 的任务能力模块,通常包含特定任务的指令、工具、示例、流程、边界和验收方法。它让 Agent 更可靠地完成某一类工作,而不是每次靠通用提示词临场发挥。

读寓言 →

Compliance

精修版

合规映射

Compliance Mapping

Compliance Mapping 是把法规、标准、客户要求或审计准则映射到企业内部控制、流程、证据和责任人的过程。它能避免重复建设,也能发现控制缺口。

读寓言 →

Compliance/Audit

精修版

控制测试

Control Testing

Control Testing 是验证控制措施是否按设计运行、是否有效降低风险的活动。它可以通过抽样检查、重新执行、观察、询问、配置复核、日志分析或模拟演练完成。

读寓言 →

Compliance/Documentation

精修版

技术文档

Technical Documentation

技术文档描述系统架构、组件、接口、数据流、权限、部署、运行、故障处理和变更历史。

读寓言 →

Compliance/Governance

精修版

控制框架

Control Framework

Control Framework 是组织用来设计、组织、执行和评估控制措施的一套结构化框架。它通常定义控制目标、控制领域、责任归属、执行要求、证据类型、测试频率和缺陷处理方式。

读寓言 →

Compliance/Security

精修版

控制措施

Controls

Controls 是为降低风险、满足政策或达成控制目标而设计的具体措施。它可以是预防性、侦测性或纠正性的,例如访问审批、最小权限、日志监控、人工复核、配置基线、变更审批、备份、告警和事件响应。

读寓言 →

Compliance/Security

精修版

ISO 27001

ISO/IEC 27001

ISO 27001 是信息安全管理体系国际标准,要求组织以风险管理方式持续改进信息安全控制。

读寓言 →

Compliance/Security

精修版

SOC 2 Type I

SOC 2 Type I

SOC 2 Type I 是由独立审计方在某一个时间点评估服务组织的系统描述和控制设计是否适合满足相关 Trust Services Criteria,例如安全性、可用性、保密性、处理完整性和隐私。

读寓言 →

Compliance/Security

精修版

SOC 2 Type II

SOC 2 Type II

SOC 2 Type II 是独立审计方在一段期间内评估服务组织控制设计和运行有效性的报告。它比 Type I 更能说明组织是否持续执行控制,常覆盖 3 到 12 个月的证据。

读寓言 →

Compliance/Security

精修版

SOC 2

Service Organization Control 2, SOC 2

SOC 2 是面向服务组织的审计报告框架,用于评估安全、可用性、保密性、隐私等控制是否有效。

读寓言 →

Compression

精修版

AWQ

Activation-Aware Weight Quantization

AWQ 是一种权重量化方法,会根据激活大小保护关键通道,同时更激进地压缩不重要权重。

读寓言 →

Compression

精修版

bitsandbytes

BitsAndBytes

bitsandbytes 是常用于 Hugging Face 生态的低精度加载与量化库,尤其常见于 8-bit 和 4-bit 权重加载。它让较大的模型能在更有限的显存里加载、微调或部署。

读寓言 →

Compression

精修版

深度剪枝

Depth Pruning

Depth Pruning 是模型压缩方法之一,通过移除整个 Transformer 层来得到更浅的模型。它关注哪些层对输出贡献较小,并通过评估、校准或再训练尽量保持质量。

读寓言 →

Compression

精修版

蒸馏推理模型

Distilled Reasoning Models

Distilled Reasoning Models 是用大型推理模型产生的答案、步骤或推理轨迹来训练较小模型,使小模型获得部分推理能力的做法。它常结合 SFT、知识蒸馏和模型压缩,用于降低推理成本、延迟和部署门槛。

读寓言 →

Compression

精修版

GGML

GGML Tensor Library

GGML 是 llama.cpp 早期依赖的 C 语言张量库,支持 CPU 上的 LLM 推理和量化,是 GGUF 生态的前身。

读寓言 →

Compression

精修版

GPTQ

GPT Post-Training Quantization

GPTQ 是训练后一次性权重量化方法,利用近似二阶信息降低 3/4 bit 量化带来的误差。

读寓言 →

Compression

精修版

GGUF

GPT-Generated Unified Format

GGUF 是 llama.cpp 等本地推理生态常用的量化大模型文件格式,用统一方式打包模型权重和元数据。它让运行时能稳定加载不同量化版本,而不是每个模型都靠临时约定。

读寓言 →

Compression

精修版

模型剪枝

Model Pruning

模型剪枝是在训练好的模型中移除不重要的权重、神经元、注意力头或层,以降低模型尺寸、显存占用和推理延迟。

读寓言 →

Compression

精修版

训练后量化

Post-Training Quantization, PTQ

训练后量化是在模型训练完成后降低权重或激活精度的压缩方法,速度快但可能损失一定效果。

读寓言 →

Compression

精修版

量化感知训练

Quantization-Aware Training, QAT

量化感知训练(QAT)是在训练或微调时模拟低精度量化的影响,让模型提前适应压缩后的计算方式。它不是训练完再压缩,而是训练过程中就让模型感受到低精度约束。

读寓言 →

Compression

精修版

稀疏性

Sparsity

稀疏性指模型中许多权重为零,或许多激活在计算时不活跃。剪枝等方法可以制造稀疏结构,从而减少理论上的计算和内存需求。

读寓言 →

Compression

精修版

结构化剪枝

Structured Pruning

结构化剪枝会移除整组神经元、注意力头、通道、层或其他规则结构。剪完后的模型结构更整齐,标准硬件和运行时更容易真的跑快。

读寓言 →

Compression

精修版

非结构化剪枝

Unstructured Pruning

非结构化剪枝会按重要性把单个权重置零,保留模型原有的大部分结构。它可以制造高度稀疏的模型,并减少存储或内存压力。

读寓言 →

Compression

精修版

宽度剪枝

Width Pruning

宽度剪枝会缩小隐藏维度、注意力头或前馈层中间维度,让模型更窄,从而降低参数量和推理成本。

读寓言 →

Concept distinction

精修版

思维链与草稿区

Chain-of-Thought vs Scratchpad

Chain-of-Thought 是中间推理过程或推理痕迹;Scratchpad 是更宽的临时工作区,可包含推理、观察结果、工具输出、计划、变量、中间数据和执行备注。

读寓言 →

Content provenance

精修版

C2PA

Coalition for Content Provenance and Authenticity

C2PA 是数字内容来源与真实性标准,用加密凭证记录图片、视频、音频等内容的生成和编辑历史。

读寓言 →

Control pattern

精修版

人在回路

Human-in-the-Loop

人在回路是在 AI 或 Agent 流程关键节点嵌入人工审核、判断、修正、批准或接管。

读寓言 →

Conversation state object

精修版

会话线程

Thread

Thread 是托管 Agent API 中保存会话状态的对象。它把用户、助手和消息放进同一个持续上下文里,让后续 run 能基于既有对话继续执行。

读寓言 →

Coordination pattern

精修版

交接

Handoff

Handoff 是任务所有权、上下文和下一步动作从一个 Agent、工作流、系统或人转移给另一个执行者的过程。在企业 Agent 中,交接常发生在多智能体协作、人工升级、客服转专家、自动流程转人工审批等场景。

读寓言 →

Cost / context

精修版

Token 预算

Token Budget

Token 预算是分配给任务、请求、用户或工作流的 token 上限。它控制提示词长度、检索上下文、工具输出、模型推理空间和回答长度。

读寓言 →

Cost optimization

精修版

预算感知路由

Budget-Aware Routing

预算感知路由是在预算、任务价值、质量要求和延迟之间做选择:不同请求不必都交给最贵模型,也不必一味省钱。系统会根据场景选择模型、工具、检索深度或执行路径。

读寓言 →

Customer support / Contact center AI

精修版

智能客服

AI Customer Service, Intelligent Customer Service

智能客服用自然语言理解、知识库检索、对话管理和工单系统集成,自动处理常见咨询并转交复杂问题。

读寓言 →

Data framework for LLM applications

精修版

LlamaIndex

LlamaIndex

LlamaIndex 是面向 LLM 应用的数据与检索框架,用于连接私有、结构化、半结构化和非结构化数据源,并提供 loaders、nodes、indexes、retrievers、query engines 等抽象。

读寓言 →

Data ingestion

精修版

文档解析

Document Parsing

Document Parsing 是把 PDF、Word、网页、表格、扫描件等文档转换为可索引文本、结构化元素和元数据的过程。它通常包括文本抽取、版面识别、表格和图片处理、页码和来源保留、噪声清理等。

读寓言 →

Data ingestion

精修版

OCR

Optical Character Recognition

OCR 从图片、扫描件或照片中识别文字,让发票、合同、表单等非结构化文档进入自动化处理流程。

读寓言 →

Data ingestion integration

精修版

数据连接器

Data Connector

Data Connector 将外部文件、数据库、SaaS 内容、网页或 API 加载到 AI 应用的索引和检索流水线中。

读寓言 →

Data strategy / Competitive advantage

精修版

数据飞轮

Data Flywheel

Data Flywheel 是产品使用、业务反馈和结果数据持续回流,反过来改进模型、流程、知识库、评测和交付质量的机制。

读寓言 →

Decoding

精修版

束搜索

Beam Search

Beam Search 是生成时同时保留多个高概率候选序列的解码策略。它比贪心解码更不容易被单步最高概率带偏,但会增加计算成本,也可能生成过于保守、模式化的文本。

读寓言 →

Decoding

精修版

解码

Decoding

Decoding 是把模型对下一个 token 的分数分布转换成实际输出文本的过程。它包含贪心、采样、beam search、top-k、top-p、temperature 等策略。

读寓言 →

Decoding

精修版

贪心解码

Greedy Decoding

Greedy Decoding 是每一步都选择概率最高的下一个 token。它速度快、确定性强、成本低,适合固定格式、低创造性、短输出任务。但它容易过早收束,生成单调文本,也可能因为局部最优导致整体答案不佳。

读寓言 →

Decoding

精修版

Logits

Logits

Logits 是模型在 softmax 转成概率之前输出的原始分数。解码参数、约束、禁用词、温度缩放和采样策略都作用在 logits 或其转换后的分布上。

读寓言 →

Decoding

精修版

采样

Sampling

Sampling 是按模型概率分布随机选择 token 的解码方式。它能提高多样性,减少贪心输出的机械感,但也会带来不可重复和低概率错误。

读寓言 →

Decoding

精修版

温度

Temperature

Temperature 是控制生成随机性的参数。较低温度会让概率分布更尖锐,输出更稳定、保守;较高温度会让分布更平,增加多样性,也增加出错概率。

读寓言 →

Decoding

精修版

Top-k 采样

Top-k Sampling

Top-k Sampling 会把下一 token 候选限制在概率最高的 k 个之内,再从中采样。它能削掉长尾低质量 token,降低随机采样的失控风险。

读寓言 →

Decoding

精修版

Top-p 采样

Top-p Sampling, Nucleus Sampling

Top-p Sampling,也叫 Nucleus Sampling,会选择累计概率达到 p 的最小候选集合,再在其中采样。它比 top-k 更能适应不同分布形状:确定任务候选少,开放任务候选多。

读寓言 →

Deep Learning

精修版

反向传播

Backpropagation

Backpropagation 是神经网络训练中计算梯度的核心算法。它把输出误差沿网络层层向后传播,判断每个参数应如何调整。没有反向传播,深层模型很难高效学习。

读寓言 →

Deep Learning

精修版

深度学习

Deep Learning

Deep Learning 是使用多层神经网络从数据中学习表示和函数映射的方法。它让模型能够从原始或半结构化数据中逐层提取特征,支撑现代语音、视觉、语言模型、推荐、检索和 Agent 系统。

读寓言 →

Deep Learning

精修版

神经网络

Neural Network

Neural Network 是由大量相互连接的人工神经元或计算单元组成的模型,通过权重、激活函数和层级结构从数据中学习输入到输出的映射。它是深度学习、语言模型、视觉模型和推荐系统的基础。

读寓言 →

Deep Learning

精修版

表征学习

Representation Learning

Representation Learning 是让模型从数据中学习有用表示的过程。这些表示可以是 embedding、隐藏层特征、跨模态向量或业务实体表示,用来支撑分类、检索、推荐、聚类、预测和 Agent 记忆。

读寓言 →

Deployment

精修版

金丝雀发布

Canary Release

金丝雀发布是在全面上线前,先让少量用户、租户、地区或流量使用新版本,用真实指标判断是否继续扩大。它的核心是限制影响范围,同时尽早发现生产环境里的问题。

读寓言 →

Deployment

精修版

灰度发布

Gradual Rollout

灰度发布是按用户、租户、地区、流量比例或用例逐步扩大变更范围。它比一次金丝雀更完整,包含阶段计划、准入条件、观察窗口、暂停条件、沟通和例外处理。

读寓言 →

Deployment / Enterprise procurement

精修版

私有化部署

Private Deployment, On-premises Deployment

私有化部署是把 AI 系统放在客户自有或专属环境中运行,用于满足数据安全、合规和内网访问要求。

读寓言 →

Deployment / Infrastructure

精修版

本地化部署

Local Deployment, On-premises Deployment

本地化部署把软件、模型或系统放在客户机房、私有云、内网或受控环境中运行。

读寓言 →

Deployment / infrastructure

精修版

容器

Container

容器把应用及其运行依赖打包成可移植、隔离的单元,让部署、扩缩容和环境一致性更容易管理。

读寓言 →

Deployment / infrastructure

精修版

Kubernetes

Kubernetes, K8s

Kubernetes(K8s)是容器编排系统,用来安排容器运行、扩缩容、服务发现、滚动更新、健康检查和故障自愈。简单说,它负责让一组容器化服务按预期持续运行。

读寓言 →

Deployment / release engineering

精修版

蓝绿部署

Blue-Green Deployment

蓝绿部署会保留两套接近生产环境的系统:一套正在承接真实流量,另一套提前部署新版本。新版本验证通过后,把流量切过去;如果出问题,再切回旧环境完成回滚。

读寓言 →

Deployment / release engineering

精修版

金丝雀发布

Canary Deployment

金丝雀发布先把新版本放给少量流量或用户验证,确认稳定后再逐步扩大范围,以降低发布风险。

读寓言 →

DevOps / infrastructure

精修版

基础设施即代码

Infrastructure as Code, IaC

基础设施即代码(IaC)用声明式配置或脚本管理服务器、网络、权限、数据库和云资源,而不是靠人工在控制台逐项点击。

读寓言 →

DevOps / operations

精修版

GitOps

GitOps

它把 Git 仓库作为系统期望状态的唯一可信来源,基础设施和应用配置用声明式文件描述,自动化控制器持续把实际环境同步到 Git 中描述的状态。

读寓言 →

DevOps / release engineering

精修版

持续集成与持续交付

CI/CD, Continuous Integration / Continuous Delivery

CI/CD 把代码集成、测试、打包、部署、发布和回滚做成自动化流水线,让软件变更能更频繁、更可靠地交付。它把发布质量从临时人工检查,变成可重复执行的流程。

读寓言 →

Dialogue / workflow

精修版

插槽填充

Slot Filling

插槽填充是在对话或表单任务中识别并补齐关键字段,例如身份、时间、地点、产品、数量和联系方式。

读寓言 →

Diffusion

精修版

噪声预测器/UNet

UNet / Noise Predictor

UNet / Noise Predictor 是许多扩散模型中的去噪网络骨干,用来预测当前样本中的噪声或去噪方向。UNet 通过编码器下采样获得全局上下文,再通过解码器上采样恢复细节,并用 skip connection 保留局部信息。

读寓言 →

Distributed inference

精修版

流水线并行

Pipeline Parallelism

流水线并行把模型层拆到多张设备上,让微批次像流水线一样前进,以减少设备空闲时间。

读寓言 →

Distributed inference

精修版

张量并行

Tensor Parallelism

张量并行是把单个权重矩阵或张量运算切分到多块 GPU 上。每块设备计算同一层的一部分,再通过通信把结果合并。

读寓言 →

Distributed training

精修版

数据并行

Data Parallelism

Data Parallelism 是分布式训练中常见的方法:在多张 GPU 或多台机器上复制同一个模型,每个副本处理不同数据 batch,随后同步梯度或参数更新。它能提高训练吞吐,是大模型预训练和微调的基础并行策略之一。

读寓言 →

Distributed training

精修版

FSDP

Fully Sharded Data Parallelism

Fully Sharded Data Parallelism, FSDP 是一种分布式训练策略,将模型参数、梯度和优化器状态在多个设备之间分片,而不是让每个数据并行副本完整持有所有状态。

读寓言 →

Distributed training

精修版

ZeRO

Zero Redundancy Optimizer

Zero Redundancy Optimizer, ZeRO 是一种减少数据并行训练中内存冗余的优化策略。它通过分片优化器状态、梯度和模型参数,避免每个 GPU 都完整保存所有训练状态,从而显著降低显存占用。

读寓言 →

Document AI

精修版

版面分析

Layout Analysis

Layout Analysis 是识别文档页面结构的过程,包括标题、段落、表格、图片、列表、页眉页脚和阅读顺序。它通常接在 OCR 或文本抽取之后,是文档解析、表格抽取和 RAG 切分的重要步骤。

读寓言 →

Document AI

精修版

表格抽取

Table Extraction

Table Extraction 是从 PDF、图片、扫描件或文档中识别表格结构与单元格内容的过程。它不仅抽取文字,还要恢复表格区域、行列、表头、合并单元格、跨页关系和坐标来源。

读寓言 →

Documentation

精修版

数据集说明书

Datasheet for Datasets

数据集说明书结构化记录数据集的动机、组成、采集、预处理、用途、限制、风险和维护方式。

读寓言 →

Documentation

精修版

模型卡

Model Card

Model Card 是描述模型用途、训练数据、评测结果、限制、风险、适用场景和伦理考虑的结构化文档。企业采购、部署或微调模型时,model card 帮助产品、工程、法务和风险团队理解模型边界,并为审计、供应商评估和上线审批提供证据。

读寓言 →

Documentation

精修版

系统卡

System Card

系统卡描述已部署 AI 系统的能力、组成、风险、缓解措施、评测结果、适用边界和监督机制。

读寓言 →

Embedding database

精修版

Chroma

Chroma

Chroma 是一个开源的轻量级嵌入数据库,专为本地开发和快速原型设计。它用几行代码就能在本地存储嵌入向量、文档和元数据,并提供相似度搜索。

读寓言 →

Embeddings

精修版

嵌入

Embedding

嵌入(Embedding)是把文本、图片、音频、代码、用户、商品或其他对象转换成一组数字向量。这个向量不是给人读的标签,而是给机器计算的语义坐标。

读寓言 →

Embeddings

精修版

语义相似度

Semantic Similarity

Semantic Similarity 衡量两段文本、问题、任务或对象在意义上的接近程度,通常通过 embedding 向量距离或相似度计算实现。它是语义搜索、去重、聚类、推荐、RAG 检索和工单路由的基础。

读寓言 →

Embeddings

精修版

向量数据库

Vector Database

向量数据库(Vector Database)是专门存储 embedding 向量并按相似度检索近邻的数据系统。它常用于语义搜索、推荐、去重和 RAG。

读寓言 →

Embeddings

精修版

词嵌入

Word Embedding

Word Embedding 是把词或 token 表示为向量的技术,使模型能通过空间位置捕捉词语之间的统计关系和语义关系。相近词在向量空间中通常距离更近,关系模式也能被模型利用。

读寓言 →

Engineering organization / infrastructure

精修版

平台工程

Platform Engineering

平台工程通过内部开发者平台、自助能力、标准模板和共享基础设施,提升工程交付效率和治理一致性。

读寓言 →

Engineering organization / platform

精修版

开发者体验

Developer Experience, DevEx

Developer Experience, DevEx 衡量开发者从理解、开发、测试、部署到排障的效率、顺畅度和认知负担。

读寓言 →

Enterprise AI application / Retrieval

精修版

知识库问答

Knowledge Base Q&A, KBQA, RAG Q&A

知识库问答把企业文档、制度、产品资料和业务知识接入检索与生成系统,提供带依据的自然语言答案。

读寓言 →

Enterprise AI orchestration SDK

精修版

Semantic Kernel

Semantic Kernel

Semantic Kernel 是微软的开源 AI 编排 SDK,定位是在企业应用中集成大语言模型、插件、规划器、记忆和原生应用代码。

读寓言 →

Enterprise collaboration / Solution design

精修版

共创

Co-creation, Joint Solution Development

共创是供应商与客户围绕真实业务问题共同定义场景、数据、流程和验收标准,再联合打磨解决方案。

读寓言 →

Enterprise implementation / Adoption

精修版

试点

Pilot, Pilot Program

试点是在真实业务环境中小范围运行方案,用来验证采用意愿、流程适配、运营成本、稳定性和复制条件。

读寓言 →

Evaluation

精修版

评测基准

Benchmark

评测基准是用于比较模型、Agent 或系统能力的一组标准化任务、数据集、指标或测试套件。好的 benchmark 不只是排行榜题目,而要对应真实业务场景、失败边界和验收标准。

读寓言 →

Evaluation

精修版

基准污染

Benchmark Contamination

基准污染是指评测题目、答案或高度相似样例进入了训练数据、提示示例、调参过程或模型选择流程,导致模型在 benchmark 上表现虚高。对企业 Agent 来说,污染会让发布评测失真:系统看似会处理客户问题,实际只是见过测试样例。

读寓言 →

Evaluation

精修版

数据泄漏

Data Leakage

数据泄漏是指训练、调参、模型选择或评测过程中不该出现的信息提前进入系统,使性能估计失真。它不只包括测试题答案泄漏,也包括目标标签、未来信息、人工批注、客户结果、相似样例或生产反馈不当回流。

读寓言 →

Evaluation

精修版

分布偏移

Distribution Shift

分布偏移是指模型训练、验证或历史评测所面对的数据分布,与部署后的真实输入分布不一致。它会让离线分数很好、线上效果变差。企业 Agent 常见偏移包括客户群变化、行业语言变化、任务类型变化、工具返回格式变化、渠道变化和政策变化。

读寓言 →

Evaluation

精修版

困惑度

Perplexity

困惑度是语言模型评估指标,用来衡量模型预测一段文本序列的难易程度。困惑度越低,通常表示模型对该文本分布的预测越好。它适合评估语言建模和同类语料上的拟合程度,但不能直接代表 Agent 任务完成率、事实正确性、安全性或工具调用能力。

读寓言 →

Evaluation

精修版

步骤成功率

Step Success Rate

步骤成功率衡量多步骤任务中每个中间步骤执行正确的比例。对企业 Agent,它比单纯最终成功率更能定位质量问题:计划是否合理、检索是否命中、工具是否选对、参数是否正确、权限是否通过、异常是否处理。

读寓言 →

Evaluation

精修版

工具调用准确率

Tool Call Accuracy

工具调用准确率衡量 Agent 是否选对工具、填对参数、合规调用,并合理使用工具返回结果。

读寓言 →

Evaluation

精修版

轨迹评估

Trajectory Evaluation

轨迹评估是对 Agent 执行过程中的计划、推理步骤、工具调用、观察结果、重试、异常处理和最终输出进行整体评价。它适合多步骤任务,因为最终答案可能掩盖过程中的越权、侥幸、错误工具调用或不可复现路径。

读寓言 →

Evaluation infrastructure

精修版

LLM 评测平台

LLM Evaluation Platform

LLM 评测平台管理数据集、测试用例、评分函数、人工标注、模型裁判、回归检查、实验对比和发布门禁。它把评测从零散脚本变成持续质量系统。

读寓言 →

FinOps / operations

精修版

成本归因

Cost Attribution

成本归因把模型调用、云资源、工具、人工复核和运营成本分摊到客户、功能、工作流或任务结果上。

读寓言 →

Fine-Tuning

精修版

微调

Fine-Tuning

Fine-Tuning 是在预训练模型基础上,用特定领域、任务或行为数据继续训练模型,使其更适合目标场景。它可以改善语气、格式、领域知识使用、工具调用习惯和任务完成稳定性,但也带来数据治理、过拟合、评测、回滚和成本问题。

读寓言 →

Fine-Tuning

精修版

指令微调

Instruction Tuning

Instruction Tuning 是用大量“指令-响应”样例训练模型,使模型更会理解人类任务要求并按指令输出。它让基础模型从单纯预测文本,转向更适合问答、摘要、改写、分类、格式化输出、拒绝不当请求和工具前置判断等交互场景。

读寓言 →

Fine-Tuning

低秩适配

Low-Rank Adaptation, LoRA

LoRA 是参数高效微调方法,在冻结原模型权重的同时注入小型低秩矩阵,用较少参数完成适配。

读寓言 →

Fine-Tuning

精修版

参数高效微调

Parameter-Efficient Fine-Tuning, PEFT

参数高效微调只训练少量新增或选定参数来适配基础模型,常见方法包括 LoRA、Adapter 和 Prefix Tuning。

读寓言 →

Fine-Tuning

精修版

监督微调

Supervised Fine-Tuning, SFT

监督微调用带目标输出的标注样例训练模型,让模型学习在给定输入下生成期望响应。

读寓言 →

Fine-tuning

精修版

全量微调

Full Fine-Tuning

全量微调会更新模型全部或大部分参数,适配能力强但训练成本、显存需求和灾难性遗忘风险更高。

读寓言 →

Fine-tuning

精修版

指令数据

Instruction Data

Instruction Data 是用于训练或评测模型指令遵循能力的数据,通常包含用户指令、上下文、期望响应、拒绝样例、格式要求和有时的工具调用轨迹。

读寓言 →

Fine-tuning

精修版

分层学习率

Layer-wise Learning Rate

Layer-wise Learning Rate 是在微调时给不同模型层设置不同学习率,常见做法是底层较小、高层或任务相关层较大。它有助于保留通用表示,同时让模型适应新任务,降低灾难性遗忘和过拟合风险。

读寓言 →

Fine-tuning

精修版

拒绝采样

Rejection Sampling

Rejection Sampling 在 AI 训练中常指生成多个候选输出,并根据质量标准只保留合格样本,用于构造更高质量的微调或偏好数据。它能提升数据质量,但依赖筛选器、奖励模型或人工标注的可靠性。

读寓言 →

Foundations

精修版

人工智能

Artificial Intelligence, AI

Artificial Intelligence 是构建能执行感知、语言、推理、规划、决策等智能任务系统的广义领域。企业语境里,AI 不应被理解成一个单一模型,而是一组能力、数据、流程、控制和商业交付方式的组合。

读寓言 →

Foundations

精修版

模型

Model

模型是一个从数据或经验中学到的简化系统,用来把输入映射到输出,例如预测、分类、生成或决策。

读寓言 →

Generative AI

精修版

扩散模型

Diffusion Model

Diffusion Model 是一种生成模型,训练时把真实数据逐步加噪,再学习反向去噪过程;生成时从随机噪声开始,经过多步去噪得到图像、音频、视频或其他样本。它的强项是高质量生成和可控编辑,代价是推理步骤多、计算较重。

读寓言 →

Generative modeling

精修版

扩散变换器

Diffusion Transformer, DiT

DiT 将 Transformer 用作扩散模型的生成骨干,通常把图像或潜空间切成 token 后进行去噪建模。

读寓言 →

Generative modeling

精修版

潜在扩散模型

Latent Diffusion Model, LDM

Latent Diffusion Model, LDM 是在压缩后的潜在空间中执行扩散去噪,而不是直接在原始像素空间中生成。通常先用自编码器把图像编码到低维 latent,再在 latent 上扩散,最后解码回图像。

读寓言 →

Go-to-market / Implementation

精修版

场景化落地

Scenario-based Implementation, Use-case Implementation

场景化落地从具体业务角色、输入输出、系统集成和验收指标出发,把 AI 能力转成可交付流程。

读寓言 →

Governance

精修版

AI 影响评估

AI Impact Assessment, AIIA

AI 影响评估是在系统部署前和运行中,评估其对个人、业务、法律、隐私、安全和公平性的影响。

读寓言 →

Governance

精修版

AI 使用场景清单

AI Use Case Inventory

AI Use Case Inventory 是组织维护的 AI 使用场景清单,记录用例名称、业务目的、系统/模型、数据输入、供应商、负责人、风险分类、运行状态、审查记录和退役计划。

读寓言 →

Governance

精修版

数据血缘

Data Lineage

Data Lineage 是跟踪数据从来源、加工、转换、合并到最终使用位置的全过程关系。

读寓言 →

Governance

精修版

治理、风险与合规

Governance, Risk, and Compliance, GRC

GRC 将治理、风险、控制、政策、审计和合规义务统一管理,是企业引入 Agent 时的基础控制框架。

读寓言 →

Governance

精修版

策略引擎

Policy Engine

Policy Engine 是在运行时评估规则并决定允许、拒绝、限制或升级某个动作的组件。它通常结合主体、资源、动作、上下文、风险等级和审批状态进行判断。

读寓言 →

Governance

精修版

来源证明

Provenance

Provenance 是关于数据、内容或输出的来源、作者、授权和变换历史的证据。企业 Agent 会读取文档、检索知识库、调用外部 API、引用客户数据并生成新内容,因此必须知道材料从哪里来、是否可信、是否有使用权、经过哪些处理。

读寓言 →

Governance

精修版

影子 AI

Shadow AI

Shadow AI 是员工或团队在未获正式批准、安全审查、采购可见性或治理控制的情况下使用 AI 工具、模型或 Agent。它可能带来数据泄露、供应商风险、合规违规、不可审计决策和重复采购。

读寓言 →

Governance

精修版

可追溯性

Traceability

Traceability 是重建系统为什么产生某个输出或采取某个动作的能力。企业 Agent 中,它要求把用户请求、上下文、检索来源、模型选择、提示词版本、工具调用、权限判断、人工审批、外部写入和最终结果关联起来。

读寓言 →

Governance

精修版

透明度

Transparency

透明度要求清楚披露 AI 系统的用途、能力、限制、数据使用、决策角色、责任方和用户选择。

读寓言 →

Governance

精修版

可信 AI

Trustworthy AI

可信 AI 指系统在特定用途下满足合规、伦理、公平、隐私、安全、鲁棒性、透明、监督和问责要求。

读寓言 →

Governance and control

精修版

智能体策略

Agent Policy

Agent Policy 定义 Agent 在数据、工具、用户、外部动作、预算、沟通和升级方面允许、禁止或必须执行的规则。它应能被运行时、策略引擎和审计机制使用,而不只是自然语言原则。

读寓言 →

Governance/Compliance

精修版

AI 披露

AI Disclosure

AI 披露是在合适场景告知用户、员工或受影响方,AI 参与了内容生成、交互、建议或决策。

读寓言 →

Governance/Compliance

精修版

控制所有人

Control Owner

Control Owner 是对某项控制的设计、运行、证据、测试和改进负有责任的人或职能。企业 Agent 治理中,控制可能包括权限审批、敏感数据过滤、人工复核、日志留存、模型变更审批、供应商审查和异常升级。

读寓言 →

Governance/Operations

精修版

人工监督

Human Oversight

Human Oversight 是通过人工审查、批准、监控、干预、覆盖、暂停或升级机制,防止或缓解 AI 系统造成不当后果。有效监督不是所有动作都手工审批,而是根据风险、影响、置信度和异常信号,把人放在关键决策点,并赋予足够信息和权限。

读寓言 →

Governance/Risk

精修版

偏见

Bias

Bias 是数据、模型、设计、目标函数或部署流程中的系统性偏斜,可能导致不准确、不公平或有害结果。企业 Agent 的偏见可能来自历史数据、标签偏差、采样不足、反馈循环、代理变量或业务规则。

读寓言 →

Governance/Risk

精修版

可解释性

Explainability

Explainability 是 AI 系统能够以适合使用场景的方式说明输出或决策的关键原因、证据、因素和限制。对企业 Agent 来说,可解释性帮助业务人员判断是否采纳建议,帮助用户申诉,帮助审计和风险团队追踪问题。

读寓言 →

Governance/Risk

精修版

公平性

Fairness

Fairness 指 AI 系统避免对受保护或业务相关群体产生无正当理由的不利待遇或结果。它需要定义相关群体、测量差异影响、分析原因、设置公平性指标和缓解措施。

读寓言 →

Governance/Risk

精修版

三道防线

Three Lines of Defense

Three Lines of Defense 是一种治理模型,将责任分为三类:第一道防线由业务团队拥有并管理风险;第二道防线由风险、合规、安全等职能制定框架、监督和挑战;第三道防线由内部审计等独立职能提供保证。

读寓言 →

Governance/Safety

精修版

内容过滤

Content Filtering

Content Filtering 是对用户输入、模型输出和交互上下文进行检测、分类与处理,以拦截违法、有害、欺诈、仇恨、暴力、自残、隐私泄露或政策违规内容。

读寓言 →

Governance/Security

精修版

策略即代码

Policy as Code

策略即代码用机器可执行代码表达安全、合规和业务治理规则,并通过版本控制、测试和审计管理规则。

读寓言 →

IT operations / automation

精修版

人工智能运维

AIOps

AIOps 更准确地说是智能运维:用机器学习和自动化分析日志、指标、链路追踪、告警和事件记录,帮助团队发现异常、压缩噪音、定位根因并推动响应。这里不是泛指维护 AI 系统,而是用 AI 方法提升运维判断和处理效率。

读寓言 →

Implementation / Project governance

精修版

交付验收

Delivery Acceptance, Acceptance Testing, Project Acceptance

交付验收是客户或项目方根据事先约定的标准,确认交付物是否满足合同、功能、性能、安全、业务效果和可运行要求的过程。

读寓言 →

Inference

精修版

自回归解码

Autoregressive Decoding / Decode Phase

自回归解码,也就是 Decode Phase,是大模型处理完输入之后逐个生成 token 的阶段。每生成一个新 token,都要依赖前面已经生成的内容,所以它天然有顺序依赖,不能像批量读输入那样完全并行。

读寓言 →

Inference

精修版

最佳-of-N 采样

Best-of-N Sampling

Best-of-N 采样,也可以理解为“多候选择优”:系统一次生成 N 个候选答案,再用评分器、规则、验证器或人工标准选出最好的一个。它不是让模型只生成一次,而是在请求时多花计算来换更高质量。

读寓言 →

Inference

精修版

上下文剪枝

Context Pruning / Prompt Compression

上下文剪枝会删除或压缩低相关内容,缩短提示长度,减少 KV 缓存占用并降低预填充延迟。

读寓言 →

Inference

精修版

动态批处理

Dynamic Batching / In-flight Batching

动态批处理会在已有批次运行时加入新请求,而不是等整批结束,从而提升推理服务吞吐和 GPU 利用率。

读寓言 →

Inference

精修版

早出

Early Exiting

提前退出,也可叫早退推理,是让模型在置信度足够高时停在中间层,不必每次都跑完整个模型。简单样本少花计算,难样本仍走完整路径。

读寓言 →

Inference

精修版

Flash Attention

FlashAttention

FlashAttention 是面向 IO 优化的注意力算法,通过分块和算子融合减少显存读写,降低长序列注意力开销。

读寓言 →

Inference

精修版

推理

Inference

这里的 inference 指模型推理或模型运行:把训练好的模型用于新的输入,并生成输出。它不是人类意义上的逻辑推理,而是模型在当前请求上执行计算。

读寓言 →

Inference

精修版

缓存卸载

KV Cache Offloading

KV 缓存卸载是把不那么活跃的 KV 缓存块从 GPU 显存搬到 CPU 内存或 SSD。这样系统可以支持更长上下文或更多并发请求,而不完全受 GPU 显存限制。

读寓言 →

Inference

精修版

量化 KV 缓存

KV Cache Quantization

KV 缓存量化用更低精度保存推理中的键值缓存,在有限显存下支持更长上下文或更高并发。

读寓言 →

Inference

精修版

算子融合

Kernel Fusion

算子融合把多个 GPU 操作合并为一个内核,减少内存往返和启动开销,是高性能推理运行时的常见优化。

读寓言 →

Inference

精修版

延迟

Latency

延迟是模型或 Agent 系统从收到请求到返回响应、或生成 token 所花的时间。它可能包括排队、路由、检索、工具调用、预填充、首 token、解码和后处理。

读寓言 →

Inference

精修版

回顾解码

Lookahead Decoding

前瞻解码是加速自回归生成的一类方法:它会并行构造候选的 n-gram 序列,再由主模型并行验证候选。它和投机解码相关,但不依赖单独的草稿模型。

读寓言 →

Inference

精修版

Medusa

Medusa

Medusa 是一种推测解码方法:在基础模型上加多个解码头,让这些头并行预测未来 token,再由基础模型验证哪些可以接受。

读寓言 →

Inference

精修版

模型服务

Model Serving

模型服务是把模型放到生产环境里,通过 API 稳定处理推理请求的运行层。它不只是“模型能跑”,还包括端点、批处理、调度、自动扩缩容、GPU 分配、缓存、流式输出、鉴权、监控、限流、回退和 SLA 管理。

读寓言 →

Inference

精修版

分页注意力

Paged Attention

分页注意力把 KV 缓存存在固定大小、可不连续的页或块里,而不是要求每条序列占用一大段连续显存。这样可以减少显存碎片,提高 GPU 内存利用率。

读寓言 →

Inference

精修版

预填充

Prefill Phase

预填充阶段是推理刚开始时,模型先并行处理全部输入 token,并建立 KV 缓存的阶段。它发生在逐 token 解码之前,通常会显著影响首 token 时间。

读寓言 →

Inference

精修版

前缀缓存

Prefix Caching

前缀缓存复用相同提示词前缀已经计算好的 KV 缓存,比如系统提示、共享策略文本、产品文档或长参考上下文。它缓存的是共同上下文的计算结果,不是直接缓存最终答案。

读寓言 →

Inference

精修版

量化

Quantization

量化用低精度数值表示模型权重或激活,以减少显存、存储和计算成本,但需要控制精度损失。

读寓言 →

Inference

精修版

推测解码

Speculative Decoding

推测解码先用小模型生成候选 token,再由大模型并行验证,可在基本不降质量的情况下加速生成。

读寓言 →

Inference

精修版

推测编辑

Speculative Editing

推测编辑是把推测解码的思路用于编辑任务:由更快的助手先提出局部修改或延续,再由更强模型验证、接受或修正。

读寓言 →

Inference

精修版

推测前缀树

Speculative Prefix Tree

推测前缀树把多个候选生成路径组织成树结构,并行探索和验证,用于提高推测解码的接受率。

读寓言 →

Inference

精修版

投机采样

Speculative Sampling

投机采样,也常被看作投机解码的一种表述,是先由草稿过程采样候选 token,再由目标模型接受或拒绝。最终输出仍应保持目标模型本来的分布。

读寓言 →

Inference

精修版

测试时计算

Test-Time Compute / Inference-Time Scaling

测试时计算,也更直白地说是推理时扩展计算,是在模型运行时额外花计算来提升输出质量。这里的“测试时”不是软件测试阶段,而是模型面对新输入生成答案的阶段。

读寓言 →

Inference

精修版

吞吐量

Throughput

吞吐量衡量模型服务单位时间内处理的请求或 token 数,是评估推理系统容量和成本效率的核心指标。

读寓言 →

Inference

精修版

树搜索

Tree Search

它把一个决策问题展开成树状结构:当前状态是根节点,每个动作产生子节点,再继续展开未来可能状态,最后通过评估选择更好的路径。

读寓言 →

Inference optimization

精修版

连续批处理

Continuous Batching

连续批处理是在模型运行过程中,动态把多个请求的 token 放在一起调度。某些序列结束后,新请求可以进入仍在运行的 batch,而不用等整批请求全部结束。

读寓言 →

Inference optimization

精修版

提示缓存

Prompt Caching

提示缓存复用已处理的系统提示、文档前缀或共享上下文,减少重复预填充计算,从而降低延迟和成本。

读寓言 →

Infrastructure

精修版

运行时

Runtime

运行时是执行 Agent 的环境,负责工具调用、权限、记忆、状态和生命周期控制,决定系统能做什么和如何收束。

读寓言 →

Knowledge access

精修版

检索增强生成

Retrieval-Augmented Generation (RAG)

检索增强生成(Retrieval-Augmented Generation, RAG)是在生成回答前,先从外部知识库、文档库、数据库或搜索系统中检索相关材料,再把这些材料作为上下文交给模型生成答案。

读寓言 →

Knowledge representation

精修版

知识图谱

Knowledge Graph

知识图谱用实体、关系和属性结构化表示知识,适合实体查询、关系分析、合规溯源和推荐。

读寓言 →

Knowledge representation

精修版

本体

Ontology

Ontology 是对一个领域中概念、类别、属性、关系和约束的结构化定义。它帮助系统统一“什么是什么、彼此如何关联、哪些推理是允许的”。在企业 Agent 和知识图谱中,本体用于减少命名混乱、支持关系推理、权限边界、数据集成和可解释检索。

读寓言 →

Knowledge representation

精修版

三元组

Triple

三元组通常用“主语-谓语-宾语”的结构表示一条事实或关系,例如“赵掌柜-经营-林记茶庄”。

读寓言 →

Knowledge-augmented generation

精修版

图增强检索生成

Graph RAG

图增强检索生成(Graph RAG)把知识图谱、实体关系、图遍历或社区摘要引入 RAG。传统 chunk-level vector search 擅长找相似文本,但对多跳关系、实体关联、供应链/组织/合同链路这类问题容易漏掉结构。

读寓言 →

LLM

精修版

上下文窗口

Context Window

Context Window 是模型在一次请求中能处理的输入和输出总量,通常以 token 衡量。它决定了 prompt、检索材料、历史消息、工具结果和生成答案能共同占用的空间。

读寓言 →

LLM

精修版

语言模型

Language Model

语言模型根据上下文对语言序列建模,常见能力包括预测下一个 token、生成文本、理解意图、改写、摘要和问答。

读寓言 →

LLM

精修版

大语言模型

Large Language Model, LLM

大语言模型是在大规模语料和参数规模上训练的语言模型,具备生成、理解、推理表达、代码和泛化能力。

读寓言 →

LLM API gateway and SDK

精修版

LiteLLM

LiteLLM

LiteLLM 提供跨多家模型供应商的 OpenAI 风格统一接口、SDK 和代理层。开发者可以用更一致的方式接入不同模型,而不必为每家供应商写一套完全不同的调用逻辑。

读寓言 →

LLM Agents

精修版

智能体

Agent

智能体是在给定目标下感知上下文、规划步骤、调用工具、执行动作并根据结果继续推进的 AI 工作单元。

读寓言 →

LLM Agents

精修版

记忆

Memory

Memory 是 AI 系统保存和重新使用信息的能力,使 Agent 能跨步骤、跨会话或跨用户交互保持连续性。企业 Agent 的记忆通常包含工作记忆、长期记忆、情景记忆和语义记忆。

读寓言 →

LLM Agents

精修版

规划

Planning

规划是 AI 系统把目标分解为步骤、选择动作并随条件变化调整路线的过程。它比单次推理更贴近真实交付:需要处理目标、约束、资源、依赖、风险、审批和失败分支。

读寓言 →

LLM Agents

工具调用

Tool Use, Function Calling

工具调用让模型请求外部 API 或函数来检索信息、计算结果或执行动作,是 Agent 从对话走向办事的关键能力。

读寓言 →

LLM Applications

检索增强生成

Retrieval-Augmented Generation, RAG

RAG 会先检索外部知识,再把相关内容作为上下文交给模型生成答案,用于降低幻觉并接入私有知识。

读寓言 →

LLM Behavior

精修版

幻觉

Hallucination

幻觉 Hallucination 是模型生成听起来合理但实际上错误、无证据支持或凭空编造的信息。它常见于模型试图补全缺失事实、过度自信回答、混淆相似信息或缺少可靠上下文时。

读寓言 →

LLM Interaction

精修版

少样本提示

Few-Shot Prompting

Few-Shot Prompting 是在 prompt 中提供少量输入-输出示例,让模型从示例中学习任务格式、判断尺度和输出风格。它不改变模型权重,而是在当前上下文中引导模型行为。

读寓言 →

LLM Interaction

精修版

上下文学习

In-Context Learning

In-Context Learning 是模型根据 prompt 中的指令、示例和上下文临时调整行为的能力,不更新模型权重。Few-shot、格式示例、反例和任务说明都利用了这种能力。

读寓言 →

LLM Interaction

精修版

提示词

Prompt

Prompt 是给语言模型的输入指令或上下文,可以包含任务、问题、背景、示例、约束和期望输出。它是用户或应用把意图传给模型的主要接口。

读寓言 →

LLM Interaction

精修版

提示工程

Prompt Engineering

Prompt Engineering 是设计提示词来引导模型行为、提高任务表现的实践,不改变模型权重。它包括明确目标、提供上下文、设定约束、给出示例、规定输出格式和迭代评测。

读寓言 →

LLM Interaction

精修版

系统提示词

System Prompt, System Message

System Prompt 或 System Message 是对模型行为具有高优先级的指令,用来定义角色、任务边界、政策约束、安全规则和交互方式。它位于指令层级的上层,通常应高于用户消息。

读寓言 →

LLM Interaction

精修版

零样本提示

Zero-Shot Prompting

Zero-Shot Prompting 是不给示例、只通过任务指令让模型完成工作的提示方式。它适合模型已具备通用能力、任务标准明确、风险较低或不值得占用上下文放示例的场景。

读寓言 →

LLM Reasoning

精修版

思维链

Chain-of-Thought, CoT

Chain-of-Thought, CoT 是让模型使用中间推理步骤来解决复杂任务的提示或训练模式。它能提升数学、逻辑、规划等多步任务的表现,但并不保证每一步真实或正确,也不一定适合直接暴露给最终用户。

读寓言 →

LLM application framework

精修版

LangChain

LangChain

LangChain 是构建 LLM 应用的框架,用可组合组件连接提示、模型、检索器、工具、链和 Agent 工作流。

读寓言 →

LLM evaluation and observability library

精修版

TruLens

TruLens

TruLens 是 LLM 应用评测与可观测库,可为 RAG 和 Agent 添加反馈函数,衡量相关性、可信度和依据性。

读寓言 →

LLM inference

精修版

解码阶段

Decode Phase

解码阶段是预填充之后的自回归生成阶段:模型一次生成一个 token,每一步读取 KV 缓存,计算下一个 token,把新的缓存追加进去,并可能把 token 流式返回给用户。

读寓言 →

LLM inference

精修版

预填充

Prefill

Prefill 是 LLM 推理中处理输入 prompt/context 并构建初始 KV cache 的阶段。它发生在模型生成第一个 token 之前,计算量通常随输入长度增长。

读寓言 →

LLM inference optimization

精修版

分页注意力

PagedAttention

PagedAttention 用分页方式管理 KV 缓存块,减少内存碎片并提升 LLM 服务在高并发场景下的吞吐。

读寓言 →

LLM inference server

精修版

文本生成推理

Text Generation Inference, TGI

TGI 是 Hugging Face 的文本生成推理服务器,支持 LLM 部署、批处理、流式输出和生产服务接口。

读寓言 →

LLM infrastructure optimization

精修版

缓存

Caching

缓存复用已有响应、embedding、检索结果、工具结果或提示前缀,用于降低延迟、成本和重复调用。

读寓言 →

LLM observability and evaluation platform

精修版

LangSmith

LangSmith

LangSmith 是 LangChain 生态中的 LLM 应用可观测、调试、评测、监控和测试平台。它帮助团队记录 traces、管理 datasets、运行 evals、比较实验、调试 prompts 和观察 Agent 工作流。

读寓言 →

LLM observability and gateway tool

精修版

Helicone

Helicone

Helicone 是面向 LLM API 的可观测平台,常以代理方式记录日志、延迟、成本、缓存命中和用户反馈。

读寓言 →

LLM operations

精修版

成本跟踪

Cost Tracking

成本跟踪衡量 token usage、provider charges、缓存节省、重试成本、工具调用成本以及按用户、客户、团队或工作流分摊的花费。

读寓言 →

LLM orchestration abstraction

精修版

LangChain 表达式语言

LangChain Expression Language, LCEL

LCEL 是 LangChain 的声明式组合层,用于把提示、模型、解析器、检索器和函数连接成可运行管线。

读寓言 →

LLM program interface

精修版

签名

Signature

这里的 Signature 指 DSPy 里的任务签名,不是加密签名。它用来声明一个 LLM 任务的输入字段、输出字段和语义说明。

读寓言 →

LLM programming and optimization framework

精修版

DSPy

DSPy

DSPy 是一个用于编程和优化 LLM 系统的框架。

读寓言 →

LLM runtime / optimization

精修版

KV 缓存

KV Cache, Key-Value Cache

KV 缓存保存 Transformer 已计算过的 key 和 value,让自回归生成无需反复重算历史 token。

读寓言 →

LLM runtime / user experience

精修版

首 Token 时间

Time to First Token, TTFT

首 Token 时间(TTFT)衡量的是流式 LLM 响应中,从请求发出到收到第一个真实生成 token 的时间。它决定系统看起来多快开始回应。

读寓言 →

LLMOps / application platform

精修版

提示词管理

Prompt Management

提示词管理是对提示词模板、变量、版本、实验、审批和效果追踪进行系统化管理的实践。在 LLM 应用里,prompt 决定任务边界、语气、工具调用、输出格式和安全约束。

读寓言 →

LLMOps / quality

精修版

评测

Evaluation, Evals

评测是用人工、规则或模型裁判衡量 AI 系统在任务质量、安全性、稳定性和成本上的表现。企业 Agent 的 evals 应覆盖真实任务、边界场景、回归样例、安全红线、延迟和费用,并与发布流程绑定。

读寓言 →

LLMOps / quality

精修版

黄金数据集

Golden Dataset, Golden Set

黄金数据集是一组经过人工确认、可重复使用的高质量样例,用于回归评测和模型或提示词对比。对 LLM 应用,它通常包含真实任务输入、期望输出、评分标准、边界场景和安全禁区。

读寓言 →

Local model packaging

精修版

模型文件配置

Modelfile

Modelfile 是 Ollama 等本地模型工具的配置文件,用来定义基础模型、参数、系统提示和定制构建方式。

读寓言 →

Local model runtime

精修版

Ollama

Ollama

Ollama 是本地模型运行和管理工具,可拉取、打包、运行并服务 LLM,适合个人机器或私有环境部署。

读寓言 →

MLOps / data platform

精修版

特征库

Feature Store

特征库是集中生产、存储、复用和服务机器学习特征的数据平台组件。它把训练时使用的特征和线上推理时使用的特征统一管理,减少 training-serving skew,并让特征有版本、血缘、质量检查和复用边界。

读寓言 →

MLOps / governance

精修版

模型版本管理

Model Versioning

模型版本管理用于追踪不同模型、数据、参数和代码组合,确保部署、回滚和审计可复现。它不只是给模型起版本号,还要记录训练数据、特征、超参数、评测结果、审批状态、部署环境和使用范围。

读寓言 →

MLOps / monitoring

精修版

模型漂移

Model Drift

模型漂移是生产环境中的输入分布、目标关系或业务语境变化,导致模型或 Agent 效果下降的现象。它可能来自用户变化、业务流程变化、数据采集方式变化、外部市场变化,也可能来自工具、政策和上游系统调整。

读寓言 →

MLOps / platform

精修版

模型注册表

Model Registry

模型注册表是集中管理模型版本、元数据、审批状态和部署流转的系统。它通常记录模型 artifact、版本、训练来源、评测结果、负责人、风险等级、阶段状态和部署目标。

读寓言 →

Machine Learning

精修版

泛化

Generalization

泛化指模型在训练数据之外的未见样本上仍能保持良好表现,而不是只在见过的数据上得分高。

读寓言 →

Machine Learning

精修版

梯度下降

Gradient Descent

Gradient Descent 是用梯度信息逐步更新模型参数、降低损失函数的优化方法。学习率、批大小和优化器会影响它是稳定下降、震荡还是陷入差的区域。

读寓言 →

Machine Learning

精修版

超参数

Hyperparameters

超参数是训练前或训练过程中由人设定的配置,例如学习率、训练轮数、batch size、模型层数、上下文长度和正则化强度。它们不是模型自己从数据里学出来的,却会深刻影响训练成本、稳定性和最终效果。

读寓言 →

Machine Learning

精修版

损失函数

Loss Function

损失函数是衡量模型输出和目标答案差距的数学目标。训练时,模型会沿着降低损失的方向调整参数,所以损失函数等于告诉模型“什么算错、错多少”。

读寓言 →

Machine Learning

精修版

机器学习

Machine Learning, ML

它让计算机不是只按人手写的规则工作,而是从数据样本中学习规律,用学到的模式对新输入做预测、分类、生成或决策。

读寓言 →

Machine Learning

精修版

过拟合

Overfitting

模型在训练数据上表现很好,却学到了噪声、偶然模式或过细细节,导致遇到新数据时表现变差。

读寓言 →

Machine Learning

精修版

参数

Parameters

参数是模型内部可学习的数值,例如神经网络里的权重和偏置。训练过程会不断调整这些数值,让模型从输入产生更符合目标的输出。

读寓言 →

Machine Learning

精修版

强化学习

Reinforcement Learning, RL

智能体在环境中观察状态、选择动作、获得奖励或惩罚,并通过多次试错学习一套能最大化长期收益的策略。

读寓言 →

Machine Learning

精修版

监督学习

Supervised Learning

模型用带标签的数据训练:每个样本都有输入和对应的正确答案,模型学习从输入预测标签。

读寓言 →

Machine Learning

精修版

测试集

Test Set

Test Set 是在开发选择固定之后才使用的保留数据,用于估计模型在未见样本上的最终表现。它是上线前的最后验收之一;被污染后,指标会虚高,业务风险会被低估。

读寓言 →

Machine Learning

精修版

训练集

Training Set

Training Set 是用于拟合模型参数的数据。它直接参与学习,因此数据质量、覆盖范围、标签一致性和泄漏控制会决定模型学到什么。企业不能把验证或测试样本混入训练集。

读寓言 →

Machine Learning

精修版

无监督学习

Unsupervised Learning

Unsupervised Learning 是在没有显式标签的数据中寻找结构,例如聚类、降维、异常检测和主题发现。它适合探索未知模式、整理大量数据和发现相似群组。企业使用时要避免把自动发现的簇直接当业务真相,通常需要领域专家解释和验证。

读寓言 →

Machine Learning

精修版

验证集

Validation Set

Validation Set 是开发过程中保留出来、用于调参和选择方案的数据集。它帮助判断模型是否泛化,但因为会被反复查看,不能当作最终客观成绩。

读寓言 →

Managed agent API

精修版

OpenAI 助手 API

OpenAI Assistants API

OpenAI Assistants API 是托管助手接口,围绕线程、消息、运行、工具和文件管理持久对话状态。

读寓言 →

Managed agent object

精修版

助手

Assistant

助手是托管 Agent 平台中预配置的 AI 实体,通常绑定指令、模型、工具和文件,不只是一次临时聊天。

读寓言 →

Managed model and agent API

精修版

OpenAI 响应 API

OpenAI Responses API

OpenAI Responses API 是统一的模型与 Agent 式工作流接口,支持模型响应、工具调用、多模态输入、结构化输出和内置工具等能力。

读寓言 →

Managed retrieval tool

精修版

文件搜索

File Search

File Search 是托管检索能力:将上传文件建立索引,在模型生成回答时检索相关内容。它通常承担 RAG 中的文件摄取、切分、索引和召回环节,适用于合同、手册、知识库等场景,但仍需要处理权限隔离、文件更新、引用质量和答案评测。

读寓言 →

Managed tool execution

精修版

代码解释器

Code Interpreter

Code Interpreter 是让模型在受控沙箱中编写并运行代码的托管工具,常用于数据分析、文件处理、计算、可视化和临时脚本执行。

读寓言 →

Managed vector database

精修版

Pinecone

Pinecone

Pinecone 是托管型向量数据库服务,为生产级 AI 应用提供向量存储、相似度搜索和元数据过滤。

读寓言 →

Marketing / Enterprise sales

精修版

标杆案例

Reference Case, Lighthouse Case, Benchmark Customer Case

标杆案例是可复用的代表性客户成功样本,用来证明产品在某行业、场景或预算池中真实产生了结果。

读寓言 →

MoE

精修版

辅助损失

Auxiliary Loss / Load Balancing Loss

辅助损失是 MoE 训练中的额外约束,用来让 token 更均衡地分配到专家,避免少数专家过载或闲置。

读寓言 →

MoE

精修版

专家路由

Expert Routing / Gating

专家路由是 MoE 中决定每个 token 交给哪些专家处理的机制,通常由门控网络为专家打分并选择。

读寓言 →

MoE

精修版

Top-k 路由

Top-k Routing

Top-k Routing 是 MoE gating 的一种策略:每个 token 只发送给得分最高的 k 个专家,而不是所有专家。

读寓言 →

Model Risk Management

精修版

模型清单

Model Inventory

Model Inventory 是集中记录开发、验证、生产、退役或第三方使用中模型的清单,包含所有权、用途、状态、风险和元数据。

读寓言 →

Model Risk Management

精修版

模型监控

Model Monitoring

模型监控是在模型部署后持续测量其行为、性能、输入、输出、风险和事故。它覆盖数据漂移、概念漂移、质量下降、延迟、成本、异常输出、安全事件和业务指标。

读寓言 →

Model Risk Management

精修版

模型风险管理

Model Risk Management, MRM

模型风险管理是治理模型错误、误用、漂移、限制、假设和运营失败所带来风险的纪律。MRM 通常包括模型清单、风险分级、模型验证、审批、监控、变更管理、供应商模型管理、例外处理和定期复审。

读寓言 →

Model Risk Management

精修版

模型验证

Model Validation

模型验证是独立或结构化的审查,用来判断模型是否适合预定用途、表现是否符合预期、限制是否清楚。它通常检查模型目的、数据、假设、方法、性能、稳定性、偏差、边界条件、文档和监控计划。

读寓言 →

Model interface

精修版

函数调用

Function Calling

Function Calling 是一种模型接口:开发者预先定义函数名称、参数 schema 和说明,模型在需要调用外部能力时输出机器可读的函数名和参数,由应用程序校验并执行。

读寓言 →

Model interface

精修版

JSON 模式

JSON Mode

JSON Mode 是一种生成模式,用来促使或约束模型输出有效 JSON,而不是自由文本。它适合需要机器解析的场景,如信息抽取、配置生成、轻量结构化返回。

读寓言 →

Model interface

精修版

结构化输出

Structured Output

Structured Output 是把模型响应约束为指定结构或 schema 的做法,例如 JSON object、字段类型、枚举、数组和嵌套对象。

读寓言 →

Model interface

精修版

结构化输出

Structured Outputs

结构化输出约束模型按 JSON 等固定 schema 返回结果,让下游系统能稳定解析、校验和自动处理。

读寓言 →

Multi-agent architecture

精修版

监督智能体

Supervisor Agent

Supervisor Agent 是多智能体系统中的监督与协调角色。它监控任务进展,分派子任务,协调 subagents,处理失败,判断何时重规划、升级给人、合并结果或停止执行。

读寓言 →

Multi-agent coordination

精修版

群聊编排

Group Chat Orchestration

Group Chat Orchestration 是多 Agent 共享对话中的编排机制。它负责选择下一位发言者、路由消息、管理上下文、判断任务是否完成,并防止重复、跑题和无限循环。

读寓言 →

Multi-agent framework

精修版

AutoGen

AutoGen

AutoGen 是用于构建多智能体应用的框架。它让多个 conversational agents 通过消息传递协作,并可调用工具、执行代码、进行人工参与或群聊编排。

读寓言 →

Multi-agent organization unit

精修版

Agent 团队

Crew

Crew 是多 Agent 系统中的团队组织单元,通常由多个具有角色、目标、工具和任务边界的 Agent 组成。它强调把复杂工作组织成协作团队,而不是单个 Agent 包办全部能力。

读寓言 →

Multi-agent role

精修版

用户代理 Agent

User Proxy Agent

User Proxy Agent 是多 Agent 系统中代表用户的角色,常见于 AutoGen。它可以提供人工输入、审批动作、代用户执行受控代码或把问题交还给真人。

读寓言 →

Multi-agent workflow framework

精修版

CrewAI

CrewAI

CrewAI 是多 Agent 工作流框架,用角色化 Agent、任务、工具和流程组织协作,适合搭建团队式自动化。

读寓言 →

Multimodal

精修版

CLIP

Contrastive Language-Image Pre-training

CLIP(Contrastive Language-Image Pre-training)通过对比学习把图像和文本表示对齐:匹配的图文对在向量空间中更近,不匹配的更远。它是多模态检索、零样本分类和图文理解的重要基础。

读寓言 →

Multimodal

精修版

交叉模态对齐

Cross-Modal Alignment

交叉模态对齐是让文字、图像、音频、视频等不同形式的信息指向同一个对象或含义。比如一段文字说明、一张图片和一段操作视频,都应该被模型理解为同一个工件、步骤或风险点。

读寓言 →

Multimodal

精修版

多模态模型

Multimodal Model

Multimodal Model 是能够处理多种模态的模型,例如文本、图像、音频、视频,并可能跨模态生成或推理。企业场景中,多模态模型可用于质检、客服、文档理解、视频巡检、语音交互、培训和现场支持。

读寓言 →

Multimodal AI

精修版

视频理解

Video Understanding

Video Understanding 是模型理解视频中画面、对象、动作、语音、字幕和时间关系的能力。它不同于单张图像识别,重点在时序、事件、因果和跨模态线索。

读寓言 →

Multimodality

精修版

对比学习

Contrastive Learning

Contrastive Learning 是通过比较正样本和负样本来学习表示的方法。模型被训练为让语义相近或同类样本的向量更接近,让不相关或易混淆样本更远。它常用于 embedding 模型、跨模态对齐、检索模型、推荐和相似案例匹配。

读寓言 →

Multimodality

精修版

跨模态嵌入

Cross-Modal Embedding

Cross-Modal Embedding 是把不同模态的数据,例如文本、图片、音频、视频或结构化对象,映射到可比较的共同向量空间。

读寓言 →

Multimodality

精修版

多模态

Multimodality

Multimodality 指 AI 系统能够处理、结合或生成多种模态的数据,包括文本、图像、音频、视频和结构化信号。企业 Agent 落地中,多模态能力让系统能理解截图、合同扫描件、客户语音、操作视频、表格和日志,而不只依赖用户文字描述。

读寓言 →

Multimodality

精修版

视觉语言模型

Vision-Language Model, VLM

Vision-Language Model, VLM 是能同时处理视觉输入和语言输入,并用语言进行解释、问答或决策的模型。它可用于截图理解、文档扫描件解析、现场故障诊断、商品识别、多模态 RAG 和 UI 操作 Agent。

读寓言 →

NLP / RAG

精修版

实体抽取

Entity Extraction

Entity Extraction 是从非结构化文本、图片 OCR 或对话中识别并抽取实体,如人名、公司、产品、金额、日期、地址、合同编号和业务对象。它是知识库构建、搜索、风控、CRM 自动化和 Agent 工具调用的重要前处理。

读寓言 →

NLP / knowledge graph

精修版

关系抽取

Relation Extraction

它从文本中识别实体,并判断实体之间存在什么关系,例如雇佣、收购、位于、导致、属于、治疗、供应等。

读寓言 →

NLP and RAG framework

精修版

Haystack

Haystack

Haystack 是开源搜索、问答、RAG 和 LLM 管线框架,常用于企业文档和知识库上的检索增强应用。

读寓言 →

Observability

精修版

工具调用延迟

Tool Call Latency

工具调用延迟是 Agent 等待外部工具、API、数据库、浏览器或服务返回结果的时间。即使模型本身很快,工具等待也可能成为用户体验的主要瓶颈。

读寓言 →

Observability artifact

精修版

跨度

Span

Span(跨度)是 Trace 中的一次具体操作记录。它通常表示一次模型调用、检索、工具调用、数据库查询、解析、审批或中间步骤,包含开始时间、结束时间、耗时、输入输出、状态、错误和关联上下文。

读寓言 →

Observability artifact

精修版

跟踪记录

Trace

Trace(跟踪记录)记录一次请求或任务从开始到结束的完整执行路径。对 Agent 系统来说,一个 trace 通常包括用户输入、模型调用、检索步骤、工具调用、参数、返回结果、延迟、错误和中间状态。

读寓言 →

Observability standard

精修版

OpenTelemetry

OpenTelemetry, OTel

OpenTelemetry 是厂商中立的可观测标准,用于采集链路、指标和日志,帮助追踪 Agent 应用全流程。

读寓言 →

Open-source AI observability and evaluation tool

精修版

Arize Phoenix

Arize Phoenix

Arize Phoenix 是开源 AI 可观测和评测工具,用于追踪、评估和分析 LLM、RAG 与机器学习应用行为。

读寓言 →

Open-source LLM observability platform

精修版

Langfuse

Langfuse

Langfuse 是开源 LLM 可观测平台,用于追踪调用、提示、生成结果、评分、成本和用户反馈。

读寓言 →

Open-source vector database

精修版

Milvus

Milvus

Milvus 是一个开源分布式向量数据库,专为大规模向量相似度搜索设计。它采用存储计算分离架构,支持多种索引类型(HNSW、IVF_FLAT、IVF_PQ、DiskANN 等)、水平扩展、数据持久化和混合查询。

读寓言 →

Open-source vector database

精修版

Qdrant

Qdrant

Qdrant 是开源向量数据库和搜索引擎,支持向量相似度检索、结构化元数据过滤、HNSW 索引和量化。

读寓言 →

Open-source vector database

精修版

Weaviate

Weaviate

Weaviate 是一个开源向量数据库,结合了向量搜索、结构化过滤、关键词搜索(BM25)和基于 schema 的对象存储。它的核心设计理念是'向量化一切':每个数据对象可以同时拥有向量、结构化属性和关键词倒排索引,查询时可以混合加权使用。

读寓言 →

Operations

精修版

变更管理

Change Management

变更管理是对变更进行申请、评审、批准、测试、沟通、发布和回滚的受控流程。它不是拖慢迭代,而是让高风险变更有证据、有责任人、有退出路径。

读寓言 →

Operations

精修版

升级路径

Escalation Path

升级路径是预先定义的异常上报和转交流程,用于处理高风险、低置信度、权限不足或合规敏感情况。

读寓言 →

Operations

精修版

异常处理

Exception Handling

异常处理 Exception Handling 是系统在遇到无法正常继续、输入异常、工具失败、权限不足、低置信度或风险升高时的识别、分流、记录、恢复和升级机制。

读寓言 →

Operations

精修版

热加载

Hot Reload

Hot Reload 是在不中断或少中断服务的情况下更新配置、提示词、工具、路由、策略或模型版本的能力。对 LLM/Agent 系统,它能提高迭代速度,但需要版本管理、验证、灰度、回滚、状态一致性和审计记录,避免运行中配置漂移或半更新状态。

读寓言 →

Operations

精修版

人工旁路监督

Human-on-the-Loop, HOTL

Human-on-the-Loop(人工旁路监督)是一种运行模式:AI 或 Agent 可以自动执行任务,但人类在旁边监控,并能在异常、风险升高或结果不符合预期时介入、暂停、覆盖或接管。

读寓言 →

Operations

精修版

事后复盘

Postmortem

事后复盘 Postmortem 是事故、故障或重大失败后的结构化回顾,用来还原时间线、分析根因、评估影响、明确修复动作和防止复发。好的复盘强调系统改进而不是简单追责,最终要产出可执行的行动项、负责人和验证方式。

读寓言 →

Operations

精修版

质量保障

Quality Assurance, QA

Quality Assurance, QA 是在 AI 应用和 Agent 交付中建立质量标准、测试流程、抽样复核、缺陷分级和回归检查,确保输出满足业务要求。它覆盖知识准确性、流程完成、工具调用、格式、合规、安全和用户体验。

读寓言 →

Operations

精修版

回滚

Rollback

回滚 Rollback 是当新版本、模型、提示词、工具、配置或流程出现问题时,快速恢复到之前稳定状态的机制。它不是失败后的临时补救,而是发布和变更设计的一部分。

读寓言 →

Operations

精修版

回滚计划

Rollback Plan

回滚计划 Rollback Plan 是在变更上线前预先定义的恢复方案,包括触发条件、负责人、恢复步骤、时间限制、验证方法和沟通方式。它比单纯的回滚动作更完整,强调什么时候回滚、谁来决定、怎么执行、如何确认恢复成功。

读寓言 →

Operations

精修版

根因分析

Root Cause Analysis, RCA

根因分析 Root Cause Analysis(RCA)是找出问题背后真正原因的分析方法,而不是只处理表面症状。它常用于事故、质量问题、系统故障和业务异常复盘中。

读寓言 →

Operations / finance

精修版

云成本运营

FinOps

FinOps 是跨工程、财务和业务团队管理云资源、模型调用、预算、归因和成本优化的实践体系。

读寓言 →

Operations / infrastructure

精修版

自动扩缩容

Autoscaling

自动扩缩容根据负载、队列长度、CPU、GPU 或请求指标动态调整资源数量,以平衡成本和性能。

读寓言 →

Operations / platform

精修版

大语言模型运维

LLMOps

LLMOps 是面向大语言模型应用的运维体系,重点管理提示词、检索、评测、安全、成本、延迟和模型版本。

读寓言 →

Operations / platform

精修版

机器学习运维

MLOps

MLOps 是将机器学习模型从实验推进到稳定生产的工程体系,覆盖数据、训练、部署、监控和治理。它强调数据与特征管理、实验追踪、模型注册、CI/CD、上线审批、性能监控、漂移检测和回滚。

读寓言 →

Operations / reliability

精修版

死信队列

Dead-Letter Queue, DLQ

死信队列会保存那些多次重试后仍失败,或没有通过校验的消息和任务。它把问题任务隔离出来,避免阻塞正常主流程。

读寓言 →

Operations / reliability

精修版

灾难恢复

Disaster Recovery, DR

灾难恢复是一组架构、备份、预案、演练和操作流程,用于重大故障后恢复关键系统和数据。

读寓言 →

Operations / reliability

精修版

可观测性

Observability

可观测性是通过日志、指标、追踪和事件来理解系统内部状态的能力。对 Agent 系统来说,可观测性不只是知道任务成功或失败,而是能回看模型调用、检索、工具调用、参数、延迟、错误、成本和中间输出。

读寓言 →

Operations / reliability

精修版

恢复点目标

Recovery Point Objective, RPO

恢复点目标定义系统可接受的最大数据丢失时间,用来决定备份、复制和恢复策略的频率。

读寓言 →

Operations / reliability

精修版

恢复时间目标

Recovery Time Objective, RTO

恢复时间目标(RTO)是故障发生后,某项服务或业务能力可接受的最长恢复时间。它回答的是:最多能停多久。

读寓言 →

Operations / security

精修版

事故响应

Incident Response

事故响应 Incident Response 是系统发生故障、安全事件、质量事故或业务风险时的一整套处理流程,包括发现、分级、止血、隔离、恢复、沟通、取证和复盘。

读寓言 →

Operations/Audit

精修版

抽样复核

Sampling Review

Sampling Review 是在无法全面人工复核所有 AI 输出或 Agent 任务时,按风险、场景、客户、金额、历史问题和随机性抽取样本进行人工检查。

读寓言 →

Operations/Auditability

精修版

版本控制

Version Control

版本控制记录提示、模型、数据集、工具、策略、代码和配置的变化,让历史状态可审计、回滚和复现。

读寓言 →

Operations/Governance

精修版

审批门槛

Approval Gate

审批门槛 Approval Gate 是工作流中要求人工批准、策略校验或权限确认后才能继续的控制点。它通常用于高风险、高金额、不可逆、对外承诺、隐私敏感或合规相关动作。

读寓言 →

Operations/Governance

精修版

变更咨询委员会

Change Advisory Board, CAB

变更咨询委员会是跨职能评审机制,用于评估重大变更的风险、准备度、合规影响和运营影响。

读寓言 →

Operations/Risk

精修版

AI 事故

AI Incident

AI 事故是 AI 系统造成或险些造成伤害、违规、安全问题、数据泄露或重大运营中断的事件。

读寓言 →

Operations/Risk

精修版

业务连续性

Business Continuity

业务连续性关注的是中断发生时,关键业务承诺还能不能继续履行。灾难恢复更偏向把技术系统恢复起来;业务连续性更关心接单、履约、收款、客服、合规通知等能力是否有替代办法。

读寓言 →

Operations/Risk

精修版

置信度阈值

Confidence Threshold

置信度阈值是预设的信心或风险门槛,用来决定 AI 输出自动通过、复核、拒绝、降级或升级。

读寓言 →

Operations/Risk

精修版

事实核验

Fact Verification

事实核验 Fact Verification 是把 AI 生成的声明、结论或关键事实与可信来源、原始证据、权威系统或业务记录进行对照确认的过程。它用于降低幻觉、过时信息、误读和错误传播风险。

读寓言 →

Operations/Security

精修版

事故管理

Incident Management

事故管理覆盖发现、分级、止损、调查、沟通和修复流程,用于处理 AI、安全、隐私或运营事故。

读寓言 →

Orchestration

精修版

有向无环图

Directed Acyclic Graph, DAG

Directed Acyclic Graph(DAG,有向无环图)是一种由节点和有向边组成且不存在环的图结构,常用于表示任务、数据管道或工作流的依赖关系。

读寓言 →

Orchestration

精修版

意图识别

Intent Classification

Intent Classification 是判断用户请求属于哪类意图,以决定后续流程、工具、Agent 或回复策略的能力。它可以由规则、传统分类器或 LLM 完成。

读寓言 →

Orchestration

精修版

语义路由

Semantic Routing

语义路由 Semantic Routing 是根据请求的含义、意图、上下文和任务类型,把请求分发到合适的模型、工具、Agent、知识库或工作流。它不同于简单关键词匹配,更关注用户真正要完成的事。

读寓言 →

Orchestration component

精修版

路由器

Router

路由器 Router 是把请求、任务或中间步骤分发到合适模型、工具、工作流、技能或 Agent 的组件。它可以根据意图、能力、成本、延迟、风险、权限、负载和策略做决策。

读寓言 →

PEFT

精修版

适配器

Adapter

Adapter 是一种参数高效微调方法,通常在模型层之间插入小型可训练模块,同时冻结基础模型大部分权重。它让同一个基础模型可以通过不同 adapter 适配不同任务、领域或客户。

读寓言 →

PEFT

精修版

IA3

Infused Adapter by Inhibiting and Amplifying Inner Activations

IA3 是极高效的参数微调方法,通过学习向量缩放键、值和前馈激活,所需参数通常少于 LoRA。

读寓言 →

PEFT

精修版

合并权重

Merge Weights / Merge Adapters

合并权重是把 LoRA 或 Adapter 等 PEFT 训练出的增量并入基础模型权重,便于部署和减少运行依赖。

读寓言 →

PEFT

精修版

前缀微调

Prefix Tuning

Prefix Tuning 是一种 PEFT 方法,冻结基础模型参数,只训练一组可学习的连续前缀向量,并把它们作为模型各层 attention 的额外上下文来影响输出。

读寓言 →

PEFT

精修版

提示微调

Prompt Tuning

Prompt Tuning 是一种 PEFT 方法,通常冻结模型参数,只学习一小组连续的 soft prompt 向量,并将其附加到输入前,以引导模型完成特定任务。

读寓言 →

PEFT

量化低秩适配

Quantized LoRA, QLoRA

QLoRA 将基础模型量化到 4 bit,并只训练 LoRA 适配器,使大模型能在较低显存设备上完成微调。

读寓言 →

PEFT

精修版

目标模块选择

Target Module Selection

目标模块选择是在 LoRA、Adapter 或 IA3 等方法中决定插入、训练或调整哪些模型模块的过程。

读寓言 →

Platform / backend infrastructure

精修版

工作流引擎

Workflow Engine

工作流引擎负责把多步骤任务持久化、调度、执行和恢复。它记录每一步状态、输入输出、依赖关系、失败原因、重试规则、人工审批和下一步路由。

读寓言 →

Platform / billing

精修版

配额

Quota

配额定义用户、租户或计划在一定周期内可使用的资源上限,例如 token、请求数、存储量或并发数。对 LLM/Agent 平台,quota 用来保护共享模型、GPU、工具执行器、检索服务和预算,避免单个租户或异常任务耗尽资源。

读寓言 →

Platform / integration

精修版

连接器

Connector

Connector 是把 AI 系统接入外部应用、数据库、文件、SaaS 或企业系统的适配组件。它负责 API 调用、认证授权、权限边界、参数转换、错误处理、速率限制和审计,使 Agent 能稳定使用外部能力,而不是依赖一次性胶水代码。

读寓言 →

Platform / reliability

精修版

持久执行

Durable Execution

持久执行是让长任务在进程崩溃、机器重启、网络中断、超时或人员切换后仍能继续或恢复的执行方式。它通过持久化事件、状态、输入输出和检查点,避免任务只存在于内存或一次会话里。

读寓言 →

Platform architecture

精修版

云原生

Cloud Native

云原生是面向云环境设计、构建和运行应用的方式,强调容器化、微服务、弹性伸缩、自动化部署、可观测性和故障隔离。

读寓言 →

Platform engineering

精修版

内部开发者平台

Internal Developer Platform, IDP

内部开发者平台为工程团队提供标准化自助入口,用于创建、部署、监控和运维应用,通常包含服务目录、模板、权限、环境和 CI/CD 能力。

读寓言 →

Platform engineering / governance

精修版

黄金路径

Golden Path, Paved Road

Golden Path / Paved Road 是平台团队为常见开发、部署和运维场景提供的推荐流程、模板和默认配置。它让团队以较少决策完成合规、可靠的交付,同时允许特殊情况有受控例外。

读寓言 →

Policy

精修版

AI 政策

AI Policy

AI Policy 是组织对 AI 使用、采购、部署和治理的正式规则集合,明确允许与禁止的用途、数据处理边界、审批流程、监督要求、披露义务、日志审计和违规后果。

读寓言 →

Policy

精修版

可接受使用政策

Acceptable Use Policy, AUP

可接受使用政策规定 AI 或 Agent 产品的允许和禁止用途,用于约束欺诈、伤害、违法和隐私侵犯等风险。

读寓言 →

PostgreSQL vector extension

精修版

pgvector

pgvector

pgvector 是 PostgreSQL 扩展,为关系数据库增加向量存储、相似度搜索和元数据过滤能力,常用于轻量 RAG 系统。

读寓言 →

Preprocessing

精修版

BPE

Byte-Pair Encoding

BPE 是一种子词分词方法,会反复合并语料中最常见的相邻符号对,形成固定词表。

读寓言 →

Preprocessing

精修版

SentencePiece

SentencePiece

SentencePiece 是一种常用的子词分词工具和算法框架,特点是把输入视为原始字符序列,不强依赖空格分词,适合多语言和混合文本。

读寓言 →

Pretraining

精修版

语料库

Corpus

语料库是一组被收集、整理并用于训练、检索、评估或分析的数据材料,可以是文本、图片、音频、代码、表格或对话记录。

读寓言 →

Pretraining

精修版

基座模型

Foundation Model

Foundation Model 是在广泛数据上训练出来、可迁移到许多下游任务的大模型。它是企业 Agent 的能力底座,但不是完整产品;真正交付还需要数据接入、工具、权限、评测、成本控制和业务流程。

读寓言 →

Pretraining

精修版

预训练

Pretraining

预训练是模型的大规模初始训练阶段,通常通过自监督目标从海量语料中学习语言、知识和通用模式。它让模型形成底子,但还不会自动懂某家企业的流程、边界和工具。

读寓言 →

Pretraining

精修版

自监督学习

Self-Supervised Learning

自监督学习是从数据本身构造监督信号的学习方式,比如预测下一个 token、补全被遮住的词或判断片段关系。它不需要每条数据都由人工标注答案。

读寓言 →

Privacy

精修版

匿名化

Anonymization

匿名化是把个人数据处理到无法识别特定个人,且在合理可用的信息和手段下也难以重新识别的状态。

读寓言 →

Privacy

精修版

数据最小化

Data Minimization

它要求只收集、处理、访问和保留完成明确目的所必需的数据,不因为“以后可能有用”就多拿。

读寓言 →

Privacy

精修版

数据保护影响评估

Data Protection Impact Assessment, DPIA

DPIA 是处理个人数据尤其高风险活动前的影响评估,用于识别隐私风险、控制措施和合规依据。

读寓言 →

Privacy

精修版

数据保留政策

Data Retention Policy

它规定不同类型的数据应保留多久,到期后删除、归档、匿名化还是继续保存,以及例外情况由谁批准。

读寓言 →

Privacy

精修版

差分隐私

Differential Privacy

差分隐私通过加入经过设计的数学噪声,限制单个样本对统计结果的影响。目标是让外部人很难从输出里判断某个人的数据是否参与了计算。

读寓言 →

Privacy

精修版

成员推断攻击

Membership Inference Attack

成员推断攻击是攻击者通过反复查询模型、观察置信度或输出特征,判断某条数据是否出现在训练集中。它泄露的不是数据全文,而是“某个人或某条记录是否被用过”这个事实。

读寓言 →

Privacy

精修版

模型反演攻击

Model Inversion Attack

攻击者通过观察模型输出、概率分数、相似度、置信度或多次查询,反推出训练数据中的敏感特征,甚至重建部分原始数据。

读寓言 →

Privacy

精修版

个人数据

Personal Data

个人数据是指与已识别或可识别自然人相关的信息。只要能直接或间接指向某个人,就可能属于个人数据。

读寓言 →

Privacy

精修版

个人身份信息

Personally Identifiable Information, PII

PII。它是能够直接或间接识别特定个人的信息,例如姓名、身份证号、手机号、邮箱、照片、地址,也包括与其他信息结合后能识别个人的线索。

读寓言 →

Privacy

精修版

假名化

Pseudonymization

假名化是把姓名、手机号等直接标识替换成编号或假名,并把能重新识别身份的对照信息分开保存。它能降低暴露风险,但不是匿名化。

读寓言 →

Privacy

精修版

目的限制

Purpose Limitation

目的限制是隐私保护中的原则:个人数据应为明确、具体的目的收集,之后不能无依据地改作不相容的新用途。

读寓言 →

Privacy

精修版

安全聚合

Secure Aggregation

安全聚合常用于联邦学习等场景:服务器只得到多个参与方更新后的总和,而看不到任何单方的明文更新。它让大家能共同训练或统计,同时降低单个参与者数据泄露风险。

读寓言 →

Privacy

精修版

敏感个人数据

Sensitive Personal Data

它是个人数据中一类伤害风险更高的信息,例如健康、金融、生物识别、精确位置、未成年人信息、种族宗教、政治观点、性取向或可能导致歧视和重大权益损害的数据。

读寓言 →

Privacy/Compliance

精修版

跨境数据传输

Cross-Border Data Transfer

它指个人数据、业务数据或其他受监管数据从一个国家或地区流向另一个国家或地区,或者被境外主体远程访问、处理、存储、备份。

读寓言 →

Privacy/Compliance

精修版

数据本地化

Data Localization

数据本地化是指法律、政策或合同要求某类数据必须留在特定国家、地区或监管边界内,不能随意跨境传输、处理或存储。

读寓言 →

Privacy/Compliance

精修版

数据驻留

Data Residency

它要求某些数据必须存储、处理、复制、备份或恢复在指定国家、地区、云区域、机房或客户控制环境内。

读寓言 →

Procurement

精修版

供应商评估

Vendor Evaluation

Vendor Evaluation 是采购和风险团队评估 AI 供应商能力、安全、合规、经济性、支持能力和运营匹配度的过程。

读寓言 →

Procurement/Architecture

精修版

供应商锁定

Vendor Lock-In

供应商锁定是专有 API、数据格式、工作流、合同条款或模型行为导致更换供应商成本过高的依赖风险。

读寓言 →

Procurement/Privacy

精修版

数据处理协议

Data Processing Agreement, DPA

Data Processing Agreement(DPA)是约定供应商或处理方如何代表客户处理个人数据的合同。

读寓言 →

Procurement/Privacy

精修版

数据使用权

Data Usage Rights

数据使用权定义供应商是否以及如何使用客户数据,常覆盖服务交付、统计分析、产品改进、训练和微调。

读寓言 →

Procurement/Privacy

精修版

子处理方

Subprocessor

子处理方是处理方为交付服务而聘用的第三方,可能包括云厂商、模型 API、向量数据库和日志平台。

读寓言 →

Procurement/Privacy

精修版

训练数据排除

Training Data Exclusion

训练数据排除是合同或技术承诺,说明客户数据未经许可不得用于训练、微调或改进供应商模型。

读寓言 →

Procurement/Risk

精修版

退出计划

Exit Plan

Exit Plan 是安全终止或替换供应商的计划,目标是在保留数据访问、服务连续性、合规证明和运营控制的前提下完成迁移。

读寓言 →

Procurement/Risk

精修版

第三方风险管理

Third-Party Risk Management, TPRM

Third-Party Risk Management(TPRM)是对供应商、外包方和合作伙伴进行准入评估、合同约束、持续监控、事件处理和退出管理的生命周期纪律。

读寓言 →

Procurement/Risk

精修版

供应商尽职调查

Vendor Due Diligence

供应商尽职调查是对供应商安全、隐私、合规、财务稳定、服务可靠性和运营能力的结构化审查。

读寓言 →

Procurement/Security

精修版

安全问卷

Security Questionnaire

Security Questionnaire 是买方用于评估供应商安全控制、合规状态、数据处理和事故实践的结构化问卷。它常覆盖身份权限、加密、日志、漏洞管理、渗透测试、合规认证、子处理方、数据留存、备份、业务连续性和事件响应。

读寓言 →

Product / business strategy

精修版

产品市场匹配

Product-Market Fit, PMF

产品市场匹配(PMF)是产品为明确客户群解决强需求,并出现留存、复购、推荐、付费意愿和收入增长等信号的状态。它不是有人夸产品,也不是一次 Demo 成功。

读寓言 →

Product / customer success

精修版

价值实现时间

Time to Value, TTV

Time to Value(TTV)指客户从开始使用到获得可感知业务价值所需的时间。TTV 越短,越有利于试用转化、客户信心、采用率和留存。

读寓言 →

Product / platform

精修版

自助服务

Self-Service

Self-Service 让用户或内部团队无需人工介入即可完成注册、配置、部署、查询、升级、排障等操作。它降低边际服务成本,提升上手速度,也让 PLG 和规模化交付成为可能。

读寓言 →

Product / research

精修版

用户画像

Persona, User Persona

Persona / User Persona 是对典型使用者目标、任务、痛点、环境和行为模式的抽象描述。

读寓言 →

Product / sales

精修版

概念验证

Proof of Concept, POC

Proof of Concept(POC)是在有限范围内验证技术可行性、业务价值或采购信心的项目。高质量 POC 必须有明确假设、范围、成功标准、时间盒、数据条件、责任分工和下一步决策。

读寓言 →

Product engineering / release management

精修版

特性开关

Feature Flag, Feature Toggle

特性开关是在不重新部署代码的情况下,控制某项能力是否启用。它可以按用户、租户、地区、任务类型、模型、工具、策略或风险等级逐步开启。

读寓言 →

Product experience / customer success

精修版

入门引导

Onboarding

Onboarding 是帮助新用户或客户完成账号配置、数据导入、首次任务、权限设置、团队协作和价值确认的过程。好的 onboarding 不只是教程,而是把用户带到激活和首个业务结果。

读寓言 →

Product growth

精修版

激活

Activation

Activation 是新用户首次体验到产品核心价值的过程或关键行为,常被设计成 activation metric。它不同于注册、登录或观看教程;真正的激活必须让用户完成一个能代表产品价值的动作。

读寓言 →

Product strategy

精修版

最小可行产品

Minimum Viable Product, MVP

Minimum Viable Product(MVP)是用最小必要范围验证核心用户需求、价值主张或商业假设的早期产品。

读寓言 →

Product strategy / research

精修版

待完成任务

Jobs to Be Done, JTBD

Jobs to Be Done(JTBD)关注用户在特定情境下想取得的进展,而不是只按身份、行业或功能偏好理解需求。

读寓言 →

Product strategy / workflow design

精修版

AI 原生工作流

AI-Native Workflow

AI 原生工作流围绕 AI 的理解、生成、工具调用、记忆、评估和人工介入能力重新设计工作流程。

读寓言 →

Prompt optimization tool

精修版

提示优化器

Teleprompter

Teleprompter 在 DSPy 中指用于优化 prompts、demonstrations 或程序设置的优化器。它根据训练样本、评测指标和模块结构,搜索更有效的 few-shot 示例、指令或推理策略。

读寓言 →

Prompt/function abstraction

精修版

语义函数

Semantic Function

Semantic Function 是把提示词或自然语言指令包装成可调用单元的抽象,常见于 Semantic Kernel。它像函数一样有名称、输入和输出,可以和 native function、plugin、planner 组合。

读寓言 →

Quality assurance

精修版

评测框架

Evaluation Harness

评测框架 Evaluation Harness 是一套可重复运行的测试环境和用例集合,用来评估模型或 Agent 在不同任务、边界条件、工具调用、延迟、质量和失败场景下的表现。

读寓言 →

Quantization

精修版

双重量化

Double Quantization

Double Quantization 是 QLoRA 中的一种量化技巧:模型权重被量化后,还需要保存量化尺度等常数;双重量化会进一步量化这些量化常数,从而额外节省显存,论文中约可节省 0.4 bit/parameter。

读寓言 →

Quantization

精修版

NF4

NormalFloat 4-bit

NF4 是 QLoRA 引入的 4 bit 数据类型,针对近似正态分布的权重设计,用于更高效地量化大模型。

读寓言 →

RAG

精修版

多模态 RAG

Multimodal RAG

Multimodal RAG 是把文本、图片、表格、图纸、音频、视频等多种模态纳入检索增强生成,让模型回答时能引用不同类型证据。企业场景中,大量知识存在于扫描件、产品图、工单截图、合同表格、录音和视频里。

读寓言 →

RAG / search

精修版

重排序器

Reranker

重排序器(Reranker)是在初步检索后,对候选文档或 chunk 重新评分排序的模型或组件。

读寓言 →

RAG evaluation

精修版

答案相关性

Answer Relevance

答案相关性 Answer Relevance 衡量模型回答是否真正回应用户问题和任务目标。一个回答可以流畅、真实、信息丰富,却仍然不相关,因为它没有解决用户真正问的事。

读寓言 →

RAG evaluation

精修版

上下文精确率

Context Precision

上下文精确率 Context Precision 衡量检索或提供给模型的上下文中,有多少靠前内容真正与问题相关。它关注的不只是答案是否被检索到,还关注相关材料是否排在前面、无关噪音是否过多。

读寓言 →

RAG evaluation

精修版

上下文召回率

Context Recall

上下文召回率 Context Recall 衡量回答问题所需的关键证据是否被检索并放入上下文。它关注的是有没有漏掉必要信息。

读寓言 →

RAG evaluation

精修版

忠实性

Faithfulness

事实一致性 Faithfulness 衡量模型回答是否忠于给定证据或上下文。一个回答可能流畅、有逻辑、甚至大体方向正确,但如果它加入了证据中没有支持的内容、改写了事实关系或夸大结论,就不够 faithful。

读寓言 →

RAG evaluation

精修版

检索精确率

Retrieval Precision

Retrieval Precision 衡量检索返回结果中真正相关结果所占比例。在 RAG 中,它回答的问题是:进入模型上下文的 chunk 里,有多少确实能支撑当前问题。

读寓言 →

RAG evaluation

精修版

检索召回率

Retrieval Recall

Retrieval Recall 衡量所有相关结果中被系统成功检索出来的比例。在 RAG 中,它回答的是:关键证据有没有被召回。低 recall 会导致模型基于不完整上下文作答,在合规、合同、售后和医疗等场景尤其危险。

读寓言 →

Reasoning

精修版

思维图

Graph of Thoughts

思维图用图结构组织中间想法,让推理节点可以分叉、合并、回溯和复用,适合组合型推理任务。

读寓言 →

Reasoning

精修版

自我一致性

Self-Consistency

Self-Consistency 是对同一问题采样多条推理路径,再通过投票或一致性选择最终答案的方法。它常和 Chain-of-Thought 一起用于提高复杂推理稳定性。

读寓言 →

Reasoning

精修版

思维树

Tree of Thoughts

Tree of Thoughts 是把模型推理展开为多条候选路径,并在分支之间进行搜索、评估、剪枝和选择的方法。它适合规划、谜题、策略决策等需要探索多个可能方案的任务。代价是推理成本更高,需要设计分支生成、评估函数、停止条件和搜索预算。

读寓言 →

Reasoning / tool use

精修版

程序辅助语言模型

Program-Aided Language Model, PAL

Program-Aided Language Model, PAL 是让模型生成程序或可执行代码,再通过执行程序解决数学、逻辑、数据处理等问题的方法。模型负责把自然语言问题转成程序,执行器负责精确计算。

读寓言 →

Reasoning/action pattern

精修版

推理-行动范式

ReAct

ReAct 是一种推理-行动交替的 prompting 和 Agent 模式。模型先进行短步推理,选择工具或动作,观察结果后再继续下一轮。它适合需要外部信息、工具调用和逐步决策的任务。

读寓言 →

Regulation

精修版

EU AI 法案

EU AI Act

EU AI 法案是欧盟按风险分级监管 AI 的法律框架,对高风险系统、通用目的 AI 和透明披露提出要求。

读寓言 →

Regulation

精修版

通用目的 AI

General-Purpose AI, GPAI

通用目的 AI 指可适配多种下游用途的通用 AI 模型或系统,可作为多个产品和 Agent 的基础能力。

读寓言 →

Regulation

精修版

高风险 AI 系统

High-Risk AI System

高风险 AI 系统是在监管框架中因用途影响安全、基本权利或重要机会而承担更严格义务的系统。

读寓言 →

Regulation/Compliance

精修版

合格评定

Conformity Assessment

合格评定是在受监管 AI 系统投放或使用前,验证其是否满足适用法律和标准要求的程序。

读寓言 →

Reliability / AI platform

精修版

回退

Fallback

回退是在首选模型、工具、服务或流程失败、变慢、不可用或风险过高时启用的备用路径。

读寓言 →

Reliability / architecture

精修版

熔断器

Circuit Breaker

熔断器是在依赖持续失败或延迟过高时临时停止调用,避免级联故障,并在恢复期逐步探测。

读寓言 →

Reliability / operations

精修版

错误预算

Error Budget

错误预算是在 SLO 允许范围内可消耗的不可靠额度,用于平衡发布速度、实验频率和系统稳定性。

读寓言 →

Reliability / operations

精修版

服务级别目标

Service Level Objective, SLO

服务级别目标是对服务可靠性的可衡量承诺,例如可用性、延迟、错误率或任务完成率。

读寓言 →

Reliability / product experience

精修版

降级

Graceful Degradation

优雅降级是指系统在容量、依赖、模型、工具或数据源异常时,仍提供缩小但有用的服务,而不是整体失败。

读寓言 →

Reliability pattern

精修版

模型回退

Model Fallback

模型回退是在主模型失败、超时、超预算或违反策略时,将请求路由到备用模型或供应商的可靠性模式。

读寓言 →

Reliability technique

精修版

事实锚定

Grounding

Grounding 是把模型输出和决策锚定到给定证据、工具结果、源文档或已验证系统状态上,而不是依赖模型猜测。企业 Agent 中,grounding 是降低幻觉、支撑审计、生成引用和建立用户信任的关键机制。

读寓言 →

Representation learning

精修版

嵌入

Embeddings

Embeddings 是把文本、图片、音频、代码、实体或业务对象转换成稠密数字向量的表示方法。它与已精修的 Embedding 页面讲同一核心机制,但这里强调复数形态在企业系统里的资产化:大量对象被持续编码、存储、检索、更新和评估。

读寓言 →

Reranking

精修版

交叉编码器

Cross-Encoder

Cross-Encoder 是把查询和候选文本一起输入同一个模型,让模型在联合上下文中判断相关性的方法。它通常比只分别编码查询和文档的方式更精细,适合 RAG 的 reranking、搜索结果精排、问答证据选择和合规材料匹配。

读寓言 →

Retrieval

精修版

BM25

BM25

BM25 是经典的关键词检索排序算法,常用于搜索引擎和 RAG 的稀疏检索。它基于词频、逆文档频率和文档长度归一化来判断文档与查询的相关性。BM25 擅长处理专有名词、编号、精确术语和法规条款等字面匹配问题。

读寓言 →

Retrieval

精修版

双编码器

Bi-Encoder

Bi-Encoder 是分别编码查询和文档,将两者转换成向量后用相似度进行匹配的架构。因为文档向量可以离线预计算并存入向量数据库,它非常适合大规模语义检索、RAG 第一阶段召回、相似案例搜索和推荐。

读寓言 →

Retrieval

精修版

假设文档嵌入

Hypothetical Document Embeddings, HyDE

HyDE 先生成假设答案或文档,再对其做 embedding 用于检索,以改善短查询或模糊查询的召回。

读寓言 →

Retrieval

精修版

最大边际相关性

Maximal Marginal Relevance, MMR

Maximal Marginal Relevance, MMR 是一种在相关性和多样性之间做权衡的检索结果选择方法。它会优先选择既与查询相关、又与已选结果不太重复的文档。

读寓言 →

Retrieval

精修版

多跳检索

Multi-Hop Retrieval

多跳检索为回答复杂问题进行多步检索,先找到证据片段,再根据实体、关系或中间结论继续检索。

读寓言 →

Retrieval

精修版

查询改写

Query Rewriting

Query Rewriting 是把用户原始问题改写成更适合检索、数据库查询或工具调用的形式。它能补全指代、标准化术语、拆分复杂问题、生成多路查询,并提升 RAG 召回质量。

读寓言 →

Retrieval

精修版

递归检索

Recursive Retrieval

Recursive Retrieval 是在 RAG 或知识检索中根据已取回内容继续生成后续查询、追踪新实体或补齐缺失证据的检索方式。它适合多跳问题、复杂事实核查、长链业务分析。

读寓言 →

Retrieval infrastructure

精修版

近似最近邻搜索

Approximate Nearest Neighbor Search (ANN Search)

近似最近邻搜索在有限时间和计算资源内找到足够相近的向量,是大规模向量检索的基础技术。

读寓言 →

Retrieval infrastructure abstraction

精修版

文档存储

Document Store

Document Store 是 RAG、搜索和问答管线中存放文本、元数据、嵌入向量和索引信息的存储抽象。它可以由 Elasticsearch、OpenSearch、向量数据库、关系数据库或框架内置存储实现。

读寓言 →

Retrieval infrastructure ecosystem

精修版

向量数据库生态

Vector Database Ecosystem

向量数据库生态包括 Pinecone、Milvus、Qdrant、FAISS 等数据库和检索库,用于存储、索引和查询向量。

读寓言 →

Retrieval method

精修版

密集检索

Dense Retrieval

密集检索(Dense Retrieval)用神经网络 embedding 把查询和文档编码成低维稠密向量,再通过向量相似度寻找语义接近的内容。它能处理同义表达、改写、跨语言和隐含意图,是现代 RAG 的核心检索方式之一。

读寓言 →

Retrieval method

精修版

混合搜索

Hybrid Search

混合搜索(Hybrid Search)是把关键词/稀疏检索(如 BM25)和向量/语义检索结合起来的检索方法。关键词检索擅长精确匹配专有名词、编号、代码、法规条款;向量检索擅长找到字面不同但意思相近的内容。

读寓言 →

Retrieval method

精修版

语义搜索

Semantic Search

语义搜索(Semantic Search)基于意义而非精确关键词匹配来检索结果。它把查询和文档都嵌入到同一个向量空间,通过计算向量距离找到语义最接近的内容。与传统关键词搜索相比,语义搜索能处理同义词、近义表达、跨语言和模糊描述,召回更完整。

读寓言 →

Retrieval method

精修版

稀疏检索

Sparse Retrieval

稀疏检索(Sparse Retrieval)用高维稀疏特征表示查询和文档,典型形式包括 BM25、倒排索引,以及 SPLADE 这类学习型稀疏表示。它的优势是精确命中关键词、罕见词、编号、专有名词、错误码和条款。

读寓言 →

Retrieval preparation

精修版

分块

Chunking

分块(Chunking)是把长文档切成适合检索和放入模型上下文的小片段。RAG 系统通常不能直接把整份文档都塞给模型,而是先把文档切块、向量化、索引,再按问题召回相关块。分块质量会直接影响召回精度、上下文完整性、引用准确性和答案质量。

读寓言 →

Retrieval preparation

精修版

父子分块

Parent-Child Chunking

父子分块用较小子块做向量检索,再返回更大的父块作为上下文,兼顾命中精度和语义完整性。

读寓言 →

Retrieval preparation

精修版

语义分块

Semantic Chunking

语义分块(Semantic Chunking)按照语义边界切分文档,而不是机械按固定字符数、token 数或行数切分。它会尽量让每个 chunk 成为相对完整的意义单元,例如一个规则、一个步骤、一段定义、一组例外或一个案例。

读寓言 →

Retrieval preparation

精修版

滑动窗口分块

Sliding Window Chunking

滑动窗口分块(Sliding Window Chunking)用固定大小的窗口切分长文档,并让相邻 chunk 之间保留一定 overlap。它的目标是减少语义或事实刚好跨越分块边界时被切断的风险。

读寓言 →

Retrieval quality

精修版

重排序

Reranking

Reranking 是在第一阶段检索之后,对候选文档、chunk 或搜索结果重新评分排序的步骤。它通常结合查询和候选内容做更细粒度的相关性判断,常由 cross-encoder、LLM 或专门重排模型完成。

读寓言 →

Retrieval/application abstraction

精修版

查询引擎

Query Engine

Query Engine 是 LlamaIndex 等框架中的应用抽象:接收用户查询,调用检索器或索引取回相关数据,并通过 LLM 或其他策略合成最终答案。

读寓言 →

Risk Management

精修版

AI 风险管理

AI Risk Management

AI Risk Management 是对 AI 系统全生命周期风险进行识别、测量、优先级排序、缓解、监控和汇报的系统过程。

读寓言 →

Risk Management

精修版

AI 风险管理框架

AI Risk Management Framework, AI RMF

AI RMF 是治理 AI 风险的结构化框架,通常围绕治理、映射、度量和管理来识别并控制风险。

读寓言 →

Risk Management

精修版

幻觉风险

Hallucination Risk

Hallucination Risk 是生成式 AI 产生虚假、无依据或编造内容并被用户当成事实使用的风险。

读寓言 →

Risk Management

精修版

剩余风险

Residual Risk

Residual Risk 指在控制、缓解和监控措施实施之后仍然存在的风险。企业 Agent 治理中,权限限制、审批流、日志、评测和护栏会降低风险,但不会让风险归零。

读寓言 →

Risk Management

精修版

风险接受

Risk Acceptance

Risk Acceptance 是由授权责任人正式决定接受已知剩余风险的治理动作。它通常要求说明风险内容、业务理由、适用范围、期限、补偿控制、监控指标和升级条件。

读寓言 →

Risk Management

精修版

风险偏好

Risk Appetite

Risk Appetite 是组织为实现业务目标而愿意接受的风险类型和水平。它为 Agent 的权限、自动化范围、审批阈值、测试强度和监控要求提供上层边界。

读寓言 →

Risk Management

精修版

风险评估

Risk Assessment

风险评估识别、分析和分级 AI 用例或系统的潜在风险,判断伤害、合规义务、概率、严重性和控制措施。

读寓言 →

Risk Management

精修版

风险所有人

Risk Owner

Risk Owner 是对特定风险承担管理责任的人或职能,负责确保风险被识别、评估、缓解、监控,并保持在批准阈值内。它不同于 Control Owner:控制所有人负责某项控制运行,风险所有人负责该风险整体处置和问责。

读寓言 →

Risk Management

精修版

风险登记册

Risk Register

风险登记册持续记录已识别风险、责任人、可能性、影响、缓解措施、残余风险、接受状态和复查周期。

读寓言 →

SaaS / platform architecture

精修版

多租户

Multi-Tenancy

多租户是让多个客户或组织共享同一平台,同时隔离数据、权限、配置、用量、计费和运维控制。它的核心不是简单共用服务器,而是共享与隔离同时成立。

读寓言 →

SaaS / security architecture

精修版

租户隔离

Tenant Isolation

租户隔离确保一个客户的数据、配置、权限、上下文、工具、日志和资源不会被其他客户访问或影响。

读寓言 →

Safety and Alignment

精修版

安全护栏

Guardrails

安全护栏是一组围绕 AI/Agent 的安全与治理控制,用来限制输入、输出、工具调用、权限和高风险动作。

读寓言 →

Sales AI / Revenue operations

精修版

销售智能体

Sales Agent, AI Sales Agent, Sales Copilot

销售智能体是面向销售和收入运营的 AI 执行系统,覆盖客户研究、线索评分、个性化触达和会议准备。

读寓言 →

Security

精修版

AI 安全

AI Security

AI Security 是保护 AI/Agent 系统免受提示注入、数据泄露、模型滥用、工具越权、训练/检索数据污染、供应链风险、凭证泄露和对抗攻击的安全实践。

读寓言 →

Security

精修版

基于属性的访问控制

Attribute-Based Access Control, ABAC

基于属性的访问控制(ABAC)不是只看一个人的角色,而是根据主体、资源、动作和环境等属性共同决定是否放行。主体可以是用户或 Agent,资源可以是客户数据或工具,动作可以是读取、导出、删除,环境可以是时间、设备、网络、租户和审批状态。

读寓言 →

Security

精修版

后门攻击

Backdoor Attack

后门攻击在模型、数据、依赖或系统中植入隐藏行为,使其平时正常、遇到特定触发条件时异常。

读寓言 →

Security

精修版

上下文污染

Context Poisoning

上下文污染是恶意、过时、无关或低质量内容进入 Agent 上下文后,影响推理、决策或工具调用。

读寓言 →

Security

精修版

数据外泄

Data Exfiltration

数据外泄是数据未经授权离开受控边界的行为,可能通过工具调用、提示注入或集成系统发生。

读寓言 →

Security

精修版

数据投毒

Data Poisoning

数据投毒是攻击者操纵训练、微调、评测、检索或反馈数据,让 AI 系统学到错误、偏见、不安全或对攻击者有利的行为。它不一定发生在训练集,也可能藏在文档库、工单、日志、用户反馈和人工标注里。

读寓言 →

Security

精修版

越权代理

Excessive Agency

越权代理指给 AI Agent 的自主性、工具访问、决策权限或操作范围,超过了任务风险和治理能力。它不是普通的权限小错,而是系统允许 Agent 做了本不该由它独立完成的事。

读寓言 →

Security

精修版

模型投毒

Model Poisoning

模型投毒操纵权重、适配器、检查点或训练过程,使模型产生后门、偏差或错误行为。

读寓言 →

Security

精修版

OWASP LLM Top 10

OWASP Top 10 for LLM Applications

OWASP LLM Top 10 是面向大模型应用的风险分类,覆盖提示注入、数据泄露、工具滥用等常见漏洞。

读寓言 →

Security

精修版

权限边界

Permission Boundary

权限边界是对 Agent、用户、角色或工具能读、写、调用、修改、删除或委派什么设置的最大上限。它不是建议,也不是提示词里的软提醒,而是运行时或工具层必须执行的硬边界。

读寓言 →

Security

精修版

基于角色的访问控制

Role-Based Access Control, RBAC

RBAC 将权限分配给角色而不是单个身份,让用户或 Agent 通过角色继承访问范围,便于治理。

读寓言 →

Security

精修版

供应链风险

Supply Chain Risk

供应链风险来自依赖库、模型、数据集、工具、插件或外部服务,可能影响安全、合规和业务连续性。

读寓言 →

Security

精修版

工具输出污染

Tool Output Poisoning

工具输出污染是指外部工具、网页、文件、API 或插件返回恶意或误导内容,诱导 Agent 忽略策略、调用其他工具、泄露数据或改变目标。

读寓言 →

Security / agent runtime

精修版

沙箱

Sandbox

沙箱是隔离的执行环境,用来限制文件、进程、网络访问、系统调用、工具和凭证。它让代码或工具输出即使出错,也不容易影响外部系统。

读寓言 →

Security / compliance

精修版

审计日志

Audit Log

审计日志记录谁在何时对哪些资源执行了什么操作,通常包含身份、时间、资源、动作、输入输出和结果状态。

读寓言 →

Security / governance

精修版

权限模型

Permission Model

权限模型定义用户、Agent、工具、资源、动作、授权、审批和审计之间的关系与边界。

读寓言 →

Security / operations

精修版

最小权限原则

Principle of Least Privilege

最小权限原则只授予用户、Agent、服务或工具完成当前任务所需的最小权限和最短有效时间。

读寓言 →

Security / operations

精修版

机密管理

Secrets Management

机密管理负责安全存储、分发、轮换、撤销和审计 API key、密码、token、证书等敏感凭证。

读寓言 →

Security/Compliance

精修版

信息安全管理体系

Information Security Management System, ISMS

Information Security Management System, ISMS 是管理信息安全的体系,通常包括安全政策、资产识别、风险评估、风险处置、控制措施、角色职责、培训、审计、证据和持续改进。

读寓言 →

Security/Governance

精修版

职责分离

Segregation of Duties, SoD

职责分离把相互冲突的责任拆开,避免单个人或 Agent 独立完成高风险流程而缺少制衡。

读寓言 →

Security/Privacy

精修版

数据防泄漏

Data Loss Prevention, DLP

DLP。它是一套发现、监控和阻止敏感数据离开安全边界的机制,常覆盖终端、邮件、聊天、云盘、网页上传、API 和数据库导出。

读寓言 →

Serving

精修版

vLLM

vLLM

vLLM 是高吞吐 LLM 推理引擎,依靠分页注意力和连续批处理提升并发效率,是生产服务常用选择。

读寓言 →

Serving / UX

精修版

流式响应

Streaming Response

流式响应在生成 token 或内容块时即时返回结果,而不是等待完整输出完成后一次性返回。

读寓言 →

Serving metric

精修版

每秒 token 数

Tokens Per Second, TPS

每秒 token 数(TPS)衡量模型或服务系统每秒生成多少 token,通常主要看解码阶段。它是速度和吞吐的重要指标。

读寓言 →

Serving optimization

精修版

Chunked Prefill

Chunked Prefill

Chunked Prefill 将长提示词的预填充处理拆成小块,避免单个长请求长期占用 GPU 调度资源。

读寓言 →

Serving optimization

精修版

草稿模型

Draft Model

草稿模型是推测解码中较小或更快的模型,用来先提出一串候选 token。随后目标大模型负责验证这些候选,只接受符合自己分布的前缀。

读寓言 →

Serving optimization

KV Cache

Key-Value Cache

大模型生成文本时,每个旧 token 都会产生可供注意力机制使用的 Key 和 Value。把这些 Key/Value 缓存起来,后续生成新 token 时就不用重新计算全部历史。

读寓言 →

Software architecture / workflow

精修版

状态机

State Machine

State Machine 用一组明确状态和状态转移规则描述系统行为。它适合管理审批流、任务执行、Agent 生命周期、复杂 UI 和异常处理,因为系统在任何时刻都处于可识别状态,并且只能按允许的条件进入下一状态。

读寓言 →

Speech AI

精修版

语音识别

Automatic Speech Recognition, ASR

Automatic Speech Recognition, ASR 是把语音转换成文本的技术。企业 Agent 中,ASR 常用于语音客服、会议记录、外呼、质检和实时语音助手。

读寓言 →

Speech AI

精修版

语音合成

Text-to-Speech, TTS

Text-to-Speech, TTS 是把文本转换成可听语音的技术。企业 Agent 中,TTS 用于语音客服、实时助手、通知播报、无障碍访问和外呼场景。

读寓言 →

System architecture

精修版

多智能体编排

Multi-Agent Orchestration

多智能体编排把任务分配给多个专门 Agent,并协调角色、依赖、消息、输出、冲突和最终结果。

读寓言 →

System architecture

精修版

编排

Orchestration

编排负责协调模型、工具、工作流、Agent、人工审批、状态和错误处理,让完整任务能跨多个组件可靠推进。它关注全局依赖、路由、权限、重试、升级、并行和结果合并。

读寓言 →

System design

精修版

上下文工程

Context Engineering

Context Engineering 是为模型选择、组织、压缩、更新和隔离上下文的工程实践。它比传统 Prompt Engineering 更宽:不仅写指令,还处理记忆、检索、工具结果、任务状态、权限边界、来源可信度和 token 约束。

读寓言 →

Tokenization

精修版

字节对编码

Byte Pair Encoding, BPE

Byte Pair Encoding, BPE 是一种常见子词分词方法。它从基础符号开始,反复合并训练语料中最频繁相邻出现的符号对,得到一套固定 vocabulary。

读寓言 →

Tokenization

精修版

词元

Token

Token 是模型处理文本或数据的基本单位,可能是一个词、词片、字符片段、标点或符号。模型的上下文窗口、API 计费、延迟、吞吐和输出长度通常都按 token 计算,而不是按字符或单词。

读寓言 →

Tokenization

精修版

分词

Tokenization

Tokenization 是把原始文本转换成模型可处理 token 序列的过程。常见方法包括 BPE、SentencePiece 等子词分词方式。分词会影响 token 数量、上下文占用、成本、速度、多语言表现、代码处理和特殊字符行为。

读寓言 →

Tokenization

精修版

分词器

Tokenizer

Tokenizer 是把文本映射为 token IDs、并把生成的 token IDs 还原为文本的软件组件。它通常包含词表、分词算法和特殊 token 规则。

读寓言 →

Tokenization

精修版

词表

Vocabulary

Vocabulary 是 tokenizer 或模型可识别 token 的集合,通常包含子词片段、符号、特殊 token 及其 token ID。它决定文本如何被编码、哪些片段可以高效表示、同一文本会占用多少上下文空间。

读寓言 →

Tool

精修版

浏览器工具

Browser Tool

Browser Tool 是让 Agent 打开网页、读取页面、点击控件、填写表单或执行网页任务的工具。

读寓言 →

Tool interface

精修版

插件

Plugin

Plugin 是 AI 系统可发现并调用的外部能力包,通常描述某个 API、工具或服务的用途、参数、权限和返回格式。它让 Agent 能连接日历、CRM、数据库、工单、支付等系统执行动作。

读寓言 →

Training

精修版

激活检查点

Activation Checkpointing / Gradient Checkpointing

激活检查点在训练时只保存部分中间激活,反向传播时重新计算其余激活,以显存换计算。

读寓言 →

Training

精修版

bf16

Brain Floating Point 16

Brain Floating Point 16, bf16 是一种 16 位浮点格式,指数范围与 fp32 相同但尾数更少。它相比 fp32 节省显存和带宽,相比 fp16 更不容易出现数值溢出,通常不需要复杂梯度缩放。

读寓言 →

Training

精修版

灾难性遗忘

Catastrophic Forgetting

Catastrophic Forgetting 是神经网络在新数据或新任务上微调后,显著丢失先前学到能力的现象。企业微调 LLM 时,过窄数据、过大学习率或训练轮次过多都可能导致通用能力、安全对齐或原有业务能力退化。

读寓言 →

Training

精修版

思维链训练

Chain-of-Thought Training

Chain-of-Thought Training 是用逐步推理轨迹进行微调或训练,以提升模型在数学、规划、逻辑等多步任务上的能力。它比只用最终答案监督更能传递解题过程,但依赖高质量、真实、可验证的推理数据。

读寓言 →

Training

精修版

Chinchilla 方案

Chinchilla Optimal

Chinchilla Optimal 指 DeepMind Chinchilla 工作提出的计算最优缩放观点:在固定训练计算预算下,应同时增加模型参数量和训练 token 数,许多早期大模型相对参数过大、训练 token 不足。

读寓言 →

Training

精修版

持续预训练

Continual Pre-training / Continued Training

持续预训练是在已有基础模型上继续用新领域、新时间段或新语言风格的数据训练。它能让模型补充知识、适应行业表达,但也可能冲淡原本能力或引入新偏差。

读寓言 →

Training

精修版

课程学习

Curriculum Learning

Curriculum Learning 是按从易到难或按能力阶段组织训练样本的策略,类似人类学习课程。它可用于模型预训练、指令微调、Agent 轨迹训练和工具使用训练,帮助模型更稳定地掌握基础能力再处理复杂任务。

读寓言 →

Training

精修版

数据混合

Data Mixing

数据混合是在预训练或微调中按比例组合不同数据源的策略。代码、数学、中文、安全、客服、行业文档等数据占比不同,模型最终擅长的能力和形成的偏差也会不同。

读寓言 →

Training

精修版

去噪目标

Denoising Objective

Denoising Objective 是扩散模型训练中的核心目标:模型学习从加入噪声的数据中预测并去除噪声,逐步恢复干净样本。通过在不同噪声强度下训练,模型掌握数据分布的结构,生成时从随机噪声一步步反推到图像、音频或其他内容。

读寓言 →

Training

精修版

GRPO

Group Relative Policy Optimization

GRPO 是一种强化学习优化方法,常用于大模型对齐和推理能力训练。它对同一个提示生成一组候选回答,用组内相对表现来计算奖励优势,从而减少对独立价值函数模型的依赖。

读寓言 →

Training

精修版

掩码语言建模

Masked Language Modeling, MLM

Masked Language Modeling(MLM)是在输入中随机遮盖部分 token,让模型根据上下文预测被遮盖内容的训练目标。它常用于 BERT 类双向 Encoder 预训练,使模型学习理解型表示。

读寓言 →

Training

精修版

混合精度训练

Mixed Precision Training

Mixed Precision Training 是在模型训练中同时使用不同数值精度,例如 FP32、FP16、bf16,以减少显存占用、提高吞吐,同时保留关键计算的稳定性。

读寓言 →

Training

精修版

多任务学习

Multi-Task Learning

Multi-Task Learning 是让一个模型在多个相关任务上共同训练,共享表示或参数,同时学习各任务的输出。它可以提升数据效率和泛化能力,尤其当任务之间存在共同结构时。

读寓言 →

Training

精修版

下一个词预测

Next-Token Prediction

Next-Token Prediction 是让模型根据已有上下文预测下一个 token 的训练目标,是 GPT 类自回归语言模型的核心。它能从大规模数据中学习语言、代码和推理模式,但目标本身并不保证事实正确、权限合规或结果可执行。

读寓言 →

Training

精修版

预训练

Pre-training

Pre-training 是训练流程中的基础阶段,先让模型从大规模语料中学到通用表示和生成能力。它和后续 fine-tuning、alignment、evaluation 连成一条链;基础火候不足,后面的企业适配会很吃力。

读寓言 →

Training

精修版

强化微调

Reinforcement Fine-Tuning, RFT

强化微调(RFT)用可验证或可评分的结果信号继续优化模型行为。它常用于让模型在推理、代码、数学或企业流程中学会比示范数据更稳的策略。

读寓言 →

Training

精修版

可验证奖励强化学习

Reinforcement Learning with Verifiable Rewards, RLVR

RLVR 使用可程序化验证的结果作为奖励信号训练模型,例如数学答案、代码测试或规则校验是否通过。

读寓言 →

Training

精修版

缩放定律

Scaling Laws

Scaling Laws 描述模型性能与参数量、训练数据、计算量等规模因素之间的经验关系。它帮助团队预测扩大模型、数据或算力的收益和成本,避免单独堆参数、数据不足或算力浪费。企业决策中,缩放定律用于预算规划、模型选型和训练策略判断。

读寓言 →

Training / privacy

精修版

联邦学习

Federated Learning

Federated Learning 是一种多方协同训练方法,各参与方保留本地原始数据,只共享模型更新、梯度或经过保护的统计信息。它常用于金融、医疗、政企等数据不能集中汇聚的场景。

读寓言 →

Training and Inference

精修版

知识蒸馏

Knowledge Distillation

知识蒸馏让小模型学习大模型的输出分布或行为,以较低推理成本保留尽可能多的能力。

读寓言 →

Training data

精修版

数据增强

Data Augmentation

Data Augmentation 是通过变换、扰动、重写、合成或组合样本来扩充训练数据的方法,用于提高模型对真实变化的适应能力。它可以覆盖同义表达、噪声输入、格式差异、边界条件和少见场景。

读寓言 →

Transformers

精修版

注意力机制

Attention Mechanism

它让模型在处理一串信息时,不是平均看待所有位置,而是根据当前要生成或理解的内容,动态判断哪些位置更重要。

读寓言 →

Transformers

精修版

解码器

Decoder

Decoder 是 Transformer 中用于生成输出序列的部分。典型 Decoder 在生成时使用因果掩码,只能关注已生成 token,并逐步预测下一个 token。

读寓言 →

Transformers

精修版

编码器

Encoder

Encoder 是 Transformer 架构中负责把输入序列编码成上下文化表示的部分。它通常可以双向查看输入,因此适合理解类任务,如分类、检索向量、重排、实体抽取和文档表征。

读寓言 →

Transformers

精修版

多头注意力

Multi-Head Attention

Multi-Head Attention 把注意力分成多个 head,让模型在同一层中并行学习不同类型的关系,再把结果合并。不同 head 可以关注语法、指代、位置、任务约束、工具输出等不同模式。

读寓言 →

Transformers

精修版

位置编码

Positional Encoding

Positional Encoding 给 Transformer 注入顺序和相对位置信息,因为自注意力本身对 token 顺序不敏感。它可以是固定编码、可学习编码,也可以发展为 RoPE、ALiBi 等位置方案。

读寓言 →

Transformers

精修版

自注意力

Self-Attention

Self-Attention 让序列中的每个 token 在计算自己的表示时,查看同一序列里的其他 token,并按相关性分配权重。它是 Transformer 的核心能力,使模型能在上下文内部建立依赖关系。

读寓言 →

Transformers

精修版

Transformer

Transformer

它是一种以自注意力机制为核心的神经网络架构,能让序列中不同位置直接互相参考,并行处理文本、代码、图像片段等信息。

读寓言 →

Trust and attribution

精修版

引文

Citations

Citations 是为生成内容中的关键主张附上来源引用,让用户能检查证据、验证事实并追踪出处。企业 RAG 和 Agent 系统中,引用应指向真实支持该主张的文档片段、工具结果或记录版本。

读寓言 →

User-facing product / Productivity

精修版

AI助手

AI Assistant, Copilot

AI Assistant / Copilot 是嵌入用户工作流、辅助完成具体任务的 AI 系统。它通常负责检索、起草、提醒、分析、生成候选方案或执行低风险步骤,而责任和关键决策仍由人或业务流程掌控。

读寓言 →

Vector search library

精修版

FAISS

Facebook AI Similarity Search, FAISS

FAISS 是 Meta 开源的高效向量相似度搜索和聚类库,常用于本地向量检索和大规模近邻搜索。

读寓言 →

Workflow automation / Orchestration

AI工作流

AI Workflow, Agentic Workflow

它把模型判断、规则校验、工具调用、业务系统、人工审批和异常处理编排在一起,让 AI 不只是回答问题,而是稳定推进一件业务任务。

读寓言 →

交互机制

精修版

智能体协商

Agent Negotiation

智能体协商让多个 Agent 在目标、资源或约束冲突时,通过交换信息、让步、承诺和验证达成决策。

读寓言 →

协作机制

精修版

多智能体反思

Multi-Agent Reflection

Multi-Agent Reflection 是让多个 Agent 对方案、推理、工具结果或输出进行独立检查、互相批评、修正和汇总的机制。它可提高复杂任务质量,但需要防止群体附和、共享错误、过度自信和循环消耗。

读寓言 →

协作机制

精修版

任务分解

Task Decomposition

Task Decomposition 是把复杂目标拆成可执行、可排序、可验证的子任务。对 Agent 来说,它决定规划质量、工具调用顺序、并行边界和失败恢复能力。好的任务分解应包含依赖关系、输入输出、验收标准、风险节点和重新规划机制。

读寓言 →

协作模式

精修版

智能体辩论

Agent Debate

智能体辩论让多个 Agent 分别提出、反驳和检验证据,以提高复杂推理或高风险决策的可靠性。

读寓言 →

协作模式

精修版

智能体群

Agent Swarm

智能体群让大量相对简单的 Agent 通过局部规则、共享信号和轻量协调共同解决问题。

读寓言 →

协作模式

精修版

多智能体共识

Multi-Agent Consensus

Multi-Agent Consensus 是让多个 Agent、模型或角色在证据、观点或行动建议上形成可控一致的机制。它适用于高风险决策、复杂任务分解、交叉审查和多源信息判断。

读寓言 →

协作模式

精修版

角色扮演多智能体

Role-Playing Multi-Agent

Role-Playing Multi-Agent 是让多个 Agent 扮演不同专业角色、利益相关者或审查视角,共同完成分析、生成、评审或决策。它的价值在于显式引入角色边界和职责差异,避免单一模型视角遗漏法律、运营、客户、技术、安全等约束。

读寓言 →

协作现象

精修版

涌现行为

Emergent Behavior

Emergent Behavior 指系统中多个模型、Agent 或规则相互作用后,出现设计者没有逐条写出的整体行为。它可能带来效率,也可能形成拥堵、串谋、循环调用或风险放大。企业落地要把涌现行为纳入仿真、观测和治理。

读寓言 →

可观测性

精修版

Agent 决策追踪

Agent Decision Tracing

Agent Decision Tracing 指把企业 Agent 在执行任务时的关键判断、上下文来源、工具调用、规则命中、备选路径和放弃原因记录下来,让团队能复盘“为什么这样做”。它不是普通日志堆积,而是决策链路的可解释证据。

读寓言 →

可观测性

精修版

合规日志

Compliance Logging

合规日志按法规、合同、审计或内部政策要求,保留系统交互、控制执行和关键决策记录。

读寓言 →

可观测性

精修版

用户反馈闭环

Feedback Loop

用户反馈闭环把行为、错误、投诉、人工修正和业务结果持续回流到产品、提示词、知识库、模型或流程中。

读寓言 →

可观测性

精修版

幻觉检测

Hallucination Detection

幻觉检测判断模型输出是否与给定上下文、来源文档或已知事实不一致,常用主张抽取和证据匹配。

读寓言 →

可观测性

精修版

LLM 可观测性

LLM Observability

LLM Observability 是对 LLM/Agent 应用的输入、prompt、模型调用、检索、工具调用、输出、延迟、错误、成本和质量指标进行采集、追踪和分析。它帮助团队定位幻觉、检索失败、成本异常、供应商问题和版本回归。

读寓言 →

可观测性

精修版

延迟监控

Latency Monitoring

延迟监控持续衡量 LLM 或 Agent 请求耗时,常关注首 token 时间、解码速度、工具耗时和端到端延迟。

读寓言 →

可观测性

精修版

生产漂移检测

Production Drift Detection

Production Drift Detection 是在线上生产环境持续监测输入分布、用户行为、工具返回、业务场景、模型输出质量和结果指标是否偏离上线时状态。

读寓言 →

可观测性

精修版

提示版本管理

Prompt Versioning

提示版本管理记录提示模板版本,并关联部署时间、线上效果、评测结果、回滚记录和业务指标。

读寓言 →

可观测性

精修版

Token 用量监控

Token Usage Monitoring

Token 用量监控会追踪输入 token、输出 token、总 token、成本、用户、产品区域、模型和请求类型。它让团队知道钱花在哪里、哪些请求异常、哪些功能毛利受压。

读寓言 →

可观测性

精修版

调用链追踪

Tracing

Tracing 是记录一次请求在多个服务、Agent、模型、工具和 API 之间流转路径的可观测机制。它通常通过 trace id 串联多个 span,记录耗时、输入输出摘要、错误、重试和依赖关系。

读寓言 →

基准

精修版

BIG-bench (超越模仿游戏基准)

Beyond the Imitation Game Benchmark

BIG-bench, Beyond the Imitation Game Benchmark 是一个覆盖大量任务的语言模型能力基准,目标是超越“是否像人”这类单一判断,系统评估模型在推理、知识、语言、数学和创造等多种任务上的表现。

读寓言 →

基准

精修版

HumanEval (代码生成评估)

HumanEval

HumanEval 是用于评估代码生成模型的基准,通常给出函数签名、说明和测试,要求模型生成能通过测试的代码。

读寓言 →

基准

精修版

MMLU (大规模多任务语言理解)

Massive Multitask Language Understanding

MMLU 是覆盖多学科和难度层级的语言理解基准,用于评估模型在知识、推理和考试题上的能力。

读寓言 →

基准

精修版

SWE-bench

SWE-bench

SWE-bench 是评估模型解决真实软件工程问题的基准,通常要求模型基于真实开源仓库 issue 修改代码并通过测试。

读寓言 →

基准框架

精修版

HELM (整体语言模型评估)

Holistic Evaluation of Language Models

Holistic Evaluation of Language Models, HELM 是斯坦福提出的整体语言模型评估框架,强调从准确性、校准、鲁棒性、公平性、效率、偏见、毒性等多个维度系统评估模型。

读寓言 →

安全方法

精修版

模型安全评估

Model Safety Evaluation

模型安全评估用标准化或定制化测试集系统评估模型在有害内容、越狱、滥用、隐私、偏见、危险建议和策略绕过等场景下的表现。它关注拒答率、有害输出率、边界一致性、替代回答质量和多轮攻击下的稳定性。

读寓言 →

安全方法

精修版

红队测试

Red Teaming

红队测试主动模拟攻击者或高风险用户,测试 AI 系统的安全边界、策略漏洞和失效模式。

读寓言 →

安全机制

精修版

有害内容过滤

Harmful Content Filtering

有害内容过滤识别并拦截暴力、色情、仇恨、自残、违法指导和骚扰等内容,是安全治理基础层。

读寓言 →

对齐技术

基于人类反馈的强化学习

RLHF (Reinforcement Learning from Human Feedback)

它通常先让模型学会生成,再收集人类对多个回答的偏好比较,用这些偏好训练奖励模型,最后用强化学习方法调整模型,让输出更接近人类偏好的方向。

读寓言 →

对齐技术

精修版

安全微调

Safety Fine-Tuning

安全微调用安全数据继续训练模型,使其更稳定地拒绝危险请求、减少有害输出并遵守企业策略边界。

读寓言 →

工具

精修版

评估套件

Eval Suite / Eval Harness

评估套件把测试数据、任务场景、执行流程、评分规则和报告汇总起来,用于可重复地评估模型或 Agent。

读寓言 →

指标

精修版

任务成功率

Task Success Rate

Task Success Rate 衡量 Agent 或自动化系统在给定任务上真正完成用户目标的比例。它不能只看调用次数、响应次数或流程是否启动,而要定义清楚成功条件、验收证据和失败分类。

读寓言 →

攻击类型

精修版

对抗性示例

Adversarial Examples

Adversarial Examples 是经过刻意设计、看起来正常却会诱导模型或系统犯错的输入。它们在企业 Agent 中可能表现为恶意提示、相似但错误的文档、格式陷阱、视觉噪声、边缘业务请求等。

读寓言 →

攻击类型

精修版

拒绝服务攻击

Denial-of-Service (DoS) on LLM

LLM 拒绝服务攻击通过超长上下文、递归任务、大量并发或昂贵工具调用耗尽模型服务资源。

读寓言 →

攻击类型

精修版

间接提示注入

Indirect Prompt Injection

间接提示注入把恶意指令藏在网页、文档、邮件等外部内容中,等待 Agent 检索或读取后触发。

读寓言 →

攻击类型

精修版

越狱

Jailbreak

越狱是试图通过角色扮演、重述问题、混淆表达、多轮诱导、编码语言等方式,绕过模型或 Agent 的安全、策略和权限边界。

读寓言 →

攻击类型

精修版

多模态越狱

Multi-modal Jailbreak

多模态越狱通过图片、音频、视频、截图、二维码或排版等非文本输入绕过模型安全边界。

读寓言 →

攻击类型

精修版

提示注入

Prompt Injection

提示注入是用户可控文本试图覆盖、绕过或操纵 AI 系统指令的攻击方式。

读寓言 →

攻击类型

精修版

越狱

Prompt Leaking

提示词泄露是攻击者通过诱导、角色扮演、翻译、格式转换或多轮套话,让模型泄露系统提示、开发者指令、隐藏规则、工具说明、私有上下文或敏感数据的攻击手法。

读寓言 →

架构

精修版

智能体编排

Agent Orchestration

Agent Orchestration 是对一个或多个 Agent 的任务分配、状态流转、工具调用、审批、重试和终止条件进行编排。

读寓言 →

架构

精修版

黑板架构

Blackboard Architecture

Blackboard Architecture 是一种协作架构:多个专业模块或 Agent 通过共享的黑板状态读取问题、写入中间结果、更新假设并触发下一步处理。

读寓言 →

架构

精修版

去中心化多智能体

Decentralized Multi-Agent

Decentralized Multi-Agent 是没有单一中央控制器的多智能体系统,多个 Agent 通过局部观察、协议、消息传递和一致性规则协同工作。

读寓言 →

架构

精修版

层级多智能体

Hierarchical Multi-Agent

Hierarchical Multi-Agent 是把多个 Agent 按层级组织起来,上层负责目标、策略、分配和监督,下层负责执行、局部决策和异常反馈。

读寓言 →

架构

精修版

混合多智能体

Hybrid Multi-Agent

Hybrid Multi-Agent 是结合集中式编排、层级控制、去中心化协作和局部自治的多智能体设计。企业系统常需要混合模式:高风险动作走中心审批,低风险局部任务自治执行,异常再升级。关键是划分控制面、自治范围、同步点和治理规则。

读寓言 →

架构

精修版

多智能体系统

Multi-Agent System (MAS)

Multi-Agent System (MAS) 是由多个自治或半自治 Agent 组成的系统,这些 Agent 通过通信、协作、竞争、协商或编排共同完成单个 Agent 难以完成的目标。

读寓言 →

治理

精修版

AI 治理

AI Governance

AI 治理是组织围绕 AI 系统开发、采购、部署、运营和退役建立的政策、流程、角色、控制和问责框架。

读寓言 →

治理

精修版

访问控制

Access Control

访问控制限制哪些用户、Agent、工具、模型、知识库和资源可以执行哪些具体动作。

读寓言 →

治理

精修版

Agent 身份与认证

Agent Identity & Authentication

Agent 身份与认证为 Agent 建立可验证身份,并在调用系统、工具或数据前完成认证和授权校验。

读寓言 →

治理

审计日志

Audit Logs

审计日志是系统为关键行为留下的可追踪记录,通常包括谁、在什么时候、从哪里、以什么权限、请求了什么、调用了哪些工具、看到或改了什么、结果如何、是否经过审批。

读寓言 →

治理

自主性级别

Autonomy Levels

它描述一个 Agent 在任务中拥有多少决策权、行动权和例外处理权,以及人类需要在多频繁、多关键的位置介入。

读寓言 →

治理

精修版

数据隐私与 PII 遮蔽

Data Privacy & PII Masking

Data Privacy & PII Masking 指在 AI/Agent 处理数据时保护个人隐私,并通过遮蔽、替换、泛化、脱敏、最小化、访问控制和审计来降低 PII 暴露风险。

读寓言 →

治理

人类在回路内

Human-in-the-Loop (Deep HITL)

它指人在 AI 或 Agent 执行过程中多次参与,不只是最终审批,而是在理解、计划、执行、纠错和接管等环节提供判断。

读寓言 →

治理

人类在回路中

Human-in-the-Loop (HITL)

它是在自动化流程的特定节点加入人工审核、批准、纠错或接管,让系统在风险、低置信度或高影响场景下有人类判断。

读寓言 →

治理

人类在回路外

Human-on-the-Loop (HOTL)

AI 系统自主执行但人类保持监督态势,仅在系统发出告警或异常时才介入的更宽松的控制模式。

读寓言 →

治理

精修版

模型审批流程

Model Approval Workflow

Model Approval Workflow 是模型从试验进入生产或扩大使用前的审批流程,通常覆盖用途说明、风险分级、评测结果、安全合规、数据限制、负责人、上线范围和回滚计划。

读寓言 →

治理

精修版

模型风险评估

Model Risk Assessment

模型风险评估是在上线前对模型的能力边界、潜在有害使用场景、偏见放大风险和滥用可能性进行结构化评估。

读寓言 →

治理

精修版

速率限制

Rate Limiting

速率限制控制某个用户、租户、IP、API key、工作流或 Agent 在一个时间窗口内能发起多少请求、动作、token、工具调用或昂贵操作。

读寓言 →

治理

精修版

负责任 AI

Responsible AI

Responsible AI 指在设计、部署和运营 AI/Agent 时,把合法性、公平、隐私、安全、透明、人工监督和问责纳入系统,而不是只追求自动化效率。

读寓言 →

治理

精修版

后悔权与撤销机制

Right to Appeal & Rollback

Right to Appeal & Rollback 是在 AI 或 Agent 决策影响用户、客户或业务权益时,提供申诉、复核、撤销、恢复和版本回退的机制。

读寓言 →

治理

精修版

安全事故响应

Security Incident Response

安全事故响应是对提示注入、数据泄露、凭证暴露、越权访问等安全事件的结构化处置流程。

读寓言 →

治理

精修版

使用策略

Usage Policy

使用策略规定 AI、模型、数据、工具或 Agent 哪些用途可以接受,哪些用途禁止或需要审批。它要覆盖用户类型、数据类别、任务风险、禁止行为、例外处理和执行机制。

读寓言 →

评估

精修版

LLM 评估

LLM Evaluation (Eval)

LLM 评估通过自动化测试、人工评分、模型裁判、对抗探针和线上监控衡量模型或 Agent 表现。

读寓言 →

评估方法

精修版

对抗性评估

Adversarial Evaluation

对抗性评估是故意构造迷惑性、边界性、恶意或压力型输入,测试模型和 Agent 的鲁棒性、安全边界与失败模式。它覆盖 prompt injection、jailbreak、工具滥用、数据外泄、策略绕过、组合攻击和高压业务场景。

读寓言 →

评估方法

精修版

对齐评估

Alignment Evaluation

对齐评估衡量模型或 Agent 是否符合人类意图、企业政策、安全边界和业务目标。

读寓言 →

评估方法

精修版

能力评估

Capability Evaluation

Capability Evaluation 是对模型或 Agent 的具体能力进行分项、可复现的测试,例如推理、检索、工具使用、长上下文、协作、拒答、安全边界和业务任务完成。

读寓言 →

评估方法

精修版

人工评估

Human Evaluation

人工评估是由人类评审者根据 rubric、业务语境和质量标准判断模型或 Agent 输出。它适合主观、复杂、高风险或自动指标覆盖不足的任务,例如销售话术质量、客户语气、事实解释、风险判断和最终交付可用性。

读寓言 →

评估方法

精修版

逐轮评估

Per-Turn Evaluation

Per-Turn Evaluation 是对 Agent 或对话系统在每一轮行动、工具调用、观察和回复中进行评估,而不仅看最终结果。

读寓言 →

评估问题

精修版

能力污染与数据泄露

Contamination & Data Leakage

Contamination & Data Leakage 指训练、调优或提示过程中接触了评测集、答案、近似题或敏感业务数据,导致模型表现被高估或隐私泄露。它会破坏基准可信度,也可能把客户数据带入不该出现的输出。

读寓言 →

评估问题

精修版

提示敏感度

Prompt Sensitivity

Prompt Sensitivity 指模型对提示措辞、顺序、格式、示例选择或字段命名的变化表现出明显性能波动。它会让企业 Agent 在相同事实下给出不同判断,影响评测稳定性和生产可靠性。

读寓言 →

调度

精修版

Agent 路由

Agent Routing

Agent 路由根据请求内容、子任务类型、能力描述、权限边界、负载和历史表现分配任务。

读寓言 →

通信

精修版

Agent 通信协议

Agent Communication Protocol

Agent Communication Protocol 是定义 Agent 间消息格式、语义和交互规则的协议或语言。它不仅规定字段,还要表达通信意图,例如请求、通知、承诺、拒绝、查询、委托和确认。

读寓言 →