基础
Token
大语言模型处理文本的最小单位,既不是完整的词也不是单个字符,而是介于两者之间的子词单元
不同模型使用不同词表(BPE/WordPiece),导致同样的文本 Token 数不同
Embedding
将文本映射为高维稠密向量,使语义相近的文本在向量空间中距离更近
通过计算向量间的余弦相似度,可以实现语义搜索、聚类等应用
Context Window
上下文窗口是模型一次能处理的最大 Token 数
当对话历史超过窗口限制时,需要截断或压缩旧消息,为新回复预留空间
合理管理 Token 预算是 LLM 应用的关键
Temperature & Top-k & Top-p
采样策略决定 LLM 如何从候选 token 中选择下一个输出
Temperature 温度控制随机性
Top-k 限制候选数量
Top-p(核采样)动态截断
三者组合使用可以平衡创造性和质量
Function Calling
让 LLM 能够调用外部工具函数
流程为:定义工具 -> LLM 决定调用 -> 系统验证参数 -> 执行函数 -> 返回结果 -> LLM 利用结果生成回复
使 LLM 能访问实时数据和执行操作
结构化输出
确保 LLM 返回可解析的格式化数据(如 JSON)
通过 JSON Mode、Schema 约束和输出解析器,将不可靠的自然语言转换为程序可信赖的结构化对象
System Prompt
LLM 的"操作系统"-定义角色、能力边界、行为约束和输出格式
好的系统提示词让模型行为可预测,差的提示词导致"幻觉"和越界行为
Few-Shot
Few-Shot Learning 通过在提示词中提供示例来引导模型行为
提示模板将变量与固定文本组合, 实现可复用、可管理的提示词工程
Prompt Chaining
将复杂任务拆解为多个步骤, 前一步输出作为后一步输入
支持顺序链、并行分支、条件路由, 实现可组合、可调试的 LLM 工作流
LLM API
LLM API 调用是应用层与大模型交互的核心接口
涵盖请求构建、流式响应、错误重试、Token 计费和多模型管理
Context Engineering
管理 LLM 上下文窗口的工程实践
通过 优先级排序、Token 预算分配和信息压缩, 在有限窗口内最大化信息价值
完整对话助手
集成系统提示词、上下文管理、流式输出、工具调用、错误重试和成本追踪
展示一个生产级 LLM 应用的核心架构如何协同工作
RAG
文档解析
把 PDF/Word/Markdown/网页等不同格式统一提取成纯文本+结构信息, 为后续分块和向量化做准备
文本清洗与分块
去除噪声(多余空白/特殊字符/页眉页脚), 分块把长文档切成适合检索的证据片段
分块策略直接决定 RAG 的召回质量
向量化与存储
向量化把文本变成高维向量(Embedding),向量数据库存储这些向量并支持高效相似度搜索
这是 RAG 检索的基础设施
向量检索
向量检索(语义检索)是 RAG 的核心:把用户问题向量化,在向量库中找最相似的文档块
关键在于相似度计算和 Top-K 召回
关键词检索_BM25
BM25 是经典的关键词检索算法: 基于词频(TF)和逆文档频率(IDF), 擅长精确匹配关键词
与向量检索互补, 适合混合检索
混合检索
混合检索(Hybrid Search)融合语义检索(向量)和关键词检索(BM25)的结果
语义检索理解意思, 关键词检索精确匹配, 两者互补提升召回率
RRF(Reciprocal Rank Fusion)和加权融合两种合并策略
重排序
重排序(Reranker)对初步检索结果做精细化二次排序
向量检索是"双塔"模型(快但粗),Reranker 是"交叉"模型(慢但准);先粗筛再精排是 RAG 检索的标准模式
用关键词重叠度模拟 Reranker 评分,展示粗排->精排的两阶段检索流程
查询改写
前置优化: 用户问题可能太短/口语化/缺关键词, 通过 LLM 改写为更适合检索的表述, 提升召回率
查询扩展、查询分解和 HyDE 三种改写策略(用规则模拟 LLM 改写效果)
完整 RAG 流程
把 文档解析->清洗分块->向量化->混合检索->重排序->上下文构建->生成回答 串联成端到端 pipeline
实现一个可运行的 RAG 类, 展示各环节如何协同工作; 用模拟 Embedding 和规则生成替代真实 LLM 调用
RAG 评测
RAG 评测衡量检索系统和生成系统的质量
核心指标:召回率(Recall)、精确率(Precision)、MRR、NDCG; 生成质量评估:忠实度(Faithfulness)、相关性(Relevance)
实现检索评测指标计算和 LLM-as-Judge 生成评估(用规则模拟)
Agent
Agent 基础
Agent = LLM + 工具 + 推理循环 + 记忆 + 状态;
不是简单的"聊天机器人", 而是目标驱动的循环系统, 能自主决策下一步动作
基础概念:角色设计、指令层级、状态管理,用 Python 类模拟 Agent 的核心结构
ReAct 推理循环
ReAct = Reason + Act,Agent 的经典推理循环
Think(分析) -> Act(调工具) -> Observe(看结果) -> 循环直到完成
从零实现 ReAct 循环, 用规则模拟 LLM 的推理决策, 展示 Agent 如何一步步完成任务
任务分解与规划
Agent 把复杂目标拆成可执行的子任务列表, 逐步执行并动态更新计划
核心是 Planning + Decomposition + Todo List
实现任务分解、计划执行、动态更新和进度追踪, 用规则模拟 LLM 的规划能力
工具选择与调用
Agent 根据 LLM 输出的函数调用意图, 选择正确的工具、校验参数、执行并返回结果
核心是 Tool Schema + Function Calling
实现完整的工具调用流程: Schema 定义 -> 参数校验 -> 执行 -> 错误处理 -> 结果标准化
反思与自我纠正
Agent 评估自身输出质量,发现错误后自动修正
核心是 Reflection(反思) + Self-Correction(纠正) + Retry(重试)
实现输出评估、错误检测、纠正策略和重试循环, 用规则模拟 LLM 的反思能力
短期记忆
短期记忆管理对话上下文: 不是简单地把所有消息塞给模型
而是要控制 Token 预算、截断旧消息、摘要压缩, 保证关键信息不被淹没
实现 消息管理、Token 计数、窗口截断和摘要压缩策略
长期记忆
跨会话持久化用户偏好、历史事实和经验教训
用向量数据库存储, 按语义相似度检索, 让 Agent "记住" 过去的交互
用 Qdrant 实现长期记忆的写入、检索、更新和遗忘机制
人机协同(HITL)
人机协同(HITL): Agent 在关键决策点暂停, 等待人工审批/修改/拒绝
核心是 Interrupt(中断) + Approval(审批) + Resume(恢复) + Reject(拒绝)
实现工具调用前的 审批流、人工修改参数、拒绝执行和人工接管
停止条件与预算控制
Agent 不能无限循环, 需要多重停止条件--最大轮数、Token 预算、费用限制、超时、重复检测、收敛判断
实现完整的 Agent 预算控制体系,防止资源浪费和无限循环
完整 Agent
集成 ReAct 推理 + 工具调用 + 短期记忆 + 长期记忆 + 反思纠正 + HITL 审批 + 预算控制 的单 Agent 系统
展示各核心能力如何协同工作, 构成一个可运行的 Agent
LangGraph
LangGraph 基础
State(状态) + Node(节点) + Edge(边) + Conditional Edge(条件路由) 是构建图的三要素
StateGraph 是有向图
节点是函数
边定义执行顺序
条件边实现分支逻辑
状态管理
State 管理是 LangGraph 的核心: State Schema 定义数据结构, Reducer 控制状态合并方式
默认是"覆盖"模式, 用 Annotated + reducer 可以实现"累加"模式
Messages State 是最常用的 reducer 模式
条件路由与分支
条件路由是 LangGraph 实现分支逻辑的核心: add_conditional_edges 根据状态动态选择下一个节点
支持 多路分支、循环控制、动态路径和基于 LLM 决策的路由, 是 Agent 工作流的基础
ReAct Agent
用 LangGraph 构建 ReAct Agent: 这是最经典的 Agent 图结构
agent 节点(决策) <-> tool_node(执行) 循环, 直到模型不再调用工具
核心: agent 节点调用 LLM
条件边检查是否有 tool_calls,有 则路由到 tool_node, 无则结束
持久化与恢复
Checkpoint 保存图执行状态
Thread 隔离不同会话
Resume 从断点恢复
Time Travel 回溯历史状态
这是 LangGraph 生产级 Agent 的关键能力--会话中断后可恢复, 出错后可回滚, 多用户会话互不干扰
LangGraph HITL
用 interrupt_before/interrupt_after 在指定节点暂停, 等待人工审批后 Resume
核心能力: 工具调用前审批、修改参数、拒绝执行、人工输入反馈, 是生产级 Agent 的必备功能
子图与并行
子图(Subgraph)封装复杂逻辑为独立模块
Fan-out/Fan-in 实现并行执行与结果聚合
Map-Reduce 对列表数据批量处理再汇总
这些是构建复杂多步骤工作流的核心模式, 让图的层次更清晰、逻辑更模块化
流式输出
LangGraph 流式输出
stream() 方法支持多种 stream_mode, 实时获取执行过程中的中间结果
values 模式输出完整状态快照
updates 模式输出增量更新
debug 模式输出执行轨迹
前端用 SSE 推送给用户
多 Agent 编排
多 Agent 编排: Supervisor 模式是最经典的多 Agent 架构
Supervisor 负责任务分发和结果聚合,专家 Agent 各司其职
用 LangGraph 的条件路由实现 Supervisor -> 专家 Agent -> Supervisor 的循环, 是复杂任务的标准解决方案
生产级 Agent
生产级 LangGraph Agent: 集成 ReAct + 工具调用 + Checkpoint 持久化 + HITL 审批 + 流式输出 + 预算控制
如何构建一个 可部署、可恢复、可监控的生产级 Agent
工具集成与MCP
MCP
MCP(Model Context Protocol)是连接 AI 模型与外部工具/资源的标准协议
Host(宿主) -> Client(客户端) -> Server(服务端) 三层架构
MCP 的核心概念、架构组件和通信流程, 用纯 Python 模拟 MCP 的请求/响应模式
MCP Server
MCP Server 开发: 使用真实 MCP SDK 构建工具服务器, 提供 Tools/Resources/Prompts 三种能力
核心: Server 实例 + 工具注册 + JSON-RPC 通信, 通过 stdio 传输与 Client 交互
MCP Client
MCP Client 集成: Agent 通过 MCP Client 连接外部 MCP Server, 获取工具列表并调用
核心能力: 多 Server 连接、工具发现、工具调用、结果解析, 让 Agent 动态扩展能力边界
工具 Schema 设计
工具 Schema 设计: 好的工具定义 = 精确的参数类型 + 清晰的描述 + 合理的约束
Schema 质量直接决定 LLM 能否正确选择和调用工具
JSON Schema 设计最佳实践、参数校验、描述编写技巧和常见反模式
工具安全与权限
工具安全与权限: Agent 可以调用强大工具, 但也可能造成破坏
权限控制、沙箱隔离、最小权限原则是安全的三道防线
实现基于 角色的权限控制(RBAC)、路径白名单、命令黑名单和沙箱执行
工具错误处理
网络超时、参数错误、服务不可用是工具调用的常态
重试、超时、降级、幂等是保证可靠性的四大策略
实现指数退避重试、超时控制、降级策略和幂等设计
常用工具集成
常用工具集成: 搜索、数据库、文件操作、代码执行、浏览器自动化是 Agent 最常用的五类工具
每类工具的实现方式和安全注意事项,用模拟函数演示核心逻辑
MCP 传输层
MCP 传输层: stdio(标准输入输出)和 Streamable HTTP(可流式 HTTP)是 MCP 的两种传输方式
stdio 适合本地进程通信(如 IDE 插件)
HTTP 适合远程服务和多客户端场景
两种传输方式的原理、消息格式和适用场景
工具版本管理
工具版本管理: 工具会迭代更新(加参数、改行为、废弃), 版本管理确保 Client 和 Server 兼容
核心: 语义化版本(SemVer)、向后兼容策略、废弃通知、多版本共存和迁移路径
完整工具生态
完整工具生态: 集成 MCP Server + Client + Schema + 安全 + 错误处理 + 版本管理的完整工具系统
展示如何构建一个生产级工具生态
Harness Engineering
Harness
Harness 是包裹 Agent 的"测试与运行框架": 它不改变 Agent 逻辑, 而是在外部提供受控环境、监控、错误处理和可复现性
核心: Harness 是 Agent 的"保险带+仪表盘+飞行记录器" -- 让 Agent 可测试、可监控、可回溯、可恢复
环境 Harness
为 Agent 提供隔离的执行环境, 管理资源(内存/CPU/网络/文件系统), 防止 Agent 操作影响宿主系统
核心: 环境快照、资源限制、文件系统隔离、网络控制、临时工作区管理
工具 Mock 与注入
测试 Agent 时不能调用真实工具(有副作用/慢/不稳定)
Mock 工具返回预设结果, 注入特定行为模拟各种场景
核心: Mock 注册、场景控制、行为序列(第 N 次调用返回不同结果)、错误注入、调用验证
状态检查点 Harness
在 Agent 执行过程中定期保存状态快照, 支持回滚到任意历史检查点, 实现"时间旅行"调试
核心: 快照保存、状态回滚、检查点差异对比、从历史点重新执行--让 Agent 执行可回溯、可重放
错误注入与恢复 Harness
主动向 Agent 工具调用注入故障(超时/断连/失败), 并配置恢复策略(重试/降级/跳过/熔断)
核心: 故障注入器、恢复策略管理器、熔断器--让 Agent 在故障场景下仍能降级运行或优雅退出
执行控制 Harness
对 Agent 执行施加约束--超时、递归/迭代深度、取消、步进、步数预算,防止失控
核心: 协作式取消、超时熔断、深度限制、单步调试--让 Agent 执行"可约束、可暂停、可终止"
批量执行与回归测试
对 Agent 执行批量测试用例, 保存基线结果, 后续版本与基线对比以检测回归
核心: 测试用例管理、批量执行(支持并行)、基线持久化、回归检测、汇总报告(通过率/回归数)
影子模式与灰度发布
在 Agent 版本升级时, 用影子模式对比新旧输出、灰度逐步放量、A/B 测试统计决策, 实现安全发布
核心: 流量路由(百分比/哈希/特性开关)、影子对比(不影响用户)、灰度递进放量、A/B 测试统计与胜出判定
执行轨迹与可复现
记录 Agent 每一步的输入输出, 支持导出/导入, 并确定性回放验证输出一致, 检测偏离
核心: TraceEvent 事件记录、TraceRecorder 录制、JSON 序列化、DeterministicReplay 回放、TraceAnalyzer 分析、ReplayVerifier 验证
Skills 系统与 Deep Agents
Skill 是 Agent 的"可复用能力包"(名称+描述+指令+资源+版本)
Deep Agent 是长时间运行的 Agent, 支持工作区隔离、制品管理、后台执行、中断恢复、故障恢复和上下文卸载
核心: Skill 注册表 + 渐进式加载(只在需要时加载完整定义) + Deep Agent 的检查点机制让长任务可恢复、可回溯
安全 Harness
持久化与恢复
Checkpoint 保存图执行状态
Thread 隔离不同会话
Resume 从断点恢复
Time Travel 回溯历史状态
这是 LangGraph 生产级 Agent 的关键能力--会话中断后可恢复, 出错后可回滚, 多用户会话互不干扰
性能 Harness
为 Agent 执行提供实时性能监控--跟踪延迟(Token/工具/总耗时)、统计 Token 用量、计算 API 成本、监控内存,并在预算超限时告警
核心: 指标采集 + 预算阈值(80%警告/95%严重/100%硬停) + 瓶颈分析 = Agent 的"性能仪表盘"
完整测试 Harness
集成环境隔离、工具 Mock、状态检查点、故障注入与恢复、执行控制、轨迹录制与回放、安全过滤、性能监控、批量回归的 Agent 测试平台
核心: 一站式测试框架 = 环境沙箱 + 工具控制 + 状态快照 + 故障模拟 + 安全过滤 + 性能监控 + 回归对比, 让 Agent "可测、可控、可复现"
Evals评测
评测基础
评测(Evals)基础:设计评测方案、测试分类法、成功标准;评测是衡量 AI 系统质量的系统性方法
核心:评测设计(EvalDesign)、测试分类(TestTaxonomy)、成功标准(SuccessCriteria)、评测运行器(EvalRunner)、结果聚合
数据集构建
数据集构建:Golden 数据集、合成数据、边界用例、用户日志、对抗样本;高质量数据集是评测的基础
核心:数据集构建器(DatasetBuilder)、数据集管理(Dataset)、统计信息(DatasetStatistics)、导出导入(DatasetExporter)
正确性评测
衡量回答的准确性,包括精确匹配、包含检查、正则匹配、事实准确性、数值精度
核心:评测指标基类(CorrectnessMetric)、多种具体指标、多指标组合(MultiCriteria)、评分结果(ScoreResult)
忠实度评测
检测幻觉、验证回答是否基于上下文(Groundedness)、引用是否准确
核心:声明提取(Claim)、忠实度检查器(FaithfulnessChecker)、上下文重叠(ContextOverlap)、矛盾检测(ContradictionDetector)
轨迹评测
评估 Agent 执行轨迹的质量,包括规划质量、工具选择、参数准确性、效率、结果达成度
核心:轨迹步骤(TrajectoryStep)、轨迹(AgentTrajectory)、多维评估器(TrajectoryEvaluator)、轨迹评分(TrajectoryScore)
LLM-as-Judge
用大语言模型作为评审员,对生成质量进行打分;包括评分量规(Rubric)、单条/成对/批量评审、偏见缓解
核心:评审配置(JudgeConfig)、评分量规(Rubric)、LLM 评审器(LLMJudge)、模拟评审(MockLLMJudge)、偏见缓解(BiasMitigation)
RAG 评测
评估检索增强生成系统的检索质量和生成质量,包括 Recall@K、MRR、NDCG、忠实度、相关性等
核心:检索指标(RetrievalMetrics)、生成指标(GenerationMetrics)、RAG 评测用例(RAGEvalCase)、RAG 评测器(RAGEvaluator)
Agent 评测
评估智能体的任务完成能力,包括结果达成、工具使用、多轮交互、效率和安全
核心:Agent 评测用例(AgentEvalCase)、多维评估器(OutcomeEval/ToolUseEval/MultiTurnEval/EfficiencyEval/SafetyEval)、综合结果(AgentEvalResult)。
评测自动化
构建 CI/CD 可集成的评测流水线,包括数据加载、批量执行、报告生成、基线对比、质量门禁
核心:评测流水线(EvalPipeline)、质量门禁(EvalGate)、报告生成器(ReportGenerator)、基线对比(compare_with_baseline)。
线上质量监控
实时监控 AI 系统的线上质量指标,检测质量漂移和回归,触发告警并展示趋势
核心:线上监控器(OnlineMonitor)、质量指标(QualityMetric)、漂移检测器(DriftDetector)、告警管理(AlertManager)、质量看板(QualityDashboard)
评论区