目 录CONTENT

文章目录

从LLM到Harness

PySuper
2026-07-25 / 0 评论 / 0 点赞 / 4 阅读 / 0 字
温馨提示:
所有牛逼的人都有一段苦逼的岁月。 但是你只要像SB一样去坚持,终将牛逼!!! ✊✊✊

基础

主题

核心内容

分词

tiktoken 编码/解码、6 种文本类型 Token 对比(中英文/Emoji/代码)、3 模型计费计算器、Prompt 预算估算

向量

MockEmbedding 哈希向量化、余弦相似度计算、5 文档相似度矩阵、语义搜索引擎、最相似对查找

上下文窗口

ContextWindow Token 预算管理、10 轮对话模拟、自动截断旧消息、摘要压缩、预算分配可视化

采样参数

Softmax+温度缩放、Top-k/Top-p 核采样、组合采样管道、6 种参数对比可视化、T=0 确定性测试

函数调用

3 工具 JSON Schema 定义、MockLLM 决策、完整调用流程(3 轮连续调用)、参数校验与错误处理

结构化输出

Schema 验证(模拟 Pydantic)、JSON Mode、OutputParser 含重试、3 种任务不同 Schema

系统提示词

SystemPromptBuilder 链式构建、指令层级(System>Task>User)、4 种人格设计、好/差对比、Token 优化

Few-Shot

FewShotExample 数据类、PromptTemplate 变量渲染、ExampleSelector Jaccard 相似度选择、0/1/3/5-shot 对比

链式提示

ChainStep 步骤定义、PromptChain 顺序/并行/条件路由、错误重试+兜底、5 步研究链演示

API 调用

MockLLMClient 模拟 OpenAI API、流式响应、指数退避重试、TokenUsage 成本追踪、3 模型定价对比

上下文工程

Priority 优先级、TokenBudget 预算分配(20%+10%+40%+30%)、ContextManager 压缩/排序、RAG 5 来源演示

完整助手

ChatAssistant 集成系统提示词+流式输出+工具调用+成本追踪+多轮历史,3 轮对话完整演示

  • Token

    • 大语言模型处理文本的最小单位,既不是完整的词也不是单个字符,而是介于两者之间的子词单元

    • 不同模型使用不同词表(BPE/WordPiece),导致同样的文本 Token 数不同

  • Embedding

    • 将文本映射为高维稠密向量,使语义相近的文本在向量空间中距离更近

    • 通过计算向量间的余弦相似度,可以实现语义搜索、聚类等应用

  • Context Window

    • 上下文窗口是模型一次能处理的最大 Token 数

    • 当对话历史超过窗口限制时,需要截断或压缩旧消息,为新回复预留空间

    • 合理管理 Token 预算是 LLM 应用的关键

  • Temperature & Top-k & Top-p

    • 采样策略决定 LLM 如何从候选 token 中选择下一个输出

    • Temperature 温度控制随机性

    • Top-k 限制候选数量

    • Top-p(核采样)动态截断

    • 三者组合使用可以平衡创造性和质量

  • Function Calling

    • 让 LLM 能够调用外部工具函数

    • 流程为:定义工具 -> LLM 决定调用 -> 系统验证参数 -> 执行函数 -> 返回结果 -> LLM 利用结果生成回复

    • 使 LLM 能访问实时数据和执行操作

  • 结构化输出

    • 确保 LLM 返回可解析的格式化数据(如 JSON)

    • 通过 JSON Mode、Schema 约束和输出解析器,将不可靠的自然语言转换为程序可信赖的结构化对象

  • System Prompt

    • LLM 的"操作系统"-定义角色、能力边界、行为约束和输出格式

    • 好的系统提示词让模型行为可预测,差的提示词导致"幻觉"和越界行为

  • Few-Shot

    • Few-Shot Learning 通过在提示词中提供示例来引导模型行为

    • 提示模板将变量与固定文本组合, 实现可复用、可管理的提示词工程

  • Prompt Chaining

    • 将复杂任务拆解为多个步骤, 前一步输出作为后一步输入

    • 支持顺序链、并行分支、条件路由, 实现可组合、可调试的 LLM 工作流

  • LLM API

    • LLM API 调用是应用层与大模型交互的核心接口

    • 涵盖请求构建、流式响应、错误重试、Token 计费和多模型管理

  • Context Engineering

    • 管理 LLM 上下文窗口的工程实践

    • 通过 优先级排序、Token 预算分配和信息压缩, 在有限窗口内最大化信息价值

  • 完整对话助手

    • 集成系统提示词、上下文管理、流式输出、工具调用、错误重试和成本追踪

    • 展示一个生产级 LLM 应用的核心架构如何协同工作

RAG

主题

核心内容

文档解析

Markdown/HTML/纯文本三种格式的解析器实现,提取标题层级与正文内容

清洗与分块

文本清洗归一化 + 4 种分块策略(固定长度/按句/按 Token/按分隔符)+ Metadata 管理

向量化与存储

Qdrant 向量数据库操作:创建集合、写入向量、浏览数据、删除更新(内存模式)

语义检索

Top-K 召回、元数据过滤(按来源/分类)、相似度阈值过滤、余弦相似度手动计算

BM25 检索

从零实现 BM25:分词、倒排索引构建、IDF 计算、TF 评分、参数(k1/b)对比

混合检索

向量+BM25 双路检索,RRF(倒数排名融合)与加权融合两种合并策略对比

Reranker

两阶段检索:向量粗排 Top-10 -> Reranker 精排 Top-3,排名变化对比分析

查询改写

查询扩展(同义词)、查询分解(子问题拆分)、HyDE(假设性文档检索)三种策略

端到端 RAG

完整 RAGPipeline 类:文档处理 -> 索引 -> 混合检索 -> 重排 -> 生成回答

RAG 评测

检索指标(Recall/Precision/MRR/NDCG/Hit Rate)+ 生成质量评估(忠实度/相关性)

  • 文档解析

    • 把 PDF/Word/Markdown/网页等不同格式统一提取成纯文本+结构信息, 为后续分块和向量化做准备

  • 文本清洗与分块

    • 去除噪声(多余空白/特殊字符/页眉页脚), 分块把长文档切成适合检索的证据片段

    • 分块策略直接决定 RAG 的召回质量

  • 向量化与存储

    • 向量化把文本变成高维向量(Embedding),向量数据库存储这些向量并支持高效相似度搜索

    • 这是 RAG 检索的基础设施

  • 向量检索

    • 向量检索(语义检索)是 RAG 的核心:把用户问题向量化,在向量库中找最相似的文档块

    • 关键在于相似度计算和 Top-K 召回

  • 关键词检索_BM25

    • BM25 是经典的关键词检索算法: 基于词频(TF)和逆文档频率(IDF), 擅长精确匹配关键词

    • 与向量检索互补, 适合混合检索

  • 混合检索

    • 混合检索(Hybrid Search)融合语义检索(向量)和关键词检索(BM25)的结果

    • 语义检索理解意思, 关键词检索精确匹配, 两者互补提升召回率

    • RRF(Reciprocal Rank Fusion)和加权融合两种合并策略

  • 重排序

    • 重排序(Reranker)对初步检索结果做精细化二次排序

    • 向量检索是"双塔"模型(快但粗),Reranker 是"交叉"模型(慢但准);先粗筛再精排是 RAG 检索的标准模式

    • 用关键词重叠度模拟 Reranker 评分,展示粗排->精排的两阶段检索流程

  • 查询改写

    • 前置优化: 用户问题可能太短/口语化/缺关键词, 通过 LLM 改写为更适合检索的表述, 提升召回率

    • 查询扩展、查询分解和 HyDE 三种改写策略(用规则模拟 LLM 改写效果)

  • 完整 RAG 流程

    • 把 文档解析->清洗分块->向量化->混合检索->重排序->上下文构建->生成回答 串联成端到端 pipeline

    • 实现一个可运行的 RAG 类, 展示各环节如何协同工作; 用模拟 Embedding 和规则生成替代真实 LLM 调用

  • RAG 评测

    • RAG 评测衡量检索系统和生成系统的质量

    • 核心指标:召回率(Recall)、精确率(Precision)、MRR、NDCG; 生成质量评估:忠实度(Faithfulness)、相关性(Relevance)

    • 实现检索评测指标计算和 LLM-as-Judge 生成评估(用规则模拟)

Agent

主题

核心内容

Agent 概念

Agent 类结构设计、角色与能力定义、指令层级(System>Task>User)、AgentState 状态管理、工具注册

ReAct 模式

Think->Act->Observe 完整循环实现,Action/Step 数据结构,执行轨迹记录与回顾

Planning

任务分解器(规则模拟)、依赖管理、计划执行器、失败重试、进度追踪、树形可视化

Tool Calling

ToolSchema 定义、OpenAI Function Calling 格式生成、参数校验(类型/Enum/必需)、重试机制

Reflection

输出质量评估、问题检测(缺类型标注/过短/缺来源)、纠正建议、多次尝试循环、历史记录

短期记忆

Token 计数(tiktoken)、Token 预算控制、消息截断策略、摘要压缩、重要性标记(critical/high/normal)

长期记忆

Qdrant 向量存储、4 种记忆类型(用户偏好/事实/情景/过程)、用户隔离、遗忘机制(低重要性淘汰)

HITL

风险评估引擎、审批请求/响应流程、批准/修改参数/拒绝/暂缓、审批历史记录

Budget

5 重停止条件:最大轮数/Token 预算/费用预算/超时/重复检测,预算状态报告

完整 Agent

集成 ReAct+工具+短期记忆+长期记忆+反思+HITL+预算控制的端到端 Agent 系统

  • Agent 基础

    • Agent = LLM + 工具 + 推理循环 + 记忆 + 状态;

    • 不是简单的"聊天机器人", 而是目标驱动的循环系统, 能自主决策下一步动作

    • 基础概念:角色设计、指令层级、状态管理,用 Python 类模拟 Agent 的核心结构

  • ReAct 推理循环

    • ReAct = Reason + Act,Agent 的经典推理循环

    • Think(分析) -> Act(调工具) -> Observe(看结果) -> 循环直到完成

    • 从零实现 ReAct 循环, 用规则模拟 LLM 的推理决策, 展示 Agent 如何一步步完成任务

  • 任务分解与规划

    • Agent 把复杂目标拆成可执行的子任务列表, 逐步执行并动态更新计划

    • 核心是 Planning + Decomposition + Todo List

    • 实现任务分解、计划执行、动态更新和进度追踪, 用规则模拟 LLM 的规划能力

  • 工具选择与调用

    • Agent 根据 LLM 输出的函数调用意图, 选择正确的工具、校验参数、执行并返回结果

    • 核心是 Tool Schema + Function Calling

    • 实现完整的工具调用流程: Schema 定义 -> 参数校验 -> 执行 -> 错误处理 -> 结果标准化

  • 反思与自我纠正

    • Agent 评估自身输出质量,发现错误后自动修正

    • 核心是 Reflection(反思) + Self-Correction(纠正) + Retry(重试)

    • 实现输出评估、错误检测、纠正策略和重试循环, 用规则模拟 LLM 的反思能力

  • 短期记忆

    • 短期记忆管理对话上下文: 不是简单地把所有消息塞给模型

    • 而是要控制 Token 预算、截断旧消息、摘要压缩, 保证关键信息不被淹没

    • 实现 消息管理、Token 计数、窗口截断和摘要压缩策略

  • 长期记忆

    • 跨会话持久化用户偏好、历史事实和经验教训

    • 用向量数据库存储, 按语义相似度检索, 让 Agent "记住" 过去的交互

    • 用 Qdrant 实现长期记忆的写入、检索、更新和遗忘机制

  • 人机协同(HITL)

    • 人机协同(HITL): Agent 在关键决策点暂停, 等待人工审批/修改/拒绝

    • 核心是 Interrupt(中断) + Approval(审批) + Resume(恢复) + Reject(拒绝)

    • 实现工具调用前的 审批流、人工修改参数、拒绝执行和人工接管

  • 停止条件与预算控制

    • Agent 不能无限循环, 需要多重停止条件--最大轮数、Token 预算、费用限制、超时、重复检测、收敛判断

    • 实现完整的 Agent 预算控制体系,防止资源浪费和无限循环

  • 完整 Agent

    • 集成 ReAct 推理 + 工具调用 + 短期记忆 + 长期记忆 + 反思纠正 + HITL 审批 + 预算控制 的单 Agent 系统

    • 展示各核心能力如何协同工作, 构成一个可运行的 Agent

LangGraph

主题

核心内容

图基础

StateGraph/Node/Edge 三要素,线性图(receive->process->output),条件路由图(classify->search/calculate/chat)

State 管理

覆盖模式 vs 累加模式(Reducer),add_messages reducer,自定义 Reducer(字典合并/集合合并),部分状态更新

路由分支

多路分支(意图分类+置信度路由),循环重试(should_retry + give_up),动态路径(基于计划逐步执行+循环)

ReAct Agent

用 LangGraph 构建 ReAct:agent<->tool_node 循环,tool_calls 检测,ToolMessage 结果返回,最大调用次数安全阀

持久化

MemorySaver Checkpoint,Thread 会话隔离(多用户),Resume 恢复对话,State History 历史快照,update_state 手动更新

HITL

interrupt_before=["tool_node"] 工具前中断,人工审批流程(批准/拒绝),状态更新后恢复执行,风险等级路由

子图与并行

Subgraph 封装复杂逻辑,Fan-out/Fan-in 并行执行+聚合,Map-Reduce 批量处理循环,子图嵌入主图

流式

stream_mode: values(完整快照)/ updates(增量更新)/ 双模式,SSE 推送模拟,invoke vs stream 对比

多 Agent

Supervisor 模式:Supervisor 分发 -> Researcher/Coder/Reviewer -> 回到 Supervisor 循环 -> synthesize 综合输出

生产级 Agent

集成 ReAct+Checkpoint+HITL+预算控制+迭代限制+检查点历史,带 interrupt_beforerecursion_limit

  • LangGraph 基础

    • State(状态) + Node(节点) + Edge(边) + Conditional Edge(条件路由) 是构建图的三要素

    • StateGraph 是有向图

    • 节点是函数

    • 边定义执行顺序

    • 条件边实现分支逻辑

  • 状态管理

    • State 管理是 LangGraph 的核心: State Schema 定义数据结构, Reducer 控制状态合并方式

    • 默认是"覆盖"模式, 用 Annotated + reducer 可以实现"累加"模式

    • Messages State 是最常用的 reducer 模式

  • 条件路由与分支

    • 条件路由是 LangGraph 实现分支逻辑的核心: add_conditional_edges 根据状态动态选择下一个节点

    • 支持 多路分支、循环控制、动态路径和基于 LLM 决策的路由, 是 Agent 工作流的基础

  • ReAct Agent

    • 用 LangGraph 构建 ReAct Agent: 这是最经典的 Agent 图结构

    • agent 节点(决策) <-> tool_node(执行) 循环, 直到模型不再调用工具

    • 核心: agent 节点调用 LLM

    • 条件边检查是否有 tool_calls,有 则路由到 tool_node, 无则结束

  • 持久化与恢复

    • Checkpoint 保存图执行状态

    • Thread 隔离不同会话

    • Resume 从断点恢复

    • Time Travel 回溯历史状态

    • 这是 LangGraph 生产级 Agent 的关键能力--会话中断后可恢复, 出错后可回滚, 多用户会话互不干扰

  • LangGraph HITL

    • 用 interrupt_before/interrupt_after 在指定节点暂停, 等待人工审批后 Resume

    • 核心能力: 工具调用前审批、修改参数、拒绝执行、人工输入反馈, 是生产级 Agent 的必备功能

  • 子图与并行

    • 子图(Subgraph)封装复杂逻辑为独立模块

    • Fan-out/Fan-in 实现并行执行与结果聚合

    • Map-Reduce 对列表数据批量处理再汇总

    • 这些是构建复杂多步骤工作流的核心模式, 让图的层次更清晰、逻辑更模块化

  • 流式输出

    • LangGraph 流式输出

    • stream() 方法支持多种 stream_mode, 实时获取执行过程中的中间结果

    • values 模式输出完整状态快照

    • updates 模式输出增量更新

    • debug 模式输出执行轨迹

    • 前端用 SSE 推送给用户

  • 多 Agent 编排

    • 多 Agent 编排: Supervisor 模式是最经典的多 Agent 架构

    • Supervisor 负责任务分发和结果聚合,专家 Agent 各司其职

    • 用 LangGraph 的条件路由实现 Supervisor -> 专家 Agent -> Supervisor 的循环, 是复杂任务的标准解决方案

  • 生产级 Agent

    • 生产级 LangGraph Agent: 集成 ReAct + 工具调用 + Checkpoint 持久化 + HITL 审批 + 流式输出 + 预算控制

    • 如何构建一个 可部署、可恢复、可监控的生产级 Agent

工具集成与MCP

主题

核心内容

MCP 概念

MCP 三层架构(Host/Client/Server)、三种资源类型(Tools/Resources/Prompts)、JSON-RPC 2.0 通信、模拟 Server+Client 完整流程

Server 开发

使用真实 MCP SDK(mcp.server.Server)构建工具服务器,@server.list_tools + @server.call_tool 装饰器,stdio 传输启动

Client 集成

多 Server 连接、跨 Server 工具发现、自动路由调用、OpenAI Function Calling 格式生成、调用历史记录

Schema 设计

JSON Schema 最佳实践、参数校验(类型/枚举/范围/长度/正则)、好 Schema vs 坏 Schema 对比、OpenAI 格式转换

安全权限

风险等级(SAFE~CRITICAL)、路径白名单、命令黑名单、SQL 注入防护、路径遍历防护、调用次数限制、人工审批

错误处理

指数退避重试、超时控制、降级策略(Fallback)、幂等设计(Idempotency Key)、错误分类(可重试/不可重试)

常用工具

6 类工具实现:搜索、数据库、文件操作、代码执行(沙箱)、浏览器自动化、通信(邮件/HTTP)

传输层

stdio 传输模拟(进程间通信)、Streamable HTTP 传输模拟(远程通信)、JSON-RPC 消息序列化、两种方式对比与选择建议

版本管理

语义化版本(SemVer)、多版本共存、兼容性检查、废弃管理、迁移路径建议

完整系统

集成注册+发现+校验+安全+错误处理+幂等+审计日志+统计的 ToolEcosystem 类,7 个工具完整测试

  • MCP

    • MCP(Model Context Protocol)是连接 AI 模型与外部工具/资源的标准协议

    • Host(宿主) -> Client(客户端) -> Server(服务端) 三层架构

    • MCP 的核心概念、架构组件和通信流程, 用纯 Python 模拟 MCP 的请求/响应模式

  • MCP Server

    • MCP Server 开发: 使用真实 MCP SDK 构建工具服务器, 提供 Tools/Resources/Prompts 三种能力

    • 核心: Server 实例 + 工具注册 + JSON-RPC 通信, 通过 stdio 传输与 Client 交互

  • MCP Client

    • MCP Client 集成: Agent 通过 MCP Client 连接外部 MCP Server, 获取工具列表并调用

    • 核心能力: 多 Server 连接、工具发现、工具调用、结果解析, 让 Agent 动态扩展能力边界

  • 工具 Schema 设计

    • 工具 Schema 设计: 好的工具定义 = 精确的参数类型 + 清晰的描述 + 合理的约束

    • Schema 质量直接决定 LLM 能否正确选择和调用工具

    • JSON Schema 设计最佳实践、参数校验、描述编写技巧和常见反模式

  • 工具安全与权限

    • 工具安全与权限: Agent 可以调用强大工具, 但也可能造成破坏

    • 权限控制、沙箱隔离、最小权限原则是安全的三道防线

    • 实现基于 角色的权限控制(RBAC)、路径白名单、命令黑名单和沙箱执行

  • 工具错误处理

    • 网络超时、参数错误、服务不可用是工具调用的常态

    • 重试、超时、降级、幂等是保证可靠性的四大策略

    • 实现指数退避重试、超时控制、降级策略和幂等设计

  • 常用工具集成

    • 常用工具集成: 搜索、数据库、文件操作、代码执行、浏览器自动化是 Agent 最常用的五类工具

    • 每类工具的实现方式和安全注意事项,用模拟函数演示核心逻辑

  • MCP 传输层

    • MCP 传输层: stdio(标准输入输出)和 Streamable HTTP(可流式 HTTP)是 MCP 的两种传输方式

    • stdio 适合本地进程通信(如 IDE 插件)

    • HTTP 适合远程服务和多客户端场景

    • 两种传输方式的原理、消息格式和适用场景

  • 工具版本管理

    • 工具版本管理: 工具会迭代更新(加参数、改行为、废弃), 版本管理确保 Client 和 Server 兼容

    • 核心: 语义化版本(SemVer)、向后兼容策略、废弃通知、多版本共存和迁移路径

  • 完整工具生态

    • 完整工具生态: 集成 MCP Server + Client + Schema + 安全 + 错误处理 + 版本管理的完整工具系统

    • 展示如何构建一个生产级工具生态

Harness Engineering

主题

核心内容

概念架构

Harness 定义与 9 种类型、BaseHarness 抽象基类(before/after 钩子)、HarnessOrchestrator 编排器(栈式执行)、环境/执行/轨迹三种 Harness 实现

环境 Harness

临时工作区创建、路径白名单/黑名单、路径遍历防护、文件大小限制、环境变量管理、资源追踪、自动清理

Mock 注入

ToolMock(5 种行为:固定值/序列/错误/延迟/透传)、MockRegistry、场景预设(正常/错误/不稳定/慢速)、调用验证

状态检查点

StateSnapshot 快照、StateCheckpointer(save/restore/time_travel/diff)、自动检查点、回滚到任意历史状态、检查点差异对比

错误注入

FaultType(6 种故障)、FaultInjector(按调用次数注入)、RecoveryManager(5 种恢复策略)、CircuitBreaker 熔断器

执行控制

全局/单步超时、迭代限制、步数预算、递归深度限制、协作式取消、单步步进调试

批量回归

TestCase/TestSuite、BatchRunner(并行执行)、RegressionSuite、BaselineManager(基线保存/对比/差异报告)

灰度发布

TrafficRouter(百分比/哈希/开关路由)、ShadowMode(影子并行)、CanaryRelease(渐进灰度+自动回退)、ABTest(A/B 测试+统计判定)

轨迹复现

TraceEvent/TraceRecorder(记录/导出 JSON/导入)、DeterministicReplay(确定性回放)、ReplayVerifier(偏离检测)、TraceAnalyzer(模式/异常分析)

Skills 与 Deep Agent

Skill 定义、SkillLoader(渐进式披露)、SkillRegistry、DeepAgent(工作区/制品/后台执行/检查点恢复/上下文卸载)

安全 Harness

SafetyFilter(输入校验/输出过滤/PII 脱敏)、SafetyRule(BLOCK/WARN/REDACT)、ContentCategory(5 类分类)、AuditLog 审计日志

性能 Harness

PerformanceMonitor(延迟/Token/成本/内存追踪)、PerformanceBudget(预算+告警)、BottleneckDetector 瓶颈分析、PerformanceReport

完整框架

AgentTestHarness 集成全部 9 种能力、TestConfig 统一配置、TestReport 综合报告、run_test() 单测 + run_suite() 批量 + check_regression() 回归

能力

核心类

应用场景

环境隔离

EnvironmentHarness

沙箱执行、路径控制、资源限制

工具 Mock

ToolMock, MockRegistry

测试时替代真实工具、注入特定行为

状态检查点

StateCheckpointer

保存/回滚/时间旅行、调试 Agent 状态

错误注入

FaultInjector, CircuitBreaker

测试 Agent 错误处理、熔断保护

执行控制

ExecutionController

超时/取消/步进、防止无限循环

批量回归

BatchRunner, RegressionSuite

批量测试、回归检测、基线对比

灰度发布

ShadowMode, CanaryRelease

新版本安全上线、A/B 测试

轨迹复现

TraceRecorder, DeterministicReplay

执行复现、调试、确定性验证

Skills

SkillRegistry, DeepAgent

技能管理、长时间任务、断点恢复

安全过滤

SafetyFilter

PII 脱敏、有害内容过滤、注入防护

性能监控

PerformanceMonitor

延迟/Token/成本监控、瓶颈分析

  • Harness

    • Harness 是包裹 Agent 的"测试与运行框架": 它不改变 Agent 逻辑, 而是在外部提供受控环境、监控、错误处理和可复现性

    • 核心: Harness 是 Agent 的"保险带+仪表盘+飞行记录器" -- 让 Agent 可测试、可监控、可回溯、可恢复

  • 环境 Harness

    • 为 Agent 提供隔离的执行环境, 管理资源(内存/CPU/网络/文件系统), 防止 Agent 操作影响宿主系统

    • 核心: 环境快照、资源限制、文件系统隔离、网络控制、临时工作区管理

  • 工具 Mock 与注入

    • 测试 Agent 时不能调用真实工具(有副作用/慢/不稳定)

    • Mock 工具返回预设结果, 注入特定行为模拟各种场景

    • 核心: Mock 注册、场景控制、行为序列(第 N 次调用返回不同结果)、错误注入、调用验证

  • 状态检查点 Harness

    • 在 Agent 执行过程中定期保存状态快照, 支持回滚到任意历史检查点, 实现"时间旅行"调试

    • 核心: 快照保存、状态回滚、检查点差异对比、从历史点重新执行--让 Agent 执行可回溯、可重放

  • 错误注入与恢复 Harness

    • 主动向 Agent 工具调用注入故障(超时/断连/失败), 并配置恢复策略(重试/降级/跳过/熔断)

    • 核心: 故障注入器、恢复策略管理器、熔断器--让 Agent 在故障场景下仍能降级运行或优雅退出

  • 执行控制 Harness

    • 对 Agent 执行施加约束--超时、递归/迭代深度、取消、步进、步数预算,防止失控

    • 核心: 协作式取消、超时熔断、深度限制、单步调试--让 Agent 执行"可约束、可暂停、可终止"

  • 批量执行与回归测试

    • 对 Agent 执行批量测试用例, 保存基线结果, 后续版本与基线对比以检测回归

    • 核心: 测试用例管理、批量执行(支持并行)、基线持久化、回归检测、汇总报告(通过率/回归数)

  • 影子模式与灰度发布

    • 在 Agent 版本升级时, 用影子模式对比新旧输出、灰度逐步放量、A/B 测试统计决策, 实现安全发布

    • 核心: 流量路由(百分比/哈希/特性开关)、影子对比(不影响用户)、灰度递进放量、A/B 测试统计与胜出判定

  • 执行轨迹与可复现

    • 记录 Agent 每一步的输入输出, 支持导出/导入, 并确定性回放验证输出一致, 检测偏离

    • 核心: TraceEvent 事件记录、TraceRecorder 录制、JSON 序列化、DeterministicReplay 回放、TraceAnalyzer 分析、ReplayVerifier 验证

  • Skills 系统与 Deep Agents

    • Skill 是 Agent 的"可复用能力包"(名称+描述+指令+资源+版本)

    • Deep Agent 是长时间运行的 Agent, 支持工作区隔离、制品管理、后台执行、中断恢复、故障恢复和上下文卸载

    • 核心: Skill 注册表 + 渐进式加载(只在需要时加载完整定义) + Deep Agent 的检查点机制让长任务可恢复、可回溯

  • 安全 Harness

    • 持久化与恢复

      • Checkpoint 保存图执行状态

      • Thread 隔离不同会话

      • Resume 从断点恢复

      • Time Travel 回溯历史状态

    • 这是 LangGraph 生产级 Agent 的关键能力--会话中断后可恢复, 出错后可回滚, 多用户会话互不干扰

  • 性能 Harness

    • 为 Agent 执行提供实时性能监控--跟踪延迟(Token/工具/总耗时)、统计 Token 用量、计算 API 成本、监控内存,并在预算超限时告警

    • 核心: 指标采集 + 预算阈值(80%警告/95%严重/100%硬停) + 瓶颈分析 = Agent 的"性能仪表盘"

  • 完整测试 Harness

    • 集成环境隔离、工具 Mock、状态检查点、故障注入与恢复、执行控制、轨迹录制与回放、安全过滤、性能监控、批量回归的 Agent 测试平台

    • 核心: 一站式测试框架 = 环境沙箱 + 工具控制 + 状态快照 + 故障模拟 + 安全过滤 + 性能监控 + 回归对比, 让 Agent "可测、可控、可复现"

Evals评测

主题

核心内容

评测基础

TestTaxonomy(5 种测试分类)、SuccessCriteria(4 种成功标准)、EvalRunner(run_single/run_batch/aggregate)、3 种评测方案演示

数据集构建

DatasetBuilder(黄金示例/合成数据/日志提取/边界用例/对抗样本)、Dataset 管理与统计、JSONL 导出导入

正确性评测

6 种指标(ExactMatch/Contains/Regex/Factual/Numeric/MultiCriteria)、ScoreResult 评分分解、6 个场景演示

忠实度评测

FaithfulnessChecker(groundedness/hallucination/citation)、Claim 提取与验证、ContextOverlap、ContradictionDetector

轨迹评测

TrajectoryStep/AgentTrajectory、6 维评估(PlanQuality/ToolSelection/ToolCallAccuracy/StepEfficiency/Outcome/Relevance)、好坏轨迹对比

LLM-as-Judge

Rubric 评分标准、LLMJudge(single/pairwise/batch)、位置偏差消除、多评审投票

RAG 评测

检索指标(Recall@K/Precision@K/MRR/NDCG@K/HitRate)+ 生成指标(忠实度/正确性/相关性/利用率)、端到端评估

Agent 评测

5 维评估(Outcome/ToolUse/MultiTurn/Efficiency/Safety)、3 类任务(简单/多工具/多轮)、薄弱维度诊断

评测自动化

EvalPipeline(load/run/report/compare/export)、EvalGate CI/CD 门禁、Markdown 报告生成、基线回归对比

线上监控

OnlineMonitor(交互记录/反馈收集/质量评分)、DriftDetector Z-score 漂移检测、AlertManager 告警、QualityDashboard 趋势图

能力

核心类

应用场景

评测设计

EvalRunner, EvalDesign

定义评测方案、成功标准、测试分类

数据集

DatasetBuilder, Dataset

构建 Golden/Synthetic/Edge/Adversarial 数据集

正确性

ExactMatch, NumericAccuracy

验证答案的精确匹配、数值精度、事实准确性

忠实度

FaithfulnessChecker

检测幻觉、验证引用、矛盾检测

轨迹评测

TrajectoryEvaluator

评估 Agent 推理路径、工具选择、效率

LLM 评审

LLMJudge, Rubric

自动化质量评估、成对比较、偏差消除

RAG 评测

RAGEvaluator

检索质量 + 生成质量全链路评估

Agent 评测

AgentEvaluator

多维度 Agent 能力评估

评测自动化

EvalPipeline, EvalGate

CI/CD 集成、门禁检查、回归检测

线上监控

OnlineMonitor, DriftDetector

实时质量追踪、漂移检测、告警

  • 评测基础

    • 评测(Evals)基础:设计评测方案、测试分类法、成功标准;评测是衡量 AI 系统质量的系统性方法

    • 核心:评测设计(EvalDesign)、测试分类(TestTaxonomy)、成功标准(SuccessCriteria)、评测运行器(EvalRunner)、结果聚合

  • 数据集构建

    • 数据集构建:Golden 数据集、合成数据、边界用例、用户日志、对抗样本;高质量数据集是评测的基础

    • 核心:数据集构建器(DatasetBuilder)、数据集管理(Dataset)、统计信息(DatasetStatistics)、导出导入(DatasetExporter)

  • 正确性评测

    • 衡量回答的准确性,包括精确匹配、包含检查、正则匹配、事实准确性、数值精度

    • 核心:评测指标基类(CorrectnessMetric)、多种具体指标、多指标组合(MultiCriteria)、评分结果(ScoreResult)

  • 忠实度评测

    • 检测幻觉、验证回答是否基于上下文(Groundedness)、引用是否准确

    • 核心:声明提取(Claim)、忠实度检查器(FaithfulnessChecker)、上下文重叠(ContextOverlap)、矛盾检测(ContradictionDetector)

  • 轨迹评测

    • 评估 Agent 执行轨迹的质量,包括规划质量、工具选择、参数准确性、效率、结果达成度

    • 核心:轨迹步骤(TrajectoryStep)、轨迹(AgentTrajectory)、多维评估器(TrajectoryEvaluator)、轨迹评分(TrajectoryScore)

  • LLM-as-Judge

    • 用大语言模型作为评审员,对生成质量进行打分;包括评分量规(Rubric)、单条/成对/批量评审、偏见缓解

    • 核心:评审配置(JudgeConfig)、评分量规(Rubric)、LLM 评审器(LLMJudge)、模拟评审(MockLLMJudge)、偏见缓解(BiasMitigation)

  • RAG 评测

    • 评估检索增强生成系统的检索质量和生成质量,包括 Recall@K、MRR、NDCG、忠实度、相关性等

    • 核心:检索指标(RetrievalMetrics)、生成指标(GenerationMetrics)、RAG 评测用例(RAGEvalCase)、RAG 评测器(RAGEvaluator)

  • Agent 评测

    • 评估智能体的任务完成能力,包括结果达成、工具使用、多轮交互、效率和安全

    • 核心:Agent 评测用例(AgentEvalCase)、多维评估器(OutcomeEval/ToolUseEval/MultiTurnEval/EfficiencyEval/SafetyEval)、综合结果(AgentEvalResult)。

  • 评测自动化

    • 构建 CI/CD 可集成的评测流水线,包括数据加载、批量执行、报告生成、基线对比、质量门禁

    • 核心:评测流水线(EvalPipeline)、质量门禁(EvalGate)、报告生成器(ReportGenerator)、基线对比(compare_with_baseline)。

  • 线上质量监控

    • 实时监控 AI 系统的线上质量指标,检测质量漂移和回归,触发告警并展示趋势

    • 核心:线上监控器(OnlineMonitor)、质量指标(QualityMetric)、漂移检测器(DriftDetector)、告警管理(AlertManager)、质量看板(QualityDashboard)

0
  1. 支付宝打赏

    qrcode alipay
  2. 微信打赏

    qrcode weixin

评论区