bojieli/ai-agent-book
《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码
Backblaze Generative Media Hackathon
Build the next generation of AI media apps with Genblaze, stored on Backblaze B2. $10,000 in prizes.
Loading star history...
Use Cases & Benefits
- Provides an open-source companion repository for the book on AI Agent design principles and engineering practices, including full text, compiled PDFs, and chapter-aligned example code.
- Offers a comprehensive, modular learning path covering foundational theory, context engineering, user memory, tool integration, evaluation, training, self-evolution, multimodal interaction, and multi-agent collaboration.
- Use for developers and researchers seeking a structured, hands-on guide to build and experiment with advanced AI agents combining LLMs, context management, and tool usage.
- Use for educators and learners wanting multilingual, open-access educational materials and runnable demos to understand AI agent architectures and engineering trade-offs.
- Use for practitioners aiming to implement production-grade coding agents, asynchronous event-driven agents, multi-agent systems, and self-evolving AI with practical code examples.
About ai-agent-book
深入理解 AI Agent:设计原理与工程实践
English | 中文 | Tiếng Việt | தமிழ்
本仓库是《深入理解 AI Agent:设计原理与工程实践》一书的开源主仓库,包含全书正文与配套示例代码。全书正文、配图与配套实验代码全部开源,欢迎把实验亲手跑一遍、提 issue 和 PR。
📖 电子书
全书提供多种语言版本:
- 中文 PDF(原版):
book/深入理解-AI-Agent-李博杰-v1.2.pdf - 英文 PDF(社区贡献翻译,by @nsdevaraj):
book-en/AI-Agents-in-Depth-Bojie-Li-v1.2.pdf - 泰米尔语 PDF(社区贡献翻译,by @nsdevaraj):
book-ta/AI-Agents-in-Depth-Bojie-Li-v1.2-ta.pdf - 越南语 PDF(社区贡献翻译,by @toanalien):
book-vi/AI-Agents-in-Depth-Bojie-Li-v1.2-vi.pdf
中文正文与编译好的 PDF 位于 book/ 目录;英文、泰米尔语与越南语翻译为社区贡献,分别位于 book-en/、book-ta/ 与 book-vi/ 目录,内容可能滞后于中文原版:
-
正文源码:
book/introduction.md(引言)、book/chapter1.md~book/chapter10.md(第一至第十章)、book/afterword.md(后记) -
自行编译:安装 pandoc、xelatex、ElegantBook 文档类与相关字体后,运行
cd book && bash build_pdf.sh图表由
book/gen_*_figs.py生成、存于book/images/,排版细节见book/preamble.tex与book/*.lua。
📑 内容速览(第 1–10 章)
全书围绕核心公式 Agent = LLM + 上下文 + 工具 展开,十章内容如下:
- 第 1 章 · Agent 基础知识:从“模型即 Agent”的新范式出发,建立 Agent = LLM + 上下文 + 工具 的核心公式,并引入 Harness 工程——模型之外的一切工程能力,才是真正的竞争力所在。
- 第 2 章 · 上下文工程:上下文决定 Agent 的能力上限。深入大模型 API 的上下文结构、KV Cache 友好设计、提示工程、动态提示词与 Agent Skills、状态栏元信息,以及上下文压缩策略。
- 第 3 章 · 用户记忆和知识库:让 Agent 跨会话记住用户、并接入外部知识。涵盖用户记忆系统、RAG 基础管道,以及超越扁平文本的知识组织与检索(结构化索引、知识图谱等)。
- 第 4 章 · 工具:工具是 Agent 的双手。讲工具分类与通用设计原则、MCP 协议与工具选择的挑战、感知/执行/协作三类工具,以及事件驱动的异步 Agent。
- 第 5 章 · Coding Agent 与代码生成:代码是“能创造新工具的工具”,是通用 Agent 的元能力。以生产级 Coding Agent 为例,展示这一最强通用工具的完整实现。
- 第 6 章 · Agent 的评估:把 Agent 的表现变成可比较的信号。从评估环境、数据集设计、指标体系,到统计显著性、可观测性、评估驱动选型,直至生产级内部评估与仿真环境。
- 第 7 章 · 模型后训练:预训练、SFT、RL 三阶段全景。何时选 SFT、何时选 RL,RLHF、算法比较、数据与环境,以及让模型学会工具调用、提升样本效率的前沿探索。
- 第 8 章 · Agent 的自我进化:不改权重也能成长。三种学习范式,从经验中学习、主动工具发现,到“从工具使用者到工具创造者”,让 Agent 从“聪明”走向“熟练”。
- 第 9 章 · 多模态与实时交互:把感知与行动从文本扩展到语音、GUI 与物理世界。语音三范式(级联/端到端全模态/全双工)、流式语音感知与合成、Computer Use 与机器人操作。
- 第 10 章 · 多 Agent 协作:群体的智能可以高于个体。多 Agent 分类框架、何时真正优于单 Agent、共享与不共享上下文的协作、失败模式,以及涌现的“Agent 社会”。
💻 配套代码
所有项目按章节组织,与全书十章一一对应,涵盖从基础概念到高级技术的完整学习路径,目录为 chapterN/项目名/。第 5、8、9、10 章的绝大多数实验现均提供可独立运行的配套 demo,并已对接真实 LLM API 验证跑通。
项目类型说明
配套项目分为三类,请对照下方图标了解每个项目“开箱即用”的程度:
- ✅ 可独立运行:本仓库自带完整代码,配置好 API Key(见文末)即可运行。
- 📖 复现指南:项目本身是一份详细的复现文档,依赖需自行
git clone的外部仓库(训练框架、评测基准等),见下方《外部仓库获取》。 - 🚧 设计文档:目前仅包含架构与实现方案的设计文档,可运行代码仍在完善中。
下列项目不是✅ 可独立运行,克隆本仓库时请留意:
| 项目 | 类型 | 说明 |
|---|---|---|
chapter7/AdaptThink · AWorld-train · MiniMind-pretrain · retool · SpatialReasoning | 📖 复现指南 | 训练类实验,依赖外部框架,按 README 复现 |
第 6 章全部基准 · 第 7 章多数训练框架 · 第 9 章 browser-use/claude-quickstarts · 第 10 章 use-computer-while-calling | 📖 复现指南 | 依赖外部仓库,见《外部仓库获取》 |
外部仓库获取(简要)
第 6、7、9、10 章的部分实验依赖评测基准、训练框架、机器人平台等外部仓库(出于体积与版权未内置本仓库)。为免一上来信息过载,完整的克隆命令、上游地址与本书验证过的提交,见文末《附录 · 外部仓库获取》。建议先从前面各章可独立运行的项目上手,需要复现训练 / 评测 / 机器人类实验时,再按文末指引快速获取。
🚀 第 1 章 · Agent 基础知识
learning-from-experience - 强化学习 vs LLM 对比
chapter1/learning-from-experience/
对比传统强化学习(Q-learning)与基于 LLM 的上下文学习,复现 Shunyu Yao 的 “The Second Half” 博文中的关键洞察。通过寻宝游戏展示 LLM 如何以 250-400 倍的样本效率超越传统 RL。
核心概念:强化学习、上下文学习、样本效率、先验知识
web-search-agent - Kimi K2 模型即 Agent
chapter1/web-search-agent/
实现具备基础深度搜索能力的 Agent,能够进行多轮搜索和信息整合。
核心概念:网络搜索、模型原生 Agent
search-codegen - GPT-5 原生工具集成
chapter1/search-codegen/
构建能够基础深度搜索能力和代码沙盒能力的 Agent,综合利用网络搜索、代码执行等工具实现复杂分析。
核心概念:网络搜索、代码生成、模型原生 Agent
context - 上下文消融研究
chapter1/context/
通过系统性的消融实验展示 Agent 上下文各个组件的重要性。支持多种 LLM 提供商(SiliconFlow Qwen、字节 Doubao、月之暗面 Kimi),配置不同的上下文模式观察 Agent 行为变化。
核心概念:上下文管理、工具调用、ReAct 循环、消融研究
🎯 第 2 章 · 上下文工程
local_llm_serving - 本地 LLM 部署与工具调用
chapter2/local_llm_serving/
跨平台的本地 LLM 部署方案,自动选择最佳后端(vLLM 或 Ollama)。展示即使 0.6B 的小模型也能通过良好的系统设计实现出色的工具调用能力。支持流式响应,实时显示思考过程。
核心概念:模型部署、Chat Template、流式处理、工具调用
attention_visualization - 注意力机制可视化
chapter2/attention_visualization/
可视化 LLM 的完整输入输出 token 序列和注意力权重分布,深入理解模型如何处理上下文、进行推理和调用工具。
核心概念:注意力机制、token 分析、推理过程可视化
kv-cache - KV Cache 友好的上下文设计
chapter2/kv-cache/
探索不同上下文管理模式对 KV Cache 的影响,演示常见的错误模式如何破坏缓存效率。通过实验展示正确的上下文设计如何显著降低延迟和成本。
核心概念:KV Cache、上下文优化、性能调优
context-compression - 上下文压缩策略
chapter2/context-compression/
实现并对比多种上下文压缩策略,包括摘要、关键信息提取、语义压缩等。在保持 Agent 能力的同时减少 token 使用量。
核心概念:上下文压缩、token 优化、信息密度
prompt-engineering - 提示工程消融研究
chapter2/prompt-engineering/
扩展 Tau-Bench 框架,通过系统性的消融实验量化不同提示工程因素对 Agent 性能的影响。展示语气风格、指令组织、工具描述等因素如何影响任务完成率。
核心概念:提示工程、消融研究、性能基准测试
system-hint - 系统提示优化
chapter2/system-hint/
研究系统提示(System Hint)对 Agent 行为的影响,探索如何通过优化系统提示提升性能。
核心概念:系统提示、行为引导、提示优化
log-sanitization - 日志脱敏处理
chapter2/log-sanitization/
实现智能的日志脱敏系统,在保留调试信息的同时保护敏感数据。
核心概念:隐私保护、日志处理、数据安全
prompt-injection - 提示注入攻防实验
chapter2/prompt-injection/
构造 3 种攻击场景(直接注入、间接注入、记忆注入)× 4 种防御配置(无防御、提示词加固、来源标记、组合防御)的对照实验,用确定性规则统计攻击成功率,直观展示逐层叠加防御后注入成功率如何显著下降。
核心概念:提示注入、间接注入、数据与指令分离、运行时校验
agent-skills-ppt - Agent Skills 渐进式披露生成 PPT
chapter2/agent-skills-ppt/
复现 Agent Skills 的「渐进式披露」思想:Agent 启动时只看到一份薄 Skill 目录,识别出任务需要 pptx Skill 后才逐层加载其完整流程、细则文档与捆绑脚本,最终用 python-pptx 生成真实的 .pptx 文件。
核心概念:Agent Skills、渐进式披露、按需加载、工具编排
📚 第 3 章 · 用户记忆和知识库
user-memory - 用户记忆系统
chapter3/user-memory/
构建长期用户记忆系统,让 Agent 能够记住用户偏好和历史交互,提供个性化服务。
核心概念:长期记忆、个性化、用户建模
mem0 / memobase - 开源记忆框架对照
chapter3/mem0/ 和 chapter3/memobase/
用 mem0、Memobase 两个开源记忆框架各自实现一版用户记忆,作为实验 3-2「记忆策略对比」的对照实现,便于横向比较不同记忆方案的抽取形态与回答质量。
核心概念:记忆框架、mem0、Memobase 、方案对比
user-memory-evaluation - 用户记忆评估框架
chapter3/user-memory-evaluation/
系统化评估用户记忆系统的准确性、相关性和有效性,包含多种测试场景和评估指标。
核心概念:评估框架、测试用例、性能度量
dense-embedding - 稠密嵌入向量检索服务
chapter3/dense-embedding/
构建向量相似性搜索服务,对比研究 ANNOY(基于树)和 HNSW(基于图)两种近似最近邻索引算法。展示不同索引策略在性能、内存占用和更新能力上的权衡。
核心概念:稠密嵌入、向量检索、ANN 算法、语义搜索
sparse-embedding - 稀疏检索引擎
chapter3/sparse-embedding/
从零实现基于 BM25 算法的稀疏向量搜索引擎,通过丰富的日志和可视化接口展示搜索引擎的内部工作机制,理解词频权重计算和倒排索引原理。
核心概念:稀疏嵌入、BM25、TF-IDF、精确匹配
retrieval-pipeline - 混合检索流水线
chapter3/retrieval-pipeline/
构建完整的检索流水线,结合稠密检索、稀疏检索和神经重排序。通过精心设计的测试用例,系统性展示混合检索在不同场景下的优势互补效果。
核心概念:混合检索、神经重排序、跨编码器、检索融合
multimodal-agent - 多模态信息提取
chapter3/multimodal-agent/
对比三种多模态处理策略:原生多模态处理、提取为文本、工具化分析。通过统一框架下的消融研究,揭示不同技术路径在保真度、成 本和灵活性上的权衡。
核心概念:多模态、视觉理解、OCR、端到端处理
structured-index - 结构化索引
chapter3/structured-index/
实现并对比 RAPTOR(递归抽象树)和 GraphRAG(知识图谱)两种先进索引策略。通过索引技术手册演示如何构建反映知识内在层次和关联的结构化索引。
核心概念:RAPTOR、GraphRAG、层次摘要、知识图谱
agentic-rag - 智能体 RAG
chapter3/agentic-rag/
对比传统 Non-Agentic RAG 与 Agentic RAG 的性能差异。展示 Agent 如何通过 ReAct 模式主导迭代式信息检索,在处理复杂司法问答时显著提升答案质量。
核心概念:Agentic RAG、ReAct 循环、迭代检索、主动探索
agentic-rag-for-user-memory - 利用 Agentic RAG 构建用户记忆
chapter3/agentic-rag-for-user-memory/
将 Agentic RAG 框架应用于管理用户对话历史,通过多轮迭代搜索能力处理跨会话的记忆检索,实现基础回忆和多会话检索能力。
核心概念:用户记忆、对话历史索引、跨会话检索
contextual-retrieval - 上下文感知检索
chapter3/contextual-retrieval/
实现 Anthropic 提出的上下文感知检索技术,通过为文本块生成包含核心上下文的前缀摘要,解决传统分块方法的上下文丢失问题,将检索失败率降低 49-67%。
核心概念:上下文增强、前缀生成、语义锚定、检索优化
contextual-retrieval-for-user-memory - 上下文感知的用户记忆系 统
chapter3/contextual-retrieval-for-user-memory/
将上下文感知检索技术应用于用户记忆构建,结合 Advanced JSON Cards 与上下文感知 RAG,形成双层记忆结构,实现更高层次的主动服务能力。
核心概念:双层记忆、结构化事实、上下文检索、主动服务
structured-knowledge-extraction - 结构化知识提取
chapter3/structured-knowledge-extraction/
以司法判例为例跑通「自下而上因子发现 → 聚类出案件原型 → 对话式建议 Agent」三段流水线:不预设僵化字段,由 LLM 从大量案例中自主发现因子并归纳为模块化 schema(核心因子 + 罪名扩展因子);再将案件聚类为若干原型、算出各原型的因子重要性;Agent 对新案情匹配最相似原型、按重要性追问缺失信息并给出有依据的建议(附法律免责声明)。
核心概念:自下而上知识发现、模块化因子、聚类原型、可解释决策
🛠️ 第 4 章 · 工具
perception-tools - 感知工具 MCP 服务器
chapter4/perception-tools/
构建全面的感知工具集,提供网络搜索、多模态理解、文件系统操作和公共数据源访问能力。大部分功能基于免费开放 API(DuckDuckGo、Open-Meteo、Yahoo Finance、OpenStreetMap 等),无需 API 密钥即可使用。
核心概念:MCP 协议、多模态解析、公共数据源、文档理解、地理信息服务
execution-tools - 执行工具 MCP 服务器
chapter4/execution-tools/
实现具备安全机制的执行工具集,包括文件操作、代码解释器、虚拟终端和外部系统集成。通过 LLM 二次审批机制防止危险操作,自动摘要复杂输出,并对代码进行语法验证。
核心概念:MCP 协议、执行安全、LLM 审批、结果摘要、自动验证
collaboration-tools - 协作工具 MCP 服务器
chapter4/collaboration-tools/
提供全面的协作能力,包括浏览器自动化(browser-use 框架)、人机协同(Human-in-the-Loop)、多渠道通知(Email、Telegram、Slack、Discord)和定时器管理。支持敏感操作的管理员审批和定时任务调度。
核心概念:MCP 协议、浏览器自动化、HITL 模式、多渠道通知、定时任务
agent-with-event-trigger - 事件触发型 Agent 与 MCP 集成
chapter4/agent-with-event-trigger/
基于 FastAPI 构建的现代化事件驱动 Agent,默认集成前三个 MCP 服务器的所有工具。采用原生异步架构实现清晰的 MCP 工具加载,通过 HTTP API 接收多源事件(Web、即时消息、GitHub、定时器等)。提供自动 API 文档(Swagger UI)和后台监控能力。
核心概念:FastAPI、原生异步、MCP 集成、事件驱动、自动 API 文档、工具编排
active-tool-selection - 主动工具选择
chapter4/active-tool-selection/
实现智能工具选择机制,让 Agent 能够根据任务需求主动选择最合适的工具组合,而非被动接受预定义的工具集。
核心概念:工具选择、动态工具加载、任务分析
async-agent - 带并行执行和打断能力的异步 Agent
chapter4/async-agent/
基于 asyncio 单线程实现事件驱动异步 Agent 框架(Flux)的核心:inbox 事件队列按紧急度分派(打断/立即/排队),支持异步工具并行执行、运行中打断当前 turn、并对模拟的长任务做取消与状态查询。决策由真实 LLM(function calling)完成。
核心概念:异步编程、事件队列、打断机制、并行工具取消、非阻塞 I/O
此外,
chapter4/docker-compose.yml与chapter4/DOCKER_DEPLOYMENT.md提供了将上述 MCP 工具服务器容器化部署的参考方案。
💻 第 5 章 · Coding Agent 与代码生成
coding-agent - 生产级 Coding Agent
chapter5/coding-agent/
基于 Claude 构建的生产级 AI 编码助手,采用纯 Python 实现所有工具,无需命令行依赖。包含 17 个完整实现的工具,涵盖文件操作、搜索、Shell 操作和项目管理。特别实现了纯 Python 的 Grep 工具,完全兼容 ripgrep 的功能。
核心特性:
- 纯 Python 实现,无命令行依赖,特别适合 Mac 用户
- 完整的工具套件:文件读写编辑、纯 Python 正则搜索、目录列表、Shell 会话管理
- 系统提示技术:时间戳、工具调用计数、TODO 列表管理、详细错误信息
- 持久化 Shell 环境、自动 Lint 检测、流式响应支持
- 支持多个 LLM 提供商(Anthropic、OpenAI、OpenRouter)
核心概念:代码生成、文件编辑、纯 Python 工具、系统提示、Lint 检测、多提供商支持
code-for-math - 用代码提升数学解题能力
chapter5/code-for-math/
让同一模型在同一组竞赛数学题上对比「纯思维链」与「代码辅助」两种模式:后者把题目形式化为 Python(sympy/numpy/scipy),通过 function calling 在子进程沙箱执行,用精确计算替代易错的心算,准确率显著更高。
核心概念:代码解释器、符号计算、思维链对比、工具增强推理
code-for-logic - 用代码提升逻辑思考能力
chapter5/code-for-logic/
把「骑士与无赖」逻辑谜题转化为约束满足问题(CSP):Agent 用 python-constraint 定义变量与双条件约束并调用求解器,对比纯自然语言推理与代码辅助两种模式在一组 K&K 谜题上的正确率。
核心概念:约束求解、CSP 建模、形式化推理、代码辅助
small-model-codified-rules - 小模型代码化规则
chapter5/small-model-codified-rules/
基于 τ-bench 航空客服场景的对照实验:把复杂业务政策(退款规则)从自然语言提示词搬进代码/工具后,小模型的任务成功率与政策一致性大幅提升,工具内代码校验能实时拦截模型的错误认知。
核心概念:代码化业务规则、政策执行、工具内校验、小模型可靠性
paper-to-ppt - 论文自动生成 PPT(提议者-审核者)
chapter5/paper-to-ppt/
把「做 PPT」重构为代码生成问题:Proposer 编写 Slidev(Markdown+HTML)代码,Reviewer 把每页真正渲染成 PNG 并用 Vision LLM 检查排版问题,据结构化反馈迭代修订;双 Agent 分工使上下文峰值显著更小。
核心概念:代码生成、Slidev、提议者-审核者、视觉质量控制
paper-to-video - 论文讲解视频自动生成
chapter5/paper-to-video/
在「论文 → PPT」基础上为每页幻灯片生成口语化讲解词,调用 TTS 合成语音,再用 ffmpeg 把每页截图与其音频逐页同步合成为一段带旁白的讲解视频。
核心概念:多媒体生成、讲解词生成、TTS、ffmpeg 音画同步
video-edit - 基于 API 的智能视频剪辑
chapter5/video-edit/
用户给一段多场景视频 + 一句自然语言需求,Agent 通过「两步 Vision 定位」(先粗后细抽帧读图)确定目标场景时间边界,剪出片段后由 Reviewer 抽取成片关键帧核对,不合格则迭代。
核心概念:视频剪辑、Vision 定位、由粗到细、提议者-审核者
adaptive-log-parser - 自适应日志解析系统
chapter5/adaptive-log-parser/
一个能自我进化的日志解析系统:遇到无法解析的新格式时不报错,而是把失败样本与报错交给代码生成 Agent 生成 parse 函数,自动测试通过后热更新注册进解析引擎,全流程无需人工介入。
核心概念:代码作为系统适配器、自愈闭环、代码热更新、自动测试
log-diagnosis - 生产日志智能诊断系统
chapter5/log-diagnosis/
诊断 Agent 读取生产轨迹日志、架构文档与 PRD,自动定位问题与根因、生成结构化报告与回归测试用例,用重放框架真正执行验证,并(mock)通过 MCP 对接 GitHub 创建 Issue。
核心概念:轨迹诊断、根因定位、回归测试生成、重放验证
dynamic-form - 动态表单意图澄清系统
chapter5/dynamic-form/
面对信息不完整的请求时,Agent 不逐条追问,而是动态生成一个含级联逻辑的自包含 HTML 表单让用户一次性补全;前端把表单汇总为 JSON 交回 Agent 继续任务。
核心概念:代码生成、意图澄清、动态表单、级联逻辑
erp-agent - 自然语言 ERP Agent(NL → SQL)
chapter5/erp-agent/
把中文自然语言查询转成 SQL 交由数据库执行、直接呈现结果表,核心是 artifact(制品)模式:LLM 只生成 SQL 制品、不亲自搬运数据,既省 token 又避免手算出错,几万行结果也能秒回。
核心概念:NL2SQL、artifact 模式、数据库执行、成本与准确性
conversational-ui - 对话式界面定制系统
chapter5/conversational-ui/
用户用自然语言提出 UI 定制需求(颜色/字体/文案/布局),Agent 自主定位并修改 React 前端源码,借助 Vite 热加载(HMR)让改动即时生效,支持多轮迭代定制。
核心概念:代码修改、前端定制、热加载、多轮迭代
🎯 第 6 章 · Agent 的评估
terminal-bench - 终端环境基准测试
chapter6/terminal-bench/
Terminal-Bench 是测试 AI Agent 在真实终端环境中表现的基准测试。从编译代码到训练模型、设置服务器,评估 Agent 如何处理真实的端到端任务。包含约 100 个任务的数据集和执行框架,支持多种 Agent 实现。
核心概念:终端自动化、任务评估、Docker 沙箱、基准测试
SWE-bench - 软件工程基准测试
chapter6/SWE-bench/
SWE-bench 是评估大语言模型解决真实 GitHub 问题能力的基准测试。给定代码库和问题描述,模型需要生成 能够解决问题的补丁。包含 SWE-bench、SWE-bench Lite、SWE-bench Verified 和 SWE-bench Multimodal 多个版本。
核心概念:代码修复、GitHub 问题、补丁生成、Docker 评估
GAIA - 通用 AI 助手基准测试
chapter6/GAIA/
GAIA 旨在评估下一代 LLM(具有工具增强、高效提示、搜索访问等能力的 LLM)。包含 450+ 个需要不同程度工具和自主性的非平凡问题,答案明确无歧义。分为 3 个难度级别。
核心概念:工具使用、多步推理、自主性评估
OSWorld - 操作系统级 Agent 基准
chapter6/OSWorld/
评估 Agent 在完整操作系统环境中执行复杂任务的能力,包括文件管理、应用程序操作和系统配置。
核心概念:操作系统自动化、多应用协作、系统级任务
android_world - Android 环境基准
chapter6/android_world/(📖 外部仓库,见《外部仓库获取》)
评估 Agent 在 Android 移动环境中的表现,包括应用导航、UI 交互和任务完成能力。
核心概念:移动自动化、Android UI、应用交互
chapter6/android-world/(连字符命名)并非基准代码,而是本书对 T3A Agent 在 android_world 上失败案例的分析笔记(t3a*.md),可作为阅读材料参考。
tau2-bench - 工具增强推理基准
chapter6/tau2-bench/
专注于评估 Agent 使用工具进行复杂推理的能力,包括计算、搜索和数据处理等场景。
核心概念:工具增强推理、多步骤任务、工具组合