图书目录

目    录

第 1 章  智能体革命的基石——从LLM到Agent的跨越 1

1.1  LLM智能的源头与大脑 1

1.1.1  什么是LLM 2

1.1.2  LLM的发展简史 4

1.1.3  Transformer架构 9

1.2  AI Agent:从“对话”到“行动”的进化 27

1.2.1  什么是AI Agent 27

1.2.2  AI Agent的本质 28

1.2.3  AI Agent的关键技术 28

1.2.4  AI Agent的五级演化 31

1.3  AI Agent核心转变 32

1.3.1  AI Agent的认知闭环 32

1.3.2  AI Agent的闭环模块 33

1.3.3  AI Agent的闭环影响 34

1.4  现实中的应用场景 35

1.4.1  办公领域中的AI Agent应用 35

1.4.2  客户服务中的AI Agent应用 37

1.4.3  科研领域中的AI Agent应用 38

1.4.4  内容创作领域中的AI Agent应用 39

1.5  本章小结 40

第 2 章  智能体的核心架构与交互协议 41

2.1  智能体的三大核心组成部分 41

2.1.1  模型 41

2.1.2  工具 46

2.1.3  编排层 47

2.2  基础模型层——选择LLM的关键指标 49

2.2.1  推理能力 49

2.2.2  多轮对话的连贯性与记忆能力 50

2.2.3  上下文窗口大小 52

2.2.4  响应时间与调用稳定性 52

2.2.5  API成本与性价比评估 53

2.2.6  安全性与对齐能力 54

2.2.7  可用性与集成便利性 55

2.3  工具集成层——Function Calling与Tool 55

2.3.1  工具集成方案描述 56

2.3.2  工具集成方案实践 57

2.3.3  工具集成方案选择 63

2.4  MCP核心技术剖析 63

2.4.1  MCP的原理与实践 63

2.4.2  MCP的底层运行机制 74

2.4.3  MCP Host与模型的交互 92

2.5  MCP与Function Calling的关系 98

2.5.1  Function Calling的基本介绍 99

2.5.2  Function Calling的交互流程 99

2.5.3  Function Calling的实践 101

2.5.4  MCP与Function Calling的关系 106

2.6  本章小结 107

第 3 章  智能体的能力增强与自动化执行 108

3.1  上下文工程 108

3.2  执行增强层——RAG 114

3.2.1  RAG原理 114

3.2.2  RAG实践 124

3.2.3  Agentic RAG 133

3.3  自动化工具集成 146

3.3.1  AI+RPA技术应用 146

3.3.2  BrowserAgent 162

3.3.3  Computer Use 165

3.3.4  Phone Use 167

3.3.5  超级个人助手OpenClaw 172

3.4  本章小结 178

第 4 章  提示词工程与认知架构 179

4.1  提示词工程 179

4.1.1  提示词定义 180

4.1.2  提示词要素 180

4.1.3  提示词通用设计原则 181

4.1.4  高级提示词 184

4.1.5  LLM的输出配置 190

4.2  从CoT到ReAct框架 194

4.2.1  思维链 194

4.2.2  ReAct框架 198

4.3  Plan-And-Execute框架 207

4.4  ToT、GoT以及AoT认知架构 209

4.4.1  ToT 210

4.4.2  GoT 211

4.4.3  AoT 213

4.5  本章小结 214

第 5 章  从理论到实践:使用LangChain、LangGraph和LangSmith构建智能体 215

5.1  Agent框架地图 215

5.2  LangChain框架 221

5.2.1  LangChain核心模块 221

5.2.2  LangChain实践 223

5.2.3  LangChain适用场景 232

5.3  LangGraph框架 233

5.3.1  LangGraph核心模块 233

5.3.2  LangGraph的整体优势 253

5.3.3  LangGraph的适用场景 253

5.4  LangSmith平台 254

5.4.1  环境准备 254

5.4.2  代码示例 255

5.4.3  LangSmith监控 256

5.5  知识问答Agent 260

5.5.1  核心功能 260

5.5.2  工作流程 261

5.5.3  环境配置 262

5.5.4  代码示例 262

5.5.5  结果展示 273

5.5.6  LangSmith监控 276

5.6  本章小结 279

第 6 章  多智能体协作与通信协议 280

6.1  多智能体系统 280

6.1.1  什么是多智能体系统 281

6.1.2  多智能体系统的优势 282

6.1.3  极简示例:第一个多智能体协作程序 283

6.1.4  动手试一试 284

6.2  核心通信协议:A2A与AG-UI 285

6.2.1  A2A协议 285

6.2.2  AG-UI协议 298

6.3  协作框架设计 304

6.3.1  角色分工 304

6.3.2  任务分配 305

6.3.3  流程编排 308

6.3.4  协作模式 308

6.4  多智能体实战:公众号图文自动生成与发布 312

6.4.1  项目全景解析 312

6.4.2  项目环境准备 312

6.4.3  核心模块深度解析 314

6.4.4  实战运行 325

6.4.5  常见问题与解决 327

6.4.6  动手试一试 328

6.5  本章小结 329

第 7 章  大模型微调与对齐技术 330

7.1  大模型微调 330

7.1.1  指令微调:教会模型“听懂”人话 331

7.1.2  LoRA微调:以小博大的参数效率革命 331

7.1.3  QLoRA微调:量化与低秩的完美结合 333

7.1.4  实践建议:选择合适的微调策略 334

7.2  RLHF技术 335

7.2.1  RLHF的三阶段流程 336

7.2.2  RLHF的技术挑战 338

7.2.3  改进方向和变体 339

7.2.4  实践案例:InstructGPT的RLHF实践 339

7.3  对齐技术进阶:DPO与PPO的算法差异与实战选择 340

7.3.1  DPO原理与实践 340

7.3.2  PPO原理与实践 343

7.3.3  DPO与PPO算法对比与实战选择 345

7.3.4  改进算法简介 346

7.3.5  实践建议 347

7.4  本章小结 348

第 8 章  AI智能体与SaaS 349

8.1  Agent集成SaaS的三个阶段 349

8.1.1  工具型接入 350

8.1.2  编排型接入 350

8.1.3  自治协作型接入 351

8.2  技术实现路径 351

8.2.1  架构层面 352

8.2.2  核心技术栈 352

8.2.3  替换与集成场景示例 355

8.3  优势与挑战 355

8.4  扩展应用案例 356

8.4.1  企业自动化 356

8.4.2  客服Agent 356

8.4.3  创新场景 357

8.5  未来展望 358

8.6  本章小结 359

后记 360