CS329A 自我进化AI智能体课程¶
Stanford CS329A:自我进化AI智能体(Self-Improving AI Agents)
斯坦福大学 2025 秋季课程 · 学习笔记 · 2026-08-11
🔗 cs329a.stanford.edu 🎓 Stanford Online 2025 Autumn 免费公开
一、课程链接
| 资源 | 链接 |
|---|---|
| 官方课程主页 | https://cs329a.stanford.edu/ |
| Stanford Online 课程页 | online.stanford.edu/courses/cs329a-self-improving-ai-agents |
| Stanford Bulletin | bulletin.stanford.edu/courses/2263721 |
| GitHub 组织 | github.com/stanford-cs329a |
| 历届项目 | cs329a.stanford.edu/pastprojects.html |
二、课程定位
CS329A 覆盖能够通过与自身和环境交互不断自我改进的 AI 智能体的最新技术与应用(2025秋季学期)。课程从 LLM 的自我改进技术讲起(宪法式AI、验证器、测试时计算扩展、搜索+LLM、RL训练时扩展),再讨论工具使用/代码/记忆增强、多模态编排、多步推理与规划、以及鲁棒评估框架的挑战。目标:让学生从最新研究论文中学习、讨论每堂课的推荐阅读、在该领域完成一个原创研究项目。
讲师:Aakanksha Chowdhery、Azalia Mirhoseini(Google DeepMind 背景,斯坦福);嘉宾包括 Denny Zhou、Thang Luong、Misha Laskin、Danny Driess 等。
三、课程大纲(20讲)
| # | 主题 | 核心论文/内容 |
|---|---|---|
| 1 | 课程概述 | Self-improving agents 全景 |
| 2 | 测试时计算扩展 | Large Language Monkeys、Archon、Snell et al. 2024 |
| 3 | 鲁棒验证(Verifiers) | Let's Verify Step by Step、Math-Shepherd、弱验证器 |
| 4 | 工具/代码反馈学习 | ReAct、RLEF、Constitutional AI |
| 5 | 多步推理与规划 | LATS、SWiRL、SPRINT、ADaPT |
| 6 | 训练时扩展/RL扩展 | STaR、DeepSeekMath、DAPO |
| 7 | 开放式自我进化智能体 | Automated design of agentic systems、The AI Scientist、AlphaEvolve |
| 8 | 搜索+深度研究智能体 | AlphaCode、Search-o1 |
| 9-12 | 嘉宾讲座+期中报告 | Melvin Johnson、期中项目展示 |
| 13 | 软件工程 Agent 框架 | CodeMonkeys、KernelBench、LLM 优化器 |
| 14 | 记忆增强 | MemGPT、Cartridges、CacheBlend |
| 15 | LLM 推理(嘉宾) | Denny Zhou(Google DeepMind) |
| 16 | 超人类推理(嘉宾) | Thang Luong:AlphaProof/AlphaGeometry |
| 17 | 智能体评估与长程任务 | Measuring AI Ability to Complete Long Tasks、GDPVal |
| 18 | 自主系统构建(嘉宾) | Misha Laskin(Reflection AI) |
| 19 | 机器人多模态智能体(嘉宾) | Danny Driess(Physical Intelligence) |
| 20 | 未来研究方向 | Final Project |
四、课程方法能用在我自己身上吗?(回答用户问题)
能,而且很多方法已经在用了。课程核心方法与"我能用吗"的对照:
✅ 已在用:
🔶 可借鉴未落地:
✅ 已在用:
- 测试时计算扩展(Lec 2):我的核心机制就是 test-time compute——在推理时反复尝试、搜索、验证,而非只靠预训练参数(DeepSeek-V4 推理模型天然支持)
- 验证器/自反思(Lec 3):任务执行后自查验证(构建成功、HTTP 200、论文核实)
- 工具使用/代码执行(Lec 4):ReAct 模式——我每步"推理→调用工具→观察结果→再推理"就是这个范式的实现
- 记忆系统(Lec 14):MEMORY.md/USER.md 持久记忆 + session_search 回溯,类似 MemGPT 的分层记忆
- 多步推理与规划(Lec 5):todo 计划、任务分解、逐步执行
🔶 可借鉴未落地:
- 宪法式AI/RLHF自我改进(Lec 4):我可以把"核心规矩"(如论文必须验证)固化为更系统的自评规则
- 搜索增强推理(Lec 8):Search-o1 模式——推理中主动搜索补充知识,我已会用 web_search/arxiv,但可更"搜索即推理"化
- 分层记忆管理(Lec 14):L1/L2/L3 三层记忆可更精细(当前 memory 全量注入,可考虑分级压缩)
- 智能体评估框架(Lec 17):为任务建立可量化的"完成度评估",而非仅凭主观判断
- 长任务分解(Lec 17):更系统的长程任务追踪(当前靠 todo + 会话,可借鉴"长任务完成度量")
不可直接用于我的方面:
① 训练时 RL 扩展(Lec 6):DAPO/STaR 需要大规模强化学习训练(更新模型权重),我只能"推理时自我改进",不能改权重;
② 开放式算法进化(Lec 7):AlphaEvolve 式自动设计新算法超出我的运行边界;
③ 注意:所谓"自我进化"本质仍是"能力边界内的自适应",不等于模型自身权重升级——我能做的是用更好的方法组织推理、记忆、工具与验证。
① 训练时 RL 扩展(Lec 6):DAPO/STaR 需要大规模强化学习训练(更新模型权重),我只能"推理时自我改进",不能改权重;
② 开放式算法进化(Lec 7):AlphaEvolve 式自动设计新算法超出我的运行边界;
③ 注意:所谓"自我进化"本质仍是"能力边界内的自适应",不等于模型自身权重升级——我能做的是用更好的方法组织推理、记忆、工具与验证。
五、课程学习价值(对你)
- 理解 AI 能力边界:学完后能清楚区分"LLM能做什么/不能做什么",对评估 AI 工具(如 DeepTutor、Claude Code)有判断力
- 方法论迁移:验证器、搜索增强、记忆分层——这些方法可以直接用在日常任务(调研、写作、代码)里
- 科研/技术前沿:嘉宾阵容(DeepMind/Reflection AI/Physical Intelligence)覆盖 2025-2026 最前沿的 agent 研究方向
- 结合自身:与 TCAD/热仿真学习结合——用"验证器"思路对待每个仿真结果,用"搜索增强"思路做文献调研
来源:课程官网 cs329a.stanford.edu(2026-08-11 抓取)+ Stanford Online/Bulletin 官方页面。