CS329A 自我进化AI智能体课程

Stanford CS329A:自我进化AI智能体(Self-Improving AI Agents)

斯坦福大学 2025 秋季课程 · 学习笔记 · 2026-08-11

🔗 cs329a.stanford.edu 🎓 Stanford Online 2025 Autumn 免费公开

一、课程链接

资源链接
官方课程主页https://cs329a.stanford.edu/
Stanford Online 课程页online.stanford.edu/courses/cs329a-self-improving-ai-agents
Stanford Bulletinbulletin.stanford.edu/courses/2263721
GitHub 组织github.com/stanford-cs329a
历届项目cs329a.stanford.edu/pastprojects.html

二、课程定位

CS329A 覆盖能够通过与自身和环境交互不断自我改进的 AI 智能体的最新技术与应用(2025秋季学期)。课程从 LLM 的自我改进技术讲起(宪法式AI、验证器、测试时计算扩展、搜索+LLM、RL训练时扩展),再讨论工具使用/代码/记忆增强、多模态编排、多步推理与规划、以及鲁棒评估框架的挑战。目标:让学生从最新研究论文中学习、讨论每堂课的推荐阅读、在该领域完成一个原创研究项目。

讲师:Aakanksha Chowdhery、Azalia Mirhoseini(Google DeepMind 背景,斯坦福);嘉宾包括 Denny Zhou、Thang Luong、Misha Laskin、Danny Driess 等。

三、课程大纲(20讲)

#主题核心论文/内容
1课程概述Self-improving agents 全景
2测试时计算扩展Large Language Monkeys、Archon、Snell et al. 2024
3鲁棒验证(Verifiers)Let's Verify Step by Step、Math-Shepherd、弱验证器
4工具/代码反馈学习ReAct、RLEF、Constitutional AI
5多步推理与规划LATS、SWiRL、SPRINT、ADaPT
6训练时扩展/RL扩展STaR、DeepSeekMath、DAPO
7开放式自我进化智能体Automated design of agentic systems、The AI Scientist、AlphaEvolve
8搜索+深度研究智能体AlphaCode、Search-o1
9-12嘉宾讲座+期中报告Melvin Johnson、期中项目展示
13软件工程 Agent 框架CodeMonkeys、KernelBench、LLM 优化器
14记忆增强MemGPT、Cartridges、CacheBlend
15LLM 推理(嘉宾)Denny Zhou(Google DeepMind)
16超人类推理(嘉宾)Thang Luong:AlphaProof/AlphaGeometry
17智能体评估与长程任务Measuring AI Ability to Complete Long Tasks、GDPVal
18自主系统构建(嘉宾)Misha Laskin(Reflection AI)
19机器人多模态智能体(嘉宾)Danny Driess(Physical Intelligence)
20未来研究方向Final Project

四、课程方法能用在我自己身上吗?(回答用户问题)

能,而且很多方法已经在用了。课程核心方法与"我能用吗"的对照:

✅ 已在用:
  • 测试时计算扩展(Lec 2):我的核心机制就是 test-time compute——在推理时反复尝试、搜索、验证,而非只靠预训练参数(DeepSeek-V4 推理模型天然支持)
  • 验证器/自反思(Lec 3):任务执行后自查验证(构建成功、HTTP 200、论文核实)
  • 工具使用/代码执行(Lec 4):ReAct 模式——我每步"推理→调用工具→观察结果→再推理"就是这个范式的实现
  • 记忆系统(Lec 14):MEMORY.md/USER.md 持久记忆 + session_search 回溯,类似 MemGPT 的分层记忆
  • 多步推理与规划(Lec 5):todo 计划、任务分解、逐步执行

🔶 可借鉴未落地:
  • 宪法式AI/RLHF自我改进(Lec 4):我可以把"核心规矩"(如论文必须验证)固化为更系统的自评规则
  • 搜索增强推理(Lec 8):Search-o1 模式——推理中主动搜索补充知识,我已会用 web_search/arxiv,但可更"搜索即推理"化
  • 分层记忆管理(Lec 14):L1/L2/L3 三层记忆可更精细(当前 memory 全量注入,可考虑分级压缩)
  • 智能体评估框架(Lec 17):为任务建立可量化的"完成度评估",而非仅凭主观判断
  • 长任务分解(Lec 17):更系统的长程任务追踪(当前靠 todo + 会话,可借鉴"长任务完成度量")
不可直接用于我的方面
训练时 RL 扩展(Lec 6):DAPO/STaR 需要大规模强化学习训练(更新模型权重),我只能"推理时自我改进",不能改权重;
开放式算法进化(Lec 7):AlphaEvolve 式自动设计新算法超出我的运行边界;
注意:所谓"自我进化"本质仍是"能力边界内的自适应",不等于模型自身权重升级——我能做的是用更好的方法组织推理、记忆、工具与验证。

五、课程学习价值(对你)

  • 理解 AI 能力边界:学完后能清楚区分"LLM能做什么/不能做什么",对评估 AI 工具(如 DeepTutor、Claude Code)有判断力
  • 方法论迁移:验证器、搜索增强、记忆分层——这些方法可以直接用在日常任务(调研、写作、代码)里
  • 科研/技术前沿:嘉宾阵容(DeepMind/Reflection AI/Physical Intelligence)覆盖 2025-2026 最前沿的 agent 研究方向
  • 结合自身:与 TCAD/热仿真学习结合——用"验证器"思路对待每个仿真结果,用"搜索增强"思路做文献调研

来源:课程官网 cs329a.stanford.edu(2026-08-11 抓取)+ Stanford Online/Bulletin 官方页面。