Agent 原理、大模型后训练与工程面试,三条学习路线。结合论文、代码与实验,逐步建立完整理解。
注册并验证邮箱后,全部章节免费学习,进度跨设备保存
从 ReAct、规划与记忆,到工具、多 Agent、Harness、自我改进和可信评测;结合 AI-Agent-Guide 持续更新。
Transformer、RAG 与 Agent 工程的三组深度面试专题,拆解原理、设计取舍和追问。
从策略梯度、PPO、SFT、DPO、GRPO 与 RLVR,到 TRL、verl 和 vLLM,完成可审计的独立后训练。