METHOD NOTES
这些笔记记录生成模型、强化学习和端到端系统中的方法理解。它们是个人学习与整理,不替代项目页中可归属、可核对的实际研究工作。
用六层技术结构串起自动驾驶论文精读:先建立感知地基,再走向端到端、世界模型、生成式规划与 VLA。
从采样、reward、advantage 到 loss 与 LoRA 梯度,追踪 Flow-GRPO 训练链路中每一步到底发生了什么。
从 L1、Focal、KL 到扩散、碰撞约束与 GRPO,理解每一种目标函数为驾驶系统引入了什么偏好。