方法笔记归档
归档只收录本站持续维护的方法笔记。项目中的真实工作、系统图和 demo 请在作品页查看。
用六层技术结构串起自动驾驶论文精读:先建立感知地基,再走向端到端、世界模型、生成式规划与 VLA。
从采样、reward、advantage 到 loss 与 LoRA 梯度,追踪 Flow-GRPO 训练链路中每一步到底发生了什么。
从 L1、Focal、KL 到扩散、碰撞约束与 GRPO,理解每一种目标函数为驾驶系统引入了什么偏好。