学习与系统
BEV / 世界模型 / VLA
生成与优化
Flow Matching / GRPO / 强化学习
端到端建模
Loss / 端到端驾驶 / 深度学习
用六层技术结构串起自动驾驶论文精读:先建立感知地基,再走向端到端、世界模型、生成式规划与 VLA。
从采样、reward、advantage 到 loss 与 LoRA 梯度,追踪 Flow-GRPO 训练链路中每一步到底发生了什么。
从 L1、Focal、KL 到扩散、碰撞约束与 GRPO,理解每一种目标函数为驾驶系统引入了什么偏好。