PAN / JIANHAO
Published on

自动驾驶学习地图:从 BEV 到 VLA

Authors

很多文章单独读可以理解,但不知道它解决了哪个前置问题;这里按“每一层解决上一层留下的问题”重新组织。

六层技术结构

第六层  VLA / 具身智能 / 强化微调       泛化与高层语义
第五层  生成式规划 / Flow / GRPO          多模态决策与后训练
第四层  世界模型                           预测未来与闭环数据
第三层  端到端规划                         感知、预测、规划对齐
第二层  BEV 感知                           多相机统一场景表示
第一层  Transformer / ViT                  token 化与全局建模基础

先建立感知坐标系

Transformer 给出 token 之间全局交互的基本工具,ViT 让图像以 token 序列进入模型。BEV 则回答自动驾驶最基础的问题:多路相机怎样变成同一个可度量、可规划的鸟瞰空间。理解 BEV query、时序特征和跨相机对齐,是读后续系统论文的门槛。

端到端、世界模型与生成式规划

UniAD、VAD、SparseDrive 等工作尝试让感知、预测和规划共享表征,并让规划目标反向影响上游模块。世界模型进一步解决真车数据昂贵、长尾情景稀缺的问题;生成式规划则用轨迹分布代替单点回归,让多个合理决策可以被表达和优化。

VLA

VLA 将视觉、语言和动作放进统一的序列建模框架,为复杂指令和长尾泛化提供新的接口。阅读顺序应当是:先建立 BEV 与端到端系统的坐标系,再读世界模型,最后进入生成式规划、RL 与 VLA。每一步都追问:前一层不能解决什么,下一层为什么有必要出现?