- Published on
自动驾驶学习地图:从 BEV 到 VLA
- Authors

- Name
- Tails Azimuth
很多文章单独读可以理解,但不知道它解决了哪个前置问题;这里按“每一层解决上一层留下的问题”重新组织。
六层技术结构
第六层 VLA / 具身智能 / 强化微调 泛化与高层语义
第五层 生成式规划 / Flow / GRPO 多模态决策与后训练
第四层 世界模型 预测未来与闭环数据
第三层 端到端规划 感知、预测、规划对齐
第二层 BEV 感知 多相机统一场景表示
第一层 Transformer / ViT token 化与全局建模基础
先建立感知坐标系
Transformer 给出 token 之间全局交互的基本工具,ViT 让图像以 token 序列进入模型。BEV 则回答自动驾驶最基础的问题:多路相机怎样变成同一个可度量、可规划的鸟瞰空间。理解 BEV query、时序特征和跨相机对齐,是读后续系统论文的门槛。
端到端、世界模型与生成式规划
UniAD、VAD、SparseDrive 等工作尝试让感知、预测和规划共享表征,并让规划目标反向影响上游模块。世界模型进一步解决真车数据昂贵、长尾情景稀缺的问题;生成式规划则用轨迹分布代替单点回归,让多个合理决策可以被表达和优化。
VLA
VLA 将视觉、语言和动作放进统一的序列建模框架,为复杂指令和长尾泛化提供新的接口。阅读顺序应当是:先建立 BEV 与端到端系统的坐标系,再读世界模型,最后进入生成式规划、RL 与 VLA。每一步都追问:前一层不能解决什么,下一层为什么有必要出现?