核心目标

自动驾驶轨迹追踪的核心目标是实现车辆沿参考路径的高精度、高鲁棒性行驶,核心依赖PID 控制、模型预测控制(MPC) 两大算法,结合RTK-GPS、IMU、激光雷达的多传感器融合技术,通过运动学与动力学集成建模,在高速(最高 116km/h)、低附着路面(μ=0.3)等复杂场景下,将横向跟踪误差控制在 0.32m 以内,同时兼顾控制平顺性与实时响应(计算时间达毫秒级),为自动驾驶变道、高速行驶等场景提供安全保障。

思维导图

基础模型(FMs)在轨迹规划中的核心应用

分类

博世的文档提出两层八级分类体系,核心按 “基础模型的作用方式” 划分:

一级分类

二级分类(子类别)

核心特点

代表模型

关键技术细节

专为

轨迹

规划

定制

的基

础模

1. 无思维链推理

直接从传感器数据输出轨迹,无中间推理步骤

CarLLaVA、DriveGPT4-v2

采用 MLP 规划头,单次推理生成轨迹,CarLLaVA 在 CARLA 挑战赛夺冠

2. 思维链推理(文本输出)

先生成场景描述 / 元动作(如 “减速”),再规划轨迹

GPT-Driver、S4-Driver

GPT-Driver 微调 Chat-GPT3.5,S4-Driver 仅预测 4 类元动作,推理时间增加 4.5 倍

3. 思维链推理(初始轨迹预测)

先输出初始轨迹,再优化得到最终轨迹

-

利用初始轨迹修正偏差,提升复杂场景跟踪精度

4. 语言交互能力

支持驾驶相关问答 / 场景解释,增强可解释性

RAG-Driver、DriveVLM

RAG-Driver 结合检索增强,DriveVLM 支持场景分析与轨迹联动

5. 动作交互能力

响应自然语言指令(如 “左变道”“靠边停车”)

DriveMLM、LMDrive

LMDrive 支持 56 种指令,唯一能检测指令完成状态的模型

6. 语言 + 动作交互能力

兼具问答解释与指令跟随功能

SimLingo

基于 Mini-InternVL,单阶段训练,驾驶评分超 85 分

指导轨迹规划的基础模型

7. 仅训练期知识蒸馏

训练时蒸馏 FM 知识,推理时无需 FM

VLP、VLM-AD

VLM-AD 用 GPT-4o 生成元动作,通过交叉熵损失蒸馏到 AD 模型

8. 推理期知识迁移

训练 + 推理均依赖 FM,迁移场景描述 / 规划决策

VLM-E2E、DiffVLA

DiffVLA 用独热编码传递元动作,适配扩散规划器

关键技术设计细节

1. 微调流程(适配轨迹规划的核心步骤)

数据整理:根据用途扩展数据元组,如语言交互需新增(X,T,O_text,O_traj)(X = 观测,T = 提示词,O_text = 文本输出,O_traj = 轨迹)

视觉适配器设计:三种主流方案 —— 文本接口(非端到端)、线性层 / MLP(简单高效)、Queryformer(选择性投射特征,Omni-Q 采用)

轨迹表示方式:

文本形式:自回归生成坐标字符(如 “1.54,0.21”),无需修改分词器,但推理慢

动作令牌:离散化动作空间(如 2048 个动作词汇),Zhou 等人 2025c 采用

数字集合:通过规划头(MLP / 变分自编码器)单次输出,效率最高(SimLingo 采用)

训练策略:两阶段训练(先训视觉适配器,再微调全参数),部分用 LoRA 降低算力消耗

2. 性能与效率权衡

推理速度:思维链(CoT)推理显著增加延迟,SimLingo 在 A4500 GPU 上,无 CoT 时 3.6fps,有 CoT 时仅 0.8fps;Orion(70 亿参数)在 A800 上仅 0.8fps

精度表现:带 CoT 的模型场景理解更准,Auto-VLA 在复杂场景通过自适应 CoT 提升鲁棒性;SimLingo 通过数据重采样,驾驶评分超 85 分

硬件适配:轻量模型(如 SimLingo,10 亿参数)更适合边缘部署,大型模型(如 GPT-Driver,>175B 参数)需数据中心级 GPU(A100/H200)

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐