自动驾驶轨迹追踪技术
核心目标
自动驾驶轨迹追踪的核心目标是实现车辆沿参考路径的高精度、高鲁棒性行驶,核心依赖PID 控制、模型预测控制(MPC) 两大算法,结合RTK-GPS、IMU、激光雷达的多传感器融合技术,通过运动学与动力学集成建模,在高速(最高 116km/h)、低附着路面(μ=0.3)等复杂场景下,将横向跟踪误差控制在 0.32m 以内,同时兼顾控制平顺性与实时响应(计算时间达毫秒级),为自动驾驶变道、高速行驶等场景提供安全保障。
思维导图

基础模型(FMs)在轨迹规划中的核心应用
分类
博世的文档提出两层八级分类体系,核心按 “基础模型的作用方式” 划分:
|
一级分类 |
二级分类(子类别) |
核心特点 |
代表模型 |
关键技术细节 |
|
专为 轨迹 规划 定制 的基 础模 型 |
1. 无思维链推理 |
直接从传感器数据输出轨迹,无中间推理步骤 |
CarLLaVA、DriveGPT4-v2 |
采用 MLP 规划头,单次推理生成轨迹,CarLLaVA 在 CARLA 挑战赛夺冠 |
|
2. 思维链推理(文本输出) |
先生成场景描述 / 元动作(如 “减速”),再规划轨迹 |
GPT-Driver、S4-Driver |
GPT-Driver 微调 Chat-GPT3.5,S4-Driver 仅预测 4 类元动作,推理时间增加 4.5 倍 |
|
|
3. 思维链推理(初始轨迹预测) |
先输出初始轨迹,再优化得到最终轨迹 |
- |
利用初始轨迹修正偏差,提升复杂场景跟踪精度 |
|
|
4. 语言交互能力 |
支持驾驶相关问答 / 场景解释,增强可解释性 |
RAG-Driver、DriveVLM |
RAG-Driver 结合检索增强,DriveVLM 支持场景分析与轨迹联动 |
|
|
5. 动作交互能力 |
响应自然语言指令(如 “左变道”“靠边停车”) |
DriveMLM、LMDrive |
LMDrive 支持 56 种指令,唯一能检测指令完成状态的模型 |
|
|
6. 语言 + 动作交互能力 |
兼具问答解释与指令跟随功能 |
SimLingo |
基于 Mini-InternVL,单阶段训练,驾驶评分超 85 分 |
|
|
指导轨迹规划的基础模型 |
7. 仅训练期知识蒸馏 |
训练时蒸馏 FM 知识,推理时无需 FM |
VLP、VLM-AD |
VLM-AD 用 GPT-4o 生成元动作,通过交叉熵损失蒸馏到 AD 模型 |
|
8. 推理期知识迁移 |
训练 + 推理均依赖 FM,迁移场景描述 / 规划决策 |
VLM-E2E、DiffVLA |
DiffVLA 用独热编码传递元动作,适配扩散规划器 |
关键技术设计细节
1. 微调流程(适配轨迹规划的核心步骤)
数据整理:根据用途扩展数据元组,如语言交互需新增(X,T,O_text,O_traj)(X = 观测,T = 提示词,O_text = 文本输出,O_traj = 轨迹)
视觉适配器设计:三种主流方案 —— 文本接口(非端到端)、线性层 / MLP(简单高效)、Queryformer(选择性投射特征,Omni-Q 采用)
轨迹表示方式:
文本形式:自回归生成坐标字符(如 “1.54,0.21”),无需修改分词器,但推理慢
动作令牌:离散化动作空间(如 2048 个动作词汇),Zhou 等人 2025c 采用
数字集合:通过规划头(MLP / 变分自编码器)单次输出,效率最高(SimLingo 采用)
训练策略:两阶段训练(先训视觉适配器,再微调全参数),部分用 LoRA 降低算力消耗
2. 性能与效率权衡
推理速度:思维链(CoT)推理显著增加延迟,SimLingo 在 A4500 GPU 上,无 CoT 时 3.6fps,有 CoT 时仅 0.8fps;Orion(70 亿参数)在 A800 上仅 0.8fps
精度表现:带 CoT 的模型场景理解更准,Auto-VLA 在复杂场景通过自适应 CoT 提升鲁棒性;SimLingo 通过数据重采样,驾驶评分超 85 分
硬件适配:轻量模型(如 SimLingo,10 亿参数)更适合边缘部署,大型模型(如 GPT-Driver,>175B 参数)需数据中心级 GPU(A100/H200)
更多推荐




所有评论(0)