三阶段框架
先记住三阶段的大框架:
- 阶段①:正常驾驶数据学危险可供性先验
H = {o, ρ, v}; - 阶段②:用语言/事故类型激活先验
H'; - 阶段③:以
H'为条件的占用扩散生成未来场景。
阶段①的模型是 Grid U-Net,它的训练数据全部由"数据处理阶段"产出。所以这一阶段要为模型提供两样东西:
- 输入 X:当前时刻的三维占用体素(车看到了什么);
- 监督信号 Y:危险强度场 ρ 和危险方向场 v 的伪标签(哪里危险、危险从哪个方向来)。
核心设计决策:阶段①完全不用事故数据
原因有两个——事故数据太稀缺,而且没有 3D 标注、构不出占用体素;更根本的是,"危险"的几何规律(距离近不近、碰撞时间多短)是运动学量,可以从正常驾驶数据的标注里精确推导出来。所以整个伪标签都是"算"出来的,不是"标"出来的。