该示例为参考算法,仅作为在J6上模型部署的设计参考,非量产算法。
简介
轨迹预测任务的目的是在给定历史轨迹的情况下预测未来轨迹。这项任务在自动驾驶、智能监控、运动分析等领域有着广泛应用。传统方法通常直接利用历史轨迹来预测未来,而忽略了预测目标的上下文或查询信息的影响。这种忽视可能导致预测精度的下降,特别是在复杂场景中。
本文将介绍轨迹预测算法QCNet在地平线征程6平台上的优化部署。
性能精度指标
模型参数:
模型 | 数据集 | map_encoder | agent_encoder | decoder | postprocess |
|---|---|---|---|---|---|
QCNet | argoverse-2 | QCNetOEMapEncoder | QCNetOEAgentEncoderStream | QCNetOEDecoder | Argoverse2Postprocess |
性能精度表现:
浮点精度HitRate | 定点精度HitRate | J6M Latency | J6M FPS |
|---|---|---|---|
0.8003 | 0.7981 | 3.72ms | 293.43 |
公版模型介绍
由于轨迹预测的归一化要求,现有方法采用以agent为中心的编码范式来实现空间旋转平移不变性,其中每个代理都在由其当前时间步长位置和偏航角确定的局部坐标系中编码。但是观测窗口每次移动时,场景元素的几何属性需要根据agent最新状态的位置重新归一化,不断变化的时空坐标系统阻碍了先前计算编码的重用,即使观测窗口存在很大程度上的重叠。为了解决这个问题,QCNet引入了以查询为中心的编码范式,为查询向量派生的每个场景元素建立一个局部时空坐标系,并在其局部参考系中处理查询元素的特征。然后,在进行基于注意力的场景上下文融合时,将相对时空位置注入Key和Value元素中。下图展示了场景元素的局部坐标系示例:

QCNet主要由编码器和解码器组成,其作用分别为:
编码器:对输入的场景元素进行编码,采用了目前流行的factorized attention实现了时间维度attention、Agent-Map cross attention和Agent与Agent间隔的attention;
解码器:借鉴DETR的解码器,将编码器的输出解码为每个目标agent的K个未来轨迹。
以查询为中心的场景上下文编码
QCNet首先进行了场景元素编码、相对位置编码和地图编码,对于每个agent状态和map上的每个采样点,将傅里叶特征与语义属性(例如:agent的类别)连接起来,并通过MLP进行编码,为了进一步生成车道和人行横道的多边形级表示,采用基于注意力的池化对每个地图多边形内采样点进行。这些操作产生形状为[A, T, D]的agent编码和形状为[M, D]的map编码,其中D表示隐藏的特征维度。为了帮助agent编码捕获更多信息,编码器还考虑了跨agent时间step、agent之间以及agent与map之间的注意力并重复多次。如下图所示:

基于查询的轨迹解码
轨迹预测的第二步是利用编码器输出的场景编码来解码每个目标agent的K个未来轨迹。受目标检测任务的启发,采用类似DETR的解码器来处理这种一对多问题。QCNet使用可学习的、无锚点的query来提出初始轨迹。初始轨迹在refine模块中充当锚点。与Multipath和DenseTNT密集采样的手动设置anchor相比,QCNet在propose模块用数据驱动的方式生成k个自适应anchor。为了减轻query的上下文提取负担并提高anchor的质量,将类似DETR的解码器推广为循环方式。通过$$T_{rec$$个循环,具有上下文感知的模态query仅通过每个循环末尾的MLP解码$$T^’/T_{rec$$未来的waypoints。在随后的循环中,这些query再次成为输入,并提取与接下来几个路径点预测相关的场景上下文。相关流程如下所示:

地平线部署说明
改动点:
相对于公版网络结构,在不大幅影响精度的情况下,对网络进行了裁剪,实现了性能的提升,相关细节见 性能优化/网络裁剪 章节;
优化FourierEmbedding结构,去除其中的所有edge_index,直接计算形状为[B, lenq, lenk, D]的相对信息r;
重构代码,将AttentionLayer中的query形状设为[B, lenq, 1, D] , key形状为[B, 1, lenk, D], r形状为[B, lenq, lenk, D],利于性能提升;
- 适当减少了相对位置编码RAttentionLayer中的Layermorm操作,对精度影响不大;
decoder 复用 agent encoder 的 feature,并去除了decoder propose 阶段a2m的RAttention;
适配流式推理:预测算法QCNet的两种推理方式,一是对所有历史帧数据并行encode后送入decode预测下一帧;二是流式推理按照时序,逐帧encode后,最后一帧将前面encoder的结果拼接后送入decoder。流式推理符合实际部署的逻辑,但hbm infer速度会变慢。实际部署数据按时序逐帧给出,应当采用流式推理方案。
性能优化
网络裁剪
为了更优异的性能表现,参考算法相对于公版做了裁剪,主要为以下参数:
公版模型 | 参考算法 | 描述 | |
num_agent_layers | 2 | 1 | 预处理agent模块的层数 |
num_recurrent_steps | 3 | 1 | 预处理部分历史时间步数 |
time_span | 10 | 2 | 采样频率 |
num_historical_steps | 50 | 10 | 历史时间步数 |
num_t2m_steps | 30 | 6 | decoder中交叉注意力时间步数 |
num_dec_layers | 2 | 1 | QCNetOEDecoder中的层数 |
代码重构
FourierEmbedding将每个场景元素的极坐标转换成傅里叶特征,以方便高频信号的学习。 但是公版QCNet 使用了大量edge_index索引操作, 使得模型中存在大量BPU暂不支持的index_select、scatter等操作。QCNet参考算法重构了代码,去除了FourierEmbedding中的所有edge_index,agent_encoder编码器注意力层的query形状设为[B, lenq, 1, D] , key形状为[B, 1, lenk, D], r形状为[B, lenq, lenk, D],相关代码如下所示:
heal/models/task_modules/qcnet/rattention.py
FourierConvEmbedding
Embedding和Linear层全部替换为了对BPU更友好的Conv1x1;
删除self.mlps层中的LayerNorm,对精度基本无影响;
- 将公版代码中的torch.stack(continuous_embs).sum(dim=0)直接优化为了add操作,获得了比较大的性能收益。
对应代码如下所示:
heal/models/task_modules/qcnet/fourier_embedding.py
RAttentionLayer
从实验结果来看,浮点精度反而略有提升。相关代码如下:
heal/models/task_modules/qcnet/rattention.py
Decoder
Decoder采用类似detr的解码器来处理一对多的 K个轨迹预测的问题,首先利用了一个递归的、无锚点的proposal模块来生成自适应轨迹锚点,初步预测未来位置、方向,然后是进一步refine初始proposals。
heal/models/task_modules/qcnet/qc_decoder.py
不支持算子替换
cumsum
heal/models/task_modules/qcnet/qc_decoder.py
取余操作
公版代码实现:
参考算法实现:
heal/models/task_modules/qcnet/utils.py
量化精度优化
FourierConvEmbedding
heal/models/task_modules/qcnet/agent_st_module.py
另外, 由于QCNet模型weight init是分算子类型初始化的,embedding改conv后 init weight应当对齐embedding类型,具体为embedding的weight是std=0.02;而且,相对速度,距离等会和角度量一起计算,保持相近的scale更加有利于量化。因此,在预处理时,将position等量输入除以10后输入到模型,相关代码如下:
heal/models/task_modules/qcnet/preprocess.py
训练模块不量化
模型中存在 scale分量只用于计算 loss,建议相关过程不量化,即在其前面插入 Dequanstub,否则会影响 QAT训练。相关代码:
heal/models/task_modules/qcnet/qc_decoder.py
量化配置
首先使用QAT的精度debug工具获取量化敏感节点,然后在Calibration和量化训练时,分别对两个输出的 top120和 top80 的量化敏感节点配置为int16量化;并且在量化训练时固定了激活的 scale,对量化精度更友好。
configs/qcnet_oe_argoverse2/qconfig.py
其它优化
适配流式推理
QCNet存在两种推理方式:
对所有历史帧数据并行encode后送入decode预测下一帧;
按照时序,逐帧encode后,最后一帧将前面encoder的结果拼接后送入decoder的流式推理。
流式推理符合实际部署的逻辑,但推理速度会变慢。但是,实际部署数据按时序逐帧给出,应当采用流式推理方案进行bc模型的推理。

总结与建议
性能优化
在不大幅影响浮点精度的情况下对模型进行适当的裁剪,删除若干 LayerNorm,以及其它算子替换,提升部署效率;
重构 AttentionLayer,将 query、key、相对信息 r的形状均改为四维,对部署更加友好;
性能评估
QCNet模型中存在索引类操作,建议在使用hrt_model_exec工具进行板端性能评测时使用真实数据输入。
附录
- 论文:QCNet
公版模型代码:https://github.com/ZikangZhou/QCNet
参考算法官网(modellabs):https://(待发布)
