各位大佬好:
1. 请问在yaml文件中移除尾部的反量化算子之后,自己在CPU上做反量化运行速度会不会更快?
2.地平线采用对称量化,所以zeropoint的数值肯定是0,但是scale的数值是从量化的int8的onnx中自己粘贴复制到代码中去吗,有没有什么办法直接从bin/hbm类型的权重文件中读取,如果有的话,对应的函数接口在哪?
麻烦各位大佬帮忙解答一下,谢谢啦!
各位大佬好:
1. 请问在yaml文件中移除尾部的反量化算子之后,自己在CPU上做反量化运行速度会不会更快?
2.地平线采用对称量化,所以zeropoint的数值肯定是0,但是scale的数值是从量化的int8的onnx中自己粘贴复制到代码中去吗,有没有什么办法直接从bin/hbm类型的权重文件中读取,如果有的话,对应的函数接口在哪?
麻烦各位大佬帮忙解答一下,谢谢啦!
1.是的,通常会更高效,但取决于具体实现方式
在 C++/Python 推理代码中,获取 BPU 输出的 Tensor 数据(通常为 int8 或 int32)。
使用对应的 Scale 值进行线性变换: Float=Int×ScaleFloat = Int \times ScaleFloat=Int×Scale。
利用 SIMD 指令集(如 NEON)优化这段 CPU 代码,速度通常优于通用的 ONNX Runtime 或工具链内置的 CPU 算子