一项新研究挑战了 INT8 量化在不同硬件平台之间可普遍用于人工智能推理的假设。研究人员发现,INT8 的加速效果在很大程度上取决于特定的 CPU 指令集,某些硬件甚至出现了性能下降而非加速。此外,INT8 的输出在不同平台之间并不一致,当量化比例不是硬件原生支持时,会导致准确性下降。研究得出结论,对于确定性和准确性至关重要的嵌入式和汽车应用而言,“一次量化,随处部署”的方法并不可靠。 AI
影响 挑战了在边缘设备上高效部署 AI 模型的假设,需要针对不同平台进行优化。
排序理由 学术论文,详细介绍了硬件性能和可移植性的测量研究。[lever_c_demoted from research: ic=1 ai=1.0]
- ARM dotprod/SDOT
- ARM Holdings
- DEEPX DX-M1
- INT8
- NVDLA
- NVIDIA Jetson AGX Orin 64GB
- ONNX
- QDQ
- Qualcomm Hexagon HTP
- single-precision floating-point format
- x86
- x86 VNNI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →