终于有团队站出来把NPU部署这个事情给做了,因为这个部署极其的麻烦,并且BUG非常多。
2025年3月份我就在高通的设备上面不断的尝试让NPU代替GPU去运行端侧模型和一些量化后的模型,比如GGUF格式。
2025年尝试过非常多的模型,whisper,YOLO,gemma,super-reslution+2025siggrah的模型,等等。
从实际产业端来看的话,需要解决的是端-端的整体的速度和延迟,要不NPU相对nvdia的方案没有太大的优势。
好消息是ISP,A/D,MCU,WIFI等等很多东西高通的芯片是有的。
坏消息是:高通还是那个高通,给所有的工具和套件设置了非常复杂的授权体系,以及普通的开发者是拿不到授权的。
导致虽然高通芯片上面有ISP,并且速度支持的到1080P或者4K的分辨率,能做视频的前处理,但是大家部署项目的时候只能用linux里面的常规算法,用不了chromatix等等工具。
这会导致一个非常严重的问题,就是NPU是很快,算力很大,但是这些节约的时间,全被linux上面那些传统的图像pipeline拖累掉了,因为软件实现的3A算法,白平衡,曝光控制,等等,太慢了。
加上NV的生态很全,工业侧肯定不止一个YOLO,还有其他的功能,都能基本在jetson上面跑下来,导致NPU的优势其实不大。
然后在有这个项目之前,我都是手动去量化模型,然后去部署的,很多模型的视觉模块和LLM里面的MoE又有奇怪的兼容性问题,导致能用NPU的团队极少,门槛也极高。
这个项目很大的推动了NPU的流行。但是需要NPU的场景下,很多时候也需要ISP之类的自定义,导致高通的东西依旧难以部署。

终于有团队站出来把NPU部署这个事情给做了,因为这个部署极其的麻烦,并且BUG非常多。
2025年3月份我就在高通的设备上面不断的尝试让NPU代替GPU去运行端侧模型和一些量化后的模型,比如GGUF格式。
2025年尝试过非常多的模型,whisper,YOLO,gemma,super-reslution+2025siggrah的模型,等等。
从实际产业端来看的话,需要解决的是端-端的整体的速度和延迟,要不NPU相对nvdia的方案没有太大的优势。
好消息是ISP,A/D,MCU,WIFI等等很多东西高通的芯片是有的。
坏消息是:高通还是那个高通,给所有的工具和套件设置了非常复杂的授权体系,以及普通的开发者是拿不到授权的。
导致虽然高通芯片上面有ISP,并且速度支持的到1080P或者4K的分辨率,能做视频的前处理,但是大家部署项目的时候只能用linux里面的常规算法,用不了chromatix等等工具。
这会导致一个非常严重的问题,就是NPU是很快,算力很大,但是这些节约的时间,全被linux上面那些传统的图像pipeline拖累掉了,因为软件实现的3A算法,白平衡,曝光控制,等等,太慢了。
加上NV的生态很全,工业侧肯定不止一个YOLO,还有其他的功能,都能基本在jetson上面跑下来,导致NPU的优势其实不大。
然后在有这个项目之前,我都是手动去量化模型,然后去部署的,很多模型的视觉模块和LLM里面的MoE又有奇怪的兼容性问题,导致能用NPU的团队极少,门槛也极高。
这个项目很大的推动了NPU的流行。但是需要NPU的场景下,很多时候也需要ISP之类的自定义,导致高通的东西依旧难以部署。