一句话定义
端侧 AI 推理(Edge Inference) 指把已经训练好的模型部署到离数据产生最近的设备上运行——摄像头、收银一体机、工控盒子、手机等,推理过程不离开设备。
与之相对的是云端推理:设备采集数据后上传服务器,由服务器跑模型,再把结果回传。
它解决什么问题
| 问题 | 端侧推理的回答 |
|---|---|
| 网络不稳/断网 | 断网仍可工作,业务不中断 |
| 数据隐私 | 原始图像不出设备,只输出结果 |
| 响应延迟 | 无网络往返,毫秒级出结果 |
| 带宽成本 | 不需要持续上传视频流 |
| 单点故障 | 无中心服务器,停一个不影响其他 |
典型硬件形态
- Android 设备:手机、平板、安卓收银机,常用 NCNN / TFLite / ONNX Runtime
- ARM 边缘盒子:RK3588、RK3576 等,用 RKNN 走 NPU 加速
- x86 工控机 / PC:ONNX Runtime、OpenVINO
- 国产 AI 芯片服务器:适合多路视频汇聚的大算力场景
什么时候用不上
- 模型极大、设备算力不足,且允许上传(如大语言模型对话)
- 需要跨设备全局聚合分析(如跨门店销量预测)
- 需要频繁换模型且设备端更新成本高
实际上很多业务是端云结合:端侧做实时检测与识别,云端做汇总统计与模型下发。
与「云边端协同」的关系
端侧负责实时性与隐私,边缘服务器负责多路汇聚,云端负责训练、管理与统计。三者分工而非替代。
火眼识别提供端侧视觉引擎与设备管理平台,相关方案见 火眼识别官网。