一句话定义

端侧 AI 推理(Edge Inference) 指把已经训练好的模型部署到离数据产生最近的设备上运行——摄像头、收银一体机、工控盒子、手机等,推理过程不离开设备。

与之相对的是云端推理:设备采集数据后上传服务器,由服务器跑模型,再把结果回传。

它解决什么问题

问题 端侧推理的回答
网络不稳/断网 断网仍可工作,业务不中断
数据隐私 原始图像不出设备,只输出结果
响应延迟 无网络往返,毫秒级出结果
带宽成本 不需要持续上传视频流
单点故障 无中心服务器,停一个不影响其他

典型硬件形态

  • Android 设备:手机、平板、安卓收银机,常用 NCNN / TFLite / ONNX Runtime
  • ARM 边缘盒子:RK3588、RK3576 等,用 RKNN 走 NPU 加速
  • x86 工控机 / PC:ONNX Runtime、OpenVINO
  • 国产 AI 芯片服务器:适合多路视频汇聚的大算力场景

什么时候用不上

  • 模型极大、设备算力不足,且允许上传(如大语言模型对话)
  • 需要跨设备全局聚合分析(如跨门店销量预测)
  • 需要频繁换模型且设备端更新成本高

实际上很多业务是端云结合:端侧做实时检测与识别,云端做汇总统计与模型下发。

与「云边端协同」的关系

端侧负责实时性与隐私,边缘服务器负责多路汇聚,云端负责训练、管理与统计。三者分工而非替代。


火眼识别提供端侧视觉引擎与设备管理平台,相关方案见 火眼识别官网。