跳转到主要内容
术语表人工智能

计算机视觉

让机器理解图像内容

返回术语表

计算机视觉分析图像和视频,自动识别物体、位置、状态和变化。相比工业视觉,它更侧重开放环境下的语义理解,比如判断走廊上那团东西是纸箱还是蹲着的人。

计算机视觉的目标是从像素中提取语义信息。基本任务包括分类(这是什么)、检测(在哪里)、分割(哪些像素属于它)、跟踪(它怎么动的)和位姿估计(它朝向如何)。机器人系统通常同时用到其中几项。

和在固定工位、固定光照下工作的工业视觉不同,计算机视觉常常要面对不可控的环境:随时间变化的自然光、任意角度、部分遮挡、从未见过的物体类别。这决定了它的算法选择更依赖学习方法,也决定了它的可靠性天然低于受控条件下的测量任务。

在移动机器人上,计算机视觉主要承担三件事:识别可通行区域、检测和分类障碍物、读取环境中的标识(门牌、二维码、货位标签)。深度相机还能同时给出距离,用于避障和抓取。

涉及人的图像处理必须提前处理合规问题。摄像头拍到员工或访客即构成个人数据处理,需要按 GDPR(欧盟通用数据保护条例)确定法律依据、保存期限和访问权限。常见做法是在设备端完成识别、只上传结构化结果、不保留原始图像。

某物流中心在装卸区部署视觉系统监测月台占用状态。法务评估后要求所有画面在边缘设备内处理,仅向 WMS 上传占用与否的布尔值,原始帧 5 秒内销毁。这一约束反过来影响了硬件选型:必须选算力足够的边缘计算盒,而不是把流传到中心服务器。

项目启动时就应把数据合规方案和技术方案放在一起讨论,否则很可能在验收前被迫重做架构。

实践应用

某物流中心在装卸区部署视觉系统监测月台占用状态。法务评估后要求所有画面在边缘设备内完成处理,仅向 WMS 上传占用与否的布尔值,原始帧 5 秒内销毁。这一约束直接改变了硬件选型:必须采购算力足够的边缘计算盒,而不能把视频流传到中心服务器。

优势

  • 能在开放环境下识别物体类别、位置和状态
  • 深度相机可同时提供距离信息,支持避障与抓取
  • 可读取门牌、二维码、货位标签等环境标识
  • 边缘处理架构能在满足合规要求的同时保留功能

局限性

  • 自然光变化、任意视角和遮挡都会显著影响识别率
  • 拍到人员即涉及 GDPR,需要提前确定法律依据和保存期限
  • 开放场景下无法穷举物体类别,总会遇到未见过的目标
  • 可靠性天然低于受控光照条件下的测量任务

典型应用领域

视觉检测异常检测语音交互自主系统

常见问题

计算机视觉能做哪些事?
基本任务包括分类、检测、分割、跟踪和位姿估计。机器人系统通常同时用到其中几项,例如识别可通行区域、检测障碍物、读取环境标识。
计算机视觉和工业视觉有什么不同?
工业视觉在固定工位、固定光照下做重复测量;计算机视觉面对不可控环境——变化的自然光、任意角度、部分遮挡,因此更依赖学习方法,可靠性也更难保证。
部署摄像头需要注意哪些合规要求?
只要画面可能拍到员工或访客,就构成个人数据处理,需按 GDPR(欧盟通用数据保护条例)确定法律依据、保存期限和访问权限。常见做法是在边缘设备完成识别,只上传结构化结果。
合规要求会影响技术方案吗?
会,而且影响很直接。要求原始图像不出设备,就必须采购算力足够的边缘计算硬件,无法把视频流集中到服务器处理。这类约束应在项目启动时就纳入方案讨论。

仍不确定哪种技术合适?

我们结合您的具体用例梳理这些术语——中立,无营销噱头。

返回术语表