计算机视觉分析图像和视频,自动识别物体、位置、状态和变化。相比工业视觉,它更侧重开放环境下的语义理解,比如判断走廊上那团东西是纸箱还是蹲着的人。
计算机视觉的目标是从像素中提取语义信息。基本任务包括分类(这是什么)、检测(在哪里)、分割(哪些像素属于它)、跟踪(它怎么动的)和位姿估计(它朝向如何)。机器人系统通常同时用到其中几项。
和在固定工位、固定光照下工作的工业视觉不同,计算机视觉常常要面对不可控的环境:随时间变化的自然光、任意角度、部分遮挡、从未见过的物体类别。这决定了它的算法选择更依赖学习方法,也决定了它的可靠性天然低于受控条件下的测量任务。
在移动机器人上,计算机视觉主要承担三件事:识别可通行区域、检测和分类障碍物、读取环境中的标识(门牌、二维码、货位标签)。深度相机还能同时给出距离,用于避障和抓取。
涉及人的图像处理必须提前处理合规问题。摄像头拍到员工或访客即构成个人数据处理,需要按 GDPR(欧盟通用数据保护条例)确定法律依据、保存期限和访问权限。常见做法是在设备端完成识别、只上传结构化结果、不保留原始图像。
某物流中心在装卸区部署视觉系统监测月台占用状态。法务评估后要求所有画面在边缘设备内处理,仅向 WMS 上传占用与否的布尔值,原始帧 5 秒内销毁。这一约束反过来影响了硬件选型:必须选算力足够的边缘计算盒,而不是把流传到中心服务器。
项目启动时就应把数据合规方案和技术方案放在一起讨论,否则很可能在验收前被迫重做架构。
实践应用
某物流中心在装卸区部署视觉系统监测月台占用状态。法务评估后要求所有画面在边缘设备内完成处理,仅向 WMS 上传占用与否的布尔值,原始帧 5 秒内销毁。这一约束直接改变了硬件选型:必须采购算力足够的边缘计算盒,而不能把视频流传到中心服务器。
优势
- 能在开放环境下识别物体类别、位置和状态
- 深度相机可同时提供距离信息,支持避障与抓取
- 可读取门牌、二维码、货位标签等环境标识
- 边缘处理架构能在满足合规要求的同时保留功能
局限性
- 自然光变化、任意视角和遮挡都会显著影响识别率
- 拍到人员即涉及 GDPR,需要提前确定法律依据和保存期限
- 开放场景下无法穷举物体类别,总会遇到未见过的目标
- 可靠性天然低于受控光照条件下的测量任务
典型应用领域
视觉检测异常检测语音交互自主系统
常见问题
- 计算机视觉能做哪些事?
- 基本任务包括分类、检测、分割、跟踪和位姿估计。机器人系统通常同时用到其中几项,例如识别可通行区域、检测障碍物、读取环境标识。
- 计算机视觉和工业视觉有什么不同?
- 工业视觉在固定工位、固定光照下做重复测量;计算机视觉面对不可控环境——变化的自然光、任意角度、部分遮挡,因此更依赖学习方法,可靠性也更难保证。
- 部署摄像头需要注意哪些合规要求?
- 只要画面可能拍到员工或访客,就构成个人数据处理,需按 GDPR(欧盟通用数据保护条例)确定法律依据、保存期限和访问权限。常见做法是在边缘设备完成识别,只上传结构化结果。
- 合规要求会影响技术方案吗?
- 会,而且影响很直接。要求原始图像不出设备,就必须采购算力足够的边缘计算硬件,无法把视频流集中到服务器处理。这类约束应在项目启动时就纳入方案讨论。