跳转到主要内容
术语表人工智能

深度学习

基于多层神经网络的学习方法

返回术语表

深度学习用多层堆叠的神经网络逐层提取特征,从图像、语音和传感器数据中学习复杂模式。它省去了人工设计特征的环节,代价是数据量、算力和推理延迟都显著上升。

深度学习是机器学习的一个分支,特点在于网络的层数。浅层网络需要人先把原始数据加工成有意义的特征,深层网络则通过逐层堆叠自己完成这一步:前几层学边缘和纹理,中间层学局部结构,深层组合出完整的语义概念。这正是它在图像和语音任务上取代传统方法的原因。

代价也很明确。层数增加意味着参数量增加,训练需要的样本量随之上升到数万甚至数十万级别。训练阶段依赖 GPU,推理阶段则要在机器人有限的算力预算内跑起来。一个在服务器上 20 毫秒完成的推理,放到嵌入式平台可能变成 200 毫秒,直接卡死控制周期。

因此边缘部署几乎总要做模型压缩:量化到 INT8、剪枝、蒸馏成小模型。压缩会损失一定精度,需要在部署前用真实数据重新评估,不能拿论文里的指标当验收标准。

工业场景很少从零训练。更常见的做法是拿在大规模数据集上预训练好的网络做微调,样本需求从数万降到数百至数千量级。这也让小批量、多品种的检测任务变得可行。

某风机运维团队用深度学习分析叶片图像识别裂纹。模型在实验室 GPU 上表现优异,但装到巡检无人机的嵌入式模块上后帧率只有 3 fps,无法配合飞行速度。团队把主干网络换成轻量结构并做 INT8 量化,帧率提到 15 fps,检出率下降约 4 个百分点,最终按可接受的漏检率通过验收。

判断一个深度学习方案能否落地,看两个数字就够了:目标硬件上的实际推理延迟,以及压缩后在真实数据上的精度,而不是任何在服务器上跑出来的结果。

实践应用

某风机运维团队用深度学习分析叶片图像识别裂纹。模型在实验室 GPU 上表现优异,装到巡检无人机的嵌入式模块后帧率只有 3 fps,跟不上飞行速度。团队更换轻量主干网络并做 INT8 量化,帧率提升到 15 fps,检出率下降约 4 个百分点,按可接受的漏检率通过验收。

优势

  • 自动学习特征,省去人工设计特征的环节
  • 在图像、语音等高维数据上精度明显优于传统方法
  • 同一套网络结构可通过微调迁移到相近任务
  • 预训练模型降低了小样本场景的启动门槛

局限性

  • 所需样本量通常是数万到数十万级别
  • 推理延迟在嵌入式平台上可能是服务器的十倍,直接卡死控制周期
  • 边缘部署必须做量化或剪枝,精度会随之损失
  • 网络层数越深,出错时越难追溯到具体原因

典型应用领域

视觉检测异常检测语音交互自主系统

常见问题

深度学习和一般机器学习的区别在哪?
区别在网络层数。浅层方法需要人先把原始数据加工成特征,深层网络通过逐层堆叠自己完成特征提取:前几层学边缘纹理,深层组合出语义概念。
深度学习需要多少数据?
从零训练通常需要数万到数十万样本。使用预训练模型做微调可以把需求降到数百到数千量级,这是小样本工业场景的常规做法。
为什么深度学习模型在机器人上要做压缩?
嵌入式平台算力有限,服务器上 20 毫秒完成的推理可能变成 200 毫秒,无法配合控制周期。量化、剪枝和蒸馏是把延迟降下来的常用手段。
验收深度学习方案时该看什么指标?
目标硬件上的实际推理延迟,以及压缩后在真实现场数据上的精度。服务器环境和论文数据集上的结果不能作为验收依据。

仍不确定哪种技术合适?

我们结合您的具体用例梳理这些术语——中立,无营销噱头。

返回术语表