深度学习如何识别目标
1、物体识别技术
近年来,通过视觉来识别物体的技术发生了巨大的变化。最重要的变化发生于10几年前,机器视觉被基于深度学习的智能视觉迅速替代。在视觉识别和分类的任务中率先使用的卷积神经网络,引发了人工智能的狂飙突进。
传统的机器视觉主要是利用像素邻域的强度关系,来设别图像的边缘和轮廓,再进一步通过形状上下文来识别物体。这种方法的缺点一目了然,难以应对无处不在的光照变化、物体变形和遮挡、以及难以控制的图像噪声等。
智能视觉采用完全不一样的解决思路。它模拟人类的视觉神经元的工作机理,构建从数十万到数亿个参数组成的深度网络。每一个参数表征不同的图像特征,而这些特征的关系构成了对图像的理解,这也是人类视觉理解图像的方式。
与传统机器视觉依靠人类硬编码不同,深度网络需要通过数百万张到数千万张标注图片来习得网络中的参数(有时候也称为权重)。这些权重参数精准复刻了人类视神经识别物体的生物电信号,因此可以像人类的眼睛一样识别各类物体,而无需进行硬编码。
2、深度神经网络
现代的神经网络往往由数量巨大、结构相似的卷积层或其它功能层组成。不同的功能层巧妙组合成可以实现特征提取、分类、图像生成和编解码等特定功能的块。在这些功能块之间又包含了诸多精心设计的反馈和前馈路径,以模仿人类的注意力机制和抽象能力。人们把不断叠加的层看作是网络的深度,这也是现代的神经网络通常被称为深度网络的原因。
也正是这种极度的深度,深度网络包含了图像中不同颗粒度和多变物体中的特征,并将这些特征通过功能块之间的联系综合成一个完整的物体影像。当数以千万计的物体影像被成功记录在深度神经网络中,就塑造出一个可以像人类一样识别各类物体的智能模型。它不仅可以设别出以前看过的物体,甚至可以设别出之前没有见过的物体,比如一个完全是虚拟出来的动物。
3、泛化能力
深度学习的一个令人惊奇的能力是它的泛化能力(通俗地说就是举一反三的能力)。它可以通过学习物体的部分图像,来获取识别这类物体其它图像的能力,即使这些图像它从来没有见过。
这种泛化能力同样来自于深度网络的庞大参数量。比如,我们对深度网络用10万张马的图片进行了训练,当我们给它出示斑马照片时,深度网络就会将图片中的信息与之前学习的能力结合起来,沿着相近的权重参数网络,完成对斑马多种形态的辨识,而无需重新训练,这种能力有时候也被称为迁移。
泛化能力减缓了工业应用中对现场照明、物体种类和异常事件的限制,使得广泛使用智能视觉技术成为可能。在工业机器臂、无人驾驶、人形机器人和自动组装、视觉抓取等诸多领域,都可以看到智能视觉技术的应用。
4、超越人眼极限
经过多年的发展,智能视觉在瞬时图像识别和推理等方面已经超过了人眼的能力,比如实验表明,在0.2~0.5秒内给人类和智能视觉出示相同的图像,智能视觉识别出目标物体的准确率已经超过了人类。更不要说对于大量图片的记忆、数据分析和复现等本来就是计算机强项的任务。
智能视觉技术的快速发展没有停歇,例如基于3D智能视觉的AR/VR,结合大语言模型的长视频生成,以及情感交互等与人类活动紧密交融的领域,始终是人工智能领域里最活跃的研究之一。
毋庸置疑,智能视觉带给了我们前所未有的机遇,那我们是否做好了与它和平相处的准备?
