报告概述
报告为《人工智能通识》配套课件的第六章,聚焦计算机视觉(视觉感知)领域。内容涵盖计算机视觉的发展历史(从20世纪50年代至今),并详细讲解图像增强、图像分类、目标检测、图像分割和三维视觉五大核心任务。报告介绍了各任务的定义、经典方法(如SRCNN、RetinexNet、R-CNN、FCN、MVSNet等)和前沿进展(如Vision Transformer、NeRF),同时说明了技术在实际中的应用(如人脸识别、自动驾驶、医疗影像)和面临的挑战。适合人工智能初学者和希望系统了解计算机视觉技术体系的学习者。
报告的核心结论
计算机视觉已进入深度学习主导的时代
从2012年AlexNet在ImageNet竞赛中获胜开始,深度学习成为计算机视觉的核心技术。随后,CNN、GAN、Transformer等模型不断推动视觉任务的性能突破,使得图像分类、检测、分割等任务的精度大幅提升,并催生了SAM等通用视觉模型。
图像增强是提升视觉系统可靠性的关键预处理步骤
报告指出,图像在采集过程中常面临光照不足、设备限制和传输干扰等问题,从而影响后续任务。图像增强技术(如超分辨率、低光增强)通过改善图像质量,为医疗、监控、自动驾驶等应用奠定了更可靠的数据基础。
目标检测正向轻量化和自动化标注方向发展
随着移动设备和嵌入式设备的普及,轻量化目标检测算法成为趋势。同时,数据标注的高成本促使自动化标注工具的研究,以降低模型训练的依赖。报告强调,未来需要在实时性和精度之间取得平衡。
图像分割从语义分割迈向全景分割,精度不断提升
图像分割经历了FCN、DeepLab系列等模型的演进,从语义分割发展到实例分割和全景分割。通过编码器-解码器结构、空洞卷积和Transformer等手段,模型能够更精细地解析场景,广泛应用于自动驾驶和医疗影像等领域。
报告回答的关键问题
计算机视觉的主要任务有哪些?
报告指出计算机视觉的核心任务包括图像增强、图像分类、目标检测、图像分割和三维视觉。图像增强改善图像质量;图像分类将图像归入预定义类别;目标检测识别并定位特定目标;图像分割实现像素级分类;三维视觉则推演场景的三维结构。
图像增强有哪些常用方法?
报告介绍了两类图像增强方法:早期方法包括滤波、直方图均衡化、傅里叶变换等时域与频域处理技术;深度学习方法如SRCNN用于超分辨率重建,RetinexNet和Zero-DCE用于低光图像增强。这些方法通过多域协同和多尺度融合提升效果。
目标检测与图像分类有何区别?
报告指出,目标检测不仅需要识别图像中目标的类别,还要输出目标的位置和大小,算法复杂度更高,处理对象是特定目标而非整幅图像。而图像分类仅输出图像整体的类别。两者在输出结果、算法复杂度和处理对象上存在差异。
报告中的代表性数据
ViT在细粒度分类数据集上的准确率
2020年,Vision Transformer(ViT)在CUB-200-2011细粒度鸟类分类数据集上达到90.3%的分类准确率,而改进的TransFG模型达到91.7%。
腾讯觅影青光眼分类模型准确率
资料未明确,腾讯觅影团队研发的基于深度学习的青光眼分类模型,在青光眼筛查中准确率超过95%,显著提高了早期诊断准确性。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 计算机视觉发展历史:从20世纪50年代的二维图像分析,到2010年后的深度学习时代,包含重要里程碑如AlexNet、GAN、ViT、SAM等。
- 图像增强技术详解:包括图像超分辨率(SRCNN、VDSR、RDN)和低光图像增强(RetinexNet、Zero-DCE)的方法原理、结构与应用。
- 图像分类方法:传统方法(SIFT+HOG)与深度学习(AlexNet、VGG、ResNet)的对比,以及细粒度分类的挑战和ViT模型的应用。
- 目标检测经典模型:R-CNN系列(R-CNN、Fast R-CNN)、YOLOv4的结构分析,以及DETR等基于Transformer的单阶段检测方法。
- 图像分割子领域:语义分割、实例分割、全景分割的定义,经典模型(FCN、DeepLab系列)和Transformer分割模型(SETR、SegFormer)。
- 三维视觉任务概览:深度估计(单目、双目、多视图、激光雷达)和三维重建(主动式如激光雷达、结构光,被动式如MVS、NeRF)。
- 实际应用案例:人脸识别在机场安检中的应用、车载摄像头ISP处理器(AliISP)在自动驾驶中的作用、胸部CT新冠肺炎智能评价系统等。
- 未来发展挑战:图像增强的实时性与可解释性、目标检测的轻量化和数据标注自动化、三维视觉的效率与多模态融合等方向。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





