计算机视觉是利用计算机技术模拟人类视觉系统,实现对图像或视频中的物体、场景和行为进行识别、理解和解释的过程。它结合了图像处理、模式识别、机器学习等多个领域的技术,旨在让计算机能够“看”和“理解”视觉信息。简单来说,计算机视觉就是让计算机能够像人一样理解和处理图像和视频内容,“看懂”世界的过程。作为人工智能领域的一个重要分支,计算机视觉技术正在改变生活方式、提升工作效率,并为各行各业带来变革。
理解这一概念,需要抓住三个要点。其一,处理对象既包括静态图像,也包括动态视频。其二,任务并非停留在采集或存储画面,而是对物体、场景和行为进行识别、理解和解释。其三,实现路径是多领域技术的综合:图像处理、模式识别与机器学习共同支撑计算机“看”和“理解”视觉信息。因此,计算机视觉的核心不是“拍下画面”,而是让计算机获得接近人类的视觉理解能力。
按照课程划分,计算机视觉的发展历程依次为萌芽期(20世纪60—70年代)、基础发展期(20世纪80年代)、系统开发期(20世纪90年代)、深度学习兴起期(21世纪初)和跨学科融合期(21世纪20年代至今)。这一脉络表明,该领域由早期探索逐步走向系统化,并在深度学习推动下进入更广泛的应用与多学科交叉阶段。掌握五个阶段的名称与时间范围,是把计算机视觉放到时间轴上理解其演进的基础。
刷脸支付、拍照识物、货物自动分拣、人证合一过安检以及人流量统计,都是计算机视觉落地的直观例子:刷脸支付使购物无须携带卡片,拍照识物把手机变成随时解答疑问的智能助手,自动分拣提高作业效率并降低人工成本,人证合一安检提升速度与安全保障,人流量统计则为商业分析和城市规划提供数据支持。把握概念与发展历程,是后续学习处理流程、基本任务和应用实践的基础。