# 5.3.2 OCR及其应用

# 知识库

# 5.1.2 计算机视觉处理流程

计算机视觉系统通过图像采集硬件（如相机、镜头、光源等）将光信号转换成图像信号，并传送给图像处理软件；软件根据像素亮度、颜色分布等信息，对目标进行特征提取、分类、检测、跟踪等处理，再输出控制信号或信息。停车场车牌自动识别流程如图5-1所示。流程主要包括数据收集与预处理、图像分割、特征提取与特征表示、模型选择与训练、模型测试与评估、图像分析与解释六个环节。

数据来自摄像机、传感器等，预处理以提高质量和可用性，主要包括对比度增强、图像灰度化、归一化、几何变换和滤波（去噪）。图像分割将图像划分为若干互不重叠、各具灰度、颜色或纹理等特征的区域，从而把目标从背景中分离。基于区域的方法有直方图门限法（仅考虑灰度、忽略空间信息）、区域生长法（能保留空间信息，但可能过度分割）和基于随机场模型法（如MRF）；基于边界的方法有边缘检测法（对噪声敏感）和活动轮廓法（Snake模型，能处理复杂边界，但需合适初始轮廓与迭代策略）。分割难点包括计算复杂度、光照变化、复杂背景与噪声、图像模糊及目标形状复杂或遮挡。

特征提取得到颜色、纹理、形状、边缘、焦点等显著特征，特征表示再转为向量、矩阵等。传统方法依赖专家先验，常见有SIFT（尺度不变特征变换）、SURF（加速稳健特征，更快、适于实时）、HOG（定向梯度直方图，主要用于物体检测）和LBP（局部二值模式，用于纹理分类）。卷积神经网络能自动学习层次化特征并端到端训练。模型选择需明确分类、回归等任务，再从逻辑回归、决策树、随机森林、支持向量机（SVM）、神经网络中筛选；训练集用于训练，验证集用于调整超参数，测试集用于评估最终性能。训练选用SGD、Adam、AdaGrad等优化器和MSE、交叉熵等损失函数，并避免过拟合与欠拟合。测试用准确率、召回率、F1分数评估，不达标则返回调整。图像分析完成分类、检测、跟踪、场景分割；图像解释则进行物体识别、场景理解、行为分析。

## 关键要点
- 采集硬件将光信号转为图像信号，处理软件依据像素亮度、颜色分布等做特征提取、分类、检测、跟踪，并输出控制信号或信息。
- 停车场车牌自动识别流程如图5-1所示。
- 六个环节：数据收集与预处理、图像分割、特征提取与特征表示、模型选择与训练、模型测试与评估、图像分析与解释。
- 预处理主要包括对比度增强、图像灰度化、归一化、几何变换和滤波（去噪）。
- 图像分割划分互不重叠且各具特征的区域；方法含直方图门限法、区域生长法、随机场模型法（如MRF）、边缘检测法、活动轮廓法（Snake）。
- 分割难点：计算复杂度、光照变化、复杂背景与噪声、图像模糊、目标形状复杂或遮挡。
- 传统特征：SIFT、SURF、HOG、LBP；卷积神经网络具有自动特征学习、特征层次化、端到端训练等优点。
- 训练集训练、验证集调超参数、测试集评估最终性能；优化器如SGD、Adam、AdaGrad，损失如MSE、交叉熵。
- 评估常用准确率、召回率、F1分数；选择、训练与测试评估是迭代过程。
- 图像分析面向分类、检测、跟踪、场景分割；图像解释面向物体识别、场景理解、行为分析。
