目录
前言
课题背景和意义
实现技术思路
一、研究内容
二、字幕帧检测算法的研究
三、字幕提取算法的研究
四、视频字幕识别算法的研究
实现效果图样例
最后
前言
📅大四是整个大学期间最忙碌的时光,一边要忙着备考或实习为毕业后面临的就业升学做准备,一边要为毕业设计耗费大量精力。近几年各个学校要求的毕设项目越来越难,有不少课题是研究生级别难度的,对本科同学来说是充满挑战。为帮助大家顺利通过和节省时间与精力投入到更重要的就业和考试中去,学长分享优质的选题经验和毕设项目与技术思路。
🚀对毕设有任何疑问都可以问学长哦!
选题指导: https://blog.csdn.net/qq_37340229/article/details/128243277
大家好,这里是海浪学长毕设专题,本次分享的课题是
🎯基于机器视觉的视频字幕识别系统- OpenCV
课题背景和意义
随着网络视频数据规模的不断扩大,有效的视频检索方式在网络视频数据管理中显得极为紧迫和必要。网络视频检索方式主要有人工添加视频摘要用于检索,或从视频中提取字幕信息用于检索和注释等。由于后者可节约大量人力和物力,因此字幕识别已成为网络视频检索的重要组成部分,无论是新闻视频剪辑、电影、还是广告等视频都含有丰富的图像字幕信息,但因为有些视频中字幕的背景比较复杂的,分辨率较低,绝大多数的视频字幕识别系统不尽人意,如无法精确的检测出字幕区域,文字识别准确率不高等,这就导致视频观看者为了搜索某个视频,而浏览了多个无关视频,浪费了大量时间及精力。字幕作为视频内容的重要内容,为网络视频的检索发挥着重要作用。以前网络视频是用人工添加注释摘要的方法检索、分类。随着视频内容的迅猛发展,信息化彻底改变了工作人员传统添加摘要的方法,字幕识别已成为网络视频添加注释摘要的重要工具。视频字幕识别是指利用计算机将视频中的图像文字识别为纯文本文字的技术,是模式识别应用的一个重要领域。
实现技术思路
一、研究内容
现有的字幕识别主要包括字幕帧检测、字幕提取和字幕识别三个主要部分,视频字幕识别的大致流程如图。
二、字幕帧检测算法的研究
镜头分割算法
在网络上检索视频时,图像帧有可能达到数十万张,甚至数百万张,图像帧数量多是所有视频存在的问题,因为图像帧数量过大,就影响了字幕识别速度,所以还需要先进行镜头分割,然后再字幕帧检测。镜头由一个摄像机镜头连续拍摄一组内在相关的连续帧组成,表现为时空上的一组运动。
1)基于直方图的算法
基于直方图的方法是目前最常用的镜头边缘检测算法之一,最简单的是计算出两帧图像的灰度直方图和颜色直方图。将灰度直方图应用于镜头边界检测当中。该
法利用灰度直方图的差值作为帧间的不相似性测度,获得了较好的镜头边缘检测效果。
2)基于像素差的算法
基于像素差的算法适用于摄像机不发生运动的情况下,可以概括为比较在将图像分割成小图像的这些区域中像素的变化量。四个统计学测度:
4)基于块匹配算法
基于块匹配的基本思想是根据每个块中对应像素的亮度差值进行运动补偿。首先将各帧图像进行分块处理,然后计算所有块之间的不相似值,最后进行归一化处理,得到帧差值。
基于轮廓的算法
为了减轻算法对镜头运动的敏感性,R.Zabhi[20]等人提出了基于轮廓的镜头分割方法,首先采用图像配准技术对整体进行运动补偿,接着采用高斯滤波算法进行处理,去掉一些多余的太过细节的轮廓,从而得到平滑的图像.
三、字幕提取算法的研究
字幕定位算法
字幕定位步骤的主要目的是从字幕帧图像中找到字幕的所在位置,现有的字幕定位方法主要可以分为五大类:基于边缘的方法、基于区域的方法、基于纹理的方法、基于学习的方法和联合定位的方法。
1)基于边缘的定位方法
利用文字具有丰富的边缘这一特点,可以对字幕的所在区域进行定位。首先,利用某种边缘检测算法检测出图像中所有边缘,依据某一小块区域内所含有的像素点个数,用于判断是否为字幕边缘,如果不为字幕边缘,则将其变换为黑色像素;然后利用图像形态学膨胀与腐蚀运算或其他运算,将字幕边缘形成一个连通区域;最后,依据图像的连通区域的轮廓信息,颜色,投影分析等因素,进行文字区域的筛选。
2)基于连通区域的定位方法
一般的新闻,MV 视频的字幕都具有相近的颜色,相近的亮度,针对视频的这一特点,提出了基于连通区域的文字定位方法。首先,利用文字具有相近的颜色和亮度,对字幕图像进行合理的图像分割,得到若干个连通区域;然后利用长,宽,连通域大小等对连通域进行有效的筛选,从而得到字幕区域。
3)基于纹理的定位方法
一般视频或图像中的字幕都具有相同特殊丰富的纹理信息,针对文字的这一特点,提出了通过寻找字幕纹理来定位字幕的方法。
4)基于学习的方法
基于学习的字幕定位方法的基本思想是利用机器学习将图像块分为文字和非文字类。
字幕抽取算法
视频字幕的提取就是将视频序列中需要的文字语义信息部分从复杂的视频背景中抽离出來。文字语义信息提取出来之后,才能继续执行基于信息内容的视频检索和分类。
1)全局阈值二值化
一副字幕图像包括前景(文字)、复杂的背景和噪声,要想从负责的背景中提取出文字,最简单的方法就是全局阈值二值化。
2)局部阈值二值化
局部阈值二值化的方法的基本思想就是给每一块区域设定一个阈值。
四、视频字幕识别算法的研究
字符切割
计算机不能一次性辨认多行或者多个文字,只能一次识别一个文字,所以为了进行字符识别就先要进行字符分割,才能得到单个字符图像。
归一化
因为原始视频的分辨率不一致且文字大小不一,这对于特征提取,文字识别的准确率有很大影响,故先要将大小各异的字符图像转换为统一大小,这个步骤就称之为字符图像大小归一化
利用外边框缩放方法对字符图像“呼”进行大小归一化:

特征提取
1)字符位置特征
位置特征由宽比、高比和上距来描述。字符的位置特征:
2)字符外围轮廓特征
提取轮廓特征的基本思想是:首先计算字形的外接边框,然后,利用提取字符位置特征中的孤立点检测方法进行预处理,再从上边框(下边框)开始,依次对汉字点阵进行扫描,直至碰到黑色像素或下边框(上边框)为止,记录下所经过的像素数。
3)字符区域笔画分布特征
字符区域笔画分布特征提取的基本思想是:首先以字符中心为坐标原点,将四个象限划分为 N 个区域,其中,相同射线所围成的区域算做一个区域,如图:
a1与 a2算做同一个区域,然后,统计黑色像素在每个区域的分布情况,笔画区域分布特征:

字符的方向特征可以表示为一个四元组 D=(d1,d2,d3,d4),可利用公式:

4)字符笔画密度分布特征
字符笔画密度分布特征的基本思想是:首先从字符图像的上边框发射 m 条射线,自上向下进行扫描,对黑白像素交替变化的次数进行统计;然后从字符图像的左边框发射 n 条射线,自左向右进行扫描,对黑白像素交替变化的次数进行统计,如图:
两个字符的相似度S2 为:
若C(i, k) 表示横方向上的字符像素值,则纵方向上的扫描线的 f ( j) 为:
若C(i, k) 表示纵方向上的字符像素值,则横方向上的扫描线的 f ( j) 为:

特征融合
特征融合就是综合采用字符图像的各种统计特征,首先给五个特征向量赋予不同的权重,然后通过上述方法获得当前字符的五个特征向量的值,再将该特征值减去字典中字符对应特征向量的值,并将其差乘以对应的权重,最后再将这些值进行求和,得到当前字符与字典中字符的相似度。
实现效果图样例
剪映识别字幕:


我是海浪学长,创作不易,欢迎点赞、关注、收藏、留言。
毕设帮助,疑难解答,欢迎打扰!
最后
所有评论(0)