语音识别系统基本结构及分类详解
人与人之间交流,最自然、最直接的方式,大概就是开口说话了。随着科技不断向前发展,人们越来越希望计算机能够听懂人类语言——毕竟,谁不想动动嘴就完成一堆事情呢?这种需求直接推动了语音识别技术的普及。尤其是在深度学习技术大规模落地之后,语音识别的性能实现了质的飞跃,也让这项技术从实验室真正走进了普通用户的
人与人之间交流,最自然、最直接的方式,大概就是开口说话了。随着科技不断向前发展,人们越来越希望计算机能够听懂人类语言——毕竟,谁不想动动嘴就完成一堆事情呢?这种需求直接推动了语音识别技术的普及。尤其是在深度学习技术大规模落地之后,语音识别的性能实现了质的飞跃,也让这项技术从实验室真正走进了普通用户的日常生活。
语音识别技术
自动语音识别技术,简单来说就是让计算机把语音信号自动转换成文字的技术。别小看这个转换过程,它可是机器理解人类语言的第一步,也是最为关键的一步。

语音识别是一门典型的交叉学科,涉及的领域相当广泛:信号处理、模式识别、概率论与信息论、发声机理与听觉机理、人工智能……甚至连人说话时的表情、手势这类体态语言也有关系(毕竟这些动作能帮助对方更好地理解你的意思)。应用场景同样五花八门:比如替代键盘输入的语音输入系统、用于工业控制的语音控制系统,以及服务领域的智能对话查询系统。在信息高度化的今天,语音识别技术及其应用,已经成为信息社会不可或缺的重要组成部分。
语音识别技术的发展历史
语音识别技术的研究,最早可以追溯到20世纪50年代。1952年,AT&T贝尔实验室的Davis团队成功研制出世界上第一个能够识别10个英文数字发音的实验系统——Audry系统。
进入60年代,计算机的应用为语音识别注入了新的动力。这一时期,两大重要研究成果诞生:动态规划(DP)和线性预测分析(LP)。后者较好地解决了语音信号产生模型的问题,对后续发展产生了深远影响。
到了70年代,语音识别领域迎来了突破性进展。Itakura成功将线性预测编码技术(LPC)用于语音识别;Sakoe和Chiba引入动态规划思想,提出了动态时间规整算法,有效解决了语音信号的特征提取和不等长语音匹配问题。同时,矢量量化(VQ)和隐马尔可夫模型(HMM)理论也被提了出来。同一时期,统计方法开始用于解决语音识别的关键问题,这为接下来的非特定人大词汇量连续语音识别技术走向成熟打下了重要基础。
80年代,连续语音识别成为研究重点之一。Meyers和Rabiner研发了多级动态规划语音识别算法(LB)。另一个重要发展是概率统计方法成为主流,其显著标志就是HMM模型在语音识别中的成功应用。1988年,美国卡内基-梅隆大学(CMU)采用VQ/HMM方法实现了997词的非特定人连续语音识别系统SPHINX。这一阶段,人工神经网络在语音识别中也得到了成功应用。
进入90年代,多媒体时代扑面而来,语音识别系统被迫切要求从实验室走向实用。许多发达国家如美国、日本、韩国,以及IBM、Apple、AT&T、NTT等知名公司,都为语音识别系统的实用化开发投入了大量资金。最典型的代表是IBM的ViaVoice和Dragon公司的Dragon Dictate系统。这些系统具备说话人自适应能力,新用户不需要对全部词汇逐一训练,就能在使用中不断提高识别率。
现阶段,美国在非特定人大词汇表连续语音隐马尔可夫模型识别方面占据主导地位,而日本则在连续语音神经网络识别、模拟人工智能进行语音后处理方面处于领先地位。
国内方面,我国在70年代末就开始了语音技术研究,但很长一段时间都处于缓慢发展阶段。直到80年代后期,中科院声学所、自动化所、清华大学、四川大学和西北工业大学等一批科研机构和高校,才纷纷加入研究行列。不过,由于起步晚、基础薄弱,计算机水平也不发达,整个80年代,我国在语音识别研究方面并没有形成自己的特色,也没有取得显著的成果或推出大型、性能优良的实验系统。
进入90年代后,情况开始改观。我国语音识别研究的步伐逐渐追上了国际先进水平。在“八五”、“九五”国家科技攻关计划、国家自然科学基金、国家863计划的支持下,中文语音技术的基础研究方面取得了一系列成果。
比如语音合成技术领域,科大讯飞已经具备国际上最领先的核心技术;中科院声学所在长期积累的基础上,也开发出颇具特色的产品;语音识别技术方面,中科院自动化所具有相当的技术优势;社科院语言所在汉语言学及实验语音科学方面同样积累深厚。不过,这些成果并没有得到很好的应用和产业转化。相反,中文语音技术在技术、人才、市场等方面,正面临着来自国际竞争环境的严峻挑战和压力。
语音识别系统的结构
语音识别系统的基本结构主要包括:语音信号的采样和预处理、特征参数提取、语音识别核心以及识别后处理。下面这张图展示了系统的基本结构。

语音识别的过程,本质上是一个模式识别匹配的过程。首先要根据人的语音特点建立语音模型,对输入的语音信号进行分析并抽取所需特征,在此基础上构建语音识别所需的模式。识别时,根据整体模型,将输入语音信号的特征与已有的语音模式进行比对,通过一定的搜索和匹配策略,找出一系列最优的匹配模式。然后根据模式号的定义查表,最终给出计算机的识别结果。
语音识别系统的分类
按识别对象的不同,语音识别任务大致可分为三类:孤立词识别、关键词识别和连续语音识别。
孤立词识别,任务是识别事先已知的孤立词,例如“开机”、“关机”这类指令;连续语音识别的任务则是识别任意的连续语音,比如一个完整的句子或一段话;关键词检测针对的是连续语音流,但它并不识别全部文字,只检测事先确定的若干个关键词在哪些位置出现,例如在一段话中检测“计算机”、“世界”这两个词。
按发音人来分,可以分为特定人语音识别和非特定人语音识别。前者只能识别一个或几个人的语音,后者则谁都能使用。显然,非特定人语音识别系统更符合实际需求,但实现起来也困难得多。
另外,按语音设备和通道来分,可以分为桌面(PC)语音识别、电话语音识别和嵌入式设备(手机、PDA等)语音识别。不同的采集通道会使人的发音声学特性发生变化,因此需要各自构造专门的识别系统。
语音识别技术类型
目前主流的语音识别技术,主要包括动态时间规整(DTW)、隐马尔可夫模型(HMM)、矢量量化(VQ)、人工神经网络(ANN)、支持向量机(SVM)等。
动态时间规整算法(DTW)
DTW在非特定人语音识别中是一种简单而有效的方法。它基于动态规划思想,解决了发音长短不一的模板匹配问题,属于出现较早、也比较常用的算法。用DTW进行语音识别时,会把经过预处理和分帧的测试信号与参考语音模板进行比较,计算相似度,按照某种距离测度得出两个模板的相似程度,并选择最佳路径。
隐马尔可夫模型(HMM)
HMM是语音信号处理中的一种统计模型,由Markov链演变而来,属于基于参数模型的统计识别方法。它的模式库是通过反复训练形成的,是与训练输出信号吻合概率最大的最佳模型参数,而不是预先储存好的模式样本。识别时,利用待识别语音序列与HMM参数之间的似然概率最大值,找到对应的最佳状态序列作为识别输出。因此,它被公认为较为理想的语音识别模型。

矢量量化(VQ)
矢量量化本质上是一种信号压缩方法。与HMM相比,它主要适用于小词汇量、孤立词的语音识别。具体做法是,把若干个语音信号波形或特征参数的标量数据组成一个矢量,在多维空间进行整体量化。矢量空间被分成若干个小区域,每个小区域找一个代表矢量,量化时只要落在该区域的矢量就用这个代表矢量来替代。矢量量化器的设计,就是从大量信号样本中训练出好的码书,找到好的失真测度定义公式,设计出最佳系统,用最少的搜索和计算失真的运算量实现尽可能大的平均信噪比。
实际应用中,人们还研究出多种降低复杂度的方法,包括无记忆的矢量量化、有记忆的矢量量化和模糊矢量量化。
人工神经网络(ANN)
ANN是20世纪80年代末期提出的一种新方法。它本质上是一个自适应非线性动力学系统,模拟了人类神经活动原理,具有自适应性、并行性、鲁棒性、容错性和学习特性。其强大的分类能力和输入-输出映射能力在语音识别中都很有吸引力。它模拟人脑思维机制,与HMM正好相反——分类决策能力和对不确定信息的描述能力得到公认,但对动态时间信号的描述能力还不够理想。通常MLP分类器只能解决静态模式分类问题,不涉及时间序列处理。尽管学者们提出了许多带反馈的结构,但仍不足以刻画语音信号这类时间序列的动态特性。因此,常把ANN与传统识别方法结合,取长补短来克服各自的缺点。
近年来,结合神经网络和HMM的识别算法研究取得了显著进展,识别率已经接近HMM系统,进一步提高了语音识别的鲁棒性和准确率。
支持向量机(SVM)
SVM是应用统计学理论的一种新学习机模型,采用结构风险最小化原理(SRM),有效克服了传统经验风险最小化方法的缺点。它在兼顾训练误差和泛化能力方面表现出色,在解决小样本、非线性及高维模式识别问题方面具有许多优越性能,已经被广泛地应用到模式识别领域。
语音识别技术的难点及对策
语音识别技术的发展还没有达到完全实用的要求,主要问题表现在以下几个方面:
(1) 自适应问题。 语音识别系统的自适应性差,主要体现在对环境条件的依赖性强。现有的应对方法有倒谱归一化技术、相对谱(RASTA)技术、LINLOG RASTA技术等自适应训练方法。
(2) 噪声问题。 在噪声环境下使用语音识别系统,讲话人会产生情绪或心理上的变化,导致发音失真、发音速度或音调改变,产生Lombard/Loud效应。常用的抑制噪声的方法有谱减法、环境规正技术、修正识别器模型以适应噪声,或者直接建立噪声模型。
(3) 语音识别基元的选取问题。 一般规律是,待识别的词汇量越大,所用基元应该越小越好。
(4) 端点检测。 语音信号的端点检测是语音识别的关键第一步。研究表明,即使在安静环境下,一半以上的识别错误都来自端点检测器。提高端点检测技术的关键在于寻找更稳定的语音参数。
(5) 其他问题。 包括识别速度问题、拒识问题、关键词检测技术(即从连续语音中去除“啊”、“唉”这类语气助词,获得真正待识别的语音部分),以及对用户的错误输入不能正确响应等问题。
语音识别的应用
语音识别可应用的领域大致可以分为五大类:
办公室或商务系统。 典型应用包括填写数据表格、数据库管理和控制、键盘功能增强等等。
制造业。 在质量控制中,语音识别系统可以为制造过程提供一种“不用手”、“不用眼”的检控方式,比如部件检查。
电信。 应用范围相当广泛,包括话务员协助服务的自动化、国际国内远程电子商务、语音呼叫分配、语音拨号、分类订货等。
医疗。 主要应用是通过声音来生成和编辑专业的医疗报告。
其他。 包括由语音控制和操作的游戏和玩具、帮助残疾人的语音识别系统、车辆行驶中一些非关键功能的语音控制(如车载交通路况控制系统、音响系统)等。
随着移动互联网的不断发展,尤其是移动终端小型化、多样化的趋势,语音识别正逐步成为区别于键盘、触屏的人机交互手段之一。随着算法模型和自适应能力的不断提升,可以预见,在未来很长一段时间内,语音识别系统的应用将更加广泛和深入,更多丰富的移动终端语音识别产品将走进人们的日常生活。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:语音识别系统基本结构及分类详解要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
