当前位置:首页 > 报告详情

互联网多媒体内容分析中的音频处理技术-颜永红-1.pdf

上传人: li 编号:30064 2021-02-08 39页 10.25MB

1、互联网多媒体内容分析中的互联网多媒体内容分析中的 音频处理技术音频处理技术 颜永红颜永红 中科院语言声学与内容理解重点实验室中科院语言声学与内容理解重点实验室 2020.9.62020.9.6 智能时代智能时代 前进中的语言声学前进中的语言声学 第二届全国社会舆情论坛第二届全国社会舆情论坛 2 中国科学院声学研究所中国科学院声学研究所 Institute of Acoustics, CAS v? v? v? ? 3 中国科学院声学研究所中国科学院声学研究所 Institute of Acoustics, CAS 互联网多媒体内容分析难点互联网多媒体内容分析难点 q? ? ? ? q? ? ?

2、? q? q? q? ? 4 中国科学院声学研究所中国科学院声学研究所 Institute of Acoustics, CAS 语音识别语音识别 声纹识别声纹识别 音频音频DNADNA 语音增强语音增强 丰富音频检测丰富音频检测 音频内容理解音频内容理解 语种识别语种识别 音频分析处理音频分析处理 相关技术相关技术 音频音频相关处理技术相关处理技术 5 中国科学院声学研究所中国科学院声学研究所 Institute of Acoustics, CAS 核心技术:语音增强核心技术:语音增强 v需求:语音在产生和传输过程中,易受各种各样的噪声需求:语音在产生和传输过程中,易受各种各样的噪声 干扰,严

3、重影响语音识别等技术的性能,如何从含噪语干扰,严重影响语音识别等技术的性能,如何从含噪语 音中提取尽可能纯净的原始语音?音中提取尽可能纯净的原始语音? v定义:语音增强是指当语音信号被各种各样的噪声干扰定义:语音增强是指当语音信号被各种各样的噪声干扰 、甚至淹没后,从噪声背景中提取有用的语音信号,抑、甚至淹没后,从噪声背景中提取有用的语音信号,抑 制、降低噪声干扰的技术。制、降低噪声干扰的技术。 6 中国科学院声学研究所中国科学院声学研究所 Institute of Acoustics, CAS 背景噪声背景噪声 混响混响 多说话人多说话人 远场麦克风远场麦克风 在现实生活中,很多 语音识别的情景并不 是干净的声学环境。 如右图所示,在一个 会议转录场景下,噪 声、混响、多说话人 始终干扰着识别系统 的正常工作。 短视频的背景场景更是几乎涵盖了生活中碰到的各种情况! 针对这些问题,在语音增

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要介绍了中国科学院声学研究所(Institute of Acoustics, CAS)在互联网多媒体内容分析中的音频处理技术。主要内容包括: 1. 语音增强技术:通过从含噪语音中提取纯净语音,提高语音识别等技术的性能。 2. 音频DNA技术:通过分析处理音频片段,实现音频内容的快速检索。 3. 语种识别技术:通过分析语音片段,判断其属于某个语言种类。 4. 说话人识别技术:根据语音中反映的说话人生理和行为特征,自动识别说话人身份。 5. 语音识别技术:通过对语音信号进行处理转成文字内容。 6. 关键词识别技术:识别输入语音中包含的敏感词语,并定位它们出现的位置。 7. 近期亮点工作:包括音频场景国际比赛第一、研发自主可控的语音信号处理与识别工具包、智能语音能力云平台等。 文章中提到,语音搜索准确率已达到95%以上,一般安静环境下,自然口语对话识别准确率已在85%以上。此外,声学所语音团队在音频场景分类DCASE2019比赛中夺冠,准确率达到85.2%,领先第2名1.4%。
语音增强技术如何提升语音识别性能? 音频DNA检索技术在音频内容分析中的应用有哪些? 说话人识别技术在信息安全领域有哪些应用?
客服
商务合作
小程序
服务号
折叠