音频信号和声卡

上传人:jiups****uk12 文档编号:38472732 上传时间:2018-05-02 格式:DOC 页数:6 大小:209.50KB
返回 下载 相关 举报
音频信号和声卡_第1页
第1页 / 共6页
音频信号和声卡_第2页
第2页 / 共6页
音频信号和声卡_第3页
第3页 / 共6页
音频信号和声卡_第4页
第4页 / 共6页
音频信号和声卡_第5页
第5页 / 共6页
点击查看更多>>
资源描述

《音频信号和声卡》由会员分享,可在线阅读,更多相关《音频信号和声卡(6页珍藏版)》请在金锄头文库上搜索。

1、第四章 音频信号和声卡4.1 音频编码基础 1、声音信号的特点 基频与音调 频率是指信号每秒钟变化的次数。人对声音频率的感觉表现为音调的高低,在音 乐中称为音高。音调正是由频率 所决定的。音乐中音阶的划分是在频率的对数 坐标(20log)上取等分而得的: 谐波与音色nO 称为 O 的高次谐波分量,也称为泛音。音色是由混入基音的泛音所决定 的,高次谐波越丰富,音色就越有明亮感和穿透力。不同的谐波具有不同的幅值 An 和相位偏移 n ,由此产生各种音色效果。 幅度与音强 人耳对于声音细节的分辨只有在强度适中时才最灵敏。人的听觉响应与强度成对 数关系。一般的人只能察觉出 3 分贝的音强变化,再细分则

2、没有太多意义。我们常用音量来描述音强,以分贝 (dB=20log)为单位。在处理音频信号时,绝对强度可以放大,但其相对强度更有意义, 一般用动态范围定义:动态范围20log(信号的最大强度/信号的最小强度)(dB) 音宽与频带 频带宽度或称为带宽,它是描述组成复合信号的频率范围 2、声音信号的分类多媒体技术中通常处理的是规则声音。规则声音是一种连续变化的模拟信号,可用一 条连续的曲线来表示,称为声波。模拟信号的曲线无论多复杂,在任一时刻 t 都可分解成 一系列正弦波的线性叠加3、音频信号处理方法: 对声音在时间轴和幅度两个方面进行离散化。分别称之为采样和量化采样和量化。根据 Nyquist 采

3、样定理,如果模拟信号的频谱带宽是有限的(假设最高频率为 fm) ,那 么用等于或大于 2fm 的采样频率进行采样所得到的等间隔离散时间序列(采样信号)能够 完全惟一地代表原模拟信号,或者说能够由采样信号恢复出原始信号。 4、音频文件的存储格式 音频数据必须以一定的数据格式存储在磁盘或其它媒体上。目前比较流行的几种格式为: 00)sin()( nnntnAtfa、WAV 文件: WAV 是 Microsoft Windows 本身提供的音频格式,由于 Windows 本身 的影响力,这个格式已经成为了事实上的通用音频格式。 b、mp3 文件:在 mp3 出现之前,一般的音频编码即使以有损方式进行

4、压缩能达到 4:1 的 压缩比例已经非常不错了。但是,mp3 可以实现 12:1 的压缩比例,这使得 mp3 迅速地流 行起来。mp3 之所以能够达到如此高的压缩比例同时又能保持相当不错的音质是因为利用 了知觉音频编码技术,也就是利用了人耳的特性,削减音乐中人耳听不到的成分,同时尝 试尽可能地维持原来的声音质量。 c、RM 文件:互联网大行其道之后,Real Media 出现了。这种文件格式几乎成了网络流 媒体的代名词。RA、RMA 这两个文件类型就是 Real Media 里面向音频方面的。它是由 Real Networks 公司()发明的,特点是可以在非常低的带宽下(低达 28.8kbps

5、)提供足够 好的音质让用户能在线聆听。这一特点在互联网的早期简直是广大网虫的福音。也就是因 为出现了 Real Media 之后,相关的应用比如网络广播,网上教学,网上点播等等才浮出水 面,形成了一个新的行业。网络流媒体的道理其实非常简单,简单说就是将原来连续不断的音频分割成一个一个 带有顺序标记的小数据包,将这些小数据包通过网络进行传递,在接收的时候再将这些数 据包重新按顺序组织起来播放。如果网络质量太差,有些数据包收不到或者延缓了到达, 它就跳过这些数据包不播放,以保证用户在聆听的内容是基本连续的。就是这么简单的道 理,促成了网络上的又一个传奇。 d、其它格式:AVI 等。 5、度量声音的

6、质量:声音质量可以用声音信号的带宽来衡量,等级由高到低依次是:DATCDFMAM数字电话。除此之外度量声音的质量还有两种基本方法:一种是客观 质量度量,主要是用信噪比来度量。另一种是主观度量方法,最常用的是 MOS(平均意见 得分)法。 4.2 音频信号压缩技术 音频压缩技术指的是对原始数字音频信号流(PCM 编码)运用适当的数字信号处理技 术,在不损失有用信息量,或所引入损失可忽略的条件下,降低(压缩)其码率,也称为 压缩编码。它必须具有相应的逆变换,称为解压缩或解码。音频信号在通过一个编解码系 统后可能引入大量的噪声和一定的失真。对音频压缩技术的研究和应用由来已久,如 A 律、 u 律编码

7、就是简单的准瞬时压扩技术,并在 ISDN 话音传输中得到应用。 一般来讲,可以将音频压缩技术分为无损(lossless)压缩及有损(lossy)压缩两大类, 而按照压缩方案的不同,又可将其划分为时域压缩、变换压缩、子带压缩,以及多种技术 相互融合的混合压缩等等。各种不同的压缩技术,其算法的复杂程度(包括时间复杂度和 空间复杂度) 、音频质量、算法效率(即压缩比例) ,以及编解码延时等都有很大的不同。 各种压缩技术的应用场合也因之而各不相同。(1)时域压缩(或称为波形编码)技术是指直接针对音频 PCM 码流的样值进行 处理,通过静音检测、非线性量化、差分等手段对码流进行压缩。此类压缩技术的共同特

8、 点是算法复杂度低,声音质量一般,压缩比小(CD 音质 400kbps) ,编解码延时最短(相 对其它技术) 。此类压缩技术一般多用于语音压缩,低码率应用(源信号带宽小)的场合。 时域压缩技术主要包括 G.711、ADPCM、LPC、CELP,以及在这些技术上发展起来的块 压扩技术如 NICAM、子带 ADPCM(SB-ADPCM)技术如 G.721、 G.722、Apt-X 等。(2)子带压缩技术是以子带编码理论为基础的一种编码方法。子带编码理论最早 是由 Crochiere 等于 1976 年提出的。其基本思想是将信号分解为若干子频带内的分量之和,然后对各子带分量根据其不同的分布特性采取不

9、同的压缩策略以降低码率。通常的子带压 缩技术和下面介绍的变换压缩技术都是根据人对声音信号的感知模型(心理声学模型) ,通 过对信号频谱的分析来决定子带样值或频域样值的量化阶数和其它参数选择的,因此又可 称为感知型(Perceptual)压缩编码。这两种压缩方式相对时域压缩技术而言要复杂得多, 同时编码效率、声音质量也大幅提高,编码延时相应增加。一般来讲,子带编码的复杂度 要略低于变换编码,编码延时也相对较短。由于在子带压缩技术中主要应用了心理声学中的声音掩蔽模型,因而在对信号进行 压缩时引入了大量的量化噪声。然而,根据人类的听觉掩蔽曲线,在解码后,这些噪声被 有用的声音信号掩蔽掉了,人耳无法察

10、觉;同时由于子带分析的运用,各频带内的噪声将 被限制在频带内,不会对其它频带的信号产生影响。因而在编码时各子带的量化阶数不同, 采用了动态比特分配技术,这也正是此类技术压缩效率高的主要原因。在一定的码率条件 下,此类技术可以达到“完全透明”的声音质量(EBU 音质标准) 。子带压缩技术目前广泛应用于数字声音节目的存储与制作和数字化广播中。典型的 代表有著名的 MPEG-1 层、层(MUSICAM) ,以及用于 Philips DCC 中的 PASC(Precision Adaptive Subband Coding,精确自适应子带编码)等。(3)变换压缩技术与子带压缩技术的不同之处在于该技术对

11、一段音频数据进行 “线性”的变换,对所获得的变换域参数进行量化、传输,而不是把信号分解为几个子频 段。通常使用的变换有 DFT、DCT(离散余弦变换) 、MDCT 等。根据信号的短时功率谱 对变换域参数进行合理的动态比特分配可以使音频质量获得显著改善,而相应付出的代价 则是计算复杂度的提高。变换域压缩具有一些不完善之处,如块边界影响、预回响、低码率时声音质量严重 下降等。然而随着技术的不断进步,这些缺陷正逐步被消除,同时在许多新的压缩编码技 术中也大量采用了传统变换编码的某些技术。有代表性的变换压缩编码技术有 DolbyAC-2、AT&T 的 ASPEC(Audio Spectral Perc

12、eptual Entropy Coding) 、PAC(PerceptualAudioCoder)等。 几种基本的编码方法: 脉冲编码调制,增量调制,自适应脉冲编码调试,差分脉冲编码调试,自适应差分脉冲 编码调试,子带编码。 4.3 音频编码标准 1、G.711 本建议公布于 1972 年,它给出话音信号编码的推荐特性。话音的抽样率为 8000Hz,允 许偏差是50ppm(Parts Permillion)。每个样值采用 8 位二进制编码。使用 A 律和 律非 线性量化技术。速率为 64kbps,主要用于公用电话网中。 2、G.722 G.722 建议的带宽音频压缩仍采用波形编码技术,因为要保

13、证既能适用于话音,又能用 于其他方式的音频,只能考虑波形编码。G.722 编码采用了高低两个子带内的 ADPCM 方 案,高低子带的划分以 4KHz 为界。然后再对每个子带内采用类似 G.721 建议的 ADPCM 编码,因此 G.722 建议的技术方案可以简写为 SB-ADPCM(子带-自适应差分脉冲码调制) 。 速率为 64kbps。主要用于视听多媒体和会议电话。3、G723.11996 年,CCITT(国际电报电话咨询委员会)通过了 G723.1 标准用于多媒体传输 的 5.3kbps 或 6.3kbps 双速率语音编码。采用多脉冲激励最大似然量化算法。 4、G.728 为了进一步降低压

14、缩的速率,CCITT 于 1992 年制定了 G.728 标准,是用基于低时延码 本激励线性预测编码算法,速率为 16kbps,主要用于公共电话网中。 5、G.729 1996 年制定,使用 8kbps 共轭结构代数码激励线性预测算法,此标准用于无线移动网, 数字多路复用系统和计算机通信系统中。6、MP3 压缩技术 MP3 是一种音频压缩的国际技术标准。MP3 格式开始于二十世纪 80 年代中期,在德国 夫朗和费研究所(Fraunhofer Institute)开始的,研究致力于高质量、低数据率的声音编码。1989 年,夫朗和费研究所在德国被获准取得了 MP3 的专利权,几年后这项技术被提交

15、到国际标准组织(ISO),整合进入了 MPEG-1 标准。 MP3 格式是一个让音乐界产生巨大震动的一个声音格式。MP3 的全称是 Moving Picture Experts Group, Audio Layer 3,它所使用的技术是在 VCD(MPEG-1)的音频压缩技术上发 展出的第三代,而不是 MPEG-3。 MPEG 代表的是 MPEG 活动影音压缩标准,MPEG 音频文件指的是 MPEG 标准中的声 音部分即 MPEG 音频层。MPEG 音频文件根据压缩质量和编码复杂程度的不同可分为三层 (MPEG AUDIO LAYER 1/2/3 分别与 MP1、MP2 和 MP3 这三种声音

16、文件相对应) 。 MPEG 音频编码具有很高的压缩率,MP1 和 MP2 的压缩率分别为 4:1 和 6:1-8:1,而 MP3 的压缩率则高达 10:112:1,也就是说一分钟 CD 音质的音乐未经压缩需要 10MB 存 储空间,而经过 MP3 压缩编码后只有 1MB 左右,同时其音质基本保持不失真。 音乐信号中有许多冗余成分,其中包括间隔和一些人耳分辨不出的信息(如混杂在较强 背景中的弱信号) 。MP3 为降低声音失真采取了名为“感官编码技术”的编码算法:编码时 先对音频文件进行频谱分析,然后用过滤器滤掉噪音,接着通过量化的方式将剩下的每一 位打散排列,最后形成具有较高压缩比的 MP3 文件,并使压缩后的文件在回放时能够达到 比较接近原音源的声音效果。虽然它是一种有损压缩,但是它的最大优势是以极小的声音 失真换来了较高的压缩比。 4.4 声卡的组成和工作原理 声卡的基本构造:一般的声卡都是由声音控制/处理芯片、功放芯片、声音输入/输出端 口几部分组成。在自然界我们所听到的声音都是经由空气或一些介质所传播的

展开阅读全文
相关资源
相关搜索

当前位置:首页 > 行业资料 > 其它行业文档

电脑版 |金锄头文库版权所有
经营许可证:蜀ICP备13022795号 | 川公网安备 51140202000112号