信息技术 虚拟现实内容表达 第3部分- 音频_第1页
信息技术 虚拟现实内容表达 第3部分- 音频_第2页
信息技术 虚拟现实内容表达 第3部分- 音频_第3页
信息技术 虚拟现实内容表达 第3部分- 音频_第4页
信息技术 虚拟现实内容表达 第3部分- 音频_第5页
已阅读5页,还剩342页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ICS35.040GB/TXXXXX.3—XXXX

L71

中华人民共和国国家标准

GB/TXXXXX.3—XXXX

信息技术虚拟现实内容表达

第3部分:音频

Informationtechnology–Virtualrealitycontentrepresentation–Part3:Audio

(征求意见稿)

(本稿完成日期:2023-1-17)

在提交反馈意见时,请将您知道的相关专利连同支持性文件一并附上。

××××-××-××发布××××-××-××实施

I

GB/TXXXXX.3—XXXX

前言

本文件按照GB/T1.1—2020《标准工作化导则第1部分:标准化文件的结构和起草规则》的规定

起草。

本文件是GB/TXXXXX《信息技术虚拟现实内容表达》的第三部分。GB/TXXXXX已经发布了

以下部分:

——第2部分:视频。

本文件由全国信息技术标准化技术委员会(SAC/TC28)提出并归口。

本文件起草单位:清华大学、北京理工大学、中国电子技术标准化研究院、北京字跳网络技术有

限公司、赛因芯微(北京)电子科技有限公司、北京全景声信息科技有限公司、中关村视听产业技术创

新联盟、清华大学天津电子信息研究院、北京大学、咪咕文化科技有限公司、腾讯科技(深圳)有限公

司、北京爱奇艺科技有限公司、小米通讯技术有限公司、全景声(北京)智能科技有限公司、华为技

术有限公司、中国传媒大学。

本文件主要起草人:王晶、窦维蓓、耿一丹、朱博成、李婧欣、黄传增、柳德荣、吴健、吴强、

许舒敏、潘兴德、曲天书、李岳鹏、商世东、王志航、刘长韬、黄为庆、刘孟美、赵天博、韩泽瑞、

王宾、韩建、李琳、徐嵩、王喆、高原、靳聪、张伟民、高文、黄铁军。

III

引言

随着虚拟现实(VR)技术的不断涌现,虚拟现实已成为增强沉浸感的新兴媒体形式,VR

音频内容表达与渲染重建技术在虚拟现实沉浸感、真实感体验中占有重要地位。目前虚拟现

实全景视频技术已经受到广泛关注和重视,但是由于缺乏VR音频内容表达和渲染重建的技

术规范,难以实现各种VR音频采集制作与终端回放设备或系统间的互通共享。本标准在遵

循ITU-RBS.2076-2规范的前提下,面向适应我国全景音频播出、沉浸式音频通信、虚拟现

实音频交互等领域,提供虚拟现实音频内容的元素定义、编码规范和渲染重建建议,服务于

虚拟现实(VR/AR/MR/XR)设备和相关系统中的音频应用。GB/TXXXXX旨在确立VR音频

元数据系统和渲染系统之间的协同关系,以及VR音频元数据流与音频流之间的可能的复接

模式,形成VR音频内容表达的互联互通应用规范,支持3DoF和6DoF等虚拟现实场景下,

涉及基于声道、对象、场景三类信号的采集制作和渲染重建。本标准设计了音频元数据系统、

音频编解码系统和VR音频渲染系统之间的解耦合架构,三个系统之间既相互独立,又紧密

配合,形成VR音频内容表达的应用规范。本标准将对VR音频坐标系、元数据系统、渲染

器系统、AVS音频元数据串行流封装格式进行规范。

本文件的发布机构提请注意,声明符合本文件时,可能涉及到如下52项专利的使用。

其中,可能涉及到第6、7、9、10章及附录相关的专利名称如下:

PCT/CN2021/100076,音频渲染系统、方法和电子设备;PCT/CN2022/098882,音频渲

染系统、方法和电子设备;PCT/CN2021/100062,用于音频渲染的音频信号编码方法、装置

和电子设备;PCT/CN2022/098850,音频渲染系统、方法和电子设备;PCT/CN2021/114366,

一种3D音频元数据系统;PCT/CN2022/114219,音频信号的处理方法和装置;

PCT/CN2021/121135,声音路径能量的淡入淡出方法、电子设备和介质,PCT/CN2022/122204,

音频渲染方法、音频渲染设备和电子设备;PCT/CN2021/121718,一种动态估计场景近似长

方体房间的方法;PCT/CN2022/122635,一种音频渲染系统和方法;PCT/CN2021/104309,

混响时长的估计方法、音频信号的渲染方法和电子设备;PCT/CN2022/103312,音频信号的

渲染方法、装置和电子设备;PCT/CN2021/115130,用于音频渲染的信号处理方法、装置和

电子设备;PCT/CN2022/115194,用于音频渲染的信号处理方法、装置和电子设备;

PCT/CN2021/121729,用于空间音频渲染的系统、方法和电子设备;PCT/CN2022/122657,

用于空间音频渲染的系统、方法和电子设备;202110984837.4,一种音频制作模型和生成方

法、电子设备及存储介质;202111102045.6,音频节目元数据和产生方法、电子设备及存储

介质;202111100818.7,音频内容元数据和产生方法、电子设备及存储介质;202111102038.6,

音频对象元数据和产生方法、电子设备及存储介质;202111205630.9,音轨唯一标识元数据

和生成方法、电子设备及存储介质;202111204386.4,一种音频轨道元数据和生成方法、电

子设备及存储介质;202111202898.7,一种音频流元数据和生成方法、电子设备及存储介质;

202111308422.1,基于音床音频包格式元数据和产生方法、设备及介质;202111308430.6,

基于对象音频包格式元数据和产生方法、设备及介质;202111306844.5,基于场景音频包格

式元数据和产生方法、设备及存储介质;202111308421.7,基于双耳音频包格式元数据和产

生方法、设备及介质;202111021068.4,基于音床音频通道元数据和生成方法、设备及存储

IV

GB/TXXXXX.3—XXXX

介质;202111020417.0,基于对象音频通道元数据和生成方法、设备及存储介质;

202111021066.5,基于场景音频通道元数据和生成方法、设备及存储介质;202111021039.8,

基于双耳音频通道元数据和生成方法、设备及存储介质;202111666346.1,一种广播音频格

式文件生成方法、装置、设备及存储介质;202111666362.0,音频元数据区块的生成方法、

装置、设备及存储介质;202210588174.9,生成渲染器内部数据结构的方法、装置、设备及

存储介质;202210634563.0,利用元数据对基于音床的音频进行渲染的方法及装置;

202210762912.7,共享渲染器组件的配置方法、装置、设备及存储介质;202210760302.3,

一种音床渲染项数据映射方法、装置、设备及存储介质;202210603204.9,一种渲染器的渲

染项确定方法、装置、设备及存储介质;202210600880.0,一种音床输出渲染项确定方法、

装置、设备及存储介质;202210603208.7,一种对象输出渲染项确定方法、装置、设备及存

储介质;202210603212.3,一种场景输出渲染项确定方法、装置、设备及存储介质;

202210603184.5,音频渲染器的渲染项处理方法、装置、设备及存储介质;202210608202.9,

一种场景渲染项数据映射方法、装置、设备及存储介质;202210782056.1,一种音频渲染器

增益计算方法、装置、设备及存储介质;202210910129.0,用于对象渲染器的元数据解析方

法、装置、设备及介质;202210907370.8,利用元数据对基于对象的音频进行渲染的方法及

装置;202210912275.7,利用元数据对基于场景的音频进行渲染的方法及装置;

202211057713.2,利用元数据对基于对象的音频进行渲染的方法及装置;202211063746.8,

利用元数据对基于场景的音频进行渲染的方法及装置;ZL201510795213.2,一种3D录音系

统球面麦克风阵列分布方法;CN112312298A,音频播放方法及装置、电子设备和存储介质;

202210451743.5,一种音频处理方法、装置、电子设备和可读存储介质。

本文件的发布机构对于该专利的真实性、有效性和范围无任何立场。

该专利持有人已向本文件的发布机构保证,他愿意同任何申请人在合理且无歧视的条款

和条件下,就专利授权许可进行谈判。该专利持有人的声明已在本文件的发布机构备案,相

关信息可以通过以下联系方式获得:

联系人:黄铁军(数字音视频编解码技术标准工作组秘书长)

通讯地址:北京大学理科2号楼2641室

邮政编码:100871

电子邮件:tjhuang@

电话:+8610-62756172

传真:+8610-62751638

网址:

请注意除上述专利外,本文件的某些内容仍可能涉及专利。本文件的发布机构不承担识

别这些专利的责任。

5

GB/TXXXXX.3—XXXX

信息技术虚拟现实内容表达第3部分:音频

1范围

本文件规定了虚拟现实(VirtualReality,VR)设备及相关系统中的沉浸式音频内容的表

达方式,提出了包括元数据(Metadata)和渲染器(Render)的系统构架及接口规范。

本文件适用于多种类型的音频采集、传输、回放系统,其中采集方式包括基于声道

(Channel)、基于对象(Object)、基于场景(Scene)或它们的混合形式,传输方式包括

面向广播信道、影视制作、互联网等多个场景下的传输协议和多种音频编解码方式,回放方

式主要包括双耳和扬声器两大类,双耳渲染分为面向3DoF和6DoF两种形式。当涉及音频编

解码格式选择时,既可按照ITU-RBS.2388-4选择PCM或其他国际通用音频编码格式,

也可选用GB/T33475.3或AVS3-P3音频编码格式。

本文件适用于全景音频录播、沉浸式音频通信、虚拟现实音频交互等领域。

2规范性引用文件

下列文件对于本文件的应用是必不可少的。凡是注日期的引用文件,仅所注日期的版本

适用于本文件。凡是不注日期的引用文件,其最新版本(包括所有的修改单)适用于本文件。

GB/T5271.1信息技术词汇第1部分:基本术语(GB/T5271.1-2000eqvISO/IEC2382-1:

1993)

GB/T5271.4信息技术词汇第4部分:数据的组织(GB/T5271.4-2000eqvISO/IEC2382-4:

1987)

GB/T5271.9信息技术词汇第9部分:数据通信(GB/T5271.9-2001eqvISO/IEC2382-9:

1995)

GB/T33475.3信息技术高效多媒体编码第3部分:音频

GB/T17191信息技术具有1.5Mbit/s数据传输率的数字存储媒体运动图像及其伴音的

编码

GB/T17975.1信息技术运动图像及其伴音信息的通用编码第1部分:系统

GY/T316用于节目制作的先进声音系统

ITU-RBS.2076Audiodefinitionmodel(音频元数据定义)

ITU-RBS.2051Advancedsoundsystemforprogrammeproduction(扬声器位置规范)

ITU-RBS.2088Long-formfileformatfortheinternationalexchangeofaudioprogramme

materialswithmetadata(BW64格式定义)

ITU-RBS.2388UsageGuidelinesfortheAudioDefinitionModelandMultichannelAudio

Files(音频元数据和多声道文件使用指南)

ITU-RBS.1770Algorithmstomeasureaudioprogrammeloudnessandtrue-peakaudiolevel

(音频节目响度和真实峰值的测量算法)

AES69:AESstandardforfileexchange-Spatialacousticdatafileformat(SOFA标准规范)

3术语和定义

6

GB/TXXXXX.3—XXXX

GB/T5271.1、GB/T5271.4、GB/T5271.9和GB/T33475.3中的界定以及下列术语和定义

适用于本文件。

3.1

3自由度3DoF

用户以三维空间的一个点为中心在横摇(Roll)、纵摇(Pitch)和垂摇(Yaw)三个方

式下进行自由旋转。

3.2

6自由度6DoF

用户在3DoF的基础上加上在X、Y和Z轴三个方向的自由平移。

3.3

全景音频panoramicaudio

能够提供3DoF自由度全方位听觉体验的空间音频。

3.4

沉浸式音频immersiveaudio

能够提供6DoF自由度沉浸感的空间音频。

3.5

互动音频interactiveaudio

特定空间场景下的用户间交互和用户与场景内声源物体的交互,使用元数据呈现。

3.6

元数据metadata

描述与虚拟现实音频内容表达相关的数据。

3.7

基础元数据basicmetadata

引用ITU-RBS.2076-2(10/2019)中定义的AudioFormatExtended所包含的所有ADM元素。

3.8

扩展元数据extendedmetadata

不包含在ITU-RBS.2076-2(10/2019)中的ADM元素。

3.9

静态元数据staticmetadata

7

GB/TXXXXX.3—XXXX

与音频内容结构相关的在一定时间段内固定不变的元数据。

3.10

动态元数据dynamicmetadata

与音频内容状态相关的随时间变化的元数据。

3.11

空间音频渲染spatialaudiorendering

用于双耳耳机或扬声器输出虚拟现实音频信号采用的信号处理过程。

3.12

双耳渲染binauralrendering

用双耳耳机呈现虚拟现实音频信号所采用的信号处理过程。

3.13

扬声器渲染loudspeakerrendering

用一组扬声器呈现虚拟现实音频信号所采用的信号处理过程。

3.14

混响reverberation

在声源停止发声后,声音在空间内继续存在,并经过多次反射和吸收,最后才消失的声

学现象。

3.15

动态混响dynamicreverberation

跟随听者的移动产生不同混响效果的信号处理过程。

3.16

房间脉冲响应roomimpulseresponse

从声源到房间中某场点的脉冲响应。

3.17

采样混响samplingreverberation

使用在现实中采集房间脉冲响应产生混响效果的信号处理过程。

3.18

人工混响artificialreverberation

使用合成脉冲序列产生混响效果的信号处理过程。

8

GB/TXXXXX.3—XXXX

3.19

头相关传输函数headrelatedtransferfunction(HRTF)

自由场情况下从点声源到双耳的频域声学传输函数。

3.20

头相关脉冲响应headrelatedimpulseresponse(HRIR)

自由场情况下从点声源到双耳的脉冲响应,是HRTF在时域的等价表示。

3.21

场景信号scenesignal

基于一/高阶环境声学技术所获取的音频信号。

3.22

场景信号编码scenesignalcoding

读入场景信号,并产生编码位流的过程。

3.23

声音对象soundobject

被感知为一个整体的声音或由一个声源发出的独立于环境的声音。

3.24

一阶/高阶环境声学技术FOA/HOA

基于Ambisonics原理的可以准确捕获和再现三维音频声场的技术。

3.25

空间编码spatialcoding

将多个通道的音频信号变换成携带空间信息的FOA/HOA格式的音频信号的处理过程。

4符号和缩略语

本文件采用的符号定义同GB/T33475.3定义。本文件中使用的数学运算符和优先级与C

语言使用的类似。但对整型除法进行了特定的定义。除特别说明外,约定编号和计数从0开

始。

4.1算术运算符

下列算术运算符适用于本文件。

:=定义符号。a:=y表示定义为y的一个名字。

+加

9

GB/TXXXXX.3—XXXX

-减(二元运算符)或取反(一元前缀运算符)

×乘

ab幂,表示a的b次幂,也可表示上标。

幂

/整数除法,结果向0取整。例如,7/4和-7/-4取整为1,-7/4和7/-4取整为

-1。

a

除法运算,不做取整或四舍五入。

b

绝对值|x|=x当x>0

|||x|=0当x=0

|x|=-x当x<0

abs绝对值

x平方根

sprt平方根

b

f(i)自变量i取由a到b(含b)的所有整数值时,函数f(i)的累加和。

ia

log10以10为底的对数

ln以e为底的对数

exp以自然常数e为底的指数函数

sin正弦函数

cos余弦函数

atan2求y/x(弧度表示)的反正切值

hypot计算直角三角形的斜边长

AlegendreAssociatedLegendrepolynomials伴随勒让德多项式

size获取矩阵的行数和列数

4.2逻辑运算符

下列逻辑运算符适合于本文件。

||逻辑或

&&逻辑与

10

GB/TXXXXX.3—XXXX

!逻辑非

4.3关系运算符

下列关系运算符适用于本文件。

>大于

>=大于或等于

<小于

<=小于或等于

==等于

不等于

min[,……,]参数表中的最小值

4.4位运算符

下列位运算符适用于本文件。

&与

4.5赋值

下列赋值运算适用于本文件。

=赋值运算符

++自加,x++相当于x=x+1。当用于数组下标时,在自加运算前先求变量值。

+=自加指定值,例如,x+=3相当于x=x+3,x+=(-3)相当于x=x+(-3)。

-=自减指定值,例如,x-=3相当于x=x+(-3),x-=(-3)相当于x=x–(-3)。

4.6助记符

下列助记符适用于本文件。

bslbf位串,左位在前,这里“左”是按GB/T17191中写的位串的顺序。位串

是带单引号的1和0串。如‘10000001’。位串内的空格是便于阅读的,

无特殊意义。(bitstreamleftbitfirst)

uimsbf无符号整数,最高有效位优先。(unsignedinteger,mostsignificantbit

first)

tcimsbf二进制补码整数,最高有效位优先。(two’scomplementinteger,most

significantbitfirst)

4.7缩略语

下列缩略语适用于本文件。

3DoF3自由度(3DegreeofFreedom)

6DoF6自由度(6DegreeofFreedom)

AAMSFAVS音频元数据串行流格式(AvsAudioMetadataSequentialFormat)

语法结构

ACN空间环绕声通道数(AmbisonicChannelNumber)

ADM音频定义模型(AudioDefinitionModel)

AES音频工程协会(AudioEngineeringSociety)

AGC自动增益控制(AutomaticGainControl)

AllRAD全向空间解码器(AllRoundAmbisonicDecoder)

11

GB/TXXXXX.3—XXXX

API应用程序编程接口(ApplicationProgrammingInterface)

ARIR空间房屋脉冲响应(AmbisonicRoomImpulseResponse)

AVS数字音视频编解码技术标准(AudioVideocodingStandard)

BRIR双耳房屋脉冲响应(BinauralRoomImpulseResponse)

BW6464位广播波文件(BroadcastWave-64bit)

DFT离散傅里叶变换(DiscreteFourierTransform)

DoF自由度(DegreesofFreedom)

DRC动态范围控制(Dynamicrangecontrol)

EPAD能量无损的空间解码器(EnergypreservedAmbisonicDecoder)

EQ均衡器(Equalization)

FFT快速傅立叶变换(FastFourierTransform)

FIR有限长单位冲激响应(FiniteImpulseResponse)

FOA一阶球谐函数信号(FirstOrderAmbisonic)

HOA高阶球谐函数信号(HigherOrderAmbisonic)

HRIR头相关脉冲响应(HeadRelatedImpulseResponse)

HRTF头相关传输函数(HeadRelatedTransferFunction)

IDFT离散傅里叶逆变换(InverseDiscreteFourierTransform)

IR冲激响应(ImpulseResponse)

ILD双耳声强差(InterauralLevelDifference)

ITD双耳时间差(InterauralTimeDifference)

LC低复杂度(LowComplexity)

MMD模型匹配解码器(ModeMatchingDecoder)

MO-BRIR多方位双耳房屋脉冲响应(MultioritentionBianauralRoomImpulse

Response)

N3D三维归一化谐波(NormalizedHarmonicsof3-Dimensions)

PCM脉冲编码调制(PulseCodeModulation)

PSP点源声像平移定位(PointSourcePanner)

RIR双耳房屋冲击响应(RoomImpulseResponse)

SAD采样空间解码器(SamplingAmbisonicDecoder)

SN3D三维半归一化谐波(Semi-NormalizedHarmonicsof

3-Dimensions)

SNR信噪比(SignaltoNoiseRatio)

SOFA面向空间的声学格式(SpatiallyOrientedFormatforAcoustics)

VBAP基于矢量的振幅平移(Vector-BaseAltitudePanning)

VR虚拟现实(VirtualReality)

VREXT虚拟现实扩展元数据(VirtualRealityExtendedMetadata)

XML可扩展标记语言(ExtensibleMarkupLanguage)

5串行流语法规则

本文件采用的串行流语法规则参考GB/T33475.3中位流语法规则的定义。串行流描述

VR音频元数据及其他辅助信息的串行封装结构。串行流中的每一个数据项用黑体。通过名

字、按比特位的长度及其类型和串行传输顺序的助记符来描述。

12

GB/TXXXXX.3—XXXX

串行流中被解封装的数据元素所导致的操作依赖于该数据的值及以前解封装的数据元

素。下面的语法结构表示数据元素以标准类型出现时的情形。

注1:如无特殊说明,本部分中的“比特位”指二进制位。

注2:本部分语法用“C”代码规定,变量或表达式为非零值时等价于条件为真,变量或表达式为零值时

等价于条件为非真。

while(condition){

dataElement

…

}

若条件为真,则数据元素组紧接着数据流产生,如此重复直到条件为非真。

do{

dataElement

…

}while(condition)

若条件为真,则数据元素组紧接着数据流产生,如此重复直到条件为非真。

if(condition){

dataElement

…

}else{

dataElement

…

}

若条件为真,在数据流中产生第一组数据元素,若条件为非真,在数据流中产生第二组

数据元素。

for(expr1;expr2;expr3){

dataElement

…

}

expr1是指定循环初始状态表达式,通常它指定了计数器的初始状态,expr2是指定的每

次循环前的测试条件。条件为非真时循环终止,expr3是每次循环结束时执行的表达式,一

般是增加计数器。

注3:本结构的最通常用法为

for(i=0;i<n;i++){

dataElement

…

}

数据元素组产生n次。数据元素组内的条件结构可能依赖循环控制变量i的值。第一次出

现时被置为‘0’,第二次增加到‘1’,如此往复。

switch(expr){根据表达式expr的值,产生对应的数据元素。expr的值为

caseconstcase1:constcase1时产生数据元素dataElement1,expr的值为

dataElement1constcase2时产生数据元素dataElement2,以此类推,expr的值

break为constcasen时产生数据元素dataElementn。当expr的值不等于

caseconstcase2:constcase1,constcase2,…,constcasen中的任何一个值时,产生

dataElement2数据元素dataElementDefault

13

GB/TXXXXX.3—XXXX

break

…

caseconstcasen:

dataElementn

break

default:

dataElementDefault

break

}

本结构的一类变体是在case后不出现break,如

switch(expr){expr的值constcasex时,从对应的caseconstcasex开始产生数

caseconstcase1:据元素,直到break出现。

dataElement1expr的值constcase1时产生数据元素dataElement1和

caseconstcase2:dataElement2,expr的值为constcasen时产生数据元素

dataElement2dataElementn

break

…

caseconstcasen:

dataElementn

break

default:

dataElementDefault

break

}

注4:数据元素组中可能含有嵌套结构。为简便起见,当后面只有一个数据元素时“[]”省略。

dataElement[]dataElement是一数组数据,数据元素的个数由上下文而定;

dataElement[n]dataElement[n]是数组数据的第n+1个元素;

dataElement[m][n]dataElement[m][n]是二维数组的第m+1,n+1个元素;

dataElement[l][m][n]dataElement[l][m][n]是三维数组的第l+1,m+1,n+1个元素;

dataElement[m…n]dataElement[m…n]是位m到位n之间包括的位。

6虚拟现实音频内容表达系统框架

6.1概述

虚拟现实音频内容表达广义上涉及元数据、渲染器、音频编解码器,本文件采用元数据、

渲染器、编解码器在逻辑上相互分离的方式,并主要对元数据和渲染器进行规范。虚拟现实

音频适用于不同应用场景,包含全景音频、沉浸音频以及互动音频。

当用于本地存储和制作时,只需要渲染器对元数据进行解析,不涉及元数据编解码及音

频编解码过程;当用于传输时(例如直播或双向通信),需要另行在系统层定义元数据+音

频流的传输格式。可以根据不同应用场合、不同传输协议的要求定义可行的静态元数据、动

态元数据、音频流封装形式。

如图1虚拟现实音频内容表达系统框架示意图。采集端,输入音频信号包括Channel(声

道信号,即声床Bed)、Object(声音对象)、Scene(场景信号,基于一阶/高阶环境声学技

14

GB/TXXXXX.3—XXXX

术FOA/HOA)或它们的混合形式,VR制作过程根据元数据定义生成基础和扩展元数据信息,

本文件定义了AVS音频元数据串行流封装格式AAMSF,见第8章。多声道音频制作系统的关

键性指标建议及测试方案可参考附录G,空间音频信号中的声音对象在元数据中用音频对象

audioObject字段表示,场景信号采集方式可参考附录D、附录E,常用的场景信号渲染方式

可见附录F。元数据又可以划分为动态元数据和静态元数据,前者是指随着音频流内容实时

变化的信息,后者则是在一次传输中固定不变的信息,动态元数据可以伴随音频流传输,具

体封装格式根据系统层采用的传输协议类型进行定义,元数据串行流封装后与音频流复接进

入传输信道。回放端,渲染器将根据解封装后元数据对解码后的音频文件进行空间音频渲染

输出(扬声器、耳机或其他方式)。逻辑上元数据和音频编解码互相独立,且解码器和渲染

器之间解耦合。渲染器采取注册制,每个注册的VR渲染器支持同一套元数据的解析。

本文件附录定义了各类独立的VR空间音频渲染技术或渲染模块,适用于不同场景的特

定需求,对于支持符合本文件元数据解析的渲染器可作为注册渲染器。

图1虚拟现实音频内容表达框架示意图

渲染器系统首先进行注册渲染器的选择,之后每个注册渲染器分别进行元数据信息读取

和音频文件的读取。渲染器的输入数据由注册渲染器标号以及元数据和音频数据构成,其中

元数据和音频数据可以组成BW64(ITU-RBS.2088)文件格式。渲染器系统中包含多个注册

渲染器,以ID号区分,其中注册渲染器ID1的具体定义和描述见第9章(面向双耳输出的基

于Ambisonic的渲染器),注册渲染器ID2的具体定义和描述见第10章(面向扬声器输出的基

于标准扬声器布局的渲染器)。

注册渲染器模式选择以不同的ID号进行标记,当用于传输时可以预留8个比特对渲染器

模式(rendererMode,见8.2节)进行指示,以支持对不同渲染器的灵活选择。

6.2坐标系语法

坐标系用于描述声源和听者的位置、姿态信息,通过坐标系将位置相关的元数据与渲染

器关联起来,实现声源和听者位置动态变化的功能。元数据的位置信息通常使用球坐标系或

者元数据坐标系定义,与ITU-RBS.2076的定义相同。世界坐标系与图形学中的坐标系一致,

第9章以世界坐标系作为渲染器ID1的参数格式。音频坐标系在音频计算领域广泛使用,在

第9章渲染器ID1中用于球谐函数的计算。

几种坐标系的定义如下:

球坐标系:为目标点在xy平面上的投影与x轴正向的夹角,为目标点和原点连线与z

轴正向的夹角,r为目标点到原点的距离。

��

元数据坐标系:X指向右边,Y指向屏幕里,Z指向天空,人看向Y轴正向;

世界坐标系:X指向右边,Y指向天空,Z指向屏幕向外,人看向Z轴正向;

15

GB/TXXXXX.3—XXXX

音频坐标系:X指向屏幕里,Y指向坐边,Z指向天空,人看向X轴正向;

坐标系定义如图2:

图2坐标系定义

坐标系之间的转换关系见表1-表4。笛卡尔坐标系转换为世界坐标系

worldPositionFromCartesian()的语法见表1,世界坐标系转换为传统的音频坐标系

audioPositionFromWorldPosition()的语法见表2,极坐标系转换为传统的音频坐标系

audioPositionFromSphericalAngleInDegree()的语法见表3,世界坐标系转换为极坐标系

sphericalFromWorldPosition()的语法见表4。

表1worldPositionFromCartesian()语法

语法比特数助记符

worldPositionFromCartesian(){

return{-x,z,y};8uimsbf

}

表2audioPositionFromWorldPosition()语法

语法比特数助记符

audioPositionFromWorldPosition(){

16

GB/TXXXXX.3—XXXX

return{z,x,y};8uimsbf

}

表3audioPositionFromSphericalAngleInDegree()语法

语法比特数助记符

audioPositionFromSphericalAngleInDegree(){

azimuth=azimuth*PI/180.f;8uimsbf

elevation=elevation*PI/180.f;8uimsbf

return{cos(elevation)*cos(azimuth),

cos(elevation)*sin(azimuth),

sin(elevation)};

}

表4sphericalFromWorldPosition()语法

语法比特数助记符

sphericalFromWorldPosition(){

azimuth=atan(x,z);

elevation=atan(y,sqrt(x*x+z*z));

}

6.3元数据系统结构

如图3元数据系统结构。其中,<audioformatExtended>基础部分引用了ITU-RBS.2076定

义的ADM,复用了其针对内容和格式的属性和元素,用来传递Bed,Object,HOA,Matrix和

Binaural等音频信号相关的内容和控制信息。进一步的,该元数据系统通过<vrExt>扩展部分

提供ADM中没有的元数据,以使符合本文件的渲染器在内容生产和渲染环节具有独特的能

力。<audioformatExtended>基础部分和<vrExt>扩展部分的元数据有可能会存在属性上的冲

突。当出现冲突时,由渲染器决定解决冲突的策略。

元数据的具体定义和解析见第7章。

17

GB/TXXXXX.3—XXXX

图3元数据系统结构

6.4元数据系统框架语法

metadataBlock()的语法见表5。

表5metadataBlock()语法

语法比特数助记符

metadataBlock()

18

GB/TXXXXX.3—XXXX

{

basicLevel;2uimsbf

numAudioProgrammes;3uimsbf

for(inti=0;i<numAudioProgrammes;++i){

AudioProgramme();

}

if(hasVrExt==1){1bslbf

vrExt();

}

}

basicLevel是基础元数据的分层,定义参考第7.1节,AudioProgramme()语法参考第7.3节,

vrExt()语法参考第7.6节。

6.5渲染器系统框架语法

createAudioRenderer()的语法见表6。

表6createAudioRenderer()语法

语法比特数助记符

createAudioRenderer()

{

switch(rendererMode){8uimsbf

case0x00:

binauralRenderer();

case0x80:

loundspeakerRenderer();

default:

otherRenderer();

}

}

6.6AVS音频元数据串行流封装格式AAMSF

第8章介绍了AVS音频元数据串行流封装格式AAMSF及其语法语义。

6.7面向双耳耳机输出的基于Ambisonics的渲染器

第9章介绍了面向双耳耳机输出的基于Ambisonics的渲染器(ID1)的系统框架和各部分

技术实现的原理、语法和语义。

6.8面向扬声器输出的基于标准扬声器布局的渲染器

第10章介绍了面向扬声器输出的基于标准扬声器布局的渲染器(ID2)的系统框架和各

部分技术实现的原理、语法和语义。

7元数据系统

19

GB/TXXXXX.3—XXXX

7.1元数据概述

第7章定义渲染相关的元数据,支持符合ITU-RBS.2076的ADM基础元数据,包含

<audioformatExtended>部分和可定制的扩展元数据<vrExt>部分。描述音频格式的ADM元

数据以XML形式给出,可以将其插入BW64文件中。

为了保持设备兼容性,内容的互操作性和渲染系统的复杂度可控,对元数据的数目和组

合采用分层(Level)控制,目前定义5级:Level0-Level4,Level0是为了保持跟现在

的音频内容互操作,主要支持“typeDefinitions=DirectSpeakers”且“SpeakerLabel=M+000/M+

022/M-022”。Level1-4分别对各元素的最大配置见表7,Level1-3对内容元素数目做限制,

Level4支持无限的元数据数目。建议的Level配置见表7。

表7Level分层建议

Level

<audioformatExtended>描述01234

Element

音频文件或音频流中

audioProgramme1148Unlimited

音频节目数

文件或者流中节目的

audioContent2(speech/non-speech)4816Unlimited

音频内容数目

文件或者流中音频源

audioObject(相当于vrExt中的23264128Unlimited

unit)

一个时间片同时存在

concurrentAudioObject281632Unlimited

的音频源数

在节目中支持交互的

interactiveObject0124Unlimited

音频源数目

audioObjectNesting音频源嵌套的层数0124Unlimited

文件(不包含音频流)

audioPackFormat1163264Unlimited

中音频格式组的数目

文件(不包含音频流)

audioChannelFormat23264128Unlimited

中音频格式的数目

文件(不包含音频流)2

audioStreamFormat3264128Unlimited

中轨道组格式的数

文件(不包含音频流)

audioTrackFormat归音频轨道格式的数23264128Unlimited

目

音频文件或者音频流

audioTrackUI23264128Unlimited

中唯一标识符数目

surface同种材料的几何表面181664Unlimited

组成surface的三角形

vertex顶点数,其中三个点组36161632Unlimited

成一个三角形

20

GB/TXXXXX.3—XXXX

7.2基础元数据定义

元数据主要使用可扩展标记语言XML编码来实现,XML格式的元数据可包含在BW64

格式的音频文件的“axml”或“bxml”块中进行传输。生成的元数据中的“音频包格式标识”、“音

频轨道格式标识”和“音轨唯一标识”,将提供给BW64文件的“chna”块,用以将元数据与实际

的音轨链接。

元数据基础元素(audioformatExtended)包括:音频节目(audioProgramme,见表8)、

音频内容(audioContent,见表9)、音频对象(audioObject,见表10)、音频流格式

(audioStreamFormat,见表11)、音频轨道格式(audioTrackFormat,见表12)、音频包格

式(audioPackFormat,见表13)、音轨唯一标识(audioTrackUID,见表14)、音频通道格

式(audioChannelFormat,见表15)、音频块格式(audioBlockFormat,见表16)。

7.2节描述了audioformatExtended部分细节。

表8audioProgramme相关规范(参考BS2076-2第5.8节)

属性/子元素规范限制必选/可选

audioProgrammeIDAPR_1001-APR_1008dependentonlevel必选

audioProgrammeName32个字符以内,否则截断必选

可以为空;如有,必须符合ISO639-2/T的规定(3

audioProgrammeLanguage

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论