CN119487872A 用于对基于体素的几何表示进行声学3d范围建模的方法、系统和装置 (杜比国际公司)_第1页
CN119487872A 用于对基于体素的几何表示进行声学3d范围建模的方法、系统和装置 (杜比国际公司)_第2页
CN119487872A 用于对基于体素的几何表示进行声学3d范围建模的方法、系统和装置 (杜比国际公司)_第3页
CN119487872A 用于对基于体素的几何表示进行声学3d范围建模的方法、系统和装置 (杜比国际公司)_第4页
CN119487872A 用于对基于体素的几何表示进行声学3d范围建模的方法、系统和装置 (杜比国际公司)_第5页
已阅读5页,还剩41页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2024.12.30PCT/EP2023/0657042023.06.13WO2023/242145EN2023.12.21用于对基于体素的几何表示进行声学3D范本公开描述了一种在音频场景中渲染音频范围的范围体素的指示以及与3D范围相关联的段的端点基于范围体素中的一个或多个范围体个音频源中的音频源分配给音频场景内的音频源方位。还描述了相应的装置和计算机程序产2接收(S101)所述音频场景的基于体素的音频场景表示,所述音频基于所述一条或多条线段(203,204;303,304)将所述多个音频源中的音频源分配3.如权利要求1或2所述的方法,其中,基于4.如权利要求1至3中任一项所述的方法,其中,所述其中,分配所述音频源包括将所述音频源分配给除所述遮挡体素之外的体素内的坐其中,分配所述音频源包括将所述音频源分配给相应线段6.如权利要求1至4中任一项所述的方法,其中其中,确定所述一个或多个可能的目标方位包括为所述一择最接近所述相应线段的所述端点并且在范围体素或未填充8.如权利要求6或7所述的方法,其中,确定所述述一个或多个可能的目标方位选择最接近所述相应线段的所述端点并且在范围体素内的及10.如权利要求1至9中任一项所述的方法,进一步包括获得指示所述音频源信号到所11.如权利要求10所述的方法,进一步包括至少部分地基于所述映射将增益指派给所3基于所述收听者位置与所述3D范围之间的参考距离来渲染所分配的音频源的音频源接收(S101)所述音频场景的基于体素的音频场景表示,所述音频基于所述一条或多条线段(203,204;303,304)将所述多个音频源中的音频源分配15.一种包括指令的程序,所述指令当由处理器执行时使所述处理器执行根据权利要4[0002]本申请要求于2022年6月15日提交的申请号为63/352,360的美国临时申请以及于2023年1月25日提交的申请号为63/441,120的美国临时申请的优先权,其全部通过[0005]贯穿本公开对背景技术的任何讨论绝不应视为承认此类技术是本领域众所周知[0006]运动图片专家组(MPEG)是由国际标准化组织(ISO)和国际电工委员会(IEC)联合[0007]新的MPEG_I标准通过支持场景和此类场景周围的各种运动——如在虚拟现实自由度(6DoF)等各种自由度的运动——来使得来自不同视点和/或视角或收听位置的听觉5配音频源可以包括将音频源分配给相应线段上的最接近相应线段的端点并且在范围体素定一个或多个可能的目标方位可以包括为一个或多个可能的目标方位选择最接近相应线以包括基于收听者位置与3D范围之间的参考6存储有软件的一个或多个计算机可读存储介[0033]图3图示了根据本公开的实施例的将音频源分配给音频场景内的音频源方位的示[0034]图4图示了根据本公开的实施例的将音频源分配给音频场景内的音频源方位的另[0035]图5至图9图示了根据本公开的实施例的在音频场景中渲染音频的方法的示例的[0036]图10图示了根据本公开的实施例的收听者位置与3D范围之间的参考距离的示例7类元素表示为了影响通信而可能需要的一条或状进行建模。用于音频渲染的体素的使用与在硬件[0042]本文描述的方法和装置涉及在3D范围由基于体素的几何形状来表示时如何渲染要至少一对音频源。作为示例,场景描述指定具有立方体范围的立体声通道来表示虚拟钢琴对象。然后可以在渲染器中进行处理,以得到放置在邻近范围内的六个不同位置的三对位置坐标L、3D范围材料ID(表示音频对象的3D范围的几何形状近似)、一组3D网格索引VOX (表示一组3D范围)和一组M个音频信号(单声道、立体声等))以及建模设置益)的映射矩阵F以及参考距离)将音频信号S1,…,M映射到相应位置P1,…,N和增益。[0045]本文描述的方法和装置允许对具有由基于体素的几何形状表示的范围的音频对[0046]有利的是,特别是当解码器以符合音频标准(如由MPEG设定的标准)的方式操作坐标。另一个优点是这允许支持在解码器处进行3D范围的几何形状修改(而无需对经修改8解码器/渲染器侧进行修改。编码器处的修改需要对要发送到解码器的范围进行“重新编的每个体素,音频场景的基于体素的表示的一些实施方式可以包括对相应材料属性的指包括3D范围的基于体素的3D音频场景表示的2D剖面图。图2示出了表示对音频场景表示进性地图示了可以可替代地使用的3D范围的几何中心201和3D范围的质量中心(质心)2_Vminx)9源被生成(例如,基于某个范围的给定/指定音频源)并被链接/映射到计算出的坐标方位近的计算出的方位上。这些目标源(而不是带有范围体素可以表示存在于例如3D范围与收听者坐标方向上的投影的最大尺寸(3D范围特性尺寸极值点)Dmaxx,y,z和Dminx,y,z可以用如下方式z],体素307之外的体素内的坐标使得可以对所分配的音频源的相应音频源信号进行渲染,进可以进一步包括将音频源分配给相应线段上的坐标(例如,图4中的308a、308b、309a、括为一个或多个可能的目标方位选择最接近相应线段的端点并且在范围体素或未填充体个可能的目标方位选择最接近相应线段的端点并且在范围体选择最接近相应线段的端点并且在范围体素内的相应坐标可以允许对相应的音频源信号[0075]在笛卡尔坐标系的示例的上下文中,可能的目标方位(3D范围的联合点源坐标)x,y,zx,y,zx,y,zx,y,zx,y,z是如空气和/或水等声音传_Pminx|#1xxOBJ_ID_12xx3y4y5zz6zz以至少部分地基于上述映射。可以进一步基于所选音频源的数量来指派适当的[0087]在该示例用例中,渲染器的任务是在VR/AR/XR/MR场景中适当地渲染虚拟电车的坐标,以及基于收听者方位510与3D范围500之间的参考距离511来渲染所分配的音频源的衍射建模的情况下使用。在此类情况下,该方法被应用于对于收听者510可见的3D范围子_Vminx)z],x,y,z是如空气和/或水等声音传_Pminx|[0127]应用基于体素的遮挡和衍射建模来渲染点音频源{Pmaxx,y,z,Pminx,y,z}的所选子集[0129]应用基于体素的遮挡和衍射建模来渲染点音频源{Pmaxx,y,z,Pminx,y,z}的所选[0134]参考图11的示例,图示了根据本公开的实施例的包括一个或多个处理器1101、[0135]实施上文描述的技术的计算设备可以具有以下示例架构。其他架构也是可能的,发送到客户端设备(例如,为了向与客户端[0144]一个或多个计算机的系统可以被配置为凭借将在操作中使系统执行动作的软件、的特定顺序或按先后顺序执行这样的操作,或执行所有所图示的操作以实现期望的结果。系统通常可以一起集成在单个软件产品中或封装到多个软算机或计算系统或类似的电子计算设备的将表示为物理(如电子)量的数据操纵和/或变换为类似地表示为物理量的其他数据的动作和/或过程。[0151]在下文的权利要求和本文的描述中,术语包括(comprising)、包括(comprisedof)或其包括(whichcomprises)中的任何一个是开放术语,其意指至少包括随后的元素/述的范围不应限于仅包括元素A和B的设备。如本文所用,术语包括(including)或其包括(whichincludes)或包括(thatincludes)中的任何一个也是开括所述术语之后的元素/特征,但不排除其他元素/特征。因此,包括(including)与包括[0156]本公开的各个方面和实施方式也可以从以下所枚举的示例实施例(EEE)中理解,[0157]EEE1.一种对扩展音频对象进行建模以用于虚拟现实或增强现实环境中的音频

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论