语音大模型行业市场前景及投资研究报告:语音识别全双工语音交互_第1页
语音大模型行业市场前景及投资研究报告:语音识别全双工语音交互_第2页
语音大模型行业市场前景及投资研究报告:语音识别全双工语音交互_第3页
语音大模型行业市场前景及投资研究报告:语音识别全双工语音交互_第4页
语音大模型行业市场前景及投资研究报告:语音识别全双工语音交互_第5页
已阅读5页,还剩66页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

语音大模型—从语音识别到全双工语音交互2026.0512345背景介绍目录语音识别大模型端到端对话模型全双工语音交互落地应用CONTENTS1.背景介绍—世界语种n

库Ethnologue第26版,目前世界上现存有7168种语言,142个语系。世界语系分布图[1][1]Eberhard,DavidM,GarySF,

etal.Ethnologue:Languagesoftheworld[M].26thed.Dallas,

Texas:

SIL

International,20231.背景介绍—中国方言n

根据教育部2019年《中国语言文字概况》介绍,汉语方言通常分为十大方言:官话方言、晋方言、吴方言、闽方言、客家方言、粤方言、湘方言、赣方言、徽方言、平话土话。表格和图片:中国语言地图集,第2版,汉语方言卷,商务印书馆,2012.1.背景介绍—多语种识别级联式多语种语音识别语种B语音识别模型语种C语音识别模型今天天气真不错语种识别音频确定语种…基于端到端的多语种语音识别普通话音频1今天天气真不错多语种语音识别模型英语音频2Ithinksoは風がとてもうるさいです日语音频31.背景介绍—GPT-4o语音模式•

2024年5月,OpenAI团队率先提出了一个结合多模态的端到端实时交互大模型——GPT-4o。该模型在GPT-4的基础上,增强了文本、视觉和音频处理能力,能在最快232毫秒内响应音频输入,平均响应时间为320毫秒,已接近人类水平。1.背景介绍—豆包语音交互•

豆包—动态判停1.背景介绍—豆包语音交互•

豆包—动态判停1.背景介绍—级联式对话模型•

最基础的语音对话系统包含三个核心模块:语音识别、LLM和语音合成模型。级联式SpeechLMs存在以下问题:•

信息丢失。语音信号不仅包含语义信息(即语音的含义),还包含副语言信息(如音高、音色、音调等),这是文本所不具备的。•

错误累积。级联式模型很容易导致整个流程中出现累积性错误,尤其是在ASR-LLM阶段。•

高延迟。由于数据需要在多个模块间传递,系统响应时间较长,复杂性高,不利于实时语音交互。1.背景介绍—端到端对话模型•

为实现更好的人机交互体验,需要真正实现一个端到端语音对话模型,如图所示,通过语音编码器将语音离散化,由语言模型直接处理语音数据,实现多个模态实时输入输出。1.背景介绍—全双工语音交互单工通信。数据仅沿一个方向流动。说话者可以发送数据,而听者只能接收数据。半双工通信。数据在两个方向上流动,但不同时流动,类似对讲机。全双工通信。允许双方同时发送和接收数据。全双工不一定是端到端对话模型!1.背景介绍—全双工语音交互•

GPT

Realtime采用WebRTC协议进行语音交互,使得音频以连续流的形式到达,更重要的是,该协议本身支持全双工通信。•

关键挑战--打断和判停:用户打断时,语音助手应停止回复;同时,语音助手需要准确识别用户是否讲完了,即意图判断。/index/delivering-low-latency-voice-ai-at-scale/报告聚焦两个关键问题•

如何通过大模型,实现多语种语音识别?•

如何通过大模型,实现全双工语音交互?目录PA

RT

TWO语音识别大模型2.语音识别大模型2.1语音识别过程2.2语音识别发展史2.3Transformer2.4Conformer2.5大语言模型(LLM)2.6开源模型2.1语音识别过程•

语音识别的任务为,找到对应观察序列ꢀ的最可能的词序列ꢁ。按贝叶斯准则:ꢅꢀ|ꢁꢆꢅꢁꢆꢅꢀꢆꢁ

=

ꢂꢃꢄmax

ꢅꢁ|ꢀꢆ

=

ꢂꢃꢄmaxꢁꢁ

=

ꢂꢃꢄmax

ꢅꢀ|ꢁꢆꢅꢁꢆꢁ•

要找到最可能的词序列,必须使上式右侧两项的乘积最大。第一项由声学模型决定,第二项由语言模型决定。2.1语音识别过程今天天气很好天气词序列好今天很语言模型ꢆꢈꢉ音素序列状态序列ian1ian1jin1ttqi4hen2hao3ꢀꢀꢁ

ꢀꢀꢀꢀꢀꢀꢀꢁ

ꢀꢀꢀꢀꢀꢀꢁ

ꢀꢀꢀꢀꢀꢀꢀꢁ

ꢀꢀꢀꢀꢀꢀ⋯⋯⋯声学模型ꢆꢇ|ꢈꢉꢂꢃꢄꢅ特征序列2.1语音识别过程今天天气很好词典:今天

jin1tian1天气

tian1qi4今天天气很好很好hen2hao3jin1tian1tian1qi4hen2hao3⋯⋯⋯人的发音包含•

说什么不确定•

怎么说不确定:ꢀ

ꢀꢀꢈ12345678⋯⋯⋯⋯⋯2.1语音识别过程—系统框架发音词典解码器特征提取识别结果声学模型语音数据语言模型文本数据2.1语音识别过程—系统框架发音词典解码器识别结果解码器识别结果E2E模型声学模型语音数据语言模型文本数据2.2语音识别发展史End-to-End:CTC模板匹配DTWVQGMM-HMMDNNDNN-HMMLLMRNN-T模型

Audry-识别10个英文数字AttentionTransformerConformer20世纪50年代20世纪70年代20世纪80年代时间2006年2012年2015年2024年以来孤立词识别大规模连续语音识别复杂场景/多语种/方言识别第一阶段模板匹配第二阶段统计模型第三阶段深度学习第四阶段大模型输出概率Softmax2.3Transformer线性层层归一化编码器输出层归一化前馈层层归一化编码器前馈层解码器╳NN╳交叉注意力层归一化层归一化自注意力掩蔽注意力位置编码卷积下采样位置编码输出嵌入输出(迭代右移)输入语音特征2.4Conformer识别结果层归一化+EncoderEncoderEncoderEncoderEncoderEncoderDecoderDecoderDecoderDecoderDecoderDecoder前馈模块+卷积模块+多头自注意力模块+前馈模块输出(迭代右移)卷积下采样ConformerBlock输入语音特征流识别机制贪婪搜索前缀剪枝搜索CTC输出经贪婪搜索(Greedy

Search)或前缀剪枝搜索(Prefix

Beam

Search),后续可接两种解码器:Transformer解码器识别结果•

接Transformer的解码器,进行二次解码得到识别结果。CTC输出•

接带语言模型的FST解码器,进行重打分得到识别结果。Conformer编码器FST解码器识别结果流识别以chunk输入,位置需要加入偏移(offset)信息。pos_emb(+offset)卷积下采样chunkchunkchunkchunk语音片段(chunk大小可自己设置,如320ms)2.5大语言模型(LLM)<eos>输出概率最高的结果Softmax线性层Helloworld<eos>层归一化大语言模型(LLM)前馈层<sos>Helloworld╳N层归一化适配器•

接入LLM,需把连续语音转化为离散编码,并通过适配器(Adapter)与文本对齐。•

(Encoder)

Transformer或Conformer

Encoder,而解码器直接用LLM

Decoder-only

Transformer

实现nexttoken预测。带掩码的多头注意力编码器位置编码输入嵌入输出(迭代右移)<sos>Helloworldnexttoken预测离散编码—TokenToken是对文本进行分割和编码的最小单元,它可以是以下形式:•

字符,如’h’;•

单词,如“hello”;•

子词•

BPE(Byte-pairEncoding),如“ello”;•

BBPE(Byte-levelByte-pairEncoding):UTF-8编码+BPE,可以跨语言使用。tokenizemap文本tokentoken文本generateToken化(编码为BPE)原始文本(莎士比亚):以TiktokenGPT2BPE为分类单元:FirstCitizen:Beforeweproceedanyfurther,hearmespeak.trainhas301,966tokensvalhas36,059tokensAll:Speak,speak.FirstCitizen:Youareallresolvedrathertodiethantofamish?对字符串采用TiktokenGPT2BPE进行分词并编码,例enc.encode("helloworld")All:Resolved.resolved.[31373,995]FirstCitizen:First,youknowCaiusMarciusischiefenemytothepeople.All:Weknow't,weknow’t.……多语种与方言识别多语种建模:BBPE

Tokenizer(GPT、Whisper)l

Tokenizer是大模型非常重要的概念。l

基于Unicode编码后使用byte建模可以打破语言的限制,所有的语言都可以共用建模单元。l

英语字符本身在ASCII码中,因此天然就是BBPE。其它语言字符需要多个字节进行编码。ãģĵãĤĵä»Ĭ天Tuesday_ãģĵ_ãĤĵ_ä»Ĭ_天_Tuesday2.6开源模型—WhisperØ

使用68万小时弱标签数据进行训练;Ø

模型结构使用Transformer结构;Ø

FBank特征(80维,large-v3128维);Ø

使用基于GPT2的tiktoken;Ø

通过prompt的方式包含语种标签;Ø

通过设计prompt的方式进行多任务训练。ModelTinyLayersWidth384HeadsParameters39M46Base6512874MSmall122432768121620244MMediumLarge10241280769M1550MWhisper:大规模数据多任务训练的端到端Transformer模型Whisper的模型尺寸A.Radford,J.W.Kim,T.Xu,G.Brockman,C.McLeavey,andI.Sutskever,“Robustspeechrecognitionvialarge-scaleweaksupervision.”arXivpreprintarXiv:2212.04356ꢀ(2022).2.6开源模型—小红书FireRedASRØ

包含约7万小时高质量精标中文数据和1.1万小时英文数据;Ø

中文采用字符编码,英文采用BBPE编码。2025年1月,小红书发布FireRedASR,包括AED和LLM版本,其中语音编码器(Encoder)采用Conformer,LLM基于Qwen2-7B-Instruct(冻结),采用LoRA微调Encoder和Adapter。Kai-TuoXu,Feng-LongXie,Xu

Tang,

Yao

Hu,"FireRedASR:Open-SourceIndustrial-GradeMandarinSpeechRecognitionModelsfromEncoder-DecodertoLLMIntegration,"

arXivpreprintarXiv:2501.14350.2.6开源模型—Qwen3-ASRØ

支持30个语种和22个中国方言;Ø

约4000万小时伪标签数据(中英为主);Ø

支持流式输入,支持语种识别;Ø

采用5万条数据和组序列策略优化(GSPO),进行强化学习。2026年1月,阿里巴巴发布Qwen3-ASR,包括0.6B和1.7B版本。采用,预训练语音编码器—AuT(采用AED框架),然后接入Qwen3LM(基模为Qwen3-Omni)。XianShi,Xiong

Wang,

ZhifangGuo,

Yongqi

Wang,

PeiZhang,XinyuZhang,ZishanGuo,HongkunHao,

Yu

Xi,Baosong

Yang,

JinXu,JingrenZhou,JunyangLin,"Qwen3-ASR

Technical

Report,"arXivpreprintarXiv:2601.21337.目录PA

RT

THREE端到端对话模型3.端到端对话模型•

如何实现语音Token化?尽可能保留原始语音的声学和语义信息。•

语音文本如何对齐?以接入LLM,统一建模。•

LLM输出的Token如何转化为语音输出?3.端到端对话模型•

语音编码器(SpeechEncoder/Tokenizer)•

大语言模型(LLM)•

语音解码器(SpeechDecoder/Detokenizer)3.1SpeechTokenizer(Encoder)•

语义Token/特征•

优先捕捉语音中的内容,即语义(Semantic)信息,适合与识别、翻译模块结合。•

一般采用Wav2Vec、HuBERT、Whisper等预训练模型。•

声学Token(离散空间)•

聚焦语音压缩与高保真重建,携带更多声学(Acoustic)信息,如语气、风格、情感等,离散化表示,更适合语音合成、音频生成等任务。•

典型模型包括SoundStream、EnCodec、TiCodec等。•

统一Token•

兼顾语义和声学信息。•

典型模型包括Mimi、SpeechTokenizer、X-Codec等。3.1SpeechTokenizer(Encoder)语义Token/特征•

编码器(Encoder):Whisper,HuBERT,…接入LLM需要增加一个适配器(Adapter),和额外的训练阶段,以实现模态对齐。3.1SpeechTokenizer(Encoder)语义Token/特征•

编码器(Encoder)+有限标量量化(FSQ):CosyVoice2、CosyVoice3CosyVoice2由阿里巴巴团队推出,其设计的Supervisedspeechtokenizer,是在语音识别模型SenseVoice-Large的Encoder插入FSQ,实现量化表征。CosyVoice3替换了Encoder,并进行多任务训练。CosyVoice3[2]CosyVoice2[1][1]ZhihaoDu,YuxuanWang,QianChen,etal.,"CosyVoice2:ScalableStreamingSpeechSynthesiswithLargeLanguageModels,“arXivpreprintarXiv:2412.10117,2024.[2]ZhihaoDu,ChangfengGao,YuxuanWang,etal.,"CosyVoice3:TowardsIn-the-wildSpeechGenerationviaScaling-upandPost-training,"arXivpreprintarXiv:2505.17589,2025.3.1SpeechTokenizer(Encoder)声学Token•

音频编解码器(Codec)+向量量化(VQ)通过Neural

Audio

Codec(如SoundStream、EnCodec),将连续的语音信号经过Encoder输出连续隐向量,然后做向量量化(VQ),最后编码为离散的语音Token序列。VQ码本采用K-mean生成,会带来量化误差,改进版包括残差向量量化(RVQ)、有限标量量化(FSQ)等。3.1SpeechTokenizer(Encoder)声学Token•

关键技术—残差向量量化(RVQ)RVQ通过逐步分解数据的残差来进行量化。首先将输入向量通过第一个量化器量化,得到一个较为粗略的近似值,然后计算原始数据和近似值之间的差异(即残差)。接着对残差应用第二个量化器,得到更精确的近似,并继续计算残差。这个过程可以重复多次,通过多个量化器逐层逼近原始数据,减少量化误差,其流程如图所示。3.1SpeechTokenizer(Encoder)声学Token•

典型例子:SoundStream采用RVQ的方式实现音频数据的高效压缩,由重建损失(Reconstruction

Loss)、对抗损失(AdversarialLoss)等共同优化模型。Neil

Zeghidour,

Alejandro

Luebs,

Ahmed

Omran,

Jan

Skoglund,

Marco

Tagliasacchi,

"SoundStream:

An

End-to-End

Neural

Audio

Codec,"

arXiv

preprintarXiv:2107.03312,2021.3.1SpeechTokenizer(Encoder)声学Token•

典型例子:EnCodec由MetaAI提出,结合卷积神经网络、RVQ、多尺度对抗训练以及Transformer熵编码,突破了传统编解码器的性能上限。AlexandreDéfossez,JadeCopet,GabrielSynnaeve,YossiAdi,"HighFidelityNeuralAudioCompression,"arXivpreprintarXiv:2210.13438,2022.3.1SpeechTokenizer(Encoder)统一Token•

声学+语义信息音频编解码器(AudioCodec)最初是为音频压缩而设计的,其产生的离散化Token包含丰富的声学信息,但是缺乏语义信息,当LLM与离散化Token结合的时候,这些编解码器可能导致LLM产生的音频Token缺乏语义信息,从而导致产生的音频质量下降。通常采用蒸馏(如SpeechTokenizer、Mimi)或者语义特征融合(如X-Codec)来丰富Codec产生的离散Token的语义信息,增强Codec在下游任务的表现。SpeechTokenizerX-Codec3.1SpeechTokenizer(Encoder)统一Token•

典型例子:Qwen3-TTSTokenizerHangruiHu,XinfaZhu,TingHe,DakeGuo,BinZhang,XiongWang,ZhifangGuo,ZiyueJiang,HongkunHao,ZishanGuo,XinyuZhang,PeiZhang,BaosongYang,JinXu,JingrenZhou,JunyangLin,"Qwen3-TTSTechnicalReport,"arXivpreprintarXiv:2601.15621,2026.3.2LLMFeedForward•

LLaMA-3.1-8B-InstructSoftMaxLinear•

Helium-7B•

GLM-4-9B•

Qwen2-0.5B•

Qwen2.5-7B-Instruct•

Qwen2.5-7B•

……RMSNormAttentionTransformerBlockLayerNLinearTransformerBlockLayer...SoftMaxTransformerBlockLayer1MaskRoPEQRoPEKVInputEmbeddingLinearRMSNorm3.3SpeechDetokenizer(Decoder)FlowMatching(流匹配)文本Tokens语音Tokens文本EncoderLLMDecoder声码器离散Token通过Decoder生成梅尔谱,然后通过声码器转成波形。3.3SpeechDetokenizer(Decoder)典型例子—CosyVoice•

SpeechTokenizer:•

实现波形到Token的转换,支持端到端训练;•

Text-to-tokenLM:•

将语音生成转化为语言模型的离散Token预测任务,继承大模型的强大序列生成能力;•

FlowMatching:•

通过概率流实现从语义特征到声学特征的映射,从而完成对声学细节的补充。Zhihao

Du,

Qian

Chen,

Shiliang

Zhang,

Kai

Hu,

Heng

Lu,

Yexin

Yang,

Hangrui

Hu,

Siqi

Zheng,

Yue

Gu,

Ziyang

Ma,

Zhijie

Yan,

"CosyVoice:

A

Scalable

MultilingualZero-shotText-to-speechSynthesizerbasedonSupervisedSemanticTokens,"arXivpreprintarXiv:2407.05407,2024.3.3SpeechDetokenizer(Decoder)典型例子—GLM-TTSGLM-TTS的生成分为两个阶段:阶段一:语义建模输入Prompt文本和音频,生成对应的Whisper-VQ语义Token;阶段二:声学建模与波形重建基于条件流匹配(Conditional

Flow

Matching,

CFM)模型预测梅尔频谱,然后通过声码器转为波形。Jiayan

Cui,

Zhihan

Yang,

Naihan

Li,

Jiankun

Tian,

Xingyu

Ma,

Yi

Zhang,

Guangyu

Chen,

Runxuan

Yang,

Yuqing

Cheng,

Yizhi

Zhou,

Guochen

Yu,

Xiaotao

Gu,

Jie

Tang,"GLM-TTSTechnicalReport,"arXivpreprintarXiv:2512.14291,2025.3.3SpeechDetokenizer(Decoder)关键技术—FlowMatching(流匹配)•

目标:学习一个连续时间的向量场,使简单分布逐步演化为真实数据分布。给定初始分布为标准高斯分布,目标分布为,构造连续路径样本随时间的演化由可由微分方程描述:流匹配目标是用一个神经网络去逼近这个真实的向量场:Lipman,Yaron,RickyT.Q.Chen,HeliBen-Hamu,MaximilianNickelandMattLe.“FlowMatchingforGenerativeModeling.”ꢀTheEleventhInternationalConferenceonLearningRepresentations,2023.3.3SpeechDetokenizer(Decoder)关键技术—FlowMatching(流匹配)实际问题中采用条件流匹配(CFM):以真实样本作为条件,将全局建模问题转化为单样本的轨迹建模问题。采用最优传输流匹配(OT-CFM):在噪声样本和真实样本之间做线性插值对时间求导可得对应的条件速度场:在语音生成中,常对梅尔频谱分布进行建模,并额外引入文本c作为外部条件。OT-CFM训练目标为:高斯噪声(t=0)真实梅尔频谱(t=1)对ODE求解3.4开源模型—端到端对话•

Moshi:/kyutai-labs/moshi作为GPT-4o之后较早发布的开源模型,在参数量较小的情况下具备类似功能,理论延迟仅为160毫秒,并支持70多种情绪和说话风格,以及英语和法语的实时交互。•

GLM-4-Voice:/THUDM/GLM-4-Voice端到端中英语音对话模型,能够直接理解和生成中英文语音,并根据用户指令灵活调整语音的情感、语调、语速和方言等特征。•

Freeze-Omni:/VITA-MLLM/Freeze-Omni在完全冻结LLM的情况下,为LLM接入语音输入和输出,具备低延迟的双工对话能力。•

Qwen-Omni系列:/QwenLM多模态大模型,专为全面的多模式感知设计,可以无缝处理包括文本、图像、音频和视频的各种输入,同时支持流式的文本生成和自然语音合成输出。•

Kimi-Audio:/MoonshotAI/Kimi-Audio在一系列音频基准测试中(包括语音识别、音频理解、音频问答和语音交互)达到了较为先进的性能。•

Step-Audio2:/stepfun-ai/Step-Audio2主打副语言理解,涵盖了

11

个维度的深度理解,包括音色

(Timbre)、音高

(Pitch)、节奏

(Rhythm)、语速

(Speed)

和说话风格等MoshiSpeechTokenizerLLMSpeechDetokenizerMimiEncoderHellium-7B&DepthTransformerMimiDecoder•

Moshi建模两路音频:一路对应Moshi说话,另一路对应用户说话。同时,Moshi预测自己语音的文本。•

小的DepthTransformer建模每个时间步的码本依赖,大的7B参数的TemporalTransformer建模时间依赖。•

Mimi采用NeuralCodec,第一个VQ从WavLM蒸馏学习语义信息,其它7个为RVQ。•

Moshi在L4GPU运行,实际延迟可低于200ms。Défossez

A,MazaréL,OrsiniM,etal.Moshi:aspeech-textfoundationmodelforreal-timedialogue[J].arXivpreprintarXiv:2410.00037,2024.GLM-4-VoiceSpeechTokenizerLLMSpeechDetokenizerWhisperEncoder+VQGLM-4-9BFlowMatching+HiFi-GANGLM-4-Voice由三个部分组成:•

GLM-4-Voice-Tokenizer:

通过在Whisper的Encoder部分增加Vector

Quantization并在ASR数据上有监督训练,将连续的语音输入转化为离散的Token。每秒音频平均只需要用12.5个离散Token表示。•

GLM-4-Voice-Decoder:基于CosyVoice的FlowMatching模型结构训练的支持流式推理的语音解码器,将离散化的语音Token转化为连续的语音输出。最少只需要10个语音Token即可开始生成,降低端到端对话延迟。•

GLM-4-Voice-9B:在GLM-4-9B的基础上进行语音模态的预训练和对齐,从而能够理解和生成离散化的语音Token。AohanZeng,ZhengxiaoDu,andetal.GLM-4-Voice:TowardsIntelligentandHuman-LikeEnd-to-EndSpokenChatbot,arXivpreprintarXiv:2412.02612.Qwen-Omni系列•Thinker-Talker架构•

Thinker-Talker升级为

MoE•

Hybrid-AttentionMoE架构•

自适应速率交错对齐•

TMRoPE位置编码•

自研2000wh预训练AuT音频编码器Qwen3.5-Omni•

沿

Thinker-Talker

ꢀHybrid-AttentionMoE,效率和性能均有显著提升。•

提出ARIA(自适应速率交错对齐,AdaptiveRateInterleaveAlignment)技术,语音输出的稳定性和自然度也进一步改善。•

在音频/音视频的理解、推理和交互任务上共取得了215项Benchmark的SOTA成绩。https://qwen.ai/blog?id=qwen3.5-omniKimi-AudioSpeechTokenizerLLMSpeechDetokenizerWhisperEncoder+AudioTokenizerQwen2.5-7BAudioDetokenzier主要特点:•

LLM是用Qwen2.5-7B初始化,并扩展了词表;•

采用12.5Hz的音频tokenizer,相当于80ms一帧;•

Whisper做为音频编码器,生成语义Token(离散化),并与声学Token结合;•

预训练数据超过1300万小时音频,包括语音、声音和音乐,通过ASR模型生成标注;•

音频合成采用FlowMatching模型结构;•

采用chunk-wise的流解码方式,减少延迟;•

分块边界存在间断问题,引入前瞻机制。KimiTeam

and

etal.,Kimi-Audio

Technical

Report.arXivpreprintarXiv:arXiv:2504.18425,2025.Step-Audio2•

端到端语音生成集成:模型将离散音频token的生成直接整合到语言建模中,显著增强对副语言信息(如语气、风格、情感)的响应能力。•

以推理为中心的强化学习

(RL):引入了思维链

(CoT)

推理和多阶段强化学习(RL)策略(包括PPO和

GRPO),显著提升了模型在复杂音频环境下的理解、推理和实时交互效率。SpeechTokenizerLLMSpeechDetokenizerLinguistic&SemanticTokenizerStep-Omni(130B)CosyVoice[1]

Wu

B,

Yan

C,HuC,etal.Step-audio2technicalreport[J].arXivpreprintarXiv:2507.16632,2025.[2]Huang

A,LiB,

Wang

B,etal.Step-Audio-AQAA:aFullyEnd-to-EndExpressiveLarge

AudioLanguageModel[J].arXivpreprintarXiv:2506.08967,2025.目录PA

RT

FOUR全双工语音交互4.全双工语音交互•

语音大模型必须以一种全双工的形式运行,即模型可以同时具有听和说的能力,实时处理两条音频流,如图所示,包含模型输出的音频和用户的指令音频。一般来说,可以通过以下方式实现插话打断:•

Voice

Activity

Detection

,VAD),即声学VAD,配合WebSocket通信协议,实现插话打断的功能。•

额外训练一个语义判停模块,相当于语义VAD,判断用户是否讲完,若用户语义不完整,可适当延长麦克风收音时间。•

端到端建模用户流和系统流,如Moshi,语音大模型可自己判断用户是否在进行插话打断、语义是否完整。4.

全双工语音交互级联式全双工交互链路由五个模块组成:•

声学VAD节点延迟备注等待静音确认,判断用户"说话结束",不能太小,否则会误切VAD

尾端延迟300-800ms•

语音识别(ASR)•

全双工模块上行网络ASR延迟20-100ms200-800ms100-500ms100-500ms0-300ms可以通过本地流式

ASR降低延迟通过vllm部署可加速全双工模块判断LLM首token文字积累等待TTS首包延迟下行网络+缓冲合计•

大语言模型(LLM)•

语音合成(TTS)通过vllm部署可加速100-400ms20-150ms840-3550ms本地流式

TTS可降低该部分延迟可使用WebSocket优化延迟这种范式可控性高,但存在延迟高、声学信息丢失的问题。/s?src=11×tamp=1778293608&ver=6709&signature=12O59RA5U9i7cdSDiz0mc02eOlEmZEgNDM3uOsCizOFtuhKziMtcCTYXiP7zlHm33elDsMa0FZuhX-Dc25VYqVxIGfQ5f7-wWX1mWfR3HCgs920nMm*uSOuUBQBY04cE&new=1语义VAD—EasyTurn•

基于Qwen2.5-0.5B-Instruct微调,同时发布1145h训练数据。•

集成声学和语言学信息,面向全双工语音交互,预测四种对话变换状态:语义完整(complete)、语义不完整(incomplete)、“嗯”“对”等简短回应(backchannel)、等待(wait)。GuojianLi,Chengyou

Wang,

HongfeiXue,Shuiyuan

Wang,

DehuiGao,ZihanZhang,

Yuke

Lin,

Wenjie

Li,LongshuaiXiao,ZhonghuaFu,LeiXie,"EasyTurn:

Integrating

AcousticandLinguisticModalitiesforRobust

Turn-Taking

inFull-DuplexSpokenDialogueSystems,"

arXivpreprintarXiv:2509.23938.语义VAD—Phoenix-VAD创新:ü

结合滑动窗口策略,模型同时支持无需ASR转录、流式、语义感知、即插即用等特点。ü

提出一种超时机制,减少语音交互场景中的误中断。ü

在仅采用合成数据训练的情况下,Phoenix-VAD在合成测试集和真实测试集都取得较好效果。Wu

W,

Guan

W,

Wang

K,etal.Phoenix-VAD:

StreamingSemanticEndpointDetectionforFull-DuplexSpeechInteraction[J].arXivpreprintarXiv:2509.20410,2025.语义VAD—SoulX-Duplug•

统一流式架构:不同于传统级联方案将VAD、ASR、对话轮次检测作为独立模块串联(导致延迟累积且缺乏语义感知),SoulX-Duplug首次将三者统一在单一流式模型中。•

采用三阶段训练(非流式ASR预训练→流式ASR适配→状态预测微调),推理时使用轻量外部ASR模型进行Teacherforcing,兼顾端到端训练的优势和实时部署的准确性。•

发布双语评测基准SoulX-Duplug-Eval:扩展了EasyTurn测试集和Full-Duplex-Bench,补充了中英双语测试数据,填补了跨语言全双工对话评估的空白。Yan,

Ruiqi,etal."SoulX-Duplug:Plug-and-PlayStreamingStatePredictionModuleforRealtimeFull-DuplexSpeechConversation."arXivpreprintarXiv:2603.14877(2026).全双工模型—Moshi•

post-training:训练模型的multi-stream能力。使用Pyannote对unsupervisedaudiodataset进行说话人分割,随机抽取一名发言者作为主要发言者,并基于说话人分割生成一个二进制掩码波形,当发言者活跃时掩码值为1,否则为0。•

finetuning:在Fisher数据集上训练让模型学习真实的多流交

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论