ParaASR:用 MTP 加速 4B 大模型语音识别,30 分钟音频一次完成转写

论文:https://arxiv.org/abs/2607.29279

大语言模型正在成为自动语音识别的新型解码器:它能更好地处理同音词、标点恢复、专有名词、中英文混说和长距离上下文,但也带来了一个直接问题——解码器越大,每生成一个 token 的成本越高,长音频转写尤其容易受到延迟限制。

StepFun 团队在论文《ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition》中提出 ParaASR。它使用冻结的 0.6B 音频编码器和 4B 稠密 Transformer 解码器,并在解码器后加入五个 Multi-Token Prediction(MTP)分支,让模型每次前向计算最多提出 6 个 token,再通过自回归路径验证并接收其中正确的连续前缀。

论文报告 ParaASR 平均每次前向计算可接收 5.0 个 token,在单张 NVIDIA H800、单并发条件下达到 0.0053 的实时因子(RTF)。模型保留原生 32K 上下文,可在一次解码会话中处理最长约 30 分钟音频。其中文、英文和长音频基准平均错误率分别为 2.97%、3.68% 和 3.70%。

论文ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition
机构StepFun,合作作者来自 NTU、PKU、UNSW、SJTU、USTC
版本arXiv:2607.29279v1,2026 年 7 月 31 日
模型规模0.6B 音频编码器 + 4B LLM 解码器 + 5 个 MTP 分支
核心能力多 token 并行提议、自回归验证、32K 长上下文、最长约 30 分钟单次转写

一、研究背景:大解码器带来质量,也带来逐 token 延迟

传统 ASR 主要围绕 CTC、Transducer 或声学序列建模展开。近年来,系统逐渐转向“音频编码器 + 适配器 + 大语言模型解码器”的架构:音频编码器提取声学证据,LLM 根据音频表征和已经生成的文本继续写出转录结果。

这种架构能够借助大模型的语言知识解决许多并非纯声学的问题,例如:

  • 同音词和上下文歧义;
  • 中英文代码切换;
  • 标点恢复与逆文本规范化;
  • 人名、地名和专业术语;
  • 会议、广播等长音频中的全局一致性。

问题在于,标准自回归解码一次通常只生成一个 token。设音频为 a,此前已经生成的文本为 x≤t,则下一 token 的预测过程为:

\(p_t=P\!\left(x_{t+1}\mid a,x_{\le t}\right)\)

如果输出序列包含 N 个 token,解码器就需要大约 N 次串行前向计算。解码器从 1B 扩大到 4B 后,语言建模能力增强,但每个 token 都要支付更高的计算成本。长音频同时需要更多输出 token 和更长上下文,因此矛盾更加明显。

二、核心洞察:ASR 比开放式文本生成更适合 MTP

ParaASR 的核心判断是:语音识别并不是开放式创作。文本大模型写故事时,后续内容可能存在大量合理分支;但 ASR 的目标是忠实恢复已经存在于音频中的内容。给定音频和当前转录前缀后,局部未来具有更强的确定性。

因此,模型可以在预测下一 token 的同时,让多个辅助分支分别预测更远位置:

\(p_{t,h}=P\!\left(x_{t+1+h}\mid a,x_{\le t}\right),\qquad h\in\{1,\ldots,5\}\)

主分支负责 xₜ₊₁,五个 MTP 分支分别预测 xₜ₊₂xₜ₊₆,一次前向计算形成六 token 提议。和直接并行输出不同,ParaASR 不会无条件采纳这些未来 token,而是只接收与标准自回归路径一致的最长连续前缀。

若 MTP 提议为 ,自回归验证结果为 x*,接收长度可以抽象表示为:

\(K=\max\left\{k:\hat{x}_{t+i}=x^{*}_{t+i},\ \forall i\in\{1,\ldots,k\}\right\}\)

一旦第 k+1 个提议与正常解码路径不一致,该位置及其后的提议全部拒绝,模型从已验证前缀继续自回归解码。正确预测能够减少前向次数,错误预测最多只是缩短本次接收长度,不会直接改变最终转录结果。这是论文把 MTP 称为“安全加速模块”的原因。

三、ParaASR 模型架构

ParaASR 的主干没有刻意设计得很复杂,而是在标准音频语言模型上重点改造解码路径。

模块设计作用
音频编码器0.6B Transformer,初始化自公开全模态基础模型,训练期间保持冻结提取音频声学表征
时间下采样8 倍下采样,每 80ms 产生一个声学 embedding降低长音频输入序列长度
适配器线性映射层把声学 embedding 投影到语言解码器的隐藏空间
文本解码器4B 稠密 Transformer,初始化自预训练文本 LLM根据音频和文本前缀生成转录
上下文原生 32K context支持最长约 30 分钟音频单次转写
MTP 模块5 个未来 token 分支与主分支共同提出最多 6 个 token

MTP 分支内部如何连接

每个 MTP Block 同时接收上一个分支的隐藏状态和经过位移的 token embedding。两路输入分别归一化后拼接,通过线性层恢复到解码器隐藏维度,再进入一个解码器式 Transformer Block。所有 MTP 分支与主干共享词嵌入层和词表输出头,使未来 token 提议尽可能保持与主解码器一致的语言空间。

32K 上下文与 80ms 声学 embedding 是长音频能力的基础。论文声称该组合可让模型直接处理最长约 30 分钟音频,从而避免传统“VAD 切片—逐段识别—文本拼接”带来的边界错误和跨片段实体不一致。

四、三项主要创新

  1. 把语音的确定性转化为解码并行度:论文没有单纯压缩解码器,而是利用音频对输出文本的强约束,让 4B LLM 可以一次预测多个未来 token。
  2. 多 token 提议与自回归验证结合:MTP 负责加速,标准解码路径负责最终正确性;错误提议只影响速度,不直接决定输出。
  3. 短音频精度、长音频一致性和推理速度统一训练:模型先建立可靠的自回归 ASR,再训练 MTP 分支,避免并行目标从训练初期干扰识别能力。

严格来说,MTP 和投机解码并非论文首次提出。ParaASR 的价值主要在于证明:与开放式语言生成相比,ASR 的声学锚定特性使未来 token 更容易预测,因此能够获得更高的连续接收率,并在较大解码器上实现实际的系统加速。

五、训练数据:1.356T 预训练 token、10 万小时短音频与 5 万小时长音频

1. 音频语言基础预训练

ParaASR 继承公开音频语言基础模型的分阶段预训练方案,总规模为 1.356T 文本和音频 token:

阶段数据规模目标
语音—文本对齐100B ASR token,12K steps冻结音频编码器和 LLM,仅学习音频适配器到文本 embedding 空间的映射
音频 token 扩展128B 文本 + 128B 音频 token加入 6.6K 个离散音频 token,训练 TTS、语音到语音等统一能力
统一多模态预训练800B token,其中包含 400B 文本混合 ASR、TTS、语音翻译以及文本—语音交错续写
Cooldown 与能力扩展200B 高质量 token增强副语言理解和多语种 ASR,并使用覆盖 5 万个说话人的会话式语音合成数据

2. 约 10 万小时短音频监督数据

短音频 SFT 数据由主流公开语料和大量私有数据构成,每条样本不超过 30 秒。数据覆盖普通话、英语、频繁中英文切换、主要汉语方言和地域口音,同时包含专业术语、远场录音和高噪声环境。论文称私有数据经过人工核验,以保证音频与转录的高质量对齐。

3. 约 5 万小时长音频伪标签数据

长音频数据不是直接使用单一 ASR 模型生成标签,而是采用多系统校验:

  1. 用 VAD 把原始长录音切成不超过 30 秒的语音片段;
  2. 使用三个 ASR 系统分别转写;
  3. 统一大小写、标点和表面格式;
  4. 中文按字、英文按词执行 ROVER 对齐和投票;
  5. 一个文本单元至少获得两个系统支持才被接收;
  6. 过滤分歧率超过 5% 的片段;
  7. 重新拼接相邻片段,并使用 LLM 恢复标点、执行 ITN 和统一全局实体。

论文用下面的分歧率作为伪标签可靠性代理指标:

\(\hat{e}=\frac{\#\,\mathrm{disagreed\ positions}}{\#\,\mathrm{text\ units}}\)

ê > 0.05 时,片段被丢弃。最后的 LLM session-level refinement 很关键:它不是只修正单个短片段,而是在整个会话范围内统一反复出现的人名、术语和实体,减少长音频拼接后的前后不一致。

六、训练流程:先做好 ASR,再训练 MTP 加速器

ASR 监督微调

训练采用对话式指令格式:system prompt 指定转写任务,user 输入音频特征,assistant 输出语言标签和转录文本。为提高噪声鲁棒性,训练集中还加入纯非语音或严重噪声输入,目标输出为非语音标签和空文本。

  • 训练序列预算:32K token;
  • 声学增强:SpecAugment 式时间遮挡和频率遮挡;
  • 音频编码器:保持冻结;
  • 优化模块:线性适配器和 4B 语言解码器;
  • 训练步数:10K;
  • 峰值学习率:2×10⁻⁵
  • 全局 batch size:32;
  • warmup:100 steps;
  • 余弦衰减终点:1×10⁻⁶

MTP 第一阶段:冻结主干,对齐未来分支

在已经收敛的 ASR 解码器后加入五个 MTP Block。每个 MTP Block 的 Transformer 层从解码器最后一层初始化,分支专用投影层随机初始化。此时只训练 MTP 模块,主干、共享 embedding 和 LM Head 全部冻结,峰值学习率为 2×10⁻⁴

MTP 第二阶段:联合校准

未来分支初步对齐后,模型解冻适配器和语言解码器,以更低的 2×10⁻⁵ 学习率联合优化。论文称两阶段沿用 32K 序列预算、全局 batch size 32 和 10K-step 训练配置。

越远的 token 越难预测,因此 MTP 分支损失采用指数衰减权重:

\(w_h=\frac{\alpha^{h-1}}{\sum_{j=1}^{H}\alpha^{j-1}},\qquad H=5,\quad \alpha=0.9\)

每个位置的总目标由标准下一 token 交叉熵和五个未来 token 交叉熵构成:

\(\mathcal{L}_t=\mathrm{CE}(p_t,x_{t+1})+\sum_{h=1}^{H}w_h\,\mathrm{CE}(p_{t,h},x_{t+1+h})\)

损失只作用于转录 token。这样的分阶段设计避免随机初始化的 MTP 分支在早期破坏已经稳定的识别主干。

七、实验设置

论文从识别精度、长音频能力和推理效率三个方面评估 ParaASR。主要对比模型包括 VibeVoice-ASR、FunASR-Nano、Doubao-ASR-2603 和 Qwen3-ASR-1.7B。

  • 除 Doubao-ASR-2603 使用官方 API 外,其余模型均部署在单张 NVIDIA H800 上;
  • 推理采用单并发;
  • 不原生支持长音频的模型使用 VAD 切成最长 30 秒片段;
  • 中文使用 CER,英文与长音频使用 WER;
  • 基准覆盖 AISHELL-1/2、WenetSpeech、FLEURS、LibriSpeech、Common Voice、VoxPopuli cleaned AA 和 Earnings22 cleaned AA;
  • Wenet testnet long 由同一来源会话中的相邻片段拼接构造。

错误率的通用定义为:

\(\mathrm{ER}=\frac{S+D+I}{N}\)

其中 SDI 分别代表替换、删除和插入错误;中文以字符数作为 N,得到 CER,英文以词数作为 N,得到 WER。

八、识别效果:平均成绩领先,但并非每个数据集都第一

评测类别VibeVoice-ASRFunASR-NanoDoubao-ASR-2603Qwen3-ASR-1.7BParaASR
中文平均 CER10.193.663.343.172.97
英文平均 WER7.145.246.673.853.68
长音频平均 WER4.875.596.114.203.70

相对 Qwen3-ASR-1.7B,ParaASR 的中文平均错误率相对下降约 6.3%,英文下降约 4.4%,长音频下降约 11.9%。其中代表性结果包括:

  • AISHELL-1 CER:0.71%
  • AISHELL-2 iOS CER:2.29%
  • LibriSpeech clean WER:1.38%
  • LibriSpeech other WER:3.16%
  • LibriSpeech clean long WER:1.27%
  • LibriSpeech other long WER:2.90%

不过,“平均第一”不等于所有数据集都第一。ParaASR 在 Wenet testnet、Wenet testmeeting、Common Voice、FLEURS en、Wenet testnet long 和 Earnings22 等数据集上仍落后于部分基线。例如 Wenet testnet 上 Doubao-ASR-2603 为 4.03%,ParaASR 为 4.54%;Earnings22 上 VibeVoice-ASR 为 5.62%,ParaASR 为 6.52%。这说明 ParaASR 的优势更接近整体质量—效率前沿,而不是对所有领域实现绝对统治。

九、推理效率:4B 解码器比 1.7B 基线更快

实时因子定义为处理时间与音频时长之比:

\(\mathrm{RTF}=\frac{T_{\mathrm{inference}}}{T_{\mathrm{audio}}}\)
模型RTF相对 ParaASR
VibeVoice-ASR0.1039约慢 19.6 倍
FunASR-Nano0.0591约慢 11.2 倍
Doubao-ASR-26030.0640约慢 12.1 倍
Qwen3-ASR-1.7B0.0094约慢 1.77 倍
ParaASR0.0053基准

RTF 0.0053 意味着在论文条件下,处理 30 秒音频约需 0.159 秒。RTF 测试使用 100 条、每条 30 秒的音频。尽管 ParaASR 使用 4B 解码器,它仍比 Qwen3-ASR-1.7B 的 0.0094 更快,说明多 token 接收抵消了更大解码器的单步成本。

需要注意,Doubao-ASR-2603 通过官方 API 测试,而其他模型运行在本地 H800 上,因此这项 API 与本地部署之间的 RTF 对比并非完全同条件。

十、为什么选择 MTP-5,而不是更多分支

配置各位置接收率平均接收长度
MTP-30.96 / 0.88 / 0.803.6 / 4
MTP-50.95 / 0.88 / 0.80 / 0.71 / 0.645.0 / 6
MTP-70.96 / 0.88 / 0.80 / 0.72 / 0.65 / 0.59 / 0.536.1 / 8

从 MTP-3 增加到 MTP-5,平均接收长度从 3.6 提升到 5.0,增长约 39%;继续增加到 MTP-7,平均接收长度只提高到 6.1,增幅约 22%。越靠后的 token 接收率越低,第七位置只有 0.53。

生产推理中,较远位置预测失败会造成 KV Cache 回滚并打断连续解码,分支数量过多的维护成本可能抵消额外接收的少量 token。因此论文最终选择 MTP-5 作为并行度、接收率和工程复杂度之间的平衡点。

十一、消融实验:MTP 基本不改变识别精度

类别不使用 MTPMTP-5变化
中文平均 CER3.003.000.00
英文平均 WER3.833.87+0.04
长音频平均 WER3.633.69+0.06

配对消融显示 MTP-5 引起的平均波动不超过 0.06 个绝对百分点。这与验证机制相符:MTP 猜对时加速,猜错时缩短接收前缀,最终输出仍由验证后的自回归路径决定。

但论文中有一个值得注意的呈现问题:表 4 的 MTP-5 数值与表 1 最终 ParaASR 的个别结果并不完全一致,例如表 1 的 VoxPopuli 为 2.76%,表 4 为 3.69%;表 1 的 FLEURS zh 为 2.63%,表 4 为 2.76%。这可能意味着消融使用了独立的配对 checkpoint 或不同实验产物,但论文没有明确解释。因此,表 4 适合用来观察“加入 MTP 前后”的相对变化,不宜与表 1 的最终模型逐项拼接。

十二、论文的价值与局限

值得肯定的地方

  • 抓住了 ASR 的任务特性:音频为未来 token 提供强约束,使 MTP 比开放式生成更容易获得长连续接收前缀。
  • 没有用小模型换速度:ParaASR 保留 4B 解码器的语言能力,通过减少串行步数提高吞吐。
  • 训练流程风险较低:先训练可靠 ASR,再分阶段加入 MTP,避免辅助目标破坏主干。
  • 兼顾长音频:32K 上下文、80ms 音频表征和 5 万小时长音频监督共同服务于会话级一致性。
  • 实验不只报告精度:同时给出 RTF、逐位置接收率、平均接收长度和配对消融。

仍需谨慎看待的地方

  • 论文使用大量私有数据,约 10 万小时短音频中公有与私有数据的具体比例没有披露。
  • 摘要页面没有给出代码、模型权重或完整数据发布地址,关键结果暂时难以由外部团队完整复现。
  • 4B 文本解码器的具体基础模型名称没有明确披露,音频编码器只说明初始化自公开全模态基础。
  • Doubao API 与本地 H800 的效率结果不在完全一致的硬件和服务链路下。
  • “最长 30 分钟一次转写”是重要能力,但论文没有单独展示不同音频长度下的显存、吞吐、延迟和错误率曲线。
  • 平均成绩领先,但在部分领域和数据集上仍落后于其他模型,实际部署仍需按目标场景复测。

结语

ParaASR 的核心贡献不是简单地给 ASR 换上一个更大的 LLM,而是重新处理“大解码器质量高、逐 token 推理慢”的矛盾。它利用语音转写的确定性,同时预测多个未来 token,再由自回归路径验证,使一次 4B 解码器前向计算平均输出 5.0 个已验证 token。

从论文结果看,MTP-5 几乎没有改变识别错误率,却把系统 RTF 降到 0.0053,并保留 32K 长上下文和最长约 30 分钟的单次转写能力。这说明在语音识别这类有外部输入强约束的生成任务中,模型规模与推理速度并不必然冲突:只要未来 token 足够可预测,并且存在可靠验证路径,大模型也可以通过提高单步有效输出量实现低延迟服务。

下一步真正决定 ParaASR 影响力的,将是模型与代码是否开放、外部团队能否复现 RTF 和长音频结果,以及它在电话、会议、方言、强噪声和专业领域中的实际稳定性。

发表评论

您的电子邮箱地址不会被公开。 必填项已用*标注