论文:https://arxiv.org/abs/2607.29279
大语言模型正在成为自动语音识别的新型解码器:它能更好地处理同音词、标点恢复、专有名词、中英文混说和长距离上下文,但也带来了一个直接问题——解码器越大,每生成一个 token 的成本越高,长音频转写尤其容易受到延迟限制。
StepFun 团队在论文《ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition》中提出 ParaASR。它使用冻结的 0.6B 音频编码器和 4B 稠密 Transformer 解码器,并在解码器后加入五个 Multi-Token Prediction(MTP)分支,让模型每次前向计算最多提出 6 个 token,再通过自回归路径验证并接收其中正确的连续前缀。
论文报告 ParaASR 平均每次前向计算可接收 5.0 个 token,在单张 NVIDIA H800、单并发条件下达到 0.0053 的实时因子(RTF)。模型保留原生 32K 上下文,可在一次解码会话中处理最长约 30 分钟音频。其中文、英文和长音频基准平均错误率分别为 2.97%、3.68% 和 3.70%。
| 论文 | ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition |
|---|---|
| 机构 | StepFun,合作作者来自 NTU、PKU、UNSW、SJTU、USTC |
| 版本 | arXiv:2607.29279v1,2026 年 7 月 31 日 |
| 模型规模 | 0.6B 音频编码器 + 4B LLM 解码器 + 5 个 MTP 分支 |
| 核心能力 | 多 token 并行提议、自回归验证、32K 长上下文、最长约 30 分钟单次转写 |

一、研究背景:大解码器带来质量,也带来逐 token 延迟
传统 ASR 主要围绕 CTC、Transducer 或声学序列建模展开。近年来,系统逐渐转向“音频编码器 + 适配器 + 大语言模型解码器”的架构:音频编码器提取声学证据,LLM 根据音频表征和已经生成的文本继续写出转录结果。
这种架构能够借助大模型的语言知识解决许多并非纯声学的问题,例如:
- 同音词和上下文歧义;
- 中英文代码切换;
- 标点恢复与逆文本规范化;
- 人名、地名和专业术语;
- 会议、广播等长音频中的全局一致性。
问题在于,标准自回归解码一次通常只生成一个 token。设音频为 a,此前已经生成的文本为 x≤t,则下一 token 的预测过程为:
如果输出序列包含 N 个 token,解码器就需要大约 N 次串行前向计算。解码器从 1B 扩大到 4B 后,语言建模能力增强,但每个 token 都要支付更高的计算成本。长音频同时需要更多输出 token 和更长上下文,因此矛盾更加明显。
二、核心洞察:ASR 比开放式文本生成更适合 MTP
ParaASR 的核心判断是:语音识别并不是开放式创作。文本大模型写故事时,后续内容可能存在大量合理分支;但 ASR 的目标是忠实恢复已经存在于音频中的内容。给定音频和当前转录前缀后,局部未来具有更强的确定性。
因此,模型可以在预测下一 token 的同时,让多个辅助分支分别预测更远位置:
\(p_{t,h}=P\!\left(x_{t+1+h}\mid a,x_{\le t}\right),\qquad h\in\{1,\ldots,5\}\)主分支负责 xₜ₊₁,五个 MTP 分支分别预测 xₜ₊₂ 到 xₜ₊₆,一次前向计算形成六 token 提议。和直接并行输出不同,ParaASR 不会无条件采纳这些未来 token,而是只接收与标准自回归路径一致的最长连续前缀。
若 MTP 提议为 ẋ,自回归验证结果为 x*,接收长度可以抽象表示为:
一旦第 k+1 个提议与正常解码路径不一致,该位置及其后的提议全部拒绝,模型从已验证前缀继续自回归解码。正确预测能够减少前向次数,错误预测最多只是缩短本次接收长度,不会直接改变最终转录结果。这是论文把 MTP 称为“安全加速模块”的原因。
三、ParaASR 模型架构
ParaASR 的主干没有刻意设计得很复杂,而是在标准音频语言模型上重点改造解码路径。
| 模块 | 设计 | 作用 |
|---|---|---|
| 音频编码器 | 0.6B Transformer,初始化自公开全模态基础模型,训练期间保持冻结 | 提取音频声学表征 |
| 时间下采样 | 8 倍下采样,每 80ms 产生一个声学 embedding | 降低长音频输入序列长度 |
| 适配器 | 线性映射层 | 把声学 embedding 投影到语言解码器的隐藏空间 |
| 文本解码器 | 4B 稠密 Transformer,初始化自预训练文本 LLM | 根据音频和文本前缀生成转录 |
| 上下文 | 原生 32K context | 支持最长约 30 分钟音频单次转写 |
| MTP 模块 | 5 个未来 token 分支 | 与主分支共同提出最多 6 个 token |

MTP 分支内部如何连接
每个 MTP Block 同时接收上一个分支的隐藏状态和经过位移的 token embedding。两路输入分别归一化后拼接,通过线性层恢复到解码器隐藏维度,再进入一个解码器式 Transformer Block。所有 MTP 分支与主干共享词嵌入层和词表输出头,使未来 token 提议尽可能保持与主解码器一致的语言空间。
32K 上下文与 80ms 声学 embedding 是长音频能力的基础。论文声称该组合可让模型直接处理最长约 30 分钟音频,从而避免传统“VAD 切片—逐段识别—文本拼接”带来的边界错误和跨片段实体不一致。
四、三项主要创新
- 把语音的确定性转化为解码并行度:论文没有单纯压缩解码器,而是利用音频对输出文本的强约束,让 4B LLM 可以一次预测多个未来 token。
- 多 token 提议与自回归验证结合:MTP 负责加速,标准解码路径负责最终正确性;错误提议只影响速度,不直接决定输出。
- 短音频精度、长音频一致性和推理速度统一训练:模型先建立可靠的自回归 ASR,再训练 MTP 分支,避免并行目标从训练初期干扰识别能力。
严格来说,MTP 和投机解码并非论文首次提出。ParaASR 的价值主要在于证明:与开放式语言生成相比,ASR 的声学锚定特性使未来 token 更容易预测,因此能够获得更高的连续接收率,并在较大解码器上实现实际的系统加速。
五、训练数据:1.356T 预训练 token、10 万小时短音频与 5 万小时长音频
1. 音频语言基础预训练
ParaASR 继承公开音频语言基础模型的分阶段预训练方案,总规模为 1.356T 文本和音频 token:
| 阶段 | 数据规模 | 目标 |
|---|---|---|
| 语音—文本对齐 | 100B ASR token,12K steps | 冻结音频编码器和 LLM,仅学习音频适配器到文本 embedding 空间的映射 |
| 音频 token 扩展 | 128B 文本 + 128B 音频 token | 加入 6.6K 个离散音频 token,训练 TTS、语音到语音等统一能力 |
| 统一多模态预训练 | 800B token,其中包含 400B 文本 | 混合 ASR、TTS、语音翻译以及文本—语音交错续写 |
| Cooldown 与能力扩展 | 200B 高质量 token | 增强副语言理解和多语种 ASR,并使用覆盖 5 万个说话人的会话式语音合成数据 |
2. 约 10 万小时短音频监督数据
短音频 SFT 数据由主流公开语料和大量私有数据构成,每条样本不超过 30 秒。数据覆盖普通话、英语、频繁中英文切换、主要汉语方言和地域口音,同时包含专业术语、远场录音和高噪声环境。论文称私有数据经过人工核验,以保证音频与转录的高质量对齐。
3. 约 5 万小时长音频伪标签数据
长音频数据不是直接使用单一 ASR 模型生成标签,而是采用多系统校验:
- 用 VAD 把原始长录音切成不超过 30 秒的语音片段;
- 使用三个 ASR 系统分别转写;
- 统一大小写、标点和表面格式;
- 中文按字、英文按词执行 ROVER 对齐和投票;
- 一个文本单元至少获得两个系统支持才被接收;
- 过滤分歧率超过 5% 的片段;
- 重新拼接相邻片段,并使用 LLM 恢复标点、执行 ITN 和统一全局实体。
论文用下面的分歧率作为伪标签可靠性代理指标:
\(\hat{e}=\frac{\#\,\mathrm{disagreed\ positions}}{\#\,\mathrm{text\ units}}\)当 ê > 0.05 时,片段被丢弃。最后的 LLM session-level refinement 很关键:它不是只修正单个短片段,而是在整个会话范围内统一反复出现的人名、术语和实体,减少长音频拼接后的前后不一致。

六、训练流程:先做好 ASR,再训练 MTP 加速器
ASR 监督微调
训练采用对话式指令格式:system prompt 指定转写任务,user 输入音频特征,assistant 输出语言标签和转录文本。为提高噪声鲁棒性,训练集中还加入纯非语音或严重噪声输入,目标输出为非语音标签和空文本。
- 训练序列预算:32K token;
- 声学增强:SpecAugment 式时间遮挡和频率遮挡;
- 音频编码器:保持冻结;
- 优化模块:线性适配器和 4B 语言解码器;
- 训练步数:10K;
- 峰值学习率:
2×10⁻⁵; - 全局 batch size:32;
- warmup:100 steps;
- 余弦衰减终点:
1×10⁻⁶。
MTP 第一阶段:冻结主干,对齐未来分支
在已经收敛的 ASR 解码器后加入五个 MTP Block。每个 MTP Block 的 Transformer 层从解码器最后一层初始化,分支专用投影层随机初始化。此时只训练 MTP 模块,主干、共享 embedding 和 LM Head 全部冻结,峰值学习率为 2×10⁻⁴。
MTP 第二阶段:联合校准
未来分支初步对齐后,模型解冻适配器和语言解码器,以更低的 2×10⁻⁵ 学习率联合优化。论文称两阶段沿用 32K 序列预算、全局 batch size 32 和 10K-step 训练配置。
越远的 token 越难预测,因此 MTP 分支损失采用指数衰减权重:
\(w_h=\frac{\alpha^{h-1}}{\sum_{j=1}^{H}\alpha^{j-1}},\qquad H=5,\quad \alpha=0.9\)每个位置的总目标由标准下一 token 交叉熵和五个未来 token 交叉熵构成:
\(\mathcal{L}_t=\mathrm{CE}(p_t,x_{t+1})+\sum_{h=1}^{H}w_h\,\mathrm{CE}(p_{t,h},x_{t+1+h})\)损失只作用于转录 token。这样的分阶段设计避免随机初始化的 MTP 分支在早期破坏已经稳定的识别主干。
七、实验设置
论文从识别精度、长音频能力和推理效率三个方面评估 ParaASR。主要对比模型包括 VibeVoice-ASR、FunASR-Nano、Doubao-ASR-2603 和 Qwen3-ASR-1.7B。
- 除 Doubao-ASR-2603 使用官方 API 外,其余模型均部署在单张 NVIDIA H800 上;
- 推理采用单并发;
- 不原生支持长音频的模型使用 VAD 切成最长 30 秒片段;
- 中文使用 CER,英文与长音频使用 WER;
- 基准覆盖 AISHELL-1/2、WenetSpeech、FLEURS、LibriSpeech、Common Voice、VoxPopuli cleaned AA 和 Earnings22 cleaned AA;
- Wenet testnet long 由同一来源会话中的相邻片段拼接构造。
错误率的通用定义为:
\(\mathrm{ER}=\frac{S+D+I}{N}\)其中 S、D、I 分别代表替换、删除和插入错误;中文以字符数作为 N,得到 CER,英文以词数作为 N,得到 WER。
八、识别效果:平均成绩领先,但并非每个数据集都第一
| 评测类别 | VibeVoice-ASR | FunASR-Nano | Doubao-ASR-2603 | Qwen3-ASR-1.7B | ParaASR |
|---|---|---|---|---|---|
| 中文平均 CER | 10.19 | 3.66 | 3.34 | 3.17 | 2.97 |
| 英文平均 WER | 7.14 | 5.24 | 6.67 | 3.85 | 3.68 |
| 长音频平均 WER | 4.87 | 5.59 | 6.11 | 4.20 | 3.70 |
相对 Qwen3-ASR-1.7B,ParaASR 的中文平均错误率相对下降约 6.3%,英文下降约 4.4%,长音频下降约 11.9%。其中代表性结果包括:
- AISHELL-1 CER:0.71%;
- AISHELL-2 iOS CER:2.29%;
- LibriSpeech clean WER:1.38%;
- LibriSpeech other WER:3.16%;
- LibriSpeech clean long WER:1.27%;
- LibriSpeech other long WER:2.90%。
不过,“平均第一”不等于所有数据集都第一。ParaASR 在 Wenet testnet、Wenet testmeeting、Common Voice、FLEURS en、Wenet testnet long 和 Earnings22 等数据集上仍落后于部分基线。例如 Wenet testnet 上 Doubao-ASR-2603 为 4.03%,ParaASR 为 4.54%;Earnings22 上 VibeVoice-ASR 为 5.62%,ParaASR 为 6.52%。这说明 ParaASR 的优势更接近整体质量—效率前沿,而不是对所有领域实现绝对统治。
九、推理效率:4B 解码器比 1.7B 基线更快
实时因子定义为处理时间与音频时长之比:
\(\mathrm{RTF}=\frac{T_{\mathrm{inference}}}{T_{\mathrm{audio}}}\)| 模型 | RTF | 相对 ParaASR |
|---|---|---|
| VibeVoice-ASR | 0.1039 | 约慢 19.6 倍 |
| FunASR-Nano | 0.0591 | 约慢 11.2 倍 |
| Doubao-ASR-2603 | 0.0640 | 约慢 12.1 倍 |
| Qwen3-ASR-1.7B | 0.0094 | 约慢 1.77 倍 |
| ParaASR | 0.0053 | 基准 |
RTF 0.0053 意味着在论文条件下,处理 30 秒音频约需 0.159 秒。RTF 测试使用 100 条、每条 30 秒的音频。尽管 ParaASR 使用 4B 解码器,它仍比 Qwen3-ASR-1.7B 的 0.0094 更快,说明多 token 接收抵消了更大解码器的单步成本。
需要注意,Doubao-ASR-2603 通过官方 API 测试,而其他模型运行在本地 H800 上,因此这项 API 与本地部署之间的 RTF 对比并非完全同条件。
十、为什么选择 MTP-5,而不是更多分支
| 配置 | 各位置接收率 | 平均接收长度 |
|---|---|---|
| MTP-3 | 0.96 / 0.88 / 0.80 | 3.6 / 4 |
| MTP-5 | 0.95 / 0.88 / 0.80 / 0.71 / 0.64 | 5.0 / 6 |
| MTP-7 | 0.96 / 0.88 / 0.80 / 0.72 / 0.65 / 0.59 / 0.53 | 6.1 / 8 |
从 MTP-3 增加到 MTP-5,平均接收长度从 3.6 提升到 5.0,增长约 39%;继续增加到 MTP-7,平均接收长度只提高到 6.1,增幅约 22%。越靠后的 token 接收率越低,第七位置只有 0.53。
生产推理中,较远位置预测失败会造成 KV Cache 回滚并打断连续解码,分支数量过多的维护成本可能抵消额外接收的少量 token。因此论文最终选择 MTP-5 作为并行度、接收率和工程复杂度之间的平衡点。
十一、消融实验:MTP 基本不改变识别精度
| 类别 | 不使用 MTP | MTP-5 | 变化 |
|---|---|---|---|
| 中文平均 CER | 3.00 | 3.00 | 0.00 |
| 英文平均 WER | 3.83 | 3.87 | +0.04 |
| 长音频平均 WER | 3.63 | 3.69 | +0.06 |
配对消融显示 MTP-5 引起的平均波动不超过 0.06 个绝对百分点。这与验证机制相符:MTP 猜对时加速,猜错时缩短接收前缀,最终输出仍由验证后的自回归路径决定。
但论文中有一个值得注意的呈现问题:表 4 的 MTP-5 数值与表 1 最终 ParaASR 的个别结果并不完全一致,例如表 1 的 VoxPopuli 为 2.76%,表 4 为 3.69%;表 1 的 FLEURS zh 为 2.63%,表 4 为 2.76%。这可能意味着消融使用了独立的配对 checkpoint 或不同实验产物,但论文没有明确解释。因此,表 4 适合用来观察“加入 MTP 前后”的相对变化,不宜与表 1 的最终模型逐项拼接。
十二、论文的价值与局限
值得肯定的地方
- 抓住了 ASR 的任务特性:音频为未来 token 提供强约束,使 MTP 比开放式生成更容易获得长连续接收前缀。
- 没有用小模型换速度:ParaASR 保留 4B 解码器的语言能力,通过减少串行步数提高吞吐。
- 训练流程风险较低:先训练可靠 ASR,再分阶段加入 MTP,避免辅助目标破坏主干。
- 兼顾长音频:32K 上下文、80ms 音频表征和 5 万小时长音频监督共同服务于会话级一致性。
- 实验不只报告精度:同时给出 RTF、逐位置接收率、平均接收长度和配对消融。
仍需谨慎看待的地方
- 论文使用大量私有数据,约 10 万小时短音频中公有与私有数据的具体比例没有披露。
- 摘要页面没有给出代码、模型权重或完整数据发布地址,关键结果暂时难以由外部团队完整复现。
- 4B 文本解码器的具体基础模型名称没有明确披露,音频编码器只说明初始化自公开全模态基础。
- Doubao API 与本地 H800 的效率结果不在完全一致的硬件和服务链路下。
- “最长 30 分钟一次转写”是重要能力,但论文没有单独展示不同音频长度下的显存、吞吐、延迟和错误率曲线。
- 平均成绩领先,但在部分领域和数据集上仍落后于其他模型,实际部署仍需按目标场景复测。
结语
ParaASR 的核心贡献不是简单地给 ASR 换上一个更大的 LLM,而是重新处理“大解码器质量高、逐 token 推理慢”的矛盾。它利用语音转写的确定性,同时预测多个未来 token,再由自回归路径验证,使一次 4B 解码器前向计算平均输出 5.0 个已验证 token。
从论文结果看,MTP-5 几乎没有改变识别错误率,却把系统 RTF 降到 0.0053,并保留 32K 长上下文和最长约 30 分钟的单次转写能力。这说明在语音识别这类有外部输入强约束的生成任务中,模型规模与推理速度并不必然冲突:只要未来 token 足够可预测,并且存在可靠验证路径,大模型也可以通过提高单步有效输出量实现低延迟服务。
下一步真正决定 ParaASR 影响力的,将是模型与代码是否开放、外部团队能否复现 RTF 和长音频结果,以及它在电话、会议、方言、强噪声和专业领域中的实际稳定性。
