Qwen3.8-LiveTranslate:平均滞后降到 2.3 秒,实时同传开始能用了

2026-09-19 语音多模态Qwen产品能力

Qwen 团队在 9 月 18 日发布了 Qwen3.8-LiveTranslate,做的是实时同声传译。核心变化是用 Interleave 架构把整个任务重构成一条「音频与文本交织」的单一流——已经听过的音频和已经产出的译文都能被缓存复用,于是翻译质量和延迟同时改善:平均滞后(LAAL)从上一代的 2.8 秒降到 2.3 秒

除了快,这次新增的三项能力更贴近真实场景:

  • 实时说话人分离。 几个人轮流发言时,模型能区分不同说话人各自说了什么,译出的语音也能更稳定地保留各人音色。多人会议场景之前基本没法用,现在至少有了可用基线。
  • 原文与译文同步输出。 同屏双语,既方便即时理解也方便回头核对。官方说这是给字幕显示、内容整理、检索这些后续能力留的接口。
  • 长上下文消歧。 用前面的对话历史来消解专有名词和指代的歧义,长会话里人名、术语的一致性明显更好。

评测口径也给了:覆盖 60 种语言,在公开数据集 FLEURS 的音频测试集上跑了 70 个语向,在翻译质量、平均滞后、语音识别准确率、语音合成质量四个维度上都优于上一代和当前主流实时翻译系统。

0.5 秒听起来不多,用起来是两回事。同传这门技术的分水岭不在「准不准」,在「跟不跟得上」——超过大约 3 秒的滞后,听众的注意力会开始往别处走,会议节奏直接崩掉。2.3 秒意味着它终于可以被当作一个产品组件来规划,而不是一个 demo。

对一人公司来说,有几条现成的路:

  • 跨境沟通类产品有了现成的底层。 做外贸、做跨文化社群、做出海内容的人,之前要么花钱找同传、要么让对方看字幕,现在可以考虑把翻译做进产品,成本是可计算的 API 费用。
  • 直播和线上活动可以双语同开。 中文播主面向海外观众、或者反过来,实时双语字幕 + 译制语音是一套能卖的功能。
  • 从「转写再做字幕」升级到「边说边出」。 如果你的内容生产流程里还有「录完 → 转写 → 翻译 → 校对 → 压制」这几步,这条链路有可能压缩成一次性的实时处理,省掉中间几趟人工。

要泼的冷水:

  • 2.3 秒是平均值,复杂长句、专有名词密集的场景实际体感会更慢。要在自己的真实内容上测,别看榜单。
  • 同流涉及用户语音数据,走 API 之前先想清楚合规和客户能否接受;涉密或敏感的场合仍然应该走本地部署。
  • 各家这类模型的评测基本都是自家跑的,横向可比性有限,选型时自己拿同一段音频跑一遍更有说服力。

建议:如果你手上有跨境沟通或双语内容的场景,先别急着重构产品——拿一段真实的 10 分钟会议录音做一次端到端试验,重点看两件事:专有名词是否被译错、多人发言时归属是否混乱。这两项过关,再谈接入。

原文出处 · 事实以此为准
Qwen
阅读原文 ↗