Muse Voice Transcribe:实时听写、分人、断句一次做完
别再把 ASR、说话人分离、endpointing 三套模型拼起来。Meta Superintelligence Labs 把它们塞进同一个实时模型。
2026 年 9 月 1 日,Meta 发布 Muse Voice Transcribe——Muse Spark 家族里第一款实时音频感知模型。官方演示里八个人同场说话,模型能标出谁说了什么;中英夹杂的句子也能跟。
怎么工作
音频按 80ms 一块(12.5 Hz)切成 soft token。每块之后模型二选一:继续听(输出 <|next_audio|>),或吐出文字。流停了会插入 <|empty_audio|>,把剩下的字一口气打完。
延迟是自适应的:难词多等一会儿,简单词尽快出。用强化学习同时压 WER 和 delay,在「速度—准确率」曲线上走到 Pareto 前沿。截至 2026-09-01,Artificial Analysis 流式语音转写榜上它排第一。
分人与断句
- 说话人切换用
<|start_of_turn|>,说话人用<|speaker_A–Z|>,支持 20 人以上。 - Endpointing 用
<|speech_onset|>/<|speech_endpoint|>,方便语音代理判断你说完了没有。 - 训练覆盖 70+ 语言,首发推荐先试已充分验证的 25 种;原生支持句内/句间 code-switching,还能做语言、关键词、上下文 biasing。
- 单段音频可超过一小时,不需要事后拼补。
怎么用
目前走 Meta Model API、Meta AI for Mac,以及 Muse Code。在 Meta AI / Muse Code 里按住 Fn 就能对着任意窗口听写。和 Llama 不同,这次权重不开源。
主要依据 Meta AI Research Introducing Muse Voice Transcribe(2026-09-01)。