abc小站

2026-09-03

Muse Voice Transcribe:实时听写、分人、断句一次做完

别再把 ASR、说话人分离、endpointing 三套模型拼起来。Meta Superintelligence Labs 把它们塞进同一个实时模型。

2026 年 9 月 1 日,Meta 发布 Muse Voice Transcribe——Muse Spark 家族里第一款实时音频感知模型。官方演示里八个人同场说话,模型能标出谁说了什么;中英夹杂的句子也能跟。

怎么工作

音频按 80ms 一块(12.5 Hz)切成 soft token。每块之后模型二选一:继续听(输出 <|next_audio|>),或吐出文字。流停了会插入 <|empty_audio|>,把剩下的字一口气打完。

延迟是自适应的:难词多等一会儿,简单词尽快出。用强化学习同时压 WER 和 delay,在「速度—准确率」曲线上走到 Pareto 前沿。截至 2026-09-01,Artificial Analysis 流式语音转写榜上它排第一。

分人与断句

怎么用

目前走 Meta Model API、Meta AI for Mac,以及 Muse Code。在 Meta AI / Muse Code 里按住 Fn 就能对着任意窗口听写。和 Llama 不同,这次权重不开源。

主要依据 Meta AI Research Introducing Muse Voice Transcribe(2026-09-01)。