HeadlinesBriefing favicon HeadlinesBriefing.com

Meta实时音频模型转录20+说话者

Engadget •
×

Meta推出了其首个实时音频模型Muse Voice Transcribe,来自Meta超级智能实验室(MSI)。该模型可处理超过20位说话者的听写和转录,并同时无缝处理多种语言。Meta首席执行官马克·扎克伯格分享了一个示例,展示了该模型区分说话者和在语言之间切换(包括“语码转换”)的能力。

“模型决定何时倾听。它在难词上等待更长时间,在简单词上更快提交,使用自适应延迟来预测每个标记并提高准确性,”扎克伯格解释道。“它也能应对嘈杂的真实音频——在70多种语言上训练(发布时验证了25种),处理句中语码转换,并管理20多位说话者长达一小时的会话。”

Meta的发布紧随Google Gemini 3.5 Transcribe不到一周。谷歌正在将其模型集成到Android和Chrome中,而Meta对Muse Voice Transcribe的计划仍不明确。目前,该模型为Meta Mac应用中的听写提供支持,并可通过Muse Code和Meta的模型API提供给开发者,定价为每1000音频分钟3美元

这是MSL的最新发布,继编码代理和开放权重模型之后。演示可在Meta的研究博客上获取。

关键实体:公司:Meta、Google、Muse、MSI | 人物:马克·扎克伯格、亚历山德·王

常见问题:什么是Muse Voice Transcribe?

Muse Voice Transcribe是Meta的首个实时音频感知模型,可同时处理超过20位说话者的听写和转录以及多种语言。

常见问题Q:什么是Muse Voice Transcribe?

常见问题A:Muse Voice Transcribe是Meta的首个实时音频感知模型,可同时处理超过20位说话者的听写和转录以及多种语言。