Meta杀入实时语音转写赛道:基准测试力压OpenAI、谷歌,API价格低至每小时0.18美元
原标题:Meta(META.US)杀入实时语音转写赛道:基准测试力压OpenAI、谷歌(GOOGL.US),API价格低至每小时0.18美元
作者:智通财经赵锦彬

题图来源 | Unsplash
智通财经 APP 获悉,近日,Meta 旗下超级智能实验室(Superintelligence Labs)正式推出实时语音识别模型 Muse Voice Transcribe。该模型在部分基准测试中超越 OpenAI、谷歌等竞争对手的同类产品,并以每小时 0.18 美元的 API 价格进入市场。不过,Meta 方面确认,该模型不会开放权重。
据了解,在 Artificial Analysis 的 AA-WER Streaming 英语语音转写准确率基准上,Muse Voice Transcribe 的词错率为 3.1%,优于 Cartesia Ink-2 的 3.4%、ElevenLabs Scribe v2 Real-time 的3.6%、OpenAI GPT Live Transcribe 的 3.9% 以及谷歌 Gemini 3.5 Transcribe Live 的 4.0%。
在说话人区分能力上,各模型整体表现仍难令用户满意,但 Muse Voice Transcribe 在多个标准基准中的平均错误率为 17.5%,同样处于领先位置。
据 Meta 介绍,该模型可区分超过 20 位说话人,并支持超过 70 种语言,其中 25 种经过“广泛验证”,还能处理多语者在对话中切换语言以及超过一小时的长时间对话。
Muse Voice Transcribe 目前已通过 Meta Model API、Meta AI for Mac 和 Muse Code 提供。API 定价为每 1000 音频分钟 3 美元,折合每小时 0.18 美元。与 Meta 此前 Muse Glimmer 系列开放权重的做法不同,Meta 发言人向 The New Stack 确认,该模型不会公开权重。
技术层面,Muse Voice Transcribe 属于 Muse Spark 家族的自回归多模态模型。音频以 80 毫秒为单位输入,每秒约 12.5 个块,每块被压缩为单个软 token。模型在每个块上做出选择:要么输出文本 token,要么输出特殊的“下一音频”占位符,等待更多音频上下文。当音频结束时,“空音频”令牌会触发模型输出剩余文本。
这种机制使模型能自行控制延迟,Meta 称之为“自适应延迟”。简单词汇几乎可以即时转写,复杂词汇则获得更多音频上下文。该权衡在强化学习阶段被训练,词错率奖励与延迟奖励采用相乘而非相加的方式优化。说话人识别也使用类似机制。
今夏,实时语音转写已成为 AI 领域竞争最激烈的细分市场之一。近期 OpenAI、谷歌、xAI、阿里巴巴等公司均在数周内密集发布流式语音模型,专业厂商也已深耕多时。而 Muse Voice Transcribe 目前 0.3 个百分点的基准领先优势,在这种竞争强度下很难长期保持。
不过,对 Meta 而言,智能眼镜、Mac 应用等核心产品都需要实时语音能力作为底层支撑。这一内生需求可能促使 Meta 在该赛道持续投入,而非仅追求外部 API 市场份额。
文章信息来自于智通财经App,不代表白鲸出海官方立场,内容仅供网友参考学习。对于因本网站内容所引起的纠纷、损失等,白鲸出海均不承担侵权行为的连带责任。如若转载请联系原出处。
友情提醒:白鲸出海目前仅有微信群与QQ群,并无在Telegram等其他社交软件创建群,请白鲸的广大用户、合作伙伴警惕他人冒充我们,向您索要费用、骗取钱财!
本文相关公司
Meta认证



闽公网安备35010402350923号