SpaceXAI发布了语音转文字模型Grok Voice Transcribe 2.0,官方称其在相同价格下准确率较1.0版本提升一倍,定价为每小时0.10美元。该模型针对噪声电话线路、多人同时说话、地方口音及口语化凭证等困难音频场景优化,支持批处理和实时流式两种模式,通过语音转文字API以托管形式提供服务,模型ID为grok-voice-transcribe-2.0,但未开放权重,无法自行部署。据SpaceXAI报告,该模型在Artificial Analysis公开排行榜的32个流式模型中准确率排名第一,并在电话、对话、凭证和短语四组内部测试集上均优于1.0版本,其中电话场景领先所有受测模型。模型支持数十种语言并自动检测语种,还能处理录音中途的语言切换。不过上述内部结果均为厂商自报,尚未经独立复现验证。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅