全双工语音模型工具调用新架构:召回率92-97%,还能拒绝无关调用!
A frontend-backend architecture for tool calls in full-duplex speech models
arXiv CL (cs.CL) 重要 Agent多模态论文方法 🕐 09-18 12:00

📖 AI 总结

本文提出一种前后端分离架构,用于解决全双工语音对话模型调用外部工具的问题。其核心思路是让双工语音转文本前端学习发出“委派令牌”,将流式识别文本转发给基于文本的后端大模型执行工具调用,再通过轻量级预填充与重复机制把结果注入前端,经流式语音合成返回用户。该方案对前端模型改动极小,基本保留了正常的双工轮次切换、打断处理和低延迟交互特性。在单轮工具调用评测中,系统取得92%至97%的调用召回率,拒绝无关调用的准确率为81.2%;搭配更大后端模型时,在Full-Duplex-Bench-V3上表现与开源及闭源模型相当,并在EVA-Bench上显著优于GPT-realtime-mini和Qwen3-Omni-30B-A3B-Instruct。结果表明,后端委派是一种兼具模块化与有效性的方案,能在保持自然双工语音交互的同时赋予模型强大的智能体工具调用能力。

🔑 关键词速览

Full-duplex speech-to-speech (S2S)全双工语音到语音模型,可同时听与说,实现自然低延迟的实时对话交互。
Delegation token委托令牌,由前端模型发出的特殊标记,用于指示后端LLM需要执行工具调用。
Prefill-and-repeat mechanism预填充-重复机制,一种轻量级方法,将后端工具调用结果重新注入前端模型以继续生成语音。
Streaming ASR流式自动语音识别,实时将语音转写为文本,无需等待完整音频输入。
Tool-call recall工具调用召回率,衡量系统正确识别并触发所需工具调用的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅