本文提出 Turnslide,一种全自动、轻量级的多轮工具调用数据合成框架,旨在解决小型语言模型微调时缺乏按 API 定制数据、现有合成方法成本过高的问题。其核心思路是将每个 API 建模为有限状态机,用抽象状态决定各工具何时可被调用,从而生成状态合法的工具调用序列,再通过单次大模型调用将序列转化为完整训练样本。与以往追求多样性不同,该方法直接设定对话轮数、工具序列和任务复杂度的目标分布。作者以微调小型模型后的下游准确率衡量数据质量,结果显示基于有限状态机的生成显著优于未变异基线,在对比现有方法时取得 70.7% 的完全准确率,高于 63.4% 和 53.7%,且 token 消耗减少 3.6 至 6.6 倍。该工作为高规模多轮工具调用微调提供了一种可扩展、低成本的数据合成路径。
| 有限状态机 (Finite-State Machine, FSM) | 一种计算模型,由有限个状态及状态间的转移组成,此处用于抽象表示 API 的调用规则。 |
| 多轮工具调用 (Multi-Turn Tool Calling) | 语言模型在多次交互中连续调用外部工具或 API 以完成复杂任务的能力。 |
| 小型语言模型 (Small Language Models, SLMs) | 参数量较少、计算资源需求低、易于部署的语言模型,通常指 10B 参数以下的模型。 |
| 数据合成 (Data Synthesis) | 通过算法自动生成训练数据的过程,用于弥补真实标注数据的不足。 |
| 状态有效序列 (State-Valid Sequences) | 在有限状态机中,符合状态转移规则、不会导致非法状态转移的工具调用序列。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅