本文研究如何利用大语言模型实现端到端的商业智能(BI)自动化。传统BI流程要求用户手动完成识别相关数据表、数据转换、建立连接关系等繁琐的准备工作,之后才能回答业务问题。为系统评估LLM在这一任务上的能力,作者从公开来源收集了大量真实BI项目,并从实际用户仪表盘中人工提取“问题—标准答案”数据对,构建了首个端到端BI基准BI-Bench。测试发现,即便是前沿LLM在BI-Bench上的准确率也不足50%。为此,作者设计了工具增强的BI-Agent,将BI工作流拆解为搜索、连接、转换等结构化数据子任务,并编排专门的数据管理方法;同时提出后训练框架,从真实BI项目合成训练轨迹,结合监督微调与强化学习进一步优化。结果显示,BI-Agent相较原始LLM最高提升40个百分点,后训练版本再提升最多30个百分点。该工作表明,工具增强推理与领域特定后训练相结合,是应对复杂BI流程的有效路径。
| BI-Bench | 首个系统评估大语言模型端到端商业智能能力的基准测试集,包含从真实用户仪表板中提取的问题与真实答案对。 |
| BI-Agent | 一种工具增强的智能体,将商业智能工作流程分解为搜索、连接、转换等子任务,并编排专门的数据管理方法。 |
| 端到端商业智能 | 指用户无需手动执行数据准备步骤,直接由模型完成从数据准备到回答业务问题的全过程。 |
| 监督微调(SFT) | 一种后训练方法,使用标注数据对预训练模型进行有监督的微调,以提升特定任务性能。 |
| 强化学习(RL) | 一种通过与环境交互、根据奖励信号优化策略的机器学习方法,用于后训练智能体以改进决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅