🔥 今日值得一读 前沿LLM做商业智能准确率不到50%,新Agent框架直接自动化端到端BI流程!
BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
arXiv LG (cs.LG) 🔥 重点 #Agent#商业智能#评测基准 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
用LLM自动完成选表、转换、连接等BI数据准备,开发者可构建自动化数据分析Agent。

📖 AI 总结

本文研究如何利用大语言模型实现端到端的商业智能(BI)自动化。传统BI流程要求用户手动完成识别相关数据表、数据转换、建立连接关系等繁琐的准备工作,之后才能回答业务问题。为系统评估LLM在这一任务上的能力,作者从公开来源收集了大量真实BI项目,并从实际用户仪表盘中人工提取“问题—标准答案”数据对,构建了首个端到端BI基准BI-Bench。测试发现,即便是前沿LLM在BI-Bench上的准确率也不足50%。为此,作者设计了工具增强的BI-Agent,将BI工作流拆解为搜索、连接、转换等结构化数据子任务,并编排专门的数据管理方法;同时提出后训练框架,从真实BI项目合成训练轨迹,结合监督微调与强化学习进一步优化。结果显示,BI-Agent相较原始LLM最高提升40个百分点,后训练版本再提升最多30个百分点。该工作表明,工具增强推理与领域特定后训练相结合,是应对复杂BI流程的有效路径。

🔑 关键词速览

BI-Bench首个系统评估大语言模型端到端商业智能能力的基准测试集,包含从真实用户仪表板中提取的问题与真实答案对。
BI-Agent一种工具增强的智能体,将商业智能工作流程分解为搜索、连接、转换等子任务,并编排专门的数据管理方法。
端到端商业智能指用户无需手动执行数据准备步骤,直接由模型完成从数据准备到回答业务问题的全过程。
监督微调(SFT)一种后训练方法,使用标注数据对预训练模型进行有监督的微调,以提升特定任务性能。
强化学习(RL)一种通过与环境交互、根据奖励信号优化策略的机器学习方法,用于后训练智能体以改进决策。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅