工业采购大模型IndustryLLM用100B token失败驱动训练,专治行话黑话!
IndustryLLM: Failure-Driven LLM Training for Industrial Procurement
arXiv AI (cs.AI) 重要 大模型开源商业化 🕐 今天 12:00

📖 AI 总结

本文提出IndustryLLM,一个面向工业采购场景的开源权重语言模型,基于Qwen3.5-35B-A3B-Base训练,总参数35B、每token约激活3B,视觉编码器冻结。针对工业采购中买方口语、稀疏商品属性与权威工程标准之间的鸿沟,作者摒弃通用文本扩展思路,提出“失败驱动”的适配方案,涵盖持续预训练与监督微调。其预训练语料约100B token,融合5B国家标准与技术档案、10B脱敏真实交易与询价记录及60B通用回放数据,并通过多语域改写、置信度路由的极小事实编辑和错误定向问答合成,重建约20B token的领域子集,以解决语域错配与事实脆弱问题,例如将“42-luo-mu”纠正为42CrMo、将“16674”扩展为GB/T 16674。部署层面,作者形式化了一个证据门控的约束评估接口,采用三值逻辑,未经验证的产品证据保持“未知”而非“满足”。离线评测显示采购查询结构化任务在No-Think模式下精确匹配提升2.97个百分点(95%置信区间[2.11, 3.86]);生产环境随机在线A/B实验带来GMV提升4.25%、满意询价提升8.3%,延迟从6-7秒降至1.5秒。模型权重与配置已公开。

🔑 关键词速览

IndustryLLM一个面向工业采购领域的开源语言模型,基于 Qwen3.5-35B-A3B-Base 训练,旨在处理工业采购中的非正式行话、市场属性和工程标准。
失败驱动适配一种训练策略,通过识别和针对模型失败案例来设计持续预训练和监督微调,以提升模型在特定领域的性能。
持续预训练 (CPT)在预训练模型基础上,使用领域特定的大规模语料库进行进一步训练,以注入领域知识。
监督微调 (SFT)使用标注数据对预训练模型进行微调,以优化其在特定任务上的表现。
三值逻辑一种逻辑系统,其中命题的真值不仅包括真和假,还包括未知,用于处理证据不完整的情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅