🔥 今日值得一读 35PB语料5.6倍提速!蚂蚁OmniTable拿下VLDB最佳论文,大模型清洗不再熬夜
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
量子位 🔥 重点 大模型数据工程论文方法 🕐 09-02 14:20

📖 AI 总结

蚂蚁集团研发的统一宽表系统OmniTable获评VLDB 2026工业赛道最佳论文,聚焦大模型训练中常被忽视的数据准备环节。该系统在生产环境管理超35PB、3050亿条训练数据,覆盖Web、代码、PDF和SFT等数据域。核心设计为“逻辑统一、物理分离”:上层将同一数据域呈现为一张逻辑宽表,底层按规模与访问方式拆分物理表,并通过全局主键和批次字段实现数据追踪。特征从脚本临时计算升级为带版本、依赖和血缘的系统资产,解决了传统流程中数据难定位、特征难回刷、结果难追溯三大痛点。实际应用中,真实SFT任务端到端周期从约14天缩短至2.5天,手工步骤从45步降至12步,效率提升5.6倍。该系统还支持记录级故障隔离,避免少数坏样本导致整批数据重跑。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅