本文介绍了一个名为 NeMo Data Designer(NDD)的开源通用框架,用于多模态合成数据生成。该框架采用声明式配置格式,允许用户逐列定义数据集,列类型覆盖文本、代码、结构化输出、图像、嵌入以及用于调控数据多样性的统计采样器,并可通过插件系统灵活扩展新类型与功能。其配置本身是可检查的工件,便于工作流共享与复现。针对合成数据生成的迭代特性,NDD 将预览与修订循环内置于核心流程,使用户能先生成少量样本进行检视、优化规格后再全量生成;运行时框架负责解析依赖、调度用户提供的模型端点调用并重试失败请求。论文阐述了 NDD 的架构与编程模型,并给出涵盖结构化、智能体、多模态及领域专用任务的案例研究,其中包括用于 Nemotron 模型开发及生产级企业部署的数据集。
| NeMo Data Designer (NDD) | 一个开源、通用的多模态合成数据生成框架,支持声明式配置和插件扩展。 |
| 多模态合成数据生成 (SDG) | 生成包含文本、图像等多种模态的合成数据的过程,用于训练和评估机器学习模型。 |
| 声明式配置格式 | 一种通过定义列类型和属性来指定数据集结构的配置方式,用户无需编写过程式代码。 |
| 插件系统 | 框架提供的灵活扩展机制,允许用户添加新的列类型和功能。 |
| 预览-修订循环 | 核心工作流中的迭代过程:生成少量样本、检查、修改规范,再全规模生成。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅