12万食谱+3.5万食材!跨99国营养数据一键可查
A framework for recipe data structure with applications for culinary and nutritional insights
arXiv CL (cs.CL) 论文方法多模态 🕐 今天 12:00

📖 AI 总结

该研究针对食谱长期以自由文本形式存在、难以直接计算的问题,提出了一套食谱数据结构化框架。研究者构建了RecipeDB2数据库,收录来自99个国家、32个地区的128,942份食谱和35,474种食材。框架通过基于Transformer的命名实体模型将食材短语解析为七类烹饪属性,利用BERT嵌入策略将食材映射至USDA营养参考数据库(在200种高频食材的人工校验集上F1值达87.90),每种映射食材可获得148项营养参数;同时使用随机森林分类器为全部食材词汇传播34个类别标签,并以确定性规则为每份食谱分配饮食风格。该工作将烹饪遗产从艺术对象转化为可量化分析的数据对象,为烹饪文化与营养学研究提供了可扩展的计算基础。

🔑 关键词速览

RecipeDB2一个结构化食谱数据库,包含来自 32 个地区、99 个国家的 128,942 个食谱和 35,474 种食材,支持可计算查询。
命名实体识别(NER)一种自然语言处理技术,用于从文本中识别和分类实体,如食材、数量、单位等烹饪属性。
BERT 嵌入基于 BERT 模型生成的文本向量表示,用于将食材短语映射到标准营养数据库中的条目。
随机森林分类器一种集成机器学习方法,通过多棵决策树投票进行分类,此处用于将食材类别传播到整个词汇表。
USDA 参考表美国农业部提供的标准营养数据库,包含各种食物的营养成分信息,用于为食材提供营养参数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅