AI基准测试有了通用语言Benchy,一套YAML定义就能跨系统跑!
Benchy: towards a universal language for task-oriented AI benchmarks
arXiv AI (cs.AI) 重要 评测基准论文方法 🕐 今天 12:00

📖 AI 总结

Benchy 是一种面向任务型 AI 基准测试的语义语言与执行引擎,旨在为 AI 程序评测提供统一规范。该研究将基准测试形式化为程序、评分函数与数据集的三元组 B=(P,S,D),并将其与受测 AI 系统相分离,运行过程则表示为 R=(B,AI)。基准以规范化 YAML 编写,每个语义概念对应唯一合法语法,并通过共享的任务、领域与语言本体进行分类,随后确定性地编译为规范 JSON 中间表示供引擎执行;编译仅改变表示形式而不改变语义,也不会修复无效定义或注入隐藏默认值。程序采用固定的命名输入输出字段模式,叶子输出字段即评分维度,引擎对外暴露统一的运行时契约,使外部 AI 系统在边界处适配,从而避免集成机制渗入基准语义。论文给出了语义对象模型、本体与任务到程序的验证规则、评分与失败语义、编译执行架构及当前语言范围,并在附录中固定了首个引擎实现的规范性工程契约。

🔑 关键词速览

Benchy一种用于对 AI 程序进行基准测试的语义语言和执行引擎,旨在提供通用语言。
基准测试(Benchmark)由程序、评分函数和数据集组成的规范,用于评估 AI 系统,与 AI 系统本身分离。
规范 YAML(Canonical YAML)一种编写基准测试的格式,其中每个语义概念只有一种有效语法,确保一致性。
本体(Ontology)共享的任务/领域/语言分类体系,用于对基准测试的语义概念进行分类。
运行时契约(Runtime Contract)引擎暴露的通用接口,规定输入为命名字段输入对象,输出为命名字段输出对象,外部 AI 系统需适配。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅