Terminal-Bench-LILT 是一个面向多语言编程智能体的全新基准测试,包含 300 个真实编码任务,覆盖阿拉伯语、捷克语、德语、西班牙语、印地语、日语、韩语、塞尔维亚语、土耳其语和中文十种语言。与现有仅限英语的评估不同,该基准聚焦于非英语软件开发中的特有难题,如国际化、编码处理、文本规范化和文化惯例,这些任务在英语环境中没有直接对应。所有任务均由母语程序员编写,并通过多阶段质量控制流程验证。对六个前沿模型的评估显示,最强模型通过率仅为 63.1%,且许多任务没有任何模型能够解决。性能因语言差异显著波动,且与通用编码基准排名并不一致,表明多语言编码能力是一个独立且尚未充分探索的能力维度。
| Terminal-Bench-LILT | 一个多语言编码智能体基准测试套件,包含十种语言的真实编码任务。 |
| Agentic coding | 指由智能体(如AI模型)自主执行的编码任务,而非人工编码。 |
| Internationalization | 软件国际化的过程,涉及使软件适应不同语言和地区,包括文本编码、日期格式等。 |
| Text normalization | 将文本转换为标准形式的过程,例如统一大小写、去除变音符号等,以处理语言变体。 |
| Frontier models | 指当前最先进、性能最强的AI模型,通常用于基准测试的评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅