这篇立场论文指出,AI排行榜在结构上无法有效服务全球南方,核心障碍并非数据缺失,而是制度设计缺陷。尽管印度已有IndicSUPERB、MILU、LAHAJA等高质量区域基准,非洲和阿拉伯语地区也有相应基准,但全球排行榜既未纳入这些基准,也缺乏强制机制推动其纳入。商业压力仅在影响北方付费客户时才能纠正排行榜失灵,而全球南方缺乏同等影响力,导致印地语、斯瓦希里语或阿拉伯语使用者的问题长期被记录却无人解决。以印度为案例(14亿人口、22种官方语言、高质量基准却无可信聚合),作者对58名AI从业者的咨询显示,他们一致倾向于正式治理和基于披露的冲突管理机制。结论是,解决方案不在于增加数据,而在于建立更好的制度:从起步阶段就具备独立治理的区域排行榜。
| AI leaderboards | AI排行榜,用于比较不同AI模型在特定基准测试上的性能排名。 |
| Global South | 全球南方,指发展中国家和地区,通常位于南半球或经济欠发达地区。 |
| IndicSUPERB | 一个针对印度语言(如印地语、泰米尔语等)的语音和语言处理基准测试集。 |
| MILU | 一个用于评估印度语言理解能力的基准测试集。 |
| LAHAJA | 一个针对印度语言的自然语言处理基准测试集。 |
| IrokoBench | 一个用于评估非洲语言处理能力的基准测试集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅