OpenAI在Hot Chips大会上首次展示了自研推理芯片“Jalapeño”的基准测试结果。该芯片专用于AI模型推理而非训练,且未针对自家模型优化,属于通用大语言模型推理加速器。据OpenAI公布并经SemiAnalysis部分验证的数据,Jalapeño在能效和延迟上均超越Nvidia的Blackwell及新一代Vera Rubin平台:峰值吞吐下每瓦特AI工作量提升1.5至1.9倍,端到端延迟降低1.7至3.6倍,交互式工作负载性能高出2.1至4.1倍。在匹配解码速度时,其每千瓦token吞吐量是现有最佳加速器的54至104倍。值得注意的是,这些成绩未采用多token预测或投机解码等优化手段,仍有提升空间。该芯片由OpenAI与博通合作,设计始于2024年中,历时九个月完成,目前仍处于工程样品阶段,而Rubin系统已开始出货。尽管存在测试模型规模等局限,SemiAnalysis认为Jalapeño的首次亮相已极具竞争力,标志着OpenAI在硬件自研上迈出关键一步。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅