思考token直降37.2%,准确率只丢0.86个点!
BottleCap AI Releases ThinkingCap-Qwen3.8-27B: 37.2% Fewer Thinking Tokens at a 0.86pp Accuracy Cost
MarkTechPost 重要 大模型推理效率开源 🕐 今天 02:58

📖 AI 总结

BottleCap AI 发布 ThinkingCap 系列第二款模型 ThinkingCap-Qwen3.8-27B,基于 Qwen3.8-27B 微调,目标单一:缩短推理链。在 12 项基准测试中,该模型平均减少 37.2% 的思考 token,宏观平均准确率从 86.65% 降至 85.79%,仅损失 0.86 个百分点。其设计思路是许多冗余思考 token 并不改变最终答案,因此在不新增知识、不改变回答风格的前提下压缩推理过程。各基准的 token 削减幅度在 10.7% 至 65.5% 之间,其中知识类与多语言任务压缩最明显,MMLU 减少 65.5%,MMLU-Pro 减少 57.3%;长上下文检索准确率反而提升 2.25 个百分点;代价最大的是 AIME 2026,准确率下降 3.85 个百分点。该模型可直接替换 vLLM 或 SGLang 上的 Qwen3.8-27B,并提供 FP8、NVFP4、GGUF 和 MLX 版本,但仓库设有访问门槛,超出小企业许可范围的商业使用需另行签约。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅