BottleCap AI 发布 ThinkingCap 系列第二款模型 ThinkingCap-Qwen3.8-27B,基于 Qwen3.8-27B 微调,目标单一:缩短推理链。在 12 项基准测试中,该模型平均减少 37.2% 的思考 token,宏观平均准确率从 86.65% 降至 85.79%,仅损失 0.86 个百分点。其设计思路是许多冗余思考 token 并不改变最终答案,因此在不新增知识、不改变回答风格的前提下压缩推理过程。各基准的 token 削减幅度在 10.7% 至 65.5% 之间,其中知识类与多语言任务压缩最明显,MMLU 减少 65.5%,MMLU-Pro 减少 57.3%;长上下文检索准确率反而提升 2.25 个百分点;代价最大的是 AIME 2026,准确率下降 3.85 个百分点。该模型可直接替换 vLLM 或 SGLang 上的 Qwen3.8-27B,并提供 FP8、NVFP4、GGUF 和 MLX 版本,但仓库设有访问门槛,超出小企业许可范围的商业使用需另行签约。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅