Sebastian Raschka 在体验 GPT-6 Astra 后给出高度评价,但其长文的核心并非评测模型能力,而是追查 The Information 关于 Astra 采用「循环深度」(looped transformer)架构的传闻。他系统拆解了循环架构的技术原理,并探讨该设计可能带来的推理链隐藏机制。文章的意义在于:若传闻属实,这意味着主流大模型可能正在从单纯堆叠参数转向通过架构创新提升推理能力,而循环深度正是其中一条被长期讨论但尚未大规模验证的路径。Raschka 的分析为理解下一代模型的可能演进方向提供了技术视角。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅