这项研究检验了一个被广泛默认却缺乏严格验证的假设:可见的思维链推理是否普遍提升分析代码生成的效果。作者构建了一个查询匹配的SQL与pandas基准,交叉测试了人格化措辞、目标语言、可见思维链格式、控制前缀、直接生成以及内部推理配置等多种条件。结果显示,可见思维链并不带来普遍的准确率优势,让推理表示与目标语言匹配(如"用SQL思考")也未见一致收益;实际效果取决于人格设定、目标语言、模型配置和内部推理设置。控制消融实验进一步区分了推理内容与提示格式各自的作用。研究的意义在于,推理策略不应作为通用默认选项,而应针对模型、人格、目标和内部推理配置联合选择;同时该工作提供了一个受控框架,用于判断可见推理何时真正改善可执行代码生成,何时只是扰动模型行为,以及何时内部推理配置才是更关键的因素。
| Visible Chain-of-Thought (CoT) | 可见思维链,指模型在输出最终答案前显式展示中间推理步骤的提示方式。 |
| Analytics Code Generation | 分析型代码生成,指根据自然语言分析请求自动生成 SQL、Python 等数据分析代码的任务。 |
| Persona Phrasing | 角色措辞,指在提示中通过设定模型身份(如“你是一位数据工程师”)来影响其行为的方式。 |
| Schema Grounding | 模式接地,指将自然语言请求中的实体和关系映射到数据库表结构或数据框架列的过程。 |
| Internal-Reasoning Configuration | 内部推理配置,指模型在生成最终输出前于内部进行推理的机制设置(如是否启用隐藏推理)。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅