本文介绍了TelecomGPT-R1-9B,一个面向电信领域的统一开源推理模型,旨在解决通用大模型缺乏电信专业知识、而专用电信模型推理能力不足的双重瓶颈。研究团队构建了包含67,427个样本的监督微调语料库,围绕协议、知识、建模和故障四个推理维度组织,并采用思维链生成与自验证机制增强数据质量。模型基于Qwen3.5-9B,通过两阶段训练:先以多教师低秩适配注入领域知识,再用组相对策略优化配合解耦裁剪和动态采样策略提升推理稳定性。在七个公开电信基准测试中,该模型在开源电信大模型中排名第一,综合表现接近闭源前沿推理模型,为电信行业复杂工程问题提供了高效、可复用的开源推理方案。
| TelecomGPT-R1-9B | 一个统一的开源电信推理器,基于Qwen3.5-9B构建,在电信基准测试中表现优异。 |
| SFT (Supervised Fine-Tuning) | 监督微调,使用标注数据对预训练模型进行进一步训练以适应特定任务。 |
| CoT (Chain-of-Thought) | 思维链,一种引导模型进行多步推理的技术,通过生成中间推理步骤提高准确性。 |
| LoRA (Low-Rank Adaptation) | 低秩适配,一种参数高效的微调方法,通过低秩矩阵更新模型权重。 |
| GRPO (Group Relative Policy Optimization) | 组相对策略优化,一种强化学习算法,通过组内相对比较优化策略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅