本文介绍了一个名为 GreenLeaf Law Embed Tiny 的紧凑型法律领域嵌入模型,参数量仅 0.6B,专为法律文本检索设计。在 Massive Legal Embedding Benchmark 上达到 75.11% 的准确率,在 MTEB(Law, v1) 上取得 64.38% 的成绩,在 1B 参数以下的模型中表现突出。该模型采用两阶段训练流程:先从大型教师模型中蒸馏知识到紧凑的学生架构,再通过难负样本挖掘进行领域微调。训练数据包含 340 万对查询-文本对,其中 15 万对为跨司法管辖区的人工精选样本。模型支持 BF16、INT8 和二进制等多级量化,便于在资源受限环境中部署。研究结果表明,结合高质量数据的领域专属训练能显著提升专业场景下的检索性能,为法律 AI 应用提供了高效可行的轻量化解决方案。
| Embedding Model | 嵌入模型,将文本转换为向量表示以用于检索和相似度计算。 |
| Knowledge Distillation | 知识蒸馏,一种将大型模型的知识迁移到小型模型的技术。 |
| Hard Negative Mining | 难负样本挖掘,选择与查询相似但无关的样本作为负例以提升训练效果。 |
| Quantization | 量化,通过降低数值精度来减小模型大小和加速推理。 |
| MLEB | 大规模法律嵌入基准,用于评估法律领域嵌入模型的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅