🔥 今日值得一读 5.75亿参数编码器不生成token,嵌套JSON抽取F1达91.10,逼近GPT-5.6-luna!
Knowledgator Releases GLiFormer: A 575M-Parameter Encoder That Hits 91.10 F1 on Nested JSON Extraction Without Generating Tokens
MarkTechPost 🔥 重点 论文方法大模型开源 🕐 09-17 05:19

📖 AI 总结

Knowledgator 发布了 GLiFormer,一个基于模式条件编码器的信息抽取框架,用单一模型统一处理命名实体识别、文本分类、关系抽取、嵌套 JSON 结构化及文本嵌入等任务。其核心思路是:在推理时传入标签与抽取模式,模型只需对源文本编码一次,即可通过“锚点”机制对多个模式并行打分,从而避免像大语言模型那样逐 token 生成字段名、标点和值。GLiFormer 提供两个开源检查点,Base 版 2.642 亿参数,Large 版 5.756 亿参数,均采用 Apache 2.0 许可,可通过 pip 安装并在 CPU 或 GPU 上运行。在嵌套 JSON 抽取任务上,Large 版取得 91.10 的 F1 成绩。其结构化流程分四步:将字段值定位为源文本中的片段、用匈牙利匹配把片段分配到无序记录槽、预测受模式约束的父子链接,最后由确定性解码器组装嵌套 JSON。由于值直接取自源文本片段,模型无法凭空生成输入中不存在的值文本,这为抽取结果的可靠性提供了保障。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅