近日,信息学院(人工智能学院)青年教师颜荣恩在自然语言处理领域的文档级关系抽取(Document-level Relation Extraction)任务中取得进展。相关研究成果以《Document-Level Relation Extraction With Low Entity Redundancy Feature Map》为题,发表于人工智能与数据工程领域国际顶级期刊《IEEE Transactions on Knowledge and Data Engineering》(CCF A,中国科学院一区TOP期刊,影响因子10.4)。
文档级关系抽取旨在从整篇文档中识别散布于不同句子的实体之间的语义关系,是构建知识图谱、智能问答等应用的关键技术。传统方法通常直接利用全文信息构建实体级矩阵,容易引入冗余和噪声,从而影响关系判断的准确性。
针对这一问题,研究团队提出了一种基于“最优路径过滤(Optimal Path Filtering, OPF)”的方法。该方法通过启发式规则筛选与实体对最相关的句子,并将句子选择问题建模为集合覆盖问题,利用回溯剪枝算法求解最优路径,有效减少冗余信息。在此基础上,团队引入U-Net结构对构建的低实体冗余特征图进行语义分割,完成关系分类。

随着大语言模型的快速发展,进一步评估了OPF模块的有效性,通过将其集成到AutoRE-Vicuna-7B框架中,并探索了基于ReAct的推理方法,以GLM-3-6B为基座, 推理过程中F1分数提高到15.56%。这些结果展示了基于ReAct的提示在捕捉长距离和隐式关系推理方面的有效性。本研究首次将实体冗余控制与图像分割思维相结合,为文档级关系抽取提供了新范式,不仅提升了模型性能,也为未来融合多模态信息的深度语义理解奠定了基础。

论文第一作者为青年教师颜荣恩和北京师范大学党德鹏教授。该项研究由中央高校基本科研业务费(BLX202356)、中央高校优秀青年团队项目(QNTD202504)等资助支持。
Copyright © 2005- 2018 北京林业大学新闻办公室 地址:北京市海淀区清华东路35号 邮政编码:100083
总编:刘广超   副总编:杨金融 刘丽萍 李佳 欧阳汀 赵聪   编辑:姜玥 杨一楠 陈昊原 李锐    管理员登陆