业务背景:希望能够通过大模型提取医学论文中一些基本信息为后续任务服务,其中基本信息包括:文章题目,疾病名称,治疗方案,优势方案,文章DOI和收稿日期。

实际问题:文章题目,疾病名称,治疗方案和优势方案等与文章强相关的信息基本上能够准确提取出,且准确率非常高,但是文章DOI和收稿日期信息提取不一定能够提取出来且提取出来的不一定准确。

存在原因:在当前基于PDF的大模型信息提取流程中,上传的PDF文件确实会经历类似ETL(抽取、转换、加载)的数据处理过程。PDF解析通常包括文本提取、结构化清洗、关键字段标注等步骤,这直接影响信息提取的准确性。针对您提到的DOI和收稿日期提取不准确的问题,可能涉及以下原因及解决方案:

关键原因分析:

  1. DOI和收稿日期的文档布局复杂性
  • DOI通常位于PDF的页眉、页脚或参考文献部分,而收稿日期也是分散在文档中。若PDF解析未针对这类非连续文本区域进行优化,可能导致召回率较低。
  1. 模型对元数据的关注度不足
  • 大模型倾向于优先处理正文内容(如标题、研究问题、方法),而对元数据(如DOI、日期)的语义关联较弱。这可能导致提取时忽略特定字段的上下文特征。
  1. PDF解析工具的局限性
  • 若ETL流程中的OCR或文本提取工具未针对学术文献的格式进行优化(如LaTeX排版、多语言混合),可能丢失关键元数据。

观察大模型thinking的输出(这个真的是优化提示词和找问题的好方法),发现目前存在的问题有:

  1. 文章本身存在DOI,且参考文献引用有个论文也会附上DOI,所以有一版提示词写的是“文献DOI”,导致模糊了概念,后续优化成“文章DOI”能够较好的解决问题。
  2. 文章存在收稿日期和修回日期等影响因素,提示词需要强调仅提取收稿日期,避免其余日期对收稿日期的误导。
  3. 最关键问题:文章DOI和收稿日期信息提取不一定能够提取出来且提取出来的不一定准确,需要用额外的手段解决这个问题。

深入研究PDF:PDF(Portable Document Format)是一种广泛用于文档交换的文件格式,由Adobe Systems开发。它具有跨平台性、固定布局和易于打印等特点,因此在商业、学术和个人领域广泛应用。然而,PDF文件的解析一直是一个具有挑战性的问题,因为其内部结构的复杂性和多样性,使得提取其中的文本、图片和表格等内容并不是一件容易的事情。

在目前的PDF文件解析领域中,我们可以将其大致分为以下几类技术方案:

  • LLM/视觉大模型解析:LLM(Large Language Model)大型语言模型在近年来的发展中,展现出了强大的语言理解和生成能力。通过训练大规模的神经网络,可以实现对PDF文件中文字内容的理解和提取,这种方法尤其适用于那些布局复杂、内容丰富的PDF文件。
  • OCR模型:光学字符识别(OCR)模型专门设计用于将PDF文件中的图像转换为可编辑的文本。这种技术在处理扫描版或图像化的PDF文档时尤其有用。
  • 传统规则提取:传统的PDF解析方式可能包括基于规则的文本提取、图像处理和表格识别等方法。虽然这些方法可能不如深度学习模型那样灵活,但在某些情况下仍然是有效的选择。

各个解决方案目前可能需要配合使用,因为PDF格式本身的复杂程度,一项技术方案可能是无法100%满足业务需求的,这里面需要考虑的是:

  • 文档提取还原度:通过技术手段,能够完整的提取PDF中的各项元素,包括文本、表格、图片、链接、图形、目录等等信息
  • 高效/成本:在RAG知识库问答的产品中,考虑到文本还需要Embedding的过程,因此在提取过程中如何更高效,成本更低也是需要着重考虑到事项。
  • 稳定/幂等:我们知道大模型可能是出现幻觉的,如果用大模型来提取PDF中的内容,是否能足够保证稳定性。

思路:基于业务需求,文献DOI和收稿日期只是为了佐证论文的权威性,而非关键信息,即使大模型可能无法准确识别,也不需要对模型微调,微调成本高且可能会影响内容的准确性,只需要基于传统规则提取补充即可,且文献DOI和收稿日期此类关键信息具有固定的格式,可通过模板规则进行提取。

完整的流程:

1.提示词工程:定义结构化任务与思维链推理

  • 槽位标注与任务描述
    在System Role中明确要求LLM提取特定字段(如标题、....、DOI、收稿日期),并设计模板化输出格式。例如:"你是一个学术论文信息抽取器,请从以下文本中提取:1. 标题;2. DOI;3. 收稿日期。若信息缺失,请标注'未找到'。"
    通过槽位定义约束LLM的输出范围,减少无关信息干扰。
  • 思维链(Chain-of-Thought, CoT)提示
    引导LLM分步骤分析文档结构。例如:"第一步:定位论文的页眉/页脚区域,查找包含'DOI'的字符串;第二步:扫描摘要或作者信息部分,匹配'收稿日期'后的日期格式。"

2.正则匹配:

Apache PDFBox使用PatternMatcher类匹配DOI和日期候选。文章中多个DOI,因为包括参考文献,但是只取第一个即可,参考文件DOI出现在最末尾

后续额外的思考:

如果真的需要微调怎么去实现,针对于学术论文。在学术论文数据集上微调LLM(如LoRA技术),增强其对文献结构的理解能力。例如:微调时强调标题、摘要、参考文献的布局特征,使LLM更敏感于DOI在页脚或参考文献中的分布规律

1. 优先级标注:强化页眉、页脚及参考文献区域的文本提取

  • 区域划分 :通过PDF解析库(如Apache Tika识别文档布局结构,标注页眉、页脚、正文及表格区域。例如,利用PDF的物理坐标信息分割出页眉页脚区域。
  • 优先级加权 :在文本提取时,对标注区域赋予不同权重。例如,文章底部的文本优先级高于正文,确保DOI等信息不被遗漏。
  • 表格与图文混合处理 :若页眉页脚包含表格或图片(如期刊Logo旁的DOI),需结合OCR工具(如Tesseract)进行混合解析

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐