如何从PDF中提取书目参考文献

更新于 2026-07-28

从PDF中复制书目并粘贴到参考管理器几乎总是无效:换行符会出现,斜体消失,连字符会拆分单词,名字的顺序也会丢失。结果是你必须手动重建的列表。

本指南解释了为什么会发生这种情况,应该使用哪些格式,以及如何在将其导入参考库之前验证输出。

为什么直接复制会失败

PDF不存储段落,而是存储字符位置。当你复制时,阅读顺序通过近似重建,在带有脚注的双栏文本中,这会产生混合和截断的行。

添加连字符、排版连字和特殊字符,这些会作为错别字到达管理器,并在你的参考列表中显现出来。

选择导出格式

如果你使用LaTeX,BibTeX是自然的选择。RIS是商业管理器和数据库最广泛接受的交换格式。CSV在你想在导入前在电子表格中审查列表时很有帮助。

始终使用结构化格式而非纯文本:分隔字段使你能够在不重新输入任何内容的情况下切换引用样式。

导入到Zotero或Mendeley

在Zotero中,使用文件导入并检查分配的项目类型:书籍章节和会议论文是最常被错误标记的。

导入后,填写缺失的DOI。有了DOI,管理器可以自行纠正其余字段,你在最终书目中获得永久链接。

信任列表之前的检查

将参考文献的总数与原始文章进行比较,查找不合理的年份,并扫描带有奇怪字符的名字。这三种迹象揭示了提取的不完整性。

如果书目来自扫描的PDF,需全面审核:光学识别容易混淆页码和年份,这正是没人会仔细检查的。

常见问题

它能处理扫描的PDF吗?
只有当文档具有文本层或应用了光学识别时。在这种情况下,逐一检查年份和页码。
我可以提取整本书的参考文献吗?
可以,但建议按章节处理:非常长的书目混合了样式和编号,分部分审查输出会容易得多。
没有DOI的参考文献怎么办?
从原始来源手动补全。在1990年代之前的文档和灰色文献中,缺少DOI是正常的;完整且可验证的参考文献就足够了。

文献引用提取器

提取论文的书目

参考提取识别PDF中的每个参考文献,并以结构化和可导出的形式返回,准备导入到你的参考管理器中。

研究研究

每个指标实际测量的内容、评估标准如何不断变化,以及哪些期刊值得再次关注。为研究人员撰写,而非销售工具的人。无需账户,无需注册。

仅用于向您发送时事通讯。您可以随时取消订阅任何期刊。

其他指南

如何从PDF中提取书目参考文献 | Explore Labs