如何从PDF中提取书目参考文献
更新于 2026-07-28
从PDF中复制书目并粘贴到参考管理器几乎总是无效:换行符会出现,斜体消失,连字符会拆分单词,名字的顺序也会丢失。结果是你必须手动重建的列表。
本指南解释了为什么会发生这种情况,应该使用哪些格式,以及如何在将其导入参考库之前验证输出。
为什么直接复制会失败
PDF不存储段落,而是存储字符位置。当你复制时,阅读顺序通过近似重建,在带有脚注的双栏文本中,这会产生混合和截断的行。
添加连字符、排版连字和特殊字符,这些会作为错别字到达管理器,并在你的参考列表中显现出来。
选择导出格式
如果你使用LaTeX,BibTeX是自然的选择。RIS是商业管理器和数据库最广泛接受的交换格式。CSV在你想在导入前在电子表格中审查列表时很有帮助。
始终使用结构化格式而非纯文本:分隔字段使你能够在不重新输入任何内容的情况下切换引用样式。
导入到Zotero或Mendeley
在Zotero中,使用文件导入并检查分配的项目类型:书籍章节和会议论文是最常被错误标记的。
导入后,填写缺失的DOI。有了DOI,管理器可以自行纠正其余字段,你在最终书目中获得永久链接。
信任列表之前的检查
将参考文献的总数与原始文章进行比较,查找不合理的年份,并扫描带有奇怪字符的名字。这三种迹象揭示了提取的不完整性。
如果书目来自扫描的PDF,需全面审核:光学识别容易混淆页码和年份,这正是没人会仔细检查的。
常见问题
- 它能处理扫描的PDF吗?
- 只有当文档具有文本层或应用了光学识别时。在这种情况下,逐一检查年份和页码。
- 我可以提取整本书的参考文献吗?
- 可以,但建议按章节处理:非常长的书目混合了样式和编号,分部分审查输出会容易得多。
- 没有DOI的参考文献怎么办?
- 从原始来源手动补全。在1990年代之前的文档和灰色文献中,缺少DOI是正常的;完整且可验证的参考文献就足够了。