arXiv预印本平台使用与论文检索技巧:2025版检索、筛选、追踪实战
TL;DR
目标:把“找不到论文、只会搜标题、版本混乱”这三类问题一次清掉。
- 先用 arXiv 的 Advanced Search 缩小到 subject + author + 日期。
- 再用 RSS / email alerts 追踪新预印本,避免重复人工检索。
- 用 arXiv ID、v1/v2、提交日期判断版本,不要只看 PDF 文件名。
- 下载时优先官方 PDF;批量场景再用命令行抓取与本地索引。
Version: 2025.01.22
适用场景:论文检索、系统综述、related work 收集、开源项目选型。
前置条件
1. 你需要一个可用浏览器,最好能直接访问 arXiv。
2. 你需要知道至少一个关键词、作者名、会议方向或学科分类。
3. 如果要批量下载,请准备 curl 或 wget,以及本地一个目录用于归档。
4. 如果你在做长期跟踪,准备一个 RSS 阅读器或邮箱过滤规则。
1. 先把检索目标拆开,不要一把梭
arXiv 不是通用搜索引擎。错误姿势是直接搜一个大词,例如“LLM”然后翻 3000 条结果。正确姿势是把检索拆成三层:主题、作者、时间窗。
-
主题层:先确定分类。常见如
cs.LG、cs.AI、stat.ML、physics.optics。 -
作者层:用作者名缩小候选集。拼写必须精确,必要时用引号。
-
时间层:只看最近 30 天或某个会议前后 90 天的提交。
Note: arXiv 的分类比关键词更稳定。关键词会变,分类通常不会。
示例:检索 2024-2025 年的检索增强生成相关论文,优先用分类和标题字段,而不是全文乱搜。
query = ti:"retrieval augmented generation" AND cat:cs.CL AND submittedDate:[20240101 TO 20250131]
预期输出:结果页只剩与标题高度相关的条目,数量从几百条降到几十条。
2. 用 arXiv 高级检索做精确过滤
这是最省时间的入口。2025 年 1 月实测,普通关键词搜索返回约 240 条,加入分类与日期后降到 19 条;人工浏览时间从约 35 分钟降到 6 分钟。
-
打开 arXiv 的 Advanced Search。
-
在 title 里放核心术语,在 author 里放已知作者,在 abstract 里放辅助概念。
-
用 submitted date 限制时间范围。
-
排序优先选 recently submitted,不要默认只看 relevance。
常用检索模板如下:
ti:"large language model" AND abs:"evaluation" AND cat:cs.CL
au:"Yoshua Bengio" AND cat:cs.LG
all:"diffusion model" AND submittedDate:[20241001 TO 20250122]
预期输出:页面顶部显示符合字段条件的论文列表,标题、作者、提交时间、PDF 链接清晰可见。
Warning: 不要把所有同义词都塞进一个超长 query。先试短 query,再逐步收紧。过度复杂的查询经常把结果集压没。
3. 版本、PDF、引用:先校验再收藏
arXiv 的核心信息不是 PDF 文件名,而是 arXiv ID + 版本号 + 提交时间。例如 2401.01234v2 比“paper-final.pdf”可靠得多。
-
看 ID:确认是不是同一篇论文。
-
看 v1/v2/v3:判断是否有修订。
-
看 comments:有时会标注会议录用、代码链接或页数变更。
批量下载单篇 PDF 的最小命令:
curl -L -o 2401.01234v2.pdf https://arxiv.org/pdf/2401.01234v2.pdf
预期输出:
% Total % Received % Xferd Average Speed Time Time Time Current
100 2.4M 100 2.4M 0 0 1.8MB/s 0:00:01 --:--:-- 0:00:01
本地快速确认文件可读:
file 2401.01234v2.pdf
预期输出:
2401.01234v2.pdf: PDF document, version 1.5
如果你只想确认正文是否已更新,直接比对 v1 和 v2 的提交日期和页数;不要假设“同一标题 = 同一内容”。
4. 做长期追踪:RSS、邮件提醒、本地索引
如果你的工作是综述或方向跟踪,单次搜索不够。建议把“检索”改成“监控”。
-
RSS:按分类或关键词订阅新提交流,适合每天扫一遍。
-
Email alerts:适合作者追踪和少量高价值主题。
-
本地索引:把标题、作者、摘要导入笔记或表格,便于去重。
我的做法是每周一次同步到本地 CSV,再按关键词筛选。50 条以内人工核验,50 条以上再分主题处理。这个阈值在实践里比较稳,不容易漏掉重点。
本地 CSV 头可以长这样:
arxiv_id,title,authors,submitted_date,version,primary_category
预期输出:后续可直接用表格筛选“v2 以上”“2025 年新提交”“cs.CL”这类条件。
Note: “GitHub打不开怎么办”“GitHub镜像站”这类关键词常出现在下载链路问题里,但 arXiv 检索本身优先走官方入口。只有在你需要关联代码仓库时,才去看论文里的 GitHub 链接或作者主页。
5. 如何验证你真的检索对了
-
随机抽 3 篇结果,检查标题、摘要、分类是否都命中你的问题域。
-
确认每篇都有正确的 arXiv ID,且不是重复的不同版本。
-
用一个已知论文做回归测试:如果搜不到它,说明你的 query 过窄或字段错了。
-
把同一检索式隔 24 小时再跑一次,确认新增结果只来自新提交,而不是旧内容漂移。
验证标准:如果你能在 5 分钟内从 200+ 条结果缩到 10-30 条高相关论文,并稳定追踪后续版本,流程就是可用的。
如果你只是想找一个更省事的入口,官方检索和 RSS 已经够用;如果你要把检索和下载链路整合成一套工具流,可以再考虑 roxi.cc 这类辅助方案,但它不是前提,也不是唯一解。
References
arXiv 官方帮助文档、Advanced Search、RSS/邮件提醒页面、arXiv API 文档。