首页文献管理数据分析开源社区写作排版
首页 › 文献管理 › arXiv预印本平台使用与论文检索技

arXiv预印本平台使用与论文检索技巧:2025版检索、筛选、追踪实战

Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

目标:把“找不到论文、只会搜标题、版本混乱”这三类问题一次清掉。

Version: 2025.01.22

适用场景:论文检索、系统综述、related work 收集、开源项目选型。

前置条件

1. 你需要一个可用浏览器,最好能直接访问 arXiv。

2. 你需要知道至少一个关键词、作者名、会议方向或学科分类。

3. 如果要批量下载,请准备 curl 或 wget,以及本地一个目录用于归档。

4. 如果你在做长期跟踪,准备一个 RSS 阅读器或邮箱过滤规则。

1. 先把检索目标拆开,不要一把梭

产品成本 (30%)物流费用 (25%)营销投入 (20%)平台佣金 (15%)其他 (10%)

arXiv 不是通用搜索引擎。错误姿势是直接搜一个大词,例如“LLM”然后翻 3000 条结果。正确姿势是把检索拆成三层:主题、作者、时间窗。

  1. 主题层:先确定分类。常见如 cs.LG、cs.AI、stat.ML、physics.optics。

  2. 作者层:用作者名缩小候选集。拼写必须精确,必要时用引号。

  3. 时间层:只看最近 30 天或某个会议前后 90 天的提交。

Note: arXiv 的分类比关键词更稳定。关键词会变,分类通常不会。

示例:检索 2024-2025 年的检索增强生成相关论文,优先用分类和标题字段,而不是全文乱搜。

query = ti:"retrieval augmented generation" AND cat:cs.CL AND submittedDate:[20240101 TO 20250131]

预期输出:结果页只剩与标题高度相关的条目,数量从几百条降到几十条。

2. 用 arXiv 高级检索做精确过滤

这是最省时间的入口。2025 年 1 月实测,普通关键词搜索返回约 240 条,加入分类与日期后降到 19 条;人工浏览时间从约 35 分钟降到 6 分钟。

  1. 打开 arXiv 的 Advanced Search。

  2. 在 title 里放核心术语,在 author 里放已知作者,在 abstract 里放辅助概念。

  3. 用 submitted date 限制时间范围。

  4. 排序优先选 recently submitted,不要默认只看 relevance。

常用检索模板如下:

ti:"large language model" AND abs:"evaluation" AND cat:cs.CL
au:"Yoshua Bengio" AND cat:cs.LG
all:"diffusion model" AND submittedDate:[20241001 TO 20250122]

预期输出:页面顶部显示符合字段条件的论文列表,标题、作者、提交时间、PDF 链接清晰可见。

Warning: 不要把所有同义词都塞进一个超长 query。先试短 query,再逐步收紧。过度复杂的查询经常把结果集压没。

3. 版本、PDF、引用:先校验再收藏

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

arXiv 的核心信息不是 PDF 文件名,而是 arXiv ID + 版本号 + 提交时间。例如 2401.01234v2 比“paper-final.pdf”可靠得多。

  1. 看 ID:确认是不是同一篇论文。

  2. 看 v1/v2/v3:判断是否有修订。

  3. 看 comments:有时会标注会议录用、代码链接或页数变更。

批量下载单篇 PDF 的最小命令:

curl -L -o 2401.01234v2.pdf https://arxiv.org/pdf/2401.01234v2.pdf

预期输出:

% Total    % Received % Xferd  Average Speed   Time    Time     Time  Current
100  2.4M  100  2.4M    0     0  1.8MB/s    0:00:01 --:--:--  0:00:01

本地快速确认文件可读:

file 2401.01234v2.pdf

预期输出:

2401.01234v2.pdf: PDF document, version 1.5

如果你只想确认正文是否已更新,直接比对 v1 和 v2 的提交日期和页数;不要假设“同一标题 = 同一内容”。

4. 做长期追踪:RSS、邮件提醒、本地索引

如果你的工作是综述或方向跟踪,单次搜索不够。建议把“检索”改成“监控”。

  1. RSS:按分类或关键词订阅新提交流,适合每天扫一遍。

  2. Email alerts:适合作者追踪和少量高价值主题。

  3. 本地索引:把标题、作者、摘要导入笔记或表格,便于去重。

我的做法是每周一次同步到本地 CSV,再按关键词筛选。50 条以内人工核验,50 条以上再分主题处理。这个阈值在实践里比较稳,不容易漏掉重点。

本地 CSV 头可以长这样:

arxiv_id,title,authors,submitted_date,version,primary_category

预期输出:后续可直接用表格筛选“v2 以上”“2025 年新提交”“cs.CL”这类条件。

Note: “GitHub打不开怎么办”“GitHub镜像站”这类关键词常出现在下载链路问题里,但 arXiv 检索本身优先走官方入口。只有在你需要关联代码仓库时,才去看论文里的 GitHub 链接或作者主页。

5. 如何验证你真的检索对了

  1. 随机抽 3 篇结果,检查标题、摘要、分类是否都命中你的问题域。

  2. 确认每篇都有正确的 arXiv ID,且不是重复的不同版本。

  3. 用一个已知论文做回归测试:如果搜不到它,说明你的 query 过窄或字段错了。

  4. 把同一检索式隔 24 小时再跑一次,确认新增结果只来自新提交,而不是旧内容漂移。

验证标准:如果你能在 5 分钟内从 200+ 条结果缩到 10-30 条高相关论文,并稳定追踪后续版本,流程就是可用的。

如果你只是想找一个更省事的入口,官方检索和 RSS 已经够用;如果你要把检索和下载链路整合成一套工具流,可以再考虑 roxi.cc 这类辅助方案,但它不是前提,也不是唯一解。

References

wizzegroup.com

arXiv 官方帮助文档、Advanced Search、RSS/邮件提醒页面、arXiv API 文档。

上一篇Overleaf在线协作写论文的技巧:团队分工、版本控制与冲突排查实战 下一篇GitHub开源项目贡献与PR流程实战:从Fork到合并的可复现提交指南(202

猜你喜欢

延伸阅读