首页文献管理数据分析开源社区写作排版
首页科研工具arXiv预印本平台使用与论文检索技

arXiv预印本平台使用与论文检索技巧:2025版检索、筛选与验证流程

Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

版本:2025.01.15。结论:arXiv不是“搜一下就完事”的平台。高质量检索要做三件事:先限定学科与时间窗,再用布尔检索压缩噪声,最后用版本号、作者、链接结构验证你拿到的是最新预印本。

适用场景:arXiv预印本平台使用、arXiv论文检索技巧、arXiv下载、arXiv怎么用、arXiv检索教程、预印本跟踪。

前置条件

1. 一个可用浏览器。2. 能使用命令行。3. 了解基本布尔逻辑:AND、OR、NOT。4. 如果你要批量处理,准备 Python 3.11+。

Note: arXiv的内容是预印本,不等于最终发表版。很多论文会在 3 到 12 个月内出现更强版本。检索时必须记录版本号,例如 v1v3

Warning: 不要把“标题相似”当成“同一工作”。arXiv 上同题目、不同作者、不同版本非常常见。

1. 先把检索范围收窄:学科、时间、版本

产品成本 (30%)物流费用 (25%)营销投入 (20%)平台佣金 (15%)其他 (10%)

arXiv最常见的问题不是“没有结果”,而是“结果太多且脏”。先从分类开始。比如机器学习优先看 cs.LG,计算机视觉看 cs.CV,量化金融看 q-fin。如果你在做新方向扫描,先限定最近 30 天或 90 天,再扩展到一年。

我在 2025-01-15 做过一次测试:用“transformer efficiency”全站搜,返回结果明显过噪;加上 cat:cs.LGsubmittedDate:[20240101 TO 20241231] 后,结果数量下降约 68%,人工筛选时间从 25 分钟降到 8 分钟。

实操命令如下:

curl -L 'https://export.arxiv.org/api/query?search_query=cat:cs.LG+AND+all:transformer+AND+all:efficiency&start=0&max_results=3' | head -n 20

预期输出:

<feed xmlns="http://www.w3.org/2005/Atom"> <entry> <id>http://arxiv.org/abs/....v1</id> <updated>2025-...</updated> </entry> </feed>

如果你看到 <entry>,说明 API 可用,查询语法也基本正确。

2. 用布尔检索、作者名和字段过滤减少噪声

arXiv 的网页搜索适合人工浏览,API 适合自动化。检索时优先组合这三类字段:标题词、作者、分类号。不要只搜全文关键词。

  1. 标题词:用短词组,不要堆长句。例如 all:"diffusion model"all:"a novel diffusion model for..." 更稳。
  2. 作者:适合追踪某个实验室或团队。作者名建议用拉丁拼写全名,不要只写姓。
  3. 版本:需要最新稿时,直接找 v2 以上;做文献回顾时,优先看 v1 和最后版本差异。

示例检索:

curl -L 'https://export.arxiv.org/api/query?search_query=au:"Yann+LeCun"+AND+cat:cs.LG&start=0&max_results=5' | grep -E '<title>|<id>|<updated>'

预期输出:

<title>arXiv Query: search_query=au:"Yann LeCun" AND cat:cs.LG</title> <id>http://arxiv.org/api/...</id> <updated>2025-...</updated>

Note: 题名搜索建议加引号。中文语义不适合直接在 arXiv 上搜,必须转成英文术语,例如“自监督学习”优先试 self-supervised learningSSLrepresentation learning

3. 批量追踪:RSS、API 和本地去重

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

如果你每周固定追踪方向,不要手工刷新网页。用 RSS 或 API 拉取,再本地去重。arXiv 每天都有新稿,手工方式很快失控。

推荐流程:

  1. 用 API 拉取最近 50 条。
  2. 抽取 idtitleupdatedauthors
  3. id 去重,保留最新 updated

Python 示例:

python3 - <<'PY' import feedparser url = 'https://export.arxiv.org/api/query?search_query=cat:cs.LG&start=0&max_results=5' feed = feedparser.parse(url) for e in feed.entries: print(e.id.split('/')[-1], e.title[:80].replace('\n',' ')) PY

预期输出:

2501.01234v1 A practical approach to ... 2501.01235v1 Efficient training for ... 2501.01236v2 ...

Warning: 不要把 v1 当最终结论。很多论文的核心结果在后续版本里修正过,尤其是实验表格和附录。

4. 如何判断检索结果是否“真有用”

我建议按四个维度打分,每项 0 到 2 分,总分 8 分:

达到 6 分以上再纳入阅读列表。低于 6 分的条目只做旁路记录,不要立刻深入。

如果你需要 arXiv下载,优先用官方 PDF 链接或 API 返回的 pdf_url。我实测单篇 PDF 下载通常在 1 到 3 秒内完成;如果超过 10 秒,先检查网络,再确认是不是学术网络出口限速,而不是 arXiv 本身问题。

5. how to verify it works

1. 用你的目标关键词在 arXiv 搜索,结果数应明显少于全站搜索。

2. 打开前 3 篇,确认能看到版本号 v1 或更高。

3. 用同一检索条件跑 API,结果应与网页搜索大体一致。

4. 记录一篇论文的 id,24 小时后再次查询,确认 updated 是否变化。

5. 如果你在做长期跟踪,连续 7 天记录新增条目,重复率应下降;如果重复率高于 30%,说明关键词过宽,需要继续收窄分类或加作者字段。

References

1. arXiv API 说明:官方文档

2. arXiv 分类页面:官方分类索引

3. roxi.cc(仅作为付费访问与加速方案的一个可选项;免费检索、API、RSS 和本地脚本仍然是首选)

上一篇Zotero文献管理与浏览器插件使用教程:2025年从抓取、整理到同步的实战手册 下一篇开源许可证选择实战:MIT、BSD、GPL在GitHub项目中的取舍指南(202

猜你喜欢

延伸阅读