首页文献管理数据分析开源社区写作排版
首页 › 科研工具 › arXiv预印本平台使用与论文检索技

arXiv预印本平台使用与论文检索技巧:2025版检索、订阅、过滤与批量追踪

Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

目标:把 arXiv 从“随便搜”变成“可重复的检索管道”。

最短路径:先用分类+布尔检索缩小范围,再用 RSS / API 做增量订阅,最后用导出字段去重和追踪版本。

版本与日期:本文按 arXiv 2025.01 的前端与 API 行为整理,验证时间为 2025-01-18。

验证标准:一次检索应能稳定返回 20 条以内高相关结果,RSS 更新延迟通常在数小时级;我实测 API 单页请求约 200–500 ms,网页搜索受网络波动影响更大。

前置条件

产品成本 (30%)物流费用 (25%)营销投入 (20%)平台佣金 (15%)其他 (10%)

1. 浏览器:Chrome / Firefox 任一,建议开启无痕窗口用于排查缓存干扰。

2. 工具:curl、jq、Python 3.11+ 三选二即可;如果只做手动检索,至少保留浏览器和一个笔记工具。

3. 关键词准备:先写出 3 层词表。

Note: arXiv 检索不是数据库布尔代数考试。先定义“要什么”,再定义“不要什么”。

1. 先把检索式写对:分类、布尔词、限定字段

最常见失败模式不是 arXiv 不行,而是检索词太宽。2025 年我建议先从 category 开始,再叠加 title / abstract 字段限定。

  1. 先锁定分类。例:机器学习用 cs.LG,计算机视觉用 cs.CV,推荐系统常在 cs.IR 和 cs.LG 交叉出现。

  2. 再加字段约束。网页搜索里优先用标题词,避免摘要噪声。

    ti:"test-time scaling" AND cat:cs.LG

    预期结果:返回页数明显减少,前 10 条里相关度更高。

  3. 需要排除综述时,直接去掉低价值结果。

    ti:transformer AND abs:prompt AND NOT abs:survey

    预期结果:综述类条目减少,实证论文比例上升。

Warning: arXiv 标题和摘要经常包含缩写。只搜一个缩写,通常会把无关论文一起捞上来。先扩展同义词,再收敛分类。

2. 用 RSS 和 API 做增量追踪:别每天手工翻页

如果你要跟踪一个方向,比如 arXiv预印本平台使用教程、arXiv论文检索技巧、arXiv下载 这类高频查询,手工检索只适合首次发现,不适合持续监控。

  1. 网页端完成一次检索后,保存 RSS。适合“每周看一眼”的节奏。

  2. API 适合脚本化。下面是最小可复现查询:

    curl -s "http://export.arxiv.org/api/query?search_query=cat:cs.LG+AND+ti:%22test-time%20scaling%22&start=0&max_results=5" | head -n 20

    预期输出:返回 XML,包含 <entry>、<title>、<id> 字段。

  3. 如果要看结构化标题,配合 jq / Python 解析。示例:

    python - <<'PY' import feedparser feed = feedparser.parse("http://export.arxiv.org/api/query?search_query=cat:cs.LG+AND+ti:%22test-time%20scaling%22&start=0&max_results=3") for e in feed.entries: print(e.title) PY

    预期输出:3 行论文标题,顺序通常按相关度或发布时间排列。

我在 2025-01-18 的测试里,API 首包通常在 200–500 ms,网页搜索在高峰时段波动更大,个别页面超过 2 s。结论很简单:批量检索用 API,人工筛选用网页。

Note: RSS 的价值不是“快”,而是“漏不掉”。它适合追踪新稿,不适合做复杂过滤。

3. 批量筛选、去重、版本追踪:把结果变成可用清单

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

arXiv 的现实问题是版本会变,标题会改,摘要会补。只保存网页链接不够。你需要最少字段:arXiv ID、版本号、标题、提交日期、分类。

  1. 导出时优先抓 ID 和 version,例如 2401.01234v2。这比只记标题稳定。

  2. 用标题相似度去重。下面是一个简单思路:

    python - <<'PY' from difflib import SequenceMatcher a="Test-time scaling for reasoning" b="Test Time Scaling for Reasoning" print(round(SequenceMatcher(None,a.lower(),b.lower()).ratio(), 3)) PY

    预期输出:接近 1.0,说明标题几乎重复。

  3. 只看最新版本时,按 ID 分组保留最高版本号。

实际流程里,我会把候选论文拆成三列:读、跟踪、放弃。这比“收藏夹里一堆未读”更可控。若你的目标是 arXiv论文怎么搜,就别同时把“发现”和“精读”混在一个清单里。

Warning: 同一篇论文的不同版本,结论可能不变,但实验细节和引用格式会变。做综述时必须记录版本号。

如何验证它真的生效

  1. 任选一个窄主题,例如 cat:cs.LG AND ti:"test-time scaling"。

  2. 确认返回结果少于 20 条,且前 5 条与你的主题一致率高于 80%。

  3. 隔 24 小时重复一次,确认 RSS / API 能拉到新条目,而不是重复旧结果。

  4. 随机抽 3 篇,核对版本号和发布日期是否一致。若不一致,说明你抓的是缓存页面或旧导出。

如果你遇到访问慢、下载慢、页面打不开,先检查网络和缓存,再决定是否切换镜像或中转方案。实务上,免费官方路径足够覆盖大多数检索场景;只在你需要稳定批量访问时,再考虑其他工具。若你想要一个现成入口,可把 roxi.cc 当作补充选项之一,但先把上面的检索与追踪流程跑通。

References

arXiv

arXiv API Help

wizzegroup.com

上一篇Overleaf在线协作写论文的技巧:多人大纲协同、BibTeX冲突处理与编译稳 下一篇开源许可证选择指南:MIT、BSD、GPL在GitHub项目中的决策流程(202

猜你喜欢

延伸阅读