• 请不要在回答技术问题时复制粘贴 AI 生成的内容
cs1707
V2EX  ›  程序员

我把 7000 多篇 AI 顶会论文,整理成了一份可以被机器读懂的数据集,需要自取

  •  
  •   cs1707 ·
    Ontos-AI · 4h 29m ago · 391 views
    我是做 AI 研究的,经常为了确认一个实验设置,在几十篇 PDF 里来回翻。比方说我想知道某个方向常用哪些数据集、指标和训练方案,只能自己建表、自己比对。

    但是,一篇论文动辄几十页,管线架构、算法模块、训练参数、算力消耗、表现指标和其他方法细节,都藏在正文、表格、图注和附录里。几千篇论文堆在一起,还没有目录:想找“用过同一组数据集、针对同一个 benchmark”的工作,只能手动翻,效率太慢了。

    所以,借助自研的开源文档解析工具 Knowhere ,我把 AI 顶会论文批量整理为结构化数据,提取了关键实验参数,并在 🤗 Hugging Face 上开源了。已上线的 2023 年数据集覆盖 NeurIPS 、ICML 、ICLR 约 7300 篇论文,包含标题、摘要、作者、会议、研究主题、结构化内容摘要和语义向量,方便检索、筛选和发现相似论文。

    需要的老哥可以自取: https://huggingface.co/datasets/JensCS/top-ml-conference-papers-2023



    可能有些老哥不做科研这个方向,所以我先简单介绍一下数据集是干嘛的:

    在研究和工程里,除了查找论文,还有一类像技术选型、方案比较这样的场景,比方说:这个方法是在什么条件下有效的?同类工作普遍采用什么指标?一项结果花了多少训练资源?不同论文的对比是否站在同一条起跑线上?

    这些答案通常不在标题和摘要里,而在论文内部。我希望把这部分内容也逐步变得可查、可比。

    直接让大模型读论文当然也有用,但逐篇对话并不能天然变成一个跨数千篇论文、可重复检索和横向比较的资料库。结构化数据做的,就是把“临时找答案”变成一套可以持续使用的索引,让论文里面的内容能被检索、被对比、被拿来算点什么。



    OK ,那拿到数据集,具体可以怎么用呢?(不要觉得“顶会论文数据集”听着挺学术,其实它的用处不止在实验室里。)

    - 刚入行的人可以把它当成一张地图——不用在几千篇论文里瞎逛,按年份、会议、主题扫一遍,就能看出一个方向是怎么冒出来、火起来、又分出几个流派的。

    - 做产品、做投资研究的人可以用它分辨真趋势和假热点:一个概念突然被反复提起,是真的有突破,还是换了个新名字继续讲故事?把好几年的论文摆在一起看,答案通常比看新闻稿清楚得多。

    - 工程团队选技术方案的时候,也不用只信一篇论文的结论,可以把几个方案用的数据、指标、训练成本摆在一起比一比,再决定要不要用。

    - 老师、学生、做科普的人则能省掉不少手工整理的功夫——做个领域时间线、开门课的阅读清单,直接从数据里挑就行,不用从头一篇篇啃。

    - 对审稿、复现研究和跨学科的 AI for Science 工作来说,这种横向比较同样有价值。过去需要手工做的资料整理,如今工作量减半了。

    所以,这份数据集相当于把原来只有少数人能高效阅读的论文内容,变成大家都能查、都能懂的东西了。



    除了给人用,这份数据还有一个更远一点的用途:给科研 Agent 当知识底座。

    一个能打的科研 Agent ,至少要能查到前人做过什么,记住自己试过什么,并验证自己的结论,还要能随时检测最新的领域动向。我整理的这份结构化论文数据,恰好能解决其中的第一步:让 Agent 不必每次都从零翻 PDF ,也能查到论文里的方法、实验设置和结论,并把找到的信息追溯回原文。未来,它可以先从数据集中归纳某类任务的常见方案,再设计实验,与文献基线比较,并留下失败记录供下一轮参考。

    当然,2023 年的数据只是个开头。接下来我会把 2024 到 2026 年的论文陆续补上,往具身智能以及 NSC 正刊和子刊这些方向扩展会议范围,也会挖得更深——实验参数、训练配置、论文之间的引用关系都在计划里。时间跨度拉长以后,这份数据能回答的就不只是“现在有哪些论文”,还能看出一个方向是怎么一步步变成现在这样的。

    供大家参考。

    最后,如果你觉得数据集喂 AI 这个想法很有用,但是 AI 研究和具身智能不是你的方向,那我也可以把工具介绍给你,就是这个项目 Knowhere ,开源的: https://knowhereto.ai/github?utm_source=v2ex

    因为学术论文其实是文档解析里比较难啃的一类:多栏排版、复杂公式、跨页表格、图和图注分得老远,正文和附录之间还有大量互相引用。直接把 PDF 转成纯文本,很容易把阅读顺序打乱,表格和上下文也保不住。

    所以,这个从文档识别、解析到 chunking 、embedding 再到最后形成 memory 一条龙服务的工具就很有用。Knowhere 会从解析和结构重建开始,识别文字、表格、图片、公式,把章节层级还原出来,并且尽量保住内容之间的关联。比如抽到“learning rate = 1e-4”这条信息,不是光记个数字,还会记得它是哪篇论文、哪组实验、哪个模型的参数。

    然后是检索,在用户或者 Agent 提问以后,系统结合语义、文档结构和关联关系去找答案,再把结果指回原文的具体位置。就是它不是凭空给你答案的,它还会给你一条能回头核对的线索。对于做知识库或者数据集、Agent 开发,尤其是专家型的智能体开发,会很有用。

    有需要的各位可以自取,有其他疑问也可以留言~
    6 replies    2026-07-26 01:02:37 +08:00
    YanSeven
        1
    YanSeven  
       4h 23m ago
    感觉这个给做“论文阅读工具”做“论文推荐检索”业务的很有用。
    rpish
        2
    rpish  
       4h 13m ago
    谢谢分享。
    有点好奇 op 的工具和市面上的大模型的 Deep Research ,还有 Agent 工具自动任务执行对比,有何优势呢?
    wecan
        3
    wecan  
       3h 54m ago
    感谢分享,这个数据集应该挺有用的,不过想问下为什么选了 2023 年?
    cs1707
        4
    cs1707  
    OP
       3h 37m ago
    @wecan 因为 AI 大模型是从 23 年开始爆发的。
    chenkali
        5
    chenkali  
       2h 39m ago
    大佬,我请教下你: 使用 knowhere 可以搜“材料科学与工程”方面的 EI 、SCI ,然后建模、建数据库吗?
    tinydream520
        6
    tinydream520  
       1h 56m ago
    大佬牛,这也可以训练出来
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1028 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 26ms · UTC 18:59 · PVG 02:59 · LAX 11:59 · JFK 14:59
    ♥ Do have faith in what you're doing.