← 回首页

AI 学术打假 — 1305 篇杰青论文连夜排查

真人长视频 · EP0037 2026年6月11日 5:07
这一期讲什么

不知道大家最近有没有关注过这个新闻:杰青团队的代表作造假这么多,我是真没想到。杰青团队承担着国家的大量科研经费,是我国科研的中流砥柱,结果官网上挂的代表作那么多假的。

更关键的是:这么简单能看出来的学术造假,居然没有一个审查体系——杂志在发表的时候,就没有一个检查的机制吗?

我仔细研究了耿同学发现造假的判断逻辑——数据的重复、图片的重复,其实都非常简单能够看出来。那我能不能用 AI 把耿同学做成一个 Skill,把 25 年全年杰青的所有 Nature 和 Nature 子刊论文跑一遍,看到底有多少造假的论文?

配套下载 · 给你的 Claude Code 学

不知道大家最近有没有关注过这个新闻:杰青团队的代表作造假这么多,我是真没想到。杰青团队承担着国家的大量科研经费,是我国科研的中流砥柱,结果官网上挂的代表作那么多假的,我刚刷到的时候是非常震惊的。

我当时就非常好奇:到底什么样的人能被评为杰青?我们国家的杰青有多少?国家又给这些杰青多少科研经费,以至于他们铤而走险去做这样的学术造假?更关键的是——这么简单能看出来的学术造假,居然没有一个审查体系。杂志在发表的时候,就没有一个检查的机制吗?

把耿同学做成一个 Skill

我仔细研究了耿同学到底是怎么发现这些造假的。他有一些自己的判断逻辑,包括数据的重复、图片的重复,其实都是非常简单能够看出来的。

那我就在想:我能不能用 AI 把耿同学做成一个 Skill,把 25 年全年杰青的所有 Nature 和 Nature 子刊的论文跑一遍,看到底有多少这样的造假论文。

第一步是名单。现在国家其实不公布杰青的大名单,只分别用小名单公布出来——我就让 AI 做了聚合和去重,找到几百个人的名单。然后去跑他们在 Nature 所有子刊上发表的论文,最终锁定了 187 位有 Nature 系期刊产出的获奖作者、1300 多篇论文。

因为 Nature 子刊是英文期刊,作者都是用拼音写的。为了确保这个人就是他,我还进行了一轮对比确认:确定是这个拼音、确定是这个学校、是这个专业方向的,才会记到名单底下。每一篇论文的具体地址、所有的数据和论文 PDF,全部下载下来——1305 篇。

四种造假指纹

这 1305 篇,我设计了四种检查机制:

  • 两列恒差 — 耿同学说的:如果是人工在 Excel 里拖行列去计算,会发现不同组数据的差值恒定不变。这是非常小儿科的做数据方法,但凡会随机数都不会是这样
  • 小数位锁定 — 改数据的时候只改整数位,小数位的末位全部不变,一大片数据小数位是一致的
  • 图片重复使用 — 用哈希值对比,完全一样才会报阳性
  • 行级重复 — 不同的样本集,数据完全一样

更复杂的都没有做。命中只是出一个「阳性的报告」——它有可能是造假,不是定论。

结果:578 篇里 2 个异常 + 2 个存疑

1305 篇里面,我真正分析到的论文只有 578 篇、44% 的数据。一个很大的原因是:很多论文没有 Excel 表格数据;还有一部分挂的外链、或者特殊格式,用 AI 简单的方法没办法把数据做完整分析。

这 578 篇论文当中,有两个案例几乎是明确可以看到有客观的数据异常,还有两个论文的数据是存疑的。很不幸,这四个案例全部都在生命科学领域——生命科学领域 300 多篇里就已经有四个嫌疑出来了。包括耿同学查出的论文,也是在生命科学领域高发。据说在 2010 年那段时间,生命科学领域的论文数据大量造假、大量撤回。

AI 给线索,定性靠人

把这些全部排查出来之后,我发现其实还是蛮难用 AI 做这件事情的:机器可以给一个线索,但最终定性说这到底是不是真的造假,还是需要人去花很大的精力——人工需要具备专业知识,才能找到里面所谓不合理的地方。

我已经把这个 skill 开源到了我的 GitHub 上,可以下载去做更多的检查——因为这仅仅只是 2025 年新晋杰青的结果。

也期待学术界可以有公开的监管机制,哪怕是各个院校本身自筛机制的建立。让学术界真的是有真才实学、做真科研的人拿到科研经费,为国家科技的发展做真实的贡献——而不是把这些钱都流向那些造假的骗子。

机器可以去给一个线索,但是最终定性说这个到底是不是一个真的造假,还是需要人去花很大的精力的。