AI 学术打假 — 1305 篇杰青论文连夜排查
不知道大家最近有没有关注过这个新闻:杰青团队的代表作造假这么多,我是真没想到。杰青团队承担着国家的大量科研经费,是我国科研的中流砥柱,结果官网上挂的代表作那么多假的。
更关键的是:这么简单能看出来的学术造假,居然没有一个审查体系——杂志在发表的时候,就没有一个检查的机制吗?
我仔细研究了耿同学发现造假的判断逻辑——数据的重复、图片的重复,其实都非常简单能够看出来。那我能不能用 AI 把耿同学做成一个 Skill,把 25 年全年杰青的所有 Nature 和 Nature 子刊论文跑一遍,看到底有多少造假的论文?
不知道大家最近有没有关注过这个新闻:杰青团队的代表作造假这么多,我是真没想到。杰青团队承担着国家的大量科研经费,是我国科研的中流砥柱,结果官网上挂的代表作那么多假的,我刚刷到的时候是非常震惊的。
我当时就非常好奇:到底什么样的人能被评为杰青?我们国家的杰青有多少?国家又给这些杰青多少科研经费,以至于他们铤而走险去做这样的学术造假?更关键的是——这么简单能看出来的学术造假,居然没有一个审查体系。杂志在发表的时候,就没有一个检查的机制吗?
把耿同学做成一个 Skill
我仔细研究了耿同学到底是怎么发现这些造假的。他有一些自己的判断逻辑,包括数据的重复、图片的重复,其实都是非常简单能够看出来的。
那我就在想:我能不能用 AI 把耿同学做成一个 Skill,把 25 年全年杰青的所有 Nature 和 Nature 子刊的论文跑一遍,看到底有多少这样的造假论文。
第一步是名单。现在国家其实不公布杰青的大名单,只分别用小名单公布出来——我就让 AI 做了聚合和去重,找到几百个人的名单。然后去跑他们在 Nature 所有子刊上发表的论文,最终锁定了 187 位有 Nature 系期刊产出的获奖作者、1300 多篇论文。
因为 Nature 子刊是英文期刊,作者都是用拼音写的。为了确保这个人就是他,我还进行了一轮对比确认:确定是这个拼音、确定是这个学校、是这个专业方向的,才会记到名单底下。每一篇论文的具体地址、所有的数据和论文 PDF,全部下载下来——1305 篇。
四种造假指纹
这 1305 篇,我设计了四种检查机制:
- 两列恒差 — 耿同学说的:如果是人工在 Excel 里拖行列去计算,会发现不同组数据的差值恒定不变。这是非常小儿科的做数据方法,但凡会随机数都不会是这样
- 小数位锁定 — 改数据的时候只改整数位,小数位的末位全部不变,一大片数据小数位是一致的
- 图片重复使用 — 用哈希值对比,完全一样才会报阳性
- 行级重复 — 不同的样本集,数据完全一样
更复杂的都没有做。命中只是出一个「阳性的报告」——它有可能是造假,不是定论。
结果:578 篇里 2 个异常 + 2 个存疑
1305 篇里面,我真正分析到的论文只有 578 篇、44% 的数据。一个很大的原因是:很多论文没有 Excel 表格数据;还有一部分挂的外链、或者特殊格式,用 AI 简单的方法没办法把数据做完整分析。
这 578 篇论文当中,有两个案例几乎是明确可以看到有客观的数据异常,还有两个论文的数据是存疑的。很不幸,这四个案例全部都在生命科学领域——生命科学领域 300 多篇里就已经有四个嫌疑出来了。包括耿同学查出的论文,也是在生命科学领域高发。据说在 2010 年那段时间,生命科学领域的论文数据大量造假、大量撤回。
AI 给线索,定性靠人
把这些全部排查出来之后,我发现其实还是蛮难用 AI 做这件事情的:机器可以给一个线索,但最终定性说这到底是不是真的造假,还是需要人去花很大的精力——人工需要具备专业知识,才能找到里面所谓不合理的地方。
我已经把这个 skill 开源到了我的 GitHub 上,可以下载去做更多的检查——因为这仅仅只是 2025 年新晋杰青的结果。
也期待学术界可以有公开的监管机制,哪怕是各个院校本身自筛机制的建立。让学术界真的是有真才实学、做真科研的人拿到科研经费,为国家科技的发展做真实的贡献——而不是把这些钱都流向那些造假的骗子。
来源:EP0037_audio.mp3 · ASR 模型 gemini-2.5-pro(切段并发) · 原片完整文字版
[00:00] 不知道大家最近有没有 关注过这个新闻啊 杰青团队的代表作造假这么多 我是真没想到 杰青团队承担着国家的 大量科研经费 是我国科研的中流砥柱 结果你们官网上挂的代表作 那么多假的 我刚刷到的时候是 非常震惊的 就是耿同学现在其实在 有些平台上 已经没有声量了 那我当时就非常好奇啊 因为我原来没有关注过 这个领域啊 就到底什么样的 人能被评为杰青 那我们国家的杰青有多少 那我们国家又给这些 杰青多少的科研经费 以至于他们铤而走险去
[00:25] 做这样的学术造假 更关键的是就是这么 简单能看出来的学术造假 居然没有一个审查体系 它那个杂志在发表的时候 它就没有一个检查的机制吗 那我就去仔细研究了 一下耿同学 到底是怎么 样去发现这些造假的 他其实有一些他自己的 判断的逻辑里面 就包括它的这个数据的 重复啊一些图片的重复其实都是 非常简单能够看出来的 那我就在想我能不能用 AI 把耿同学做成一个 Skill 把 25 年全年的杰青的
[00:50] 所有的 Nature 和包括 Nature 子刊的这个论文去跑一遍 看到底是有多少这样的 造假的论文 那我首先就去看了这样的 一个数字啊 就首先现在国家其实是不去公布 杰青的大名单的 那它是分别小名单公布出来 那我就让 AI 做了一个聚合和去重 那找到了这样几百个人的 名单之后呢 我又去跑了他们全网 就是 Nature 的子所有子刊的 他们发表的论文 最终锁定了 187
[01:15] 位有这个 Nature 系 刊期刊产出的 这个获奖作者的 1300 多篇论文 那包括他们是不同领域的 然后他们的学校 通过人名和学校因为你知道 在这个 Nature 子刊上是英文的期刊嘛 它都是用拼音来去写这个作者的 所以为了确保这个人就是他 那我还进行了一轮这个对 比的一个确认 就是它确定是这个拼音 而且是确定是这个学校是 这个专业方向的才会记
[01:40] 这个名单底下 我目前大家可以看到说 每一篇的论文它的具体的地址 然后以及它的所有的数据 和它的那个论文的 PDF 全部都是下载下来的 1305 篇 那这 1305 篇呢我设计了一个什么 样的机制呢 第一个就是耿同学说的两列恒差 就是如果它是人工的去 Excel 去拖了那个行列去进行计算的话 会发现是说它会有不同组的数据 不同组的数据的差值是
[02:05] 恒定不变的 你说这个就是非常小儿科的 一个做数据的方法了对吧 像耿同学说的 但凡会随机数都不会是这样的 然后还有这种小数的锁定 就是它改数据的 时候只改这个整数位 小数位的末位全部都不变 一大片数据全都是 小数位是一致的 这样简单的一个一个造假的方式 要么就是这个图片重复的使用 或者是这个行级重复 就是不同的样本集它的 数据是完全一样的 就是我只是做了这样的
[02:30] 四种去检查的方式 更复杂的都没有做 包括这个图片的重复我是 用哈希值去对比的 就是它完全一样才会出 现这样的一个 一个叫做阳性的报告 就是它有可能是造假了一个报告 那我把这些全部都排查出来之后 发现其实还是蛮难用 AI 做这件事情的 就是机器可以去给一个线索 但是最终定性说 这个到底是不是一个真的造假 还是需要人去花很大的
[02:55] 这个精力的 那我们来看一下就是 这 1305 篇里面其实 我只拿到了它 对比了它 40% 几的这个 44% 的数据是因为什么呢 我只拿到了 578 篇的论文 和他们的详细数据 一个很大的一个原因是 有很多的论文它是没有 这种 Excel 表格的数据的 还有一部分的
[03:20] 那它其实是没有办法去 正常的拿到它的数据的 它有可能是挂的外链 或者是说一些特殊的格式 就是用 AI 简单的方法是没有办法去 把它的数据做完整的分析的 所以我真正分析到这个 论文的数量 只有 578 篇 那这 578 篇论文当中 有两个案例是几乎是 明确的可以看到它是有这个 客观的数据异常的 还有两处数据是 两个论文的数据是存疑的
[03:46] 那很不幸的是 这四个案例全部都是 这个生命科学领域的 我也不知道是为什么 难道是这个生命科学领域的这个 杰青们这个不太懂这个计算机的 这个原理 不会用随机数生成器还是怎样 就真的是 包括那个耿同学查出的这个 论文也是 在生命科学领域是高发的 我已经把这样的一个 skill 去开源到了我的 GitHub 上 可以去下载去去使用做 更多的检查
[04:11] 因为这仅仅只是 2025 年 去新晋杰青的这样的一个结果 那你说这个这个叫做我看看 生命科学领域里面 300 多篇里面就已经 有四个嫌疑出来了 那越往前其实造假的比例 尤其是在据说啊是在 2010 年 那那段时间 生命科学领域的这个论文的 数据造假 大量的造假大量的撤回 就是那哪怕有 AI 的一个加持 去做这个学术打假也不是
[04:36] 一件容易的事情 那这里面需要有大量的人工 去核实 人工需要具备专业知识 才能找到它里面所谓不合理的 这些这些地方 所以也是期待啊 学术界可以有公开的 这种监管机制 哪怕是这个各个院校本身的一个 自筛的一个机制的建立 能够让这个学术界真的是 真的是有真才实学 去做真科研的 人去拿到我们的这个科研 的经费为这个国家的
[05:01] 这个科技的发展 去做真实的贡献 而不是说把这些钱都流向那些 造假的骗子