← 回首页

大模型降智了怎么办 — 4 个 AI 互审,第 5 个 AI 来评理

真人长视频 · EP0018 2026年5月24日 8:30
这一期讲什么

不会写代码用 Claude Code,最痛的就是 「已修复」死循环 — 它跟你说改好了,你跑一下还是报错。来回三遍四遍,项目就卡死在这了

光多问几个 AI 没用 — ChatGPT / Gemini / Grok 各说各话,拼一拼丢给 Claude Code,依旧解决不了

我做了个 skill 叫大模型议会

  • 4 个角色 / 4 家厂商:推进者 Gemini · 批评者 GPT · 挑刺者 Grok · 使用者 Claude Code 自己(有你项目的 memory)
  • 第 5 个评理:Opus 4.7 做裁判,只看成员 A/B/C/D,跨厂商不偏自家
  • R0 联网调研:先用 Perplexity 拿最新行业实况,免得拿过时数据辩论
  • 强制反附和:挤掉 GPT 那种 "你真是个天才" 拍马屁模式
  • 顺便它审了自己 — 我让议会审我做的 skill,找出 5 处优化点

跑一次 $1-2.5 / 3-5 分钟 / GitHub 已开源。

配套下载 · 给你的 Claude Code 学

不会写代码的小伙伴用 Claude Code,会遇到一个非常头疼的问题。它经常会跟你说 — “这个东西我已经做好了”

你看不懂代码,你就去跑一下,就发现报错。你再丢回去,它又跟你说改好了,你再跑还是报错。来回三遍四遍,真的是非常的头疼。

你心里其实知道这事儿不对 — 你也隐约觉得 Claude Code 已经解决不了了,但你就是没办法。项目开发就卡死在这了。尤其是项目做到比较复杂的时候,特别明显。

那这个问题怎么办呢?我的解决方案叫做大模型议会

多问几个 AI 不够

你听到”大模型议会”这个名字,可能会想 — 不就是多找几个模型来问嘛?我把这个问题跟 GPT、Gemini、Grok 各问一遍,对吧?

听起来都对。但他们给的答案呢 — 基本上各说各话。尤其是把他们的答案汇总起来给到 Claude Code 的时候,依旧是不能解决这个问题的

所以我设计了一套结构,让他们真的能够 — 针对当前这个问题,了解到足够充分的信息,然后进行一场真正的辩论

4 个角色,4 家厂商,4 种性格

推进者 — Google 的 Gemini 专门针对当前情况提出建设性的解决方案、可执行的解决路径。它就是负责提案的

批评者 — GPT-5 在方案的基础上,专门找里面的边界情况 — 你看这个你没想到吧。

我在 GPT 的提示词里加入了 PUA 的部分。因为网上一些报告显示,GPT 模型在被 PUA 的情况下,表现是会提升很多的

挑刺者 — Grok 4.2 multi-agent 要求它以最反共识的一个方式去找这些方案当中的盲区。议会里必须有一个强制唱反调的角色 — 不然几个大模型在那儿互相拍马屁。

使用者 — Claude Code 自己(Opus 4.7) 这个不是另外找的模型。为什么?

因为其他三个都是外部咨询顾问。只有 Claude Code 是有我们之前项目的记忆的 — 它知道你之前踩过什么坑、你的系统是什么、你的预算是什么。那些其他的模型再聪明,也不认识你

而且 Claude Code 直接在订阅里跑,不用额外掏 API 的钱

第 5 个 AI 来评理

4 个角色齐了之后,还得有一个裁判。我用的是 Anthropic 现在最强的 — Claude Opus 4.7

这里最狠的一招 — 在它总结之前,我会把其他家反馈过来的辩论结果做一个预处理

  • 把发言风格处理成没有性格特色的
  • 把各家模型模糊成 成员 A / 成员 B / 成员 C / 成员 D

最终裁决的模型是一个盲评 — 它不知道哪个成员是谁的情况下进行汇总。这样就不会有偏袒

上下文打包 + 联网调研

议会开起来前,要打包一套完整的上下文给所有发言人:

  • 程序跑在什么样的系统上、用什么技术栈、跑了多久、用户量多少
  • 相关的真实代码
  • 之前用过哪些方案、排除了什么可能性
  • 约束条件 — 不能它说”买个显卡”,我没有预算买显卡,对吧

然后还会用 Perplexity 的 API 完成一轮辩论前的调研。因为大模型的训练数据有截止日期 — 它只能是 2025 年某几月之前的一个认知,没有最新的探索、知识和最佳实践。这一步非常重要

议会怎么开

第一步 — 各自独立审 4 个 AI 同时收到资料,互相看不见。每个按角色给第一轮反馈,并且强制提交一份结构性的总结表格 — 不能各写各的小作文,免得没法对齐。

第二步 — 真匿名化辩论 让每家看到其他三家的卡片,但不知道对方是哪个模型。因为有的模型会发现”这是 GPT 啊”,然后”GPT 说的对啊”… 不能让他们陷入这样的环境。所以完全是匿名的,只看到”成员 B 说了什么”

强制加了一条规矩 — 不能附和别人。尤其是 GPT 那个拍马屁的模式 — “你真是个天才哦”、“从来没有人想出过这样的解法”… 一定要用强制反附和的提示词把它按住。

第三步 — 综合裁决 Opus 4.7 看完所有人意见之后给我两份东西

  • 第一份给我看的 — 4 个角色都同意的有几条、3 比 1 多数的有几条、2 比 2 分裂的有几条,最后出一个推荐方案
  • 第二份留底的 — 每个观点谁先提的、谁后来改了立场、有没有人附和

什么时候用

  • 架构选型
  • 方案对比
  • 设计评审 / 审计
  • 关键决策的盲区检查
  • bug 审查 — 每当 Claude Code 自己解决不了问题的时候,我都会这么跑一轮

扩展到 7 个人

后来发现 GPT-5.5 自己做批评者可能不够。所以我加了一个开关 — 批评者同时用两个模型干,挑刺者也同时用两个模型干,扩展整个思考的丰富程度

辩论轮次也可以从两轮扩展到三轮、四轮。当然太多轮次其实就没意义了。

让议会审自己 — 找出 5 个我没意识到的问题

还跟大家说一个特别好玩的事

完成这个 skill 之后,我让这个议会自己审计了一下自己。结果发现了大概五处可以优化迭代的地方 — 然后它自己完成了一个对自己的评审和进化的过程。

真的是很有意思。我用我自己写的工具,去审了我自己写的工具,它告诉我我错在了哪。

开源

这个 skill 我已经开源了,完整的代码、所有的指令全部都在 GitHub 上面(仓库地址见上方下载卡)。

跑一次默认配置 $1 到 $2.5 / 3 到 5 分钟。如果你跟我一样平时也是看不懂代码、但又想用 AI 做事的 — 这个工具我觉得值得装一下。

下一回你的 Claude Code 跟你说”已修复”的时候 — 你别直接信。开一个议会,让 4 家厂商的 AI 一起来看看,你心里就有底了

做大决策的时候,别只信一个 AI。让 4 家厂商的 AI 同时来审,第 5 个来评理 — 找不一样的脑子来看这个事,比它们辩论本身还要更重要

还跟大家说一个特别好玩的事 — 完成这个 skill 之后,我让这个议会自己审计了一下自己。