大模型降智了怎么办 — 4 个 AI 互审,第 5 个 AI 来评理
不会写代码用 Claude Code,最痛的就是 「已修复」死循环 — 它跟你说改好了,你跑一下还是报错。来回三遍四遍,项目就卡死在这了。
光多问几个 AI 没用 — ChatGPT / Gemini / Grok 各说各话,拼一拼丢给 Claude Code,依旧解决不了。
我做了个 skill 叫大模型议会:
- 4 个角色 / 4 家厂商:推进者 Gemini · 批评者 GPT · 挑刺者 Grok · 使用者 Claude Code 自己(有你项目的 memory)
- 第 5 个评理:Opus 4.7 做裁判,只看成员 A/B/C/D,跨厂商不偏自家
- R0 联网调研:先用 Perplexity 拿最新行业实况,免得拿过时数据辩论
- 强制反附和:挤掉 GPT 那种 "你真是个天才" 拍马屁模式
- 顺便它审了自己 — 我让议会审我做的 skill,找出 5 处优化点
跑一次 $1-2.5 / 3-5 分钟 / GitHub 已开源。
不会写代码的小伙伴用 Claude Code,会遇到一个非常头疼的问题。它经常会跟你说 — “这个东西我已经做好了”。
你看不懂代码,你就去跑一下,就发现报错。你再丢回去,它又跟你说改好了,你再跑还是报错。来回三遍四遍,真的是非常的头疼。
你心里其实知道这事儿不对 — 你也隐约觉得 Claude Code 已经解决不了了,但你就是没办法。项目开发就卡死在这了。尤其是项目做到比较复杂的时候,特别明显。
那这个问题怎么办呢?我的解决方案叫做大模型议会。
多问几个 AI 不够
你听到”大模型议会”这个名字,可能会想 — 不就是多找几个模型来问嘛?我把这个问题跟 GPT、Gemini、Grok 各问一遍,对吧?
听起来都对。但他们给的答案呢 — 基本上各说各话。尤其是把他们的答案汇总起来给到 Claude Code 的时候,依旧是不能解决这个问题的。
所以我设计了一套结构,让他们真的能够 — 针对当前这个问题,了解到足够充分的信息,然后进行一场真正的辩论。
4 个角色,4 家厂商,4 种性格
推进者 — Google 的 Gemini 专门针对当前情况提出建设性的解决方案、可执行的解决路径。它就是负责提案的。
批评者 — GPT-5 在方案的基础上,专门找里面的边界情况 — 你看这个你没想到吧。
我在 GPT 的提示词里加入了 PUA 的部分。因为网上一些报告显示,GPT 模型在被 PUA 的情况下,表现是会提升很多的。
挑刺者 — Grok 4.2 multi-agent 要求它以最反共识的一个方式去找这些方案当中的盲区。议会里必须有一个强制唱反调的角色 — 不然几个大模型在那儿互相拍马屁。
使用者 — Claude Code 自己(Opus 4.7) 这个不是另外找的模型。为什么?
因为其他三个都是外部咨询顾问。只有 Claude Code 是有我们之前项目的记忆的 — 它知道你之前踩过什么坑、你的系统是什么、你的预算是什么。那些其他的模型再聪明,也不认识你。
而且 Claude Code 直接在订阅里跑,不用额外掏 API 的钱。
第 5 个 AI 来评理
4 个角色齐了之后,还得有一个裁判。我用的是 Anthropic 现在最强的 — Claude Opus 4.7。
这里最狠的一招 — 在它总结之前,我会把其他家反馈过来的辩论结果做一个预处理:
- 把发言风格处理成没有性格特色的
- 把各家模型模糊成 成员 A / 成员 B / 成员 C / 成员 D
最终裁决的模型是一个盲评 — 它不知道哪个成员是谁的情况下进行汇总。这样就不会有偏袒。
上下文打包 + 联网调研
议会开起来前,要打包一套完整的上下文给所有发言人:
- 程序跑在什么样的系统上、用什么技术栈、跑了多久、用户量多少
- 相关的真实代码
- 之前用过哪些方案、排除了什么可能性
- 约束条件 — 不能它说”买个显卡”,我没有预算买显卡,对吧
然后还会用 Perplexity 的 API 完成一轮辩论前的调研。因为大模型的训练数据有截止日期 — 它只能是 2025 年某几月之前的一个认知,没有最新的探索、知识和最佳实践。这一步非常重要。
议会怎么开
第一步 — 各自独立审 4 个 AI 同时收到资料,互相看不见。每个按角色给第一轮反馈,并且强制提交一份结构性的总结表格 — 不能各写各的小作文,免得没法对齐。
第二步 — 真匿名化辩论 让每家看到其他三家的卡片,但不知道对方是哪个模型。因为有的模型会发现”这是 GPT 啊”,然后”GPT 说的对啊”… 不能让他们陷入这样的环境。所以完全是匿名的,只看到”成员 B 说了什么”。
还强制加了一条规矩 — 不能附和别人。尤其是 GPT 那个拍马屁的模式 — “你真是个天才哦”、“从来没有人想出过这样的解法”… 一定要用强制反附和的提示词把它按住。
第三步 — 综合裁决 Opus 4.7 看完所有人意见之后给我两份东西:
- 第一份给我看的 — 4 个角色都同意的有几条、3 比 1 多数的有几条、2 比 2 分裂的有几条,最后出一个推荐方案
- 第二份留底的 — 每个观点谁先提的、谁后来改了立场、有没有人附和
什么时候用
- 架构选型
- 方案对比
- 设计评审 / 审计
- 关键决策的盲区检查
- bug 审查 — 每当 Claude Code 自己解决不了问题的时候,我都会这么跑一轮
扩展到 7 个人
后来发现 GPT-5.5 自己做批评者可能不够。所以我加了一个开关 — 批评者同时用两个模型干,挑刺者也同时用两个模型干,扩展整个思考的丰富程度。
辩论轮次也可以从两轮扩展到三轮、四轮。当然太多轮次其实就没意义了。
让议会审自己 — 找出 5 个我没意识到的问题
还跟大家说一个特别好玩的事。
完成这个 skill 之后,我让这个议会自己审计了一下自己。结果发现了大概五处可以优化迭代的地方 — 然后它自己完成了一个对自己的评审和进化的过程。
真的是很有意思。我用我自己写的工具,去审了我自己写的工具,它告诉我我错在了哪。
开源
这个 skill 我已经开源了,完整的代码、所有的指令全部都在 GitHub 上面(仓库地址见上方下载卡)。
跑一次默认配置 $1 到 $2.5 / 3 到 5 分钟。如果你跟我一样平时也是看不懂代码、但又想用 AI 做事的 — 这个工具我觉得值得装一下。
下一回你的 Claude Code 跟你说”已修复”的时候 — 你别直接信。开一个议会,让 4 家厂商的 AI 一起来看看,你心里就有底了。
做大决策的时候,别只信一个 AI。让 4 家厂商的 AI 同时来审,第 5 个来评理 — 找不一样的脑子来看这个事,比它们辩论本身还要更重要。
来源:EP0018_audio.mp3 · ASR 模型 gemini-2.5-pro(切段并发) · 8:30 原片完整文字版
[00:00] 实在是太困了 — 但不能断更啊,对吧。
不会写代码的小伙伴用 Claude Code,就会遇到一个非常头疼的问题。它经常会跟你说 — 这个东西我已经做好了。你看不懂代码嘛,你就去跑一下,就发现报错。你再丢回去,然后它跟你说改好了。然后你再跑还是报错。这么来回三遍四遍,真的是非常的头疼。
[00:20] 那这种情况,你知道这件事它不对,对吧。而且你也隐约觉得 Claude Code 已经解决不了了,但你就是没办法。那你开发就卡死在这了。尤其是一些项目做到比较复杂的时候,就会出现这样的问题。
[00:33] 那这个问题怎么办呢?今天我就来给大家讲一下。我的解决方案叫做大模型议会。
[00:38] 这个议会怎么开起来的呢?当你听到大模型议会这个名字,你可能会想说 — 不就是多找几个模型来问嘛,对吧?我把这个问题跟 GPT、Gemini、Grok 各问一遍。听起来都对,但他们给的答案呢,就基本上各说各话。尤其是把他们的答案汇总起来给到 Claude Code 的时候,依旧是不能解决这个问题的。
[01:00] 那怎么办呢?只能是说我们设计一个模式,让他们真的能够针对当前这个问题了解到足够充分的信息,然后进行一场真正的辩论。那我们来看下我是怎么设计这个结构的。
议会的 4 个角色
[01:14] 就首先,4 个角色,4 家厂商,4 种性格。那这 4 个分别是什么呢?
[01:18] 第一个我管它叫做推进者。我用的是 Google 的 Gemini 这个模型。它就是专门去针对当前情况提出各种建设性的解决方案,可执行的解决路径。它就是负责去提案的这样一个模型。
[01:32] 那第二个呢,我管它叫做批评者。它会在这个方案的基础上,用 GPT-5 的模型去专门去找这里面的边界情况 — 就是还没有想到的这个情况。你看这个你没想到吧,对吧。那个方向又有一些可能性。它专门是干这个的。
[01:50] 而且那这个 GPT 的模型呢,我在提示词里面加入了 PUA 的部分。因为大家知道就是 — 网上一些报告显示是说,GPT 的模型在被 PUA 的情况下,它的这个表现是会提升很多的。
[02:02] 那再往下一个角色叫做挑刺者。那我这个挑刺者呢我是用的这个马斯克家的这个 Grok 4.2 multi-agent 这样的一个模式。就是要求它是以一个最反共识的一个方式去找到这些方案当中的一些盲区。就是避免这些大模型在里面互相拍马屁,就必须有一个强制唱反调的这么一个角色在里面。
[02:23] 那最后一个角色叫做使用者。那它不是另外去找的模型 — 就是用的 Claude Code 本身,它调用的这个 Opus 4.7 的这个模型。
[02:32] 为什么要用这样的一个模型在呢?因为其他三个都是外部咨询顾问嘛。只有这一个模型它是有我们之前项目的这个记忆的,对吧。那些其他的模型它再聪明,它是不知道你之前踩过什么坑的,对吧。包括你的系统是什么,你的预算是什么。把这些东西你想去给到其他模型是没有办法做到的。
[02:51] 而且这个直接就在订阅里面跑嘛 — 它也不用额外去掏这个 API 的钱。
第 5 个 AI 来评理
[02:56] 那我这四个模型准备好了之后呢,我还会去用一个 Claude Opus 4.7 的模型做最后的这一个裁判。这个裁判它就是作为一个最后的一个总结者。
[03:07] 这里面比较狠的一点是什么呢?就是我在它总结之前,我把其他家反馈过来的这个辩论的结果呢,会做一个预处理。就处理成把它的这个发言风格处理成没有性格特色的,并且把这个各家的模型就把它模糊成 成员 A、成员 B、成员 C、成员 D。
[03:25] 以至于最终裁决的这个模型它是一个盲评 — 它是一个不知道是哪个成员是谁的情况下,它进行一个总结的汇总。这样就不会有一个偏袒的情况。
上下文打包 + 联网调研
[03:37] 那这个整个的过程当中呢,我们会去打包一套完整的上下文。比如说我们现在的是程序跑在一个什么样的系统上啊,用的什么技术栈啊,跑了多久啊,用户量是多少。然后比如说我们相关的真实代码是什么样,我也会发给它。然后我之前都已经用过哪些方案了,排除了什么样的的一些可能性啊,也会给到它。包括我的约束条件 — 它不能说大模型给的意见是说”买个显卡”,那我没有预算买显卡,对吧。限制条件要给到它。
[04:05] 然后最后就告诉它说,我们现在要解决的具体问题是什么。把这些全部都打包在上下文里面去给到这个议会。
[04:12] 那除了这些呢,我还会用 Perplexity 的这样的一个 API 去完成一轮辩论前的调研。因为我们知道大模型它本身是有一定的这个数据训练的截止日期的。就是它这个模型里面的数据只能是 2025 年某几月之前的一个认知。它并没有新的 — 大家对于这个问题的一些新的探索、新的知识和新的最佳实践的一些方案。
[04:35] 所以在展开辩论之前,会用到的 Perplexity 的 API 去做一轮这个并发的调研,然后也注入到这个上下文里面去。这是非常重要的。
[04:45] 那如何用 Perplexity 的 API 呢?大家可以去看我之前的一个视频,就是「用 AI 去学习 AI」 — 我们可以让 Claude Code 带着我们去拿到一个 Perplexity 的 API。
议会怎么开
[04:58] 那再往下走 — 这个第一步走完了之后第二步就是独立的这个审查。4 个 AI 同时受到资料,互相是看不见的。每个 AI 按照自己的角色去给出这个第一轮的反馈意见。
[05:09] 那我会要求他们去强制提交一份结构性的总结表格。就是不能是说按照自己的风格在那随意的写这个文章,而是说按照就相当于我给他一个表,让他去填这个表。免得大家回过来的这个东西没有办法进行对齐,没有办法进行这个统一的评估。
[05:31] 那再往下走 — 真的匿名化辩论这样一个阶段呢,就会让每家看到其他另外三家的这个卡片,但是不知道对方是哪个模型,对吧。因为就是你知道有的模型它会发现说”这是 GPT 啊”,然后”GPT 说的对啊”… 不能让他们陷入这样的一个环境。所以完全是匿名的,就只能看到说成员 B 说了什么,然后只能通过这个内容来进行判断。
[05:56] 而且我还强制性的加了一个规矩 — 就是不能去附和别人。因为我们知道就是,尤其是 GPT 就是那个拍马屁的模式 — 它会说”你真是个天才哦,你真的是从来没有人想出过这样的这个解法”… 它通常会进入一个拍马屁的模式。所以一定要用这个强制反附和的这样的一个提示词去把它按住。
[06:18] 那最后呢,会进行一个这个综合的裁决。Opus 4.7 看完所有人意见之后,会给我两份东西。
[06:28] 第一份是给我看的 — 就是这 4 个角色都同意的有几条,然后经过辩论之后少数服从多数的,就是比如 3 比 1 的是有几条,2 比 2 的是有几条,最后出一个推荐的方案。
[06:42] 还有一个留底的方案 — 就比如说每一个观点是谁先提的,后来谁又改了立场,对吧,有没有人附和。那这些都是会去留档。我不一定每次去看,但是如果我想看的话,其实是能够看到这个辩论的过程的。
适用场景
[06:59] 那这样的一个大模型议会,我们什么时候用呢?
第一个是说,在我们架构选型的时候可以去用。然后我们去做方案对比的时候、我们去做设计评审还有审计的时候、然后做关键决策的这个盲区的检查的时候,会会去做。包括这个 bug 审查的时候我也会去做 — 就是每当 Claude Code 自己解决不了问题的时候,我都会这么跑一轮。
扩展到 7 个人
[07:23] 后来就是我其实在运行的时候,我会发现是说 — 有的时候我会觉得 GPT 5.5 自己做批评者可能是不够的。那我会加一个开关在这,就会把这个议会 — 比如说批评者同时用两个模型干,对吧;挑刺者我也同时用两个模型干。就扩展了这个整个的思考的丰富的程度。
[07:47] 然后他们辩论的轮次呢也可以从两轮扩展到三轮、四轮甚至是五轮。那当然太多轮次其实就没意义了嘛,对吧。
让议会审自己
[07:54] 还跟大家说一个特别好玩的事 — 就是最后我在完成这个 skill 的开发之后呢,我让这个议会自己审计了一下自己的这样的一个 skill 的内容。结果发现了大概五处可以去优化迭代的地方。然后他自己就完成了一个自己的对自己的一个评审和一个进化的这么一个过程。真的是很有意思。
收尾
[08:15] 那这个 skill 我已经开源了,完整的代码所有的指令全部都在这个 GitHub 上面。然后大家也可以去官网去下载这一期的相关的这个网页啊,还有我的这个逐字稿。
[08:26] 哎呀我真的是得去睡觉了。拜拜,下期明天见,明天见。