永远用最好的模型 — 我的 API 模型清单(我给 Claude Code 接了哪些第三方模型)
很多朋友问我:你的 Claude Code 里到底接入了哪些模型,怎么能干这么多事?这一期我就让 Claude Code 把我通过 API 接入的所有第三方模型,梳理成一份清单——每个模型的名称、申请 API 的网址、用途和价格都写清楚,用 PPVI 的浅色风格做成一个网页。
我的心法只有一句:永远用最好的模型,加最好的工具。Claude(Opus 4.8)当大脑,多模态用 Gemini,工具层配一个 Codex;每个领域,都调那个领域里效果最好、或者性价比最高的那一个。文本、图像、语音、数字人,我逐个讲一遍优缺点和价格。这份清单我做成了一张单页 PDF,挂在博客可以直接下载。
最近很多朋友都在问我:你的 Claude Code 里面到底接入了哪些模型,怎么能干各种各样的事情?
那这一期,我就带大家看一下我这边接入的 API。我让 Claude Code 帮我做一次梳理:把我当前通过 API 方式接入的所有第三方模型,做成一个网页,用 PPVI 的浅色风格。网页的内容主要是一个列表,详细列出每个模型的名称、申请 API 的网址、它的功能和价值简介,以及它的收费价格。做出来,方便我跟大家做一次详细的分享。
这个页面我会上传到博客上,大家可以去下载。怎么用呢——点开每个模型右边的网址,就能去官网申请 API,充上值拿到 API key,给到 Claude Code,你就可以做这些事情了。
我的心法:永远用最好的模型,加最好的工具
最近很多人在聊:到底是 Claude Code 好,还是 Codex 好?我的想法始终是这样的——我们永远要去用最好的模型,和最好的工具。
模型的选择上,我一定用当今最好的。主观地说,就是 Claude 的 Opus 4.8。而在多模态的场景下——比如视频、音频的解析——我认为最好的是 Gemini,毕竟它是原生多模态的。
工具的选择上也一样。像多台电脑的 computer use,Codex 是比较方便的方式;gpt-image-2 的生图,用 Codex 也更直接、性价比更高。所以我会开通一个低金额的套餐配套使用:把 Claude 当成大脑,把 Codex 当成一个工具,在 CLI 里通过终端,用 Claude Code 去调用 Codex,完成我想做的工作。
文本 LLM:推理与对话
Claude。 最常用的还是 Claude。我自己的 Claude Code 没有去接 API,用的是官方订阅的套餐;但对外的一些产品——比如漫剧平台写剧本、撰写公众号文章和口播稿——全部都是用 Claude。除了 4.8,4.6 的 Sonnet 和 4.6 的 Opus 也比较常用,因为它的文字表达、长上下文、对剧本和小说的解读、注意力和推理能力,以及文字最终的呈现,都相当棒。
OpenRouter。 它是一个中转站。我以前讲过中转站——我并不是说所有中转站都不好,而是中转站的 API 接入 Claude Code 是不好的,因为里面很多 tool use(工具调用)会出现问题。OpenRouter 是国外的聚合中转站,口碑相对较好,但它会收 5.5% 左右的手续费。所以当有一些新出现的模型、我还没去申请官方 API 的时候,我会先用 OpenRouter 做个测试,看看这个模型的能力。
Gemini Flash。 成本比较便宜,2.5 和 3.x Flash 是最近常用的。因为它是原生多模态,我最常用的就是:每天录完视频之后,让它帮我生成字幕的逐字稿——它能把视频或音频转换成几乎没有错误的文本稿件,是带推理能力的转换。
Qwen3。 我是通过硅基流动这个聚合站申请使用的,当时给了一定的免费额度。目前一直拿它来做需求路由、意图路由的判断:当我的 AI 客服或机器人收到用户需求时,它会先做一个简单判断——我该用什么方式去回应。
图像生成:文生图与编辑
Nano Banana Pro。 最常用的就是它。原生 4K,生成图的一致性和品质非常强。美中不足有两点:一是有点贵;二是如果一个画面上中文内容比较多,中文会出现乱码、识别不了。但它生成的品质、对提示词的遵循都很强。
Nano Banana 2(3.1 Flash)。 比 Pro 便宜,生成速度更快,允许的参考图更多,中文渲染也更好;只是生图的细节品质稍微不如 Nano Banana Pro——比较难量化地表达,但确实有区别。
gpt-image-2。 最近用来做 PPT 比较多。它最典型的就是参考图巨多,最多能给到 16 张,可以生成多人的复杂场景,或者复杂的中文信息图;准确率极高,我做电商图的时候会用它去修复细节,包括 logo、文字的部分。缺点也明显:生成的风格机生感比较强,作品有一点点「油」、有点机器渲染的生硬感。另外它按 token 收费,小分辨率的图便宜,但 4K 的图生成价格反而比 Nano Banana 还贵。
Seedream 4.0。 用来生成那些对品质要求没那么高、但对成本要求高的图片,通过火山方舟 Ark 做国内直连,早期也给了一定免费额度。
可灵。 它很奇怪:如果想用可灵官方的 API,需要填一个非常复杂的表,走 to B 销售那套申请试用、充值的逻辑,非常麻烦。所以我现在用可灵,其实是通过阿里云百炼的平台接入的,反而没用可灵官方的接口。
语音 TTS:合成与克隆
MiniMax TTS。 上一期刚讲过,我用的是它的 speech-2.8-hd。音色克隆、音色的配方(formula)、跨语种能力、情绪表达,还有呼吸、唇齿音这种模拟的能力都非常强。它在 2.8 这个版本停留了挺长时间没更新,但完全是一个足够用的状态。
Qwen3-TTS。 大家看到我自己开发的那个产品,其实就是用 Qwen3 TTS 做了一个 polish——修复和润色,性价比非常高。
数字人 / 视频生成
石榴数字人。 这是向量方程做的接口。因为我们长期有大量合作,数字人也是我一直比较持续的一块业务。我目前觉得,它是国内数字人模型里 4K 精度下、能把嘴型对得非常好的一个。
即梦 Seedance。 Seedance 做漫剧是必须的。它目前的接口,720p 分辨率差不多是一块钱左右一秒的成本,但因为它抽卡少、镜头表现和多镜头表现都很好。除了一些特殊场合——比如做视频编辑,像我现在在讲话、要把背景换掉,或者手里多一个东西,会用到 Google 最新的 Omni 模型——所有这种 AI 剧、AI 漫剧,目前 Seedance 就是绝对绝对第一的位置。据说它现在收入已经超过 10 亿这个量级,也是国货之光。
另外要生成 1080p 的视频,除了 Seedance,用可灵最多,其次可能是 Google 的 Veo 3.1——不过我最近发现用得越来越少了。
小结
我目前一个月的 tokens 费用,除了官方订阅之外,大概在几千美金这个范围,就是几个小产品的生成量级。
我用到的这些模型,分别是各个领域里效果最好、或者性价比最高的那一个。把它们通过 API 接入到 Claude Code 里面,就可以实现图片抠底、PPT 生成、视频生成、视频字幕提取等等——这一系列我展示过的功能,全部都是通过 Claude Code 去调用这些模型的能力实现的。
有什么问题,也欢迎在评论区给我留言。我们下期再见。
来源:EP0029_audio.mp3 · ASR 模型 gemini-2.5-pro(切段并发) · 约 11 分钟原片完整文字版
[00:00] 最近很多朋友都在问我说 我的 Claude Code 里面到底接入了哪些模型啊 以至于我可以干各种各样的事情 那我今天就带着大家来 看一下我这边接入的 API 请你帮我做一个梳理 所有我当前 Claude Code 里面通过 API 方式 接入的第三方模型 我需要你去做一个网页 使用 PPVI 的浅色风格 那这个网页的内容呢 主要是一个列表 列表里面详细的列出
[00:26] 我采用我接入的 API 的模型 这个模型的名称 那这个模型去申请 API 的网址 这个模型它的功能以及它的 价值的简介 以及这个模型它的收费的价格 那把这个网页制作出来 我们好做一个详细的分享 好的 那我们就等他把这个 内容做出来 我们今天其实就是这么 一个轻松的话题啊 那最近很多人都在聊说
[00:53] 这个到底是 Claude Code 好还是用 Codex 好 其实我的一个想法是是 这样的 始终是这样的 就是我们永远要去用最好的模型 和最好的工具也 就是说模型的选择上 我一定是要用这个当今最好的 我我认为啊 主观的啊 就是 Claude Code Opus 4.8的 这样一个模型 那比如说在这个多模态的情况下 比如说视频或者音频的 解析的情况下 那我认为最好的模型是 Gemini 的模型
[01:18] 毕竟它是原生多模态的嘛 所以在模型的选择上 就会永远用最好的 模型去做对应事情 那在工具的选择上 像这个多台电脑的这个 computer use 那可能 Codex是 一个比较方便的方式 那以及 gpt-image-2的 生图 Codex是 一个更直接且性价比高的方式 那我可能会选择去 开通一个低金额的套餐 去配套使用 那把 Claude 把 Claude 当成大脑
[01:43] 然后把 Codex 当成一个工具 在这个 CLI 里面 通过终端去用 Claude Code 去调用 Codex 去完成一些我想要完成的工作啊 那它现在 哎呀 它在问我 所有的模型都要算到里面 就是除了你提及的 凡是 我在这个配置文件里面 有保存过 API key 的模型 可以都做一个全面的分析 那让大家了 解说我现在都用到了哪些个
[02:09] 模型的官网上 对 因为我这边接入的 模型还蛮多的 因为长期以来一个比较 持续的业务是 数字人的业务嘛 所以像这个石榴数字人也是 我非常好的合作伙伴 那我们 哎 忘了选 next OK 好 那我们就加速它的这个过程 一会儿给大家直接看一个网页啊 好嘞 已经做好了
[02:34] 我们来看一下啊 我这个页面我会上传到 这个博客上 大家可以去下载啊 页面怎么用呢 就是 我先会给大家从头到尾讲解一下 然后你看这个右边其实是有一个 点开这个网址呢 它其实就可以 去这个官网去申请这个 API 了对吧 充上值其实拿到那个 API key 给到 Claude Code 你就可以去做这个事情了 那首先 我们来看它分了几类啊 第一类是这个文本的
[02:59] 大语言模型 推理和对话 那最常用的还是 Claude 了那我本身 Claude Code 我是没有 去接这个 API 的 我是用的订阅的官方订阅的套餐 那对外的的一些产品 比如说像漫剧的 平台去写剧本的 然后像这个撰写文章的 撰写这个公众号文章以 及口播稿的 全部都是用的 Claude 那 除了4.8之外呢 其实4.6的 Sonnet 和这个4.6的 Opus也是
[03:24] 比较常用的 因为它的这个文字的表达 包括它的这个长上下文 对于这个剧本的解读 然后小说的解读 它的这个注意力和它的 这个推理能力 以及它的这个文字最终的呈现 都是相当的棒的 那第二个就是那个 OpenRouter 嘛 它是一个中转站 那我曾经有讲过中转站 那我并不是说所有的中转站 都是不好的 而是中转站的 API 接入 Claude Code是 不好的
[03:49] 它其实里面有很多 tool use 这些工具的 使用它其实会出现问题 那 OpenRouter 它是一个 国外的这个聚合的中转站嘛 相对来讲的话口碑是比较好的 但是它的一个问题是说它会收取 5.5% 我记得之前好像8% 还是5.5%的一个手续 手续费 那我在有一些模型 就是新出现的模型 那我还没有去申请他们官方的
[04:14] 这个 API 的时候呢 我会用 OpenRou ter 先去做一个测试 看看这个模型的能力 那再往下就是 Gemini Flash的 这个模型 那这个模型的话 相对来讲它的成本是 比较便宜的 你像2.5和 3. 3.5 Flash是 最近常用的 主要用于什么呢? 因为它是原生的多模态的模型 我最常用到的就是 我每天这个录 视频录完了之后 我让它去帮我生成字幕的逐字稿 字幕的逐字稿 它就可以把视频或者音频转换成
[04:41] 几乎没有错误的这个文本的稿件 它是带推理能力的转换 然后这个 Qwen3 的系列 我是通过硅基流动的 这样的一个聚合站去申请使用的 然后当时它是给了 我记得当时是给了 一定免费的额度 所以目前一直在做 叫做这个需求路由 意图路由的判断 就是当我的这个 AI 客服 或者是 AI 的机器人 收到了用户的需求的时候
[05:06] 它会做一个简单的判断说 我应该用什么样的 方式去回应 那这个需求的意图判断 都是用这个 Qwen3 去做的 那再往下这个图像生成 和文生图的这部分呢 最常最常用的是这个 Nano Banana Pro的 这个模型 那它是原生 4K 的 而且它的这个生成图的 一致性和品质是非常强的 但唯一不足 美中不足的地方是说 一个是有一点点贵
[05:31] 然后另外一个是说 它的这个中文的表现 如果一个画面上中文内 容比较多的话 它其实中文是会出现乱码的 而且是识别不了的 但它的生成的这个品质 包括提示词的遵循是很强的 那再往下就是 3.1 Flash 这个 Nano Banana 2 的这个模型 那这个模型呢就比 Pro的 模型要便宜 而且生成速度会更快它允许的 参考图也会更多一些 它中文渲染的会更好但是呢
[05:57] 就是它生图的这个细节的品质上 稍微不如 Nano Banana Pro 那目前就是 比较难量化具象去表达 但确实是有区别的 那再往下看 最近用来做 PPT 比较多的就是 OpenAI 的 gpt-image-2的 这个模型 那它这个模型最典型的 就是参考图巨多 对吧 它有最多可以给到 16 张参考图 你可以生成一个多人的 一个复杂场景 或者是说复杂的中文信息图
[06:22] 都可以用它去去做的 那它的特点是说 准确率极高 那我在做电商图的时候 可以用它去修复一些细节 包括 logo, 包括文字的部分 但它的缺点也是蛮明显的 就是它生成的风格就是 机生感比较强 就是怎么怎么理解呢 就是 有点像是 它生成的作品有一点点油 或者是说有一点点像 机器渲染的那样的一个感觉
[06:48] 稍微能够感觉出来 一点生硬的感觉 那它 gpt-image-2 这个模型 它的这个小分辨率的 图片是比较便宜的 那高分辨率的 因为它是按照 token 去收费的嘛 它的这个 4K 的图片 相对来讲的生成价格反而会比 Nano Banana 要要贵 然后这个 Seedream 4.0 的模型 用它去生成一些 对品质要求没有那么高的
[07:13] 但是对成本要求高的 这个图片的模型 那是通过这个火山方舟 Ark 去进行了一个国内的直连 然后 这也是一家这个中转站 那我最早的时候 它也是给到了 一定的这个免费的额度 包括这个矢量化的 这样的一个模型的提供 所以我有做了一些简单的尝试 后续其实就没有再用这个模型了 包括可灵也是 可灵非常的奇怪 就是 如果你想用可灵官方的 API 的话
[07:38] 你去可灵那个申请 它需要你填一个非常复杂的表 然后是 to B 销售的那套逻辑 去申请试用啊 然后充值这个逻辑 就非常的麻烦 所以我现在用可灵其实是 通过的这个百炼的平台 就是阿里云百炼的平台 去接入的可灵 反而是没有用可灵官方的 API 接口 那语音的 TTS 合成与克隆 我之前一期刚讲了 我是我用的 MiniMax的 TTS 它的那个 speech-2.8-hd的 这个模型简直了
[08:04] 就是音色克隆 包括它的这个音色的配方 formula 然后包括它跨语种的能力 以及它的这个情绪表达 和一些呼吸 唇齿音的这种模拟的 能力都非常的强 但是它已经在 2.8的 这个版本 停留了蛮长时间了 它一直也没更 但就是完全是一个足够用的 一个状态 然后 Qwen3 的 TTS的 这个模型是 我就是大家看到的 我自己开发的 这个云书法其实用 Qwen3 TTS
[08:29] 做了一个 polish 就它做了一个修复和润色 非常的性价比非常的高 然后那再往后数字人视频生成 那我刚才提到了也是 向量方程做的石榴数字人的 这个接口 那它现在也是 因为我们是大量的合作嘛 然后我们我们去用到的 它这个模型也 可以说我目前觉得它是目前 国内数字人模型里面 4K 精度
[08:56] 能够把嘴型对得非常好的 一个一个这样的模型 然后像即梦视频 Seedance 就不用说了 Seedance 2.0 做漫剧是必须的 那它目前的接口 就是如果是 720p的 这样的一个 一个水就是分辨率的 话差不多是 一块钱左右一秒钟的一个成本 但是因为它抽卡少啊 它的这个镜头表现 都多镜头的表现它的真的是 就是目前来讲不用说是
[09:22] 只有在一些特殊的场合 比如说这个在做这种视频编辑 就比如说我现在在讲话 把我的背景换掉 或者说手里多一个什么东西 会用到那个 Google 最新的 那个 Omni 的模型之外呢 就所有的这种的 AI的 剧或者是 AI 的漫剧 目前真的是就是 如果 Seedance 这个 Seedance 2.0 就目前就是绝对绝对的 第一的这么一个位置 它据说目前它的 这个收入已经超过了 10 亿的 这样的一个一个量级也是
[09:49] 国货之光 然后我们基本上就用到这些模型 这里面其实还没有提到的是 说这个 Gemini 其实 Google的 模型我还会用到它生成视频 但是目前来看的话还是 比如说要生成 1080p 的视频 除了 Seedance 2.0 之外用可灵是最多的 那其次其次其次 可能是用这个 Veo 3.1 这样的这个 Google 的模型 所以原来还是会用到一些
[10:14] 但我最近发现好像是 用的越来越少了 越来越少了 那我目前一个月的这个 tokens 的费用 除了官方的订阅之外 大概是在一个几千美金的 这样的一个范围之内 就是几个小的产品的这个生成的 这样的一个量级啊 反正我目前用到的这些模型 就是这些啊 就是这些模型 就是分别是各个领域 效果最好或者是性价比最高的 这样的模型
[10:40] 把它去通过 API 的方式 接入到 Claude Code 里面 我们就可以实现说一些 图片的抠底呀 然后 PPT的 生成视频的生成 然后视频字幕的提取等等 一系列这种就是我展示过的 这些这些功能呢 全部都是通过 Claude Code 去调用一些模型的 能力去实现的 那有什么问题的话也一样 可以在评论区给我留言 那我我们下期再见拜拜