← 回首页

永远用最好的模型 — 我的 API 模型清单(我给 Claude Code 接了哪些第三方模型)

真人长视频 · EP0029 2026年6月4日 11:00
这一期讲什么

很多朋友问我:你的 Claude Code 里到底接入了哪些模型,怎么能干这么多事?这一期我就让 Claude Code 把我通过 API 接入的所有第三方模型,梳理成一份清单——每个模型的名称、申请 API 的网址、用途和价格都写清楚,用 PPVI 的浅色风格做成一个网页。

我的心法只有一句:永远用最好的模型,加最好的工具。Claude(Opus 4.8)当大脑,多模态用 Gemini,工具层配一个 Codex;每个领域,都调那个领域里效果最好、或者性价比最高的那一个。文本、图像、语音、数字人,我逐个讲一遍优缺点和价格。这份清单我做成了一张单页 PDF,挂在博客可以直接下载。

配套下载 · 给你的 Claude Code 学

最近很多朋友都在问我:你的 Claude Code 里面到底接入了哪些模型,怎么能干各种各样的事情?

那这一期,我就带大家看一下我这边接入的 API。我让 Claude Code 帮我做一次梳理:把我当前通过 API 方式接入的所有第三方模型,做成一个网页,用 PPVI 的浅色风格。网页的内容主要是一个列表,详细列出每个模型的名称、申请 API 的网址、它的功能和价值简介,以及它的收费价格。做出来,方便我跟大家做一次详细的分享。

这个页面我会上传到博客上,大家可以去下载。怎么用呢——点开每个模型右边的网址,就能去官网申请 API,充上值拿到 API key,给到 Claude Code,你就可以做这些事情了。

我的心法:永远用最好的模型,加最好的工具

最近很多人在聊:到底是 Claude Code 好,还是 Codex 好?我的想法始终是这样的——我们永远要去用最好的模型,和最好的工具

模型的选择上,我一定用当今最好的。主观地说,就是 Claude 的 Opus 4.8。而在多模态的场景下——比如视频、音频的解析——我认为最好的是 Gemini,毕竟它是原生多模态的。

工具的选择上也一样。像多台电脑的 computer use,Codex 是比较方便的方式;gpt-image-2 的生图,用 Codex 也更直接、性价比更高。所以我会开通一个低金额的套餐配套使用:把 Claude 当成大脑,把 Codex 当成一个工具,在 CLI 里通过终端,用 Claude Code 去调用 Codex,完成我想做的工作。

文本 LLM:推理与对话

Claude。 最常用的还是 Claude。我自己的 Claude Code 没有去接 API,用的是官方订阅的套餐;但对外的一些产品——比如漫剧平台写剧本、撰写公众号文章和口播稿——全部都是用 Claude。除了 4.8,4.6 的 Sonnet 和 4.6 的 Opus 也比较常用,因为它的文字表达、长上下文、对剧本和小说的解读、注意力和推理能力,以及文字最终的呈现,都相当棒。

OpenRouter。 它是一个中转站。我以前讲过中转站——我并不是说所有中转站都不好,而是中转站的 API 接入 Claude Code 是不好的,因为里面很多 tool use(工具调用)会出现问题。OpenRouter 是国外的聚合中转站,口碑相对较好,但它会收 5.5% 左右的手续费。所以当有一些新出现的模型、我还没去申请官方 API 的时候,我会先用 OpenRouter 做个测试,看看这个模型的能力。

Gemini Flash。 成本比较便宜,2.5 和 3.x Flash 是最近常用的。因为它是原生多模态,我最常用的就是:每天录完视频之后,让它帮我生成字幕的逐字稿——它能把视频或音频转换成几乎没有错误的文本稿件,是带推理能力的转换。

Qwen3。 我是通过硅基流动这个聚合站申请使用的,当时给了一定的免费额度。目前一直拿它来做需求路由、意图路由的判断:当我的 AI 客服或机器人收到用户需求时,它会先做一个简单判断——我该用什么方式去回应。

图像生成:文生图与编辑

Nano Banana Pro。 最常用的就是它。原生 4K,生成图的一致性和品质非常强。美中不足有两点:一是有点贵;二是如果一个画面上中文内容比较多,中文会出现乱码、识别不了。但它生成的品质、对提示词的遵循都很强。

Nano Banana 2(3.1 Flash)。 比 Pro 便宜,生成速度更快,允许的参考图更多,中文渲染也更好;只是生图的细节品质稍微不如 Nano Banana Pro——比较难量化地表达,但确实有区别。

gpt-image-2。 最近用来做 PPT 比较多。它最典型的就是参考图巨多,最多能给到 16 张,可以生成多人的复杂场景,或者复杂的中文信息图;准确率极高,我做电商图的时候会用它去修复细节,包括 logo、文字的部分。缺点也明显:生成的风格机生感比较强,作品有一点点「油」、有点机器渲染的生硬感。另外它按 token 收费,小分辨率的图便宜,但 4K 的图生成价格反而比 Nano Banana 还贵。

Seedream 4.0。 用来生成那些对品质要求没那么高、但对成本要求高的图片,通过火山方舟 Ark 做国内直连,早期也给了一定免费额度。

可灵。 它很奇怪:如果想用可灵官方的 API,需要填一个非常复杂的表,走 to B 销售那套申请试用、充值的逻辑,非常麻烦。所以我现在用可灵,其实是通过阿里云百炼的平台接入的,反而没用可灵官方的接口。

语音 TTS:合成与克隆

MiniMax TTS。 上一期刚讲过,我用的是它的 speech-2.8-hd。音色克隆、音色的配方(formula)、跨语种能力、情绪表达,还有呼吸、唇齿音这种模拟的能力都非常强。它在 2.8 这个版本停留了挺长时间没更新,但完全是一个足够用的状态。

Qwen3-TTS。 大家看到我自己开发的那个产品,其实就是用 Qwen3 TTS 做了一个 polish——修复和润色,性价比非常高。

数字人 / 视频生成

石榴数字人。 这是向量方程做的接口。因为我们长期有大量合作,数字人也是我一直比较持续的一块业务。我目前觉得,它是国内数字人模型里 4K 精度下、能把嘴型对得非常好的一个。

即梦 Seedance。 Seedance 做漫剧是必须的。它目前的接口,720p 分辨率差不多是一块钱左右一秒的成本,但因为它抽卡少、镜头表现和多镜头表现都很好。除了一些特殊场合——比如做视频编辑,像我现在在讲话、要把背景换掉,或者手里多一个东西,会用到 Google 最新的 Omni 模型——所有这种 AI 剧、AI 漫剧,目前 Seedance 就是绝对绝对第一的位置。据说它现在收入已经超过 10 亿这个量级,也是国货之光。

另外要生成 1080p 的视频,除了 Seedance,用可灵最多,其次可能是 Google 的 Veo 3.1——不过我最近发现用得越来越少了。

小结

我目前一个月的 tokens 费用,除了官方订阅之外,大概在几千美金这个范围,就是几个小产品的生成量级。

我用到的这些模型,分别是各个领域里效果最好、或者性价比最高的那一个。把它们通过 API 接入到 Claude Code 里面,就可以实现图片抠底、PPT 生成、视频生成、视频字幕提取等等——这一系列我展示过的功能,全部都是通过 Claude Code 去调用这些模型的能力实现的。

有什么问题,也欢迎在评论区给我留言。我们下期再见。

我们永远要去用最好的模型,和最好的工具——每个领域,都用那个领域里效果最好、或者性价比最高的那一个。