AI 剪辑成片,全流程揭秘:我每天的视频是怎么被 AI 做出来的
昨天有网友问我:你每天的视频到底是怎么用 AI 做出来的?这期让 CC 按我的工作流程出了一份网页版流程说明书,带大家逐步看。
七步:选题、用历史稿件提炼的语言指纹撰稿、音色克隆配音、数字人切段驱动、封面加下半屏信息图、字幕合成烧录、五平台文案自动填。AI 实际要算一两个小时;一条成本几十块——每一个环节都是官方 API 实打实付费。全自动能出片,但人参与效果更好。
起因:嗓子哑了,工作流就迭代成了数字人
昨天有网友问我,我是如何用数字人和 CC、配合生图模型,来制作我每天的短视频的,尤其是怎么实现自动化生成的。这个逻辑我已经迭代了很多轮,这期就把它整个摊开。我让 CC 进到我创作短视频的项目文件夹里,查对话记录、项目记忆和交付文档,梳理出一份最新的流程说明,用我自己设计的 PPVI 浅色网页风格做成可视化页面——下面就照着这份说明书走。
直接的起因是前段时间感冒加过敏,嗓子彻底哑了,没法自己录视频,干脆把整个工作流迭代成了数字人讲述的方式。
素材准备只有三样:录一段我自己的声音做音色克隆;找一段我之前某期录制的上半屏形象,60 到 90 秒连续的就够;再把我原来所有期的口播稿子都给它。然后是七个步骤。
第一步:选题——热点工具在手,但我多用自选题
我一开始就在本地做了一个根据热点自动选题的工具。但实话实说,我的视频不太会用到它推荐的热点——不是热点不好,而是我每天都有自己特别想说、或者粉丝想听的内容,我就直接自选题了。有时候流量确实不如 AI 选题好,但那毕竟是我想讲、粉丝在群里一直催着要的东西。
第二步:撰稿——语言指纹,加上对「AI 味儿」的一道防线
选题定了,就用我之前所有口播稿件提炼的表达结构和表达风格——语言指纹——去写稿。
这一步我做了一个延伸。我发现从 Sonnet 4.6 之后的版本,包括 GPT-5 之后的版本,所有这些模型几乎都是英文的深度思考、翻译回中文的表达,这就形成了我说的新一代的 AI 味儿——有一点翻译腔。比如中文会说流程循环,翻译腔就会说「人在环里」,你体验一下这个区别。
所以初稿是一个信息非常丰富的堆叠,把背景资料、案例、行文逻辑线索全面写下来,然后发给 DeepSeek 或者 Kimi K3 这样的模型,做中文版的撰写和审查。写完之后我基本不检查,直接进音频生成环节。
第三步:配音——逐字稿要先变成「口播生成稿」
音色已经克隆好了,接下来用 TTS 生成音频。因为整条是自动化流程,所以只选可以 API 调用的 TTS 模型。目前我测试下来,MiniMax 的 2.8 HD Speech 在当下这个时间节点,仍然是最强的机读模型。
这里有个关键动作:我会让 CC 把口播逐字稿变成一个「口播生成稿」。区别在哪?它会提前处理里面的多音字、提前处理数字,在适当的位置增加停顿、增加拟声词——把它变成一个语音生成模型更容易理解、更容易遵循的稿件,再去生成整篇通读的音频。
第四步:数字人——按语速和情绪切段,拼出来像剪辑过一样
数字人平台也是同一个逻辑:只选提供 API 服务的。我对清晰度和嘴型对齐的准确度有要求,所以选了向量方程的石榴数字人的 API。
CC 会把语音稿切段:有的部分适合快语速,有的适合舒缓,甚至有的部分需要特殊的情绪加进去,都会为它匹配我对应的不同片段的数字人素材,一段一段生成,然后拼接。生成出来就好像被剪辑过了一样,非常自然,表情也到位。
第五步:封面和下半屏信息图——同时进行
封面按不同平台出三种比例:3:4、4:3、16:9。生成完它还会自动检测人物一致性——是不是符合我给它的形象照。
同时它会根据视频逐字稿的内容,合成下半屏那些精美的画面:PPT 也好、网页也好。它会非常精准地做时间切割——第几秒到第几秒,我需要一个什么样的画面去支撑我讲的这个观点。用到的是 HyperFrames(HeyGen 出的那个 skill)生成网页动画效果,又或者用 GPT 的 Image 2 直接生成全图的黑板粉笔字效果、陶土效果,做配套的 B-roll 插画。
这里有一个坑值得说:如果用 Image 2 出图,一定让它整幅去出,而不是出一个背景再往上叠字——这样整体的美学才有一致性。
第六步、第七步:合成与发布
素材渲染出来之后进行拼接、字幕合成和烧录,把字幕自动加到固定位置,把日期和我的主张也像贴图一样贴进去。
最后它会帮我写好五个平台发布的所有标题、标签和文案,并且自动打开这些网页填写进去。由我检查之后,我自己去按那个发布的按钮。
两个大实话:时间和成本
我不会骗你说它 10 分钟就出来了。整个过程中我付出的时间不会超过 10 分钟,但 AI 实际做完所有的运算,要一个小时到两个小时——它要思考、要撰写、要生图、要合成,这些都需要时间。我也不会骗你说一个按钮下去几百条视频就出来了。
成本上,一条视频大概是几十块钱的水平,每一个环节都是官方 API 调用、实打实的付费。想降成本也可以,替换一些性价比高的模型就行——像群里的 Gary 老师,一期视频几块钱的成本,做得也不错。反过来如果可着劲儿花,做更丰富的 B-roll、更高的图片密度,再把图生视频做成 B-roll,一期能到几百块。所以 AI 生成、AI 剪辑视频,是一个 10 元到百元级的价格跨度。
另外,每个需要调用 API、需要付费的环节之前,它都会先做一遍自检,否则不会浪费钱去生成。
全流程分工表
- 总编导:CC
- 配音:MiniMax
- 数字人:石榴
- 信息图:GPT Image 2
- 动态渲染:HyperFrames
- 字幕对齐:Gemini 2.5 Flash
- 合成与发布:FFmpeg 编码 + 浏览器自动化
粉丝最常问的三个问题
全自动一键出片行不行? 可以做到。但为了追求视频质量,我还是会给一些反馈和调整:某些段落加入自己的观点和表达,让它调整行文结构,出图之后针对个别图片的排版提优化建议。人不参与也能出,但人参与效果更好。
观众知道这是数字人吗? 现在各平台都有「含 AI 生成内容」的打标。不打标其实也会有流量——我有一些数字人视频,包括帮其他 IP 做的,也出过几十万上百万播放的爆款。但要注意平台的审核规则:比如视频号,当一条视频马上要爆、进入大概 10 万的流量池的时候,会有肉身审核——数字人视频没打标,会被限制传播。
普通人能复制这套流程吗? 可以。除了 CC,Codex、WorkBuddy 加上 Kimi 的模型都能完成上述过程,但都需要花很多时间去调试整个 agent 执行这件事的循环。我这套流程从两年前就开始迭代了。我自己口播出镜的视频也完全是 AI 剪辑的——那就更简单了,连画面都不用生成,直接完成粗剪、加字幕、发出去。
最后:道德水平和赚干净钱
很多粉丝、尤其一些好朋友,转发别的博主的视频给我,说道德水平太高的话赚不到大钱,就是要去割韭菜,尤其做知识付费。我特别不认同。
我现在视频号发的这些内容,打包成一个课程去投流卖课,我不知道怎么卖吗?我当然知道——我做的就是互联网广告、互联网营销。但这种对交付不负责任的事情,我是不会去做的。我就是想睡得踏踏实实的,赚的每一分钱都干净。
来源:EP0072_audio.mp3 · ASR 模型 gemini-2.5-pro(切段并发) · 原片完整文字版
[00:00] 现在有的 AI 博主呢 喜欢给自己的账号写讣告 可能还顺便卖一个广告 我觉得特别不理解这种 阿三直男行为 明明是最早一批用上 最先进的 AI 模型和工具 因此拿到了巨大的 认知差和信息差 本来就是做着知识付费的生意 反过头来骂那个 给他提供优秀产品的人 而且还拿之前的某知名大厂 被薅羊毛自担后果的那个案例 去嘲讽啊 站在一个薅羊毛的立场上 去嘲讽别人不体面 这就好像一个强奸犯
[00:25] 在被判死刑的时候 对着被害者说 上次那个姑娘又没有告我 你真不体面 真的是典型的 断奶就可以骂娘的行为 而且就是因为这样的 盗刷甚至是灰产 造成了大量的出海电商 银行卡段被封 电话号码没有办法用 影响了很多人的正常生意 我就想说咱道德水平能 不能高一点 真的是无语 那其实今天我想讲的是 我做视频自动化的逻辑 因为昨天有网友问到我 而且整个逻辑我已经迭代了很多 所以今天其实是讲 AI 制作视频的 整个一个逻辑 我们还是让 Claude Code
[00:50] 根据我的工作流程出一个 网页版的流程说明书 那我给他一个这样的提示词啊 事情是这样的 我的一个短视频的 粉丝在问我 我是如何用数字人和 Claude Code 甚至配合生图模型 来制作我每天的短视频的 尤其是如何实现 自动化生成的这样一个过程 我现在想请你 进入到我创作短视频的 项目文件夹内 去查询我们的对话记录 项目记忆以及相关的交付文档 梳理出一个最新的 全面的流程总结的说明
[01:16] 使用我自己设计的 PPVI 的浅色网页风格 进行直观可视化的呈现 好我们把这个需求发出去 看它给我们一个回复 我们跳过这个 AI 产出的过程 一会儿直接带着大家看 它交付的结果 好了它已经做完了 我们来打开看一眼 起因是这样的 前段时间我感冒加上过敏 就嗓子彻底的哑了 就没有办法自己来录这个视频了 所以就干脆把整个工作流 迭代成了一个 数字人去讲述的这样的一个方式 那我们就来看一下整个的 一个流程 如何去实现的 像能给大家一个启发
[01:42] 首先一些素材的准备 比如说我会录一段我自己的声音 进行一个音色的克隆 然后找到我之前 某一期录制的 这个上半屏幕的这个形象 一段连续的大概 60 到 90 秒的视频 给到他我原来所有期的 我自己口播的稿子 准备了这些素材之后完 成这样七个步骤 我其实在一开始就在本 地做了一个 自动化根据热点做选题的 这样一个工具 但是实话实说 我的视频里面不太会用 到它推荐的热点 并不是说它推荐的热点不好
[02:08] 而是说我每天都有自己 特别想说或者是粉丝想听的内容 我就直接去自己选题了 那有的时候流量确实不如 AI 选题流量好 但是这毕竟是我自己想讲 或者是粉丝想听的内容 我不讲他们就在群里一 直问一直问 就一定要我尽快地发出来 那选题完成了之后 就像我有一期视频专门讲的 会用我之前的口播的稿件 做一个我的表达结构 和表达风格的语言指纹 那这一步其实我做了一个延伸 因为我发现从 Sonnet 4.6 之后的版本 包括 GPT-5 之后的版本
[02:34] 所有的这些模型几乎都是 英文的深度思考 翻译回中文的表达 这就形成我之前说的 新一代的 AI 味儿 它其实是有一点翻译腔的感觉 比如说中文会说流程循环 那翻译腔就会说人在环里 loop 这个环里 大家体验一下这个区别 初稿是一个非常丰富的一个 信息堆叠 它会把背景资料案例 整个的一个行文的逻辑线索 初稿是非常全面地写下来的 会发给像 DeepSeek
[02:59] 或者是 Kimi K3 这样的模型 去进行中版的撰写和审查 那写完了之后我基本上是 不检查的 直接就进入到音频生成的环节了 那刚才我提到的是说 已经克隆了音色 需要用 TTS 去生成音频了 这个的环节选择很多 但因为我们是一个自动化的流程 所以选择那些可以 API 调用的 TTS 模型 那我目前测试下来 我之前的视频也说了 就是 MiniMax 的 2.8 HD Speech 在当下的这个时间节点 仍然是最强的机读模型
[03:25] 我会让 Claude Code 把刚才的那版 口播的逐字稿变成一个 口播生成稿 这有什么区别 它会去提前处理里面的多音字 提前处理里面的数字 以及适当的位置会增加停顿 增加拟声词 把它变成一个语言生成模型 更容易理解的 更容易去遵循的 这样一个稿件 去生成这样整篇通读的一个音频 数字人平台我们也是一个逻辑 我们去选择那些提供 API 服务的 在这个当中我又会去要求
[03:50] 它的视频的清晰度 和嘴型对的准确度 所以我选择了向量方程的 石榴数字人的 API 去完成这样的一个工作那我会让 Claude Code 把 语音的稿子进行切断 比如说有的部分 适合比较快速的语速 有的部分适合比较舒缓的 甚至有的部分需要特殊的情绪 加进去的 都会为它匹配我对应的 不同片段的数字人素材 一段一段的 生成然后进行一个拼接 生成出来之后就好 像被剪辑过了一样 非常的自然 而且这个表情也非常的到位
[04:16] 那同时进行的还有 不同平台不同比例的 封面的生成 3:4 的 4:3 的和 16:9 的 基本上是这三种的尺寸 生成完了之后它还会自动的 检测说 这个人物的一致性 它是不是符合我给到它的形象照 同时它会根据我视频稿件的 逐字稿的内容 去合成下半屏的 那些大家看到的精美的图片 PPT 也好或者是网页 它会非常精准的进行时间的切割 第几秒到第几秒 我需要用一个什么样的画面
[04:41] 去 power 我所讲的这个观点 这时候用到的就是 HyperFrames 那个 HeyGen 出的那个 skill 去生成那些网页动画的效果 又或者是说用 GPT 的 Image 2 直接生成全图的 黑板粉笔字这样的效果 或者是说陶土的这样的效果 去做一个配套的 B-roll 的插画 那整个视频的 素材渲染出来之后 会进行一个拼接 以及字幕合成和烧录 会把字幕自动的 去加到这样的一个位置上 也会把我的这个日期和我的 这些主张
[05:06] 也像贴图一样贴进去 最后它会帮我写一个五个平台 发布的所有的 标题标签和文案 并且自动的 帮我打开这些网页填写进去 由我检查了之后 我自己去按那个发布的按钮 那大家可以看到我的 视频就是这样做出来的 我不会骗你说它 10 分钟就出来了 虽然整个过程当中我付出的时间 不会超过 10 分钟但是 AI 实际做完所有的运算 是要一个小时到两个小时 这样的时间长度的 因为它要思考它要去撰写 它要去生图它要去合成 所有的这些都是需要时间的
[05:32] 我不会骗你说 我一个按钮下去几百条 视频就出来了 那视频生成好之后 它还会做自己的一个质检 那包括里面遇到的一些坑 我也跟大家简单的说一下 比如说如果用 Image 2 去出图 一定是让它整幅去出 而不是出一个背景上面再叠字 这样它整体的 美学会有一个一致性 整个环节在那些需要调用 API 需要支付之前 都会做一个自检 否则不会浪费钱去做这个生成 那整条视频的成本 大概是一个几十块钱的一个水平 每一个环节都是官方的 API 调用
[05:57] 实打实的付费 那如果想要降低成本 也是有可能的 那我们去替换一些性价比 高的模型就可以 那像群里的 Gary 老师 他出一期视频大概也就是 一个几块钱 的成本的水平 做的也还不错 那如果我可以可着劲儿的去花 做更丰富的 B-roll 的图片 更高的图片密度 那一期视频的成本 如果再把图生成视频做成 B-roll 就会达到一个几百块的水平 所以 AI 生成 AI 剪辑视频 确实是一个 10 元到百元级的 这样的一个价格的跨度 那我们再回头来看一下
[06:22] 整个流程当中每个环节都是 什么样的模型 在负责什么 总编导就是 Claude Code 配音是 MiniMax 数字人是石榴信息图是 GPT Image 2 动态渲染是 HyperFrames 字幕的对齐呢用的是 Gemini 的 2.5 Flash 合成发布的时候使用的是 FFmpeg 的编码 和浏览器的自动化 那粉丝最常问的三个问题是什么 第一个是说 全自动一键出片是 可以做到的 但是整个过程当中为了 追求视频的质量 还是会给一些反馈和调整 比如说某些段落会加入
[06:47] 自己的观点自己的表达 或者是让它去调整一些 行文的结构 以及在它出图之后 有可能针对个别图片它的 排版进行一些优化的建议 如果人不参与也能出 但是人参与效果更好 那再有就是观众知道这是 数字人吗 现在各个平台都会有一个含 AI 生成内容的一个打标 如果我们的 内容没有打这个标 其实也是会有流量的 我有一些数字人的 视频包括帮其他 IP 做的数字人视频 也有达到过 也有几十万上百万的
[07:12] 播放这样的爆款出现 但是有一个问题是现在的 平台的审核规则 比如说像视频号的审核规则 当这条视频马上要爆了 进入大概一个 10 万的流量池的时候 就会有一个所谓的 肉身审核了 那你如果是数字人的视频但是 没有打标会被限制传播最后就是 一个普通人能够复制这样的 一套流程其实是可以的 那除了 Claude Code 那 Codex 包括 WorkBuddy 加上 Kimi 的模型 都可以完成我上述的 这样的一个过程但是都是
[07:37] 需要花很多时间去调试 一整个 agent 去执行这件事情的一个 loop 一个循环 那我这样的 一套流程其实从两年前 就开始迭代了 包括我自己口播的 视频也是完全让 AI 来进行剪辑的 那就更简单了 连生成画面都不用直接 就帮我完成一个粗剪并 且加字幕发出去就好了 那我们再回到开始的那个话题 很多粉丝就在跟我说尤其是 一些好朋友 转发其他博主的视频给我 说道德水平太高的 话赚不到大钱 就是要去割韭菜
[08:02] 尤其是做知识付费我特别的 不认同 你说我现在视频号发的这些内容 把它打包成一个课程去 投流去卖课 我不知道怎么卖吗 我当然知道了做的就是 互联网广告互联网营销 但是这种对交付不负责任的 事情我是不会去做的 我就是想睡得踏踏实实的 赚的每一分钱都干净 好那今天的视频就是这样 记得关注我 我们下期视频再见拜拜