← 回首页

AI 剪辑成片,全流程揭秘:我每天的视频是怎么被 AI 做出来的

真人长视频 · EP0072 2026年7月29日 08:22
这一期讲什么

昨天有网友问我:你每天的视频到底是怎么用 AI 做出来的?这期让 CC 按我的工作流程出了一份网页版流程说明书,带大家逐步看。

七步:选题、用历史稿件提炼的语言指纹撰稿、音色克隆配音、数字人切段驱动、封面加下半屏信息图、字幕合成烧录、五平台文案自动填。AI 实际要算一两个小时;一条成本几十块——每一个环节都是官方 API 实打实付费。全自动能出片,但人参与效果更好。

起因:嗓子哑了,工作流就迭代成了数字人

昨天有网友问我,我是如何用数字人和 CC、配合生图模型,来制作我每天的短视频的,尤其是怎么实现自动化生成的。这个逻辑我已经迭代了很多轮,这期就把它整个摊开。我让 CC 进到我创作短视频的项目文件夹里,查对话记录、项目记忆和交付文档,梳理出一份最新的流程说明,用我自己设计的 PPVI 浅色网页风格做成可视化页面——下面就照着这份说明书走。

直接的起因是前段时间感冒加过敏,嗓子彻底哑了,没法自己录视频,干脆把整个工作流迭代成了数字人讲述的方式。

素材准备只有三样:录一段我自己的声音做音色克隆;找一段我之前某期录制的上半屏形象,60 到 90 秒连续的就够;再把我原来所有期的口播稿子都给它。然后是七个步骤。

第一步:选题——热点工具在手,但我多用自选题

我一开始就在本地做了一个根据热点自动选题的工具。但实话实说,我的视频不太会用到它推荐的热点——不是热点不好,而是我每天都有自己特别想说、或者粉丝想听的内容,我就直接自选题了。有时候流量确实不如 AI 选题好,但那毕竟是我想讲、粉丝在群里一直催着要的东西。

第二步:撰稿——语言指纹,加上对「AI 味儿」的一道防线

选题定了,就用我之前所有口播稿件提炼的表达结构和表达风格——语言指纹——去写稿。

这一步我做了一个延伸。我发现从 Sonnet 4.6 之后的版本,包括 GPT-5 之后的版本,所有这些模型几乎都是英文的深度思考、翻译回中文的表达,这就形成了我说的新一代的 AI 味儿——有一点翻译腔。比如中文会说流程循环,翻译腔就会说「人在环里」,你体验一下这个区别。

所以初稿是一个信息非常丰富的堆叠,把背景资料、案例、行文逻辑线索全面写下来,然后发给 DeepSeek 或者 Kimi K3 这样的模型,做中文版的撰写和审查。写完之后我基本不检查,直接进音频生成环节。

第三步:配音——逐字稿要先变成「口播生成稿」

音色已经克隆好了,接下来用 TTS 生成音频。因为整条是自动化流程,所以只选可以 API 调用的 TTS 模型。目前我测试下来,MiniMax 的 2.8 HD Speech 在当下这个时间节点,仍然是最强的机读模型。

这里有个关键动作:我会让 CC 把口播逐字稿变成一个「口播生成稿」。区别在哪?它会提前处理里面的多音字、提前处理数字,在适当的位置增加停顿、增加拟声词——把它变成一个语音生成模型更容易理解、更容易遵循的稿件,再去生成整篇通读的音频。

第四步:数字人——按语速和情绪切段,拼出来像剪辑过一样

数字人平台也是同一个逻辑:只选提供 API 服务的。我对清晰度和嘴型对齐的准确度有要求,所以选了向量方程的石榴数字人的 API。

CC 会把语音稿切段:有的部分适合快语速,有的适合舒缓,甚至有的部分需要特殊的情绪加进去,都会为它匹配我对应的不同片段的数字人素材,一段一段生成,然后拼接。生成出来就好像被剪辑过了一样,非常自然,表情也到位。

第五步:封面和下半屏信息图——同时进行

封面按不同平台出三种比例:3:4、4:3、16:9。生成完它还会自动检测人物一致性——是不是符合我给它的形象照。

同时它会根据视频逐字稿的内容,合成下半屏那些精美的画面:PPT 也好、网页也好。它会非常精准地做时间切割——第几秒到第几秒,我需要一个什么样的画面去支撑我讲的这个观点。用到的是 HyperFrames(HeyGen 出的那个 skill)生成网页动画效果,又或者用 GPT 的 Image 2 直接生成全图的黑板粉笔字效果、陶土效果,做配套的 B-roll 插画。

这里有一个坑值得说:如果用 Image 2 出图,一定让它整幅去出,而不是出一个背景再往上叠字——这样整体的美学才有一致性。

第六步、第七步:合成与发布

素材渲染出来之后进行拼接、字幕合成和烧录,把字幕自动加到固定位置,把日期和我的主张也像贴图一样贴进去。

最后它会帮我写好五个平台发布的所有标题、标签和文案,并且自动打开这些网页填写进去。由我检查之后,我自己去按那个发布的按钮。

两个大实话:时间和成本

我不会骗你说它 10 分钟就出来了。整个过程中付出的时间不会超过 10 分钟,但 AI 实际做完所有的运算,要一个小时到两个小时——它要思考、要撰写、要生图、要合成,这些都需要时间。我也不会骗你说一个按钮下去几百条视频就出来了。

成本上,一条视频大概是几十块钱的水平,每一个环节都是官方 API 调用、实打实的付费。想降成本也可以,替换一些性价比高的模型就行——像群里的 Gary 老师,一期视频几块钱的成本,做得也不错。反过来如果可着劲儿花,做更丰富的 B-roll、更高的图片密度,再把图生视频做成 B-roll,一期能到几百块。所以 AI 生成、AI 剪辑视频,是一个 10 元到百元级的价格跨度。

另外,每个需要调用 API、需要付费的环节之前,它都会先做一遍自检,否则不会浪费钱去生成。

全流程分工表

  • 总编导:CC
  • 配音:MiniMax
  • 数字人:石榴
  • 信息图:GPT Image 2
  • 动态渲染:HyperFrames
  • 字幕对齐:Gemini 2.5 Flash
  • 合成与发布:FFmpeg 编码 + 浏览器自动化

粉丝最常问的三个问题

全自动一键出片行不行? 可以做到。但为了追求视频质量,我还是会给一些反馈和调整:某些段落加入自己的观点和表达,让它调整行文结构,出图之后针对个别图片的排版提优化建议。人不参与也能出,但人参与效果更好。

观众知道这是数字人吗? 现在各平台都有「含 AI 生成内容」的打标。不打标其实也会有流量——我有一些数字人视频,包括帮其他 IP 做的,也出过几十万上百万播放的爆款。但要注意平台的审核规则:比如视频号,当一条视频马上要爆、进入大概 10 万的流量池的时候,会有肉身审核——数字人视频没打标,会被限制传播。

普通人能复制这套流程吗? 可以。除了 CC,Codex、WorkBuddy 加上 Kimi 的模型都能完成上述过程,但都需要花很多时间去调试整个 agent 执行这件事的循环。我这套流程从两年前就开始迭代了。我自己口播出镜的视频也完全是 AI 剪辑的——那就更简单了,连画面都不用生成,直接完成粗剪、加字幕、发出去。

最后:道德水平和赚干净钱

很多粉丝、尤其一些好朋友,转发别的博主的视频给我,说道德水平太高的话赚不到大钱,就是要去割韭菜,尤其做知识付费。我特别不认同。

我现在视频号发的这些内容,打包成一个课程去投流卖课,我不知道怎么卖吗?我当然知道——我做的就是互联网广告、互联网营销。但这种对交付不负责任的事情,我是不会去做的。我就是想睡得踏踏实实的,赚的每一分钱都干净。

我不会骗你说一个按钮下去几百条视频就出来了。