微博客

由 Telegram 机器人发布 · AI 整理 · 自动配图
← 返回首页
2分钟手绘视频成本不到1元,全流程拆解

2分钟手绘视频成本不到1元,全流程拆解

2026-08-22 08:54:45 · 原文链接 ↗

一条2分钟的手绘白板视频,画面只播120秒,人工却可能按天甚至按周算。没有自动化流程时,脚本、分镜、配音同步、画面素材和逐笔动画都要自己接起来,公开DIY制作指南给简单项目的时间参照是1到3天。

博主榴莲刚跑完一条117秒黑板手绘视频,有6幕、23个独立绘制区。图片和配音的可见API调用成本为0.5-1元,笔迹、字幕、黑板擦和视频合成都在本地完成。这篇文章按真实生产顺序,把它拆成8步详解。

项目结构:复用与隔离

长期资产和单期内容分开存放,是整个流程能低成本复用的基础。

  • 系列目录保存角色参考图、默认画风和执笔素材
  • 单期目录只保存这一条视频的主题、脚本、声音、图片和成片

换一期内容时不复制角色,换角色时也不改渲染代码。project.json记录用户想做什么,state.json记录机器已经做到哪一步,新建项目后运行status命令,流程会直接告诉下一步该生成图片还是等确认。

这一层解决的是复用。角色属于系列,故事属于本期,核心程序不认识任何固定IP名称。

从主题到脚本:两次确认守住质量

输入可以是一个主题、一篇现成文稿或SRT字幕。博主的做法是先写完整口播再拆幕,最后拆成6页提纲、每页补一段话,才按人物动作和因果变化拆成场景。

这次黑板视频的口播共有608个字符,拆成6幕,最终得到23个绘制区,平均每幕接近4个元素。

脚本内部保留明确的层级关系:

```

  • elements 数组顺序就是绘制顺序
  • 每幕通常放3到4个元素
  • 程序不会根据画面坐标重新猜一遍

```

生图前进行第一次确认:用户会看到完整口播、配音试听、开场短标题、视觉模板、角色分工和每幕准备画什么。确认后又改了口播或角色,这一阶段会重新失效,后面的旧图不会被误当成新版本继续使用。

配音时间线:词级边界决定一切

声音产出三类时间文件:

  • SRT负责句子边界
  • words.json保存词级时间
  • 场景开始、区域出现、逐字字幕和清场动作都从这份时间里计算

字符数只能粗略估时。中文短词可能读得很慢,一串数字也可能比同样字数花更久。用真实语音边界以后,口播改动会重新生成所有派生时间,字幕和手绘不会各守着一套旧秒数。

这时进行第一次确认。脚本确认之前不生图。确认后又改了口播或角色,这一阶段会重新失效。

分幕生图:一张完整白板胜过多次拼接

脚本通过以后,完整流程为每一幕准备一张16:9分镜。每张图内部规划好3到4个互不连接的叙事区。

这次正式版本由6张完整图片组成,每幕只保留一张。分别生成人物、道具和箭头会增加调用次数,拼接后也更容易出现线宽、纸色和角色造型不一致。

图片出来后运行review-images,流程会统一底色并检查发布安全区。主体越界时,程序对整张构图做等比缩小或平移,不会只裁掉人物的一只手。

标注里保存画布、场景时长和元素列表。每个元素至少有绘制编号、区域范围和显露时间。

当前区域允许恢复的像素遵守一条公开规则:把遮罩关系翻成布尔运算,得到的allowed只会显露当前区域,这条遮罩会先扣掉后续人物和道具。第1区的外接范围即使碰到第2区,也不会提前露出半张脸。

用户查看原图和编号预览后进行第二次确认,黄色虚线只存在于审核图,数字就是正式绘制顺序。

笔迹生成:本地渲染的六道处理

确认图片以后,渲染完全在本地运行,没有新的模型调用。

程序把板图和空模板做差,变化过的像素成为前景候选。白纸模板寻找浅底上的深线,黑板模板寻找深底上的浅线。

每个绘制区随后经过六道处理:

  • 当前区域和前景遮罩相交,并扣掉后续区域
  • 线条候选被细化成一像素宽的骨架
  • 程序按八个方向寻找邻居,记录端点和交叉点
  • 未访问的边被追成独立笔画,分叉处优先选择方向变化较小的边
  • 笔画经过重采样和平滑,再吸附回有效墨线
  • 相近笔画归到同一对象,组内选择移动距离较短的下一笔

两个对象之间还要插入抬笔状态。手部素材可以从人物眼睛移动到右侧图表,移动期间只更新手的位置,不更新笔迹遮罩。少了这个状态,再好的最近邻排序也会在两个对象之间画出一条假线。

最终图片没有保存原画师的真实笔顺,这里得到的是一条看起来合理、可以重复执行的路径。

描线、填色与清场:三段分离渲染

线稿中心适合安排笔尖,不适合填满衣服和大色块。博主把每个区域拆成描线和填色两段。

描线阶段沿中心线恢复轮廓。填色阶段在连通色块里生成蛇形路线,横向走完一行,下一行反向回来。填色笔刷更宽,只恢复当前区域内原图已有的颜色。

一段路径总长度为L,分给它的时间为T,平均绘制速度约为L/T。同样5秒,人物半身像和密集流程图的路径长度差很多。画面太密时,程序可以减少采样,构图仍然要主动减对象、拆幕或延长口播。

开场中文标题由本地字体生成准确字形。程序先描字形边缘,再在内部填色,图片模型不用承担正式中文文字。

纸张模板在非末页翻页,黑板模板让同一只手换成黑板擦。清场动作占用场景末尾已有的时间,最后一幕保留完整结论。

合成验收:最后一次兜底检查

所有场景准备好以后,本地合成器加入旁白、字幕和可选音乐,再输出最终成片。

逐字字幕直接读取words.json。当前读到的字单独高亮,未读部分保持普通颜色。只有分句SRT时,系统会使用整句字幕,不会伪造不存在的词级边界。

最后运行validate,只拦无法交付的问题:

  • 视频轨缺失
  • 配置了声音却没有音频轨
  • 图片损坏
  • 区域越界
  • 确认后的文件已经变化

构图略挤、节奏略快这类问题保留为警告,由人决定要不要再改。

到底值不值?

这套流程省下的是以后每条视频重复接流程的时间,一处修改只让受影响的文件重跑。博主的前4条测试内容截至8月20日合计获得40,070次曝光和304次收藏。

但要注意:这里的约1元只指本次可见的API调用账单。完整成本还包括前期开发调试skill、人工确认、本地设备、网络和失败调用。模型价格和计费方式会变,实际总成本也会随之波动。

换主题、角色和画风时改哪里:核心代码只接收分层数据。换角色时更新系列,换纸面时更新模板,故事脚本和渲染器都不用复制。

普通人可以用它持续发布垂直内容吸引客户,也可以接品牌合作、卖知识产品,或者替客户定制视频。能不能赚到钱仍取决于选题、内容质量、更新频率和后续怎么接住观众,自动化不会替任何人保证流量和收入,但可以让你有更多的精力去思考后链路的问题,至少在入门的流量这一层可以保证你快速产出高质量的内容。

超级博主已经跑通,自动化让普通人也能快速复刻,保证内容质量和成本可控。先做第一条,选一个你最想讲的主题,换上自己的IP,把它从脚本确认跑到成片。做完这一条,角色、模板和已经确认的流程都能留给下一条继续使用。

← PDF扔进去3分钟出视频,这个AI工具太狠了https://x.com/xiaoxi →