你好,我是月晖。
从昨天上午开始,我就在我的Claude Code里不断跟Opus5.5模型对话,把思考强度开到最大(Max),让它给我渲染视频。
最早意识到Claude最新出的这个模型,在视频生成方面功力不俗,是将近半个月前。9月29日,我的朋友在他的Mac电脑上用Claude Opus 5.5渲染了一段6分钟的视频,讲中国古代思想流变。整个视频63张图,时长6分钟,配乐与画面浑然一体,精妙绝伦。随后,他写了一篇文章发布在自己的公众号上感慨此事。
看过后,我也萌生了自己弄一个的想法。这是十一前的事,我原本应该在十一假期里做,但10月1号和10月2号那两天我沉迷网络小说,10月3号起去上海见朋友,所以假期内就没有做成,一路拖到现在。
这种新技术一旦发布,从海外到海内大概需要一周;从最早有人琢磨出用法,到网上开始大量涌现,也差不多一周。那些技术爱好者追得非常快,大概10月7号晚上,我在上海等晚餐的时候,打开B站就刷到成片的Opus 5.5视频,心中顿生紧迫感,回京之后迅速开始做。
做法本身不难:
第一,在电脑上打开调出Claude Code的对话,以我自己为例,就是苹果电脑打开终端。然后直接用文字命令说明想做的题材、时长和参照的艺术风格,像我这次选的艺术风格是直接参照我朋友的那个视频,我就告诉Claude Code这个视频在电脑上的位置,让它自己去看。
第二,画面。主要是让Claude Code自己跑。命令下达之后,它一般会先下载大量资料,然后开始渲染图片。这个过程中,人其实不需要做什么,只要确认API供给别断就行,然后让电脑一直开机,Claude自会分化出无数Agent,写分镜、写代码、渲染。
它给出画面后,人必须重新看一遍,避免迷之bug,比如文字和图片重合或者出现乱码。如有此类问题,告诉它,让它重画。
第三,音频。目前大概有三类解法:一是你自己有其他AI生成音频平台的API,比如Suno,然后以MCP让Claude Code去对接其他平台;二是让它自己写代码做音乐;第三,我今天的做法是让Claude Code根据视频内容写生成对应配乐的提示词,我充当能工智人去复制提示词粘贴到网页端Gemini的对话框里,让Gemini(当然实际上是Lyria3.5)写音乐。
Lyria3.5现在写一首音乐,可以长达2:30~3分钟,连贯性很好,一首就能管半段视频,非常给力,且如果有Gemini Pro便是免费。
如此,人与AI配合默契之下,半天即可出一个五六分钟的视频。
说完不难的,再说困难的地方,也就是这事真正的门槛所在:
首先你要有Claude Code会员账号/买API,这一步自不必说;其次,就是Token消耗问题。
理论上,你确实可以像网上说的那样“用一句话生成视频”,活都让Claude Code去干,人就负责震撼瘫坐。但实际上,如果真这样做,消耗的token数量可能非常庞大,比如我今天做出两个视频,总共消耗了几亿token,大概相当于有几百刀。我自己是因为有朋友免费送我额度,所以能这么做。如果全都是花钱买额度,从性价比上看其实很成问题。
这么多token花在什么地方呢?我做完视频之后,让Claude Code也给我出了个报告。大体上,主要花在两个地方。
——资料考证与整体构思,主要是开工前的长时间构思,思考过长,有三次撞到了单次输出上限。
——分镜绘制与逐页检查,这一环节每页都要画、出预览、看图、修改,这个过程中,大模型可能会在一些奇怪的地方过分严谨。然而,这种严谨说实话也不能真的保证它生成的画面没有问题,人还是得审一遍。
如果再去看token消耗的结构,读入是非常多的,因为我整个项目是在一个对话里做完,每次都要把前面的全部对话读一遍,越到后面越贵。
我今天这种使用方式相当粗放,今后如果还是用Claude Code去做视频,肯定得优化。比如说,查资料之前我可能会限定一个范围,这次为了做一个比特币的视频,给我下载了上百份报告,这就明显存在冗余。又比如写稿可能会由我自己完成,大模型在选择内容上的判断力目前还不够,想选出好内容消耗的token太多。我能简单做的工作就自己来,完全不会的再指望大模型,像是写代码去渲染这种肯定得让它来做。
最后,放一下我的两个视频:
1,Opus 5.5 x 诡秘之主|从史前到第五纪全历史动画(B站)
亦可在抖音、小红书、YouTube搜【月晖】进我的频道观看。
2,17年1.7亿倍:6 分钟比特币发展史|Opus5.5模型制作(B站)
亦可在抖音、小红书、YouTube搜【月晖】进我的频道观看。
发表回复