在项目中评估cutscene-reel,可以先看清用途边界:代理技巧:将一张产品照片变成游戏过场风格的有声视频广告。把它放到视频制作流程中,最容易暴露的是素材、节奏、编码和最终画面容易不一致,不能只看演示是否顺利。落地前可以拿一组已有素材完成一段短样片,用素材路径、渲染结果、音画同步和导出格式判断它是否真的省事。如果团队属于有真实素材并需要稳定视频产出的创作者,它有继续测试的理由;否则先看替代方案会更省时间。

名称:过场动画 描述:制作一个 25-35 秒的“游戏过场动画”产品广告 - 一个风格化的 3D 角色穿着或拿着用户的真实产品,在现场发表冷酷有趣的事实咆哮,在产品上打出一个妙语,并切入真实的产品照片和 URL。当用户请求 AI 角色广告、游戏过场动画/PS2-style 卷轴、会说话的角色产品视频、“与 T 恤中的游戏角色一起疯传的视频”,或者想要将产品照片转换为 图像社交平台、TikTok 或 X 的简短视频广告时使用。
过场动画卷轴
将一张产品照片变成“视频游戏过场动画”格式的简短的会说话的人物广告。
你是导演。脚本负责生成;你做出创造性的决定,审查每一个 框架表,并重新生成错误的内容。大多数第一次拍摄都需要一两个修复。
格式是什么
| 节拍 | 时间 | 射击 | 职位 |
|---|---|---|---|
| 挂钩(可选) | 0-4秒 | 无声的行动 | 停止滚动:演讲前的一个时尚小动作 |
| 1号线 | 2-5秒 | 媒介、手势 | 令人惊讶的“你知道吗”事实或“有趣的是”观察 |
| 2号线 | 3-5秒 | 宽大、全套装备 | 解释一下。显示整体外观和位置 |
| 3号线 | 5-7秒 | 特写 | 笑话。狡猾、面无表情 |
| 4号线 | 3-5秒 | 中等,指向产品 | 产品的变化 |
| 端卡 | 3-4秒 | 真实产品照片 | “在 <url> 获取您的。生物链接。” |
使其发挥作用的规则:一个角色、一个位置、取自产品的两种颜色的灯光,
一个干巴巴的声音,大约每分钟 150 个单词,一张安静的低保真床,白色的小写字幕,每一个剪辑
4-6秒,最后以实物照片展示实物。完整细分:
references/format.md.
开始之前
询问用户是否缺少任何内容。不要猜测产品或 URL。
GEMINI_API_KEY 和 ELEVENLABS_API_KEY 或环境中的 .env 文件
工作文件夹。切勿打印密钥或提交 .env。路径上需要带有 Pillow (pip install pillow) 和 ffmpeg 的 Python 3。
管道
在新的项目文件夹中工作。下面的S是该技能的scripts/文件夹。
1. 脚本
写 4 行,每行 8-16 个字,加上尾卡行。小写态度,没有主题标签,没有炒作。
检查每一个事实。将 examples/project.json 复制到 project.json 并填写各行。
2. 关键帧(每次拍摄一张图像,16:9)
python S/gen_image.py shots/k1_medium.png 16:9 "<prompt>" product/on_model.jpg product/print.jpg
references/prompts.md。3. 动画
python S/make_shots.py project.json
每个镜头都成为 runs/<name>/out/ 中带有语音和口型同步的 10 秒剪辑。然后对于每个剪辑:
python S/sheet.py runs/<name>/out/s1.mp4
并阅读纸张图像。如果出现以下情况,则拒绝并重新生成(删除.mp4,调整action,重新运行):
4. 语音
python S/voice.py project.json
使用单词时间戳转录每个剪辑,并将语音转换为一个 ElevenLabs 语音
语音到语音,保持时间同步,从而保持口型同步。标记为 CHECK 的行与
脚本:读取它们,如果单词丢失,则重新生成剪辑。小成绩单(? 为
.、47(对于 forty-seven)可以通过编辑 out/sN_stt.json 来修复,因为字幕是根据它构建的。
5. 音乐
python S/music.py music/bed.mp3
生成原始低保真床。将project.json中的"music"设置为它。
6. 构建
python S/build.py project.json
将每个镜头修剪成其语音,裁剪为 4:3,放大到 1440x1080,刻录字幕,添加结尾
卡,混合音乐配音。输出:final/<name>.mp4。
7. 检查
python S/qc.py final/<name>.mp4
python S/sheet.py final/<name>.mp4 1
您无法听到视频。 qc.py具有模型手表和侦听和报告语音一致性,
口型同步、字幕和连续性问题。阅读它和表格,修复他们发现的内容,并告诉
用户清楚地了解模型检查的内容与他们仍需要自己观察的内容。
钩子
第 1 行之前的无声动作镜头延长了观看时间。添加一个带有 "silent": true 的镜头,它自己的
"prompt",并在审查其工作表后 "trim": [start, end] 和 "speed" (1.5-1.75 作品)所以
3-5 秒后着陆。有效的例子:涂口红、合上粉盒以及
对着镜头飞吻;扔出扳手,抓住它并将其指向相机。保留产品
在快速运动期间打印出框或大框,否则会出现污点。
当一代人被封锁时
视频模型拒绝一些提示。效果如何:
action 而不命名服装,或使用徽标较小的关键帧。
重试同一请求有时会通过。使用其他型号
各个阶段是独立的。交换其中任何一个并保留文件契约:
shots/<id>.jpg。runs/<name>/out/<id>.mp4。
如果模型没有语音,请生成文本转语音的行并使用唇形同步模型。{"words":[{"text","start","end","type":"word"}]} 为 out/<id>_stt.json,语音为 out/<id>_vo.mp3。build.py 只需要这些文件加上 project.json。权利(发布前请阅读此内容)