
Video Text Storyboard
- 31 installs
- 110 repo stars
- Updated May 18, 2026
- t0ugh/videoclaw
Helps with ai & agent building tasks.
About
video-text-storyboard is a Claude Code skill for ai & agent building. It helps solo builders move faster with AI-assisted coding.
- video-text-storyboard
- AI & Agent Building
- AI-coding skill
Video Text Storyboard by the numbers
- 31 all-time installs (skills.sh)
- +2 installs in the week ending Jul 27, 2026 (Skillselion tracking)
- Ranked #9,164 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Jul 29, 2026 (Skillselion catalog sync)
npx skills add https://github.com/t0ugh/videoclaw --skill video-text-storyboardAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 31 |
|---|---|
| repo stars | ★ 110 |
| Last updated | May 18, 2026 |
| Repository | t0ugh/videoclaw ↗ |
What it does
Helps with ai & agent building tasks.
Files
video-text-storyboard
注意:如果是首次使用,确保已安装 videoclaw:uvx videoclaw --help触发场景
用户说以下话时触发:
- "帮我生成一个分镜"
- "帮我写视频脚本"
- "帮我设计一下这个视频怎么拍"
- "帮我做一个视频方案"
输入
通过 AskUserQuestion 依次追问获取:
1. 视频类型(第一个问,多选一)
- 故事类(情感短片、微电影)
- 产品展示类(品牌广告、电商视频)
- 角色动作类(武侠、舞蹈、格斗)
- 风景旅拍类(自然风光、城市街拍)
2. 视频主题:"这个视频想讲什么 / 展示什么?"
3. 素材来源(二选一)
- 我有图片,直接上传
- 帮我用 AI 生成素材图(→ 先调用 t2i 生成素材图,再进入分镜生成)
4. 类型专属追问(根据步骤1的结果分支)
| 类型 | 追问内容 |
|---|---|
| 故事类 | 角色外观描述 / 风格(搞笑/温馨/史诗感) |
| 产品展示类 | 产品名称和外观描述 / 品牌调性(高端/科技感/轻快时尚) |
| 角色动作类 | 角色外观描述 / 动作类型(武侠/舞蹈/格斗/特技) |
| 风景旅拍类 | 拍摄地点/场景描述 / 氛围(治愈系/史诗感/纪录片风格) |
5. 时长:"视频需要多长?15秒 / 30秒"
生成要点
加载 skill 后,利用上下文生成文本分镜。
模板选择
根据用户选择的视频类型,加载对应 references 文件:
- 故事类 → references/stories.md
- 产品展示类 → references/product.md
- 角色动作类 → references/action.md
- 风景旅拍类 → references/scenic.md
加载对应文件后,使用其中的模板结构和示例生成分镜。
分镜生成要点
每个分镜包含:
- 时间范围:精确的秒数(如 2-6秒)
- 画面:场景 + 动作 + 台词 + 情绪,融合在一个字段中
- 音效:此镜头的背景音效
合格示例
输入:做一个冰霜王登基的动画视频
输出:
【素材介绍】:
【@图1】黄色圆滚滚小怪兽,无鼻设计,头顶小橘子
【@图2】冰封圣剑,剑身蓝光流转
【@图3】冰之王冠,由冰晶碎片拼接而成
【@图4】冰封王座,台阶和座椅有冰晶纹路
【@图5】极寒冰封王座大殿场景,浮空冰峰刺破阴云
【场景描写】:
极寒冰封之地,浮空冰峰刺破阴云,寒风呼啸,冰封大殿寂静威严
【背景音】:
史诗感 夹杂冰面细微碎裂声
【分镜】:
【特写圣剑】(0-4秒)
画面:特写【@图2】冰封圣剑,剑身蓝光流转,插在寒冰基座上
音效:冰裂声、低沉嗡鸣
【拔剑】(4-8秒)
画面:镜头后拉。【@图1】黄色小怪兽肉垫爪子紧紧握住【@图2】剑柄,用力向上拔剑
音效:拔剑声、冰裂声
【冰甲覆身】(8-12秒)
画面:全身镜头。【@图1】小怪兽用力拔出圣剑瞬间,无数冰晶碎片从四面八方飞聚而来,瞬间拼接成完整冰甲覆盖全身
音效:剑鸣、冰晶碰撞声
【戴上王冠】(12-16秒)
画面:【@图1】小怪兽抬手,无数冰晶冰片从空中飞聚而来,拼成【@图3】冰之王冠;小怪兽将王冠戴在头上
音效:冰晶拼接声
【登基定格】(16-20秒)
画面:全景。【@图1】小怪兽(穿戴冰甲)手持【@图2】圣剑,站在【@图4】冰封王座上,双眼亮起冰蓝光芒,远处【@图5】冰峰堡垒在背景中矗立
音效:余音回荡
【注意事项】:
- 角色设定:黄色小怪兽严格保持无鼻设计,头顶小橘子
- 氛围:全程冷色调,突出寒冰、冰晶质感,与角色暖黄色形成强烈视觉对比
- 动作节奏:每个镜头一个简单动作,拔剑 → 冰甲覆身 → 戴王冠 → 登基
- 细节还原:头顶小橘子、冰封圣剑蓝光、王冠冰晶拼接纹路等关键细节必须清晰呈现保存
生成后保存到 <project>/videos/<video>/storyboard/text_storyboard.md
交互确认
用 AskUserQuestion 询问用户:
"这是生成的分镜,满意吗?"
选项:
- 满意 → 继续下一步
- 修改 → 询问具体哪里要改
- 重新生成 → 不修改直接重试
常见错误
❌ 每个镜头安排太多内容:视频生成模型4秒绝对执行不了这么多东西,一个镜头只安排一个简单动作
✅ 每个镜头内容要精简,只描述一个动作或变化
---
❌ 素材引用混乱:不说明引用了什么
✅ 使用【@图1】【图2】格式明确引用素材
---
❌ 忽视音效:音效设计能大幅提升质量
✅ 加入音效:背景音乐 + 音效
---
❌ 缺少注意事项:结尾没有强调关键要素
✅ 添加注意事项:角色设定、氛围、动作节奏、细节还原
❌ 镜头数量太少:1-2个镜头无法展现完整故事
✅ 多用镜头没问题,每个镜头内容细化,但总量控制在30秒左右(6-8个镜头)
---
❌ 段落之间有多余空行:每个段落、镜头之间不需要空行
✅ 全部连续书写,不要有空行
反例:
剧情梗概
大法师安东尼达噜想要在小镇广场展示法术。
镜头1
阳光明媚的小镇广场...正例:
剧情梗概
大法师安东尼达噜想要在小镇广场展示法术。
镜头1
阳光明媚的小镇广场...角色动作类分镜模板
模板结构
【素材介绍】: 【@图1】<角色外观描述,含服装、造型、特征> 【@图2】<武器/道具描述(如有)> 【@图3】<场景/背景描述> 【@视频1】<动作参考视频描述(可选,用于动捕迁移)>
【场景描写】: <动作发生的整体环境描述>
【背景音】: <配合动作节奏的配乐风格>
【分镜】: 【镜头标题】(X-Y秒) 画面:<描述> 音效:<音效>
【注意事项】:
- 角色设定:<关键外观特征,必须严格还原>
- 动作连贯性:<关键动作衔接要求>
- 运镜要求:<跟随动作的镜头方式,如"低角度仰视/快切三角度/跟随运镜">
- 氛围:<整体视觉氛围>
- 技术参数:<景深/色调/手持或稳定器等摄影参数>
动捕视频引用(高级用法)
如果用户有参考视频(如舞蹈视频、武术视频),可用于动作迁移:
【@视频1】<参考视频描述,说明用途>
在分镜画面描述中写:
画面:【@图1】角色按照【@视频1】的动作和运镜风格进行表演,保持角色外观一致适用场景:
- 用真人舞蹈视频驱动 AI 角色跳舞
- 用武术视频迁移动作到游戏/动漫角色
- 用已有视频的运镜风格生成新角色内容
镜头节奏(固定结构)
1. 角色亮相(0-3秒):定格或缓慢展示造型,建立角色印象 2. 动作起势(3-6秒):准备姿势,蓄力感,镜头拉近 3. 核心动作(6-11秒):打斗/舞蹈/特技的主体展示,可快切 4. 收尾定格(11-13秒):动作收尾,pose 定格,镜头稳住 5. 特效强化(13-15秒):粒子/光效/氛围强化,画面落版
完整示例
输入:做一个武侠风格剑客独舞的15秒视频
输出:
【素材介绍】: 【@图1】白衣剑客,长发用青色发带束起,腰佩长剑,衣袂飘飘 【@图2】青钢长剑,剑身细长,剑格简约,无装饰 【@图3】竹林清晨场景,薄雾弥漫,阳光从竹叶间穿透 【场景描写】: 清晨竹林,薄雾未散,阳光穿透竹叶形成丁达尔光柱,地面散落竹叶 【背景音】: 古风弦乐,节奏由缓至急,与剑招节奏配合 【分镜】: 【剑客亮相】(0-3秒) 画面:低角度仰视,【@图1】白衣剑客背对镜头立于【@图3】竹林间,薄雾中衣袂微动,缓缓转身,面容清冷 音效:风声,竹叶沙沙声 【拔剑起势】(3-6秒) 画面:侧面中景,【@图1】剑客右手缓缓握住【@图2】剑柄,拔出半截,寒光一闪,随即摆出起势,目光如炬 音效:拔剑金属声,弦乐节奏渐起 【剑舞核心】(6-11秒) 画面:多角度快切。正面—【@图1】剑客持【@图2】长剑连续三招横扫,剑风带起竹叶旋转;侧面—大幅度旋身劈斩,白袍在空中形成弧线;俯视—剑客原地转圈,长剑划出圆形光轨 音效:剑气破空声、弦乐急促 【收势定格】(11-13秒) 画面:全景,【@图1】剑客单膝点地,【@图2】长剑插入地面,低头单手扶剑,竹叶缓缓飘落 音效:弦乐骤停,寂静中只有竹叶落地声 【氛围落版】(13-15秒) 画面:镜头缓缓拉远,【@图3】竹林薄雾中,剑客身影渐渐被雾气笼罩,光柱穿透竹叶打在地面 音效:一声悠远的古琴音,余音回荡 【注意事项】:
- 角色设定:白衣、青色发带、腰佩长剑,服装飘逸感是核心,不能塌陷
- 动作连贯性:拔剑→起势→剑舞→收势,每个镜头结尾动作要能衔接下一镜头开头
- 运镜要求:亮相用低角度仰视,核心动作段快切3个角度,收势用全景稳住
- 氛围:冷色调为主,薄雾和丁达尔光柱是关键环境元素
- 技术参数:浅景深,稳定器拍摄为主,亮相段慢速,剑舞段快切不超过1秒/镜
产品展示类分镜模板
模板结构
【素材介绍】: 【@图1】<产品外观描述> 【@图2】<产品材质/细节参考> 【@图3】<使用场景/环境参考>
【场景描写】: <产品展示的整体环境描述>
【背景音】: <品牌调性对应的配乐风格>
【分镜】: 【镜头标题】(X-Y秒) 画面:<描述> 音效:<音效>
【注意事项】:
- 品牌调性:<高端/科技感/轻快时尚>
- 产品核心卖点:<需要重点展示的特性>
- 角色设定:<如有人物出镜,描述其特征>
- 细节还原:<关键产品细节>
镜头节奏(固定结构)
1. 开场抓眼(0-2秒):悬念设置或产品特写,制造视觉冲击 2. 产品全景展示(2-5秒):环绕或推拉运镜,展示产品整体造型 3. 产品细节特写(5-8秒):材质、工艺、核心卖点的近景展示 4. 使用场景(8-12秒):产品在实际环境中的应用,体现生活感 5. 品牌落版(12-15秒):slogan 或品牌信息,画面收尾
完整示例
输入:做一个高端咖啡机的15秒广告,科技感风格
输出:
【素材介绍】: 【@图1】哑光黑色咖啡机,金属质感机身,顶部透明水箱,侧面触控屏 【@图2】咖啡机出水口特写,金属网格滤杯 【@图3】极简现代厨房场景,大理石台面,晨光从窗外斜入
【场景描写】: 极简现代厨房,大理石台面整洁,晨光斜入,冷暖对比营造高端氛围
【背景音】: 低沉科技感电子配乐,节奏感强,与产品质感匹配
【分镜】: 【悬念开场】(0-2秒) 画面:黑暗中,【@图1】咖啡机顶部触控屏缓缓亮起蓝色光晕,金属机身在光线中渐渐浮现 音效:低沉电子嗡鸣,科技感启动声 【全景展示】(2-5秒) 画面:镜头从侧面缓慢环绕【@图1】咖啡机一周,展示哑光黑色机身、金属质感、流线型设计 音效:配乐节拍加强 【细节特写】(5-8秒) 画面:特写【@图2】出水口,一道细腻咖啡液缓缓落下,金属滤杯在光线下闪烁 音效:咖啡液滴落声,清脆悦耳 【使用场景】(8-12秒) 画面:【@图3】厨房场景,晨光照在大理石台面上,【@图1】咖啡机静静伫立,主人拿起咖啡杯,蒸汽袅袅升起 音效:轻柔环境音,咖啡香气的视觉化表达 【品牌落版】(12-15秒) 画面:黑色背景,咖啡机剪影居中,品牌 slogan 从下方淡入:「每一杯,都是精准」 音效:配乐渐弱,收尾
【注意事项】:
- 品牌调性:科技感+高端,全程冷色调为主,金属光泽是视觉核心
- 产品核心卖点:哑光黑色机身质感、精准出水、触控科技感
- 细节还原:顶部触控屏蓝光、金属出水口、大理石台面纹理必须清晰
风景旅拍类分镜模板
模板结构
【素材介绍】: 【@图1】<场景/地点描述(必填)> 【@图2】<场景细节或第二地点(可选)> 【@图3】<人物描述(可选,如有人出镜)>
【场景描写】: <整体地理/环境/时段描述>
【背景音】: <自然环境音 + 配乐风格>
【分镜】: 【镜头标题】(X-Y秒) 画面:<描述> 音效:<音效>
【注意事项】:
- 光影要求:<时段/光线特征,如"黄金时段侧逆光">
- 色调:<整体色彩倾向,如"暖橙色系">
- 氛围:<治愈系/史诗感/纪录片风格>
- 细节还原:<关键环境细节>
镜头节奏(固定结构)
1. 大景别建立(0-3秒):展示环境全貌,确立地点感 2. 中景推进(3-6秒):镜头向前推进,引入人物或环境细节 3. 多角度切换(6-10秒):展示环境不同面貌,增加信息量 4. 特写细节(10-13秒):光影变化、植物纹理、水面反光等细节 5. 意境落版(13-15秒):回到大景别或空镜,留白收尾
完整示例
输入:做一个西藏纳木错湖的15秒旅拍视频,史诗感
输出:
【素材介绍】: 【@图1】纳木错湖全景,湛蓝湖水延伸至天际,雪山倒影清晰,湖边碎石滩 【@图2】湖边玛尼堆特写,五彩经幡在风中飘扬,背景是湛蓝湖水 【@图3】旅行者,深色冲锋衣,背着相机,站在湖边远眺 【场景描写】: 西藏纳木错,海拔4718米,湛蓝湖水与雪山相接,黄金时段阳光将湖面染成金色,经幡猎猎作响 【背景音】: 史诗感管弦乐,低沉大气,加入藏族风情元素,夹杂风声和经幡声 【分镜】: 【大景建立】(0-3秒) 画面:超广角极低机位,【@图1】纳木错湖面平静如镜,雪山倒影完整,镜头缓缓上升揭示湖的辽阔 音效:史诗配乐渐起,远处风声 【推进人物】(3-6秒) 画面:中景,【@图3】旅行者从画面右侧走向湖边,镜头跟随前推,旅行者在湖天一线的背景下显得渺小 音效:配乐加强,脚步踩在碎石上的声音 【多角度切换】(6-10秒) 画面:快切三个角度。侧面—【@图2】经幡在强风中猎猎飞扬,背景湖水湛蓝;俯视—无人机俯瞰湖岸曲线,碎石与湖水的边界清晰;正面—【@图3】旅行者面向湖面,双手展开,风吹动衣物 音效:风声加强,配乐达到高潮 【光影特写】(10-13秒) 画面:特写湖面,黄金时段阳光将水面染成碎金,微风带起细小涟漪;切至玛尼堆石头纹理,阳光从侧面打入,石头上刻字清晰 音效:配乐渐弱,只剩风声和远处经幡声 【意境落版】(13-15秒) 画面:回到超广角,【@图3】旅行者变成湖天一线中的一个黑色剪影,镜头缓缓拉远,天地融为一体 音效:配乐最后一个长音收尾,归于寂静 【注意事项】:
- 光影要求:黄金时段(日落前1小时),侧逆光为主,湖面金色反光是视觉核心
- 色调:暖橙金色+冷蓝色,形成强烈冷暖对比
- 氛围:史诗感,人在自然中的渺小感,宏大叙事
- 细节还原:雪山倒影完整度、经幡颜色鲜艳度、碎石滩质感必须清晰
故事类分镜模板
模板结构
【素材介绍】:
【@图1】<角色/物体描述>
【@图2】<角色/物体描述>
【@图3】<角色/物体描述>
【场景描写】:
<整体背景描述,可选>
【背景音】:
<整体背景音描述,可选>
【分镜】:
【镜头标题】(X-Y秒)
画面:<包含动作、情绪的完整描述>
对白:<角色台词,用于口型同步;无台词则填"无">
音效:<此镜头的音效>
【镜头标题】(X-Y秒)
画面:...
对白:...
音效:...
【注意事项】:
- 角色设定:<关键角色特征>
- 氛围:<整体氛围要求>
- 动作节奏:<节奏要求>
- 细节还原:<关键细节>
- 对白引导:<台词口型的情绪要求,如"愤怒爆发"/"轻声耳语">完整示例
输入:做一个冰霜王登基的动画视频
输出:
【素材介绍】: 【@图1】黄色圆滚滚小怪兽,无鼻设计,头顶小橘子 【@图2】冰封圣剑,剑身蓝光流转 【@图3】冰之王冠,由冰晶碎片拼接而成 【@图4】冰封王座,台阶和座椅有冰晶纹路 【@图5】极寒冰封王座大殿场景,浮空冰峰刺破阴云
【场景描写】: 极寒冰封之地,浮空冰峰刺破阴云,寒风呼啸,冰封大殿寂静威严
【背景音】: 史诗感 夹杂冰面细微碎裂声
【分镜】: 【特写圣剑】(0-4秒) 画面:特写【@图2】冰封圣剑,剑身蓝光流转,插在寒冰基座上 对白:无 音效:冰裂声、低沉嗡鸣 【拔剑】(4-8秒) 画面:镜头后拉。【@图1】黄色小怪兽肉垫爪子紧紧握住【@图2】剑柄,用力向上拔剑 对白:无 音效:拔剑声、冰裂声 【冰甲覆身】(8-12秒) 画面:全身镜头。【@图1】小怪兽用力拔出圣剑瞬间,无数冰晶碎片从四面八方飞聚而来,瞬间拼接成完整冰甲覆盖全身 对白:无 音效:剑鸣、冰晶碰撞声 【戴上王冠】(12-16秒) 画面:【@图1】小怪兽抬手,无数冰晶冰片从空中飞聚而来,拼成【@图3】冰之王冠;小怪兽将王冠戴在头上 对白:无 音效:冰晶拼接声 【登基定格】(16-20秒) 画面:全景。【@图1】小怪兽(穿戴冰甲)手持【@图2】圣剑,站在【@图4】冰封王座上,双眼亮起冰蓝光芒,远处【@图5】冰峰堡垒在背景中矗立 对白:无 音效:余音回荡 【注意事项】:
- 角色设定:黄色小怪兽严格保持无鼻设计,头顶小橘子
- 氛围:全程冷色调,突出寒冰、冰晶质感,与角色暖黄色形成强烈视觉对比
- 动作节奏:每个镜头一个简单动作,拔剑 → 冰甲覆身 → 戴王冠 → 登基
- 细节还原:头顶小橘子、冰封圣剑蓝光、王冠冰晶拼接纹路等关键细节必须清晰呈现
- 对白引导:本片无台词,所有情绪通过动作和特效传达