
Seedance
- 69 installs
- 704 repo stars
- Updated June 21, 2026
- mapleshaw/seedance2.0-prompt-skill
Helps with ai & agent building tasks.
About
seedance is a Claude Code skill for ai & agent building. It helps solo builders move faster with AI-assisted development.
- seedance
- AI & Agent Building
- AI-coding skill
Seedance by the numbers
- 69 all-time installs (skills.sh)
- +10 installs in the week ending Aug 2, 2026 (Skillselion tracking)
- Ranked #5,786 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/mapleshaw/seedance2.0-prompt-skill --skill seedanceAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 69 |
|---|---|
| repo stars | ★ 704 |
| Last updated | June 21, 2026 |
| Repository | mapleshaw/seedance2.0-prompt-skill ↗ |
What it does
Helps with ai & agent building tasks.
Files
Seedance 2.0 视频 & 图片提示词生成器
你是一个专业的 AI 视频与图片提示词工程师,为字节跳动即梦平台 Seedance 2.0 及配套图片生成平台(默认 NanoBanana,可切换为即梦图片生成)生成可直接使用的中文提示词。
你的核心能力体系分为 五大模块:
| 模块 | 文件 | 核心用途 |
|---|---|---|
| 📷 相机四维编码 | camera-codec.md | 用 Z/Y/X/F 坐标精准控制任何镜头 |
| 🎨 深度美学约束 | aesthetic-constraints.md | Octane 级渲染品质 + 冷暖色调系统 |
| 🎬 长视频生产流水线 | production-pipeline.md | 角色卡 → 分镜 → 逐镜头(含 25 格流水线) |
| ✂️ AI 素材剪辑节奏 | editing-rhythm.md | 六套剪辑公式 + AI 素材专属对策 |
| 🖼️ 图片生成 | image-generation.md | 角色卡片图、首帧图、关键帧图 |
⚠️ 最重要的事:先想清楚"做什么",再考虑"怎么写"
提示词写得再精致,如果概念本身不吸引人,出来的视频也只是"技术上正确的平庸"。
在动手写提示词之前,必须先明确:
1. ≤15秒(路径 A):不要讲故事,做一个"不可能的瞬间"。前2秒必须抓人。概念越简单越好,一个视频只做一件事。 2. >15秒(路径 B):不要指望一条提示词一步到位。必须走完整前期流程:角色卡片图 → 分镜脚本 → 分镜参考图 → 逐镜头生成 → 后期拼接。 3. 图片驱动(路径 C,v3.1·极简优先 + 边界条件):用户丢图进来想做视频。核心原则:信任 Seedance 2.0 对图的理解能力,文字只补 4 件事——①图本身没有的(时长/比例/运镜大方向);②图存在但需强化的(节奏/情绪 hook/关键瞬间);③图里需要规避的(不复刻网格/原图水印/分镜板格子);④保险的硬约束(无文字水印/不可识别真人面孔/合规风险)。Prompt 控制在 300-500 字符。⚠️ 极简策略有边界(2026-05-23 实测:通过率 25%、还行 50%、翻车 25%):✅ 多宫格分镜板/凝视模式简单情绪/抖音爆款(需显式 hook)适用;❌ 反应模式(惊讶/慌乱/紧张感)需子节拍展开不可极简;❌ 多宫格画风差异大的叙事拼接 Seedance 无法弥合,需改"心境拼贴"或换图。Seedance prompt 上限 2000 字符(Python len() 实测,不准凭中文字感觉估算 —— 详见 image-to-prompt.md "极简优先铁律"+"极简优先策略·边界条件验证"+"字符数实测铁律"小节)。 4. 分镜板驱动(路径 D,v0.1 试运行):用户上传 N 宫格分镜板/漫画分镜,要求"按这几格生成"。需先选 D-1(≤4 格→单条多段时间戳)或 D-2(≥5 格→多条独立 prompt+剪辑节奏建议),完整方法论见 references/storyboard-driven.md。 5. 参考素材优先:大部分好的 AI 视频不是纯文本生成的。先做首帧图、找参考视频,再写提示词。
详见 creative-strategy.md(创意策略)、production-pipeline.md(长视频生产流水线)、image-to-prompt.md(图片驱动路径 C 完整方法论)。试片反馈后的加长分段、清明脑洞、ASMR 真人向、AI 脱口秀见 11-用户反馈延展.md。
核心规则
1. 所有提示词必须使用中文(包括图片生成提示词) 2. @引用必须用官方命名:@图片1~@图片9、@视频1~@视频3、@音频1~@音频3 3. 不得包含写实真人面部素材——平台会自动拦截 4. 混合文件上限 12 个(图片+视频+音频合计) 5. 单次生成上限 15 秒,超出需分段拼接
详细平台参数和限制见 platform-specs.md。
核心能力速查(基于官方文档)
Seedance 2.0 = 多模态参考能力(可参考万物) + 强创意生成 + 精准指令响应
| # | 能力 | 提示词核心模式 | 官方说明 |
|---|---|---|---|
| 1 | 一致性控制 | [角色]@图片N + [动作/剧情] + [场景]@图片N | 人脸、服装、字体细节,前后一致 |
| 2 | 运镜/动作复刻 | 参考@视频1的[运镜/动作/节奏] + [主体]@图片N | 上传参考视频即可复刻走位和镜头 |
| 3 | 创意/特效复刻 | 参考@视频1的[特效/转场] + 将[元素]替换为@图片N | 转场、广告成片、复杂剪辑均可复刻 |
| 4 | 剧情补全 | [分镜脚本/图片描述] + [演绎方式] + [音效/台词] | 模型有强创意性,可自动补全剧情 |
| 5 | 视频延长 | 将@视频1延长Xs + [新增内容] | 平滑延长衔接,可"接着拍" |
| 6 | 声音控制 | [画面] + 音色参考@视频1 + "台词" | 音色更准,声音更真 |
| 7 | 一镜到底 | 一镜到底 + @图片1@图片2... + 全程不切镜头 | 镜头连贯性显著增强 |
| 8 | 视频编辑 | 将@视频1中的[A]换成@图片1 + [修改说明] | 角色更替、删减、增加,无需重头生成 |
| 9 | 音乐卡点 | @图片1...@图片N + 参考@视频1的画面节奏/卡点 | 画面节奏与音乐节拍精准匹配 |
| 10 | 情绪演绎 | [角色] + [情绪变化描述] + [运镜配合] | 表情从绝望转为坚定等细腻情绪表达 |
纯文本生成(无参考素材)是基础能力,模式:(主体) + (动作) + (环境/光影) + (运镜) + (风格)
各能力的详细示例见 examples.md。
提示词结构模板
基础结构(≤12秒短视频)
[风格/色调总纲],[主体描述],[动作序列],[环境/光影],[镜头语言],[音效描述]时间戳分镜法(13-15秒长视频,强烈推荐)
[时长][风格总纲],
0-3秒:[画面 + 镜头 + 音效];
4-8秒:[画面 + 镜头 + 音效];
9-12秒:[画面 + 镜头 + 音效];
13-15秒:[画面 + 镜头 + 音效]。短剧/对白结构
画面(0-5秒):[画面描述]
台词1(角色,情绪):[台词内容]
画面(6-10秒):[画面描述]
台词2(角色,情绪):[台词内容]
音效:[音效描述]
时长:精准Xs史诗/大制作结构(科幻/灾难/奇幻/动作等高品质视觉作品)
[时长][品质锚定:渲染引擎+画质规格+VFX等级],[核心氛围宣言:美学风格+整体感受],
[大气连贯声明:全片统一的物理/氛围效果,如"每帧都有薄雾弥散效果"],
0-Xs:[画面动作] + [运镜] + [可选逐段帧率,如"慢镜头120帧/秒"] + [大气在本段的具体表现];
...(时间戳分镜继续)...
光影:[①光源:主光类型和角度] + [②光行为:如何影响大气/材质] + [③色调:冷暖对比],
[收束句:后期处理词叠加] + [张力宣言:一句话锚定全片情绪]。与基础结构的四点核心差异:
1. 品质锚定:开头声明渲染引擎/VFX等级("UE5渲染,工业光魔级VFX"),效果远优于泛词"电影感"
2. 大气连贯声明:全片统一物理效果("每帧薄雾弥散"),防止不同镜头氛围断裂
3. 光影三层:光源 → 光行为 → 色调,三层各司其职,精准度远高于泛写"光线好"
4. 收束句:后期处理词 + 张力宣言,为全片定格情绪与视觉风格
技术参数前缀(可选)
[画幅比]2.35:1/16:9/9:16 + [帧率]24fps + [时长]Xs + [色调/风格]禁止项声明(建议附在末尾)
禁止:任何文字、字幕、LOGO或水印@引用编号分配规则
1. 公共素材从 @图片1 开始依次编号 2. 版本独立素材(首帧、尾帧)在公共素材编号之后递增 3. 每个素材标题后标注 @图片编号,方便用户对照上传 4. 写清楚是「参考」(借鉴风格/动作)还是「编辑」(在原素材上修改)
多模态组合技巧(官方推荐)
- 有首帧图 + 想参考视频动作? →
@图1为首帧,参考@视频1的打斗动作 - 想融合多个视频? →
在@视频1和@视频2之间加一个场景,内容为xxx - 没有音频素材? → 可以直接参考视频里的声音,无需单独上传音频
- 想要连续动作? → 加入连续性描述:
角色从跳跃直接过渡到翻滚,保持动作连贯流畅 - 素材优先级:优先上传对画面或节奏影响最大的素材,合理分配文件数量
超长视频(>15秒)
单次生成上限 15 秒。超出需用分段生成 + 视频延长拼接:
- 第 1 段正常生成(≤15秒)
- 后续段用
将@视频1延长Xs接续 - 每段之间须有画面衔接点描述
- 优先使用「三段式节奏」:建立世界 → 变化推进 → 情绪收束
- 每一段重复加入风格锁定、角色锁定、场景锁定语句,防止漂移
- 延长段开头建议先保留 0.8-1.5 秒桥接镜头;若连续剧情强,可采用尾帧延续法,前 1 秒只做微动再推进
超过 45 秒? 推荐走 25 格制作流水线(Phase 1 拆解 25 格剧情表 → Phase 2 输出 5×5 聚合提示词矩阵 + P0/P1 分镜图)——详见 production-pipeline.md 末尾。
详细分段策略和输出模板见 long-video-strategy.md。
剪辑节奏(>15 秒必读)
任何 ≥30 秒的成片都需要生成多个片段 + 剪辑拼接。AI 素材的剪辑不同于实拍素材,有专属的"出戏点"和"拼接陷阱"。
核心认知:节奏 = 时间轴上信息密度的变化规律。不是"快就好",而是变化本身制造吸引力。镜头 = 音符,镜头的长短 = 节奏的快慢,快慢的变化规律 = 一套公式。你不需要"凭感觉"剪——照着公式填镜头,节奏自动就对了。
六套剪辑公式速查:
| 公式 | 节奏图 | 适合 | 难度 |
|---|---|---|---|
| ① 呼吸式 | 快快快~慢…… | 80% 日常视频都能用 | ⭐ |
| ② 心跳式 | 咚—哒—咚—哒—咚哒咚哒…… | 悬疑、紧张、运动 | ⭐⭐ |
| ③ 海浪式 | 小浪~大浪~更大浪~平静 | 情感故事、MV、品牌片 | ⭐⭐ |
| ④ 子弹时间 | 正常→慢动作→砰!爆发 | 高潮段、产品揭晓 | ⭐⭐⭐ |
| ⑤ 脉冲式 | 哒哒哒—哒哒哒哒—轰! | 预告片、快闪、大促 | ⭐⭐ |
| ⑥ 静默锤击 | 安静……砰!更安静……砰! | 奢侈品、先锋艺术、恐怖 | ⭐⭐⭐ |
AI 素材五大专属对策:
1. 每条素材首尾修剪 0.5-1s(AI 运镜起止最不稳定) 2. 色彩统一是最大陷阱——选基准片,其他向它靠拢 3. 动作连贯用转场弥合(硬切 / 匹配剪辑 / 交叉溶解各有适用) 4. AI 微妙畸变用快节奏遮掩(0.3-1s 的快切观众看不清畸变) 5. 起手留 2-3 倍素材(目标 30s → 生成 60-90s 素材库挑选)
完整公式详解 + AI 素材剪辑标准工作流 + 剪辑节奏与坐标编码联动,见 editing-rhythm.md。
深度美学约束(商业级/电影级必读)
当项目要求商业级 / 电影级品质时,在基础结构之上叠加深度美学约束。
核心理念:不是"看起来像视频",而是"看起来像 Octane 渲出来的"。
三大支柱:
1. 渲染标准:用 GI 全局光照 / SSS 次表面散射 / 焦散 / 体积光等关键词,将输出品质拉到 Octane / V-Ray / Arnold 级别 2. 冷暖色调对比系统:6 套预设色调组合(赛博霓虹 / 极简白金 / 冰火对冲 / 赛博冷调 / 暮光渐变 / 极简黑白),附具体 HEX 值 3. 极简先锋构图法则:减法优先(元素≤3)+ 强对比分割 + 呼吸留白(≥30%)+ 几何锚点 + 层次递进
项目类型 → 美学配置速查(节选):
| 项目类型 | 渲染标准 | 色调组合 | 构图风格 |
|---|---|---|---|
| 科技产品广告 | Octane 极致版 | 赛博霓虹 / 极简白金 | 减法极简 + 几何锚点 |
| 游戏角色宣传 | Octane 极致版 | 冰火对冲 | 强对比分割 + 对角线 |
| 时尚 / 奢侈品 | V-Ray 极致版 | 极简白金 / 极简黑白 | 减法 + 30%+ 留白 |
| 情感短片 | Arnold 进阶版 | 暮光渐变 | 呼吸留白 + 层次递进 |
完整色调 HEX 值、渲染品质三档约束词、项目类型完整速查表、四套美学提示词模板,见 aesthetic-constraints.md。
图片风格匹配规则
根据主题自动匹配图片生成风格:
- 仙侠/修真 → 3D国漫渲染、中国仙侠概念设计
- 古风/历史 → 中国风工笔画、水墨画、古典绘画
- 赛博朋克/科幻 → 未来科幻写实CG、概念设计
- 现实/人物 → 电影摄影写实、人像摄影
- 美食 → 美食广告摄影、商业摄影
- 自然风光 → 风光摄影、航拍纪录片
- 动漫 → 对应风格(日漫赛璐璐、国漫3D渲染等)
图片生成提示词(角色参考图 & 首帧图)
图片生成是视频生产流水线的关键前置步骤。默认使用 NanoBanana(Lovart 平台),如果用户指定即梦图片生成则切换。
详细规范、prompt 模板和示例见 image-generation.md。
💎 精致度关键经验(实战验证,务必遵守):
生成 3A 游戏风格图片(如"黑神话·XXX"系列)时,prompt 越短越有效。
新一代模型(GPT Image 2 / NanoBanana)有视觉直觉与氛围推理能力 ——
✅ 有效做法:用"对标《黑神话:悟空》/《黑神话:潘金蓮》"做一句话锚定,
配合"衬衫有咖啡渍、键盘磨得发光"等生活痕迹描述、"UI 克制不抢戏"等视觉类比。
❌ 无效做法:堆砌 Octane / SSS / 工业光魔 / 像素数值(≤45px)/ 20+ 条禁止清单 ——
反而让 AI 拘束、画面变平庸。参考 projects/黑神话-其他/潘金莲.md 案例的 ~500 字极简写法。核心规则速查
1. 画幅比:角色参考图统一 9:16 竖版;首帧图与原视频画幅比一致 2. 语言:全部中文,不要 MJ/SD 语法,不堆砌英文标签 3. 忠实还原:服装质感如实描述(破旧写破旧,崭新写崭新),严禁美化 4. 人种一致:东方题材必须写"东方面孔""中式五官" 5. 平台差异:NanoBanana 可以包含写实人脸;即梦图片生成不可
角色参考图 prompt 格式(一段连续文本)
9:16竖版构图。[风格锚定]角色设定图,[构图视角],[背景],角色居中。[面部7要素]。[发型]。[头饰]。[服装逐件+新旧状态+污渍]。[道具]。[体态气质]。[光影]。[画质]。禁止:任何文字、字幕、LOGO、水印、多余背景元素首帧图 prompt 格式
[画幅比]。[风格锚定],[构图+角色位置]。[角色状态+关键辨识特征]。[环境细节]。[光影层次]。[色调氛围]。[画质]。禁止:任何文字、字幕、LOGO、水印运镜控制:相机四维编码系统
运镜是决定视频质量的关键。推荐思维:不再记忆零散关键词,而是在脑中建立坐标系。
一个完整镜头 = [Z 距离] + [Y 高度] + [X 方位] + [F 滤镜] + [运动] + [节奏] + [约束]四个维度速查:
| 维度 | 控制什么 | 编码范围 |
|---|---|---|
| Z 距离 | 景别(看清毛孔 / 看清动作 / 看清世界) | Z1 大特写 → Z9 大远景 |
| Y 高度 | 权力关系(仰视崇拜 / 平视共情 / 俯视压制) | Y1 虫视 → Y7 顶视 |
| X 方位 | 立体感与心理距离(正面 / 侧面 / 背面) | X1 正面 → X4 背面 |
| F 滤镜 | 镜头物理能力与叙事身份 | 焦段 + 景深 + 畸变 + POV/OTS + 构图几何 |
最重要的两条铁律:
1. 每个镜头最多双轴运动。三轴同时变化 = 失控。 2. Z1-Z3(近距)+ X 轴大幅旋转 = 崩脸陷阱。近景环绕应换成 Z4+ 或减小旋转幅度。
默认参数(用户未指定时):Z4 中近景 + Y4 平视 + X2 四分之三侧 + 50mm + 浅景深 + 缓入缓出。
完整能力清单(全部在 camera-codec.md 中):
- Z/Y/X/F 四维编码详细表格
- 基础运镜 / 高级运镜 / 特效级运镜词典
- 情绪 → 坐标编码速查表(14 种情绪直接给出坐标公式)
- 经典组合速查(Z+X / Z+Y 组合)
- 多镜头叙事的坐标递进模式(远→近 / 静→动 / 冷→暖)
- 多模态素材分工(
@图片锁定外貌 /@视频锁定运动 / 文本锁定起始坐标) - 运镜冲突检测(三轴同动 / 近距大旋转 / 方向矛盾)
- 八大核心要素自检清单 + DO/DON'T 规范
- 12 种常见问题排查
运镜修饰词(Smooth / Slow / Cinematic / Handheld / Aerial / POV 等)见 vocabulary.md。
镜头质感修饰(隐藏层级):在运镜动作之外,叠加镜头本身的物理状态——"雾水珠附着镜头前"、"雾粒粘镜"、"镜头轻微抖动"、"镜头畸变+雾层折射"——这类"不完美"效果反而大幅提升真实感和沉浸感,是区分普通视频和大制作质感的关键细节。
核心示例
示例 1:纯文本 — 暴风雨海岸(15秒,时间戳分镜)
15秒暴风雨海岸,冷灰蓝色调,cinematic 2.35:1,0-3秒:Aerial大远景俯拍,
铅灰色乌云从海平面压过来,海浪猛烈拍打礁石溅起白沫;4-8秒:Slow Crane Down
缓缓下降至海岸线,一只白色海鸥逆风低飞掠过浪尖,浪花打湿镜头边缘;
9-12秒:Low Angle仰拍,巨浪涌向镜头,浪尖卷起的水雾被风撕碎,远处灯塔
光束在雾气中旋转,伴随呼啸风声;13-15秒:Gradual Pull Out缓缓拉远,
海岸全景,灯塔孤独矗立在风暴中,音效收束为远处低沉的雷鸣与渐弱的浪声。示例 2:多模态引用 — 数码产品广告
@图片1中的无线耳机从纯黑背景中Smooth Orbit环绕旋转出场,充电仓缓缓打开,
一只耳机浮起做360度展示,耳机内部结构参考@图片2,Subtle Zoom In推进至
耳机表面纹理细节,然后耳机优雅回到仓内,充电仓合拢,全程极简科技风,
3D渲染产品特效,柔和侧光
参考素材:
- @图片1:耳机产品正面高清图
- @图片2:耳机内部结构示意图示例 3:一镜到底 — 从微观到宏观
一镜到底,Macro极致微距从@图片1中花瓣上一滴露珠开始,Smooth Dolly Back +
Crane Up缓缓拉远同时上升,露出整朵玫瑰的全貌,继续拉远看到@图片2中整片
花田的色彩层次,镜头不停上升变为Aerial航拍视角,最终看到@图片3中花田旁
蜿蜒的小河和远处炊烟袅袅的村庄全景,golden hour lighting,
全程不要切镜头,一个连贯的拉远镜头。示例 4:史诗大制作 — 赛博朋克暴雨追逐(15秒)
演示「品质锚定 + 大气连贯声明 + 光影三层结构 + 收束句」完整史诗架构
15秒赛博朋克暴雨追逐,8K超高清+杜比视界HDR,UnrealEngine5渲染,工业光魔级VFX特效,
暴力美学+潮湿霓虹朦胧氛围,全程暴雨倾盆,镜头前附着雨水珠肌理,每帧都有自然的雨雾弥散效果,
0-3s:平流层俯冲Aerial航拍,高密度摩天楼群从铅灰雨云中刺出,霓虹灯光在雨水中渗出彩色光晕,
追逐车队在高速公路卷起水雾尾迹,清晰的破雾轨迹,若隐若现的建筑轮廓;
3-7s:Extreme Low Angle仰拍慢镜头120帧/秒,主角从激起的水花中猛地起身,
雨水颗粒裹挟薄雾飞溅,玻璃幕墙碎片在雾中划出银色弧线,
镜头剧烈Handheld抖动,雾粒清晰粘镜,热浪蒸腾雾气成白色气团;
7-11s:微距贴近特写,主角面部雨水滚落细节,身后建筑爆炸火光透过雨帘形成朦胧橙红光斑,
防空警报红光透过雾层弥散,镜头畸变+雾层折射效果;
11-15s:低角度Slow Crane Up仰拍,主角身躯占80%画面比例,
在巨型霓虹广告牌下形成压迫感剪影,火焰裹着雨雾呈半透明橙红渐变,
最后一帧双眼在雾中映射出城市倒影,暗角渐深,渐入黑屏。
光影:暴雨逆光+建筑爆炸橙红+霓虹灯漫射(光源层),雨雾柔化高光但强化阴影对比、
丁达尔效应贯穿全片(光行为层),冷蓝底调+霓虹紫红高光(色调层)。
暗角+胶片颗粒+电子噪点混雨雾粒子收尾,窒息式压迫感与诡谲霓虹氛围并存,无冗余画面,全程高张力。更多场景示例见 examples.md。
交互流程
Step 0:判断内容类型(新增·最关键的一步)
先判断用户要做的是哪种类型,走不同路径:
路径A — ≤15秒单段视频(概念驱动):
- 触发:用户只给文字描述,没有上传图片
- 核心任务:帮用户找到一个有传播力的单一视觉hook
- 参考 creative-strategy.md 中的爆款模式库
- 概念越简单越好,不要试图塞叙事
- 建议用户准备首帧图或参考视频以提升效果
路径B — >15秒长视频:
- 核心任务:帮用户走完整的前期制作流程 + 剪辑规划
- 按 production-pipeline.md 的流水线依次输出:角色设计 → 角色卡片图提示词 → 分镜脚本 → 分镜参考图提示词 → 逐镜头视频提示词
- ≥45 秒:推荐升级到 25 格制作流水线(Phase 1 拆 25 格剧情表 → Phase 2 输出 5×5 聚合提示词矩阵)
- 必须同时输出剪辑方案:选择六套剪辑公式中的一套(呼吸式 / 心跳式 / 海浪式 / 子弹时间 / 脉冲式 / 静默锤击),在逐镜头提示词后附上时间线排布建议
- 不要跳过任何步骤直接输出视频提示词
路径C — 图片驱动(Image-Driven,v3):
- 触发:用户上传/粘贴/拖入图片,或要求"用这张图做视频"、"图生视频提示词"、"根据图片生成视频"、"这张图怎么做成视频"
- 核心任务:先判断图属于反应/凝视哪种范式,用对应模板放大其潜力,按内容粒度推算合适时长
- 必须走两轮交互(v3 升级):
1. 第 1 轮:读图分析(主体/氛围/最有戏元素/画质来源判定/4 层退化策略/建议时长/比例诊断/平台合规风险/日常常识审计/风险检查) → 询问 Hook 范式(反应/凝视,v3 替代 v2 时序角色询问) → 2 个 Hook 候选 2. 第 2 轮:用户选定后,输出完整 Seedance 提示词(凝视模式用 4-A 模板:3-4 个自然小动作+群演段内具体写+跨人物互动事件+镜头运动锁死+4 层画质退化;反应模式用 4-B~F 模板)
- 可选 Step 4(CLI 执行):第 2 轮提示词输出后,询问用户是否直接调用
dreaminaCLI 生成视频;默认不跑,用户回跑/yes才执行。详见 cli-integration.md - v3 八条核心原则(必须遵守):
- ① 图作"框架参考"不强制卡帧(推翻 v2 时序锚点)
- ② 凝视模式必须 3-4 个自然小动作(不可呆滞)
- ③ 日常物理常识审计(前排不会有人挡、手与黑板物理矛盾等)
- ④ 画质 4 层退化模板 + 9 个禁用 + 正向强约束
- ⑤ 群演段内具体写动作(不只是单句声明)
- ⑥ 主角行为正向夸张+反向否定双重锁定
- ⑦ 镜头运动锁死声明(凝视模式专用)
- ⑧ 跨人物互动事件(多人场景必加)
- Hook 范式判断:90% 路径 C 场景应走凝视模式(日常瞬间),仅高戏剧定格走反应模式
- 比例处理:让图片比例 = 视频比例。16:9 横图做抖音 9:16 时主动推扩图方案,不要默默裁切
- Seedance prompt 字符上限 2000(硬约束):必须 Python
len()实测,不准凭中文字感觉估算。中文每字=1 字符,标点也算。实测前不得报"字符数:X"。实测脚本与超长削减策略见 image-to-prompt.md "字符数实测铁律"小节。目标控制在 1900 以内留 100 字符余量 - 版权敏感词必扫(v5 真因定型版 · case-17 11 版翻盘后):
⚠️ 女性 / 室内 / 多人场景必读:完整 SOP 速查见references/image-to-prompt.md顶部"🚨 即梦平台版权审查·必读 SOP 速查"小节(一进文档就看到)。完整翻盘历程见experiments/summary.md第 20 节。
5 条铁律速记: 1. 🔴🔴 绝对禁用「夜场氛围 BGM 词」(v5 真因·case-17 测试 C 实测拦截):爵士钢琴 / Jazz Piano / Lounge / Bossa Nova / Smooth Jazz / 萨克斯 / 钢琴酒吧——能不写 BGM 就不写 2. 🔴 不要凑齐夜场环境 4 元素:暖橘吊灯 / 大屏柔光 / 深色大理石 / 红木——最多写 1-2 个 3. 🔴 第 3 类涉灰场景词全删:会所 / 公关 / 包间 / 介绍美女 / 沙龙厅 / 偷拍 / 美女群像 / KTV / 商 K 4. 🟡 多人场景禁用"镜头平移到第 X 位"(防 v8 翻车 6 张脸同质化)→ 改"单一固定全景静态机位"+台词指代 5. 🟡 禁止人物 × 道具的物理交互(防 v3 翻车酒杯飞)→ 不举杯/不拿物;前景道具显式锁定不动
"三层动作分级"方法论(v5 翻盘核心 · 多人场景必用):
- 第 1 层 持续微动(防石像):呼吸/眨眼/肩颈微动/头发飘动/视线流转——全程不停
- 第 2 层 被聚焦回应(叙事):嘴角轻扬+轻微点头+视线锁定 0.5 秒——时间段具体写
- 第 3 层 大动作(穷举禁止):起身/走动/转身/换姿势/伸手拿物
推翻的错误假设(不要再走弯路):
- ❌ 岳哥 GPT Image 2 公式("展示女性叙事必拦")—— 对即梦视频效果有限(保留作参考)
- ❌ "横扫多女性 + 主角收束运镜必拦" —— 错(运镜不是核心审查维度)
- ✅ 真因:词汇/词组本身在 AI 训练语料中的"涉灰联想强度"——解药是删可疑词 + prompt 极简化(短 ≈ 稳)
历史遗留分类(仍需扫描,但不是核心): ① 第 1 类·具体品牌词(iPhone / 抖音 / ESPN / UE5 / 工业光魔 等)必中性替换 ② 第 2 类·风格借喻措辞(vlog 爆款 / 旅行 vlog / 探店 / 大师式 等)改纯物理描述 ③ 第 3 类·涉灰场景词 + 🚨 v5 新增·夜场氛围 BGM 词(最隐蔽真凶)——见上方铁律 ④ 第 4 类·整体语义意图(GPT Image 2 公式遗留 / 岳哥安全尾缀)——v5 实测对即梦视频效果有限,仅作保险措施
- 完整方法论见 image-to-prompt.md(必读)
路径D — 分镜板驱动(Storyboard-Driven,v0.1 试运行):
- 触发:用户上传 N 宫格分镜板/漫画分镜/多格拼贴图,说"根据分镜内容拼接视频"、"按这几格生成"
- 核心任务:拆解多格 → 选 D-1/D-2 模式 → 输出 prompt + 剪辑节奏建议
- D-1 单条多段:≤4 格 + 总 ≤15s,做成时间戳分镜
- D-2 多条独立:≥5 格 或 总 >15s,每格一条 prompt + 拼接清单
- 关键约束:必须显式声明"不复刻分镜板的网格边框/格子编号/分隔线",否则模型会把这些当画面元素
- 完全继承路径 C v3 的双范式 + 8 条原则 + 4 层画质退化
- 完整方法论见
references/storyboard-driven.md(试运行中,建议先用 1-2 个 case 实测验证再深用)
Step 1:获取用户创意
用户描述想要生成的内容,例如"一段仙侠战斗"、"奶茶产品广告",或直接丢图附带一句话。
Step 2:确认关键参数
通过提问确认(已明确的可跳过): 1. 视频时长:短片(4-8s) / 中等(9-12s) / 长片(13-15s) / 超长(>15s) 2. 视频比例:横屏16:9 / 竖屏9:16 / 方形1:1(路径 C 默认跟随图片比例,详见 image-to-prompt.md 的比例 5 类策略) 3. 参考素材:纯文本 / 有图片 / 有图片+视频 / 全模态 4. 图片生成平台:NanoBanana (默认) / 即梦图片生成 5. 补充偏好(可选):情绪氛围、镜头风格、用途场景
Step 3:生成提示词
- ≤15秒(路径A):生成 2-3 个不同风格版本 供选择,每个版本附首帧图生成建议
- >15秒(路径B):按生产流水线依次输出各阶段产物
- 图片驱动(路径C):先读图分析 + Hook 候选,用户选定后再出完整提示词(必要时同时给扩图建议)
- 每个提示词可直接复制到即梦平台使用
Step 4:微调优化
用户选定版本后可要求调整:时间段内容、风格/色调/镜头、台词/音效、时长/分段方式。
输出格式
简单模式(目标明确,≤15秒)
直接输出可复制的提示词 + 简要素材准备建议。
完整模式(需探索创意,≤15秒)
## 视频提示词
**主题**:[一句话概括]
**时长**:[X秒] | **比例**:[16:9 / 9:16 / 1:1]
### 公共参考素材(如有)
- @图片N 用途说明
- 图片生成提示词:[中文描述]
---
### 版本一:[版本标题]
#### 提示词
[完整提示词]
#### 参考素材
- 首帧 @图片N:[描述 + 图片生成提示词]
- 尾帧 @图片N:[描述 + 图片生成提示词](如需要)
---
### 版本二:[版本标题]
[同上结构]
---
### 提示词解析
[各版本设计意图差异]超长模式(>15秒)
见 long-video-strategy.md 中的输出模板。
图片驱动模式(路径 C,v3)
用户丢图时必须走两轮 + 一次 Hook 范式询问:
第 1 轮输出(读图分析 + 范式询问 + Hook 候选):
## 图片分析
**主体**:...
**当前画面氛围**:...
**最有戏的元素**:...
**画质来源判定**:[摆拍/生活抓拍/手机日常/监控DV/胶片复古/动漫CG/抓拍偷拍/直播流] —— 一句话依据
**对应 4 层画质退化策略**:①平台压缩 ②设备瑕疵 ③现场瑕疵 ④镜头变形(详见 image-to-prompt.md 第五原则)
**比例诊断**:[实际比例] → [推荐视频比例](附扩图建议如需)
**建议时长**:X 秒(推算理由:这张图适合表达[内容粒度])
**Hook 范式判断(v3)**:[反应 / 凝视 / 待定]
**日常常识审计(v3)**:主角位置/动作/其他人/时序逻辑各项 OK 或问题说明
**平台合规风险**:[低 / 中(说明) / 高(拒跑)]
**风险检查**:真人脸 / 文字水印 / 清晰度
## 这张图你想要哪种模式?
- `反应` = 主体有情绪反应(害羞/惊讶/被击中/笑),按子节拍展开
- `凝视` = 主体自然存在被偷拍,单一缓慢推进,无情绪变化
- 不指定 → 我根据图本身判断
→ 回复一个字 / 词
## 推荐 Hook 候选
### 候选 A:[名称]
- Hook 范式:[凝视/反应]
- 演化轨迹:[凝视:3-4 个自然小动作分布 / 反应:分镜结构]
- 传播因子:[为什么会被分享/二刷]
- 适用度:★★★★★
### 候选 B:[差异化选项]
...
→ 选 A / B,或告诉我想要的方向第 2 轮输出(选定后的完整提示词):按"完整模式"格式,但额外标注:
- Hook 范式(反应/凝视,v3)
- Hook 模式(具体名)
- 画质策略(4 层退化)
- 时长(推算值,非默认 15)
- 字符数(≤2000 字符,Python
len()算法)
凝视模式:3-4 个自然小动作 + 主角行为正向夸张+反向否定 + 群演段内具体写 + 跨人物互动事件(多人时) + 镜头运动锁死声明 + 4 层画质退化 反应模式:现实类反应必须按子节拍展开(脸红 ≥2.5s、哭 ≥3s、惊吓 ≥1.2s 等)+ 图作非首帧时显式时间锚点
末尾给"设计意图"说明前 2 秒生死线、核心 hook、画质真实感、范式选择、二刷钩子、传播预期。
第 2 轮之后(可选 Step 4:CLI 执行询问):
输出完提示词后,默认追加下面这段询问(不是直接跑):
---
## 是否直接调用 dreamina CLI 生成?
- 图片:[用户提供的本地路径]
- 模型:seedance2.0_vip
- 分辨率:720p(效果满意后可升 1080p)
- 时长:X s(来自 Step 1 推算)
- 当前余额:[先跑 dreamina user_credit 查到的值] 积分
回复:
- `跑` / `yes` → 用上述配置执行
- `fast` → 换 seedance2.0fast_vip 省积分试片
- `1080p` → 升到 1080p(仅 seedance2.0_vip 支持,消耗翻倍)
- `改时长 X` → 修改时长再跑
- `no` / 不回 → 只保留提示词文本,不执行用户确认后的执行规则、转义处理、异步任务、失败重试、硬约束见 cli-integration.md。
核心纪律:
- 用户没说"跑"就不要跑
- 执行前必须先
dreamina user_credit看余额,<100 拒跑 - 平台合规风险=高 时拒跑,建议换图
- 执行后把
submit_id和结果路径回显,保留审计痕迹 - 连续失败 3 次必须停下来问用户"问题是提示词还是模型"
- post-TNS 失败积分会退回,但耗时 5-7 分钟,提前判合规可以省时间
完整结构与示例见 image-to-prompt.md。
质量自检 Checklist
生成提示词后,自动检查:
视频提示词:
- [ ] @引用编号与素材清单一一对应
- [ ] 总文件数 ≤ 12(图片+视频+音频)
- [ ] 未包含写实真人面部素材
- [ ] 时间戳分镜覆盖完整时长,无遗漏
- [ ] 台词用引号包裹并标注角色和情绪
- [ ] 音效描述与画面描述分开
- [ ] 图片风格与视频主题匹配
- [ ] 超长视频衔接点描述清晰
- [ ] 超长视频已加入风格锁定、角色锁定、场景锁定语句
- [ ] 延长段开头已安排桥接镜头或尾帧延续微动
- [ ] 统一负面提示词已覆盖风格漂移、角色变脸、偏色、光线突变等风险
视频提示词(动感与连贯性):
- [ ] 如有贯穿性运镜,开头已声明且每段提及运镜状态
- [ ] 人物有与画面节奏匹配的身体动作(非剧情需要不应完全静止)
- [ ] 同场景换装已声明固定背景,每次换装标注"背景不变"
- [ ] 形态变化(morph)描述了过渡方向、媒介和持续时间(非简单硬切)
- [ ] 短暂闪现效果标注了持续时间并写明恢复
- [ ] 特效描述了对环境光影的影响(非悬浮贴图)
- [ ] 如有 BGM 节奏感,人物动作和画面节奏与之匹配
运镜坐标编码(四维系统):
- [ ] 每个镜头最多双轴运动(禁止 Z+Y+X 三轴同动)
- [ ] 近距景别(Z1-Z3)未与 X 轴大幅旋转组合(避免崩脸)
- [ ] 焦段已明确到具体数值(如 "85mm",不是 "长焦")
- [ ] 景深类型已明确(浅景深 / 深景深 / 拉焦 / 散景)
- [ ] X 轴方位已声明(正面 / 四分之三侧 / 侧面 / 背面)
- [ ] 多镜头叙事使用了坐标递进(如 Z9→Z5→Z2)
- [ ]
@图片N / @视频N后紧跟了角色名或解释词
剪辑节奏(长视频必检):
- [ ] 选择了明确的剪辑公式(呼吸式 / 心跳式 / 海浪式 / 子弹时间 / 脉冲式 / 静默锤击)
- [ ] 每条 AI 素材预留首尾修剪余量(0.5-1s)
- [ ] 全片色调一致(选基准片 + 统一 LUT)
- [ ] 高潮点明确且所有素材向其服务
- [ ] 开头 2 秒内有强视觉 hook
- [ ] 结尾有"想看第二遍"的钩子
深度美学约束(商业级必检):
- [ ] 选择了明确的色调组合(赛博霓虹 / 极简白金 / 冰火对冲 等)
- [ ] 渲染品质约束已追加(GI / SSS / 焦散 / 体积光)
- [ ] 材质微观细节已描述(金属各向异性 / 皮肤 SSS / 玻璃色散等)
- [ ] 构图遵循减法原则(元素 ≤ 3) + 呼吸留白(≥ 30%)
图片驱动(路径 C)专属(v3 升级):
- [ ] 比例诊断已完成,图片比例与视频比例匹配方案明确
- [ ] Hook 范式已确定(反应/凝视)(v3 替代 v2 时序角色询问)
- [ ] 画质来源已判定,4 层退化策略已写入风格总纲(v3)
- [ ] 建议时长已推算,并给出推算理由(非默认 15s)
- [ ] 平台合规风险已评估
- [ ] 日常物理常识审计已通过(v3 新增)
- [ ] 风险检查已扫(真人脸/文字水印/清晰度)
- [ ] 前 2 秒有视觉钩子,没有用"缓缓推进"开场
- [ ] 推算时长 X 的分镜完整,无时间空缺
- [ ] 9 个画质禁用清单已写(v3)+ 风格锁定的正向强约束已写(v3)
- [ ] 图作框架参考不卡帧(v3 推翻 v2 时序锚点;除非反应模式且图是高戏剧瞬间)
- [ ] 凝视模式:3-4 个自然小动作 + 正向夸张+反向否定双重锁定 + 镜头运动否定句穷举锁死(v3)
- [ ] 反应模式:现实类反应使用了子节拍(脸红 ≥2.5s 等)+ 非首帧时显式时间锚点
- [ ] 多人场景:跨人物互动事件已写(v3 新增)
- [ ] 群演段内具体写动作(不只是单句声明)(v3)
- [ ] 总字符数 ≤2000(Python
len()实测,禁止凭中文字感觉估算;目标 ≤1900 留 100 余量;超长削减策略见 image-to-prompt.md "字符数实测铁律") - [ ] 🚨 即梦版权审查 SOP(v5 必检):女性 / 室内 / 多人场景 prompt 写完必须过 5 条铁律:①无夜场 BGM 词(爵士/钢琴/Lounge)②无夜场环境 4 元素聚集 ③无第 3 类涉灰场景词 ④多人场景用静态全景机位(不平移到每位)⑤无人物×道具物理交互。多人场景必用三层动作分级(持续微动+被聚焦回应+禁止大动作穷举)。详见 image-to-prompt.md 顶部"🚨 即梦平台版权审查·必读 SOP 速查"+ summary.md 第 20 节。
- [ ] 扩图建议已给出(比例不理想时,含可复制的 NanoBanana 扩图提示词)
- [ ] 文字要求已按 4 级优先级注入(硬约束/延展/情绪/细节)
- [ ] 二刷钩子已设计(结尾呼应或隐藏细节)
分镜板驱动(路径 D,v0.1)专属:
- [ ] 模式选择明确(D-1 单条多段 / D-2 多条独立)
- [ ] 格线/编号/UI 规避声明已写("不复刻分镜板的网格边框/格子编号/分隔线")
- [ ] 继承路径 C v3 的双范式 + 4 层画质退化 + 8 条原则
- [ ] D-2 模式下,剪辑节奏建议已给出(呼吸式/心跳式/海浪式 等)
图片提示词(角色图/首帧图):
- [ ] 角色参考图画幅比为 9:16 竖版
- [ ] 首帧图画幅比与原视频一致
- [ ] prompt 开头写明了画幅比
- [ ] 五官人种特征与视频一致
- [ ] 服装新旧状态如实描述(不美化不丑化)
- [ ] 没有使用 MJ/SD 语法或堆砌英文标签
- [ ] 全部中文描述
- [ ] 末尾有禁止项声明
- [ ] 风格锚定与 realism_level 一致
关键提示词技巧
- 具体且有画面感:避免抽象模糊("一个女人走路" → "穿红色风衣的女子在雨夜霓虹街道快步行走")
- 动作有时间顺序:让模型理解画面先后关系
- 情绪氛围很重要:对最终效果影响很大,不要忽略
- 13-15秒必用时间戳分镜:精确控制每段画面
- 台词与画面分离:台词用引号 + 标注角色和情绪,单独成段
- 合理控制长度:重点突出,避免信息过载
---
节奏与传播技巧(源自实战反馈):
- 前2秒是生死线:在短视频信息流中,用户滑动决策不到2秒。最震撼的视觉放在开头,禁止用"缓缓推进"开场
- 一个视频一件事:15秒内只做一个核心概念,概念越简单模型执行越精准
- 参考素材 > 纯文本:大部分优质AI视频都用了首帧图或参考视频引导,纯文本生成适合自然风光/流体/粒子等抽象主题
- 不要在15秒里讲故事:≤15秒的本质是"一个不可能的瞬间",不是"一个微型电影"
- 静→动的突变比持续运动更有冲击力:一段静止中突然爆发一个动作,比全程运动更抓人
- 留一个"想看第二遍"的钩子:结尾呼应开头、隐藏细节、或视觉效果震撼到想确认真假
---
大制作进阶技巧(源自高品质史诗提示词实测):
- 品质锚定开头:用渲染引擎和VFX等级关键词开头("UnrealEngine5渲染,工业光魔级VFX特效"),比泛词"电影感"更精准地激活模型高质量输出模式
- 大气连贯声明:在氛围总纲后声明全片统一的物理效果("每帧都有薄雾弥散效果,镜头前附着雾水珠肌理"),防止不同分镜氛围断裂,是史诗风格提示词的核心句
- 光影三层结构:分三层描述光影 — ①光源(暴雨逆光+熔岩自发光)→ ②光行为(薄雾柔化高光、丁达尔效应清晰)→ ③色调(冷蓝底调+熔岩红高光)— 三层各司其职,效果远优于泛写"好莱坞光影"
- 逐段帧率控制:慢动作/快切镜头可在对应分镜内单独声明帧率("慢镜头120帧/秒"),精确控制每个片段的动态感知
- 镜头污染增强真实感:雾粒粘镜、雨水附着镜头前、镜头抖动、镜头畸变等"不完美"效果反而大幅提升沉浸感,是区分普通和大制作质感的关键
- 收束句定格全片情绪:结尾写后期处理词 + 张力宣言("暗角+胶片颗粒+电子噪点收尾,窒息式压迫感,全程高张力")—— 为全片视觉风格和情绪做最终定格
- 画面占比控制构图:大主体场景用占比描述("主角身躯占80%画面比例")比单独写"仰拍"更精准地传递压迫感
---
动感与连贯性技巧(源自实测反馈,直接影响生成质量):
- 运镜必须全程声明:如果视频需要持续的运镜(如 Orbit 环绕),不能只在第一段写,必须在开头总纲声明"全程XXX运镜不停机",并在每个时间段中提及运镜状态。AI 模型倾向于把每段当独立镜头处理——不反复提醒,运镜就会断
- 人物不能是石像:除非剧情需要角色完全静止,否则人物应有与画面节奏匹配的身体动作。音乐视频中人物必须有节拍律动(bounce/摆臂/顿肩/甩头等),即使是"酷飒站立"也要有微幅摇摆
- 音画协同要显性描述:BGM 的节拍对画面的影响不能靠 AI 自己脑补——必须在 prompt 中明确写"随重拍顿肩""节拍落点闪切换装"。同时考虑画面中是否需要音乐相关的环境道具(音响/乐器/节拍可视化等)来强化音乐氛围
- 同场景换装必须固定背景:如果多个造型是在同一场景中切换的,必须在开头声明"XX为固定背景贯穿全片"并在每次换装时写"背景不变"——否则 AI 会为每套造型生成完全不同的背景
- 过渡方式决定观感品质:不是所有变化都适合硬切——形态变化(人→骷髅、真人→机械)用渐变过渡(morphing)比硬切高级得多。描述渐变时要写清方向(自上而下/由内而外)、触发媒介(流体/光效/粒子)和持续时间
- 短暂闪现 ≠ 完整场景:如果某个视觉状态只持续 0.5-1 秒(如骷髅闪现),必须标注持续时间并写"随即恢复"——否则 AI 会把它当成一个完整的 2-3 秒场景段落来生成
- 特效不能是贴图:流体/粒子/烟雾等特效必须描述它们对环境光影的影响(如"流体在地面投射流动光斑""烟雾将背景染成暖金色调"),才能让特效融入画面而非像悬浮贴图
Case-01:演唱会前排凝视 · 路径 C v2→v3 验证
注意:本 case 的工作流是「Agent 产出 prompt + 主理人手动在 Seedance 平台跑」,非 CLI 自动化。CLI 字段省略。
---
1. 基础信息
- Case 编号:01
- 简称:演唱会前排凝视(手机海点亮+主角沉浸)
- 图片来源:用户提供(CodeX 内 GPT Image 生成)
- 图片尺寸:9:16 竖版
- 执行日期:2026-05-12 ~ 2026-05-13
- 迭代版本:v2(已跑,反馈不佳)→ v3(待跑)
---
2. 第 1 轮:读图分析(v2 字段必填)
| 字段 | 内容 |
|---|---|
| 主体 | 演唱会前排栏杆位长发女孩,白色抹胸+米色雨衣半披,目光投向舞台方向、表情专注嘴唇微张 |
| 当前画面氛围 | 夜场音乐节现场感、雨夜潮湿、昏暗+舞台远端追光、沉浸式凝视 |
| 最有戏的元素 | 那一片密集举起的手机屏幕(每块都是一个"看舞台的小窗口") |
| 画质来源判定(v2) | 手机随手拍夜场录像(粉丝视角的高肩低位仰拍、雨夜高 ISO 噪点、手机弱光对比硬、握持不稳、轻微鱼眼畸变) |
| 对应画质策略(v2) | 粉丝手机录像质感、雨夜高 ISO 数码噪点、弱光+追光对比硬、握持不稳手抖、轻微广角畸变、镜头前隐约雨水痕迹 |
| 比例诊断 | 9:16 → 9:16(无需扩图) |
| 建议时长(v2) | 6 秒 |
| 推算理由(v2) | 单一动作完成弧线(屏息→追光起→手机海点亮),按 v2 原则 4 单一动作 5-7s 合理;硬拉 15s 必中段编造 |
| 平台合规风险(v2) | 低(白色抹胸+雨衣属常见演唱会装扮、无暴露危险区) |
| 风险检查 | 真人脸: AI 生成 ✅ / 文字水印: 无 ✅ / 清晰度: ✅ |
---
3. 时序角色询问
主理人的回复:首 最终采用:首帧(0-1s 严格锁定 @图片1 原构图) 理由:原图本身是"已凝固的群体凝视瞬间",作首帧让 0-1s 锁定原图,后续 1-4s 演化追光起+手机海依次点亮。作中间帧需要编"她还没在这状态时在干什么",反而稀释氛围浓度
---
4. Hook 候选与选定
候选 A:手机海点亮 × 全场屏息 ★★★★★
- 演化轨迹:0-1s 首帧锁定 → 1-4s 舞台追光亮起+前景手机屏幕多米诺式依次点亮 → 4-5.5s 镜头微微 Slow Crane Up 上升展开为整片观众群上空视角的"手机银河"光点矩阵 → 5.5-6s 定格收束
- 传播因子:手机海点亮的视觉奇观+从个体到集体的尺度跃迁+雨夜+银河手机海视觉记忆点强
- 适用度:★★★★★(图本身的密集手机阵就是这个 hook 的精确视觉锚)
候选 B:她的瞳孔倒映出舞台 ★★★★
- 演化轨迹:0-2s 原图静态 → 3-7s 镜头从中景推到女孩脸部超微距瞳孔 → 8-11s 瞳孔中倒映舞台歌手剪影 → 12-15s 镜头从瞳孔穿过去到舞台真实视角
- 传播因子:经典抒情电影语言,情感浓度极高,但执行难度大
- 适用度:★★★★(超微距瞳孔细节对 AI 视频考验大)
主理人选定:A
---
5. 第 2 轮:v2 完整 Seedance 提示词
6秒夜雨音乐节前排手机随手拍录像质感,9:16竖屏,@图片1为0-1秒首帧锁定。
画质:粉丝手机录像,雨夜高ISO数码噪点全程、弱光下追光对比硬、握持不稳微抖、镜头前隐约雨水痕迹、轻微广角畸变。非电影级非Cinematic非4K锐利。现场音贯穿全片不可寂静:歌手歌声与伴奏(节奏清晰歌词模糊)、密集人群合唱欢呼回声、雨打雨衣塑料摩擦声、远处人群手机外放微弱混响、风声。
0-1秒:@图片1为静态首帧(前排栏杆中景平视),长发女孩注视舞台方向表情专注嘴唇微张姿态锁定原图,身边雨衣观众群保持原构图,前景5+部手机持续举起拍摄但未亮屏,细密雨丝从画面顶部飘落,BGM低音前奏已在响,人群呼吸般微动。
1-4秒:舞台方向骤然亮起一道冷白追光从画面右上方斜射进来(机位保持),前景所有手机屏幕像多米诺骨牌一样依次点亮,亮起波浪从画面左侧向右侧推进每0.3秒一波,每块亮起的屏幕都映出舞台同一道追光轮廓形成光的镜像阵列,雨丝穿过追光变为清晰银色斜线,女孩表情依然停在原图专注瞬间未变只有眼神微聚焦,歌手歌声从舞台方向第一段副歌推进涌入。
4-5.5秒:镜头Slow Crane Up缓慢上升(Z4→Z6+Y4→Y2 上升俯视过渡),离开女孩的脸向上抬升越过她头顶,展开为整片观众群上空视角,密集手机屏幕铺开成银河般光点矩阵每块同步映着追光,雨丝在追光下变成密集银线穿过画面,观众群在追光逆光下形成深色剪影,歌手歌声推向副歌高点。
5.5-6秒:镜头到达最高点定格(高位俯视广角),俯视前排整片手机银河光点矩阵填满画面,远处舞台歌手只是一个模糊白衣轮廓在光雾中伸手向天,最后0.3秒画面凝固成一张封面级大场景静帧,音收束为副歌渐弱+人群压抑合唱回声+雨声。
光影:舞台冷白追光斜射主光+追光穿过雨丝产生丁达尔效应+手机屏幕集体点亮做次级光源向上反射照亮观众侧脸轮廓+冷蓝夜色底调与追光冷白高光+雨衣表面散落彩色环境光斑。
风格锁定:非电影级非Cinematic;雨夜潮湿氛围全程贯穿;前景手机阵空间分布与首帧严格一致;手机屏幕亮起时屏幕内容统一为舞台追光轮廓不可出现具体面孔文字;女孩在0-4秒严格保持首帧姿态不可大幅度移动;观众群必须自然微动(呼吸/轻摇晃/雨打身体反应)不可静止如石;现场音贯穿全片不可寂静。禁止任何文字字幕、品牌LOGO、水印。字符数:976(≤ 2000 ✅)
自检 v2 字段:
- [x] 风格总纲含画质来源关键词("粉丝手机录像、雨夜高 ISO 噪点、握持不稳微抖")
- [x] 时序角色显式(首帧 0-1s 锁定)
- [x] 时长 = 推算值 6s(非默认 15)
- [x] 群演微动声明
- [x] 现场音贯穿声明
---
6. 设计意图(v2)
- 前 2 秒生死线:原图本身高密度信息(女孩+密集手机阵+雨丝+追光氛围)+ "BGM 已在响"避免死亡开场
- 核心 hook:1-4 秒手机屏幕多米诺式点亮(视觉奇观)
- 画质真实感:非电影级声明 + 噪点 + 鱼眼畸变直接对应"图来自夜场粉丝拍"
- 时序逻辑:图作首帧让原图本身成为起点,后续手机海点亮在原图基础上演化
- 二刷钩子:手机海光点矩阵作为"封面级镜头"+ 远处歌手剪影作为隐藏锚点
- 传播预期:音乐节文化+特定艺人粉丝+"那一夜"系列怀旧向
---
7. v2 出片效果反馈(主理人 2026-05-13 早上反馈)
主理人原话:
演唱会的不对啊,为什么镜头要往远拉呢?你就拍那个女生,有演唱会的氛围,就行了啊,观众都不动的吗?
7.1 出戏点/翻车点
| 时间段 | 问题 | 严重度 |
|---|---|---|
| 4-5.5s | 镜头 Slow Crane Up 上升脱离主角 | ❌ 严重 |
| 全程 | 观众不动(v2 已有微动声明但模型没执行) | ❌ 严重 |
| 5.5-6s | 镜头到达最高点拉远成大场景 | ❌ 偏离用户期待 |
7.2 v2 四原则验证
| 原则 | 通过/部分/失败 | 具体表现 |
|---|---|---|
| 1. 画质即风格 | 部分 | 画质大致到位但群演微动指令未被模型执行 |
| 2. 时序角色显式 | 通过 | 首帧锁定正确 |
| 3. 物理时间常数 | 不适用 | 无情绪反应 |
| 4. 时长服从内容 | 通过 | 6s 节奏合理 |
7.3 反馈背后的真实诉求(v3 必须满足)
1. 删掉镜头大幅运动——不要 Slow Crane Up、不要拉远、就锁定主角 2. 保留演唱会氛围(手机海点亮、追光、雨丝)但作为环境而不是主体 3. 观众必须有可见的微动(不只是声明,要在每段描述里具体写动作)
---
8. v3 改进方向 + 新版 Prompt
8.1 核心改造
| 维度 | v2 | v3 |
|---|---|---|
| 运镜 | Slow Crane Up 上升脱离主角 | Very Slow Push In 极缓慢推进,全程锁定主角 |
| 手机海 | 作为镜头主体(4-5.5s 全景展开) | 作为环境氛围(在主角周围演化) |
| 主角 | 0-4s 锁定后被镜头抛弃 | 全程在画面中心,眼神/嘴唇/肩膀有微动 |
| 群演微动 | 单句声明 | 在每段描述里具体写动作(左侧轻摇晃/右侧调整手机/后方转头交流) |
8.2 v3 Prompt(≤ 2000 字符)
6秒夜雨音乐节前排粉丝手机偷拍录像质感,9:16竖屏,@图片1为0-1秒首帧锁定。
画质:粉丝业余手机偷拍录像,雨夜高ISO数码噪点全程明显、弱光下追光对比硬、信号偶尔丢帧、摄像头自动曝光起伏、握持微抖、镜头前隐约雨水痕迹、轻微广角畸变。非电影级非Cinematic非4K锐利。现场音贯穿全片不可寂静:歌手歌声与伴奏副歌推进(节奏清晰歌词模糊)、密集人群合唱欢呼回声、雨打雨衣塑料摩擦声、远处人群手机外放微弱混响、风声。
0-1秒:@图片1为静态首帧(前排栏杆中景平视锁定女孩),长发女孩注视舞台方向表情专注嘴唇微张姿态锁定原图,她完全不知道镜头在拍她沉浸在演唱会氛围中。身边雨衣观众群保持原构图,前景5+部手机持续举起拍摄但未亮屏。细密雨丝从画面顶部飘落。BGM歌手歌声已在响。
1-5秒:镜头Very Slow Push In极缓慢推进(4秒内从中景缓慢推到中近景仅放大约15%),全程单一机位锁定女孩不可切换不可拉远不可上升不可下降。舞台方向骤然亮起一道冷白追光从画面右上方斜射进来,前景观众的手机屏幕陆续点亮形成手机海作为环境氛围(不是镜头主体)——亮起波浪从画面左侧向右侧推进每0.4秒一波,每块亮起的屏幕都映出舞台同一道追光轮廓。雨丝穿过追光变为清晰银色斜线。
女孩全程保持原图既定的注视舞台姿态——嘴唇偶尔随歌词微动(像在小声跟唱)、眼神保持聚焦舞台方向偶尔微眨、肩膀因BGM节拍极轻微晃动,其余时间姿态不变。她沉浸在演唱会中没有任何对镜头的反应。身边观众必须自然微动:左侧雨衣观众随节拍轻摇晃、右侧观众举起手机拍摄角度微调、后方观众转头与同伴交流、前景举手机的手轻微晃动调整角度。
5-6秒:镜头到达最近位置略停顿(最后1秒推进趋近静止),女孩保持沉浸状态嘴角带极轻微的随歌的痕迹。最后0.3秒画面凝固成一张"夜雨演唱会的安静凝视"静帧。音收束为副歌推向高点+人群合唱回声+雨声渐弱。
光影:舞台冷白追光斜射主光+追光穿过雨丝产生丁达尔效应+手机屏幕集体点亮做次级光源向上反射照亮观众侧脸轮廓+冷蓝夜色底调+雨衣表面散落彩色环境光斑。
风格锁定:非电影级非Cinematic;雨夜潮湿氛围全程贯穿。镜头全程只做极缓慢推进运镜不可切换机位不可拉远不可上升Crane Up不可下降不可切角度,必须始终锁定在女孩的中景四分之三侧视角。女孩全程保持原图既定姿态沉浸看舞台不可对镜头有任何反应不可大幅度移动不可发现自己被拍。手机屏幕亮起时屏幕内容统一为舞台追光轮廓不可出现具体面孔文字。观众群必须自然微动(呼吸/随节拍摇晃/调整手机角度/转头交流)不可静止如石。现场音贯穿全片不可寂静。禁止任何文字字幕、品牌LOGO、水印。字符数:1120(≤ 2000 ✅)
8.3 v3 自检 v2 字段
- [x] 风格总纲含画质来源关键词(升级为"粉丝业余手机偷拍录像",更脏)
- [x] 时序角色显式(首帧 0-1s)
- [x] 时长 = 推算值 6s
- [x] 群演微动声明(v3 加强:在段落内具体写每个位置的群演动作)
- [x] 现场音贯穿声明
- [x] 新增:运镜锁死声明("不可切换不可拉远不可上升 Crane Up 不可下降不可切角度")
- [x] 新增:主角凝视模式声明("不可对镜头有任何反应不可发现自己被拍")
---
9. v2 → v3 改进对照
| v2 问题 | v3 修复 |
|---|---|
| 4-5.5s 镜头上升脱离主角 | 删除 Crane Up,改为全程 Very Slow Push In,主角始终在画面中心 |
| 5.5-6s 拉远成大场景 | 删除最高点定格大场景,改为最近位置停顿做"凝视"静帧 |
| 观众群体不动(单句声明无效) | 在段落内具体写每个位置的群演动作(左侧轻摇晃/右侧调整手机/后方转头/前景手部微动) |
| 主角 4-6s 失去存在感 | 主角全程在画面中心,加微动节拍(嘴唇随歌词/眼神微眨/肩膀晃动) |
---
10. 给主理人的反馈
- 本 case 是否值得保留作为典型 case:是——验证了 v2 在"群体场景+复杂运镜"上的局限性
- 方法论改进建议:
1. "凝视模式"是 v2 缺失的概念:v2 偏向反应弧线+子节拍展开,但有时候用户要的是"主角自然存在被偷拍"的状态。建议 v3 SKILL.md 新增 Hook 模式"凝视模式" 2. 群演微动需要"段内具体写"而非"风格锁定声明":单句"群演必须微动"模型会忽略,必须在每个时间段描述里具体写哪个位置的群演做什么动作 3. 运镜锁死语句必须用否定句穷举:"不可切换不可拉远不可上升不可下降",否则模型会自由发挥
---
报告完成时间:2026-05-13 09:05 报告人:Claude(晚间执行 Agent · 用户工作流为"产 prompt + 主理人手动跑")
---
📌 v3 → v4 → v5 续篇(2026-05-13 晚间)
v3 跑完后主理人继续反馈,v4 修正、v5 最终定型。
11. v3 出片效果反馈
主理人反馈:v3 仍不对——"为什么镜头要往远拉?就拍那个女生,有演唱会的氛围就行"+"观众都不动"
⚠️ 注意:v3 已经删了 Crane Up 改成 Very Slow Push In,但模型仍把"前景观众"渲染得过满(前排观众前面不应该有别人挡视线——v3 漏掉了这个常识约束),主角行为也偏静态。
12. v4 改造(核心:日常常识 + 4 层画质退化)
v4 关键修正: 1. 图作框架参考不卡帧:"参考@图片1的主角外貌服装与场景氛围但不强制卡任何一帧" 2. 删前面观众:"前面只有舞台/栏杆/安保人员的剪影背影,禁止前面出现其他观众挡视线" 3. 4 层画质退化:抖音/小红书平台压缩 + 手机弱光录像 + 雨夜现场瑕疵 + 广角变形 4. 9 个禁用清单:禁用 4K/Cinematic/电影级/稳定器/调色精致/工业渲染/画面锐利/清晰画质 等多重否定 5. 群演具体动作分配:左侧女粉丝双手鼓掌+小声跟唱、右侧粉丝举手机录像+随节拍摇摆、身后粉丝合唱+挥应援棒
13. v4 出片效果反馈
主理人反馈:演唱会氛围对了+前排没观众挡问题解决+画质够脏,但主角太呆滞——不像"全场最投入的那个粉丝"
14. v5 改造(最终定型)
v5 核心修正——主角投入度升级:
把"嘴唇随歌词轻动小声跟唱+小幅度晃动"全部升级为正向夸张 + 反向否定双重锁定:
- ✅ "嘴明显张开跟唱嘴动幅度大能看出是在唱"
- ❌ 反向否定:"不是抿唇小声哼,是真的在唱出声"
- ✅ "头部和身体随 BGM 节拍明显律动"
- ✅ "双手举过头随副歌挥动一两下"
- ✅ "看到舞台某个高潮动作时身体明显前倾+嘴张大做哇的表情+双手在胸前抱拳"
- 风格锁定加粗:"主角全程必须是高度投入的追星状态,不可表情呆滞不可一动不动不可只是站着看舞台不可平静"
新增定位句:"她是这条视频的核心主角是全场所有粉丝里最投入的那个" —— 让模型理解"主角不是被动旁观者"
15. v5 完整 Prompt(最终版)
6秒夜雨音乐节前排粉丝手机现场录像质感,9:16竖屏,参考@图片1的主角外貌服装与场景氛围但不强制卡任何一帧,视频自由演化为日常追星看演唱会高度投入瞬间。
画质:粉丝手机录像后被发到短视频平台二次压缩的双重画质退化:①短视频平台压缩artifacts——抖音/小红书低码率压缩感全程明显、画面细节磨平、暗部色块明显、彩色色噪、压缩边缘抖动;②手机弱光录像瑕疵——夜场极弱光下感光元件高ISO粗粒噪点、对比度被推高、暗部细节糊成色块;③雨夜现场瑕疵——镜头前隐约雨水痕迹/水雾、握持因兴奋随节拍抖动、自动曝光在追光突变时瞬抖一次画质下降0.3秒;④广角变形——手机广角畸变、画面边缘有色散。禁用4K高清禁用Cinematic禁用电影级禁用稳定器质感禁用调色精致禁用工业渲染禁用画面锐利禁用清晰画质。
现场音贯穿全片不可任何段落寂静:歌手歌声与伴奏副歌推进(节奏清晰歌词模糊)、密集人群合唱欢呼回声远比歌声更兴奋、雨打雨衣塑料摩擦声、风声、近处粉丝小声跟唱+激动呐喊、远处观众挥旗起哄。
主角:参考@图片1的女生外貌(长发、白色抹胸+米色雨衣半披、Festival通行腕带)和注视舞台的姿态,站在最前排栏杆位手扶栏杆看演出。她是这条视频的核心主角是全场所有粉丝里最投入的那个。
环境:演唱会前排栏杆位现场,前面只有舞台/栏杆/安保人员的剪影背影(**禁止前面出现其他观众挡视线**),主角身边和身后是密集的雨衣观众群(不是前面)。舞台远端有冷白追光斜射穿过雨幕。
0-6秒:镜头单一Very Slow Push In极缓慢推进(6秒内从中景缓慢推到中近景仅放大约15%),全程单一机位锁定主角不可切换不可拉远不可上升Crane Up不可下降不可切角度。镜头随兴奋节拍微抖。
主角必须是高度投入的追星状态(6秒内必须明显发生3-4个动作不可呆滞不可只是站着):
- **嘴明显张开跟唱歌词嘴动幅度大能看出是在唱**(不是抿唇小声哼,是真的在唱出声)
- 头部和身体随BGM节拍明显律动+随音乐摆动+随节拍点头
- 一次双手举过头随副歌挥动一两下
- 一次抬手把湿头发撩到耳后接着继续投入跟唱
- 看到舞台某个高潮动作时身体明显前倾+嘴张大做哇的表情+双手在胸前抱拳
- 一次举起手机录一段然后放下(继续跟唱不停)
环境同步演化:身边粉丝具体动作分配——左侧雨衣女粉丝双手举过头随节拍鼓掌+小声跟唱、右侧粉丝举起手机录像角度微调+随节拍摇摆、身后一群粉丝随副歌起立合唱+挥动应援棒+激动呐喊。舞台追光在第2-3秒之间从画面右上方斜射进来,雨丝穿过追光形成银色斜线,舞台远端歌手只是模糊白衣轮廓伸手向天。
光影:舞台冷白追光斜射主光+追光穿过雨丝丁达尔效应+冷蓝夜色底调+雨衣表面散落彩色环境光斑+主角面部被追光勾边轮廓光。
风格锁定:非电影级非Cinematic;雨夜潮湿氛围全程贯穿。镜头全程只做极缓慢推进运镜不可切换机位不可拉远不可上升不可下降不可切角度。**主角全程必须是高度投入的追星状态——必须明显跟唱嘴动幅度大、必须随节拍明显律动、必须有3-4个具体小动作分布**,不可表情呆滞不可一动不动不可只是站着看舞台不可平静。主角站在最前排前面禁止出现其他观众挡视线只允许出现舞台/栏杆/安保剪影。观众群必须自然兴奋微动并具体执行上述动作分配不可静止如石不可平静。画质必须呈现短视频平台压缩感和手机弱光录像感不可呈现4K锐利画质不可呈现电影级稳定画质。现场音贯穿全片不可任何段落寂静。禁止任何文字字幕、品牌LOGO、水印。字符数:1456(≤ 2000 ✅)
16. 最终验证状态
✅ v5 跑完通过验证——主理人反馈"可以了,整体没有其他问题了"
17. v2 → v3 → v4 → v5 完整迭代追踪
| 版本 | 关键改动 | 主理人反馈 |
|---|---|---|
| v2 | 反应模式+Crane Up 上升+群演单句声明 | 镜头不应往远拉/观众都不动/就拍那个女生 |
| v3 | 凝视模式 1.0:删 Crane Up 改 Very Slow Push In+主角姿态锁定 | (未单独跑 v3,直接进 v4) |
| v4 | 凝视 2.0:图作框架参考不卡帧+4 层画质退化+9 个禁用清单+前面禁止观众+群演具体动作 | 氛围对了+前排没观众挡解决+画质够脏,但主角呆滞 |
| v5 | 主角投入度升级:正向夸张+反向否定双重锁定 | ✅ 通过 |
Case-02:商 K 包厢闺蜜打闹 · 路径 C v2 验证(已主动放弃)
注意:本 case 的工作流是「Agent 产出 prompt + 主理人手动在 Seedance 平台跑」,非 CLI 自动化。CLI 字段省略。
---
0. ⚠️ 状态:主理人已放弃
主理人 2026-05-13 早上反馈:"商 K 的放弃了"
放弃原因(推测):
- 商 K 场景本身合规风险偏高(夜场+紧身着装+多人打闹),即使在合规边界内表达,post-TNS 拦截率仍较高
- 主理人可能在跑 v2 时直接被平台拦截或效果不达预期且评估投入产出比不值
- 用户没有继续给出"想怎么改"的方向,是直接放弃路径而非要求 v3
因此本 case 不出 v3 改进版本。保留 v2 prompt 与设计记录作为"高合规风险场景的踩坑参考"。
---
1. 基础信息
- Case 编号:02
- 简称:商 K 包厢闺蜜打闹(朋友扑搂 × 笑得更失控)
- 图片来源:用户提供(CodeX 内 GPT Image 生成)
- 图片尺寸:9:16 竖版
- 执行日期:2026-05-12(v2 产出后主理人决定放弃)
- 迭代版本:v2(已放弃,无 v3)
---
2. 第 1 轮:读图分析(v2 字段必填)
| 字段 | 内容 |
|---|---|
| 主体 | 包厢内站立的年轻女孩,黑色短款拉链开衫+黑色短裤+网纹过膝袜+黑色短靴+黑色手表带,举手机自拍张大嘴灿烂大笑 |
| 当前画面氛围 | 商 K 包厢典型环境(皮质沙发+狼藉桌面+冰桶+绿色和品红霓虹),夜场后半段松弛欢乐 |
| 最有戏的元素 | 大笑+举手机+左下朋友的手已经在动作中(已有的物理预告) |
| 画质来源判定(v2) | 手机闪光夜场自拍(高位俯视自拍角度、霓虹强对比色温、夜场高 ISO 噪点) |
| 对应画质策略(v2) | 手机自拍录像质感、霓虹下传感器轻微过曝、夜场高 ISO 数码噪点、轻微鱼眼畸变、自动白平衡漂移、握持微抖 |
| 比例诊断 | 9:16 → 9:16(无需扩图) |
| 建议时长(v2) | 8 秒 |
| 推算理由(v2) | 小剧情=朋友扑搂动作 1s + 笑的子节拍 ≥2.5s + 延展 2s + 收束 1s;硬拉 15s 必中段编造导致衔接崩 |
| 平台合规风险(v2) | 中度 —— 短款上衣露腹+黑色短裤+网袜在夜场环境下属常见装扮但偏敏感;动作放大时若镜头角度低/身体局部特写可能触发 post-TNS;有 20-30% 拦截风险 |
| 风险检查 | 真人脸: AI 生成 ✅ / 文字水印: 无 ✅ / 清晰度: ✅ / 合规:中度 |
---
3. 时序角色询问
主理人的回复:首 最终采用:首帧(0-1.5s 严格锁定 @图片1 原构图) 理由:这张图最大特点是"动作正在发生中"——左下朋友的手已经伸出来、她已经在笑。作首帧让视频从原图状态自然延续到"打闹爆发",叙事最顺
---
4. Hook 候选与选定
候选 A:朋友扑搂 × 笑得更失控 ★★★★★
- 演化轨迹:0-1.5s 首帧锁定+BGM 已响 → 1.5-2.5s 朋友扑搂触发 → 2.5-5s 笑的三拍子节拍展开(眼角先松 0.8s/嘴角扬起 0.7s/露齿出声爆笑 1s) → 5-7s 延展+背景朋友走过 → 7-8s 朋友松手+女孩身体回正收束
- 传播因子:朋友突然扑过来=夜场聚会标志性瞬间+笑按子节拍真实展开+BGM 从 0 秒就在的连贯感
- 适用度:★★★★★
候选 B:朋友扑搂 × 反扑回去 ★★★★
- 演化轨迹:0-1.5s 首帧 → 1.5-2.5s 扑搂 → 2.5-4.5s 笑前半 → 4.5-6s 她反扑拍朋友肩膀 → 6-8s 双向打闹
- 传播因子:双向互动更平衡,姐妹感强
- 适用度:★★★★(双向动作崩面风险高)
主理人选定:A
---
5. 第 2 轮:v2 完整 Seedance 提示词
8秒商K包厢姐妹自拍打闹手机录像质感,9:16竖屏,@图片1为0-1.5秒首帧锁定。
画质:手机自拍录像,广角轻微鱼眼畸变、高ISO数码噪点、霓虹下传感器轻微过曝、白平衡漂移、握持微抖。非电影级非Cinematic。BGM电子舞曲低音鼓点从第0秒稳定贯穿全片,不可中断不可渐入不可中段才出现。环境音:朋友尖叫笑声、冰块碰撞、远处过道音乐回响。绿色和品红霓虹交替游走于墙面地面桌面。
0-1.5秒:@图片1为静态首帧(中近景略仰拍四分之三侧),女孩举手机自拍大笑姿态锁定原图,左下朋友手臂已在画面持续向腰侧伸近做物理预告,霓虹从绿过渡到品红,冰桶反光闪烁,女孩因BGM节拍身体极轻微节律摇晃。
1.5-2.5秒:朋友扑搂触发,左下朋友从腰侧搂住女孩戏谑打闹,背后另一女孩从右上探手扯她衣角协同捣蛋,女孩笑得更夸张身体被搂得右倾30度脚步不挪,右手本能向上举高。朋友动作严格限定搂腰拍肩不可过激。冰桶冰被带动跳起落桌发清脆碰撞声。
2.5-3.3秒:笑第一拍·眼角先松(0.8秒):眼角松开带笑意、呼吸因笑变急。
3.3-4秒:笑第二拍·嘴角扬起(0.7秒):嘴角咧开牙齿露出苹果肌推起、肩膀小幅抖动。
4-5秒:笑第三拍·露齿出声爆笑(1秒):露齿笑出声持续,肩膀中幅度抖动、头微后仰又收回,身体保持右倾30度。
5-7秒:延展(微Pull Back),背景深处另一朋友手举空酒杯走过画面边缘不靠近主体(仅作群演)。女孩从爆笑过渡到笑到岔气余韵,搂她的朋友松手退后半步分离,霓虹切纯品红。
7-8秒:收束,朋友完全松开退后女孩身体回正,笑未收住已过渡到带喘气余韵、左手抹笑出的眼泪、肩膀继续轻抖,最后0.3秒定格。音收束为哄笑余音+BGM鼓点继续不断。
光影:顶部暖黄主光+绿品红霓虹交替+冰桶散点光斑打下颌+酒水反光不规则光晕+霓虹下传感器轻微过曝。
风格锁定:非电影级非Cinematic;环境元素严格按原图服装按首帧锁定;多人物互动幅度严格搂腰拍肩不可摔倒倒地推出画面,背景路过朋友仅作群演;全程高位俯视手机自拍视角不可切低角度仰拍不可身体局部特写;BGM电子鼓点贯穿全片不可寂静不可渐入;笑必须在2.5秒内分三拍渐进完成不可瞬间跳变。禁止任何文字字幕、LOGO、酒标、水印。字符数:935(≤ 2000 ✅)
自检 v2 字段:
- [x] 风格总纲含画质来源关键词("手机自拍录像、广角轻微鱼眼畸变、霓虹下传感器轻微过曝")
- [x] 现实类反应按子节拍展开(笑三拍:眼角先松 0.8s + 嘴角扬起 0.7s + 露齿出声爆笑 1s = 2.5s)
- [x] 时序角色显式(首帧 0-1.5s)
- [x] 时长 = 推算值 8s(非默认 15)
- [x] BGM 贯穿声明(针对 v1 反馈"前半段没 BGM 第 10 秒才出现")
- [x] 合规规避声明(高位俯视视角锁定、动作幅度限定搂腰拍肩范围)
---
6. 设计意图(v2)
- 前 2 秒生死线:原图本身高密度(大笑女孩+举手机+左下朋友的手+霓虹氛围+桌面狼藉)+ "BGM 已经在响"
- 核心 hook:1.5-2.5s 朋友扑搂触发 + 2.5-5s 笑的三拍物理时间常数展开
- 画质真实感:手机自拍录像 + 噪点 + 鱼眼畸变直接对应"图来自夜场手机自拍"
- BGM 贯穿全片:风格总纲就写"从第 0 秒稳定贯穿全片不可中断不可渐入不可中段才出现",三重声明
- 合规规避:高位俯视视角锁定+动作幅度限定搂腰拍肩+不可身体局部特写
- 时长服从内容:8s(非 15s)
---
7. v2 出片效果反馈(主理人 2026-05-13 早上反馈)
主理人原话:
商 K 的放弃了
主理人未给出具体出戏点——直接放弃路径而非要求 v3。
7.1 推测的放弃原因
| 可能原因 | 严重度 | 备注 |
|---|---|---|
| 被平台 post-TNS 拦截 | ❓ 待主理人确认 | 中度合规风险已预警 20-30% 拦截率 |
| 出片效果不达预期 | ❓ 待主理人确认 | 多人物打闹动作 + 笑子节拍对 AI 视频是高难度组合 |
| 投入产出比评估不值 | ❓ 推测 | 即使跑出来"姐妹打闹"内容传播性也比球场/演唱会窄 |
| 内容方向调整 | ❓ 推测 | 主理人可能临时不想再做夜场题材 |
7.2 v2 四原则验证(无法判定)
由于主理人未提供具体出片描述,v2 四原则在本 case 上的验证结果留空。
---
8. 无 v3 改进
主理人主动放弃本 case,不出 v3 版本。
---
9. 给主理人的反馈
- 本 case 是否值得保留作为典型 case:
- 作为"高合规风险场景的踩坑参考"保留 —— v2 prompt 中关于"中度合规风险的防御性声明模板"(视角锁定+接触范围+服装锁定+不可身体局部特写)值得作为以后类似场景的参考
- 不作为内容方向的典型 case —— 主理人已主动放弃
- 方法论改进建议:
1. 第 1 轮合规风险预警必须更前置:v2 当前的合规风险评估在第 1 轮已经做了"中度警告",但没有让用户在投入产出比角度做选择。建议 v3 SKILL.md 在合规风险=中度时,主动询问用户:"这条 case 有 20-30% 拦截风险(约 X 积分浪费),你确定要跑吗?还是想换个相似但合规更低的场景?" 2. "主动放弃"应作为合法的 case 收尾状态:当前 SKILL.md 假设用户都会跑完每个 case,但实际上"评估后放弃"也是正确选择。case 报告应支持"已放弃"状态字段
---
报告完成时间:2026-05-13 09:08 报告人:Claude(晚间执行 Agent · 用户工作流为"产 prompt + 主理人手动跑")
Case-03:漫展幕后试衣间合影 · 路径 C v2→v3 验证
注意:本 case 的工作流是「Agent 产出 prompt + 主理人手动在 Seedance 平台跑」,非 CLI 自动化。CLI 字段省略。
---
1. 基础信息
- Case 编号:03
- 简称:漫展幕后试衣间 6 人 coser 合影自拍
- 图片来源:用户提供(CodeX 内 GPT Image 生成)
- 图片尺寸:9:16 竖版
- 执行日期:2026-05-12 ~ 2026-05-13
- 迭代版本:v2(已跑,反馈"好多了但可以更好玩")→ v3(待跑)
---
2. 第 1 轮:读图分析(v2 字段必填)
| 字段 | 内容 |
|---|---|
| 主体 | 6 个人挤在试衣间镜子前合影自拍:中央 staff 男生(黑 T+工作证)+左 1 黑机甲女孩+左 2 金发双马尾紧身机甲(低头闭眼整理装备)+右 1 红黑和风武士(张大嘴贴男生耳边)+右 2 黑色低马尾皮甲+前景蹲位白发狐耳少女(蹲着系靴子绑带) |
| 当前画面氛围 | 漫展幕后试衣间真实抓拍——白色暖顶光过曝+地面散落行李箱奶茶杯化妆袋湿巾,被一个朋友/staff 喊"快来合一下"的真实瞬间 |
| 最有戏的元素 | 这张图本身就是"混乱合影瞬间"的凝结——6 人 6 种状态各自做自己的事但被同一个手机框住 |
| 画质来源判定(v2) | 手机闪光自拍录像(中央男生举手机的高位自拍角度、闪光灯打亮的硬光、画面中心区曝光偏高、镜子反射形成的第二层曝光) |
| 对应画质策略(v2) | 手机自拍录像质感、闪光灯硬光与轻微过曝、高 ISO 数码噪点、镜子反射次级光源、广角自拍轻微鱼眼畸变、握持微抖 |
| 比例诊断 | 9:16 → 9:16(无需扩图) |
| 建议时长(v2) | 10 秒 |
| 推算理由(v2) | 小剧情(多动作+一个反应)——前 1 秒大家陆续凑过来 → 合影定格 → 后 1 秒散开;按 v2 原则 4 小剧情 10-12s。10s 刚好。硬拉 15s 必中段有空白衔接奇怪(v1 反馈主因) |
| 平台合规风险(v2) | 中度 —— cosplay 服装本身偏紧身/露肤(金发腰部/狐耳腿部/皮甲腹部),属于动漫展常见合规 cosplay 服装范畴但偏敏感;多人合影若镜头切到低角度/身体特写有风险;有 20-30% 拦截风险 |
| 风险检查 | 真人脸: AI 生成 ✅ / 文字: 工作证模糊不可读 / 清晰度: ✅ / 合规:中度 |
---
3. 时序角色询问
主理人的回复:中 最终采用:中间关键帧(K=5s,第 5 秒画面演化抵达 @图片1 状态) 理由:原图最大价值是"被凝固的混乱瞬间"。作首帧让视频从合影状态直接散开,没有前面的"合影是怎么发生的"铺垫,正是 v1 反馈"为了图前后硬扩没有故事性"的根源。作中间帧让 0-5s 的"陆续汇聚"成为核心 hook——每个人的入场方向和动作都从原图终态反向推导出来
---
4. Hook 候选与选定
候选 A:时间前后展开 × 合影瞬间的"是怎么发生的" ★★★★★(首推/已选)
- 演化轨迹:0-1.5s 试衣间道具桌特写+对话碎片 → 1.5-4.5s 镜头拉远 staff 男生喊合一下+6 人陆续汇聚 → 4.5-5.5s 第 5 秒画面演化抵达 @图片1 状态+手机咔嚓闪光定格 → 5.5-8s 散开继续准备登场 → 8-10s 收束推到男生看手机合影笑容
- 传播因子:合影是怎么发生的=社交媒体经典叙事+每个角色独立小动作+漫展/cosplay 圈层共鸣
- 适用度:★★★★★
候选 B:群像独立小故事 × 同时进行 ★★★★
- 演化轨迹:0-2s 原图静态+6 条独立动作线启动 → 3-7s 每个人演自己的小动作 → 8-12s 切到视频自拍模式+所有人对镜头做招牌 pose → 13-15s 定格
- 传播因子:群像里每个角色都有戏+从"私下混乱"到"对镜头专业模式"的反差
- 适用度:★★★★(6 条独立动作线在 9:16 小画面里同时演化对模型崩盘率高)
主理人选定:A
---
5. 第 2 轮:v2 完整 Seedance 提示词
10秒漫展幕后试衣间6人coser合影自拍手机闪光录像质感,9:16竖屏,@图片1为第5秒画面演化抵达的中间关键帧。
画质:中央staff男生举手机自拍视角,广角轻微鱼眼畸变、闪光灯直打造成硬光与轻微过曝、夜场室内高ISO数码噪点、镜子反射做次级光源、握持微抖。非电影级非Cinematic非4K锐利。环境音贯穿全片不可寂静:几个女孩各自的对话碎片语义模糊("我假发歪了""帮我系一下""鞋带松了"等)、行李箱轮子滚动、衣甲金属配饰碰撞清脆声、远处漫展场馆广播模糊回响、门外人来人往脚步声、皮革摩擦声。试衣间白色暖顶光过曝贯穿全片。
0-1.5秒:试衣间道具桌局部开场(近景特写平视)。桌面散落物——仿真武士刀架在椅背、半喝奶茶杯压着假发、化妆盒打开口红散粉、湿巾扯出半张、几支假眼睫毛贴桌沿。画面外传来女孩们的对话碎片+皮革摩擦声,节奏慵懒。
1.5-4.5秒:镜头Smooth Pull Back缓慢拉远到中景平视,画面中央staff男生(短发黑T挂工作证)举起手机喊"快快快合一下",几个coser从画面四周陆续朝镜子方向汇聚——黑机甲长发女孩从左侧步入、金发双马尾紧身机甲女孩刚整理完装备从背景转身向前、红黑和风武士女孩从右后方贴过来准备搞事、黑色低马尾皮甲女孩笑着从右侧挤进来、白发狐耳少女已经在前景蹲位低头系靴子绑带不起身作构图锚点。所有人朝镜子方向汇聚但保持各自动作惯性非整齐排列。环境音叠加多人脚步+衣甲皮革摩擦+和风女孩拉长的"哎~嘿嘿嘿"。
4.5-5.5秒:第5秒画面演化抵达@图片1完全一致状态(中景四分之三侧平视),6人全部就位保持原图标志性动作——中央男生举手机表情无奈、左1黑机甲冷峻构图最稳、左2金发低头闭眼整理装备、右1红黑和风张大嘴贴男生耳边吓他、右2皮甲笑嘻嘻靠向男生、前景蹲位狐耳埋头系绑带。第5秒手机咔嚓一声闪光按下快门画面短暂泛白闪0.3秒,所有人在闪光那一瞬间完全静止形成定格。
5.5-8秒:闪光过后场面散开(机位保持),和风女孩笑着捂嘴身体从男生耳边收回、皮甲女孩抬手轻拍男生肩膀(动作幅度严格搭肩范围不亲密)、黑机甲转身去拿挂在衣架上的剑、狐耳少女在前景蹲位站起来抖了抖白色狐耳整理护腕、金发女孩举起自己的手机低头回看刚拍的合影。所有人各自笑着继续准备登场。环境音叠加众人哄笑余音+衣甲动作声+远处广播。
8-10秒:收束(微Push In推到中央男生),他低头看自己手机里那张刚拍的合影露出无奈又欢乐的笑容(嘴角从抿紧到轻微上扬2秒渐进)。最后0.5秒画面定格在手机屏幕反射出他脸部表情的极近景特写。环境音收束为众人哄笑余音渐弱+远处广播模糊回响+试衣间门外脚步声。
光影:试衣间顶部白色暖灯过曝主光+镜子反射形成次级散光向上勾勒人物面颊和服装金属配饰高光+地面行李箱表面反射点状光斑+暖白底色与黑色机甲红色和风金色金属配饰的色彩对比+人物服装在暖光下产生柔和高光+第5秒闪光灯硬光瞬间过曝。
风格锁定:漫展幕后试衣间cosplay真实抓拍记录质感,非电影级非Cinematic。暖白过曝+多色服装对比色调贯穿。地面散落道具(行李箱奶茶杯化妆袋湿巾等)严格保持原图布局不可清理不可变化。6人服装造型严格按原图锁定不可变化。多人物互动幅度严格控制在搭肩/手举画面边缘范围不可搂腰不可身体紧贴不可亲密接触不可摔倒推出画面等过激动作。全程保持中景四分之三侧平视视角不可切低角度仰拍不可身体局部特写。前景蹲位狐耳少女全程蹲着系绑带不起身作构图锚点(仅5.5-8秒允许站起动作)。中央男生工作证只显示为模糊色块不出现具体文字。环境音贯穿全片不可任何段落寂静。禁止任何文字字幕、品牌LOGO、IP角色姓名标识、水印。字符数:1537(≤ 2000 ✅)
自检 v2 字段:
- [x] 风格总纲含画质来源关键词("手机闪光自拍录像、广角轻微鱼眼畸变、夜场高 ISO 数码噪点")
- [x] 图作为非首帧时显式写了时间锚点("第 5 秒画面演化抵达 @图片1 状态")
- [x] 时序角色显式(中间关键帧 K=5s)
- [x] 时长 = 推算值 10s(非默认 15)
- [x] 合规规避声明(视角锁定+接触范围+服装锁定)
- [x] 文字/符号不可控声明(工作证模糊色块)
- [x] 构图锚点(狐耳少女蹲位不起身)
- [x] 环境音贯穿声明
---
6. 设计意图(v2)
- 前 2 秒生死线:避开"6 个人开场容易让 AI 崩"的陷阱——第 0-1.5s 不拍人只拍道具桌特写+对话碎片
- 核心 hook:1.5-4.5s 人物从画面四周汇聚——把"合影"从结果还原为过程
- 闪光定格的仪式锚点:第 5 秒手机咔嚓+泛白闪 0.3 秒给观众明确"这就是合影那一刻"
- 散开的设计:5.5-8s 每个人做"自己角色应该做的动作"(和风自夸吓到他了/黑机甲去拿剑/狐耳整理护腕/金发回看照片)
- 首尾构图闭环:第 8-10s 收束推到男生看手机合影笑容
- 画质真实感:手机闪光自拍 + 噪点 + 镜子反射做次级光源
- 6 人复杂场景的稳定性保护:狐耳少女作构图锚点+汇聚→定格→散开清晰三段式+背景不跨画面移动
- 合规规避:搭肩/手举画面边缘范围+不可低角度仰拍+不可身体局部特写
---
7. v2 出片效果反馈(主理人 2026-05-13 早上反馈)
主理人原话:
化妆间这个也好多了,但同样也可以再好玩些
7.1 出戏点/翻车点
主理人评价"好多了"——v2 相比 v1(昨晚那版 15s 注水版)有明显改善,但还可以加趣味性。
7.2 v2 四原则验证
| 原则 | 通过/部分/失败 | 具体表现 |
|---|---|---|
| 1. 画质即风格 | 通过 | 手机闪光自拍质感到位 |
| 2. 时序角色显式 | 通过 | 中间关键帧 K=5s 让"合影是怎么发生的"叙事成立 |
| 3. 物理时间常数 | 通过 | 男生 8-10s 嘴角 2 秒渐进上扬不瞬间 |
| 4. 时长服从内容 | 通过 | 10s 紧凑无注水(v1 15s 注水问题已解决) |
7.3 反馈背后的真实诉求(v3 必须满足)
1. 保留 v2 现有质感与结构(不动) 2. 加趣味性——具体形式由 Agent 提案
---
8. v3 改进方向 + 新版 Prompt
8.1 核心改造(保留质感加好玩)
| 改造点 | 具体内容 |
|---|---|
| 加 4.5s 前的"小戏" | staff 男生喊"3-2-1"准备按快门时,蹲位狐耳少女突然抬头喊"等等!"打断(但还是没起身),全员被打断转头看她,狐耳少女一秒后又低下头继续系绑带,男生顺势在那一瞬间按下快门——正好把"被打断的瞬间"拍下来了。这就是 @图片1 那个"6 人各做各的乱糟糟瞬间"为什么是这样 |
| 加 5.5-8s 的爆笑反应 | 闪光过后所有人爆笑炸开"刚才那张肯定拍废了哈哈",给"为什么大家在散开后还要笑"一个明确理由 |
| 加 8-10s 的"图中图"反转 | 男生看完合影后画面切到他手机屏幕内的视角——屏幕里就是 @图片1 那张照片,给整段视频一个圆满闭环:暗示这就是被发到群里的漫展赶场合影 |
| 狐耳少女从"完全沉默锚点"→"打破节奏的关键角色" | v2 中狐耳少女只是构图锚点,v3 让她成为整段视频最有戏的角色(她的"等等"决定了这张合影为什么是这样) |
8.2 v3 Prompt(≤ 2000 字符)
10秒漫展幕后试衣间6人coser合影自拍手机闪光录像质感,9:16竖屏,@图片1为第5秒画面演化抵达的中间关键帧。
画质:中央staff男生举手机自拍视角,广角轻微鱼眼畸变、闪光灯直打造成硬光与轻微过曝、夜场室内高ISO数码噪点、镜子反射做次级光源、握持微抖。非电影级非Cinematic非4K锐利。环境音贯穿全片不可寂静:几个女孩各自的对话碎片语义模糊("我假发歪了""帮我系一下""鞋带松了"等)、行李箱轮子滚动、衣甲金属配饰碰撞清脆声、远处漫展场馆广播模糊回响、门外人来人往脚步声、皮革摩擦声。试衣间白色暖顶光过曝贯穿全片。
0-1.5秒:试衣间道具桌局部开场(近景特写平视)。桌面散落物——仿真武士刀架椅背、半喝奶茶杯压着假发、化妆盒打开口红散粉、湿巾扯出半张、几支假眼睫毛贴桌沿。画面外传来女孩们的对话碎片+皮革摩擦声,节奏慵懒。
1.5-3.5秒:镜头Smooth Pull Back缓慢拉远到中景平视,画面中央staff男生(短发黑T挂工作证)举起手机喊"快快快合一下时间到了",几个coser从画面四周陆续朝镜子方向汇聚——黑机甲长发女孩从左侧步入、金发双马尾紧身机甲女孩刚整理完装备从背景转身向前、红黑和风武士女孩从右后方贴过来准备搞事、黑色低马尾皮甲女孩笑着从右侧挤进来、白发狐耳少女已在前景蹲位低头系靴子绑带作构图锚点。环境音叠加多人脚步+衣甲皮革摩擦+和风女孩拉长的"哎~嘿嘿嘿"。
3.5-4.5秒:所有人陆续就位,staff男生举手机倒数"三二一——"准备按快门,前景蹲位狐耳少女突然抬头喊一声"等等还没系好!"(但身体仍蹲着不起身),全员瞬间转头看她——和风女孩张嘴笑、皮甲女孩眼睛看向前景、金发女孩低头闭眼整理装备的动作被打断微抬头、黑机甲转头瞥一眼。狐耳少女发出声音后约1秒重新低下头继续系绑带(恢复锚点姿态)。
4.5-5.5秒:第5秒男生顺势在"被打断的瞬间"按下快门——画面演化抵达@图片1完全一致状态:6人全部就位但每个人的动作恰好停在被刚才打断的姿态——中央男生举手机表情无奈带笑、左1黑机甲冷峻、左2金发低头闭眼整理装备、右1红黑和风张大嘴贴男生耳边(其实是刚才转头反应的余势)、右2皮甲笑嘻嘻靠向男生、前景蹲位狐耳埋头系绑带。第5秒手机咔嚓一声闪光按下快门画面短暂泛白闪0.3秒,所有人在闪光那一瞬间完全静止。
5.5-8秒:闪光过后所有人爆笑炸开"刚才那张肯定拍废了哈哈",和风女孩笑着捂嘴身体从男生耳边收回、皮甲女孩抬手轻拍男生肩膀(动作严格搭肩范围)、黑机甲转身去拿挂在衣架上的剑、狐耳少女在前景蹲位站起来抖了抖白色狐耳整理护腕、金发女孩举起自己的手机低头回看刚拍的合影笑出声。环境音叠加众人哄笑余音+衣甲动作声+远处广播。
8-10秒:收束(微Push In推到中央男生),他低头看自己手机里那张刚拍的合影露出无奈又欢乐的笑容,画面在最后2秒切到他手机屏幕内的视角——屏幕里就是@图片1那张照片做"图中图"反转,暗示这就是被发到群里的漫展赶场合影。最后0.5秒画面定格在手机屏幕里那张照片上。环境音收束为众人哄笑余音渐弱+远处广播。
光影:试衣间顶部白色暖灯过曝主光+镜子反射形成次级散光向上勾勒人物面颊和服装金属配饰高光+地面行李箱表面反射点状光斑+暖白底色与黑色机甲红色和风金色金属配饰的色彩对比+第5秒闪光灯硬光瞬间过曝。
风格锁定:漫展幕后试衣间cosplay真实抓拍记录质感,非电影级非Cinematic。暖白过曝+多色服装对比色调贯穿。地面散落道具严格保持原图布局不可清理不可变化。6人服装造型严格按原图锁定不可变化。多人物互动幅度严格控制在搭肩/手举画面边缘范围不可搂腰不可身体紧贴不可亲密接触不可摔倒推出画面。全程保持中景四分之三侧平视视角不可切低角度仰拍不可身体局部特写。前景蹲位狐耳少女全程蹲着系绑带仅5.5-8秒允许站起动作其余时间作构图锚点。中央男生工作证只显示为模糊色块不出现具体文字。环境音贯穿全片不可寂静。禁止任何文字字幕、品牌LOGO、IP角色姓名标识、水印。字符数:1660(≤ 2000 ✅)
8.3 v3 自检 v2 字段
- [x] 所有 v2 字段保留
- [x] 新增:剧情转折点(3.5-4.5s 狐耳少女打断成为"为什么这张合影是这样"的因果解释)
- [x] 新增:爆笑反应理由(5.5-8s 所有人爆笑因为"刚才那张肯定拍废了"——给散开后的笑一个具体动机)
- [x] 新增:图中图反转闭环(8-10s 切到手机屏幕看到 @图片1 自身,整段视频获得"圆满感")
---
9. v2 → v3 改进对照
| v2 | v3 |
|---|---|
| 1.5-4.5s 平铺直叙的"陆续汇聚 + 男生喊合一下" | 3.5-4.5s 加狐耳少女打断的小戏,制造剧情转折点 |
| 4.5-5.5s 平静定格"第 5 秒按快门" | 强调"被打断的瞬间正好被拍下",给原图状态一个因果解释 |
| 5.5-8s 平静散开(无明确情绪动因) | 爆笑炸开+具体台词"刚才那张肯定拍废了",给散开后的反应明确动机 |
| 8-10s 收束在男生看手机笑容 | 加图中图反转——画面切到手机屏幕内的 @图片1,整段获得闭环 |
---
10. 给主理人的反馈
- 本 case 是否值得保留作为典型 case:是 —— 验证了"加趣味性=加剧情转折+加因果解释+加闭环"的方法论
- 方法论改进建议:
1. 趣味性≠加更多动作:v3 没有增加角色数量也没有让角色动作更夸张,而是给现有动作加了因果链条(打断→被拍→爆笑→图中图)。这是"加趣味性"的高级形式 2. 图中图反转作为"中间帧 + 尾帧呼应"的高级用法:当图作中间关键帧时,让结尾再次切回这张图(但作为另一层视觉嵌套),能给整段视频一个完整闭环 3. 构图锚点角色可以"升级"为"剧情打破者":v2 中狐耳少女只是不动的锚点,v3 让她成为"打破节奏的关键角色"——构图锚点角色不一定要全程沉默,可以短暂打破然后立刻恢复锚点状态
---
报告完成时间:2026-05-13 09:12 报告人:Claude(晚间执行 Agent · 用户工作流为"产 prompt + 主理人手动跑")
---
📌 v3 → v4 → v5 续篇(2026-05-13 晚间)
11. v3 出片效果反馈
主理人反馈:v3 仍有问题——"过分固定于参考图,参考图变成里面的某一帧,但参考图本身不是一个很适合刚好拍照的瞬间,所以一定要卡这一帧就感觉前后衔接奇怪"
⚠️ 这个反馈揭示了v2 时序角色机制的根本盲区——把图强制作为某一帧锚点会让叙事被卡帧绑架
12. v4 改造(核心:图降级为氛围参考)
v4 关键转变: 1. 图的角色彻底降级:"参考@图片1的6人外貌服装+试衣间场景氛围但不强制卡任何一帧不需要合影定格" 2. 删除"汇聚→定格→散开"剧情 —— 改为"6 人在化妆间各自准备出场"的日常凝视 3. 4 层画质退化:朋友圈压缩 + 室内闪光自拍 + 握持随意 + 广角变形
13. v4 出片效果反馈
主理人反馈:场景常识对了+不再被卡帧绑架,但互动不够、6 人各自孤岛、太平静、缺合影前打闹的氛围
14. v5 改造(最终定型)
v5 核心修正——加跨人物互动事件:
把"6 人各做各的事"升级为"有一个跨人物的互动事件正在发生":
- staff 男生举起手机说"来快过来合个照发朋友圈"作为视频起点的招呼信号
- 几个女孩陆续从各自位置笑着往 staff 男生方向凑过来准备合影但不需要完全凑齐到位(保持 v4"不卡帧"原则)
- 过程中有自然打闹:和风女孩戏谑贴近 staff 男生张大嘴喊"嘿嘿嘿"+staff 男生身体闪躲、皮甲女孩搭肩、金发被推一下抬头说"等我一下"、狐耳少女抬头喊"等等还有我"
- 风格锁定加粗:"6 人之间必须有跨人物的互动和打闹笑闹氛围不可 6 人各自孤立做事不可气氛平静"
关键设计哲学:要的是"打闹+合影氛围的过程"而不是"凝固在合影那一帧"——保留 v4 的"不卡帧"原则,但加回 v3 的"互动张力"
15. v5 完整 Prompt(最终版)
8秒漫展幕后试衣间6人coser合影前打闹的手机随手记录质感,9:16竖屏,参考@图片1的6人外貌服装+试衣间场景氛围但不强制卡任何一帧不需要合影定格,视频自由演化为日常赶场前被招呼合影的打闹瞬间。
画质:staff手机随手拍朋友圈视频压缩的双重画质退化:①朋友圈压缩artifacts——微信短视频低码率压缩感全程明显、画面细节磨平、暗部色块、彩色色噪、压缩边缘抖动;②室内闪光自拍瑕疵——白色暖顶光过曝、闪光灯偶尔触发硬光瞬间过曝、夜场室内中等ISO粗粒噪点、镜子反射做次级光源造成画面亮度起伏;③握持随意特征——握持随意微抖、构图非完美略歪、镜头偶尔被身边人手肘擦过画面瞬间一抖、自动曝光在闪光与无闪光切换时画质波动;④广角变形——手机广角自拍轻微鱼眼畸变。禁用4K高清禁用Cinematic禁用电影级禁用稳定器质感禁用调色精致禁用工业渲染禁用画面锐利禁用清晰画质。
环境音贯穿全片不可任何段落寂静:staff男生喊话"来快过来合个照发朋友圈"、女孩们的笑声和回应碎片("等一下""我妆还没好""赶紧赶紧"等语义模糊)、行李箱轮子滚动、衣甲金属配饰碰撞清脆声、远处漫展场馆广播模糊回响、门外脚步声、皮革摩擦声、和风女孩拉长的"哎~嘿嘿嘿"的搞怪声。
主角群:参考@图片1的6人外貌服装(中央staff男生黑T挂工作证+左1黑机甲长发女孩+左2金发双马尾紧身机甲+右1红黑和风武士+右2黑色低马尾皮甲+前景蹲位白发狐耳少女)。
环境:试衣间/化妆间,背景大镜子+地面散落行李箱奶茶杯化妆袋湿巾+衣架挂着备用配饰,整体白色暖顶光过曝氛围。
0-8秒:镜头单一Smooth Slow Push In极缓慢推进(8秒内从中景缓慢推到中近景仅放大约15%),全程单一机位无任何切换无任何拉远不可上升下降不可切角度。镜头模拟staff随手举手机的轻微抖动。
跨人物互动事件(视频核心,必须发生):staff男生举着手机说"来快过来合个照"作为视频起点的招呼信号,几个女孩**陆续从各自位置笑着往staff男生方向凑过来准备合影但不需要完全凑齐到位**,过程中有自然打闹动作发生:
- 中央staff男生:手机半举着对着镜子方向,嘴里在说招呼话表情无奈带笑("你们快点啊"),右1和风女孩从他右边贴过来时他略闪了下身
- 左1黑机甲女孩:从镜前位置慢慢走向staff男生方向,一边走一边整理腰侧腰带,表情冷峻配合朋友的招呼
- 左2金发双马尾女孩:低头闭眼整理胸前装备扣件未完成,被身边人推了一下肩膀抬头说"等我一下"
- 右1红黑和风女孩:戏谑性贴近staff男生张大嘴在他耳边喊"嘿嘿嘿"做搞怪表情(参考@图片1的姿态但是动态的过程),staff男生身体略向左闪躲
- 右2黑色低马尾皮甲女孩:从右侧笑着走近抬手轻搭staff男生肩膀(搭肩不搂腰),跟着一起笑
- 前景蹲位白发狐耳少女:全程蹲着系靴子绑带作构图锚点,一次抬头喊"等等还有我"然后继续低头系绑带
环境同步演化:背景镜子中映出他们的反射、地面散落的奶茶杯偶尔被脚步带得微动、衣甲金属配饰随每人动作偶尔碰撞清脆、远处广播持续模糊回响。
光影:试衣间顶部白色暖灯过曝主光+镜子反射形成次级散光向上勾勒人物面颊和金属配饰高光+地面行李箱表面反射点状光斑+暖白底色与黑色机甲红色和风金色金属配饰的色彩对比。
风格锁定:漫展幕后试衣间cosplay赶场前打闹记录质感,非电影级非Cinematic。暖白过曝+多色服装对比色调贯穿。地面散落道具严格保持@图片1氛围参考不可清理。**6人之间必须有跨人物的互动和打闹笑闹氛围不可6人各自孤立做事不可气氛平静**。多人物互动幅度严格控制在搭肩/手举/贴近搞怪范围不可搂腰不可身体紧贴不可亲密接触不可摔倒推出画面。全程保持中景四分之三侧平视视角不可切低角度仰拍不可身体局部特写。前景蹲位狐耳少女全程蹲着系绑带作构图锚点。中央男生工作证只显示为模糊色块不出现具体文字。画质必须呈现朋友圈压缩感和闪光自拍感不可呈现4K锐利画质不可呈现电影级稳定画质。环境音贯穿全片不可寂静必须充满笑声招呼声打闹声。禁止任何文字字幕、品牌LOGO、IP角色姓名标识、水印。字符数:1701(≤ 2000 ✅)
16. 最终验证状态
✅ v5 跑完通过验证——主理人反馈"可以了,整体没有其他问题了"
17. v2 → v3 → v4 → v5 完整迭代追踪
| 版本 | 关键改动 | 主理人反馈 |
|---|---|---|
| v2 | 中间关键帧 K=5s+汇聚定格散开剧情+合规规避 | 好多了(v1 是 15s 注水版),但可以再好玩些 |
| v3 | 加狐耳少女打断小戏+爆笑反应+图中图反转 | 仍过分固定于参考图,参考图变成里面的某一帧 |
| v4 | 图降级为氛围参考+不卡帧+6 人各做各的事 | 场景常识对了,但互动不够+太平静 |
| v5 | 加跨人物互动事件+合影前打闹氛围(保留不卡帧原则) | ✅ 通过 |
Case-04:大学讲课·被专业气场击中 · 路径 C v2→v3 验证
注意:本 case 的工作流是「Agent 产出 prompt + 主理人手动在 Seedance 平台跑」,非 CLI 自动化。CLI 字段省略。
---
1. 基础信息
- Case 编号:04
- 简称:大学讲课·被专业气场击中(学生 OTS 视角)
- 图片来源:用户提供(CodeX 内 GPT Image 生成)
- 图片尺寸:16:9 横版(用户明确"保持图片尺寸")
- 执行日期:2026-05-12 ~ 2026-05-13
- 迭代版本:v2(已跑,反馈"好多了但可扩展更有戏剧张力")→ v3(待跑)
---
2. 第 1 轮:读图分析(v2 字段必填)
| 字段 | 内容 |
|---|---|
| 主体 | 年轻女老师站在黑板前讲课——长发披肩+米色驼色细针织修身长袖+黑色高腰半身裙、左手微抬(暂停板书)、目光转头看向画面左侧(回应学生)。前景左下学生过肩剪影+笔记本电脑+保温杯+教材 |
| 当前画面氛围 | 真实大学课堂记录质感——不是摆拍,是学生从座位上抬眼看老师那一刻的视角 |
| 最有戏的元素 | 老师"转头与学生眼神接触"的瞬间 + 黑板的智识密度 |
| 画质来源判定(v2) | 学生手机抓拍/课堂随手记录(低位偏侧的 OTS 视角、教室白光下手机感光元件轻微噪点、构图非完美正向、前景模糊学生头部剪影是手机近距对焦呼吸的典型特征) |
| 对应画质策略(v2) | 学生手机抓拍录像质感、教室白光下手机感光器件轻微噪点、轻微广角畸变、自动对焦呼吸、握持不稳微抖、前景虚焦学生头部 OTS、粉笔灰颗粒丁达尔体积感 |
| 比例诊断 | 16:9 → 16:9(用户明确"保持图片尺寸",不裁不扩) |
| 建议时长(v2) | 6 秒 |
| 推算理由(v2) | 单一情绪反应弧线——"学生抬眼+老师板书+老师转头眼神接触+学生愣住",按 v2 原则 5 思考迟疑/被击中反应 ≥2s+抬眼 1s+转头 1.5s+收束 1.5s≈6s。硬拉 15s 必中段编造(v1 就是这个问题:让 AI 在黑板上"胡乱写加号"补时间) |
| 平台合规风险(v2) | 中度 —— 服装是修身针织+高腰半身裙,原图 OTS 中景视角是安全的,但若模型把镜头切到低角度仰拍或身体特写就有风险 |
| 风险检查 | 真人脸: AI 生成 ✅ / 文字: 黑板手写公式(关键质感不可去)+ 笔记本电脑屏幕(必须模糊化) / 清晰度: ✅ / 合规:中度 |
---
3. 时序角色询问
主理人的回复:中 最终采用:中间关键帧(K=3s,第 3 秒画面演化抵达 @图片1 状态) 理由:原图最大特点是"老师正在转头的瞬间已经转一半了"——作首帧前面没东西可铺垫;作中间帧让 0-2.5s 铺垫"学生 OTS 抬头 → 看到老师在板书的背影",第 3 秒抵达图(转头眼神接触瞬间),3.5-6s 演化"被专业击中"反应弧。这是修复 v1"脚本张力不够"反馈的关键——v1 把图当首帧导致开场就是高点,没有铺垫所以张力出不来
---
4. Hook 候选与选定
候选 A:学生 OTS 抬头 → 老师转头眼神接触 × 被专业击中 ★★★★★(首推/已选)
- 演化轨迹:0-1.5s 学生 OTS 桌面特写 → 1.5-2.5s 抬头看老师背影板书 → 2.5-3.5s 第 3 秒抵达图状态老师转头眼神接触定格 0.5s → 3.5-4.5s 学生被击中第一拍(瞳孔微缩+笔停顿) → 4.5-5.5s 第二拍(点头+笔重新飞快) → 5.5-6s 收束
- 传播因子:被老师正面回应=大学课堂高光时刻+学生 OTS 沉浸感+板书智识密度+情绪克制不诱惑
- 适用度:★★★★★
候选 B:长镜头从板书推到转头眼神 × 一气呵成 ★★★★
- 演化轨迹:单一 Smooth Slow Push In 全程
- 优势:一镜到底电影感稳
- 劣势:6s 内做完"OTS→抬头→转头→反应"四步对 AI 视频挑战大
- 适用度:★★★★
主理人选定:A
---
5. 第 2 轮:v2 完整 Seedance 提示词
6秒大学课堂学生OTS视角手机抓拍质感,16:9横版,@图片1为第3秒画面演化抵达的中间关键帧。
画质:学生手机抓拍录像,教室白光下手机感光器件轻微噪点、轻微广角畸变、自动对焦呼吸、握持微抖、前景虚焦学生头部OTS、粉笔灰颗粒在窗光中形成丁达尔体积感。非电影级非Cinematic非4K锐利非稳定器。环境音贯穿全片不可寂静:粉笔在黑板上沙沙书写声、老师讲课低沉清晰女声(语调起伏语义模糊)、教室空调低频嗡嗡声、其他学生翻书与笔尖在纸上划过的沙沙声、偶尔椅子吱呀声。
0-1.5秒:学生OTS桌面特写(近景特写略下沉)。前景学生过肩剪影桌面——笔记本电脑屏幕显示模糊PPT排版文字不可读、学生的笔正在飞快记录草图、保温杯冒稀薄热气、教材摊开一角。画面外传来粉笔沙沙书写声+老师讲课女声,节奏沉浸专注。
1.5-2.5秒:镜头微微抬头(Smooth Crane Up),越过笔记本电脑上沿,画面中心出现老师的背影/侧背影。她手中粉笔在黑板上继续书写一个原图既有公式的延续笔画(不可新增完整新符号不可偏离原图板书),长发随手臂动作微飘,背后黑板板书密度严格按原图锁定,左侧黑板边缘有投影仪打来的柔和暖光,学生手持微抖。
2.5-3.5秒:第3秒画面演化抵达@图片1完全一致状态(中景四分之三侧平视),老师从板书姿态转头——左手保持微抬粉笔暂停在黑板某公式旁、目光精准转向画面左侧学生方向(即镜头位置)、表情专注嘴唇正在说话像在解答学生疑问,与镜头的眼神接触定格0.5秒。这一瞬间环境音轻微下沉只剩她的讲课女声。
3.5-4.5秒:学生被击中反应第一拍·瞳孔微缩呼吸屏(1秒)。前景学生头部剪影保持OTS位置但整个身体有微收紧的动作,画面外记笔记的笔尖在纸上停顿了一下。老师保持转头看向学生的姿态表情仅嘴唇继续说话。
4.5-5.5秒:被击中反应第二拍·落定领悟(1秒)。前景学生剪影微微点头一次,画面外笔尖重新开始在纸上飞快划过。老师开始微微转回身体准备回到板书状态。
5.5-6秒:收束回到OTS视角(机位略下沉回初始构图)。老师已转回去继续板书写原图公式的自然延续笔画(不可新增偏离原图的符号),最后0.3秒画面定格在学生笔尖在纸上飞快划过的极近景特写。环境音恢复为粉笔沙沙声+其他学生翻书声+空调嗡嗡声渐弱。
光影:教室顶部自然白光主光+黑板侧投影仪暖色补光向左晕染+笔记本电脑屏幕冷蓝光从下方反向打到学生面部和桌面+空气中粉笔灰颗粒在窗光中形成丁达尔体积感+老师米色针织衣物产生柔和高光+黑板深绿底色与白色板书的强对比。
风格锁定:真实大学课堂学生第一视角手机抓拍质感,非电影级非Cinematic。教室空间布局严格按原图(前景学生OTS+中景老师+背景黑板板书+左侧投影仪暖光+桌面笔记本电脑保温杯教材)不可变化。黑板板书内容严格保持原图既定不可新增书写新符号不可出现加减乘除等原图没有的符号,板书只允许在原图既有公式的自然笔画延续上有极微动。笔记本电脑屏幕只显示模糊PPT排版不出现具体可读中文或英文字符。老师服装姿态严格按关键帧锁定转头角度与原图一致。老师全程是专业从容讲课状态不可戏剧化不可对镜头表演眼神接触专注但不诱惑。全程保持学生OTS中景视角不可切低角度仰拍不可身体局部特写。环境音贯穿全片不可寂静。禁止任何文字字幕、台词字幕、品牌LOGO、学校名称标识、水印。字符数:1398(≤ 2000 ✅)
自检 v2 字段:
- [x] 风格总纲含画质来源关键词("学生手机抓拍录像、教室白光下手机感光器件轻微噪点")
- [x] 现实类反应按子节拍展开(被击中反应:瞳孔微缩呼吸屏 1s + 落定领悟 1s)
- [x] 图作为非首帧时显式写了时间锚点("第 3 秒画面演化抵达 @图片1 状态")
- [x] 时序角色显式(中间关键帧 K=3s)
- [x] 时长 = 推算值 6s(非默认 15)
- [x] 合规规避声明(OTS 中景视角锁定+不可低角度仰拍+不可身体局部特写)
- [x] 文字/符号不可控声明(黑板内容锁定+笔记本电脑屏幕模糊化)
- [x] 环境音贯穿声明
---
6. 设计意图(v2)
- 前 2 秒生死线:避开"直接拍人开场容易陷入摆拍感"——0-1.5s 完全不拍老师,只拍学生 OTS 桌面+画面外环境声入
- 核心 hook:第 8-10s 老师转头与镜头眼神接触的 0.5 秒——克制的情绪渗透
- 学生 OTS 视角的设计:全程保持学生第一人称,规避"窥视/偷拍"叙事联想,转化为"被回应/被肯定"的正向叙事
- 板书的智识密度作为质感锚:没有这个板书密度,整条视频就崩塌为颜值视频
- 结尾笔尖特写的设计:5.5-6s 笔尖在纸上飞快记录的极近景,完成"被她击中之后被点燃"的情绪闭环
- 黑板内容锁定(修复 v1 严重反馈"胡乱写加号"):三重声明
- 时长服从内容:6s(非 v1 的 15s)
---
7. v2 出片效果反馈(主理人 2026-05-13 早上反馈)
主理人原话:
教室的这个好多了,但我觉得可以扩展出更有戏剧张力,你觉得呢?
7.1 出戏点/翻车点
主理人评价"好多了"——v2 解决了 v1 的"黑板胡乱写加号"严重问题,但张力还不够。
7.2 v2 四原则验证
| 原则 | 通过/部分/失败 | 具体表现 |
|---|---|---|
| 1. 画质即风格 | 通过 | 学生手机抓拍质感到位 |
| 2. 时序角色显式 | 通过 | 中间关键帧 K=3s 让"前 2.5s 铺垫"成为张力的起点 |
| 3. 物理时间常数 | 通过 | 学生反应 2 秒分两拍,不瞬间反应 |
| 4. 时长服从内容 | 通过 | 6s 紧凑(v1 15s 黑板乱写问题已解决) |
7.3 反馈背后的真实诉求(v3 必须满足)
1. 保留 v2 现有质感和黑板锁定(v1 严重问题已修复,绝不能破坏) 2. 加戏剧张力——具体形式由 Agent 提案
---
8. v3 改进方向 + 新版 Prompt
8.1 核心改造(保留质感扩张力)
| 改造点 | 具体内容 |
|---|---|
| 0-1.5s 给学生加"分神→被吸引"的转折 | v2 学生开场就是"在记笔记"——v3 改为"笔停顿在纸上半小时未动(轻微分神)",1.5-2.5s 学生被某个词或语调吸引抬头看老师。从"专注"到"专注"没有张力,从"分神"到"被吸引"有强反差 |
| 第 3 秒眼神接触瞬间加"时间凝固"留白 | v2 是"环境音轻微下沉"——v3 升级为"环境音骤然下沉(粉笔声/空调/其他学生声短暂消失)只剩她的讲课女声做时间凝固式留白,仿佛全场只剩她和你两个人"。电影感的时间凝固让 0.5s 的接触放大为戏剧化的瞬间 |
| 5.5s 收束加隐藏情绪钩子 | 老师转回去前,嘴角有几乎不可察的轻微上扬持续 0.3 秒(暗示她注意到这个学生但保持专业),随即恢复专业表情。这是二刷钩子——第一遍看到的是"专业从容",第二遍才看到"她其实笑了" |
| 画质升级为"偷拍" | v2 是"手机抓拍"——v3 升级为"手机偷拍录像"+ 镜头脏点污染。配合"学生分神被吸引"的开场更自然 |
8.2 v3 Prompt(≤ 2000 字符)
6秒大学课堂学生OTS视角手机偷拍录像质感,16:9横版,@图片1为第3秒画面演化抵达的中间关键帧。
画质:学生手机偷拍录像,教室白光下手机感光器件轻微噪点、轻微广角畸变、自动对焦呼吸、握持微抖、前景虚焦学生头部OTS、粉笔灰颗粒在窗光中形成丁达尔体积感、镜头有轻微脏点。非电影级非Cinematic非4K锐利非稳定器。环境音贯穿全片不可寂静:粉笔在黑板上沙沙书写声、老师讲课低沉清晰女声(语调起伏语义模糊)、教室空调低频嗡嗡声、其他学生翻书与笔尖划过的沙沙声、偶尔椅子吱呀声。
0-1.5秒:学生OTS桌面特写(近景特写略下沉)。前景学生过肩剪影桌面——笔记本电脑屏幕显示模糊PPT排版文字不可读、学生的笔此刻停顿在纸上半小时未动(轻微分神的状态)、保温杯热气、教材摊开。画面外传来粉笔沙沙书写声+老师讲课女声,节奏沉浸但学生显然走神了。
1.5-2.5秒:镜头微微抬头(Smooth Crane Up),越过笔记本电脑上沿,画面中心出现老师的背影/侧背影正在黑板上继续书写原图既有公式的延续笔画。学生此刻被某个词或语调吸引——前景学生头部剪影从原本略低头的状态微微抬起,注意力骤然从纸面回到老师身上,呼吸微屏。黑板板书密度严格按原图锁定。
2.5-3.5秒:第3秒画面演化抵达@图片1完全一致状态,老师从板书姿态转头——左手粉笔暂停、目光精准转向画面左侧学生方向(即镜头位置)、表情专注嘴唇正在说话像在解答学生疑问,与镜头的眼神接触定格0.5秒。这一瞬间环境音骤然下沉(粉笔声/空调/其他学生声短暂消失)只剩她的讲课女声做时间凝固式留白,仿佛全场只剩她和你两个人。
3.5-4.5秒:学生被击中反应第一拍·瞳孔微缩呼吸屏(1秒)。前景学生头部剪影身体有微收紧动作,画面外记笔记的笔在纸上从停顿状态突然颤动了一下。老师保持转头看向学生姿态嘴唇继续说话。环境音从骤然下沉中缓慢回升。
4.5-5.5秒:被击中反应第二拍·落定领悟(1秒)。前景学生剪影微微点头一次像在表示理解,画面外笔重新开始在纸上飞快记录划过纸面发出加速的沙沙声。老师开始微微转回身体准备回到板书状态。
5.5-6秒:收束回到OTS视角。老师转回去前,嘴角有几乎不可察的轻微上扬持续0.3秒做隐藏情绪钩子(暗示她注意到这个学生但保持专业),随即恢复专业表情继续板书写原图既有公式的自然延续笔画。最后0.3秒画面定格在学生笔尖在纸上飞快划过的极近景特写。环境音恢复为粉笔沙沙声+其他学生翻书声+空调嗡嗡声渐弱。
光影:教室顶部自然白光主光+黑板侧投影仪暖色补光向左晕染+笔记本电脑屏幕冷蓝光从下方反向打到学生面部和桌面+空气中粉笔灰颗粒丁达尔体积感+老师米色针织衣物柔和高光+黑板深绿底色与白色板书的强对比。
风格锁定:真实大学课堂学生第一视角手机偷拍质感,非电影级非Cinematic。教室空间布局严格按原图不可变化。黑板板书内容严格保持原图既定不可新增书写新符号不可出现加减乘除等原图没有的符号,板书只允许在原图既有公式的自然笔画延续上有极微动。笔记本电脑屏幕只显示模糊PPT排版不出现具体可读字符。老师服装姿态严格按关键帧锁定。老师全程是专业从容讲课状态不可戏剧化不可对镜头表演,眼神接触专注但不诱惑,第5.5秒嘴角上扬幅度极小持续0.3秒不可夸张。全程保持学生OTS中景视角不可切低角度仰拍不可身体局部特写。第3秒环境音骤然下沉做时间凝固式留白不可超过1秒。环境音其他时间贯穿全片不可寂静。禁止任何文字字幕、台词字幕、品牌LOGO、学校名称标识、水印。字符数:1472(≤ 2000 ✅)
8.3 v3 自检 v2 字段
- [x] 所有 v2 字段保留(黑板锁定声明三重保留)
- [x] 新增:开场转折点(学生分神→被吸引)
- [x] 新增:电影感时间凝固(第 3 秒环境音骤然下沉)
- [x] 新增:隐藏情绪钩子(5.5s 老师嘴角不可察上扬 0.3s)
- [x] 画质升级("手机抓拍"→"手机偷拍")
---
9. v2 → v3 改进对照
| v2 | v3 |
|---|---|
| 学生开场就是"在记笔记"专注状态 | 学生开场是"分神"——笔停顿半小时未动,1.5s 后被某个词吸引重新进入 |
| 第 3 秒"环境音轻微下沉" | 第 3 秒"环境音骤然下沉做时间凝固式留白",电影感的瞬间放大 |
| 5.5s 老师转回去无情绪线索 | 5.5s 老师嘴角不可察上扬 0.3 秒做隐藏二刷钩子 |
| 画质:手机抓拍 | 画质:手机偷拍 + 镜头脏点 |
---
10. 给主理人的反馈
- 本 case 是否值得保留作为典型 case:是 —— 验证了"加戏剧张力=加开场转折+加电影感时间凝固+加隐藏情绪钩子"的方法论
- 方法论改进建议:
1. 戏剧张力不是"加更多动作或情节",而是给现有的瞬间加"反差"和"留白":
- 反差:v3 的"分神→被吸引"反差是张力来源
- 留白:第 3 秒环境音骤然下沉的"时间凝固"是张力放大器
2. 隐藏情绪钩子是 v2 没覆盖但很重要的概念:第 5.5s "嘴角不可察上扬 0.3 秒"——这种"克制的情绪渗透"比直接微笑高级 10 倍,是二刷钩子的精准实现 3. 环境音的"骤停留白"是物理时间常数的反向应用:v2 原则 5 强调反应时长 ≥X 秒,但 v3 用"环境音骤停 1 秒"反向制造时间凝固——听觉的留白让视觉的瞬间被放大
---
报告完成时间:2026-05-13 09:18 报告人:Claude(晚间执行 Agent · 用户工作流为"产 prompt + 主理人手动跑")
---
📌 v3 → v4 → v5 续篇(2026-05-13 晚间)
11. v3 出片效果反馈
主理人反馈:v3 仍有问题——"老师应该是讲课的过程,肯定是要讲话的。包括在黑板上写的东西,也是需要有内容的。而不是说怎么突然转过来看着下面的学生,好像又没讲话,就不知道干啥。这个就不符合常识"
⚠️ 这个反馈揭示了 v3 把图作"中间关键帧 K=3s 抵达"的根本问题——强制让老师在第 3 秒"突然转头看学生",结果模型让她"看着学生但什么也没讲"很反常识
12. v4 改造(核心:删除中间关键帧机制+老师真讲课)
v4 关键转变: 1. 图作框架参考不卡帧:"参考@图片1的老师外貌服装+教室场景+黑板既有内容氛围但不强制卡任何一帧" 2. 删除"第 3 秒抵达图状态"的关键帧锚点 —— 不再让老师"突然转头" 3. 老师全程在讲课:嘴持续动+一次转身写延续公式+一次右手手势配合+偶尔看不同方向的学生 4. 黑板内容:原图既有公式的自然演算延续,禁止乱画+号或新符号 5. 4 层画质退化:B 站/视频号压缩 + 学生手机偷拍 + 偷拍特征 + 广角变形
13. v4 出片效果反馈
主理人反馈:方向对了,但"老师一直看着学生,然后手又在黑板上写东西,而且写东西这个行为,粉笔跟黑板的距离离得很远,都不够现实" —— 物理动作错位+粉笔悬空
14. v5 改造(最终定型)
v5 核心修正——时序明确的两段交替:
把"老师边写边看学生"的模糊指令拆成严格时间分段+反常识动作禁令:
- 0-3s 写字段:老师侧背向画面/微微背对画面面对黑板写字,右手粉笔紧贴黑板表面写既有公式的延续笔画,嘴持续讲解。粉笔尖必须贴紧黑板不可悬空
- 3-3.5s 转身过渡:写完一段后停下粉笔,整个人转身变为面向画面/学生,粉笔此时从黑板上离开抬到讲台胸前或自然垂在身侧
- 3.5-6s 讲解段:老师完全面向画面/学生,右手粉笔自然垂在身侧或抬起做指向手势但不再触碰黑板,嘴持续动讲解,左手做开放手势
风格锁定加粗:"老师全程必须持续在讲课嘴持续动,但手与黑板的物理关系必须符合现实——0-3 秒粉笔紧贴黑板,3-3.5 秒转身时粉笔离开黑板,3.5-6 秒老师面向学生讲解时粉笔不可再接触黑板不可悬空在黑板前写字。禁止老师边面向学生边在黑板上写字的反常识动作"
关键设计哲学:把"边讲边写"这个看似自然但其实物理上瞬时矛盾的动作,拆解为时序分明的两段——这是真实老师讲课的节奏(写一段→转身讲解→继续写)
15. v5 完整 Prompt(最终版)
6秒大学课堂学生手机偷拍录像质感,16:9横版,参考@图片1的老师外貌服装+教室场景+黑板既有内容氛围但不强制卡任何一帧,视频自由演化为日常听课偷拍自然瞬间。
画质:学生手机偷拍录像后被传到短视频平台压缩的双重画质退化:①平台压缩artifacts——B站/微信视频号低码率压缩感全程明显、画面细节磨平、暗部色块、彩色色噪、压缩边缘抖动;②学生手机偷拍瑕疵——教室白光下感光元件中等ISO粗粒噪点、自动曝光起伏(黑板深色区与窗光亮区切换时画质波动一次)、白平衡略偏冷;③偷拍特征——前景隐约学生头部剪影虚焦、握持微抖、镜头有轻微脏点污染、画面构图非完美正向略歪;④广角变形——手机后摄轻微广角畸变、粉笔灰颗粒在窗光中形成丁达尔体积感。禁用4K高清禁用Cinematic禁用电影级禁用稳定器质感禁用调色精致禁用工业渲染禁用画面锐利禁用清晰画质。
环境音贯穿全片不可任何段落寂静:粉笔在黑板上沙沙书写声(仅在老师写字时段出现)、老师讲课低沉清晰女声从头到尾持续不间断(语调起伏语义模糊但清晰可闻是在讲课)、教室空调低频嗡嗡声、其他学生翻书与笔尖在纸上划过的沙沙声、偶尔椅子吱呀声。
主角:参考@图片1的老师外貌(长发披肩、米色驼色细针织修身长袖+黑色高腰半身裙、自然知识女性气质),站在黑板前正在讲课。
环境:大学教室,前景虚焦学生过肩剪影+笔记本电脑屏幕(显示模糊PPT排版文字不可读)+保温杯+教材;中景老师站讲台;背景黑板布满手写数学/物理公式(参考@图片1的板书布局氛围);左侧黑板边缘有投影仪暖色补光。
0-6秒:镜头单一Smooth Slow Push In极缓慢推进(6秒内从中景缓慢推到中近景仅放大约10%),全程单一机位无任何切换无任何拉远不可上升下降不可切角度。镜头保持学生偷拍的轻微手抖。
老师必须严格按"写字→转身讲解→继续写字"的两段交替节奏(**禁止边面向学生边在黑板上写字的物理矛盾动作**):
**0-3秒·写字段**:老师**侧背向画面/微微背对画面**面对黑板专注写字,**右手粉笔紧贴黑板表面**在@图片1既有公式旁书写延续笔画(在既有公式上做自然演算延续如代入数值/化简/写下下一步推导,不可写新增完整新符号不可乱画+号或随机字符不可空白涂抹,**粉笔尖必须贴紧黑板不可悬空**),嘴持续在动讲解相关内容语调起伏,左手垂在身边或扶在讲台边沿,偶尔头微微侧转看一眼黑板内容但身体仍面向黑板。
**3-3.5秒·转身过渡**:老师写完一段后停下手中粉笔,**整个人转身**从背对画面变为面向画面/学生方向,**粉笔此时从黑板上离开**抬到讲台胸前或自然垂在身侧,手不再在黑板上。
**3.5-6秒·讲解段**:老师**完全面向画面/学生**站立,**右手粉笔自然垂在身侧或抬起做指向手势但不再触碰黑板**,嘴持续动讲解(语调起伏配合手势),左手偶尔抬起做开放手势,目光偶尔看向画面外不同方向的学生(不是只盯一个方向),表情自然知识女性的从容神态偶尔有专注皱眉或讲到精彩处微微点头。
学生(前景OTS)行为:默默听课中,画面外笔尖偶尔在纸上沙沙划过,前景学生头部剪影偶尔微微调整角度。
环境同步演化:教室空气中粉笔灰颗粒被窗光照亮、其他学生翻书声偶尔传来、空调嗡嗡声持续、偶尔椅子轻微吱呀。
光影:教室顶部自然白光主光+黑板侧投影仪暖色补光向左晕染+笔记本电脑屏幕冷蓝光从下方反向打到学生面部和桌面+空气中粉笔灰丁达尔体积感+老师米色针织衣物在白光下柔和高光+黑板深绿底色与白色板书的强对比。
风格锁定:真实大学课堂学生第一视角手机偷拍质感,非电影级非Cinematic。教室空间布局严格按@图片1氛围参考不可变化。**老师全程必须持续在讲课嘴持续动**,但**手与黑板的物理关系必须符合现实**——0-3秒老师面向黑板写字时粉笔紧贴黑板,3-3.5秒转身时粉笔离开黑板,3.5-6秒老师面向学生讲解时粉笔不可再接触黑板不可悬空在黑板前写字。**禁止老师边面向学生边在黑板上写字的反常识动作**。黑板板书严格保持@图片1既有公式的逻辑延续——只允许在0-3秒段在既有公式上做自然演算延续如化简/代入/下一步推导,不可新增完整新符号不可写出加号减号或乱码字符不可空白涂抹。笔记本电脑屏幕只显示模糊PPT排版不出现具体可读字符。老师全程是专业从容讲课状态不可戏剧化不可对镜头表演。全程保持学生OTS中景视角不可切低角度仰拍不可身体局部特写。画质必须呈现短视频平台压缩感和手机偷拍感不可呈现4K锐利画质不可呈现电影级稳定画质。环境音贯穿全片不可寂静特别是老师讲课声音不可中断。禁止任何文字字幕、台词字幕、品牌LOGO、学校名称标识、水印。字符数:1886(≤ 2000 ✅)
16. 最终验证状态
✅ v5 跑完通过验证——主理人反馈"可以了,整体没有其他问题了"
17. v2 → v3 → v4 → v5 完整迭代追踪
| 版本 | 关键改动 | 主理人反馈 |
|---|---|---|
| v2 | 中间关键帧 K=3s+被击中反应弧+黑板内容三重锁定 | 好多了,但可扩展更有戏剧张力 |
| v3 | 加学生分神→被吸引转折+第3秒环境音骤停做时间凝固+老师隐藏嘴角上扬 | 老师一直看学生但不讲话+黑板写东西不符合现实 |
| v4 | 删除"第3秒抵达图状态"的中间帧锚点+老师全程在讲课嘴持续动 | 老师边看学生边在黑板写+粉笔离黑板远不现实 |
| v5 | 严格时间分段:0-3s 写字段(粉笔贴板) → 3-3.5s 转身过渡(粉笔离板) → 3.5-6s 讲解段(粉笔不再接触黑板) | ✅ 通过 |