先泼盆冷水:90%的人写AI视频提示词,第一步就错了
上周有个做知识付费的朋友找我,说他用某款AI视频工具生成宣传片,折腾了三天,烧了200多次生成额度,出来的东西还是“人工智障”水平——人物五官乱飞,场景切换生硬,逻辑前言不搭后语。他把提示词发给我一看,好家伙,写的是:“make a video about success”。
这种提示词,AI要是能给你生成大片,那才叫见鬼了。站长从2023年初开始系统研究AI视频生成,用Runway、Pika、可灵、Luma等工具跑了上千次测试,发现一个铁律:AI视频质量的下限由模型决定,但上限100%由提示词决定。今天这篇不讲虚的,直接把我们付费社群内部跑通的“ai video prompt ideas五步法”和盘托出,每一步都有具体案例和可复制的模板。
第一步:先定“镜头语言”,再写“画面描述”
这是新手和老鸟最大的分水岭。新手写提示词,喜欢堆砌形容词:“a beautiful girl walking in a beautiful forest with beautiful light”。老鸟写提示词,脑子里先有分镜脚本。
我们给内部学员的固定要求是:任何提示词,必须包含“景别 + 运动方式 + 主体动作 + 环境氛围”四个要素。拿“女孩在森林里走路”举例,废稿和成稿的差距是这样的:
- 废稿:a girl walking in forest, beautiful, cinematic
- 成稿:Medium tracking shot, girl in her 20s wearing red coat walking forward on mossy forest path, dolly zoom effect, foggy morning light rays through tall pine trees, leaves rustling, shallow depth of field, 4k, photorealistic
看到区别了吗?成稿里每一个词组都在告诉AI:“镜头应该怎么摆”、“主体在做什么”、“环境光是什么状态”。我们实测,包含完整镜头语言的提示词,生成视频的有效率(即无需重roll)从不到20%直接提升到65%以上。
这里再送一个我们自用的“万能四要素模板”:
[景别+运镜], [主体特征+动作], [环境+时间+天气], [画质+风格标签]
记住这个顺序,写提示词时按顺序填内容,逻辑永远不会乱。
避坑提醒:不要写“a beautiful girl”——“beautiful”是主观词,AI无法量化。要写“a girl in her 20s with freckles and braided hair”。越具体的物理描述,AI理解越准确。
第二步:巧用“负面提示词”和“时间轴控制”,告别AI抽风
很多新手不知道,主流AI视频工具(如Runway Gen-2、Pika 2.0)都支持负面提示词(Negative Prompt)。我们实测,加入负面提示词后,画面崩坏率能再降低30%。但大多数人根本不用这个功能。
常用负面提示词清单(直接复制):
- mutated hands, extra fingers, distorted face(防止人物畸形)
- blurry, low resolution, jpeg artifacts(防止画质劣化)
- watermark, text, logo(防止乱入水印文字)
- slow motion, time lapse(防止运镜速度异常)
更进阶的玩法是“时间轴控制”。比如用Pika 2.0的“Camera Control”功能,你可以指定前3秒是推近镜头,后3秒是环绕镜头。这时候提示词可以写成:
“Scene 1-2s: extreme close-up on eyes reflecting city lights. Scene 3-6s: crane shot pulling up to reveal the whole skyline at dusk.”
这种分时间段描述,AI生成的运动轨迹明显更符合预期。我们做电商产品视频时,经常用这个技巧让产品旋转展示+背景光效变化,一条过。
第三步:从“单镜头”到“多镜头叙事”——用“镜头矩阵”批量生产
单条视频生成得再好,也只是素材。要做出能变现的成品(比如抖音带货视频、B站解说素材),你需要的是“镜头矩阵”。
站长接商单时,标准流程是:先写一个15-30秒的脚本大纲,拆解成3-5个关键镜头,然后为每个镜头单独生成提示词。举个例子,我们给某茶饮品牌做的30秒广告片,拆解如下:
| 镜头序号 | 时长 | 提示词核心描述 |
|---|---|---|
| 镜头1 | 0-4s | Macro shot, ice cubes dropping into amber liquid, splash frozen in air, backlit |
| 镜头2 | 4-9s | Top-down view, hand pouring milk into tea, swirling patterns, steam rising |
| 镜头3 | 9-15s | Low angle tracking, glass on wooden table, city bokeh background, golden hour |
| 镜头4 | 15-22s | Close-up, person taking a sip, condensation droplets on glass, smile, natural light |
这样每个镜头独立生成,再通过剪映或Premiere Pro拼接起来,加上转场和BGM,一个看起来“很贵”的广告片,实际制作成本不到50元电费。
关键技巧:每个镜头生成时,保持“主体特征一致”和“环境风格一致”。比如镜头1写了“amber liquid”,后面所有镜头都要写“amber liquid”而不是“brown drink”。我们强烈建议你给每个项目建一个“关键词表”,统一用词,避免AI“串味”。
避坑提醒:千万不要试图让AI一次生成超过8秒的连续复杂动作。目前主流模型的“幻觉率”(即动作逻辑错误)会随着时长呈指数级上升。我们的经验是:单镜头时长控制在4-6秒为最佳性价比区间。
第四步:善用“风格化后缀”,让视频一眼高级
同样的内容,加不加风格化后缀,成品质感天差地别。这是我们在实战中总结的“风格配方”,直接套用即可:
- 商业大片风:cinematic lighting, anamorphic lens, film grain, color graded, octane render
- 赛博朋克风:neon lights, cyberpunk style, rain-soaked streets, holographic ads, blade runner aesthetic
- 国风山水风:ink wash painting style, misty mountains, traditional Chinese architecture, poetic atmosphere
- 产品广告风:studio lighting, soft shadows, 8k product render, clean background, high key lighting
- 纪录片质感:handheld camera style, natural lighting, realistic textures, documentary photography, 35mm lens
这些后缀不是玄学,它们是在告诉AI调用哪些“视觉记忆库”。我们测试过,加了“cinematic lighting”和“anamorphic lens”后,生成画面的光影层次感明显提升,暗部细节不再是一片死黑。
第五步:变现路径——别只发朋友圈,让提示词变成“印钞机”
学会了写提示词,怎么变现?我们跑通的三条路,供你参考:
路径一:帮传统企业做“AI视频定制”。很多本地餐饮店、健身房、装修公司,没有预算请专业拍摄团队,但愿意花300-800元买一个15秒的AI宣传视频。你只需要用上面的方法,拍摄他们店里的实景照片,用AI图生视频功能生成动态宣传片,成本几乎为零,利润极高。
路径二:做“提示词模板”售卖。在知识星球、闲鱼、Etsy上,一套精心整理的“100个行业AI视频提示词模板”卖19.9-99元,销量非常可观。我们社群有位学员,专门整理“翡翠玉石类”和“美妆类”提示词,月入过万。
路径三:做“AI视频素材号”接商单。把生成的优质视频素材(无人声、无字幕)发布到视觉中国、VJ师、新片场等平台。很多自媒体人懒得自己跑AI,直接买素材用。一条卖30-100元,上传500条,就是被动收入。
但切记,变现的前提是你的视频质量要过硬。我们见过太多人拿劣质视频去投稿,结果被平台打回。所以,前100条视频,请老老实实按照上面的五步法打磨,别急着变现。
避坑提醒:目前国内主流平台(抖音、B站)对AI生成内容的标识要求越来越严。商业合作时,务必提前和客户确认是否需要添加“AI生成”标识,以免后续纠纷。
总结:现在,轮到你动手了
别光收藏,去实践。打开你的AI视频工具,先别急着写提示词,打开一个空白文档,按我们说的“四要素模板”写出一个5秒镜头的提示词,生成一条,对比一下和你之前瞎写的结果有何不同。
如果这条视频让你眼前一亮,恭喜你,你已经入门了。如果还是不满意,欢迎在评论区带上你的提示词和生成结果,我们抽空帮你看问题出在哪。记住,AI视频这行,手熟而已。