痛点:AI 视频越强,越显得你不会写提示词
Veo 3、Sora 2、Seedance 2.0 越强,越显得你不会写视频提示词。开源项目 Video to Prompt 专治这个:丢进去一段参考视频,它还你一份分镜级的、可直接开工的提示词。
项目地址在 github.com/imooooc/video-to-prompt,MIT 协议,作者 2026 年 5 月创建,Next.js 写的。不想折腾部署的,有现成的在线 demo:v2p-demo.vmoli.com,打开即用。

怎么用:拖视频、贴 Key,三步出活
- 拖进去一段视频:MP4、MOV、WebM、AVI、WMV、3GP、MKV 都吃,最大 2GB,手机里存的爆款、自己拍的旧素材、电影片段都行。
- 贴上 Gemini API Key:在 Google AI Studio 免费领一个,Key 只存在浏览器 localStorage 里,不注册账号、不经过作者服务器,视频直传 Google。
- 拿提示词开工:输出是带时间码的分镜表(0–3s、3–7s 这种),每段动作、运镜、台词、画面风格拆得明明白白,台词原样保留不改写。模型可在 gemini-2.5-pro(效果最好)和 gemini-2.5-flash(更快)之间切换,还能一键把提示词甩给 Seegen.ai 直接渲染成片。
技术细节:凭什么是它拆得准
作者在 README 里把工程取舍写得很实在,抄作业价值拉满:
- 2FPS 采样:Gemini 视频接口默认 1 秒 1 帧,快剪蒙太奇会被悄悄吞掉镜头,作者提到 2FPS,用双倍 token 成本换分镜召回。
- 高分辨率采样:每帧视觉 token 翻倍,区别就是”法庭里有个人”和”戴卷发假发的严厉法官在敲法槌”的区别。
- 结构化系统提示词:强制整数秒时间码、整段视频拆 3–6 个节拍、台词用双引号原样钉在对应节拍里,模板代码直接开源在仓库的 app/lib/prompt-template.ts。
- 双上传路径:18MB 以下 base64 一次发完,大的走 Gemini Files API,轮询到 ACTIVE 状态再引用。
本地部署:四行命令整一个自己的
项目是纯静态构建,Vercel、Cloudflare Pages、Netlify、GitHub Pages 随便扔。本地跑也很简单:git clone 下仓库,pnpm install 装依赖,pnpm dev 起服务,然后打开 http://localhost:3000,点齿轮图标贴 Key 就能用。作者的 roadmap 里还写了示例画廊、多语言 UI(中日韩)、浏览器插件和可嵌入小组件,issues 区欢迎拿难搞的片子去调模板。
- git clone https://github.com/imooooc/video-to-prompt.git
- cd video-to-prompt
- pnpm install
- pnpm dev,浏览器打开 http://localhost:3000
三种”扒提示词”路线对照
| 路线 | 形态 | 上手门槛 | 适合谁 |
|---|---|---|---|
| Video to Prompt | 网页应用,开源可部署 | 贴个 API Key 就行 | 想快速出活的创作者 |
| video-prompt-reverse(skill 版) | SKILL.md 技能,跑在 Codex / Cursor 里 | 要会配 Agent 环境 | 重度玩 Agent 的极客 |
| 手写 | 人肉看片写分镜 | 费眼睛费时间 | 导演本人 |
白嫖党注意两点:Gemini API 有免费额度,轻度用基本不花钱,但 Key 别外泄;扒来的提示词记得做二次 remix,直接套用别人的爆款分镜配自己的产品和台词,才是正经玩法。相关 skill 版实现可以看 video-prompt-reverse 仓库,纯 Markdown 零代码,粘进 Agent 里就能用。