← 返回列表
需源码安装
输入一个选题,自动生成 Vox 风格拼贴讲解视频
暂不能直接安装(需源码编译或环境不满足):缺少 main/exports/bin 入口声明。 · 最近上游提交 2026/8/11 · 已提供中文文档
将一个主题变成一部完成的Vox风格纸拼贴解说/广告视频——在Atlas Cloud + ffmpeg上端到端自动化。一个智能体技能。
综合分
67.8
GitHub 分
67.8
用户评分
—
★ Stars
1909
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Alisa0808/vox-director缺少 main/exports/bin 入口声明,改用 GitHub 源安装
🟢实装验证通过· 2026/9/16
由 dsh-plugin-verify(GitHub Actions)在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查需源码安装
以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。
✗npm 包vox-director(未发布到 npm,仅可源码安装)
✓Node 引擎未声明 engines.node
✓dsh CLI 依赖未声明 dsh 版本约束
✗入口文件缺少入口声明
缺少 main/exports/bin 入口声明
验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/16 16:50:55
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
English · 简体中文 🎬 Vox Director(拼贴动效导演) 一个选题进,一条成片出——脚本、拼贴关键帧、动效、旁白、配乐、字幕,全流程自动化的 Vox 风格拼贴讲解/广告视频。 一个通用 agent 技能,后端全跑 Atlas Cloud API、本地用 ffmpeg 合成,任何编码 agent(Claude Code、Codex 等)都能用。你给一句话选题,它给你一个 mp4。 License: MIT Powered by Atlas Cloud Agent Skill https://github.com/user-attachments/assets/ed08d230-7bcb-4b48-a17d-23c079208f9f ▶《中华文明的变迁》· 30 秒 足球如何征服世界 · 60 秒 墨西哥街头美食 · 60 秒 货币简史 · 60 秒 硅谷简史 · 60 秒 ▶ 更多影片 —— 点击任意封面播放 这是什么 风格是 Vox 讲解片带火的现代编辑感纸质拼贴:手撕纸片、毛边、胶带、半调网点、报纸剪贴、每一拍一块大胆平涂色、大号剪纸标题——再配上动效、旁白、配乐和字幕,让整张海报活过来。 工作原理 一个选题依次流过每个阶段一个脚本,全程由每个项目一份 beats.json 驱动: 选题 │ ├─ 1. 分镜脚本 选叙事弧线 → 写 beats.json ◀── 决策点 1:你确认分镜脚本 ├─ 2. 风格试片 同一拍渲成 3–4 种主题 ◀── 决策点 2:你看图挑风格 ├─ 3. 关键帧 每拍一张拼贴海报 (nano-banana-2) ├─ 4. 动效 让每张海报动起来 (gemini-omni-flash 图生视频) ├─ 5. 旁白+配乐 统一旁白 (xai/tts) + 背景乐 (minimax/music) ├─ 6. 合成 ffmpeg:拼接、配乐在旁白下自动闪避、烧字幕+水印 └─ final.mp4 上面这条是 B-roll——一个选题进去,画面全靠生成。另外两种输入形态复用同一套引擎: - A-roll——你已经有一段口播视频。 它会被 ASR 自动切成段,再整段套上拼贴风格,真人的脸、口型、手势逐帧保留(gemini-omni-flash/video-edit,失败自动重试 seedance-2.0/reference-to-video)。 - C-roll——你只有一张静态照片(自拍、产品图)。主体被抠成摄影质感的贴纸——绝不重绘——每一段的海报围着它生成(nano-banana-2/edit)。旁白还能克隆成主体本人的声音。 两个关键理念决定成败,技能就是围绕它们搭的: 1. 风格诞生在生图这一步。 每一拍是一张成品拼贴海报,所有拼贴基因(撕纸、剪纸、网点、标题文字)都长在这张图里——图不够拼贴,后面再怎么救也救不回来。 2. 动效是后加的。 默认由 AI 视频模型把整张海报动起来(「活海报」路径);要那种戏剧化的零件逐个飞入拼合,可选的本地关键帧引擎会把海报拆成零件逐帧驱动(无内容审核、像素级精确,尤其适合真人)。 两个人工决策点让你始终掌控(确认分镜脚本、挑风格),其余全自动。 模型(已在 Atlas Cloud 上验证) | 用途 | 模型 | |---|---| | 关键帧 / 拼贴海报 | google/nano-banana-2/text-to-image | | 动效(非真人内容) | google/gemini-omni-flash/image-to-video | | 动效(真人 / 品牌) | kwaivgi/kling-video-o3-pro/image-to-video | | 口播视频转拼贴(A-roll) | google/gemini-omni-flash/video-edit | | 照片锚进拼贴(C-roll) | google/nano-banana-2/edit | | 旁白 | xai/tts-v1 | | 用真人本人的声音念旁白 | bytedance/seed-audio-1.0(声音克隆) | | 配乐 | minimax/music-2.6 | | 抠素材(高级路径) | youchuan/v8.1/remove-background | 模型 ID 会变——技能运行前会先从 GET https://api.atlascloud.ai/api/v1/models 拉取最新列表。 安装 这是一个通用 agent 技能——任何能读工作流、跑脚本的编码 agent 都能用(Claude Code、Codex 等)。Claude Code 会自动把它识别成 skill;其他 agent 读 AGENTS.md → SKILL.md。 方式 A —— 从本仓库: git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director 方式 B —— 用打包好的技能文件: 下载 vox-director.skill,在你的 Claude 技能界面里安装。 然后设置 Atlas Cloud API key(在 atlascloud.ai/console/api-keys 获取): export ATLASCLOUD_API_KEY="sk-..." 快速开始 装好技能后,直接跟你的编码 agent 说: 「做一条 Vox 风格的拼贴视频,介绍墨西哥街头美食——全英文,16:9,15 秒。」 agent 会先起草分镜脚本给你确认,再跑一轮风格试片让你挑,然后生成关键帧 → 动效 → 旁白 → 配乐,合成 out//final.mp4。 环境要求 - 一个编码 agent——Claude Code、Codex 或类似工具 - Atlas Cloud API key - ffmpeg + ffprobe(brew install ffmpeg) - Python 3 + Pillow(pip install pillow)——用于字幕/水印叠加 目录结构 SKILL.md 技能本体(英文)——agent 遵循的工作流 SKILL.zh.md 同一技能的中文版 AGENTS.md 非 Claude agent(Codex 等)的入口 references/ 创意引擎 prompt-guide.md 画面/LOOK 层:提示词结构 + 词库 + 9 套主题预设 beat-layer.md 14 种叙事弧线 + 钩子/节奏 + 镜头模式 voices.md xai/tts 音色表 —— 按语种/调性挑 voice_id models-and-gotchas.md 每一个 API / ffmpeg 坑,都已填平 local-engine.md 高级的元素级动效引擎 scripts/ 每个管线阶段一个脚本 examples/ 可直接跑的 beats.json 示例 assets/ 样片 致谢 作者 @alisaqqt —— 关注我看更多 agent skill 实验。 灵感来自 Stav Zilber、rom1trs、Higgsfield 的拼贴广告工作流,以及 Vox 的讲解片视觉语言。 全流程基于 Atlas Cloud 构建——一个提示词,一条成片。 许可 MIT © 2026 Alisa Qian
扫码进群