Core scripts
自动化脚本
scripts/doubao_tts.py连接豆包语音并生成分句 MP3build_optimized.py选稳定镜头、渲染字幕、合成成片recipe.json记录素材、起点、时长和输出配置qa_final/report.json保存自动质检结果
AI Video Automation · Case 01
这不是一次“让 AI 随机拼视频”的演示。我从参考片拆解、真实素材筛选和合规文案开始,把配音、字幕、镜头时长、画面质检做成一套可以继续批量化的流程。
豆包现成音色 · 新青年体字幕 · 真实云南素材
Production Pipeline
每一步都留下机器可读的中间结果,方便重做单句、替换单个镜头,或者把同一套规则用于下一条视频。
读取 5 条参考视频的时长、帧率和镜头密度,提炼“钩子—路线—体验—收尾”的内容结构。
FFprobe · scene detect控制在 35–45 秒,使用短句和路线信息,避开绝对化承诺与不必要的价格表达。
script.txt从昆明、大理、丽江、香格里拉等分类中抽帧筛选,排除水印、原生字幕和素材内部跳切。
OpenCV · NumPy每句单独调用豆包语音,再读取真实音频时长;画面和字幕不再靠字数估算。
doubao_tts.py素材先裁入稳定区间,再统一为 30fps;字幕直接烧入各自片段,最后按精确帧数拼接。
build_optimized.py检查字幕安全边距、描边像素、黑帧、冻结帧、重复帧和镜头内异常突变。
qa_final/report.jsonScripts & API
页面只公开实现方式,不暴露 API Key、应用凭证或用户数据。
Core scripts
scripts/doubao_tts.py连接豆包语音并生成分句 MP3build_optimized.py选稳定镜头、渲染字幕、合成成片recipe.json记录素材、起点、时长和输出配置qa_final/report.json保存自动质检结果Voice API
seed-tts-2.0zh_female_xiaohe_uranus_bigtts使用平台现成音色,没有进行真人声音克隆。
Media stack
Iteration Log
这条视频经历了多轮人工反馈。每一次修改都被沉淀成自动化检查项。
FFmpeg 字体渲染受环境影响,改用 Pillow 生成透明字幕层,并保留至少 93px 横向边距。
从整段语音按字数估时,改成 12 句独立生成,再将每句音频补齐到精确帧边界。
逐镜查看画面四角与字幕区域,替换带设备水印、账号文字和原生字幕的素材。
先检测源文件内部切镜,只取无突变区间;输出统一 30fps,并检查连续帧差和重复帧。
字幕改为 8px 内描边和 14px 外层阴影,并对 12 张字幕图逐一验证黑白像素。
43.5 秒、1305 帧,字幕、音频和镜头边界统一;下一条只需替换文案与素材匹配结果。