从一条信号,到一支成片。
生产线装在自己电脑里。
李发发工作台把口播视频要走的每一步——信号、选题、写稿、配音、字幕、视频、质检、发布——串成一条流水线。模型调用、素材与成片全部留在本机,数据不出门。
渲染 11073 帧 · 约 3.5 分钟 · 246 项单测全绿 · 全程零云端费用
八个阶段,一条流水线
每个阶段是一个独立模块,产物交给下一环。任何一环不过关,任务就地停下,不会把问题带进成片。
- 01
信号
采集公开来源与 AI 内容日报,筛出值得做的素材。
- 02
选题
按账号、渠道与切入角度生成候选,加入待写稿。
- 03
写稿
起稿、润色与稿件检查,动笔之前先确认任务。
- 04
配音
云端 MiMo 或本地 LongCat,用参考音频复刻音色。
- 05
字幕
Qwen3-ASR 出轴,切换点吸附真实停顿,误差 0.12 秒。
- 06
视频
创作 Agent 编写 Remotion 工程,渲染前自动预检。
- 07
质检
ffprobe 技术质检,独立审片 Agent 真正看片。
- 08
发布
标题、文案、标签与封面一次备齐,即可发布。
工作台只管通用,
业务交给能力包
底座是 DeepSeek Harness(DSH):对话、模型配置、工具执行与会话管理都由它承担,内核锁定在 dsh-v0.1.6-alpha.1,不做一行改动。
「口播视频内容创作」是第一个能力包。新的业务场景写成独立包装进来——自带页面、任务流程和数据存储,装上即用,卸载保留数据,永远不必把业务写进工作台核心。
账号定位
受众、内容方向与表达约束,存一次,全程复用。
信号
内置来源加 AI 日报,素材在这里进站。
选题
候选、待写稿与选题角度,逐条落位。
写稿
起稿、编辑、润色,写前确认写后检查。
配音 · 字幕
云端与本地引擎互斥切换,字幕轴是唯一时间源。
视频 · 审片
AI 导演写工程,技术质检与独立审片双闸门。
发布资料
标题文案封面一套抽屉,齐备即可发布。
内容安排
成片按账号陈列,发布节奏一目了然。
维修记录
一支视频做下来修掉的问题,约 700 行改动、14 个文件,每一条都在真机验证过。留着这份记录,也提醒自己下次别再踩。
- 音画同步
画面超前语音 2–3 个章节,18 个场景 13 个切在句子中间。
场景边界改取真实语音时间轴,渲染前自动核对,错位直接拒渲。
- 字幕对齐
按字数估算,字幕在开口前 0.4–1.0 秒就上屏。
切换点吸附 ffmpeg 量出的句间停顿,固定开口前 0.12 秒出现。
- 音效淹没
音效峰值比旁白低 12–21dB,混进成片等于不存在。
loudnorm 归一化,实测混音中 1.3–1.9 倍于邻域,清晰可闻。
- 渲染提速
11073 帧渲染约 20 分钟,根因是渲染浏览器版本不配对。
指定本机同源 Chrome 后 3.5 分钟完成,快了约 5.7 倍。
- 审片失明
审片 Agent 的读图请求全部被拒,三轮审片无条件失败。
给模型声明图像输入能力,审片真正开始看画面。
- 选题闪退
Windows 文件锁让写入 11 次里失败 7 次(EPERM)。
原子写入加退避重试,12 次并发全过,延迟 6–13 毫秒。
快速开始
一台自己的电脑就够,不需要云服务器。
$ git clone https://github.com/ScarecrowFu/dsh-laofu-workbench.git
$ cd dsh-laofu-workbench
$ npm ci
$ npm run dev
✔ 工作台已启动 → http://127.0.0.1:4173
- Node.js ≥ 22.19
- ffmpeg(视频合成)
- Chrome / Edge(Remotion 渲染)
- Windows 或 macOS
稿件、音频、视频与凭据全部存在本机 lwb/local/,不经过任何服务器。模型服务商自己选,配音、字幕与封面生图都可以接到本机 ComfyUI,零云端费用。