李发发工作台 LIFAFA WORKBENCH

从一条信号,到一支成片。
生产线装在自己电脑里。

李发发工作台把口播视频要走的每一步——信号、选题、写稿、配音、字幕、视频、质检、发布——串成一条流水线。模型调用、素材与成片全部留在本机,数据不出门。

渲染 11073 帧 · 约 3.5 分钟 · 246 项单测全绿 · 全程零云端费用

画面
AI 导演 Remotion 渲染 技术质检
配音
MiMo 合成 · 参考音复刻 响度归一
字幕
ASR 出轴 吸附真实停顿
音效
whoosh pop ding

八个阶段,一条流水线

每个阶段是一个独立模块,产物交给下一环。任何一环不过关,任务就地停下,不会把问题带进成片。

  1. 01

    信号

    采集公开来源与 AI 内容日报,筛出值得做的素材。

  2. 02

    选题

    按账号、渠道与切入角度生成候选,加入待写稿。

  3. 03

    写稿

    起稿、润色与稿件检查,动笔之前先确认任务。

  4. 04

    配音

    云端 MiMo 或本地 LongCat,用参考音频复刻音色。

  5. 05

    字幕

    Qwen3-ASR 出轴,切换点吸附真实停顿,误差 0.12 秒。

  6. 06

    视频

    创作 Agent 编写 Remotion 工程,渲染前自动预检。

  7. 07

    质检

    ffprobe 技术质检,独立审片 Agent 真正看片。

  8. 08

    发布

    标题、文案、标签与封面一次备齐,即可发布。

工作台只管通用,
业务交给能力包

底座是 DeepSeek Harness(DSH):对话、模型配置、工具执行与会话管理都由它承担,内核锁定在 dsh-v0.1.6-alpha.1,不做一行改动。

「口播视频内容创作」是第一个能力包。新的业务场景写成独立包装进来——自带页面、任务流程和数据存储,装上即用,卸载保留数据,永远不必把业务写进工作台核心。

  • 账号定位

    受众、内容方向与表达约束,存一次,全程复用。

  • 信号

    内置来源加 AI 日报,素材在这里进站。

  • 选题

    候选、待写稿与选题角度,逐条落位。

  • 写稿

    起稿、编辑、润色,写前确认写后检查。

  • 配音 · 字幕

    云端与本地引擎互斥切换,字幕轴是唯一时间源。

  • 视频 · 审片

    AI 导演写工程,技术质检与独立审片双闸门。

  • 发布资料

    标题文案封面一套抽屉,齐备即可发布。

  • 内容安排

    成片按账号陈列,发布节奏一目了然。

维修记录

一支视频做下来修掉的问题,约 700 行改动、14 个文件,每一条都在真机验证过。留着这份记录,也提醒自己下次别再踩。

  • 音画同步

    画面超前语音 2–3 个章节,18 个场景 13 个切在句子中间。

    场景边界改取真实语音时间轴,渲染前自动核对,错位直接拒渲。

  • 字幕对齐

    按字数估算,字幕在开口前 0.4–1.0 秒就上屏。

    切换点吸附 ffmpeg 量出的句间停顿,固定开口前 0.12 秒出现。

  • 音效淹没

    音效峰值比旁白低 12–21dB,混进成片等于不存在。

    loudnorm 归一化,实测混音中 1.3–1.9 倍于邻域,清晰可闻。

  • 渲染提速

    11073 帧渲染约 20 分钟,根因是渲染浏览器版本不配对。

    指定本机同源 Chrome 后 3.5 分钟完成,快了约 5.7 倍。

  • 审片失明

    审片 Agent 的读图请求全部被拒,三轮审片无条件失败。

    给模型声明图像输入能力,审片真正开始看画面。

  • 选题闪退

    Windows 文件锁让写入 11 次里失败 7 次(EPERM)。

    原子写入加退避重试,12 次并发全过,延迟 6–13 毫秒。

快速开始

一台自己的电脑就够,不需要云服务器。

  • Node.js ≥ 22.19
  • ffmpeg(视频合成)
  • Chrome / Edge(Remotion 渲染)
  • Windows 或 macOS

稿件、音频、视频与凭据全部存在本机 lwb/local/,不经过任何服务器。模型服务商自己选,配音、字幕与封面生图都可以接到本机 ComfyUI,零云端费用。