开源 | Vibecoding爱好者福利

https://github.com/IM-DaXiong/bgxiong-ai-story-docs

**比格熊数字导演工作站(BGXiong Digital Director Workstation)** 是一款面向影视创作者的 **AI 驱动的桌面端创作平台**。它将剧本写作、角色设计、分镜绘制、视频剪辑等环节整合到统一的工作流中,通过接入多种 AI 大模型,让个人创作者也能完成原本需要一整个团队才能做到的影视前期工作。**核心定位**:用 AI 把创意变成可视化的故事 — 从一段文字描述,到有角色、有画面、有声音的完整影像脚本。官网地址 :https://www.bgxiong.com

对外项目综述 | 比格熊

# 项目综述(bgxiong-ai-story)— 比格熊数字导演工作站

| 项 | 说明 |
|----|------|
| **文档性质** | 面向非技术读者的项目全景:市场背景、产品与技术要点、阶段性成果与方向(中性表述)。 |
| **统计口径** | 工程规模统计截至 **2026-07-18**(v0.2.721),仅统计个人自研源码与内部文档,不含第三方依赖库与自动生成的安装包内容。 |

## 1. 定位概览

比格熊数字导演工作站(bgxiong-ai-story)是一套 **AI 驱动的多模态影视前期制作工作站**,产品形态为 **安装在电脑上的桌面客户端软件**(而非浏览器网页产品)。它把故事结构(项目—剧集—场次—片段/镜头)、角色与演员资产、分镜故事板、文本 / 图像 / 视频 / 语音生成、对白编辑与配音、视觉精修、自动剪辑与专业软件导出等 **全流程** 放在 **同一套本地工程与同一应用窗口** 里闭环完成,面向影视、短视频、动漫、广告与教育实训等 **前期创意到粗剪交付** 场景。

产品名称「比格熊数字导演工作站」体现其核心理念:**用 AI 将「一句话故事」自动拆解为完整的可视化制作管线**——从故事种子到剧集、场次、镜头、分镜图、视频成片、配音、自动剪辑、最终导出到专业剪辑软件(如 Final Cut Pro),全链路自动化,大幅降低短视频与动画制作门槛。

相较于 v0.2.618 时期的「AI 分镜工作台」定位,当前 v0.2.721 已演进为 **覆盖从创意到粗剪交付全链路的数字导演工作站**:新增了语音配音工作台、视觉精修编辑工具、AI 自动剪辑引擎、NLE 时间线导出、故事工程备份与迁移、跨平台架构抽象等重大能力模块。产品正从「生成工具」走向「制作管线」。

云端 AI、开放平台接口在本产品中的角色,更接近 **用户按需接驳的能力插件**:用来完成某次生成或某种模型推理;**工程本体、数据结构、任务编排、设置与日志** 仍以客户端与本地存储为主轴。这与「做一个网站外壳,里面嵌各家网页或只转发接口」有本质区别——前者是 **可离线打开的工程文件型生产力工具**,后者往往离不开会话、Cookie 与远端页面形态,数据和体验的掌控链也更短。

---

## 2. 市场视角

- **需求背景**:多工具并行(文档、表格、浏览器里各家模型页面)容易造成上下文断裂、素材与版本散落;创作方难复盘「用了哪家模型、最终下过怎样指令」。短视频与 AI 动画行业爆发式增长,创作者需要从「一句话创意」到「可交付粗剪」的一站式工具,而非多个孤立工具的拼凑。
- **产品切入点**:用 **结构化本地工程** 承接创意流程;用户在设置与各界面里 **明确选定** 文本、配图、改图、视频、语音等通道,系统按选择执行,**不做**用户未同意的暗中替换,降低合规与品控风险。 **自动剪辑引擎** 将分镜素材自动组装为时间线,并导出为 Final Cut Pro 等专业软件可直接打开的项目文件,打通了「AI 生成 → 专业后期」的最后一公里。
- **典型用户**:独立创作者、小型制作组、内容团队、MCN 机构、院校实训等需要在 **可控环境** 下完成从创意到粗剪全流程的群体。

---

## 3. 为什么是桌面客户端

下面几条概括 **客户端路线相对「云端套壳」或「纯浏览器工具」** 的差异;不是说「完全不用云」,而是 **云服务于生成能力,客户端承载创作资产与工业流程**

- **工程与数据默认在用户自己电脑上**
  项目、章节场次关系、分镜结构、任务记录、素材引用等落在 **本地数据库与本地目录**,用户对自己的剧本与物料拥有直观的 **占有感与备份方式**(拷贝文件夹、整机备份、离线归档、工程导出导入),而不是默认「全部托管在第三方网页账号背后」。

- **不绑死在浏览器标签页的生命周期**
  关闭浏览器、清理站点数据、某家网站改版或下线,通常 **不会**一笔勾销你的「工作台形态」。客户端像普通办公软件一样常驻本机,打开即是同一套界面与同一套工程逻辑。

- **云端是「可选外挂」,不是「唯一脊梁」**
  需要文生图、图生图、视频、语音等时再按用户选择去访问各家开放平台;同时支持 **本地装载的大模型**(llama.cpp 文本推理、Whisper 语音识别、本地 TTS 语音合成),弱网、断网或保密环境下仍可浏览与编辑工程结构、跑本地推理,**不把「能上网」当作使用产品的绝对前提**

- **更深地接入本机能力**
  日志与诊断、数据目录配置、可选本地工作流(如 ComfyUI)、大批量读写与路径解析、媒体运行时(FFmpeg 集成)、磁盘清理、运行时自动下载与管理(llama、Whisper、TTS 引擎、FFmpeg)等,都是 **操作系统级客户端** 天然擅长的领域;这些若仅靠网页沙箱,往往处处受限或体验割裂。

- **复杂界面与大体量交互敢往深了做**
  例如大面积无限画布、多标签重度工作台、长列表任务中心、语音波形编辑、视频预览与帧定位——按 **桌面性能预期** 做虚拟渲染与内存策略,而不是在手机浏览器或嵌套网页里「凑合能用」。

- **隐私与对内合规更好叙事**
  敏感台词与设定默认留在本机;对外发出的仅是用户在某个按钮上 **明确触发** 的那次生成请求。机构关心「剧情与素材出不出域」时,客户端架构更容易给出清晰边界。

- **产品心智:工具 vs 入口**
  「云端套壳」常常是聚合入口,换一个模型页等于换一个站;本产品则在客户端内固定 **同一套菜单、同一套设置与能力映射、同一套任务与日志语义**,长期使用成本低,也更像 **正经的生产软件**

---

## 4. 产品与系统概要

- **形态**:Windows 等环境下的 **桌面应用**,界面为现代 Web 技术呈现,与 **本机 Rust 后台服务**(Tauri 2)协同工作,数据主要落在本机。
- **数据**:核心资料使用 **本地 SQLite 数据库**持久保存;数据库采用 **50+ 张表** 覆盖故事结构、画布状态、AI 任务、媒体轨道、语音合成、权限、备份迁移等全领域;数据库、对外接口与界面之间 **字段命名规则统一**(冻结词表 + SSOT 索引),减少「同名不同义」导致的差错。
- **架构**:后端已落地 **四层分层架构**(领域层 → 应用层 → 基础设施层 → 组合层),通过 **170+ 个持久化适配器** 实现领域逻辑与数据库的解耦,为未来扩展(内存存储、远程存储、iOS 适配)奠定基础。
- **智能能力**:既支持对接 **云端** 图像、视频、语音等开放平台能力(即梦、可灵、通义万相、Seedance、OpenAI、DashScope 等),也支持 **本地大模型**(llama.cpp 文本推理、Whisper 语音识别、本地 TTS 语音合成),兼顾联网弹性、离线可能以及隐私敏感场景。
- **运行时管理**:外挂运行时(llama.cpp、Whisper、TTS 引擎、FFmpeg、Python)通过 **版本化 CDN 清单 + 自动下载 + 断点续传** 统一管理,用户无需手动配置复杂环境。
- **运维与排障**:关键操作链路会写入 **本地日志**(tracing 分级日志 + 日志保留策略);涉及后台任务时,从「已提交 → 执行过程 → 结束结果」分段留痕,便于出问题后按时间线追查,而不是只靠口头描述。
- **自动化扩展**:同一套故事与素材的领域模型,还提供 **命令行工具****离线数据库迁移脚本**,便于以后做批处理、脚本或与外部系统对接。

### 4.1 设计上值得单独说的几点

- **用户选定的模型才生效,禁止暗中换通道**
  每一次云端或本地推理,都必须对应用户在当前界面或设置里 **明确选好的服务商与模型**;全局默认值只在「用户尚未选择」时起补充作用。**不允许**对用户没选中的通道自动轮询、悄悄兜底,也不允许例如「参考图失败就无声改成纯文字生图」这类隐蔽替换。这在消费级工具里不常见,但对 **采购合规、成本可归因、结果可复现** 很重要;产品上用统一的模型选择与「记住上次实际使用」的体验,避免多套界面、多套记忆规则打架。

- **最终指令与任务过程可追溯**
  在 **真正发出请求之前**,会把下发给所选模型的 **最终文本指令** 记入可检索日志;纳入任务中心的流程则按 **提交 → 进行中更新 → 结束汇总** 留存。多步骤、多模态的长链路事后可以对齐时间线,有利于长期维护与企业环境交付。

- **故事板:最终台词稿单一来源**
  数据库、接口与界面之间遵循同一套数据约定;分镜故事板里,**最终送给模型的那段提示** 集中在约定的分段内容里统一维护,而不是在多个地方各存一份、时间一长就对不上。这样导出、备份或多端协作时不容易分叉。

- **演员库可以不绑死在某一个故事上**
  「演员」允许作为 **全局可复用资产** 管理,不必先创建某个故事才能建档;跨项目共用肖像与设定时,边界更清晰,后续若做协作或素材库也更容易扩展。

- **设置里的「能力映射」统领全站的模型列表顺序**
  文本、配图、改图、视频、语音等能力,按账号区块与模型行的顺序组成清单,再反映到各功能页的模型下拉列表;顺序与是否隐藏由用户在设置里 **保存****不跟着**厂商网页或偶然的网络返回顺序飘。多家供应商加多台本地模型混用时,这是 **列表可控、心智稳定** 的关键。

- **自研无限画布:为「很多张图 / 很多卡」做的性能策略**
  大面积拖拽、缩放、摆卡片(演员形象墙、场次、分镜浏览、片段画布、Clips 片段画布等)共用一套 **自研画布内核****不依赖**额外的重型第三方画布商业包。做法是分层减负:**只重点处理屏幕附近的内容**(外加一圈缓冲,避免边缘闪烁)、**分批加载**避免一口气创建成百上千张卡片卡住界面、对视野外的元素 **减少无谓绘制**,并对视频、大图在 **离开视野后主动降级或收回资源**,避免「划走了还在后台解码占内存」。缩放以指针为中心、手感一致;瀑布流排布与画布核心分开,多处界面复用同一套交互习惯。内部规格文档中对 **数百个节点** 量级写了性能目标(首次打开耗时、拖动流畅度、内存占用上限),属于「先定体验指标再实现」的基础设施思路。**v0.2.721 新增画布节点编组功能**,支持将多个节点打组管理,大幅提升复杂画布的整理效率。

- **统一 AI 端点注册表与调度层**
  后端 `open_platform` 模块实现统一端点注册表(39 个源文件),即梦、可灵、通义万相、Seedance、OpenAI 等各家接口各异,但业务管线只需调用统一接口。新增厂商只需注册新端点,业务管线零侵入,可持续升级。支持文生图、图生图、图生视频、文生视频、TTS 语音合成、唇形同步等多种生成能力。

- **通用有向图引擎(GraphCore)**
  自研通用图引擎模块,提供有向图的 CRUD、拓扑排序、连通性分析、性能优化等能力,统一支撑分镜故事板、片段画布、Clips 片段画布等多个画布场景的节点连线与关系管理,避免各模块重复造轮子。

- **AI 任务队列与状态机**
  内置完整的 AI 任务队列系统(30 个源文件),含状态机、调度器、分发器、14 种任务类型 Handler、持久化层与事件总线。支持任务并发控制、进度心跳、失败重试、配额管理,面向批量生成场景。

- **本地 AI 能力内置**
  通过 llama.cpp 集成本地文本推理(含 llama-server 灵活模型加载),通过 Whisper 集成本地语音识别,通过本地 TTS 引擎(VoxCPM、IndexTTS 等)集成本地语音合成。在离线、保密或低成本场景下,核心 AI 能力不依赖云端。所有本地运行时通过统一的版本化管理与自动下载机制分发,用户无需手动配置。

- **权限系统与配额管理**
  内置可插拔权限框架(权限后端、装饰器、审计日志、缓存层),支持用户激活、账号管理、AI 任务日配额控制,面向机构采购与团队使用场景。

- **全链路视频生成管线**
  从分镜图到视频成片,支持多家视频模型(即梦、可灵、Seedance、通义万相等)的统一调度,含视频定价、限流、任务生命周期管理、唇形同步(5 种适配器:Hedra、LivePortrait、MuseTalk、Wav2Lip、可灵)、TTS 语音合成、字幕生成等完整管线。

- **ComfyUI 本地工作流深度集成**
  不仅是简单调用,而是完整集成:HTTP/WebSocket 双协议客户端、工作流扫描与编译器、占位符注入、自定义工作流支持、图像/视频双管线、设置管理等(27 个源文件),让用户可以用 ComfyUI 自定义本地生图/生视频流程。

- **FFmpeg 媒体运行时**
  统一的媒体处理层,封装 FFmpeg 的定位、参数构建、执行、探测解析,提供媒体能力注册与格式选择,供视频转码、音频提取、字幕合成、自动剪辑、波形生成等全链路使用。

- **内部 HTTP 桥接服务(Local Bridge)**
  内置本地 HTTP 服务(40 个源文件),作为前端界面与本地 AI 能力之间的高效桥梁。承载自动剪辑、字幕识别、高光检测、封面生成、图像处理等长耗时任务,支持作业队列、进度推送、会话管理与会话级安全守卫。这套架构让本地重任务不阻塞界面交互,用户体验更流畅。

---

## 5. 当前成果(产品与工程)

**功能范围(摘要)**
主要功能页覆盖故事总览、剧集与场次看板、场景与素材管理、分镜故事板与镜头工作台、片段画布(无限画布 + 节点编组)、视频片段管理(Clips)、角色与演员、**对白编辑与配音工作台****语音合成工作台(TTS Studio)****配音项目管理(Voice Studio)****视觉精修编辑工具****AI 自动剪辑引擎****NLE 时间线导出(Final Cut Pro)****故事工程备份与迁移**、任务中心、帮助学习中心等;设置中提供账号与绑定、**能力与模型映射**、可选本地工作流(如 ComfyUI)、**运行时管理(自动下载与版本控制)**、本地模型管理、TTS/视频实验室、诊断与数据存储位置、BUG 报告与日志上云等;界面文案支持中英文。

**研发体量(静态统计,便于理解投入)**

| 类别 | 文件数 | 代码行数(约) |
|------|--------|----------------|
| 后端桌面服务(Rust) | 1,542 | 31.1 万 |
| 前端界面与逻辑(TS/TSX) | 3,515 | 43.3 万 |
| **自研程序合计** | **≈ 5,057** | **≈ 74.4 万** |
| 内部设计 / 规范 / 记录文档 | ≈ 1,534 | — |

**技术栈明细**

| 层 | 技术选型 |
|----|----------|
| 桌面壳 | Tauri 2(Rust 进程托管,非 Electron) |
| 前端框架 | React 19.2 + TypeScript 5.9 + Vite 8 |
| 前端测试 | Vitest 4.1 |
| 后端语言 | Rust(edition 2021) |
| 数据库 | SQLite(WAL 模式 + r2d2 连接池) |
| 架构模式 | 四层分层架构(领域层 / 应用层 / 基础设施层 / 组合层) |
| 持久化层 | 170+ SQLite 适配器,依赖反转设计 |
| Rust 依赖 | 771+ 个 crate |
| AI 调度 | 统一端点注册表(open_platform),云端/本地双模式 |
| 本地 AI | llama.cpp(文本推理)+ Whisper(语音识别)+ 本地 TTS(VoxCPM、IndexTTS 等) |
| 运行时管理 | 版本化 CDN 清单 + 自动下载 + 断点续传 |
| 媒体处理 | FFmpeg 集成(视频转码、探测、合成、波形生成、静音检测) |
| 本地桥接 | 内部 HTTP 服务(作业队列、进度推送、会话管理) |
| 图像生成 | 即梦、通义万相、ComfyUI 等 |
| 视频生成 | 即梦、可灵、Seedance、通义万相等 |
| 语音合成 | 多家云端 TTS + 本地 TTS 引擎(适配器架构) |
| 唇形同步 | 多适配器架构(Hedra、LivePortrait、MuseTalk、Wav2Lip、可灵) |
| 自动剪辑 | AI 驱动的镜头边界检测(BTD)+ FCPXML 时间线生成 |
| NLE 导出 | Final Cut Pro XML(FCPXML)导出 |
| 本地工作流 | ComfyUI 完整集成(HTTP/WebSocket、工作流编译器、管线注入) |
| 自动更新 | Tauri Updater(被动安装模式,支持静默后台下载) |
| 权限系统 | 可插拔权限框架 + 日配额管理 + 审计日志 |
| 异步运行时 | Tokio(多线程) |
| HTTP 客户端 | reqwest 0.13(native-tls、HTTP/2、gzip、multipart、stream) |

大量内部文档对应作者在 **数据约定、交互规范、故障排查与版本迁移** 上的持续沉淀,便于长期维护与日后扩展。

---

## 6. 后端核心模块地图

后端共 1,542 个 Rust 源文件,按职责划分为以下核心模块群:

| 模块群 | 关键内容 | 职责 |
|--------|----------|------|
| **故事管线** | `story_chapter_pipeline``chapter_scenes_plan`(pipeline / plan_granularity / scene_shots_pipeline / content_parser / llm_client)、`story_sync_pipeline``story_role_generation` | 故事→剧集→场次的 LLM 级联生成;场次规划粒度校验与自动修复;故事圣经同步管线;故事角色 AI 生成 |
| **分镜引擎** | `storyboard_*`(specs / stage_a / stage_b / merge / rules / render / graph / composition_compiler / image_prompt_lint / compiler_lint_contract / shot_membership / shot_number_policy / playbook / continuity / shot_prompt_optimize / stage_a_inputs / stage_b_ingest) | 分镜生成、导演化语义层、质量门、渲染输出、构成编译器、提示词校验、编译器校验合约、镜头成员关系、镜头编号策略、**分镜剧本动作语法****镜头连续性批量编排****镜头提示词智能优化** |
| **提示词工程** | `ai_prompts/`(builtins×35+ / render / types / registry)、`prompt_expert/`(gate / registry / genre_axis / style_axis / slots) | 内置提示词模板库、渲染引擎;**动态提示词专家系统**:叙事类型轴 + 风格轴 + 插槽组装,替代硬编码模板 |
| **叙事与风格** | `narrative_genre/``creative_format/``ai_output_language/``story_style_domain.rs` | 叙事类型定义、创意格式定义、AI 输出语言门控、故事级画面风格单一来源 |
| **AI 任务队列** | `ai_queue/`(state_machine / scheduler / dispatcher / facade / events / persistence / handlers×14) | 完整任务队列:状态机、调度、分发、14 种 Handler、持久化、配额管理 |
| **开放平台** | `open_platform/`(provider / dispatch / gen_error / provider_metadata / tts / jimeng / volc_* / kling_* / dashscope_* / qwen / seedance) | 统一端点注册表、多厂商适配、错误归一化 |
| **图像生成** | `image_generation/`(multi_view / persist / pipelines / refine_service / refine_session_store / service / visual_style) | 生图管线、多视角定妆照、视觉风格词表注册表、精修服务与会话存储 |
| **视觉编辑** | `visual_edit/`(bridge / capabilities / ops / persist / storage / submit)、`refine_local_edit/`(ops / types)、`refine_regions/`(guide / preview / selection) | **图像精修编辑管线**:裁剪、蒙版笔刷、旋转、笔刷合并;区域引导与选择;提交校验与持久化 |
| **图像布局分析** | `image_layout_analysis/`(vision_adapter / cache / graph / vocabulary / validate / staging / consumers) | **AI 驱动的画面构成分析**:视觉模型适配、缓存层、构图词汇表、轴连续性校验、提示词片段生成 |
| **外观提取管线** | `appearance/`(extract / batch_extract / ingest / persist / sanitize / digest / bundle_schema / effective_portrait_prompt / narrative_assembly / ensure) | 角色外观特征提取、批量处理、持久化、提示词组装 |
| **演员描述优化** | `cast_portrait_description_optimize/`(catalog / optimize / orchestrate / router / validate) | 演员定妆描述智能优化、多模型路由、结果验证 |
| **定妆照构建** | `portrait_build/`(catalog / compose / digest / ipc / resolve / types / validate) | **定妆照构建管线 v2**:目录化配置、组合引擎、摘要、校验、前后端 IPC 对齐 |
| **视频管线** | `video_task``video_task_poller``video_param_mapper``video_rate_limiter``video_pricing``segment_video_pipeline``segment_video_narrative/`(compose / hydrate / resolve / optimize_parse / persist)、`video_prompt_compiler``video_prompt_pipeline/`(vendor_optimize) | 视频任务调度、轮询、参数映射、限流、定价;**片段视频叙事引擎**:组装→注入→解析→优化→持久化;提示词编译与供应商优化 |
| **视频后期** | `video_post_process/`(preflight / provider / resolve / volc_mediakit)、`video_delivery/`(capabilities / planner) | **视频后期处理管线**:预检、供应商解析、火山引擎 MediaKit 集成;**视频交付规划器** |
| **自动剪辑** | `auto_edit/`(btd / cfr_proxy / cleanup / detect / subtitles / types)、`autocut_fcpxml/`(time / xml_util) | **AI 自动剪辑引擎**:镜头边界检测(BTD)、CFR 代理生成、字幕对齐、素材清理;**FCPXML 时间线生成**,导出至 Final Cut Pro |
| **Clips 导出** | `clips_export/`(archive_orphans / copy_plan / fcpxml / naming / paths / progress / resolve_media / scan / scan_history) | **片段工程导出**:FCPXML 生成、媒体文件归档、复制计划、进度推送、历史扫描 |
| **高光检测** | `highlight_pipeline/`(prompt / run / validate) | **AI 高光片段检测**:LLM 驱动的内容分析,自动识别精彩片段 |
| **ComfyUI** | `comfyui/`(client / commands / pipeline / workflow / http / settings / analyzer) | 本地 ComfyUI 完整集成(双协议、编译器、管线) |
| **本地 AI** | `local_ai/`(text_generation / speech_recognition / llama_server / model_manager / speech_synthesis) | llama.cpp 文本推理、Whisper 语音识别、本地 TTS 引擎(VoxCPM、IndexTTS 适配器) |
| **运行时管理** | `runtimes/`(download / llama / whisper / tts / ffmpeg_ensure / python / locator / registry / migrate / active) | **统一运行时生命周期**:版本化 CDN 清单解析、自动下载安装、版本迁移、激活管理 |
| **语音与配音** | `speech/`(adapters×4 / dialogue_audio_state / materialize / synthesis_request / tts_mode_capability / tts_reference_audio / tts_reference_prepare)、`voice_studio/`(export / model / repository / segment_text / service) | **统一语音合成层**:DashScope / Mimo 适配器、对话音频状态管理、参考音频预处理;**配音项目管理**:导出、分段文本、服务层 |
| **唇形同步** | `lipsync_provider/`(factory / hedra / kling / liveportrait / musetalk / wav2lip) | 5 种唇形同步适配器 |
| **音频处理** | `audio_align/`(cross_correlate / envelope / pcm)、`audio_silence/` | **音频对齐**(互相关算法 + 包络检测)、**静音检测与尾部裁剪** |
| **角色与演员** | `role_nodes``role_physique``role_portrait_supplement``portrait_*``visual_asset/``role_display_name``portrait_frame/` | 角色管理、体型管线、肖像版本链、场景/道具资产、显示名、**定妆照相框管理** |
| **片段画布** | `segment_canvas/`(commands / queries / types / utils / canvas_commands×8 / grouping) | 无限画布引擎、画布状态持久化、**节点编组**、快照、迁移、场景锚点、批量导入 |
| **画布输入端口** | `canvas_input_ports/`(fixtures / tests)、`canvas_input_ports_app/` | **统一画布端口系统**:含测试夹具与单元测试,支撑片段、Clips 等多画布场景 |
| **画布卡片** | `canvas_card_config/`(storyboard_shot)、`canvas_image_nodes/` | 画布卡片配置、图像节点管理 |
| **画布瓦片预览** | `canvas_tile_preview/`(commands / ensure / cleanup / meta / paths) | 画布瓦片预览派生缓存(读侧 SSOT),webp 缩略图生成、LOD 加载策略与清理 |
| **视频瓦片海报** | `video_tile_poster/`(commands / ensure / cleanup) | 视频瓦片海报帧提取与缓存管理 |
| **Clips 片段** | `clips/`(commands×11 / types / clip_video_meta)、`clip_framework/` | 视频片段 CRUD、导入、导出、画布、视频绑定;**片段框架索引** |
| **图引擎** | `graph_core/`(engine / runtime / store / types / perf) | 通用有向图引擎,支撑分镜、片段画布与 Clips 画布 |
| **工作流图** | `workflow_graph_store/` | **工作流图持久化存储**,支撑复杂编辑工作流的节点编排 |
| **媒体运行时** | `media_runtime/`(ffmpeg_cli / service / registry / selector / capabilities) | FFmpeg 集成、媒体能力注册、格式探测 |
| **本地桥接服务** | `local_bridge/`(http / transport / handlers / job_store / app_state / auto_edit_worker / cover_worker / highlight_worker / image_worker / subtitle_timeline_worker / subtitle_recognize_handler / llm / speech_trim / progress_emit) | **内部 HTTP 桥接服务**(40 个源文件):12 条 HTTP 路由、传输认证、作业队列存储、6 种后台 Worker、LLM 调用、语音裁剪、进度事件推送 |
| **参考图策略** | `pad_policy/`(envelope_v3 / materialize / materialize_manual / patch / persist / scope / dismissal / shot_visible_characters / profile_workbench / stable_key / host_adapter / migrate_v2) | **参考图策略引擎 v3**:信封持久化、手动物化、补丁、作用域、角色可见性、工作台画像、v2 迁移 |
| **故事备份** | `story_backup/`(collector / commands / export / import / integrity / media_refs / scope / table_registry / types) | **故事工程备份与迁移**:全量导出、预览、导入(含 ID 重映射)、完整性校验、媒体引用追踪 |
| **权限与安全** | `permission/`(mod / backends / decorator / integration / db_migrations / example)、`authz/`(facade / registry / enforce_opts / session_bootstrap / lease / tests)、`credential_crypto``quota_guard` | 可插拔权限框架、授权会话引导增强、凭证加密、配额管理 |
| **跨平台架构** | `platform/`(traits / desktop / context / error) | **平台抽象层**(21 个源文件):能力、配置、凭证、路径、进程、存储、窗口宿主七维 trait 接口 + 桌面端实现 |
| **四层架构** | `domain/`(entities / ports / nodes / error)、`application/`(ports / dto / services)、`infrastructure/`(persistence / sqlite)、`composition/`(app_container) | **领域驱动设计四层架构**:9 个领域实体 + 12 个 Repository 端口;35+ 个 Application 端口 + 8 个 Service;170+ 个 SQLite 适配器;组合根依赖注入容器 |
| **数据库** | `db/`(schema / pool / backup / migrations×18+ / model_catalog_repo)、`migration/` | SQLite 迁移(50+ 张表)、连接池、备份、模型目录 |
| **电影语言** | `cinematic_language/`(framing / schema_gen / mod) | 画面构成枚举(占幅/裁切/透视)、JSON Schema 生成、Stage A v3 SSOT |
| **云端身份** | `cloud/`(client_identity) | 云端客户端身份标识与会话管理 |
| **应用更新** | `app_update_boot.rs``app_update_download/` | 应用冷启动更新检查与静默后台下载 |
| **激活管理** | `activation_client/` | **客户端激活管理**:许可证激活与验证 |
| **文档文本导入** | `document_text/`(mod / docx / rtf / plain / registry / types / limits) | 外部文档文本提取(DOCX/RTF/TXT),支持拖拽导入剧本 |
| **通用下载** | `generic_downloader/`(fetch / paths / resume / session / types)、`resumable_download/`(fetch / paths / resume / throttle / types) | **通用文件下载器** + **断点续传下载器**(流量控制),支撑运行时、模型等大文件分发 |
| **远程资源** | `remote_resource/`(manual_install / mirror_chain) | **远程资源镜像链**:多源回退下载 + 手动安装指引 |
| **软等待** | `soft_wait/`(etag / pull / types) | **ETag 条件轮询**:高效的异步任务结果等待机制 |
| **渲染适配** | `render_target_adapter/`(image_adapter / video_adapter / types) | **渲染目标适配器**:统一图像/视频两种渲染出口 |
| **运维** | `log_init``disk_cleanup``bug_report``app_update_*` | 日志、磁盘清理、BUG 报告打包上传、自动更新 |

---

## 7. 前端核心模块地图

前端共 3,515 个 TSX/TS 源文件,按职责划分为以下核心模块群:

| 模块群 | 关键目录 | 职责 |
|--------|----------|------|
| **故事 Tab** | `components/story-tab/`(StoryTab / hooks / modals / ui) | 故事总览、剧集列表、故事圣经编辑器、剧集插入、剧本文案保存弹框、导出脚本 |
| **剧集 Tab** | `components/chapter-tab/`(panels / sections / modals / hooks) | 剧集看板、场次规划、关键帧、批量生成 |
| **场次 Tab** | `components/scene-tab/` | 场次列表、上下文菜单、加载态 |
| **分镜工作台** | `components/storyboard/`(panels / modals / hooks / history / graph / orchestration) | 分镜故事板、镜头工作台、AI 提示词版本历史、视觉参数同步、批量生成编排 |
| **分镜镜头内容** | `components/storyboard-shot-content/` | 分镜镜头编辑:画幅比、镜头角度、景别、用户自定义字段、**视觉参数区块** |
| **分镜画布** | `components/storyboard-shot-canvas/`(renderers / overlays / handlers / minimap) | 分镜节点画布、边渲染、缩放控件 |
| **片段画布** | `components/segment-canvas/`(graph / domain / transitions) | 无限画布、图推导、撤销重做、**节点编组**、瓦片同步、**场景锚点** |
| **角色 Tab** | `features/character-tab/`(canvas / editor / actor-list / columns / layout / ai / pads) | 角色管理、演员列表、**演员编辑器**、定妆照画布、AI 生成 |
| **角色 Tab** | `features/role-tab/`(canvas / detail / hooks / modals / lightbox / portrait-pads / domain / ai) | 角色详情、肖像灯箱、批量肖像生成 |
| **视觉资产库** | `components/visual-asset-library-tab/` | 视觉资产统一管理、编辑、列表展示 |
| **Clips 片段** | `clips/`(ClipsCanvas / ClipsNodeEditor / ClipsMinimap / ClipsVideoPreview / ClipsImportModal / ClipsExportAllModal) | 片段画布、节点编辑、**导入导出(含 FCPXML)**、视频预览 |
| **对白编辑器** | `components/dialogue-editor/`(DialogueTrackEditorPanel / DialogueTrackCard / DialogueTrackList / DialogueTtsRichPanel / DialogueAudioVersionList / DialogueRoleSelector / DialogueTextEditorField / DialogueTrackVideoPreview / AudioPlayer) | **对白轨道编辑器**(15 个组件):多轨对白编辑、TTS 音频生成、角色选择、音频版本管理、视频预览联动 |
| **语音合成工作台** | `components/speech-synthesis-workbench/`(SpeechSynthesisWorkbenchShell / ReferenceAudioPanel / SpeechSynthesisParamsBody) | **语音合成工作台**:参考音频管理、合成参数配置、多模型切换 |
| **TTS 工作室** | `components/tts-studio/`(TtsStudioWorkbench / TtsStudioWorkbenchModal / TtsStudioTextPanel / TtsStudioResultPlayer / EmotionControlPanel / TtsSidecarProgressOverlay) | **TTS 工作室**(6 个组件):文本面板、情感控制、结果播放器、侧车进度叠加层 |
| **配音工作室** | `components/voice/`(VoiceTab / VoiceWorkbench / VoiceSynthesisPanel / VoiceProjectList / VoiceTaskList / VoiceExportAllModal / VoiceRenderRow / VoiceResultPlayer / VoiceTextPanel / WaveformBars / WaveformPlayer / WaveformThumbnail / InputLevelMeter / ReferenceAudioPanel / ReferenceAudioWaveform / ReferencePrepareProgressOverlay) | **配音项目管理**(17 个组件):项目列表、合成面板、任务列表、波形可视化、导出、参考音频管理 |
| **视觉编辑** | `components/visual-edit/`(plugins/CropRectPlugin / MaskBrushPlugin) | **图像精修编辑**:裁剪矩形插件、蒙版笔刷插件 |
| **精修编辑工具** | `components/refine-edit-tools/`(CropOverlay / MaskBrush / QuickSelect / UndoRedo / ShortcutBindings) | 裁剪、蒙版、快速选择等视觉编辑工具集 |
| **运行时管理** | `components/runtime-auto-download/`(RuntimeAutoDownloadOverlayHost) | **运行时自动下载面板**:进度展示、状态管理 |
| **跨平台模块** | `platform/`(capabilities / hostIntegration / invariant / shell / usePlatformShell) | **平台能力抽象**:能力查询、宿主集成、平台 Shell、不变式校验 |
| **设置 Tab** | `components/settings-tab/` / `components/settings/` | 账号、能力映射、ComfyUI、本地模型、TTS/视频实验室、**运行时下载管理**、数据迁移 |
| **帮助模块** | `help-module/` | 学习中心、引导 |
| **认证** | `auth/`(AuthProvider / store / sessionLifecycle) | 登录、注册、密码重置、Token 管理、会话生命周期 |
| **面板弹出多屏** | `components/popout-panel/``app-shell/PopoutEntityHostExecuteRegistrar.tsx``app-shell/SidebarFloatingLayer.tsx` | 画布面板弹出为独立窗口,多屏协作工作流 |
| **模型能力卡片** | `components/model-capabilities/`(CapabilityCardShell / T2iCapability / I2iCapability / TextCapability / SpeechCapability) | 统一的模型能力展示卡片组件 |
| **多视角提示词** | `components/multi-view/``domain/multi-view/prompt-pipeline/` | 多视角定妆照提示词五阶段管线前端对齐 |
| **画布宿主** | `components/canvas-host/ConnectedCanvasShell.tsx` | 统一画布宿主壳层,接入持久化与同步 |
| **画布瓦片预览** | `domain/canvas-tile-preview/`(lodPolicy / previewCache / useCanvasTileDisplayUrl) | 画布瓦片 LOD 分级加载策略、预览缓存、显示 URL hook |
| **UI 组件库** | `components/ui-*`(modal / toast / panel / form / icon / list / lightbox / edge-resize-shell / chrome-textarea / chrome-select / misc) | 通用 UI 原子组件 |
| **无限画布内核** | `infinite-canvas/`(InfiniteCanvas / components / hooks / utils / layout / canvas-chrome / CanvasNodeTileDockPanel) | 自研画布引擎:四叉树空间索引、masonry 布局、虚拟化渲染、缩放平移、瓦片边框、持久化、节点停靠面板 |
| **领域逻辑** | `domain/`(model-surfaces / local-media-upload / audio / imageGenWarnings / multi-view / reference-pad / canvas-tile-preview / storyboard-shot / document-text-import / segmentContent / **actor-editor** / **chapter-editor** / **content-autosave** / **dialogue-tts** / **local-tts** / **narrative-genre** / **refine-edit-tools** / **segment-video-narrative** / **speech-synthesis-workbench** / **story-production-genre** / **tts-bootstrap** / **tts-reference** / **tts-sidecar** / **tts-studio** / **visual-edit** / **voice**) | 模型选择编解码、上传队列、音频、生成警告、多视角生成、参考面板、画布瓦片预览 LOD、分镜视觉参数会话、文档文本导入、片段内容 SSOT、**演员编辑器****剧集编辑器****内容自动保存****对白 TTS****本地 TTS****叙事类型****精修编辑工具****片段视频叙事****语音合成工作台****故事制作类型****TTS 引导****TTS 参考****TTS 侧车****TTS 工作室****视觉编辑****配音** |
| **API 层** | `api/`(graphApi / migration / segmentCanvasV2Api / clipFramework) | Tauri IPC 调用封装 |
| **快捷键** | `shortcuts/` | **全局快捷键系统**:统一快捷键绑定与管理 |
| **系统** | `system/`(form-control-clipboard / selectable-copy) | 右键复制粘贴、可选复制 |

---

## 8. 数据架构概览

本地 SQLite 数据库采用 **幂等迁移** 策略,当前包含 **50+ 张表**,按领域分组:

| 领域 | 核心表 | 说明 |
|------|--------|------|
| **故事结构** | `stories``nodes``edges``node_chapter_order` | 故事→剧集→场次→片段的层级图 |
| **画布状态** | `segment_canvas_node``segment_canvas_edge``segment_canvas_layout_state``segment_canvas_view_state``segment_canvas_snapshot``segment_canvas_file_ref``segment_canvas_delete_audit``segment_canvas_placement_order`**`segment_canvas_grouping`** | 片段画布全量持久化 + **节点编组** |
| **画布端口** | **`canvas_input_ports_segment`****`canvas_input_ports_clips`****`canvas_input_ports_offline`** | **统一画布输入端口持久化**(片段/Clips/离线) |
| **画布图像** | **`canvas_image_nodes`** | **画布图像节点元数据** |
| **AI 任务** | `ai_tasks``ai_queue_tasks``ai_queue_task_events` | 任务记录 + 队列持久化 + 事件流 |
| **分镜** | `storyboard_graph_state``storyboard_shot_specs``storyboard_scene_revision`**`storyboard_character_scope`****`storyboard_character_lock`****`storyboard_continuity`****`storyboard_manual_segment`****`storyboard_merge_conditioning`****`storyboard_merge_consistency`****`storyboard_merge_pad`** | 分镜图状态、镜头规格、场次修订、**角色范围与锁定****镜头连续性****手动分段****合并条件与一致性** |
| **角色与资产** | `assets``scene_assets``prop_assets``role_portrait_versions``portrait_last_generations`**`portrait_builds`****`portrait_frames`****`portrait_extracted_hints`** | 全局资产、场景/道具资产、肖像版本链、**定妆照构建记录****相框配置****外观提取提示** |
| **参考图策略** | **`pad_policy_envelope`****`pad_policy_scope`****`pad_policy_workbench`****`pad_policy_video_workbench`****`pad_policy_shot_visible`****`pad_policy_upstream_*`** | **参考图策略引擎 v3 持久化**:信封、作用域、工作台画像、角色可见性、上游自动绑定 |
| **内容历史** | `node_content_history``story_content_history``scene_asset_content_history``prop_asset_content_history``video_workbench_session_history` | 版本回溯、撤销依据 |
| **Clips** | `clips``clip_edges``clip_framework_index``clips_canvas_viewport``clips_canvas_tile_pos``clips_canvas_placement_order` | 视频片段图、画布视口、排列、**框架索引** |
| **Clips 导出** | **`clips_export_history`** | **片段导出历史记录** |
| **媒体轨道** | `audio_tracks``dialogue_tracks``lipsync_providers` | 音频轨、对话轨、唇形同步供应商 |
| **对白音频** | **`dialogue_audio_versions`****`dialogue_audio_state`** | **对白音频版本链****音频状态管理** |
| **语音合成** | **`tts_reference_audio`****`tts_studio_projects`****`voice_studio_projects`****`voice_studio_tasks`****`speech_synthesis_jobs`** | **TTS 参考音频****TTS 工作室项目****配音项目与任务****语音合成作业** |
| **模型配置** | `model_official_catalog``model_capability_catalog``app_user_settings` | 官方模型目录、能力目录、用户设置 |
| **运行时** | **`runtime_registry`****`runtime_download_sessions`** | **运行时版本注册表****下载会话管理** |
| **故事备份** | **`story_backup_exports`****`story_backup_imports`****`migration_exports`****`migration_imports`** | **故事工程导出/导入记录****迁移导出/导入** |
| **删除编排** | **`delete_orchestration_inventory`** | **级联删除编排清单**:删除前的影响范围预估 |
| **权限** | `user_permissions``permission_audit_log``user_permissions_cache` | 用户权限、审计日志、缓存 |
| **布局** | `actor_list_layout``story_node_list_layout``chapter_scene_list_layout``scene_asset_list_layout``prop_asset_list_layout`**`chapter_bundle_layout`****`segment_play_order`****`segment_scene_order`** | 各列表拖拽排序持久化;**剧集包布局****片段播放顺序****片段场次顺序** |
| **图引擎** | `graph_core_graph`**`workflow_graph_state`** | 通用有向图持久化、**工作流图状态** |
| **其他** | `user_tier_cloud``task_running_wait_tips``dialogue_tracks``video_workbench_session_history`**`activation_state`****`local_media_uploads`****`orphan_references`** | 云端用户层级、运行提示、**激活状态****本地上传****孤儿引用追踪** |

---

## 9. 近期重大更新(v0.2.618 → v0.2.721,2026.6.17—7.18)

自 v0.2.618 以来,31 天内完成 **169 次提交**,涉及 **2954 个文件变更**(新增约 21.2 万行,删除约 7.1 万行)。自研代码总量从约 57.6 万行增长至约 **74.4 万行**(+16.8 万行),文件数从约 4,153 增至约 **5,057**(+904 文件)。版本号跨越 0.2.618 → 0.2.721,标志产品从「AI 分镜工作台」向「全链路数字导演工作站」的实质性飞跃。以下按主题归纳重大更新:

### 9.1 AI 自动剪辑引擎与 NLE 导出(7/2—7/10)

**这是本阶段最具里程碑意义的能力升级**——产品从「生成素材」跨越到「自动剪辑 + 专业软件交付」。

- **AI 自动剪辑引擎**`auto_edit/`,7 个源文件):AI 驱动的镜头边界检测(BTD)、CFR 代理生成、字幕对齐、素材清理。自动分析分镜视频素材,识别镜头切换点并生成时间线。
- **FCPXML 时间线生成**`autocut_fcpxml/`,3 个源文件):将 AI 分析结果生成 Final Cut Pro 可识别的 FCPXML 时间线文件,用户可直接在 Final Cut Pro 中打开、继续精剪。
- **Clips 导出体系**`clips_export/`,13 个源文件):片段工程导出为 FCPXML 时间线,含媒体文件归档、复制计划、进度推送、历史扫描。
- **内部 HTTP 桥接服务**`local_bridge/`,40 个源文件):作为前端与自动剪辑、字幕识别、高光检测、封面生成等长耗时本地任务的中间层,支持作业队列、进度推送、会话管理。

### 9.2 语音与配音工作台(6/25—7/17)

**配音能力从实验性功能升级为完整工作台**,覆盖从文本到合成、编辑、导出全流程。

- **统一语音合成层**`speech/`,12 个源文件):DashScope、Mimo 等多供应商适配器,对话音频状态管理,参考音频预处理,TTS 模式能力检测。
- **配音项目管理**`voice_studio/`,6 个源文件):配音项目的创建、管理、导出,分段文本与 TTS 任务编排。
- **对白编辑器**(15 个前端组件):多轨对白编辑面板,支持逐句 TTS 生成、角色选择、音频版本管理、视频预览联动。
- **TTS 工作室**(6 个前端组件):文本输入、情感控制、结果播放器、进度叠加层。
- **配音工作台前端**(17 个组件):项目列表、合成面板、任务列表、波形可视化与播放器、导出、参考音频管理、输入电平表。
- **音频对齐**`audio_align/`,4 个源文件):基于互相关算法的音频对齐,支持包络检测与 PCM 处理。
- **静音检测**`audio_silence/`):静音段检测与尾部裁剪,提升对白音频质量。

### 9.3 视觉编辑与精修工具(7/9—7/15)

**图像生成后处理能力从概念落地为可用的编辑管线**

- **视觉编辑管线**`visual_edit/`,19 个源文件):裁剪、蒙版笔刷、旋转、笔刷合并等操作的完整后端管线,含提交校验、持久化存储、生图桥接。
- **本地精修编辑**`refine_local_edit/`,8 个源文件):本地图像编辑操作(裁剪、旋转、笔刷合并、笔画栅格化)。
- **精修区域选择**`refine_regions/`,4 个源文件):区域引导、预览生成、选区管理。
- **前端编辑插件**:裁剪矩形插件、蒙版笔刷插件;配合已有的快速选择、撤销重做、快捷键绑定等工具。
- **图像布局 AI 分析**`image_layout_analysis/`,18 个源文件):AI 视觉模型驱动的画面构成分析,含构图词汇表、轴连续性校验、缓存层、提示词片段生成。为后续智能构图建议与自动优化奠定基础。

### 9.4 跨平台架构抽象(6/18—7/14)

**为 iOS/iPad 支持铺设的架构地基**全面落地。

- **平台抽象层**`platform/`,21 个源文件):能力、配置、凭证、路径、进程、存储、窗口宿主七维 trait 接口 + 桌面端完整实现。
- **前端平台模块**`platform/`,6 个源文件):能力查询、宿主集成、Shell 抽象、不变式校验。
- **架构意义**:后端核心逻辑与操作系统解耦,iOS 端只需实现对应的 trait 接口,无需修改任何业务代码。

### 9.5 四层分层架构落地(6/7—7/18)

**从 MVC 模式向领域驱动设计(DDD)四层架构的全面迁移**

- **领域层**`domain/`,15 个源文件):9 个领域实体 + 12 个 Repository 端口接口,定义纯业务逻辑。
- **应用层**`application/`,48 个源文件):35+ 个 Repository trait + 8 个 Application Service,封装业务用例。
- **基础设施层**`infrastructure/`,170+ 个源文件):SQLite 适配器全面覆盖各领域,通过依赖反转实现领域层与数据库的解耦。
- **组合层**`composition/`,2 个源文件):依赖注入容器,统一管理各层组件的创建与装配。
- **架构意义**:为未来扩展(内存存储、远程存储、iOS Core Data 适配)提供了清晰的插拔边界。170+ 个 SQLite 适配器按单一职责原则拆分,每个适配器只负责一个领域聚合的持久化。

### 9.6 提示词专家系统(7/9—7/14)

**从硬编码提示词模板向动态组装专家系统的跃迁**

- **提示词专家引擎**`prompt_expert/`,7 个源文件):叙事类型轴 + 风格轴 + 插槽的动态组装,替代固定模板。
- **叙事类型定义**`narrative_genre/`):正式的故事叙事类型元数据。
- **创意格式定义**`creative_format/`):创意产出的格式约定。
- **AI 输出语言门控**`ai_output_language/`):基于用户设置的输出语言自动切换。
- **架构意义**:添加新的叙事类型或风格不再需要修改模板文件,只需注册新的轴条目和插槽映射。

### 9.7 运行时统一管理(6/28—7/10)

**外挂运行时从「用户自己装」升级为「自动下载 + 版本管理」**

- **运行时管理**`runtimes/`,21 个源文件):版本化 CDN 清单解析、自动下载安装、断点续传、版本迁移、激活管理、FFmpeg 确保、Python 定位。
- **运行时注册表**`runtime_registry` 表):持久化记录各运行时的版本与安装状态。
- **通用下载器**`generic_downloader/` + `resumable_download/`,12 个源文件):支持多源回退、流量控制、断点续传的通用文件下载基础设施。
- **前端运行时管理**`runtime-auto-download/`):自动下载进度面板,用户可见的运行时状态管理。
- **架构意义**:用户安装产品后,llama.cpp、Whisper、TTS 引擎、FFmpeg 等运行时自动按需下载,无需手动配置复杂环境。

### 9.8 故事工程备份与迁移(7/1—7/11)

**从「数据库文件就是工程」升级为「结构化导出/导入」**

- **故事备份**`story_backup/`,13 个源文件):全量导出(含媒体文件引用追踪)、完整性校验、预览、导入(含 ID 重映射)、表注册表。
- **迁移增强**`migration/`):导出/导入记录持久化、跨版本兼容。
- **架构意义**:用户可以像 Office 文档一样「另存为」和「打开」工程文件,为协作与分发奠定基础。

### 9.9 分镜引擎增强(7/11—7/17)

- **分镜剧本动作语法**`storyboard_playbook/`,2 个源文件):定义场景类型的结构化动作描述语言。
- **镜头连续性批量编排**`storyboard_continuity/`,3 个源文件):批量链式处理分镜镜头的上下文连续性。
- **镜头提示词智能优化**`storyboard_shot_prompt_optimize/`,5 个源文件):基于邻居镜头上下文自动优化当前镜头的提示词。
- **Stage A 输入管理**`storyboard_stage_a_inputs/`):分镜 Stage A LLM 输入的标准化管理。
- **Stage B 摄取管理**`storyboard_stage_b_ingest/`):分镜 Stage B 输出结果的标准化摄取。

### 9.10 画布系统升级(7/3—7/18)

- **画布节点编组**(7/17):支持将多个画布节点打组,统一拖拽、缩放、管理,大幅提升复杂画布的整理效率。
- **统一画布输入端口**`canvas_input_ports/` + `canvas_input_ports_app/`):含测试夹具与单元测试的端口系统,统一片段、Clips 等多画布场景的连线端口逻辑。
- **画布卡片配置**`canvas_card_config/`):可配置的画布卡片系统,支持分镜卡片等不同卡片类型的定制化展示。
- **画布图像节点**`canvas_image_nodes/`):独立的图像节点元数据管理。
- **画布删除流程优化**:完整的级联删除编排系统(`delete_orchestration/`),删除前预计算影响范围。

### 9.11 其他重要改进

- **高光检测管线**`highlight_pipeline/`,3 个源文件):LLM 驱动的视频精彩片段自动识别。
- **片段视频叙事引擎**`segment_video_narrative/`,10 个源文件):视频叙事的组装→注入→解析→优化→持久化全链路。
- **视频后期管线**`video_post_process/` + `video_delivery/`,8 个源文件):后期预检、火山引擎 MediaKit 集成、交付规划。
- **定妆照构建管线 v2**`portrait_build/`,9 个源文件):目录化配置、组合引擎、摘要、校验、前后端 IPC 对齐。
- **定妆照相框管理**`portrait_frame/`):独立的相框配置与管理。
- **参考图策略引擎 v3**`pad_policy/`,15 个源文件):信封持久化 v3、手动物化、补丁机制、作用域、角色可见性、工作台画像、v2 迁移。
- **客户端激活管理**`activation_client/`):许可证激活与验证。
- **全局快捷键系统**`shortcuts/`):统一的快捷键绑定与管理。
- **内容自动保存**`domain/content-autosave/`):编辑器内容的自动保存机制。
- **启动白屏修复**:消除发布版冷启动时的白色闪烁与命令行窗口闪现。

---

## 10. 未来与演进方向

### 10.1 跨平台架构升级(iOS/iPad 支持)

已启动跨平台基础架构升级,目标是让产品能在 iPad 上运行。核心改造包括:

- **PlatformPaths trait**:抽象文件系统访问,替换直接的系统文件调用
- **ProcessExecutor trait**:抽象外部进程调用,iOS 上全部走云端降级
- **AiPlatformCapabilities trait**:iOS 禁用本地 AI(llama/TTS/whisper),自动降级到云端
- **配置源抽象**:iOS 无环境变量,改用 bundled config + NSUserDefaults

平台抽象层(`platform/`,21 个源文件 + 前端 6 个源文件)已完成桌面端全部 trait 实现,iOS 端只需实现对应接口。前端已落地 `platform/` 模块的能力查询与 Shell 抽象。

### 10.2 语音与配音能力深化

- **本地 TTS 引擎扩展**:持续接入更多本地 TTS 引擎(VoxCPM、IndexTTS 等),降低云端配音成本
- **情感语音合成**:情感控制面板的细粒度化,让 AI 配音更具表现力
- **多角色对话配音**:一键为整个对白轨道批量生成多角色配音
- **唇形同步增强**:5 种适配器持续迭代,提升口型匹配精度

### 10.3 自动剪辑能力增强

- **智能转场检测**:从简单的镜头边界检测扩展到转场类型识别(硬切、叠化、淡入淡出)
- **BGM 自动匹配**:基于场景情绪自动推荐背景音乐
- **字幕自动生成与对齐**:字幕识别 + 对白轨道 + 时间线自动对齐
- **Premiere Pro / DaVinci Resolve 导出**:在 FCPXML 基础上扩展更多 NLE 格式支持

### 10.4 视觉编辑能力增强

- **AI 辅助构图建议**:基于 `image_layout_analysis` 模块的 AI 画面分析能力,提供智能构图优化建议
- **批量精修**:对一批生成图像应用相同的精修操作(统一裁剪、风格滤镜等)
- **参考图智能匹配**:基于场景上下文自动推荐合适的参考图

### 10.5 产品演进

- **分镜与生成一体化**:强化分镜与生成的一体化体验,批量任务、模板与复用
- **故事圣经同步**:故事圣经变更自动同步至受影响剧集(已落地 `story_sync_pipeline`
- **故事工程可移植**:通过备份/导出/导入体系,实现跨设备、跨用户的故事工程迁移
- **更多云端能力接入**:按场景接入更多云端能力与本地模型组合
- **全局助手**:Chat 后端与 AgentLoop 架构,提供 AI 辅助创作体验

### 10.6 工程演进

- **四层架构深化**:持续领域层纯化——将残留的业务逻辑从基础设施层回迁至领域层
- **iOS 适配器实现**:在现有 170+ SQLite 适配器基础上,按需实现 Core Data 适配器
- **全仓颜色主题模块**:统一的深色/浅色主题切换系统
- **松耦合对接**:与云端素材、协同类产品探索松耦合对接(本地工程仍是权威数据源)

### 10.7 生态演进

- **可信、可选、可审计**:持续面向中文创作者工作流,向可信、可选、可审计的多模态前期工具链演进
- **模板市场**:灯光/风格预设、分镜模板、角色外观包的社区分享
- **云端渲染农场**:大模型推理卸载到云端,桌面端保持低功耗

---

*代码仓库内另行维护更细的技术约束与模块说明(约 1,534 篇内部文档),供开发与测试使用;本文不展开。*

比格熊 v0.2.715 → v0.2.716 更新日志

> 15 次提交 | 2026-07-12 ~ 2026-07-15
## 概要说明

概要:
演员、角色多视角生图角度升级为更合理的布局。
故事板、片段模块可以自由加入图片节点灵活生图。
故事板、片段无限画布更流畅减少增删节点时的抖动。

**【新增】**
1. 画布通用图片节点:片段画布直接生图,独立管线与快照支持
2. 即梦 SeedEdit 3.0 图片编辑引擎接入
3. Python 运行时一键下载与 CDN 分发,开箱即用
4. 画布左侧浮动预览面板,悬停呼出,F11 快捷切换
5. 错误报告从弹窗升级为独立设置 Tab 页
6. 人物多视角新增 3/4 视图,场景自适应与参考图前置
7. 片段画布删除节点支持 Ctrl+Z 撤销恢复(快照机制)
8. bgxpkg 导出导入增加媒体资源闭包完整性校验
9. AI 任务完成后自动刷新画布图片节点
10. Llama Server 真空启动,取消文本模型门控
11. 新增 9 项技能文档(架构 SSOT / 提示词工程 / UI 标准等)
12. 预发布自动校验脚本
13. 能力映射页新增产品语言面板
14. 火山方舟模型目录扩充,补全能力映射与参考价格
15. 删除场次节点后自动补建播放顺序连线

**【修复】**
16. 修复画布增删节点双闪、结构抖动及 Reveal 灰闪
17. 修复画布布局 tile 同步遗漏与连线手势冲突
18. 修复拖图导入分镜画布时视频框架未原子提交
19. 修复打包后 StoryboardMainContent 懒加载 404
20. 修复资产列表与侧边栏导航滚动失效
21. 修复 bgxpkg 导入后 placement/道具本地图空白丢失
22. 修复能力映射页 t-is-not-defined 白屏崩溃
23. 修复生图工作台提示词组件与负向提示词未对齐
24. 修复分镜画布缩放后右键菜单定位偏移
25. 修复多视角生图成功后画布不刷新、进度条卡住
26. 修复多视角 sheet 拼接间隙与九宫格排列错位
27. 修复参考图未前置于多视角提示词导致未生效
28. 修复 llama-server 缺模型拒启、Python 探测僵死
29. 修复 TTS sidecar CDN 下载失败无重试
30. 修复火山方舟预置模型价格与计费不一致
31. 修复 bgxpkg 导入媒体校验缺失、迁移进度卡 99%

---

## 一、新增功能

1. 画布通用图片节点——支持在片段画布上直接生图,无需依赖分镜工作台,提供独立的生图管线、参考图注入、生命周期管理与快照支持
2. 即梦 AI SeedEdit 3.0 接入——接入火山方舟即梦 SeedEdit 3.0 图片编辑引擎
3. Python 运行时一键下载——新增 Python 运行时托管下载与 CDN 分发,支持开箱即用
4. 画布左侧浮动预览(Canvas Left Peek)——左侧栏折叠时,鼠标悬停场次标签即可呼出浮动预览面板,支持 F11 快捷键切换
5. 错误报告独立面板——错误/问题报告从弹窗升级为独立的设置 Tab 页(SettingsErrorReportPanel)
6. 人物多视角 3/4 视角重构——多视角生图新增三角/四角视图布局,支持场景自适应视角选择、参考图前置提示词,重建角度分镜与负面提示词策略
7. 画布节点删除撤销(快照机制)——片段画布移除节点支持 Ctrl+Z 恢复,基于画布快照与 checkpoint 机制
8. bgxpkg 导出/导入支持媒体校验(val_media)——导入导出增加媒体资源闭包验证,确保资产完整性
9. AI 任务终端画布图片刷新——AI 任务完成后自动刷新画布图片节点,打通异步生图→画布自动更新的链路
10. 本地模型 Llama Server 真空启动——取消文本模型门控,llama-server 无需预下载模型即可启动
11. 9 项技能文档体系——新增架构 SSOT、Bug 修复方法论、文档规范、提示词工程 SSOT、UI 标准等技能文档
12. 预发布检查脚本——新增 preflight-release-checks.ps1 发布前自动校验流程
13. 能力映射页产品语言面板——设置页新增产品语言(ProductLanguage)面板,统一文案表述
14. 火山方舟模型目录扩充——补全模型能力映射与参考价格,支持更多预置模型选择
15. 场景场次播放顺序自动补建——删除场次节点后自动补建缺失的播放顺序连线

## 二、BUG 修复

### 画布与节点
16. 修复片段画布新建节点双闪——新节点创建时两次渲染闪烁,通过对账提交物化消除
17. 修复片段画布结构变更抖动——增删节点导致画布整体抖动,改由增量 Reveal 方式更新
18. 修复片段画布节点变更 Reveal 灰闪——节点内容变更时画布短暂灰色闪烁
19. 修复画布布局 tile 同步遗漏——节点位置变更后未同步更新 layout tile 缓存
20. 修复画布连线手势断言失败——连线拖拽手势与画布状态机冲突导致 panic
21. 修复分镜画布导入视频框架单提交物化——拖图导入分镜画布时,视频框架与垫图未在同一原子提交中创建
22. 修复全仓画布场景补建连线缺失——手动新建场次后场景间连线未自动生成

### UI 与交互
23. 修复 StoryboardMainContent 动态导入失败——打包后懒加载组件 404
24. 修复资产列表滚动失效——素材列表面板内容溢出但无滚动条
25. 修复 Sidebar 导航滚动异常——侧边栏导航区域无法滚动到底部
26. 修复 bgxpkg 导入漏 placement 画布空白——导入包后 placement/场景道具图片未正确恢复到画布节点
27. 修复能力映射页 t-is-not-defined 崩溃——能力映射设置页翻译函数未定义导致页面白屏
28. 修复 bgxpkg 资产场景道具本地图复现空白——导入后道具本地图片丢失
29. 修复生图工作台提示词组件布局混乱——提示词输入框、负向提示词、参考图区域未对齐,统一为规范布局
30. 修复分镜画布 ContextMenu 定位偏移——右键菜单在缩放/平移后位置错位
31. 修复 F11 全屏预览场次列表展开逻辑——非 F11 模式下侧边栏折叠行为与 Peek 预览冲突

### 多视角与角色
32. 修复演员多视角生图成功后画布不刷新——多视角任务完成但画布瓦片仍显示旧图
33. 修复人物多视角三四视角重排——四视角 sheet 布局与九宫格排列错位
34. 修复角色肖像多视角进度不刷新——多视角批量生成时进度条卡住
35. 修复多视角 sheet 无缝拼接——九宫格/四宫格拼接间隙与画廓尺寸不一致
36. 修复参考图未前置于多视角提示词——参考图注入位置错误导致生图未使用参考

### 本地模型与运行时
37. 修复 llama-server 文本模型门控——本地模型因缺少 GGUF 模型文件而拒绝启动
38. 修复 Python 运行时探测僵死——探测脚本无超时导致进程悬挂
39. 修复 TTS sidecar CDN manifest 校验——IndexTTS/VoxCPM 边车下载失败未重试
40. 修复火山方舟预置模型价格对齐——模型目录参考价格与实际计费不一致

### 导出与迁移
41. 修复 bgxpkg 导入 val_media 校验缺失——导入时未验证媒体文件完整性,静默跳过损坏资产
42. 修复数据迁移进度停滞——大数据量迁移时进度条卡在 99% 不动

比格熊 v0.2.708 → v0.2.712 更新日志

> 38 次提交 | 2026-07-09 ~ 2026-07-12
## 一、新增功能
1. 接入 Seedream 5.0 Pro 引擎
2. 视频后处理画质增强
3. 对白配音独立弹窗模式
4. 聊天助手思考模式开关
5. 内置 TTS 参考音样本
6. 视频提示词叙事优化
7. 更新下载失败自动恢复
8. 故事板工作流重置布局
9. 画布连线手势统一切换
10. 瓦片标题支持编辑
11. 对白历史版本列表
12. 对白参考音频上传预览
13. 接入阿里百炼平台
14. 画布防闪烁内容展示
15. 语音合成参数面板
16. 章节场景删除确认
17. 拖图导入分镜画布
18. 角色生图能力校验

## 二、BUG 修复

### 生图与视频
19. 修复即梦分镜画幅异常
20. 修复 Seedream5Pro 参数错
21. 修复 Seedream4 分辨率不全
22. 修复批量视频范围为空
23. 修复 ComfyUI 图生视频冲突
24. 修复 ComfyUI 音频加载失败
25. 修复 Seedance 场景互斥报错
26. 修复 Seedance 地址 404
27. 修复多视角引擎通道错配
28. 修复视频工作台提示词空白
29. 修复提示词退格失焦
30. 修复工作台重启回旧版
31. 修复提示词丢剧本对白
32. 修复分镜缩略图错位
33. 修复工作流垫图误删

### 语音与配音
34. 修复 TTS 预下载瞬满
35. 修复 TTS 进度条不显示
36. 修复 TTS 预热进度卡住
37. 修复参考音频预览失败
38. 修复引擎未配置死锁
39. 修复 IndexTTS 重复下载
40. 修复对白 IndexTTS 参数污染
41. 修复对白 TTS 崩溃
42. 修复对白 TTS 任务僵尸
43. 修复对白端口参数漏传
44. 修复对白误带音色参数
45. 修复对白工作台参数隐藏
46. 修复对白生成无加载动画
47. 修复对白状态徽标延迟
48. 修复对白演员信息未落库
49. 修复配音缺故事 ID
50. 修复片段视频预览无声
51. 修复对白历史未保存
52. 修复对白风格误切朗读
53. 修复独立配音按钮异常

### 故事板与画布
54. 修复画布首次加载抖动
55. 修复重置画布尺寸异常
56. 修复场次分镜缺定妆
57. 修复单场分镜生成过慢
58. 修复外形摘录误拒
59. 修复定妆并发阻塞
60. 修复外形摘录不刷新
61. 修复手动建场次缺连线
62. 修复标题栏高度异常
63. 修复锁定横幅文案空白
64. 修复分镜状态误报
65. 修复视频瓦片播旧片
66. 修复任务池排队卡死
67. 修复角色肖像切页丢失
68. 修复场景工作台闪关

### 本地模型与工具
69. 修复本地模型缺文件提示
70. 修复 Whisper 状态为空
71. 修复本地模型角色生成失败
72. 修复思考模式入口缺失
73. 修复数据导出进度停滞
74. 修复导出按钮被禁用
75. 修复镜像覆盖工作流配置
76. 修复 HTTP 传输无重试
77. 修复加载动画缺失
78. 修复参考音频 ID 冲突

AI 创作 | 颠覆性工具它来了

# 别人还在排队等 AI 出图,你已经用本地引擎跑完了一整条片子

---

市面上绝大多数 AI 创作平台,**自己没有模型**

他们的商业模式就一句话:从即梦、可灵、通义千问批发 API 额度,套一层网页壳,翻倍卖给你。

你以为是"AI 会员",其实买的是排队券。高峰期限速、加钱免排队、一天 50 张封顶——你不是在用 AI,你是在被中间商捏着水管滴水喝。

比格熊不玩这个。

---

## 01 第一刀:砍掉中间商

比格熊做的第一件事,简单粗暴——**直连官方 API,不走任何中间人**

什么意思?

你在比格熊里用即梦 AI 生成一张图:

- ❌ **别家路线**:你 → 某平台网页 → 某平台后端 → 官方 API → 排队 → 某平台后端 → 某平台网页 → 你
- ✅ **比格熊路线**:你 → 比格熊客户端 → 官方 API → 你

没有中间商。你填的 API Key 直通官方服务器。**你自己的账号、你自己的配额、你自己的速度。**

这意味着什么?

**零差价。** 官方什么价,你就什么价。API 按量计费本就便宜——即梦生一张图几分钱,可比那些"199 包月、一天限 50 张"的会员制良心多了。而且你充的钱 100% 花在了算力上,不是花在平台的运营成本和投资人回报上。

**零排队。** 直连官方,你在官方的 API 优先级是什么,在比格熊里就是什么。不存在"平台统一队列",不存在"高峰期限速",不存在"加钱免排队"的套路。

**一 Key 通吃。** 你在火山引擎注册一个账号,文本生成、图片生成、视频生成、语音合成——四个能力全部共享一套密钥。不需要每个功能重新填一遍、重新充一遍钱。

> 💡 **简单算笔账**:一个短视频创作者,每周生成 50 张分镜图 + 10 段配音 + 2 个 AI 视频预览。按官方 API 按量计费,**月均花费约 15-40 元**。而且 API 余额充一次用很久,**不过期、不清零、不按月扣**——这个月没创作?没事,钱还在。下个月灵感来了接着用。

---

## 02 第二刀:云端 + 本地,一屏双引擎

这才是真正"市面上绝无仅有"的地方。

### 别人的做法:云和本地,两个世界

目前市面上的 AI 创作工具,基本分两派:

**云端派**(某梦、某灵、某奇艺…):所有算力走云端,模型强、画质高,但按量计费。批量生成时账单跳得比心跳还快。想做 20 个分镜?先充钱。想跑一晚上批量测试?账单能顶一顿饭。

**本地派**(SD WebUI、ComfyUI…):免费、无限量、数据不出本机。但你得自己配 Python 环境、装 CUDA、下模型权重、写工作流、导来导去——劝退率 90%。会用的人闷声发大财,不会的人连门都摸不到。

**两个世界互不往来。** 你用云端工具做了一张图想用 ComfyUI 精修?导出 → 存盘 → 拖进 ComfyUI → 导入 → 精修 → 导出 → 拖回来。一套操作走下来,灵感早凉了。

### 比格熊的做法:一屏之内,云和本地自由切换

在比格熊里,你看到的是**同一个按钮、同一套界面**

角色定妆照想用可灵 Kling 出大片质感?点一下。20 个分镜想用本地 ComfyUI 免费跑一晚上?切换一个偏好设置,点批量生成。主角配音用火山引擎的云端 TTS 追求播报级自然度?没问题。群杂背景音用本地 VoxCPM2,量大管饱不花钱?随时切换。

**从头到尾,你只打开了比格熊这一个软件。**

> 🎯 **这就是"双引擎"的真正含义**——不是"两个工具塞进一个壳",而是"一个统一的创作界面,底下有两套动力系统随你切换"。

---

## 03 本地打草稿,云端出成品

这是比格熊用户群体里正在流行的一种使用模式,我们称之为 **"本地跑预演,云端搞精修"**

### 场景还原

你要为一个短片做 30 个分镜。每一个都需要反复调试提示词、尝试不同风格、看看哪个构图方向可行。

**纯云端模式**:每调试一次就烧一次钱。30 个分镜 × 3 轮调试 × 每张 0.2 元 = 18 元。这只是"试试看"的成本,成品还要再花一份钱。而且每次调试都要等 API 返回,节奏被打断。

**纯本地模式**:不要钱,随便试。但受限于本地显卡性能,画质上限和模型选择比云端窄。

**比格熊双引擎模式**

```
第一轮:调试构图、敲定风格 → 本地 ComfyUI,随便跑,0 元
第二轮:出成品、追求画质 → 切回云端,只跑最终版本
```

30 个分镜,只用云端跑最后一轮的 30 张。调试成本为零。而且本地出图通常比云端 API 更快(没有网络延迟),调试节奏非常紧凑。

> 🧠 **这就像写作**——草稿在本地记事本里随便写随便改,定稿了才排版印刷。没人会在草稿阶段就用铜版纸。

同样的逻辑也适用于配音:

- 台词还没定稿?本地 VoxCPM2 零样本克隆,几秒参考音频就能出声,随便试。
- 台词定稿了?切换到火山引擎云端 TTS,追播报级自然度,成品直接进时间线。

**省的不是一点半点,是"草稿成本"这一整块从账本上抹掉了。**

---

## 04 一键部署:本地引擎的"最后一公里"被我们打通了

看到这里,你可能在想:*"ComfyUI 我装过,搞了一下午环境都没跑起来。"*

这就是 90% 的人被本地 AI 劝退的原因。

比格熊花了大量精力,就做一件事:**让本地引擎的部署,变成"点一下安装"**

ComfyUI、IndexTTS-2、VoxCPM2——三个本地开源顶流引擎。在过去,每一个的原生安装都够写一篇万字踩坑帖。Python 版本不对、CUDA 不匹配、依赖冲突、权重下载失败、端口占用……每一步都是雷。

在比格熊里:

```
打开设置 → 选择引擎 → 点击安装 → 等几分钟 → 好了。
```

系统会自动:
- 探测你的显卡能不能跑、显存够不够
- 从 CDN 下载匹配你系统的版本
- 自动配置 Python 环境和所有依赖
- 校验文件完整性
- 启动引擎并健康检查

**部署只需一次。之后每次打开软件,引擎自动就绪。**

而且这套 CDN 部署体系支持**版本管理和增量更新**——ComfyUI 出了新版本?系统检测到后一键升级,旧版本保留不删,出了問題随时回退。

---

## 05 六大云端厂商 + 三大本地引擎 = 一个工具栏

回到产品本身。比格熊目前集成的 AI 能力全景:

### ☁️ 云端(6 家官方 API 直连)

| 厂商 | 能力 | 一句话 |
|------|------|--------|
| **火山引擎** | 文本 · 图片 · 视频 · 语音 | 全能型选手,一 Key 四用 |
| **通义千问** | 文本 · 图片 · 视频 · 语音 | 阿里系全家桶 |
| **即梦 AI** | 图片 · 视频 | 字节系视觉旗舰 |
| **可灵 Kling** | 图片 · 视频 | 画质党的心头好 |
| **DeepSeek** | 文本 | 性价比王者,剧本润色首选 |
| **OpenAI 兼容** | 文本 | 兼容网关,习惯 GPT 的无缝迁移 |

### 🏠 本地(3 大开源顶流引擎)

| 引擎 | 能力 | 一句话 |
|------|------|--------|
| **ComfyUI** | 图片 · 视频 | AI 绘画终极驾驶舱,Stable Diffusion 最强前端 |
| **IndexTTS-2** | 语音合成 | 情感控制 + 音色克隆,中文 TTS 第一梯队 |
| **VoxCPM2** | 语音合成 | 零样本声音克隆 + 文字描述合成声音 |

### 你的创作流,从未如此自由

这 9 个引擎,**全部在一个工具栏里**。你不是在六个 App 之间切来切去——你是在一个界面里,根据每个任务的需求,选择当下最合适的引擎。

写剧本用 DeepSeek,出定妆照用可灵,批量分镜用 ComfyUI,主角配音用火山引擎,群杂用 VoxCPM2。

**选择的权力,第一次真正回到了创作者手里。**

---

## 06 为什么这件事只有比格熊做到了?

不是技术壁垒——直连 API 技术上并不难,ComfyUI 也是开源的。

真正难的,是**产品理念**

大部分 AI 工具的商业模型建立在"中间商赚差价"上——封装一层界面,从用户手里收月费,按月费的一定比例支付 API 成本,赚差额。这个模型天然排斥两个东西:**直连 API**(因为透明了就没法赚差价了)和**本地引擎**(因为本地不要钱,更没法抽成了)。

比格熊选择了另一条路:**把选择权还给创作者,靠专业工具的价值赚钱,而不是靠信息不对等赚差价。**

这就是比格熊敢把 API Key 直接交给用户填的原因。
这就是比格熊敢把本地引擎一键部署进客户端的原因。

---

## 07 最后说一句

AI 创作工具这个赛道,过去两年卷的都是"谁接的模型多"、"谁的模板好看"、"谁的会员便宜"。

比格熊没有卷这些。

它卷的是**底层架构**——把中间商砍掉、把云和本地打通、把部署门槛踩平、把选择权还给创作者。

这不是一个"更好用的 AI 工具"。
这是一场 **AI 创作工具的玩法重塑**

> 📦 **比格熊数字导演工作站** v0.2.708
>
> 支持 Windows | 跨平台架构预留
>
> 前往设置 → 账号中心绑定官方 API Key → 本地模型启用开源引擎
>
> **你的第一个双引擎项目,今天就可以开始。**

---

*本文写于 2026 年 7 月。文中提到的本地直连 API 和云端+本地双引擎模式,是目前市面上唯一商用的完整解决方案。如有雷同……你可能看的就是比格熊。*

云端 API + 本地引擎:比格熊可能是唯一把两条路都走通的 AI 创作平台

# 比格熊数字导演工作站 — 项目架构总览

**版本**:v0.2.705 | **统计日期**:2026-07-05 | **提交数**:475

---

## 一、项目简介

**比格熊数字导演工作站(BGXiong Digital Director Workstation)** 是一款面向影视创作者的 **AI 驱动的桌面端创作平台**。它将剧本写作、角色设计、分镜绘制、视频剪辑等环节整合到统一的工作流中,通过接入多种 AI 大模型,让个人创作者也能完成原本需要一整个团队才能做到的影视前期工作。

**核心定位**:用 AI 把创意变成可视化的故事 — 从一段文字描述,到有角色、有画面、有声音的完整影像脚本。

### 谁在用?

- 短视频创作者、自媒体博主
- 独立导演、编剧
- 影视前期策划人员
- 需要快速出概念图/分镜的创意工作者

---

## 二、整体架构(最简版)

```
┌──────────────────────────────────────────────────────┐
│                    👤 用户界面                         │
│          React 前端 · 画布操作 · 工作台 · 设置          │
├──────────────────────────────────────────────────────┤
│                    🔗 通信桥梁                         │
│             Tauri IPC · HTTP Bridge · SSE              │
├──────────────────────────────────────────────────────┤
│                    ⚙️  业务引擎                        │
│       Rust 后端 · AI 任务调度 · 媒体处理 · SQLite       │
├──────────────────────────────────────────────────────┤
│                    🤖 AI 厂商层                        │
│    OpenAI · Jimeng · Kling · Qwen · Minimax · ...     │
│             本地模型(GGUF · Whisper · TTS)            │
├──────────────────────────────────────────────────────┤
│                    🔌 外部集成                         │
│      DaVinci Resolve 插件 · 云端服务器 BGXiongCloud     │
└──────────────────────────────────────────────────────┘
```

**一句话概括**:前端像纸笔一样轻量,所有重活(AI 调用、数据库、音视频处理)全部交给 Rust 后端,各层职责清晰、互不干扰。

---

## 三、核心功能模块

### 3.1 故事工厂(Story Studio)

| 模块 | 说明 |
|------|------|
| **故事管理** | 创建/编辑故事,支持 Word/PDF/文本拖入自动提取故事描述 |
| **剧集规划** | 将故事拆分为"剧集 → 场次 → 片段"三级结构,AI 辅助生成大纲 |
| **画面风格** | 12 档风格预设(电影级/日系/赛博朋克等),可自定义,一键应用到全项目 |
| **故事圣经** | 世界观、人物关系、场景设定等结构化文档,支持版本历史与自动保存 |

### 3.2 角色设计(Character Studio)

| 模块 | 说明 |
|------|------|
| **角色管理** | 创建角色档案,录入年龄、外貌、性格、背景故事 |
| **演员定妆** | 基于角色描述生成定妆照,支持正/侧/背面多视角,自动匹配面部特征 |
| **参考图策略** | 灵活管理 AI 生图所用的垫图(参考图),支持角色绑定与按需切换 |
| **演员提取** | 从故事文本中自动识别角色信息,AI 辅助补全 |

### 3.3 分镜系统(Storyboard)

| 模块 | 说明 |
|------|------|
| **分镜画布** | 无限画布上拖拽排列分镜卡片,像使用思维导图一样规划镜头 |
| **AI 批量生图** | 一键为所有分镜生成静帧画面,自动保持角色和风格一致性 |
| **摄影语言** | 景别、机位、构图、焦段等电影专业参数的 AI 自动推理 |
| **分镜历史** | 每张分镜的生成历史完整保留,可回退、对比、设为首选 |

### 3.4 片段/视频工作台(Segment Studio)

| 模块 | 说明 |
|------|------|
| **片段编辑** | 在画布上组织片段节点,管理播放顺序与转场 |
| **视频生成** | AI 文生视频/图生视频,支持多厂商模型选择 |
| **音频管线** | 语音识别(Whisper)、自动字幕、音频对齐 |
| **剪辑框架** | 素材管理、剪辑序列、导出标记 |

### 3.5 视觉资产库

独立于故事的 **通用素材管理** 模块 — 角色、场景、道具的图片资产统一存储,支持概念图生成、垫图复用,不绑定特定故事 ID。

### 3.6 DaVinci Resolve 插件集成

| 模块 | 说明 |
|------|------|
| **自动剪辑** | 基于语音标记自动生成 FCPXML 剪辑时间线,导入达芬奇直接使用 |
| **母带处理** | 多段素材精确合并、去静音、GPU 加速预处理 |
| **高光切片** | 自动识别精彩片段生成短视频切片 |
| **信封通信** | 客户端与达芬奇插件之间的通用命令通道,支持同步/异步/SSE |

### 3.7 TTS 语音合成

集成 IndexTTS-2 等模型,支持情感控制、多音色,可独立运行也可配合视频生成使用。

---

## 四、技术架构特点与优势

### 4.1 高内聚、低耦合的分层设计

```
前端(薄编排层)        Rust 后端(重计算层)
─────────────────      ─────────────────────
只负责:                只负责:
• 界面渲染             • 数据库读写
• 参数组装             • AI 任务调度
• 用户交互             • 音视频处理
                        • 复杂业务逻辑
```

**好处**
- 前后端各司其职,不会出现"前端和后端各写一套相同逻辑"的情况
- 修改界面不影响核心业务,修改业务不需要碰界面代码
- 性能敏感的计算全部在 Rust 层完成,用户体验流畅

### 4.2 单一数据源(SSOT — Single Source of Truth)

项目中每一条数据规则只有一个权威来源,从数据库字段到 API 到前端类型定义,命名和含义完全一致。例如:

- 数据库中叫 `story_id`,API 中叫 `storyId`,前端界面里也是 `storyId`,绝不出现别名或双键。
- 剧集就叫"剧集"(chapter),场次就叫"场次"(scene),片段就叫"片段"(segment),全项目统一。

**好处**
- 新人看代码不会因为"同一个东西有三个名字"而困惑
- 改一个地方不会漏掉其他地方的关联修改
- 自动化检查脚本可以扫描全项目确保一致性

### 4.3 自动化质量门禁

项目内置 **220+ 合规检查脚本**,每一次代码改动都会被多项自动化规则检查:

- 命名是否一致
- 数据格式是否正确
- 是否引入了不安全的回退逻辑
- 新功能是否遵循既定模块规范

**好处**:相当于有 220 个不会打瞌睡的审查员 24 小时盯着代码质量。

### 4.4 AI 模型多厂商统一调度

不是绑定某一家 AI 厂商,而是建立了一套 **厂商中立的调度层**

- 文本生成:OpenAI / Qwen / Minimax / DeepSeek 等均可接入
- 图像生成:Jimeng / Kling / DashScope / 本地模型
- 视频生成:多厂商支持
- 语音识别:云端 + 本地 Whisper
- TTS:云端 + 本地 IndexTTS-2

用户可以在设置中自由选择偏好模型,AI 任务失败时系统提供清晰的错误诊断。

### 4.5 离线优先 + 本地数据主权

- 核心数据库使用 **SQLite** 存储在用户本地,断网也能正常工作
- 媒体文件、模型权重全部本地化管理
- 云端服务器仅用于:账号注册、权限验证、订阅管理、资源下载

### 4.6 破坏性修复许可

当发现设计缺陷时,允许 **彻底重写** 而非打补丁凑合。这避免了"補丁摞補丁"式的代码腐烂,确保架构长期健康。

### 4.7 离线迁移策略

数据库结构变更全部通过 **离线迁移脚本** 完成,不在程序运行时偷偷改表结构。这样做的好处是迁移过程可控、可验证、可回滚。

### 4.8 无限画布引擎

自研的画布系统支持:
- 无限缩放和平移
- 节点连线(像节点编辑器一样组织分镜和片段)
- LOD 瓦片缩略图(画布上几百张图也不卡)
- 完整的撤销/重做支持

---

## 五、代码量统计

### 5.1 总体统计

| 类别 | 文件数 | 代码行数 |
|------|--------|----------|
| **Rust 后端**(src-tauri/src) | 1,522 | 300,296 |
| **Rust 基础库**(src) | 24 | 1,978 |
| **TypeScript/TSX 前端**(ui/src) | 3,266 | 404,513 |
| **CSS 样式**(ui/src) | 9 | 2,282 |
| **PowerShell 脚本**(scripts) | 224 | 22,407 |
| **Python 脚本** | 111 | 18,882 |
| **Shell 脚本** | 6 | 1,456 |
| **配置文件** | 12 | 777 |
| **技术文档**(docs) | 1,280 | 457,879 |
| **合 计** | **5,174** | **752,591**(不含文档) |

### 5.2 后端模块代码量 TOP 20

| 模块 | 行数 | 功能说明 |
|------|------|----------|
| (root) | 34,879 | 入口、配置、核心工具、全局基础设施 |
| commands | 21,538 | 前端调用的 80+ API 接口(Tauri IPC) |
| open_platform | 17,885 | 多厂商 AI 调度层(OpenAI/Jimeng/Kling/Minimax 等) |
| appearance | 6,448 | 角色外貌特征管理与生成 |
| media_preprocess | 5,552 | 媒体预处理(FFmpeg 封装) |
| local_ai | 5,488 | 本地 AI 推理(Whisper/GGUF/TTS) |
| speech_mark | 4,148 | 语音标记与识别 |
| segment_video_pipeline | 3,635 | 片段视频处理管线 |
| story_chapter_pipeline | 3,529 | 故事/剧集 AI 处理管线 |
| chapter_scenes_plan | 3,232 | 剧集场次智能规划 |
| pad_policy | 3,138 | 参考图策略引擎 |
| storyboard_stage_b_ingest | 3,124 | 分镜 Stage B 数据导入 |
| authz | 3,032 | 权限与配额控制 |
| media_runtime | 2,930 | 外部运行时管理(llama/whisper/ffmpeg/TTS) |
| comfyui | 2,929 | ComfyUI 工作流集成 |
| local_bridge | 2,913 | 达芬奇插件本地桥接 |
| storyboard_rules | 2,792 | 分镜规则引擎 |
| image_generation | 2,738 | 图像生成管线(文生图/图生图/多视角) |
| permission | 2,675 | 细粒度权限系统 |
| story_backup | 2,119 | 故事数据备份与恢复 |

### 5.3 前端模块代码量

| 模块 | 行数 | 功能说明 |
|------|------|----------|
| components | ~158,600 | UI 组件层(108+ 子模块) |
| domain | ~137,700 | 业务逻辑层(235+ 模块) |
| features | ~28,200 | 功能特性模块 |
| infinite-canvas | ~18,500 | 无限画布引擎 |
| i18n | ~13,000 | 国际化翻译 |
| api | ~6,800 | 后端接口调用封装 |
| settings | ~6,100 | 设置面板 |
| app-shell | ~5,200 | 应用外壳/框架 |
| clips | ~5,100 | 剪辑模块 |
| hooks | ~4,400 | 通用 React Hooks |
| popout-apps | ~3,400 | 弹窗独立应用 |
| three-d | ~2,800 | 3D 实验室 |
| layout-persistence | ~2,500 | 布局持久化 |
| auth | ~1,400 | 用户认证 |
| 其余 | ~10,800 | 快捷键/主题/帮助/工具等 |

### 5.4 技术栈占比

| 语言/技术 | 占比(按行数) | 作用 |
|-----------|-----------|------|
| TypeScript | 53.8% | 前端界面与交互逻辑 |
| Rust | 40.2% | 后端引擎、数据库、AI 调度、媒体处理 |
| PowerShell | 3.0% | 自动化脚本、质量门禁 |
| Python | 2.5% | 数据迁移、工具脚本 |
| CSS | 0.3% | 样式定义 |
| Shell | 0.2% | 构建/部署脚本 |

---

## 六、项目技术栈一览

| 层级 | 技术 |
|------|------|
| 桌面框架 | Tauri 2(Rust) |
| 前端框架 | Vite + React 19 + TypeScript 5.9 |
| 数据库 | SQLite(rusqlite + r2d2 连接池) |
| AI 推理 | 多厂商 HTTP API + 本地 Candle/GGUF |
| 音视频 | FFmpeg(外挂运行时) |
| 语音识别 | Whisper(外挂运行时) |
| TTS | IndexTTS-2 |
| 包管理 | Cargo(Rust)+ npm(前端) |
| 测试 | Vitest(前端)+ cargo test(后端) |
| 平台 | Windows(当前)、跨平台架构预留 |

---

## 七、关联项目

| 项目 | 关系 |
|------|------|
| **BGXiongCloud**(云端服务器) | 用户注册、权限验证、订阅管理、资源 CDN 下载 |
| **DaVinci Resolve 插件** | 与本客户端通过本地桥接通信,实现自动剪辑、母带处理等功能 |
| **local-bridge-contract**(通信契约包) | 客户端与达芬奇插件之间的接口规范定义 |

---

## 八、总结

比格熊数字导演工作站的架构核心思路是 **"前端做减法,后端做加法"**

- **前端** 保持轻量,只做界面展示和用户交互,不越界处理业务逻辑
- **后端** 用 Rust 承载所有重计算、数据库、AI 调度、媒体处理
- **中间** 通过严格的接口规范和数据契约连接前后端
- **外围** 用 340+ 自动化脚本守住代码质量底线

这种架构让项目在代码量超过 **75 万行**(含文档超 **120 万行**)的规模下,仍然保持清晰的模块边界和可控的维护成本。每个模块改动的影响范围被限制在预设的区域内,不会出现"改一行代码、崩一个系统"的情况。

一个做了 55 万行代码的桌面软件,想告诉你一件事:AI 时代的创作,从来不是「抄作业」。

## 你也被「提示词焦虑」困住了吗?

打开社交媒体,满屏都是「万能的 Sora 提示词模板」「Midjourney 咒语大全」「一键出片的分镜公式」。

收藏了一堆,真正用起来却总觉得不对劲——

别人的提示词再牛,出来的东西也带着别人的烙印。你想要的不是一张「别人也能生成」的图,而是**你自己的东西**

**不会写提示词怎么办?不会画分镜怎么办?**

答案可能比你想象的简单:**干中学。**

与其到处求别人的提示词,不如自己上手试。即使别人给了你提示词又能怎样?做出一个和别人一模一样的东西,有什么意思?

---

## 真正的问题不是「你不会」,而是「没有趁手的工具」

传统 AI 创作工具的体验是什么样的?

打开一个网页,对着一个文本框发呆。写一句话,出一张图。再来一句,再出一张。句子和图之间没有关系,你的想法散落在一堆聊天记录里。

你需要的不是一个更聪明的聊天机器人。

你需要的是**一个真正懂创作流程的工作台**

---

## 比格熊数字导演工作站:让「干中学」变成现实

比格熊是一套 **AI 驱动的多模态故事与分镜工作台**。它不像那些网页 AI 工具那样让你对着一个输入框猜咒语——它给你的是**一条完整的创作管线**

### 从一句话到一部片,全程可见

你不需要一开始就会写专业的分镜描述。你只需要输入一个想法:

> 「一个女孩在樱花树下跳舞」

比格熊会帮你完成:

- **自动拆解剧本结构**:剧集 → 场次 → 镜头,AI 帮你搭骨架,你随时可以改。
- **自动生成分镜**:画面构成、镜头运动、景别切换,AI 先出草稿,你来调整。
- **角色形象自动保持统一**:100 个镜头里的主角,长相不会变来变去。
- **一键生成视频成片**:配音、字幕、唇形同步,全链路打通。

**你不需要第一稿就完美。你只需要先做出来,然后在做中学。**

---

### 你的提示词,你说了算

比格熊有一个硬核原则:**UI 提示词不可改。**

你写进输入框的东西,系统不会偷偷截断、不会悄悄「优化」、不会静默换成另一个模型。你选了什么模型,就用什么模型。你写了什么,就提交什么。

这不是技术限制,而是设计哲学——

**创作的主导权在你手里,AI 是工具,不是替代者。**

---

### 每一张图、每一段视频,都从你的电脑直连官方 API

很多 AI 工具背后有一个「中间服务器」,你的请求先到平台,平台再转发给模型厂商。这带来三个问题:

1. **慢**:多一层中转,多一分延迟。
2. **贵**:中间商赚差价。
3. **黑箱**:你不知道实际用的是哪个模型。

比格熊的做法完全不同:**每一次生成请求,都是从你的电脑直连到模型厂商的官方 API。** 没有中间服务器转发,没有第三方中转。

你已经接入了即梦、可灵、通义万相、Seedance、OpenAI 等多家主流模型。更重要的是,统一端点注册表意味着**今天能用新模型,明天就能接进来**

---

## 不止是「生成」,更是「制作」

比格熊的定位不只是一个 AI 生成器——它是一套真正的**数字导演工作站**

### 无限画布:你的创意沙盘

自研的四叉树空间索引 + 虚拟化渲染引擎,让你在一个无限大的画布上随意摆放素材、调整分镜、串联镜头。**数百个节点量级,依然流畅交互。**

### 达芬奇插件无缝对接

如果你用达芬奇 Resolve 做后期,比格熊的本地桥接可以直接**把生成的内容推送到达芬奇时间线**。母带 A/V 精确合并(误差 0ms)、自动剪辑 FCPXML 生成、Whisper 语音识别字幕——全都在本地跑,不依赖云端。

### 本地 AI 能力:断网也能用

比格熊内置了 **llama.cpp 文本推理****Whisper 语音识别**。下载模型到本地,没有网络也能写剧本、识别字幕。你的数据、你的模型、你的作品——全在你自己的电脑上。

---

## 55 万行自研代码,不是套壳

市面上大多数「AI 创作工具」本质是什么?调几个 API,套一个网页壳。

比格熊不一样。它用了真正的桌面端架构:

| 层 | 技术 | 代码量 |
|---|---|---|
| 后端 | Rust(Tauri 2) | 22.7 万行 |
| 前端 | React 19 + TypeScript 5.9 | 33.0 万行 |
| 数据库 | SQLite(40+ 张表) | 本地落盘 |
| 画布引擎 | 自研无限画布内核 | — |
| 图引擎 | 自研 GraphCore | — |
| 媒体处理 | FFmpeg 全集成 | — |

**这不是套壳 API 聚合器,这是从零开始写的生产力工具。**

---

## 「干中学」的真正含义

回到最开始的问题:不会写提示词怎么办?

这个问题的前提是:你需要写出「完美的」提示词,然后 AI 一次性给你完美的结果。

但这个前提本身就是错的。

创作从来不是线性的。你不会先把所有分镜画完再开始拍,你不会先把所有台词写完再开始剪。**创作是在做的过程中不断发现、不断修正、不断学习的过程。**

比格熊要做的事情很简单:

**让你能够低成本地「做」,让你能够反复地「试」,让你在做和试的过程中,找到属于你自己的表达方式。**

别人的提示词再好,那是别人的审美。别人的分镜再牛,那是别人的叙事。

**你写下的第一句烂提示词,比你收藏的第一百条「万能咒语」更有价值。**

---

## 现在就开始

比格熊数字导演工作站目前支持 **Windows 平台**,macOS 版本正在开发中。

- **本地优先**:数据存在你自己电脑上,断网也能编辑。
- **直连 API**:不降级、不中转、不偷换模型。
- **全链路自动化**:从一句话到一部片,AI 全程辅助。
- **可追溯可审计**:每一次生成请求都有完整记录。

**下载地址**:[官网链接]

**限时福利**:新用户注册即送体验积分。

---

## 最后

如果你还在到处搜「AI 提示词模板」,停下来想一想——

**你想要的,到底是别人做好的东西,还是你自己的作品?**

AI 不会取代创作者,但会用 AI 的创作者会取代不会用的。

而会用 AI,不是指会背提示词模板。而是指**敢试、敢改、敢做第二遍**

**比格熊数字导演工作站——让每个人都能成为数字导演。**

---

*比格熊 · BigBear AI Story · 你的桌面级 AI 创作工作台*

57 万行代码,只为让你一句话变成视频大片

> 你有没有想过,有一天你只需要输入一句话,AI 就能帮你自动生成剧本、分镜、角色、视频,甚至配音和字幕?这不是科幻电影,这是比格熊数字导演工作站正在做的事。

---

## 从一句话到一部片,到底有多远?

传统视频制作的流程是这样的:写剧本→画分镜→找演员→搭场景→拍摄→剪辑→配音→字幕→成片。一个 30 秒的短视频,可能需要一个团队忙活好几天。

现在,想象一下这个场景:你打开比格熊,输入「一个女孩在樱花树下跳舞」,然后点击生成。几分钟后,你得到的不仅是一段文字描述,而是:

- ✅ 自动拆解的剧本结构(剧集→场次→镜头)
- ✅ 专业级的分镜故事板
- ✅ 角色形象一致的多视角定妆照
- ✅ 带有运镜和剪辑的视频片段
- ✅ 自然流畅的配音和精准的字幕

**这不是 Demo,这是已经上线的功能。**

---

## 比格熊凭什么做到?

### 1. 真正的本地优先,数据在你手里

市面上很多 AI 工具是网页版,你的剧本、素材、生成记录都存在别人的服务器上。比格熊不一样——它是一个安装在你电脑上的桌面客户端,所有数据都存在你本地的 SQLite 数据库里。

**这意味着什么?**

- 你的剧本不会莫名消失
- 断网也能编辑和预览
- 隐私有保障,合规无压力

### 2. 直连官方 API,不降级、不中转

这是比格熊最硬核的一点。很多工具会在后台偷偷「降级」——你选了 A 模型,但 A 排队太久,工具静默换成 B 模型给你出结果。你拿到的图或视频,可能根本不是你以为的那个模型生成的。

比格熊的做法完全不同:**你选了什么模型,系统就用什么模型。不会偷偷换通道,不会静默兜底。**

而且每一次生成请求,都是从你的电脑**直连**到模型厂商的官方 API。没有中间服务器转发,没有第三方中转站。速度更快、隐私更安全、成本更透明。

### 3. 统一模型调度,一家接入全管线可用

比格熊已经接入了即梦、可灵、通义万相、Seedance、OpenAI 等多家主流 AI 厂商。更重要的是,它有一个「统一端点注册表」——新增一家模型厂商,只需要注册一个新端点,业务层零改动。

**今天能用的模型,明天全部能用。明天出来的模型,后天就能接上。**

### 4. 57 万行自研代码,不是套壳 API 聚合器

很多人看到「AI 工具」四个字,第一反应是:不就是调几个 API,拼一个界面嘛。

比格熊的代码规模会让这种想法彻底破灭:

- 后端 Rust:22.4 万行,1,394 个源文件
- 前端 TypeScript:33.2 万行,3,000 个源文件
- 总计:**57.6 万行自研代码**

这不是套壳 API 聚合器,这是真正的生产力工具。从故事管线、分镜引擎、角色管理、视频生成,到无限画布、本地 AI、ComfyUI 集成,每一个模块都是从零开始自研的。

---

## 谁在用比格熊?

- **独立创作者**:一个人完成从剧本到分镜的全流程,省下大笔外包费用
- **短视频团队**:批量生成视频素材,效率提升 10 倍
- **动画工作室**:快速试制分镜,降低前期创意成本
- **影视院校**:教学实训,学生也能用 AI 做出专业级作品
- **企业内容团队**:快速产出营销视频、产品介绍、培训素材

---

## 现在就来试试

比格熊数字导演工作站目前支持 Windows 平台,macOS 和 iPad 版本正在开发中。

**下载地址**:[官网链接]

**限时福利**:新用户注册即送 1000 积分,足够生成 10 个完整项目。

---

## 最后说两句

AI 不会取代创作者,但会用 AI 的创作者会取代不会用的。比格熊不是要让你失业,而是要让你从繁琐的重复劳动中解放出来,把精力放在真正需要创意的地方。

**一句话变成视频大片,这不是未来,这是现在。**

---

*比格熊数字导演工作站 — 让每个人都能成为数字导演*


AI写一堆屎山代码怎么破?

给你的Vibecoding的agent前面加上一个禁止屎山代码的约束就好了
# 屎山代码鉴定准则 v1.0

> 本文档提供一套系统化的代码质量鉴定标准,用于客观评估代码库的"屎山化"程度。
> 评级体系采用**扣分制**:满分 100 分,每个问题扣对应分值,最终得分越低越"山"。

---

## 评级总览

| 得分区间 | 等级 | 称号 | 说明 |
|---------|------|------|------|
| 90-100 | ⭐ 优秀 | 清风明月 | 可读、可测、可维护,新人半天能上手 |
| 75-89 | 🟢 良好 | 小有瑕疵 | 整体规范,局部有改进空间 |
| 60-74 | 🟡 及格 | 勉强能看 | 能跑,但改一个地方要查三个地方 |
| 40-59 | 🟠 山脚 | 初具规模 | 已经出现明显的维护困难 |
| 20-39 | 🔴 山腰 | 山高路远 | 每次修改都像在拆炸弹 |
| 0-19 | 💀 山顶 | 不可名状 | 别动,动就崩;重写比重构快 |

---

## 第一章:命名与可读性(20 分)

### 1.1 变量/函数命名(-3 分/项)

- [ ] **谜语命名**`a`, `b`, `temp`, `data2`, `handleStuff()`, `doIt()`
- [ ] **拼音缩写混搭**`getYongHuList()`, `chaXunShuJu()`, `tmp_canshu`
- [ ] **命名与含义不符**:函数叫 `isValid()` 但实际会修改数据库;变量叫 `count` 存的是数组
- [ ] **同类不同风格**:同一文件里 `get_user_name()` / `fetchUserName()` / `queryusername()` 共存

### 1.2 注释(-2 分/项)

- [ ] **零注释**:整个文件没有任何注释,全靠"读代码"
- [ ] **废话注释**`i++; // i 加 1`
- [ ] **注释与代码不符**:注释说"返回用户列表",实际返回的是订单
- [ ] **大量注释掉的代码**:超过 20 行被注释的死代码没人清理

### 1.3 魔法数字与硬编码(-2 分/项)

- [ ] **魔法数字满天飞**`if (status == 3)` —— 3 是什么意思?
- [ ] **硬编码路径/地址**`"/Users/zhangsan/Desktop/test.txt"`, `"http://192.168.1.100:8080"`
- [ ] **硬编码密钥/密码**`password = "123456"` 直接写在源码里

---

## 第二章:结构与设计(25 分)

### 2.1 函数/方法(-3 分/项)

- [ ] **超长函数**:单个函数超过 200 行(超过 500 行扣 5 分)
- [ ] **参数爆炸**:函数参数超过 5 个
- [ ] **嵌套地狱**:if/for/try 嵌套超过 4 层(金字塔/箭头形代码)
- [ ] **职责混乱**:一个函数同时做数据查询、业务计算、格式化输出、发邮件

### 2.2 类/模块(-3 分/项)

- [ ] **上帝类**:一个类超过 1000 行,什么功能都在里面
- [ ] **万能工具类**`Utils.java` / `helpers.ts` 包含 50+ 个互不相关的方法
- [ ] **循环依赖**:A 依赖 B,B 依赖 C,C 依赖 A
- [ ] **没有分层**:UI 逻辑、业务逻辑、数据访问全混在一个文件里

### 2.3 代码重复(-4 分/项)

- [ ] **复制粘贴编程**:相同/相似代码块出现 3 次以上未抽取
- [ ] **复制后只改一处**:两段 100 行代码只有第 50 行不同,但没人合并

---

## 第三章:错误处理(15 分)

### 3.1 异常处理(-3 分/项)

- [ ] **吞异常**`catch (e) {}` 空 catch 块,错误被默默吃掉
- [ ] **万能 catch**`catch (Exception e)` 捕获所有异常然后打一行日志了事
- [ ] **用异常控制流程**:用 try/catch 代替 if/else 做业务判断
- [ ] **错误信息丢失**:catch 之后不记录原始错误,只输出"操作失败"

### 3.2 防御性编程(-2 分/项)

- [ ] **不做空值检查**:直接 `user.profile.avatar.url` 不考虑任何中间环节为 null
- [ ] **不做边界检查**:数组/列表直接取下标不检查长度
- [ ] **不做输入校验**:外部输入直接拼 SQL / 直接渲染到页面

---

## 第四章:状态管理与副作用(15 分)

### 4.1 全局状态(-3 分/项)

- [ ] **全局变量满天飞**:超过 10 个全局可变状态
- [ ] **隐式状态传递**:通过全局变量在函数间传递数据,看不出数据流
- [ ] **状态不同步**:多个地方维护同一份数据的一致性,但没有统一管理

### 4.2 副作用(-3 分/项)

- [ ] **函数有隐藏副作用**:调用 `getData()` 实际会修改数据库
- [ ] **时序依赖**:必须按特定顺序调用一系列函数,否则就崩,但没有文档说明
- [ ] **资源泄漏**:打开的文件/连接/句柄不关闭,靠"程序退出自动回收"

---

## 第五章:依赖与配置(10 分)

### 5.1 依赖管理(-3 分/项)

- [ ] **依赖版本不锁定**:没有 lock 文件,不同环境构建出不同结果
- [ ] **大量无用依赖**`package.json` / `Cargo.toml` 里有一堆不再使用的依赖
- [ ] **循环依赖 / 版本冲突**:依赖之间互相打架,靠降版本凑合

### 5.2 配置管理(-2 分/项)

- [ ] **配置散落各处**:同一类配置分散在 5 个不同的文件里
- [ ] **环境判断硬编码**`if (location.hostname === 'localhost')` 判断是否开发环境

---

## 第六章:测试与文档(10 分)

### 6.1 测试(-5 分/项)

- [ ] **零测试**:没有任何单元测试、集成测试
- [ ] **测试形同虚设**:测试只测 `2 + 2 = 4`,不覆盖核心业务逻辑
- [ ] **测试不稳定**:同一个测试有时过有时不过(flaky test)

### 6.2 文档(-3 分/项)

- [ ] **零文档**:没有 README、没有架构说明、没有 API 文档
- [ ] **文档过期**:文档描述的和实际代码完全不同

---

## 第七章:版本控制(5 分)

### 7.1 Git 提交(-2 分/项)

- [ ] **提交信息是谜语**`fix`, `update`, `aaa`, `临时提交`
- [ ] **巨型提交**:一个 commit 改动超过 20 个文件、1000 行
- [ ] **提交无关改动**:一个 commit 里混杂功能开发、Bug 修复、格式化、依赖更新

### 7.2 分支管理(-2 分/项)

- [ ] **长期不合并的分支**:分支超过 2 周不合并,冲突已无法解决
- [ ] **直接在 main 上开发**:没有分支隔离,main 随时可能崩

---

## 第八章:专项扣分(附加项,不计入基础 100 分)

以下情况属于"一票否决"级别,发现即判定为屎山:

| 编号 | 项 | 扣分 | 说明 |
|------|-----|------|------|
| S1 | SQL 注入漏洞 | -20 | 用户输入直接拼 SQL |
| S2 | 明文存储密码 | -20 | 数据库里存明文密码 |
| S3 | 生产环境 print 调试 | -10 | `console.log` / `print` / `println!` 散落在线上代码里 |
| S4 | 无意义的提交历史 | -10 | 50 个 commit 全是 `fix` / `update` |
| S5 | 大文件入库 | -15 | 二进制文件、视频、模型文件被 git 跟踪 |
| S6 | 死代码占比 > 30% | -10 | 大量未被调用的函数/类/文件 |
| S7 | 单文件超 2000 行 | -10 | 一个源文件超过 2000 行 |

---

## 附录 A:快速自查清单

回答以下 10 个问题,每个"否"计 1 分(满分 10 分,越低越山):

1. 新人能否在 **半天内** 理解项目核心架构?
2. 修改一个功能是否 **只需要改动 1-2 个文件**
3. 出现 Bug 时能否 **快速定位到相关代码**
4. 代码是否有 **一致的命名风格和组织方式**
5. 核心业务逻辑是否有 **单元测试覆盖**
6. 是否能 **一键构建并运行** 项目?
7. 错误发生时是否有 **清晰的错误信息和日志**
8. 依赖版本是否 **锁定且定期更新**
9. 是否有 **清晰的模块边界和分层**
10. 团队成员是否 **敢在不问原作者的情况下修改代码**

> **评分**:10 分 = 清风明月,7-9 分 = 小有瑕疵,4-6 分 = 初具规模,0-3 分 = 不可名状。

---

## 附录 B:屎山成因分析

屎山不是一天堆成的,常见成因:

| 阶段 | 表现 | 根因 |
|------|------|------|
| 赶工期 | "先上线再说" | 业务压力,技术债无暇偿还 |
| 人走茶凉 | 核心开发者离职,无人敢动 | 知识未沉淀,代码即文档 |
| 打补丁 | 每次只修表面,不治根因 | 缺乏重构时间和勇气 |
| 需求膨胀 | 功能无限叠加,架构从未升级 | 初期设计未考虑扩展性 |
| 缺乏规范 | 每个人按自己风格写 | 没有 Code Review,没有编码规范 |
| 信息孤岛 | 同一个逻辑写了 N 遍 | 模块间缺乏沟通,重复造轮子 |

---

## 附录 C:使用方法

### 自评流程

1. **复制本文件**到目标项目
2. 逐项检查,勾选存在的问题
3. 计算总扣分,得出最终得分
4. 对照评级表确定等级

### 定期复查

建议每个迭代结束时进行一次快速自查(附录 A),每个季度进行一次全面鉴定。

---

> **免责说明**:本准则用于自我审视和团队交流,不用于人身攻击。
> 代码写成屎山不丢人,知道自己是屎山还不改才丢人。

---

*版本:v1.0 | 创建日期:2026-06-11*

0.1 到 0.2 | 从 30万 到 50万 | 我造了一台AIGC生产机器

# 从 0.1 到 0.2,比格熊跨了一大步:直连官方 API、本地化运行、52 万行代码造一台真正的「数字导演机器」

> 版本号从 0.1.613 跳到 0.2.612,不是修了几个 Bug 那么简单。这是一次架构层面的跨越式升级——跨平台地基打好、画布内核重写、六边形架构落地、故事管线深度重构。如果你之前觉得「AI 分镜工具就是调调 API」,这篇文章会让你重新认识这个产品。

---

## 先说人话:0.2 到底升级了什么?

打开比格熊,你可能第一眼看不出太大区别——界面还是那个界面,菜单还是那个菜单。但如果你把 0.1.613 和 0.2.612 的代码放在一起对比,你会发现:**底层几乎重写了一遍**

用一句话概括这次升级:

> **把一台「能用的机器」,升级成了一台「能扩展、能移植、能扛住未来三年迭代的机器」。**

具体来说,0.2 版本做了这几件大事:

1. **跨平台地基浇筑完成**——为未来在 iPad 上运行铺好了路
2. **画布内核全面重写**——连线系统统一、缩放控件统一、支持面板弹出多屏
3. **六边形架构正式落地**——33 个 Repository 端口,领域层与存储层彻底解耦
4. **故事管线深度重构**——故事圣经变更自动同步到受影响的剧集
5. **提示词工程全仓统一**——五层架构、17 条 SSOT 入口、CI 门禁自动检查
6. **字号系统 SSOT 化**——全仓字号用一套 CSS 变量管理,改一处全局生效

听起来很技术?别急,下面我一个一个用大白话讲清楚。

---

## 一、直连官方 API,不降级、不中转

这是比格熊最硬核的一点,也是很多人误解最深的一点。

市面上大部分「AI 创作工具」做的事情是:把几家模型的 API 包一层,做成一个统一的界面。用户在里面点按钮,工具在后台转发请求,拿到结果展示出来。这种做法有个致命问题——**你不知道中间经历了什么**

有些工具会在后台偷偷做「降级处理」:你选了 A 模型,但 A 模型排队太久或者报错了,工具静默换成 B 模型给你出结果。你拿到的图或者视频,可能根本不是你以为的那个模型生成的。

比格熊的做法完全不同:

**你选了什么模型,系统就用什么模型。不会偷偷换通道,不会静默兜底。没有适配过的模型宁可报错也不给你废图。**

这不是一句口号,是写在架构里的硬规则。后端有一个「统一端点注册表」——即梦、可灵、通义万相、Seedance、OpenAI,每家模型的接口都不一样,但比格熊把它们的差异全部封装在底层。业务管线只认统一接口,新增一家模型厂商,只需要注册一个新端点,业务层零改动。

更重要的是:**每一次生成请求,都是从你的电脑直连到模型厂商的官方 API**。没有中间服务器转发,没有第三方中转站。你的请求路径是:

```
你的电脑 → 模型厂商官方 API → 结果返回你的电脑
```

不是:

```
你的电脑 → 某个中转服务器 → 模型厂商 API → 中转服务器 → 你的电脑
```

**直连意味着什么?**

- **速度更快**——少一跳就少一层延迟
- **隐私更安全**——你的提示词、你的素材,不经过任何第三方服务器
- **成本更透明**——你用的就是官方定价,没有中间商加价
- **稳定性更高**——不依赖某个中转服务的存活

而且比格熊不只是接了一两家模型。当前已接入的模型矩阵:

| 能力 | 已接入模型 |
|------|-----------|
| 文本生成 | OpenAI、本地 llama.cpp 等 |
| 图片生成 | 即梦、通义万相、ComfyUI 等 |
| 视频生成 | 即梦、可灵、Seedance、通义万相等 |
| 语音合成 | 多家云端 TTS + 本地方案 |
| 唇形同步 | Hedra、LivePortrait、MuseTalk、Wav2Lip、可灵 — 5 种适配器 |

**今天能用的模型,明天全部能用。明天出来的模型,后天就能接上。** 这就是统一端点注册表的威力。

---

## 二、本地化运行,数据主权在你手里

比格熊是一个**安装在你电脑上的桌面客户端**,不是网页,不是在线白板。

这意味着什么?意味着你的故事、剧本、分镜、任务记录、生成的图片和视频——**全部存在你自己的电脑上**。不是存在某个云服务商的服务器上,不是存在某个网站的数据库里,是实实在在落在你硬盘的 SQLite 文件里。

**「本地化运行」到底好在哪?**

**第一,数据不会莫名消失。** 用网页工具,你有没有过这种经历:某天打开一个常用的在线工具,发现它改版了、下线了、或者你的账号出了问题,所有数据都没了。比格熊不存在这个问题——你的工程文件就在你的电脑上,拷到另一台电脑上照样打开。

**第二,断网也能用。** 比格熊内置了本地 AI 能力:通过 llama.cpp 可以跑本地大模型做文本推理,通过 Whisper 可以做本地语音识别。在飞机上、在偏远地区、在保密环境里,你照样能编辑工程、跑本地推理。云端 AI 是「可选外挂」,不是「唯一脊梁」。

**第三,隐私有保障。** 你的剧本不会自动上传到任何地方。对外发出的请求,只有你在某个按钮上**明确触发**的那次生成。机构关心「剧情与素材出不出域」的时候,比格熊的架构能给出清晰的边界——数据默认在本地,只有你主动发起的生成请求才会出境。

**第四,不绑定任何网站的生命周期。** 关闭浏览器不会丢工作,清理 Cookie 不会清空项目,某家网站改版不会影响你的工程。比格熊就像 Word 或 Photoshop 一样——装在你电脑上,打开就是你的工作环境。

---

## 三、52 万行代码,不是套壳 API 聚合器

很多人看到「AI 工具」四个字,第一反应是:不就是调几个 API,拼一个界面嘛。

比格熊的代码规模会让这种想法彻底破灭:

| 类别 | 文件数 | 代码行数 |
|------|--------|----------|
| Rust 后端 | 1147 | 20.3 万 |
| TSX 前端 | 519 | 11.0 万 |
| TS 逻辑层 | 1766 | 19.3 万 |
| **合计** | **≈3598** | **≈52.3 万** |

52.3 万行自研代码,3598 个文件。这不是一个周末项目,不是从 GitHub 上 clone 下来改改就发布的东西。这是一个人、从零开始、持续迭代的**正经生产软件**

而且这些代码不是「能跑就行」的堆砌。0.2 版本做了几个架构层面的大动作:

### 六边形架构正式落地

这是软件工程里一个很高级的设计模式。简单说就是:**你的业务逻辑和数据存储完全分开**

0.2 版本新增了 33 个 Repository 端口和 5 个 DTO(数据传输对象),覆盖画布、片段、角色、分镜、迁移等全领域。这意味着什么?意味着将来如果要换一个数据库,业务逻辑完全不用改;如果要加一个云端存储选项,只需要写一个新的适配器。

**四层分离**——领域层、应用层、基础设施层、组装层——每一层只干自己的事。上层知道下层,下层不知道上层。就像一栋楼:三楼知道有二楼,但二楼不知道三楼长什么样。加一个四楼,二楼完全不受影响。

### 故事管线深度重构

0.2 版本新增了一个 830 行的「故事同步管线」。这个管线做的事情是:当你修改了故事圣经(角色设定、世界观等核心设定),系统会自动检测哪些剧集受到影响,自动合并冲突,然后逐章同步更新。

以前你改了一个角色的性格设定,可能需要手动去每一集检查有没有矛盾。现在系统帮你做了。这不是「AI 帮你写故事」,是**工程化的自动同步机制**

### 提示词工程全仓统一

比格熊的提示词系统不是「写一句 prompt 发给 AI」那么简单。它有五层架构(UPEA),17 条 SSOT 入口,还有 CI 门禁脚本自动检查。

什么是 SSOT?Single Source of Truth——单一数据源。一个提示词模板,从数据库到接口到界面,只有一个权威来源。改一处,全局生效;不会出现「数据库里是 A,界面上显示 B」的情况。

0.2 版本还做了视觉样式词表统一、negative prompt 统一管理,甚至写了自动化检查脚本——每次提交代码前自动检查提示词有没有违反规范。这种工程严谨度,在消费级 AI 工具里极其罕见。

---

## 四、画布内核全面重写——自研引擎的真正威力

比格熊的无限画布是**完全自研**的,不依赖任何第三方商业画布包。0.2 版本对画布内核做了一次全面重写。

### 连线系统统一

以前,片段画布、分镜画布、角色画布各自有一套连线逻辑,交互方式不完全一致。0.2 版本新增了 `canvas-connector` 统一模块,把所有画布的连线系统收归一处。

这意味着什么?意味着你在一个画布里学会的连线操作,在其他画布里完全通用。**改一处交互,五处同时受益。**

### 缩放控件全仓统一

以前每个画布有自己的缩放组件——有的是滑块,有的是按钮,有的是快捷键。0.2 版本把这些全部统一成 `CanvasZoomHud` 通用组件,删除了 5 套旧的缩放组件,减少了约 600 行冗余代码。

### 面板弹出多屏

这是一个很实用的新功能:你可以把画布上的某个面板「弹出来」变成一个独立窗口,拖到第二个显示器上。对于有双屏或者多屏工作环境的创作者来说,这大大提升了工作效率。

### 性能策略

比格熊的画布不是「能显示就行」的简单实现。它有一套完整的性能策略:

- **虚拟渲染**——只重点处理屏幕附近的内容,视野外的卡片不画
- **分批加载**——几百张图不会一次性涌入,按需加载
- **视野外降级**——视频、大图离开视野后自动释放资源,不白占内存
- **指针中心缩放**——以鼠标位置为中心缩放,手感一致不跳帧

内部规格对**数百个节点**量级写了性能目标——先定体验指标,再实现。这是基础设施思路,不是「能用就行」。

---

## 五、跨平台地基浇筑——iPad 版已在路上

0.2 版本做了一件看起来「用户感知不到」但极其重要的事:**跨平台基础架构升级**

比格熊目前是 Windows 桌面应用,但 0.2 版本已经开始为 iPad 支持做准备。核心改造包括三个 trait(特征抽象):

- **PlatformPaths**——抽象文件系统访问。Windows 上读 `C:\Users\...`,iPad 上读 `NSDocumentDirectory`。上层代码不需要知道底层是什么系统。
- **ProcessExecutor**——抽象外部进程调用。Windows 上可以直接调 FFmpeg、llama.cpp,iOS 上全部走云端降级。
- **AiCapabilities**——抽象 AI 能力。iPad 上不能跑本地大模型?没关系,自动降级到云端。

这三个抽象层意味着:**将来移植到 iPad,核心业务逻辑几乎不用改**。只需要为 iOS 写一套「适配器」,把文件操作、进程调用、AI 能力替换成 iOS 版本就行。

这不是「以后再说」的规划,是**已经写进代码里的架构**。跨平台地基已经浇筑完成,后续的 iPad 适配是在这个地基上盖楼。

---

## 六、你选什么模型,就用什么模型——能力映射系统

这是比格熊最被低估的功能之一。

在设置里,有一个「能力映射」面板。在这个面板里,你可以精确控制:文本生成用哪家模型、图片生成用哪家模型、视频生成用哪家模型、语音合成用哪家模型。

而且这个映射是**全局生效**的。你在这里设置好了,整个应用所有需要生成的地方都按这个来。不会出现「分镜工作台用 A 模型,角色工作台用 B 模型」的混乱情况——除非你明确在某个地方做了单独设置。

**更关键的是:系统记住你上次实际使用了什么。** 你上次用可灵生成了一个视频,下次打开视频工作台,默认就是可灵。但这个「记住」是基于你实际使用的结果,不是基于某个硬编码的默认值。

多家供应商加多台本地模型混用时,这种「列表可控、心智稳定」的体验至关重要。你不需要每次都去翻下拉列表找你常用的那个模型——系统帮你记住了。

---

## 七、双脑分镜——AI 不只是帮你画画,是帮你当导演

这是比格熊区别于所有「AI 分镜工具」的核心能力。

市面工具的「AI 分镜」通常是:你写一句话,AI 出一张图。完事。

比格熊不是。每个镜头经过**两层大脑**处理:

**导演脑(语义层)**——理解剧本,拆出镜头语言:景别、机位角度、运镜方式、角色走位、身体朝向、视线方向、对白模式……这些是影视工业几十年积累的专业概念,不是随机排列。

**工程脑(渲染层)**——把导演语义翻译成画面可执行的结构化参数:构图锚点、头部空间、鼻前空间、纵深层次、光线方向、轴线规则……

两层分开的好处:导演语义可以反复调整,不用每次从头重画;工程参数可以批量替换,换一套渲染风格只需改工程脑,不用动导演脑。

0.2 版本对这两层都做了重大升级——后端新增了五阶段提示词管线(编译门控→布局提取→参考引导→文本锚定→解析),前端对齐了相同的管线逻辑。**前后端的提示词生成逻辑完全一致**,不会再出现「前端算出来的和后端算出来的不一样」的尴尬。

而且还有**叙事保真协议(NFP)**:每集剧本自动对照 NFP 规则做结构化检查——戏剧弧位是否完整、冲突类型是否合理、节奏目标是否匹配。检查结果不是笼统的「写得不好」,而是精确到规则 ID + 违规依据。

对话场景还有**自动质检**:必须有 master 镜、双方各有 OTS 和 reaction 镜——这是好莱坞几十年的覆盖拍摄规范,系统会自动检查并补全。

**AI 不只是帮你写故事,还帮你守规矩。**

---

## 八、自研通用图引擎——故事结构不是树,是网

传统的项目管理工具用「文件夹」组织内容——一层套一层,像树状目录。但故事不是这样的:角色跨集出场、场景跨章引用、镜头之间有因果和并行关系。

比格熊内置了一个**自研的通用有向图引擎**(GraphCore),用节点和连线来表达故事结构。每个节点可以连接任意多个其他节点,支持拓扑排序、连通性分析、环路检测。

这套引擎是**通用**的——分镜故事板、片段画布、Clips 片段管理——所有涉及「关系」的场景,共用同一套图引擎。**造一次,用五处。**

0.2 版本对图引擎做了性能优化和存储层升级,配合六边形架构的端口抽象,图引擎的持久化层可以灵活切换。

---

## 九、AI 任务队列——加一种能力,只写一个文件

比格熊的 AI 任务系统不是「调一个 API 等结果」那么简单。它有一套完整的任务生命周期管理:

- **状态机**——每个任务有明确的状态流转:排队→执行中→成功/失败/取消
- **调度器**——多个任务自动排队、并发控制、配额管理
- **持久化**——任务记录落盘,关掉软件再打开,任务状态还在
- **事件总线**——任务状态变化实时通知前端,进度条不是假的

已经支持 14 种不同的 AI 任务类型(文生图、图生图、视频生成、语音合成、唇形同步……),每种任务只需要注册一个 Handler,调度、排队、持久化、前端通知——全部自动生效。

**加一种新的 AI 能力,就像往书架上放一本新书——书架不用重建。**

---

## 十、ComfyUI 深度集成——不只是调用,是完整嵌入

如果你是 AI 图像生成的重度用户,你一定知道 ComfyUI——最流行的本地 Stable Diffusion 工作流工具。

比格熊对 ComfyUI 的集成不是「简单调个 API」那么粗糙。它是**完整集成**

- HTTP/WebSocket 双协议客户端
- 工作流扫描与编译器
- 占位符注入
- 自定义工作流支持
- 图像/视频双管线
- 设置管理

27 个源文件,覆盖了 ComfyUI 的方方面面。你可以在比格熊里直接使用你在 ComfyUI 里搭建的自定义工作流,不需要在两个软件之间来回切换。

---

## 十一、FFmpeg 媒体运行时——视频转码、音频提取、字幕合成

比格熊内置了完整的 FFmpeg 集成(12 个源文件),封装了 FFmpeg CLI 的定位、参数构建、执行、探测解析。

这意味着什么?意味着在从分镜图到最终成片的全链路中,所有需要媒体处理的环节——视频转码、音频提取、字幕合成、格式转换——都可以在应用内完成,不需要你另外安装和配置 FFmpeg。

---

## 十二、权限系统与配额管理——面向机构的设计

比格熊不只是给个人用户用的。它内置了一套可插拔的权限框架:

- **权限后端**——支持多种认证方式
- **装饰器**——函数级权限控制
- **审计日志**——每一次操作都有记录
- **缓存层**——权限检查不影响性能
- **日配额管理**——控制每天的 AI 生成次数

这套系统面向的是机构采购和团队使用场景。对于影视公司、教育机构、内容团队来说,「谁能用、用了多少、做了什么」是必须回答的问题。比格熊从架构层面就考虑了这些需求。

---

## 十三、唇形同步——5 种适配器,总有一款适合你

这是比格熊在视频生成领域的一个独特能力。当你的角色需要「开口说话」时,光有配音是不够的——嘴型要对得上。

比格熊内置了 5 种唇形同步适配器:

- **Hedra**——高质量唇形驱动
- **LivePortrait**——实时肖像动画
- **MuseTalk**——开源唇形同步
- **Wav2Lip**——经典的音频驱动唇形
- **可灵**——视频模型自带的唇形能力

5 种方案,覆盖从「够用」到「精雕」的不同需求。你可以根据自己的预算和质量要求,选择最适合的方案。

---

## 十四、自动更新与断点续传

0.2 版本改进了应用更新体验:

- **静默后台下载**——更新包在后台下载,不打断你的工作
- **断点续传**——网络中断后恢复下载,不需要从头再来
- **被动安装模式**——下载完成后提示你安装,你选择合适的时间重启

这些看起来是「小功能」,但对于一个需要频繁更新的桌面应用来说,更新体验的好坏直接影响用户的留存意愿。

---

## 说到底,0.2 版本意味着什么?

0.1 是「能用」。0.2 是「能扩展、能移植、能扛住未来三年迭代」。

从用户视角看,0.2 版本的体验提升是渐进的——你可能不会立刻感觉到「哇,完全不同了」。但从架构视角看,这是一次质的飞跃:

- **跨平台地基浇筑完成**——iPad 版不再是一个遥远的梦想,而是一个「写适配器就能实现」的工程任务
- **六边形架构落地**——换数据库、换云服务商、加新功能,都不会牵一发动全身
- **画布内核重写**——所有画布共用一套引擎,改一处交互,五处同时受益
- **提示词工程统一**——前后端逻辑一致,CI 门禁自动检查,不会再出现「前端算的和后端不一样」

**架构决定上限。比格熊的上限,远不止你现在看到的样子。**

---

## 适合谁用?

- 🎬 **独立创作者**——一个人也能产出完整的分镜和视频草稿
- 📹 **短视频团队**——批量试制 AI 辅助前期,快速验证创意
- 🎓 **影视院校**——学生在可控环境下练习分镜和导演思维
- 📖 **网文/漫画作者**——把文字故事可视化,试拍「纸上电影」
- 🏢 **内容机构**——数据不出域、操作可追溯、模型可审计

---

## 现在就试试

比格熊数字导演工作站,Windows 桌面客户端,本地安装,即开即用。

- ✅ 直连官方 API,不降级、不中转
- ✅ 本地化运行,数据主权在你手里
- ✅ 52 万行自研代码,不是套壳
- ✅ 支持即梦、可灵、通义万相、Seedance、OpenAI 等多家模型
- ✅ 内置 llama.cpp + Whisper 离线推理
- ✅ 5 种唇形同步方案
- ✅ ComfyUI 本地工作流深度集成
- ✅ 自研无限画布内核,数百节点流畅运行

**你的故事。你的数据。你的选择。**

🔗 [bgxiong.com](https://www.bgxiong.com)

---

*52.3 万行代码,从零到一。不是套壳,不是聚合器,是造机器。版本号从 0.1 跳到 0.2,不是修 Bug,是重建地基。*