NovaNova Studio 是一个 Agent 驱动的 AI 创作工作台,集图片生成、视频生成、无限画布与多模型 API 、漫剧短剧生成于一体,为独立创作者和视觉团队打造更智能、更高效的创作体验。


✨ 项目定位
Novanova Studio 是面向独立创作者与视觉团队的 AI 创作工作台。它不是把图片、视频、提示词和生成记录拆散在多个工具中的集合,而是以无限画布 作为创作上下文,以 AI Agent 作为理解意图、选择工具和推进任务的中枢。
创作者可以从一句自然语言目标或一组参考素材开始,在图片、视频和画布场景中持续对话、生成、编辑、比较与复用结果;生成记录、资产、提示词和画布节点会保留在同一条创作链路中。
🧠 Agent 贯穿创作链路
Agent 不是单独的聊天窗口,也不是一次性转发模型请求的接口。它贯穿从意图理解到结果沉淀的完整流程:
| 阶段 | Agent 与系统职责 | 创作体验 |
|---|---|---|
| 1. 输入目标 | 接收自然语言、图片或视频参考素材,按图片、视频或画布场景选择对应 Agent Profile(能力配置)。 | 从一句描述或已有素材开始。 |
| 2. 选择工具 | 根据上下文调用图片生成、图片编辑、视频生成、视频编辑、历史查询或画布操作工具。 | 不必在多个功能页之间反复切换。 |
| 3. 创建任务 | 校验模型能力与积分,写入 PostgreSQL 任务快照,并投递到 Redis Stream(Redis 的持久消息流)消费组。 | 长耗时生成不会阻塞当前创作。 |
| 4. 执行与反馈 | 任务消费者调用已配置的 AI 渠道;状态、工具调用和结果通过 SSE(Server-Sent Events,服务端推送事件流)推送回前端。 | 在对话和画布中看到实时进度、失败或取消状态。 |
| 5. 沉淀上下文 | 生成结果写入生成记录,可在画布中继续引用,并按需加入资产库;画布 Agent 可继续引用节点状态与工具结果。 | 下一轮修改和复用保留前一轮创作上下文。 |
Agent 能力
| 场景 | Agent 能力 | 结果去向 |
|---|---|---|
| 图片创作 | 根据对话调用图片生成、参考图编辑与历史查询工具。 | 对话轮次、生成记录与画布图片节点;可按需加入资产库。 |
| 视频创作 | 调用视频生成、视频编辑与历史查询工具,并按模型能力校验图片或视频参考。 | 对话轮次、生成记录与画布视频节点;可按需加入资产库。 |
| 无限画布 | 读取当前画布状态,创建、更新、移动、缩放、删除和连接节点;可创建文本、图片、视频生成流并启动任务。 | 可继续编辑的画布项目与节点关系。 |
| 提示词优化 | 图片和视频使用独立策略优化提示词,优化成功后再回填输入内容。 | 当前创作输入,不覆盖失败前的原始提示词。 |
| 实时协作 | 前端画布工具执行后把工具结果回传给服务端 Agent,Agent 可基于真实执行结果继续下一轮。 | 保持"对话 -> 工具 -> 结果 -> 继续对话"的连续体验。 |
🎨 核心功能
- 无限画布:把文字、图片、视频、参考素材和生成结果放到同一空间编排,保留创作上下文。
- 对话式图片与视频生成:在同一会话中完成生成、编辑、引用历史结果和继续迭代。
- 多渠道模型配置:在"配置与用户偏好"中维护 AI 渠道、模型能力、默认模型和积分消耗规则。
- 素材与生成记录:保存可复用资产、生成历史和提示词,减少重复上传与重复配置。
- 对象存储接入:支持腾讯云 COS、阿里云 OSS、七牛云 Kodo,用于上传素材与保存生成结果。
- 用户与运营能力:邮箱登录、OAuth2 登录、积分、通知、提示词库、首页展示和管理员后台。
- 异步任务机制:Redis Stream 消费组、任务锁、失败恢复与 SSE 事件流支撑可追踪的长耗时任务。
🚀 当前分支新增能力
- 视频生成技能与工作流:管理员可维护图片、视频生成技能;视频页支持技能引导式多轮澄清、提示词草案确认,以及首帧、尾帧图片生成后再合成视频。
- 首尾帧视频模式 :新增
first-last-frame-to-video能力,支持将首帧和尾帧作为带角色的参考素材传入兼容渠道。 - 自定义模型调用:图片和视频模型可配置自有 API 的请求/响应模板、异步查询路径和占位符,适配自建模型服务。
- 模型展示配置:管理员可为模型设置展示名称和展示图标;Evolink 渠道支持拉取模型列表。
- 视频分档计费:可按视频模型的分辨率、时长等规格配置积分价格,工作流会展示各阶段报价。
- 积分流水与快捷入口:用户可从画布顶部查看积分余额并进入积分记录,流水支持增加、消耗和退款方向及来源筛选。
- 管理与可观测性:新增技能管理、风格封面分类、提示词封面、结果详情和接口访问日志;AI 异步任务轮询间隔支持统一配置。
🌟 项目优势特点
🧠 Agent 驱动的连续创作上下文
Agent 不只是一次性调用模型,而是贯穿需求理解、工具选择、任务编排、结果反馈和下一轮创作。对话、生成记录、素材与画布节点可以持续互相引用,减少在多个工具之间重复整理上下文。
🎨 无限画布连接创作过程
文字、参考素材、图片、视频、生成任务和结果都可以放在同一张画布中进行编排。画布 Agent 能读取节点状态并执行创建、移动、缩放、连接和生成等操作,让画布成为可继续编辑的创作项目,而不只是结果展示页。
🧩 技能化、工作流化的复杂创作
技能通过可配置提示词驱动引导式交互,工作流负责定义阶段、任务角色和状态流转。例如首尾帧视频工作流可以依次完成需求澄清、提示词确认、首帧生成、尾帧生成和视频合成,后续可以沿用同一机制扩展更多创作流程。
🔌 开放的模型与渠道接入
项目采用渠道适配器和模型能力配置解耦的方式,支持 OpenAI 兼容、Gemini、Agnes、Seedance、MiniMax、Evolink 等渠道,也支持通过请求/响应模板接入自有图片或视频模型。模型展示名称、图标、能力和计费规则可以由管理员独立配置。
⚡ 面向长耗时任务的可靠执行
图片和视频生成通过 Redis Stream 异步队列执行,结合任务锁、状态轮询、SSE 实时事件、取消、失败恢复和统一轮询配置,适合处理视频生成等长耗时任务,并保持任务状态可追踪。
🔒 可私有化部署、可运营扩展
服务端集中管理模型密钥和对象存储凭证,支持 Docker Compose、PostgreSQL、Redis 及多种对象存储部署方式。管理后台覆盖模型、技能、风格、提示词封面、结果详情、积分流水和接口访问日志,便于按团队或业务场景运营。项目使用的架构基于主流 Java 框架,方便企业化扩展,天然支持类似于 SpringCloud、K8s 的微服务架构。