一、模型速览
SenseNova U1.5 Lite 是商汤「SenseNova-U1」统一多模态家族的 8B 轻量版本,2026-08-21 正式开源,Apache 2.0 协议,个人/学术/商业均可免费使用、微调与二次分发。它最大的特点是「一个模型干三件事」:图像理解(看图问答、OCR、图表解析、多图对比推理)、文本生成图像、图像编辑(局部修改、元素替换、多参考图合成)全部由同一套权重完成,没有传统扩散模型里独立的 VAE 与视觉编码器。
| 维度 | 信息 |
|---|---|
| 发布方 | 商汤科技(SenseTime) |
| 参数量 | 8B 稠密(MoT 架构,非标准 MoE) |
| 上下文 | Prompt 原生支持 3--4k token;视觉理解最高 32K token |
| 许可证 | Apache 2.0(可商用) |
| 一句话定位 | 把「看懂图 + 生图 + 改图」塞进一个 8B 模型,原生 4K 输出,单卡可部署 |
为什么值得单列一篇?过去一年开源多模态生成模型大多走「生图一个模型 + 编辑另一个模型 + 理解再一个模型」的拼装路线,部署与协同成本都不低。U1.5 Lite 把三者收敛进 8B 单一权重,意味着你只需维护一套服务、一份显存预算,就能同时承接「看菜单推荐菜品 → 按文案出 4K 海报 → 把海报里的价格改掉」这样的串联任务。对中小团队而言,这种「统一」本身就是降本。
二、核心亮点
1. NEO-Unify:去掉 VE/VAE 的端到端统一架构
传统多模态生成模型通常串联「视觉编码器 + VAE + 扩散主干」,链路长、误差易累积。U1.5 Lite 采用 NEO-Unify 架构,把图像 Patch 与文本 Token 直接送入同一个 Transformer,配合 MoPD(多专家在线策略蒸馏) :训练阶段并行训练多个任务专家(文字渲染、美学、编辑等),交付时融合成单个 8B 模型------无路由开销、无专家切换、低推理时延。
python
# 架构要点(来自官方技术说明,非代码可执行)
# NEO-Unify: image_patch + text_token -> 同一 Transformer
# MoPD: 训练多专家 -> OPD 蒸馏 -> 单个 8B 融合模型
# 收益: 理解任务学到的「物体关系/空间结构/版式层级」会反哺生成与编辑
去掉 VE/VAE 不只是架构优雅:它砍掉了两处串行编解码,推理链路更短,单步延迟更低,也让「理解到的空间结构」能直接映射到「生成时的版式」,这正是 U1.5 Lite 在复杂布局海报上表现稳的关键。
2. 原生 4K 输出 + 超长复杂指令遵循
多数开源生图模型在 Prompt 超过 1k 字符时就「漏细节」,U1.5 Lite 原生支持 3--4k 字符复杂指令,能同时约束主体、数量、空间关系、文字、布局、风格,一次性落到同一张画面。正式版在 4K 高分辨率下兼顾整体构图与微小文字、材质肌理。
python
# 官方示例:一份「完整创作方案」级别的 Prompt 也能稳定执行
"这张信息图的标题是 SenseNova-U1,采用现代极简科技矩阵风格......
主标题使用粗体无衬线黑体字......左/中/右三列网格......"
# 这类长 Prompt 在 U1.5 Lite 上不会崩溃或遗漏约束(官方演示)
3. 强可控图像编辑:Bounding Box / Visual Marker / 多参考图
编辑支持自然语言局部修改、元素替换、文字精修,以及 Bounding Box 框选、Visual Marker 标记、多参考图输入合成,且对非编辑区域保持度(identity/geometry/preservation)显著优于 Preview 版------这对电商换装、海报改字等真实交付场景至关重要。它还支持多轮迭代编辑:先改主体颜色,再调背景,画面不会逐轮「跑偏」,这是很多生图模型做不到的。
4. 统一理解与生成互相增强
理解侧(看图问答、OCR、图表解析、多图对比推理)与生成侧共用权重,双向互相增强;还支持原生交错图文生成(输出「文本 + 图片」混排内容),适合报告、手册、图文笔记自动排版。
5. 完整的开源工程配套
官方同步放出:GitHub 推理示例、HuggingFace / ModelScope 权重、GGUF Q8 量化权重、Prompt 增强工具、SenseNova-Skills 工具库,以及 LightLLM + LightX2V 生产部署镜像,落地门槛极低。
三、部署实战
环境:Linux / WSL2,Python ≥ 3.10,需 NVIDIA GPU(CUDA 12.x)。消费级 24GB 卡(如 RTX 4090)走
fast模式;10--12GB 卡走 Q4 GGUF +balanced模式。
3.1 环境准备与模型下载
bash
# 1) 克隆官方仓库(内含 examples 推理脚本)
git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
# 2) 安装依赖(官方推荐 uv;也可用 pip)
pip install -e ".[gguf]" # 包含 diffusers/gguf 等可选依赖
# 或仅装量化推理所需:pip install "gguf>=0.10.0" "diffusers>=0.30.0"
# 3) 拉取权重(自动缓存到本地,二选一)
# HuggingFace:
huggingface-cli download sensenova/SenseNova-U1.5-8B-MoT --local-dir ./weights/u15
# 或 ModelScope:
modelscope download SenseNova/SenseNova-U1.5-8B-MoT --local_dir ./weights/u15
3.2 推理代码(完整可运行 Python 封装)
官方示例以脚本形式提供(t2i / editing / vqa)。下面这份 u15_demo.py 封装了三类任务,克隆仓库并装好依赖后直接 python u15_demo.py 即可运行。
python
# u15_demo.py ------ SenseNova U1.5 Lite 一键推理封装
import subprocess
MODEL = "sensenova/SenseNova-U1.5-8B-MoT" # 或本地路径 ./weights/u15
def run(task: str, **kwargs):
"""调用官方 examples/<task>/inference.py,无 GPU 实测,按官方 README 传参。"""
cmd = ["python", f"examples/{task}/inference.py", "--model_path", MODEL]
for k, v in kwargs.items():
cmd += [f"--{k}", str(v)]
print(">>", " ".join(cmd))
subprocess.run(cmd, check=True)
# 1) 文生图(T2I):原生 4K,可指定尺寸/步数/cfg
run("t2i",
prompt="A cyberpunk ramen shop at night, neon signs, cinematic lighting, 8k, highly detailed",
width=2048, height=2048,
cfg_scale=4.0, cfg_norm="none", timestep_shift=3.0, num_steps=50,
output="output.png", profile=True)
# 2) 图像编辑(Editing):改色/换元素,支持 Bounding Box / Visual Marker
run("editing",
image="input.jpg",
prompt="Change the jacket of the person on the left to bright yellow.",
cfg_scale=4.0, img_cfg_scale=1.0, cfg_norm="none",
timestep_shift=3.0, num_steps=50,
output="edited.png", profile=True, compare=True)
# 3) 视觉理解(VQA):看图问答 / OCR / 图表解析
run("vqa",
image="menu.jpg",
question="我和朋友两人今晚聚餐,看菜单推荐一组搭配均衡、性价比高的菜品。",
max_new_tokens=8192, do_sample=True,
temperature=0.6, top_p=0.95, top_k=20, repetition_penalty=1.05,
output="answer.txt", profile=True)
低显存用户(10--12GB 卡)改用官方 GGUF Q8 权重,配合 balanced 模式:
bash
python examples/t2i/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT \
--gguf_checkpoint ./weights/u15/SenseNova-U1.5-8B-MoT-Q8.gguf \
--prompt "A male peacock trying to attract a female" \
--output output_gguf.png --vram_mode balanced
3.3 效果验证
运行后检查三处产物:① output.png 是否为 2048×2048(或指定尺寸)的 4K 图;② edited.png 与 compare 拼接图,确认非编辑区域未被改动;③ answer.txt 是否给出符合菜单语境的推荐。官方在线 playground(unify.light-ai.top)可零安装先验证效果,再决定是否本地部署。本地首次运行建议先用一张小图(如 1024×1024)跑通管线,确认 --profile 输出里模型加载、采样步数、端到端耗时都正常,再上 4K;若报显存不足,先切 GGUF Q4 + balanced 模式,不要盲目加 --num_steps。
四、性能测评
说明:笔者当前环境无 GPU,以下时延/显存均为官方 README 与商汤技术报告口径,非本人实测,严格标注「官方数据」。
1)推理时延(秒/张)
- 生产部署(LightLLM + LightX2V,H100/H200,TP2+CFG2):2048×2048 出图约 0.15 s/step、端到端 ~9 s(官方数据)。
- 消费级单卡(RTX 4090,
fast模式)受算力限制会更慢,官方未给单卡具体数字,建议读者自行--profile计时。
2)显存占用(GB)
| 精度 / 模式 | 显存占用 | 适用显卡 | 来源 |
|---|---|---|---|
| FP16 全量 | ~16 GB | 24GB 卡(4090/3090)full/fast |
官方数据 |
| GGUF Q8 | ~9 GB 上下 | 16--24GB 卡 balanced |
官方数据 |
| GGUF Q4 + balanced | ~10--12 GB | 10--12GB 消费卡(如 3060/4060Ti 16G) | 官方数据 |
3)生成质量(基准,官方数据,Preview → 正式版)
| 基准 | Preview | 正式版 | 说明 |
|---|---|---|---|
| Qwen-Image-Bench | 47.14 | 55.20 | 综合生图质量 |
| ImgEdit | 3.9 | 4.37 | 图像编辑能力 |
| GEdit-Bench-EN | 7.47 | 8.14 | 英文编辑保真度 |
度量口径说明:图像生成/编辑模型不以「token/s」衡量速度,而用「秒/张」更直观;理解任务的吞吐才是 token/s。本文统一用「秒/张」汇报生成时延,避免与文本模型混淆。
4)同级模型横向对比(公开资料 / 引用)
| 模型 | 参数量 | 架构 | 协议 | 原生分辨率 | 理解+生图+编辑统一 | 消费级可部署 |
|---|---|---|---|---|---|---|
| SenseNova U1.5 Lite | 8B | NEO-Unify(无 VE/VAE) | Apache 2.0 | 原生 4K | ✅ 三合一 | ✅ Q4+balanced ~10-12GB |
| DeepSeek Janus-Pro-7B | 7B | 统一理解+生成 | Apache 2.0 | 384×384 | ❌ 生成无原生编辑 | ✅ |
| BAGEL-7B-MoT | 7B | MoT 统一 | Apache 2.0 | 高分辨率+编辑 | ✅ 理解+生成+编辑 | ✅ |
| Qwen-Image-Edit | 8B | MMDiT | Apache 2.0 | ~1328×1328 | ❌ 生图/编辑分离 | ✅ |
对比结论(引用公开资料):U1.5 Lite 在「原生 4K + 单一权重统一三任务 + 强可控编辑」三个维度上,是 8B 级里组合最完整的一个,尤其适合「生图 + 改图」一体交付的中文场景。
五、使用场景
适合场景
- 电商/海报/信息图:需要「中文文字渲染 + 复杂版式 + 4K 输出」的设计自动化。
- 可控图像编辑:换装、改字、局部替换、多参考图合成,且要求非编辑区域不动。
- 端侧/私有化:10--12GB 显存即可跑 Q4,数据不出内网,适合金融、政务等敏感行业。
- 多模态 Agent:用统一权重同时完成「看图理解 → 生成/编辑」的流水线。
不适合场景
- 追求极致生图美学、与 Flux/Krea 等顶级闭源媲美:U1.5 Lite 定位「稳定可控交付」,非「艺术天花板」。
- 超长文档级视觉理解:理解侧上下文最高 32K token(U1 原版口径),长视频/超长图尚非强项。
- 实时低延迟大规模服务:需 LightLLM + 多卡生产栈,单机消费卡吞吐有限。
调优提示
- 生图:
cfg_scale=4.0、cfg_norm=none、timestep_shift=3.0、num_steps=50是官方推荐起点;想更稳可把num_steps提到 60,想更快可降到 40 观察质量衰减。 - 低显存:优先 Q4 GGUF +
--vram_mode balanced;有 24GB 卡用fast近全速;low模式显存最低但最慢,仅作兜底。 - 强可控:善用 Bounding Box / Visual Marker 锁定编辑区域,减少「改一处崩全局」;多参考图合成时控制参考图数量(2--3 张为宜),过多会稀释主体。
- 中文文字渲染:把标题、正文、字号、字体写进同一段长 Prompt,利用它 3--4k 字符的长上下文一次成型,比「生图后再 P 字」更可控、更清晰。
- 量化取舍:Q8 GGUF 质量最接近全量(~9GB),Q4 更省显存(~10--12GB 但细节略降),生产环境显存充裕时建议 Q8。
你更看重生图模型的「画质上限」还是「可控编辑稳定性」?欢迎在评论区聊聊你的本地部署踩坑经验。
参考来源:商汤官方发布页(sensetime.com)、GitHub
OpenSenseNova/SenseNova-U1、HuggingFacesensenova/SenseNova-U1.5-8B-MoT、ModelScopeSenseNova/SenseNova-U1.5-8B-MoT、技术报告 arXiv:2605.12500。性能时延/显存/基准均为官方数据或公开资料引用,非作者实测。