商汤SenseNova-U1.5发布:无编码器无VAE,原生统一8B模型斩获多项开源第一
原创 CV君 2026-09-14 19:50 江苏
原生统一跨入4K时代
当前主流多模态大模型在架构上普遍面临一道“无形隔阂”:模型的“眼睛”依靠外部预训练视觉编码器(如 CLIP 或 SigLIP),负责抽取高度抽象的语义特征;而其“画笔”则交由变分自编码器(Variational Autoencoder, VAE)处理,在下采样的潜空间内执行去噪。这种人为划分的表征空间,使得模型在感知理解、跨模态推理与像素生成之间难以实现真正的端到端协同。
最新开源的 SenseNova-U1.5 延续了探索原生端到端统一建模的路线。在此对论文涉及的核心命名作简要阐释:
SenseNova-U1.5 是基于第一性原理打造的原生统一视觉多模态大模型(Native Unified Multimodal Model)。
该模型基于 NEO-unify 统一框架,严格贯彻无视觉编码器(Encoder-free)与无VAE(VAE-free)设计,图像输入直接下采样为离散 patch 特征,生成过程则直接在原始 RGB 像素空间通过连续流匹配(Flow Matching)重构。
其主干采用 Mixture-of-Transformers (MoT) 架构,在统一序列中联合处理图文感知与生成任务。
评测结果表明,SenseNova-U1.5 仅凭 8.2B 参数规模,在通用文生图、高难度中英双语文字排版、复杂信息图设计、微调图像编辑及交错式视觉推理等任务中刷新了多项开源模型的最佳纪录,并在多项指标上逼近甚至超越了部分闭源商业系统。
背景与动机
上一代模型 SenseNova-U1 验证了无编码器、无 VAE 架构直接从原始像素端到端学习的可行性。然而,其设计在物理实现上存在一个明显的局限:在图像解码的最后一步,模型将每个 大小的视觉 token 视作孤立单元,仅通过一个简单的多层感知机(MLP)独立映射为 RGB 图像块。
这种独立 patch 预测机制切断了相邻 token 之间的局部空间联系。在低分辨率下该问题尚不明显,但一旦迈向高分辨率与 4K 超高清生成,图像边缘的网格伪影、色差接缝以及纹理撕裂就会被严重放大。
此外,在后训练(Post-training)阶段,模型的生成能力涵盖美学表现、中英双语排版文字渲染、结构化信息图布局以及保持背景的精准图像编辑等。这些子任务对优化梯度的需求存在天然冲突:美学对齐更偏向全局光影与平滑质感,而字符渲染则对高频锐利边缘极其敏感。若在强化学习中将这些目标混合优化,容易导致奖励信号相互抵消或出现策略漂移。SenseNova-U1.5 针对这两大瓶颈进行了系统性的架构重构与训练策略重塑。
方法详解
SenseNova-U1.5 的参数配置见下表:在 42 层 Transformer 结构中,隐藏层维度为 4096,包含 32 个注意力头,理解与生成分支的参数量均为 8.2B。
架构跃迁:空间联合重构与4K噪声感知
为解决高分辨率下的拼缝与细节失真,SenseNova-U1.5 对视觉接口的编解码两端进行了重要改进:
轻量级空间联合解码器:放弃原有的独立 Patch MLP 映射。模型将主干网络输出的隐藏状态 还原为二维空间拓扑张量 。解码器通过三级 Pixel Shuffle 连续完成 、、 的逐步上采样,并在各阶段之间插入 空间卷积。这使得相邻视觉 token 在最终输出像素前能够进行充分的特征交互,从机制上根除了接缝断裂现象。
- 4K 分辨率感知噪声嵌入(NSEmb):流匹配去噪过程中,不同分辨率下的有效噪声能量尺度具有显著差异。SenseNova-U1.5 将噪声尺度的归一化参考上限由先前的 2048 扩展至 :通过专门的正弦 MLP 模块 提取尺度特征,并与时间步表示 融合成综合状态 ,使模型能够自适应多尺度与多宽高比的去噪过程。
统一 Mixture-of-Transformers 交互机制
在主干设计上,SenseNova-U1.5 保留了非对称注意力的 MoT 范式:
分支解耦与共享:自注意力算子在理解与生成之间保持结构共享,以便跨模态特征高效通信;但前馈网络(FFN)、投影矩阵和 Normalization 层依据 token 属性(文本、无噪图像、带噪状态)进行动态路由。
非对称注意力掩码:无噪上下文 token(文本与参考图像)采用因果或双向连接;带噪的生成 token 既可以在内部双向自洽,也能单向关注前方所有的无噪特征;反向连接则被严格截断,避免将高斯扩散噪声引入语义理解流程中。
整个统一主干通过联合多任务目标函数端到端训练:
其中, 负责维持自回归语言推理; 在 RGB 空间监督真实速度场与预测速度场之间的流动匹配; 则引入端点处的 LPIPS 特征感知损失(权重 0.1),进一步提升低级纹理质感。
五阶段演进:从预训练到同策略多专家蒸馏
SenseNova-U1.5 确立了清晰的五阶段渐进式训练方案:
阶段1:生成预训练:冻结预训练理解分支,专训生成分支。分步涵盖低分辨率文本生图(Phase I)、 4K 原生分辨率训练(Phase II),以及引入编辑和交错图文并开启 LPIPS 损失的综合强化(Phase III)。
阶段2:统一中训练(Unified Mid-Training):解冻双分支,使用长达 32,768 序列长度混合多模态理解(30%)、文生图(40%)、图像编辑(20%)和交错数据(10%)展开联合对齐。
阶段3:统一指令微调(Unified SFT):聚焦高质量指令遵循能力,巩固全模态协同。
阶段4:多专家强化学习(Specialize-then-Unify):针对美学渲染、OCR 文字排版、图表生成和图像编辑四个方向,构建各自专用的专家模型与定制化奖励函数(例如编辑任务采用综合考虑指令遵循、执行质量、文本变动和非编辑区域保留的瓶颈式最小值奖励 )。
阶段5:多专家同策略蒸馏(On-Policy Distillation, OPD):将四个特化专家的能力重新汇聚进单一的端到端权重中。
在蒸馏阶段,学生模型在自己的去噪轨迹上产生状态 ,并对样本所对应的特定领域专家计算单步速度场回归:
采样时间步通过 Beta 分布平滑调节,随轮次演化从关注全局构图的初期噪声步向精细调整文字排版的后期步骤过渡,确保各项专业能力无冲突地合并。
实验与结果
针对 SenseNova-U1.5 的评测覆盖了多模态理解、文生图、排版、编辑及交错式推理等多个维度。
通用多模态与语言理解能力
从评测数据来看,端到端生成能力的扩展并未损害其原有的认知水平。
在 MMMU(73.86)、MathVista(85.85)和 AI2D(92.03)上,SenseNova-U1.5 维持了高水准表现,语言推理基准 IFEval 达 93.35,C-Eval 达到 90.41。这表明统一模型能够保持扎实的文本理解与多模态感知基础。
通用文生图:组合推理与语义对齐
在 Qwen-Image-Bench 上,SenseNova-U1.5 在提示词增强(PE)加持下,英文榜取得 60.22 分,中文榜取得 60.13 分,均位居评测开源模型首位,逼近商业标杆 GPT-Image 系列的水平。
在考察复杂空间方位与属性绑定的 GenEval 与 GenEval2 中,SenseNova-U1.5 分别取得 0.92 与 0.71(w/ PE)的整体得分,在实体计数、色彩定位和多动词交互等维度展现了良好的生成可控性。
文本渲染与复杂信息图设计
在要求严苛的密集文字排版基准 CVTG-2K 中,SenseNova-U1.5 取得 0.948 的平均分,在 5 区域密集文本场景下单词准确率达到 0.954,不仅超过了多数开源模型,也优于参评的闭源方案(如 Seedream 4.5 的 0.899 与 GPT-Image-1 的 0.857)。
在 LongText-Bench 上,该模型在英文(0.988)与中文(0.989)长文本生成上同样保持了稳定的准确度;在面向复杂图表与商业海报的 IGenBench 和 BizGenEval 中,SenseNova-U1.5 亦显著超越了此前的开源统一基线。
精细图像编辑与交错式推理生成
在图像编辑基准 ImgEdit 与 GEdit-Bench 中,SenseNova-U1.5 分别取得 4.59 与 8.26 的整体得分,位居同类开源模型前列。
在文本排版编辑基准 WeEdit 中,模型取得了 7.46 的综合得分,在准确执行增删改换等指令的同时,非编辑背景保留度(BP)达到了 8.08。
而在探索“通过生成进行推理”的前沿基准 VBVR-Pro-Bench 中,SenseNova-U1.5 取得了 68.2% 的总得分(域内 67.6%,域外泛化 68.9%),超越了 Nano-Banana-Pro (56.4%) 与 GPT-Image-2 (50.7%)。
这些实测数据印证了研究的核心价值:多模态统一的意义不仅在于精简流水线,更在于促成语言逻辑推理与视觉空间生成的双向赋能。
写在最后
原生端到端统一建模曾因训练难度大、容易顾此失彼而受到审慎审视。SenseNova-U1.5 通过引入空间联合解码器、拓展 4K 噪声感知,并依托“先特化后统一蒸馏”的后训练策略,在 8B 级别实现了对复杂排版、精准编辑与认知推理生成的有效统一。这一实践表明,抛开外挂式视觉编码器与 VAE 潜空间的束缚,由底层共享表征驱动的视觉智能同样具备可观的发展空间。
论文标题: SenseNova-U1.5: Towards Native Unified Visual Intelligence
机构: 商汤科技
代码仓库: https://github.com/OpenSenseNova/SenseNova-U1 (已开源)
体验Demo: https://unify.light-ai.top/