Daniel6606

SenseNova U1.5-Lite-Preview 开源了: 4K 生成、复杂排版和原生图像编辑

  •  
  •   Daniel6606 · 4h 59m ago · 169 views

    这次目前只开源了权重,我还没饭判断本地部署的成本,把主要功能放在这儿

    原生 4K 图像生成

    U1.5 重新设计了图像生成头,并把训练扩展到 4K 分辨率。

    这部分主要改善:

    • 局部纹理和高分辨率细节
    • 材质表现
    • 光影一致性
    • 视觉 Token 网格产生的痕迹
    • 拼接缝和破损纹理

    中英文文字和复杂排版

    这次更新加强了中文、英文文字生成,以及海报、信息图和品牌视觉中的复杂布局

    简单任务仍然可以使用短提示词, 长提示词和 JSON 一类的结构化指令主要用于提高复杂任务的可控程度,不是每次生成都需要写几千字

    这个方向对海报和信息图比较实用。这类任务的难点通常不在于生成一张好看的背景,而在于同时处理文字、层级、对齐、多个主体和局部约束。

    图像编辑能力

    U1.5 覆盖的编辑方式比较多:

    • 根据参考图重新解释风格和设计
    • 从多张参考图提取人物、产品、场景或风格并重新组合
    • 根据单张人物或产品图制作新海报
    • 修改信息图中的标题、数字、图标、图表和局部布局
    • 替换现实场景中的文字
    • 通过红框、坐标或标记点指定编辑区域
    • 在当前结果上继续修改

    文字编辑会尝试保留原来的字体、材质、透视、布局和遮挡关系。局部编辑则强调保留主体身份、空间结构和未指定区域。

    我个人更关注连续编辑。如果模型能够在多轮修改后仍然保持人物、商品和版式的一致性,它会比一次性文生图更接近真正的设计工具。

    Benchmark

    官方给出的数据都是 U1.5 Preview 与上一代 U1 的对比:

    Benchmark U1 U1.5 Preview
    Qwen-Image-Bench 47.14 55.20 (使用 Prompt Enhance )
    ImgEdit-Bench 3.90 4.37
    GEdit-Bench-en 7.47 8.17
    GEdit-Bench-zh 7.42 8.05

    换算下来,四项指标的相对提升大约是 17.1%、12.1%、9.4% 和 8.5%。

    这些结果只能说明 U1.5 相比 U1 有进步。由于没有完整的同条件横向测试,目前无法据此判断它和其他开源图像模型的实际差距。Qwen-Image-Bench 的 55.20 也必须带上 Prompt Enhance 这个条件。

    目前已知的问题

    官方材料列出的待改进项包括:

    • 短提示词的理解和设计能力
    • 小字号文字
    • 人物面部细节
    • 细粒度语义纹理
    • 整体审美一致性

    我的看法

    从介绍材料来看,U1.5 的方向比较明确:把生成、参考图控制和局部编辑放进同一个工作流

    • 连续编辑几轮以后,主体和布局还能不能保持一致
    • 中文小字和复杂海报能否稳定复现
    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   934 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 22ms · UTC 22:14 · PVG 06:14 · LAX 15:14 · JFK 18:14
    ♥ Do have faith in what you're doing.