这次目前只开源了权重,我还没饭判断本地部署的成本,把主要功能放在这儿
原生 4K 图像生成
U1.5 重新设计了图像生成头,并把训练扩展到 4K 分辨率。
这部分主要改善:
- 局部纹理和高分辨率细节
- 材质表现
- 光影一致性
- 视觉 Token 网格产生的痕迹
- 拼接缝和破损纹理


中英文文字和复杂排版
这次更新加强了中文、英文文字生成,以及海报、信息图和品牌视觉中的复杂布局
简单任务仍然可以使用短提示词, 长提示词和 JSON 一类的结构化指令主要用于提高复杂任务的可控程度,不是每次生成都需要写几千字
这个方向对海报和信息图比较实用。这类任务的难点通常不在于生成一张好看的背景,而在于同时处理文字、层级、对齐、多个主体和局部约束。


图像编辑能力
U1.5 覆盖的编辑方式比较多:
- 根据参考图重新解释风格和设计
- 从多张参考图提取人物、产品、场景或风格并重新组合
- 根据单张人物或产品图制作新海报
- 修改信息图中的标题、数字、图标、图表和局部布局
- 替换现实场景中的文字
- 通过红框、坐标或标记点指定编辑区域
- 在当前结果上继续修改
文字编辑会尝试保留原来的字体、材质、透视、布局和遮挡关系。局部编辑则强调保留主体身份、空间结构和未指定区域。
我个人更关注连续编辑。如果模型能够在多轮修改后仍然保持人物、商品和版式的一致性,它会比一次性文生图更接近真正的设计工具。


Benchmark
官方给出的数据都是 U1.5 Preview 与上一代 U1 的对比:
| Benchmark | U1 | U1.5 Preview |
|---|---|---|
| Qwen-Image-Bench | 47.14 | 55.20 (使用 Prompt Enhance ) |
| ImgEdit-Bench | 3.90 | 4.37 |
| GEdit-Bench-en | 7.47 | 8.17 |
| GEdit-Bench-zh | 7.42 | 8.05 |
换算下来,四项指标的相对提升大约是 17.1%、12.1%、9.4% 和 8.5%。
这些结果只能说明 U1.5 相比 U1 有进步。由于没有完整的同条件横向测试,目前无法据此判断它和其他开源图像模型的实际差距。Qwen-Image-Bench 的 55.20 也必须带上 Prompt Enhance 这个条件。
目前已知的问题
官方材料列出的待改进项包括:
- 短提示词的理解和设计能力
- 小字号文字
- 人物面部细节
- 细粒度语义纹理
- 整体审美一致性
我的看法
从介绍材料来看,U1.5 的方向比较明确:把生成、参考图控制和局部编辑放进同一个工作流
- 连续编辑几轮以后,主体和布局还能不能保持一致
- 中文小字和复杂海报能否稳定复现