忘记密码?
其他方式登录

300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1

2026年8月24日

详细介绍

近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。

五项文生图基准上的平均表现。i1 平均领先此前表现最好的全公开模型 29.5 个百分点,并接近多款仅开放权重的领先模型

i1 在通用图像生成任务上的精选示例

i1 在文字渲染任务上的精选示例

团队的探索基于一个简单且具有代表性的文生图基线:在模型方面,用浅层融合的方式由冻结的文本编码器提取特征,并输入到一个从头用 flow matching 训练的 DiT 网络;在数据方面,组合 12 个公开的图片数据集,并重新用 VLM 生成长 caption。

i1 从一个统一基线出发,对一系列模型和数据设计开展控制实验

稍微增大文本编码器的 adapter 大小就能够在不同 backbone 上稳定提升表现

用 AdaLN 输入 timestep embedding 和 pooled text embedding 带来的额外收益十分有限

控制参数的情况下,加入 U-ViT 式长跳跃连接能稳定提升表现

控制参数的情况下,dual-stream 优于 single-stream 优于 cross-attention

使用不同比例的长、短 caption 训练后,模型在不同类型的 prompt 上的表现

在数据集 subsample 到不同规模后,模型的表现

仅保留特定数据子集进行 512×512 分辨率训练时的模型表现。即使不使用专门的文字渲染数据,模型的文字渲染能力仍能得到显著提升

300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1

i1 的整体模型框架。i1 没有引入复杂的新模块,而是组合了多项经过控制实验验证的简单设计

i1 在文生图评测上的表现

i1 表明,训练一个有竞争力的文生图模型并不一定依赖难以获取的私有数据、不透明的训练配方或复杂的模型组件:仅使用公开数据集,并基于经过系统控制实验验证的设计构建一个简洁的配方,同样可以在提示词遵循和文字渲染等能力上达到较强水平。

i1 第一作者曾博亚是普林斯顿大学一年级博士生,本科毕业于宾夕法尼亚大学,研究方向为视觉生成模型。

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论