AI 生图再进化!图像分辨纯厚接卷到2K。
腾讯开源混元图像 2.1(HunyuanImage2.1),画质径直拉满的同期,还能读懂千字长文本,以致中英文混搭渲染。

新一代模子在手艺上全面升级,不仅显贵擢升图文语义一致性和跨场景泛化才调,还粗鲁精细抑遏场景、脚色姿态以致多物体描摹,达成开源生图模子中的 SOTA。
模子开源之后,在 Hugging Face 趋势榜上一说念飙升,现在已拿劣等又名的宝座。

话未几说,先来看几个网友试玩感受一下。
率先康康真确场景下的进展,密致的手部和脸部纹理,处理细节过关

海报制作上,文本渲染也终点干净。

或者搞个好意思洲驼的办法图,亦然轻简洁松~

还有每次必弗成少的动漫风枢纽:魔女宅急便(清脆猪咪版)

不错说,混元图像 2.1 更懂语义、更擅图文、更多格调、更高清画质……
是以我们这不飞快上手体验一波。
四大亮点
绽放官网,操作界面是酱紫的~采用需要生成的图像尺寸和数目,填写 prompt(上限 2048),就能秒赢得超高分辨率图像。

我们体验了一下,追念下来这个模子有四大亮点。
亮点 1:复杂语义生成才调强
收货于万般化的大限度图文对皆数据,混元图像 2.1 模子对复杂语义清楚才调有了显贵擢升,一些长达 1k tokens 长度的超长复杂 prompt 也能简洁完成,还能终了多主体辩认描摹抑遏生成,且确保精准生成。
比如说,我这里思要吞并页面中既有吉卜力格调,又有迪士尼嗅觉,得到的扫尾 be like:

Prompt:一幅图像描摹了一个写实格调的男孩,他的摆布肩膀上各坐着一只不同格调的动物。画面中央的男孩留着玄色的短发,他身穿白色 T 恤,服装面料具有昭着的纹理和褶皱。在他的左肩上,坐着一只吉卜力卡通格调的橘色小猫,这只猫有着清脆的体魄、大大的耳朵和从简的线条,色调温情。在他的右肩上,坐着一只迪士尼 3D 动画格调的金色小狗,这只狗的毛发呈现出渲染感充足的光泽和卷曲状,有着大鼻子和亮晶晶的眼睛。布景是白墙。全体画面是一幅数字绘图作品,和会了照相级写实、手绘动画和 3D 渲染等多种格调。
亮点 2:维持中英文笔墨渲染、笔墨和画面和会
模子粗鲁在图像中当然和会中英文笔墨,适用于居品封面、插画、海报想象等万般化想象场景,得志不同边界的需求。
思要为歪果 bro 想象一款蕴蓄中国标记景点的微缩模子,有长城、佛塔还有东方明珠播送电视塔,还得要个大写的" China "水印。

Prompt:A hyper-realistic photograph of a glass cube diorama on a lush, mossy forest floor, illuminated by dappled sunlight. Inside the transparent cube, an intricate landscape of miniature, highly detailed landmarks and cultural icons from China are meticulously arranged. This includes both traditional and modern architecture, such as the Great Wall winding across a terrain, a classic pagoda, and the sleek form of the Oriental Pearl Tower, all surrounded by miniature greenery. At the base of the diorama, the 3D word " China " is prominently displayed in large, bold, white block letters. The background forest is softly blurred, creating a bokeh effect that directs attention to the sharp details of the diorama. The overall look is crisp, elegant, and immersive, with a shallow depth of field.
亮点 3:适用场景丰富,具备高好意思学质感
同期,模子可维持生成各式格调,如真确感东说念主物、漫画与搪胶手办等,同期具备高好意思学品性和视觉进展力。
最近社媒都被 AI 生成手办刷屏了,那就试试混元图像 2.1 的成果叭!赛博悟空运行!

Prompt:一幅超践诺主义格调的悟白手办,东说念主物震动在半空,体魄部分化为液态银色金属,视力尖锐,手拿着金箍棒,布景是一条巨龙在潸潸中盘旋,鳞片醒目光辉,场景充满力量感,空中有闪电。
亮点 4:原生 2K 高质料图像生成
模子现在粗鲁以其他模子 1k 生成的铺张,高效地生成超高清 2K 分辨率图像,大幅擢升了出图分辨率和可用性,尤其稳当对画质有专科条件的愚弄场景。
比如说底下生成一个小女孩的肖像照,分辨率拉满,这下谁能分清是 AI 仍是真确照相?(doge)

Prompt:A close-up shot focuses on a young girl with vibrant, curly hair and a gentle expression. Her face is characterized by a light dusting of sun-kissed freckles across her nose and cheeks. She wears a dress with a colorful floral pattern and holds a freshly-picked bouquet of wildflowers, including daisies and lavender, against a softly blurred background. The image presents a realistic photography style.
那问题来了,为啥混元图像 2.1 不错作念到这样强?来看一手手艺阐明解读。
立异手艺有盘算擢升生图质料
凭据官方先容,混元图像 2.1(HunyuanImage-2.1)是一个粗鲁生成 2K(2048 × 2048)分辨率图像的高效文本到图像模子。
手艺立异率先是熟习数据和标注上,通过结构化标注在短、中、长和超长级别提供分层语义信息,显贵增强了模子对复杂语义的反映才调。
立异性地引入OCR 行家模子和IP RAG来措置通用 VLM 标注器在密集文本和宇宙学问描摹方面的不及,而 OCR 信息迥殊使用双向考据计谋确保了标注的准确性。

悉数这个词架构不错包括两个阶段:
基础文本到图像模子:
使用了 32x 的高压缩率的VAE, 大幅减少了 DiT 模子的输入 token 数目 , 相同生成一张 2K 图,token 数目独一 16x VAE 的 1/4,大幅擢升了熟习和推理的效力。
将 VAE 的特征空间与 DINOv2 特征对皆,便于使用高压缩 VAE 的 dit 的熟习,这显贵提高了推理效力,使得 HunyuanImage 2.1 生成 2K 图像的时候与其他模子生成 1K 图像的时候调换。
多桶、多分辨率 REPA 亏本将 DiT 特征与高维语义特征空间对皆,有用加快模子敛迹。
另外秉承视觉 - 话语多模态编码器来让模子更好地清楚场景描摹、东说念主物动作和安靖条件,擢升模子的语义对皆才调。
以及引入多话语 ByT5 文本编码器,专诚用于文本生成和多话语抒发,擢升模子笔墨渲染的才调。
同期该阶段具有 170 亿参数的单流和双流Diffusion Transformer。
为了优化好意思学和结构连贯性,还愚弄了东说念主类反馈强化学习(RLHF),引入奖励散布对皆算法,立异性地将高质料图像当作采用样本,确保相识和矫正的强化学习扫尾。
精修模子:
第二阶段引入了一个精修模子,进一步擢升了图像质料和明晰度。
此外,拓荒了首个系统性工业级改写模子PromptEnhancer 模块,其中 SFT 熟习结构化地重写用户文本教唆以丰富视觉抒发,而 GRPO 熟习秉承细粒度语义AlignEvaluator 奖励模子来大幅擢升从重写文本生成的图像语义。

AlignEvaluator 涵盖 6 个主要类别和 24 个细粒度评估点,模块维持中英文重写,并在增强开源和独到文本到图像模子的语义方面展现了通用适用性。
此外,还提议了一种基于MeanFlow的新式蒸馏措施,措置了圭臬均值流熟习固有的不相识性和低效力的环节挑战。
这种措施粗鲁仅用极少采样要领生成高质料图像,这亦然 MeanFlow 在工业级模子上的初次得手愚弄。
因此混元图像 2.1 展现了稠密的语义对皆和跨场景泛化才调,擢升了文本与图像之间的一致性,增强了对场景细节、东说念主物姿态和颜色的抑遏,并粗鲁生成具有不同描摹的多个物体。
开源生图模子 SOTA
为了评估模子的语义一致性,沟通东说念主员提议了一项基于多模态诳言语模子(MLLM)的智能评测想法SSAE(Structured Semantic Alignment Evaluation)。
该想法将 300 说念评测题目按 12 个类目索要重点,并借助 MLLM 自动比对图像实质与重点进行评分,最终可输出两个扫尾:平均图像准确率(图像层级的对等分数)和全局准确率(悉数重点的平均得分)。

扫尾标明,混元图像 2.1 模子在语义对皆上的进展朝上于开源模子,并贴近GPT-Image等闭源交易模子的成果。
在 GSB 评测中,混元图像 2.1 也相较于闭源模子 Seedream3.0 胜率为-1.36%,对比开源模子 Qwen-Image 胜率为2.89%。

扫尾标明,混元图像 2.1 当作开源模子,其图像生成质料已达到闭源交易模子终点水平,并在同类开源模子中具备上风,体现了该模子在文本生成图像任务中的手艺先进性与实用价值。
体验地址:https://hunyuan.tencent.com/image/zh?tabIndex=0
huggingface 集结 : https://huggingface.co/tencent/HunyuanImage-2.1
GitHub 集结 : https://github.com/Tencent-Hunyuan/HunyuanImage-2.1
一键三连「点赞」「转发」「预防心」
谅解在批驳区留住你的思法!
— 完 —
� � 年度科技风向标「2025 东说念主工智能年度榜单」评比报名开启啦!我们正在寻找 AI+ 时期领航者 点击了解细则
❤️� � 企业、居品、东说念主物 3 大维度,共建造了 5 类奖项,谅解企业报名参与 � �

一键温顺 � � 点亮星标
科技前沿进展逐日见体育游戏app平台