嗨,朋友们大家好,我是王婉。Garrik(应为 xAI,此处按原文保留)发布了最新的 Grok Imagine Image 2.0 模型。本次升级重点强化了提示词理解与遵循能力、排版与布局能力,以及文字清晰度;同时显著提升了对提示词中指定文字主体、细节描述和参考素材的执行准确度,并大幅增强了图片编辑能力。
在 Runway 排行榜中,Grok Imagine Image 2.0 在“图像编辑”与“文生图”两项任务中均位列全球第二。模型重点加强了对复杂提示词的理解与执行能力,并在海报、信息图等需多元素协同的复杂布局任务中,展现出更优的文字识别与排版表现,支持高质量多轮编辑。
我们首先测试底层模型升级后的基础能力:生成一张教育科普类知识卡片。这类任务比生成人物肖像更具挑战性,不仅要求图像美观,还需精准组织信息结构、文字顺序与视觉层级。
我们输入指令:“制作一张介绍 SpaceX 公司相关信息的高质量教学科普知识卡片。”模型迅速完成生成。经检查,卡片中小字号文字无错别字,信息排布合理:顶部为公司成立时间、创始人等核心信息,中英文标注清晰准确,整体结构严谨、可读性强。
接着测试其多轮编辑一致性能力。我们在原图右下角语录区添加指令:“在马斯克语录卡片中增加一张马斯克的照片。”模型成功插入照片,并自动调整原有文字位置以避免遮挡,其余区域未受干扰,编辑精准可控。
第二轮修改指令为:“在右上角宇宙背景中增加一颗火星。”生成结果中,火星元素自然融入背景,原始构图、文字、其他图形均保持不变,指令遵循度高,局部干预能力稳定。
第三项测试聚焦“局部精确编辑”功能。我们上传一张保温杯产品图,在右下角点击“精确编辑”,调出可调节笔刷,涂抹杯盖区域后输入提示:“将杯盖颜色改为哑光墨绿色。”模型仅修改指定区域,杯身、文字、阴影等其余部分完全保留,色彩过渡自然,边缘控制精准,适用于电商场景中的换色、换材质等高频需求。
第四项测试为“精准分割与图层编辑”。右侧图层面板可识别并单独选中图像中不同对象(如花纹、背景、主体等)。我们选择背景区域,输入指令:“将背景替换为学校教室中的课桌。”模型准确识别主体与背景边界,完成无缝替换,课桌纹理与光影匹配合理,主体边缘无明显伪影。
第五项测试为“智能背景移除”。上传原图后,模型自动完成前景识别与分层,右上角提供 PNG 格式透明背景素材下载选项。下载所得 PNG 文件边缘虽有轻微毛边,但已满足常规设计工具复用需求,可直接导入 Figma、Photoshop 等软件进行后续处理。
第六项测试为新增的“多图参考生成”能力。该功能支持单次任务上传最多 5 张参考图,融合风格、产品、Logo、场景、材质等多维度信息,生成高度定制化图像。
我们依次上传:图一(保温杯产品图)、图二(品牌 Logo)、图三(偏好海报风格图)、图四(使用场景图)、图五(目标杯身材质/颜色参考图)。随后输入综合指令:“将保温杯 Logo 替换为 One,保持原位;参考海报风格与场景图;替换杯身颜色;生成一张完整产品海报。”模型输出结果准确还原了指定 Logo、目标色值、场景构图,并额外补全了水面倒影等细节,指令响应完整度高,具备明确商业落地潜力。
第七项为“智能比例调整与扩图”。在右下角选择宽高比(如 16:9),模型自动对原图进行构图重适配与画面延展。测试中,模型在保留原始主体与场景逻辑前提下,智能补全两侧环境,扩展后画面协调自然,构图平衡,适用于社交媒体多平台尺寸适配。
第八项为面向视频生产的“跨图一致性构建”能力。该功能重点提升角色、场景、道具在多张图像间的视觉一致性,服务于视频分镜、游戏资产或系列内容批量生产。
我们分步生成: - 首先生成一名 25 岁中国男性角色(黑色短发、战术马甲、纯色背景、正面全身); - 接着生成“火星真实地表”场景; - 再生成一把“黑色拉丝金属激光步枪”; - 返回首页,依次将三者设为参考内容(人物、场景、武器); - 最后输入指令:“该角色在火星地表,右手持激光步枪进行射击训练。”
模型成功合成图像:角色姿态自然,火星地貌真实,武器细节清晰(包括枪体反光与接口结构),三者光影、比例、透视关系一致,可直接用于视频分镜或动态内容开发。
