Qwen-Image-2.1 支持 ComfyUI,开放 7B 权重
Qwen-Image-2.1 现已支持在 ComfyUI 中使用,并开放权重,单个 7B checkpoint 同时支持生成和编辑。该模型支持原生 2K 图像生成、单次基于最多 10 张参考图的指令编辑,以及包含 alpha 通道的 RGBA 输出。
Qwen-Image-2.1 现已支持在 ComfyUI 中使用,并开放权重,单个 7B checkpoint 同时支持生成和编辑。该模型支持原生 2K 图像生成、单次基于最多 10 张参考图的指令编辑,以及包含 alpha 通道的 RGBA 输出。
阿里 Qwen 的 Qwen-Image-2.1 在 vLLM-Omni 获得 day-0 支持,可在同一模型内生成、编辑并输出透明背景图像。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,安装方式与支持的组合已发布在 vLLM recipes 页面。
Qwen-Image-2.1 相比前代提升了视觉质量,尤其在文字和肖像的美学表现上更为明显。官方同时展示了多组文字渲染示例。
Qwen-Image-2.1 支持多种图像编辑任务,并在各项任务间平衡性能表现。给定三视图角色参考图后,该模型可生成完整故事板。
Qwen-Image-2.1 现已原生支持透明图像生成,并可直接对透明图像进行编辑。该版本主打透明图生成与透明图编辑两项能力,官方未公布更多参数与可用性细节。
阿里 Qwen 发布 Qwen-Image-2.1,称其为 Qwen-Image 系列中平衡性与性价比最佳的图像生成模型,并已开放权重。该模型是生成与编辑统一模型,采用 7B 轻量架构,支持多图输入推理加速、原生 RGBA 透明图层生成与编辑、最多 10 张参考图的高保真编辑,并覆盖全景图、信息图和虚拟试穿等场景。权重已在 Hugging Face、ModelScope 和 GitHub 提供。
YouMind 用图直接生成 PPT 被确认效果最好,支持指定 PPT 模板并高保真复刻,还能针对单页快速改文字或按意图直接改图。新增页面可通过给素材让模型自动理解生成,并带有自动调优策略,例如把长图二维码改短以适配页面高度。使用时选官方生成 PPT 功能,模型用 gemini 3.8 flash,积分消耗少、速度快。
作者从做AI海报的经验出发,指出画面元素多却仍显模板化、廉价科技感的问题,多出在风格词太空、信息层级太乱、装饰元素太多和提示词没说清楚这几点。文章按这几个常见问题给出改法,包括控制信息量、拉开主次、把高级感说得更具体,以及海报提示词该按什么顺序写。
Pika 发布 AI 创意平台新版 Pika,其 Relight Media 应用可在视频中调整光线的颜色、强度和方向,而不只是改变一天中的时段。Pika 表示新平台面向创意工作者,主打简单、全面,并瞄准高标准的输出质量。
Pika 发布全新 Pika,定位为面向创作者、由创作者打造的 AI 创作平台,主打简洁、全面、输出符合严苛标准。官方同时展示了 Video Studio 应用生成的视频作品:仅用相对较短的提示词加若干参考素材,就完整理解了需求。Pika 称新平台只是其"为创意工作的未来构建 AI"的开端。
Pika 推出 Product Ad 功能,用户可在新版 Pika 上试用,入口为 create.pika.art/apps/product-a…。该功能由 Pika 官方账号 @pika_labs 发布,未披露模型版本、价格或开放范围等细节。
Pika 发布 Product Ad 应用,可根据用户输入生成真正的创意概念,而非只做产品影像的合辑短片。用户可与它共同敲定语言、语气和视觉风格,直到产出有说服力而不只是吸睛的内容。Pika 同时宣布推出新版 Pika——一个为创意人打造、也由创意人参与的 AI 创意平台。
Artificial Analysis 指出,近几周 Muse Image、MAI-Image-2.6 和 GPT Images 2.5 显著推动了文生图在价格与速度两条帕累托前沿的移动,生成高质量图像比以往更便宜、更快。Mustafa Suleyman 转发称这是全球图像生成领域最佳的性价比表现。
Character.AI 公布其全栈多模态基础设施 CAI-MM-Studio,支持多种画风、245 种相机机位,以及多角色场景在同一画风下保持一致。平台还上线了漫画专用模型,可在整部漫画中保持角色与对话一致,部分创作者已完成逾 100 页。Character.AI 称自研每一环节让新能力数周内上线,推理在消费级规模下保持快速且低成本。
Character.AI 公开了自研 CAI-Image 图像模型家族的工作原理,该系列模型经后训练实现同一角色在漫画与图像生成中跨风格、跨场景保持一致。CAI-Image 支撑 Character.ai 的 Comics 与图像生成功能。
Figma 分享教程,讲解如何在 Weave 中扩展设计。原文未披露更多细节。
Figma 发布 Figma node,可把任意 Figma frame 接入 Weave 工作流,用于规模化生成符合品牌规范的内容。该节点支持迭代、翻译,或将设计转为视频,编辑后所有关联资产保持同步更新。目前已向所有人开放。
ChatGPT Images 2.5 已能将珠宝产品生成完整的少女漫画风格广告。该演示由 LovartAI 发布,展示了从珠宝到整页漫画广告的转换效果。
字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。
NVIDIA 研究团队在 ECCV 2026 发布 Axolotl3D,一个多模态、遮挡感知的 3D 生成模型,结合图像、相机数据和部分几何信息重建缺失区域并保留已观测区域,在单视图与多视图设置下均取得 SOTA 结果。
Figma 在画布上直接推出 Weave 工具,支持将图片重绘为不同材质、把文本提示词转成概念草图,以及把图片扩展到任意画幅比例。用户还能把自制工具发布到 Community。
有用户分享了一个 GPT Image 2.5 提示词,能把任意图片变成"一整天 iPhone 相机胶卷照片"的效果,用在 Lovart logo 上呈现出的结果被评价"太可爱了"。该提示词已放在原推的 thread 中,原帖展示了实际生成效果并附有视频。
12 个极简审美视觉 Skill 可把普通照片转成水墨写意、摄影 Zine、纸张旧影、手绘插画、8-bit 像素、Riso 印刷以及秦唐宋东方美学等多种视觉风格,适用于照片二创、海报和日常视觉练习。上传一张随手拍或旅行照即可换一种视觉语言重新表达。Skill 下载地址在评论区回复“666”获取。
Kling AI 分享了一个照片技巧,让画面在中间相遇。该内容由 xgo.ing 提供支持,获得 41 次点赞、8 条回复、1 次转发,浏览量 10435。
MiniMax H3 用铅笔手绘也相当顺手,用户 @dave392750 借助うきょ的提示词在 MinimaxH3Design 中生成作品,并称效果惊人。该内容由 Hailuo AI 发布,带 #MiniMaxH3 标签。
Genspark 将配色、字体、logo 用法、包装模板和门店视觉规范提取为可复用的品牌系统,随后把这套规范应用到单条 Instagram 发布帖上,保持统一的视觉风格,无需每次重建规则。
Genspark Design 被用于虚构糖果店品牌 "SweetiePop",从单一视觉方向出发生成 logo、包装、门店标识、社交帖子和宣传视频等完整品牌系统。该工具支持品牌识别、产品包装、门店视觉与宣传内容生成。
百度与国际爱护动物基金会(IFAW)合作的"濒危物种AI守护官"数字平台正式发布,可识别34类濒危野生物种,覆盖活体动物及相关制品,整体识别准确率达86.5%,支持电脑端和移动端使用。
Lovart 的 Pencil 功能与 GPT-Image 2.5 结合,可把任意尺寸的草图转成成品图像,并支持多种风格。该组合主打让创意不停留在脑海中,相关演示以视频形式发布在 X 上。
LovartAI 展示了一段 GPT-Image 2.5 的演示,用户只需说“GPT-Image 2.5, help me arrange the flowers.”,模型便能完成插花安排。该内容在 X 上获得 31 个点赞、7 条评论和约 2 万次浏览。
把日常随手拍交给 AI,人物、宠物、风景、小物件都能保留原构图,转成带手写字和小涂鸦的手绘海报风插画。方法只需选一张照片加套提示词,适合日常记录、朋友圈配图、头像、壁纸和旅行照片二创。
有人用 GPT-Image 2.5 制作了一组 ASCII 风格海报。这条内容由 xgo.ing 提供支持,发布后获得 28 个点赞、1 条回复、2 次转发和 2142 次浏览。
GPT-Image 2.5 在像素艺术上表现出色,相关演示视频已在 Twitter 发布,获得 639 次点赞、48 次转发和 5.6 万余次浏览。该推文由 xgo.ing 提供支持。
ChatGPT Images 2.5 已上线 Lovart 无限画布,支持把任意尺寸的涂鸦转成多种风格的精细成图。三项能力包括 Smart Sketch(草图生成丰富场景)、Sharp Vector(从屏幕放大到巨型显示设备)和 Precise Edit(局部精准修改且不损失画质)。
OpenAI 已暂停 200 美元/月 ChatGPT Pro 档的新订阅和升级,Free、Go、Plus 及 100 美元 Pro 用户目前无法升级到 200 美元档,现有订阅不受影响。
Google 发布图像工具 Google Pics,基于 Nano Banana 构建,可生成、精修和共同创作图像。它支持单独编辑图中特定对象而不影响其余画面、直接修改或翻译图片内的文字、多人共享协作,以及从单个提示词生成多个方案。
GPT Image 2.5 已在 lovart.ai 上线,提供最高 31 天的无限使用额度。用户可在该平台持续生成图片,不再受次数限制。
ChatGPT Images 2.5 已上线 Lovart,带来 Smart Sketch、Sharp Vector 和 Precise Edit 三项能力。Smart Sketch 可把涂鸦变成细节丰富的场景,Sharp Vector 支持从屏幕到超大显示屏的缩放,Precise Edit 能在不损失画质的前提下做精准修改。
LovartAI 推出 Flare 与 Sunburst 两项能力。Flare 主打快速生成、透明素材,支持规模化创作;Sunburst 主打更锐利的细节、更丰富的纹理、更干净的文本,并在多次编辑间保持质量一致。
GPT Image 2.5 已在 Lovart 上线,用户可获得最长 31 天的无限量创作权限。该版本主打不受限的生成能力,具体功能与定价细节尚未公布。