Pruna 发布 Pruna-Qwen-Image-2.1 少步 LoRA 适配器,图像生成提速最高 6.3 倍
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
Recraft 发布 Recraft V4.1 Flash,主打极速草拟模式,可快速生成多个版本后挑选最满意的一张,再用 Recraft 4.1 Pro 进行放大。用户实测称其速度很快,作为草稿模式使用体验有趣,Flash 输出与 Pro 放大结果可对比查看。
论文《On the Diffusibility of High-Dimensional Latents》已在 Hugging Face Papers 上线,聚焦高维潜变量的可扩散性问题。原文未披露模型、参数规模或 benchmark 数据等具体信息。
Pika 推出 API Club,开发者可调用 100 多个领先的生成式媒体模型,价格更低以支持更多创作场景。加入入口为 dev.pika.art。
Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。
Recraft 推出 V4.1 Flash,被称作目前市场上最快的图像模型,用户点击生成即可出图。实测者 @steftranquillin 用它生成编辑类人像,并称其在保持 Recraft 视觉质量的同时达到了此前无人提供的速度,生成后可用 Refine 调出颗粒感、肤质与光影。
作者对商汤上线不久的 SenseNova U1 Pro 进行了五大场景实测,覆盖审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合。该模型在 8 月 SuperCLUE-Image 中文文生图榜单总分 93.81 排名第一,复杂信息布局 95.80 分,支持最高 8K 与特殊长宽比输出。
腾讯混元 Hy Image 3.5 预览版已在 GMI Cloud 上线,每张图片定价 0.024 美元。该价格比 GPT Image 2 便宜 8.8 倍,比 Nano Banana Pro 便宜 5.6 倍。
Kevin Weil 转发 Jeffrey Katzenberg 关于 AI、技术与创造力的文章并称需要更多这类对 AI 的乐观看法。Katzenberg 在文中回忆 2023 年曾预言 AI 工具将在三年内把世界级动画的制作时间和成本削减多达九成,并回应艺术家同行"这是不是我们的末日"的疑问:当然不是。
Runway 现已集成进 DaVinci Resolve,用户无需离开项目即可在时间线内直接调用其模型完成生成、编辑与画质提升。官方称接入的是"全球最好的模型",并给出了上手链接。
Recraft 最快的图像生成模型 V4.1 Flash 已在官方合作平台 fal 上线,生成一张图约需 1.3 秒。该模型面向创作流程,便于快速测试构图、调整提示词和探索不同方向,从最初概念到下一轮迭代都能提速。
Recraft 开放了新功能的试用入口,并附上对比结果与 API 速度基准,该基准测量于 2026 年 9 月 21 日。用户可直接体验,或先查看对比数据了解表现。
Recraft 发布图像模型 Recraft V4.1 Flash,官方称生成一张图耗时 1.3 秒。用户可在模型选择器中选中 Flash 生成图像,再用 Refine 清理细节。
作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。
vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。
用 Lovart 生成了一整套超可爱涂鸦风星座插画,先放出其中 4 张。作者在帖中邀请网友留言自己的星座,会直接在评论区回复对应的那一张。
腾讯混元 Hy Image3.5 preview 已在 OnSolo 上线,两周内会员免费使用。该版本支持 5 张参考图、2K 输出,可用于短剧角色设定表、全动态游戏素材和关键帧,角色能在各集之间保持一致,编辑为局部优化而非重做。
腾讯混元 Hy Image3.5 preview 已在 ComfyUI 上线,单模型同时支持文生图与图生图,最高可输出 2K 分辨率。官方称其人类评估胜率较 Hy Image3.0 提升 30%,支持多语言文字、符号与小字号渲染,覆盖电影、漫画、商业摄影和插画风格,并能在场景、服装和风格变化中保持人物身份与产品特征。
Hy Image3.5 preview 已在 ComfyUI 开放使用,单模型同时支持文生图与图生图,最高 2K 分辨率,人类评测胜率较 Hy Image3.0 提升 30%。该版本可正确渲染多语言文字、符号与小字,覆盖电影、漫画、商业摄影和插画风格,并在场景、服装与风格变化中保持人物身份与产品特征一致。
Qwen-Image-2.1 成为 Image Edit Arena 和 Text-to-Image Arena 的双料第一开源模型。其在 Image Edit Arena 拿下 1367 分,位列开源模型榜首,总榜排名第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 仅差 3 分。该模型由阿里 Qwen 团队推出,现已开放试用。
Pika 展示 Swap Anything 应用的另一示例,可将视频中的人物、道具、场景等任意元素替换,同时保留原视频的基本时间节奏与运动。该功能是其新 Pika 创意平台的一部分,平台定位为面向创作者打造的 AI 创作工具。
Pika 推出 Swap Anything 功能,可在新 Pika 中任意替换视频内容,入口为 create.pika.art。官方以 "Try Swap Anything on the new pika" 邀请用户试用。
Pika 推出 Swap Anything 功能,可在新版 Pika 上通过 create.pika.art/apps/reskin-vi… 试用。该功能发布在 Pika 官方账号,具体用途与支持范围尚未在推文中说明。
Figma 与 Handshake 的 AI Skills Studio 合作上线 4 个任务,教用户设计并制作动态图标集、构建循环动画、绘制贴纸包,以及把情绪板转成 App 原型稿。
Fish Audio MCP 迎来重大升级,新增图像与视频生成能力,可在 agent 内将一段 brief 直接做成广告:生成视觉素材、编辑,再生成视频。该流程支持在创建前预览成本,并已在 Claude、Codex、Cursor、Windsurf 中可用。
腾讯混元 Hy Image3.5 preview 已在 Miora 上线,支持文生图与图生图,最高 2K 分辨率,可生成广告视觉、产品场景、故事板和游戏概念图。该预览版沿用同一画布并记住品牌规则,免费开放至 10 月 7 日。
NVIDIA DLSS 5 引入 DLSS 3D-Guided Neural Rendering 与更细粒度的控制项,让游戏开发者在保持艺术意图的同时加入更逼真的光照与材质细节。此次同步更新 NVIDIA ACE、RTX Mega Geometry 2.0 与 RTX Kit,覆盖角色 AI、高密度几何与渲染工作流。
腾讯混元 Hy Image3.5 preview 上线,提供专业级图像生成,人工评测胜率比 Hy Image3.0 高 30%,支持文生图和图生图,最高 2K,一致性更好。API 按每张 0.024 美元计费,参考图不收费,Miora 和 OnSolo 提供两周免费试用。
腾讯混元(Tencent Hunyuan)的模型可用于图像编辑,而不仅是图像生成。有用户询问该模型是否只支持生成、能否同时完成编辑,官方回复确认可以编辑图像。
Qwen-Image-2.1 获得 Intel OpenVINO 的 Day-0 支持,可在 Intel 硬件上优化运行。该模型以单一开放权重 checkpoint 同时支持图像生成与编辑。Intel Devs 表示已为 Qwen-Image-2.1 提供 Day-0 OpenVINO 支持。
腾讯混元上线 Hy Image3.5 preview,支持文生图与图生图,最高 2K 分辨率,一致性更好,在人类评估中相对 Hy Image3.0 胜率提升 30%。API 上线腾讯云 TokenHub,定价为每张图 0.024 美元,仅对生成的图片计费,参考图免费;Miora 和 OnSolo 提供两周免费试用。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),一款高性价比专业级生图模型,对比 Hy Image3.0 综合能力提升约 30%。
Pika 推出 Relight Media,用户可在 create.pika.art 上对图片或视频进行重新打光。该功能以独立应用形式提供,入口为 create.pika.art/apps/relight-media。
Pika 上线 Relight Media 应用,可对任意照片或视频重建光照与阴影,支持预设或手动调整,主体、构图与运动保持不变。该功能现已登陆新版 Pika,官方称新 Pika 是面向创作者的 AI 创作平台。
阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。
SGLang-Diffusion 已实现对 Qwen-Image-2.1 的 Day-0 支持,提供文生图、多图编辑和透明 RGBA 输出,单一 checkpoint 即可完成。
Qwen 在 Hugging Face Spaces 上线 Qwen-Image-2.1 在线 demo,浏览器即可试用,无需本地配置。该模型为 7B 参数的原生图像生成与编辑模型,支持最多 10 张图像参考,自带提示词增强 LLM,并集成 diffusers 与 ComfyUI。
美图设计室支持上传一张商品平铺图,即可批量生成不同模特、姿势与场景的穿戴效果图,并支持AI服装换色出SKU变体图、替换服装与灵活切换模特场景。首页对话框还可一句话生成模特套图、1:1复刻同行爆款图的背景与版式,以及一站式生成带脚本、运镜、转场和背景音乐的带货视频;生成素材可存入资产库沉淀品牌视觉资产。该工具已首批接入WorkBuddy、Codex等主流大模型,并支持手机APP出图。
Qwen-Image-2.1 已在 Hugging Face 上线,可在 Hugging Face app 中访问对应 Space 页面。该消息由 AK(@_akhaliq) 发布,但原文未披露模型参数规模、benchmark 分数或开源许可等细节。
AI寓言绘本系列更新《守株待兔》,采用新国风绘本风格,固定农夫、树桩、田地等元素以保证前后画面像同一本故事书。配色以土黄、灰绿、米色为主并加入纸张纹理,靠人物表情和庄稼从整齐到荒废的变化推进剧情。作者表示连续剧情的关键是人物与场景一致性,完整提示词可在评论区索取。