Google 发布 Nano Banana 2.1:画面更自然,改图更连贯
Google 发布图像模型 Nano Banana 2.1,官方称其画面生成更自然,改图衔接更连贯。原文未披露参数规模、benchmark 分数与开放方式等具体细节。
Google 发布图像模型 Nano Banana 2.1,官方称其画面生成更自然,改图衔接更连贯。原文未披露参数规模、benchmark 分数与开放方式等具体细节。
LMArena 推出 Multi-Image Edit Arena,并在 arena.ai/leaderboard 上线对应榜单,用于比较多图编辑能力。原文未披露参与模型、评分指标或具体排名的更多细节。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
LMArena 推出 Multi-Image Edit Arena,专门评测多图编辑能力并已上线排行榜页面(arena.ai/leaderboard/im…),帖子附带的互动数据显示 0 条回复、0 次转发、2 次点赞和 941 次浏览。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
Gemini 图像模型在 OpenRouter 上线,支持最多 14 张参考图像,并可通过 Google Search 进行接地。该模型可生成 1:4、4:1、1:8、8:1 比例的干净全景图,输出分辨率支持 2K 和 4K。定价为每张图 1K $0.0336、2K $0.0504、4K $0.1134。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Pika 上线 Nano Banana 2.1,可通过 create.pika.art/apps/nano-bana… 试用。原文未披露模型参数、benchmark 分数或价格等细节。
Nano Banana 2.1 已在 Pika 上线,带来更好的视觉质量和更快的速度,并内置 Gemini 的真实世界智能能力。
Nano Banana 2.1 已发布,面向图像生成与编辑用户,带来更高质量的图像和对前代模型的诸多 bug 修复,并采用更低的价格。该模型已在 API、AI Studio 和 Gemini app 中提供使用。
Google 发布新一代图像生成和编辑模型 Nano Banana 2.1,从今天起陆续上线 Gemini App、Google 搜索 AI 模式、AI Studio、Flow、Stitch、Google Ads 和 Gemini 企业平台。
Replicate 上线 Google DeepMind 图像模型 Nano Banana 2.1,该模型在价格与性能之间寻求平衡。它在视觉设计、基于 mask 的编辑和主体一致性上有所提升,以生成更自然的图像。
图像生成定价公布:输出 2K 分辨率每张 0.050 美元,输出 4K 分辨率每张 0.076 美元。原文未说明具体模型或服务名称。
谷歌发布图像生成模型 Nano Banana 2.1,官方称其在视觉设计、基于蒙版的编辑、主体一致性和画面自然度上全面超越前代模型,并已在 Google AI Studio 上线。歸藏实测表示,该模型中文文字清晰度和错字问题大幅改善,中文字体设计与排版美学良好、画面干净,且支持生成 4K 图片,但价格偏贵。
Nano Banana 2.1(gemini-nano-banana-2.1)已上线,价格从上一代 Pro 模型的每张 0.134 美元降至 0.034 美元。
AI相机应用Superpose完成220万美元种子轮融资,由Khosla Ventures领投,美图和OVTR VC参投,两名创始人Melody Chu与Jing Liu均来自TikTok。
bra31k.dev 发布博客文章 same-b。原文仅给出链接,未披露模型、参数或功能细节。
Recraft V4 Styles 可基于单张图像延伸出新的角色、构图与场景,让原始创意继续生长。该功能由 Recraft 发布,官方同步给出了示例提示词。
一条生成视频高度还原了 Airbnb 上一处位于阿肯色州、可实际预订入住的退役核导弹基地房源。发布者指出,参考素材对生成效果影响巨大,正是这些 references 让视频与房源细节高度贴合。
宝玉用一段提示词让 Opus 5.5 以 JS + Canvas 画篆书印章,印文为繁体「宝玉」、自右向左读,字形按《说文》小篆而非字体,每一笔用坐标画出再加粗。模型被要求先拆解各字部件与印面布局,再做白文与朱文两个版本,用朱砂色印泥、带刀刻质感与边缘残破、背景为宣纸纹理,导出 1200×1200 透明底 PNG,完成后截图自查字形可辨与笔画间距。
Google 的 Nano Banana 2.1 已在 AI Gateway 上线,模型标识为 google/gemini-nano-banana-2.1。相比早期 Nano Banana 模型,它改进了图像生成与编辑,支持产品场景重构、基于遮罩和墨迹的编辑,并提升事实准确性,可呈现逼真肤色、细腻材质、锐利光照和连贯背景,同时保持 Flash 级延迟与成本。
Pika 现已支持试用 Ideogram 4.5,用户可通过 create.pika.art/apps/ideogram 直接访问体验。
Pika 及其 API Club 现已支持 Ideogram 4.5,可对图像反复编辑而不影响原图画质,成本最多降低 59%。该能力在 Pika 和 Pika API Club 上持续提供。
用 Ideogram 4.5 可以把名画转成写实照片,提示词只需一句:"Turn this painting into a realistic scene." Mohammad Norouzi 展示了爱德华·蒙克 1893 年《呐喊》等作品的转换效果。
Recraft 分享三组写实高细节时尚编辑图像 Prompt,分别描绘玻璃温室中修剪花枝的年轻黑人女性、清晨空站台上用合成器与鼓机制作音乐的年轻黑人男性,以及洗衣店里用平板绘制动画帧的年轻成人。每个 Prompt 均指定了服装、道具、光线条件与胶片颗粒等细节,并大量使用自然日光、玻璃反射和轻微运动模糊等写实质感描述。
Recraft V4.1 发布,主打自然摄影、强构图与真实日常瞬间,可将简单提示词转化为自然、有意图且生动的图像。该版本由 Recraft 官方账号在社交平台公布,具体参数与上线范围未披露。
作者开源了一个「小说转漫画」skill,为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并配合 ChatGPT 生图模型出图,最终提供离线阅读器、PDF 和 CBZ 漫画文件。
作者整理了一套图片反推教程,从主体、风格到细节,教读者把参考图拆成能用的提示词描述。教程覆盖字体排版、场景、摄影、插画和3D角色五类,各有一条完整模板,替换括号内容即可使用,并以水果海报为例说明哪些元素固定、哪些可替换。
极客公园文章指出,AI 图像默认生成美女并非偶然:生成模型学习数据分布并从中心取样,而心理学研究显示「平均脸」恰是人眼中的美。Civitai 上 NSFW 图片占比从 2023 年 1 月的 41% 升至 2024 年 12 月的 80%,2024 年一项研究发现用 PickScore 微调模型会增加 NSFW 输出,Grok 的 Spicy 模式则直接向付费用户开放暗示性内容。
Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。
华为推出睿影 Z10 模块相机,通过 HyperClick 超级卡口安装在 Mate 90 Pro Max 典藏版和非凡大师机身背部,内置 1 英寸 5000 万像素 RYYB 传感器和 24mm 到 240mm 的 10 倍连续光学变焦镜头,最大光圈 F2.0-F4.5,价格接近 6000 元。
Lovart 展示了由 GPT Image 2.5 与 Seedance2.5 生成的效果:文字如水流般流动并贴合海岸线。该内容以视频形式发布在 Twitter 上,帖文获得 47 个点赞、8 条回复和 2633 次浏览。
Pika 推出新版,将视频、图像与声音生成整合在同一平台,官方称使用全球最好的生成式媒体模型,成本仅为同类的一小部分。平台提供 25+ 应用与质量优先的创作工具,并强调定价公平、不做虚假的无限量套餐。
Black Forest Labs 发布 FLUX 3 Image,支持多轮精确编辑且不改变其他像素,可用 bounding boxes 指定布局、最高 4K 生成、最多 10 个参考图组合,并为企业提供商用权重,开放权重版本将在未来几周推出。Justine Moore 用一张旧 Chloe 广告实测,连续九轮替换连衣裙、沙发、墙纸、妆容和 logo 后仍保持结构,未出现 artifacts。
一篇博客详解前沿文生图模型的后训练流程,涵盖 rubric 奖励的构建方式与完整离线评测方案。文章还给出可视化前后对比,展示作者发现并捕获的奖励攻击(reward hacking)失效模式。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
Recraft 发布三条角色生成提示词示例,分别描绘光头配超长麻花辫的机车手、不对称剃发配蓬松侧马尾的滑板女孩,以及发型凌乱、戴未来感运动眼镜的城市骑行者。三条提示词均强调夸张廓形服装与随身装备细节,如机车手夹克下夹头盔、滑板女孩腋下夹滑板、骑行者手扶紧凑型自行车。
Recraft 展示 Recraft V4 Styles 的效果:同一张参考图可生成风格截然不同的角色、物体与场景。该帖仅给出提示词线索,并标注由 xgo.ing 提供支持。
Recraft 发布四组图像提示词示例:女性半身从浓密红烟中浮现、女性穿雕塑感靴子在空停车场贴近镜头蹲姿、年轻男性透过车窗侧拍、冲浪者背对镜头抱半透明冲浪板站在黑色火山岩海岸。该帖互动数据显示 1 条回复、3 次点赞、528 次浏览。
Recraft V4.1 可生成兼具气场、氛围与个性的角色图像,涵盖不同面孔、视角、环境与情绪,从电影感特写到全身场景,每条提示词都能形成独立的视觉故事。