Skywork Posters 升级:一键生成并发布适配全平台海报
昆仑万维 Skywork 推出升级版 Skywork Posters,可一键创建并发布适配所有社交平台的海报。该功能由 xgo.ing 提供支持,官方同步发布了演示视频展示操作流程。
昆仑万维 Skywork 推出升级版 Skywork Posters,可一键创建并发布适配所有社交平台的海报。该功能由 xgo.ing 提供支持,官方同步发布了演示视频展示操作流程。
Replicate 上线 reve-2.1,可通过 replicate.com/reve/reve-2.1 直接试用。该条信息未披露模型参数规模、benchmark 分数或定价等细节。
Reve 2.1 已在 Replicate 上线,可生成 4K 图像,具备原生布局规划能力和更精细的文本渲染。该模型适用于视觉稿、广告创意和品牌摄影等场景。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
Skywork 推出升级版 Skywork Posters,可一键创建并发布适配所有社交平台的海报。原文未披露模型版本、参数规模或价格等细节。
Seedream 5.0 Pro 已上线 Replicate,支持基于区域的编辑、分镜(storyboarding)、高级多层图像分离,以及最多引用 10 张图片的图像生成。
字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升。四大核心能力包括复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成,支持十余种语言的直接输入与渲染。模型已上线火山方舟体验中心,并陆续在豆包、即梦上线。
Meta Superintelligence Labs 发布其首个媒体生成模型 Muse Image,并预览 Muse Video。Muse Image 以智能体方式运行,调用搜索和编码工具,能自我改进并随测试时算力扩展而提升,已上线 Meta AI 应用、meta.ai、美国 Instagram Stories 及部分国家的 WhatsApp。
Meta Superintelligence Labs 首发的图像生成模型,其智能体式工具调用与推理时算力扩展为图像生成提供了新范式。
Andrej Karpathy 称赞某模型的 three.js 环境生成能力属于顶级水平,认为每一代新模型层级都会带来质的跃升和惊喜。他指出模型能仅凭互联网知识就将其理解转化为 xyz 坐标、meshes、transforms、动画、特效与交互式小故事,并对更高模型层级能创造什么感到惊叹。
v0 的图像生成现已改用 Nano Banana 2 Lite。用户需在提示栏打开 Generate Images,生成的图像才会包含在输出结果中。
Poe 平台上线 Anthropic 的 Sonnet 5 与 Google 的 Nano Banana 2 Lite。Sonnet 5 被称为 Anthropic 迄今最具智能体能力的模型,具备 Opus 级编码与推理能力,成本更低。Nano Banana 2 Lite 是 Google 最快、最具性价比的图像模型,约 4 秒生成清晰一致的图像。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。
Midjourney 上线两项更新:提示词中加入 --preview 可提前预览 V8.2 的美学与个性化效果;大批量草稿模式现已支持 --sref random,风格空间探索速度提升至此前 24 倍。该草稿模式此前随 V8.1 推出,一次生成 24 张低分辨率图片,价格为标准分辨率 4 图任务的 1/2,选中后按 Vary 可获取全分辨率版本。
Midjourney 表示,很可能在 v9 模型和编辑模型之后训练一个新模型。
Midjourney 在 X 上发布提问链接,指向 midjourneyofficehours.onrender.com 的线上房间,邀请用户前往该页面提交问题。帖子带 1 条评论、12 个点赞和约 5156 次浏览。
Midjourney 表示其医学扫描功能目前"完全没有使用任何 AI",而是纯粹基于物理原理,并邀请用户查看其扫描图库。该回应针对用户 @rodolfoquintana 的质疑,官方给出的验证入口为 midjourney.com/medical/scan_g。
Riverflow 2.5 已在 Replicate 上线,其 Pro 版本在 Designarena 全球基准测试的图像、平面设计和图像编辑三个类别中均排名第一,Logo 类别位列第三,超过 GPT Image 2、Gemini 3 Pro 和 Ideogram 等模型。Riverflow 2.5 Pro 现已在 OpenRouter、Runware 和 Replicate 上提供。
Nick St. Pierre 整理 Midjourney 的定位:无投资人、完全由社区资助的研究实验室,图像生成产品收入支撑全部研发,前 9 个月约 1 亿美元、第 12 个月达 2 亿美元且仍在增长,目前有 4 个硬件和 4 个软件共 8 个在研项目。
一条帖文称 Midjourney 是一家医疗公司,该帖获 220 个点赞、27 条回复、11 次转发和 14639 次浏览。帖文未给出这一说法的具体依据或更多说明。
Midjourney 发布对其全新 "Midjourney Scanner" 的技术解读。该内容由 Midjourney 官方账号发布,附带视频演示,但原文未披露该工具的具体功能、参数或发布时间。
Midjourney 宣布成立名为 "Midjourney Medical" 的新部门,正式进军医疗领域。官方同步发布了一段演示视频,但未披露该部门的具体产品、技术方案或上线时间。
Midjourney 为 V8.1 发布新的大批量草稿模式,一次可生成 24 张低分辨率图片,价格仅为 Standard 分辨率 4 图 Job 的一半。用户选中满意图片后点击 “Vary” 即可获得全分辨率新版本。
Midjourney 将于本周三 6/17 晚 6 点 PT 在旧金山线下活动上直播发布其首个硬件项目。活动留有少量邀请名额,感兴趣者可回复获取。
Ideogram 社区在一周内构建出训练器、提示词编译器、LoRA 及完整工作流。官方发起征集,邀请用户回复自己最好的生成作品,优秀作品将收录进下一期社区精选合集。
Ideogram 分享了一组 CRT 屏幕图像生成示例,可呈现细致的扫描线、屏幕弧度和反光效果。有用户评价称,这种保真度和细节是其他模型做不到的。作品来自 r/StableDiffusion 的 u/Beautiful_Egg6188。
Ideogram 发布首个开放权重模型 Ideogram 4.0,一周内开源与创意社区的使用已超出团队预期。官方称 JSON 与 bounding box 提示词正逐渐成为新的常态,并发布了第一周的社区亮点合集。
Midjourney 将 V8.1 设为所有用户的默认模型,V8 将在两周后退役,V8.2 很快开始测试。官方表示 V8.1 恢复了标志性美学,支持原生 2K HD 渲染,相比 V8 快 3 倍、便宜 3 倍,满画质 1K 模式比 V7 draft 模式更快,同时回归图像提示词并上线新的 Describe,以及新的 moodboards 与 srefs。
Ideogram 宣布发布 Ideogram 4.0,该模型以开放权重形式推出,同时公司进行了整体品牌重塑,新品牌视觉由 How&How 打造。官方还邀请用户反馈对新 logo 的看法。
Ideogram V4 在 ComfyUI 中可通过 JSON 结构化提示词结合手绘 bounding box 精确控制画面构图,社区反馈其文字渲染能力出色,仅需 12 步 turbo 推理即可快速换种子迭代。有人称其是当前 state of the art 的开源图像模型,配套可使用 Kijai 的「Ideogram 4 Prompt Builder」节点。
Ideogram 宣布其仓库中已包含 fp8 和 nf4 两种检查点,其中 nf4 版本可在单张 24 GB GPU 上运行。相关资源已发布在 Hugging Face、GitHub 及其官方博客上。
Ideogram 发布了一个 9.3B 的开源权重图像模型,称其为目前可用的最佳开源权重图像模型,正在缩小与闭源基础模型的差距。官方表示该模型远未触及扩展上限,预计继续扩大规模会带来进一步提升。
Ideogram 发布 Ideogram 4.0 技术博客。Ideogram 4.0 是一个从零训练的 9.3B Diffusion Transformer,搭配冻结的 8B VLM 作为文本编码器,其 nf4 checkpoint 可在 24GB 消费级 GPU 上运行。
Ideogram 支持免费使用 4K 分辨率,而其他支持 4K 的模型免费版通常只有 720p。其生成过程可实时显示各分段,且每个分段拥有各自的提示词。有用户表示自己提示词不止"autumn"这一组,只是用它来直观对比不同模型的差异。
Ideogram CEO Mo Norouzi 在 MTSlive 访谈中表示,图像生成正从娱乐用途转向严肃的企业基础设施,质量已提升到企业乐于采用的水平。他认为重点不是通用模型谁最强,而是为企业和具体用例定制的最佳模型,并预测创意人员将构建自有品牌模型,定制化是下一个前沿。
Ideogram 4.0 被确认是最佳开源图像模型。该结论由 Mohammad Norouzi 在向 Google 提问"最佳开放权重图像模型是什么"后得出。
Ideogram 发布 Ideogram 4.0,称其为全球最佳开放图像模型,并开放模型权重。官方表示可下载权重、在自有数据上微调并在本地硬件运行,现已上线所有 Ideogram 套餐和 API。模型与演示页面已托管在 Hugging Face。
Ideogram 发布图像模型 Ideogram 4.0,官方称其为全球最佳开放图像模型,并开放权重供下载。用户可在自有数据上微调并在本地硬件运行,该模型已上线 Ideogram 各订阅方案和 API。
Ideogram 宣布推出 Ideogram 4.0,并邀请开发者、研究人员和企业基于该模型进行定制,以拓展生成式媒体与设计方向。官方同步给出 GitHub 开源仓库地址(github.com/ideogram-oss/i…)与模型技术详情页面(ideogram.ai/models/4.0)。
Ideogram 宣布 Ideogram 4.0 现已在多家合作平台上线,包括 Hugging Face、ComfyUI、fal、runware、magnific、krea_ai、LeonardoAi、Picsart、Cloudflare、replicate、GammaApp、floraai 和 kittldesign。
Ideogram 4.0 在排版和平面设计上仍是最强项,涵盖 logo、海报、多字体布局、长文本以及真正融入设计的创意排版。这一评价来自 Ideogram 模型一贯的表现。