Ideogram 4.0 发布,主打高密度文字渲染与原生 2K 分辨率
Ideogram 发布 4.0,主打高密度且准确的文字渲染、原生 2K 分辨率、原生背景透明和精确版式控制。官方表示可编辑文字、可移动图层与完整图像编辑功能即将推出。
Ideogram 发布 4.0,主打高密度且准确的文字渲染、原生 2K 分辨率、原生背景透明和精确版式控制。官方表示可编辑文字、可移动图层与完整图像编辑功能即将推出。
Ideogram 发布 Ideogram 4.0,称其在 DesignArena 第三方榜单上是全球排名第一的开源权重文生图模型。官方表示其成绩仅次于 OpenAI 和 Google 的闭源模型,并强调该模型具备前沿质量、完整可定制性和数据隐私。DesignArena 为第三方评测榜单。
Ideogram 发布 Ideogram 4.0,称其为全球最好的开放图像模型,权重可下载,支持用户用自己的数据微调并在自有硬件上运行。该模型现已上线 Ideogram 全部订阅方案和 API。
Ideogram 将于美国东部时间明日中午 12 点开放提前体验,用户在下方回复自己的 ideogram 用户名即可获得早期访问资格。
李飞飞等人推出 GPIC(Giant Permissive Image Corpus),一个面向大规模生成模型时代的视觉生成数据集与基准,含 1 亿条 VLM 标注图文对用于训练、100 万条图文对用于评测,总计约 28 万亿像素。该数据集完全允许研究及商业用途,采用集中托管,并同时提供数据集、基准与模型。
v0 发布新的 Figma 集成,可将静态 Figma 设计稿转换为可用 UI,保真度较此前更高。导入能力现已覆盖布局、排版、组件、图标和图片五类信息。
Ideogram 的 MCP 现已可在各类主流 AI 智能体中直接使用,官方同步发布了完整配置指南(ideogram.ai/features/mcp)。用户可通过该指南完成接入设置,在智能体工作流中调用 Ideogram 的图像生成能力。
Ideogram 展示了一套工作流:用户可在同一段对话中生成创意简报的编辑式页眉、产品规格的落地页主视觉、内容日历的品牌缩略图以及脚本的故事板帧。该能力来自 Ideogram 官方账号分享,面向多场景设计资产生成。
Ideogram 发布 Ideogram MCP,可在对话中直接生成图像、设计并训练自定义模型,无需离开聊天界面。该 MCP 同样支持 ChatGPT、Cursor、Hermes 等。
Midjourney 为 V8 模型补齐用户呼吁的"反向提示词"功能,在 V8.1 中推出 --no 参数,此前版本已支持。用户可用 --no people 等方式把指定元素(如人物)从生成图像中排除。
吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。
Ideogram 背景移除功能现已在 FAL 平台上线,可精准隔离主体并提升精细结构的细节还原。该功能在真实照片上表现稳定,不限于影棚素材,可直接用于合成、包装与动效流程。
Ideogram BG Remover 是从零训练的生成式模型,不是把像素分为前景与背景的分割模型。这一差异体现在边缘上:输出为干净的 alpha 通道,无光晕、无颜色渗漏,也无需手动清理。细节见 ideogram.ai/features/backg。
Ideogram 发布 BG Remover,官方称其在图形设计场景达到 state-of-the-art,可对 logo、产品图、精细字体和复杂抠图生成干净的 alpha 通道。该功能面向所有订阅方案开放,包括 Free,并可通过 API 调用。
Midjourney 推送更新,提升 V8.1 的图像质量与锐度,在 SREF、moodboard 和 HD 图像上尤为明显,整体也有改善。V8.1 现已上线 Midjourney 主站,此前仅限 Discord 使用。
Midjourney 在 X 上分享了一个办公时间(office hours)直播房间链接 midjourneyofficehours.onrender.com。该条内容互动数据为 3 个点赞、3350 次浏览。
Midjourney 举办 4/29 每周 Office Hours,通过 X Spaces 进行,推文附带该场次链接。原文未披露本场讨论的具体内容。
Monica AI 已上线 Claude 4.7 Opus 和 GPT Image 2,前者带来更强的推理与深度分析能力,后者提供图像生成。官方称此次更新覆盖编程、写作与设计场景,用户可在 monica.im 体验。
Midjourney 举办 4 月 22 日的每周 Office Hours 活动,以 X Spaces 形式进行,相关链接为 x.com/i/spaces/1nxeL…。该条动态获得 16 个点赞、4 条回复和 10221 次浏览。
Ideogram 的 Custom Models 功能已正式上线,用户可通过 API 访问使用。官方提供了功能详情页面 Ideogram.ai/features/custom-models 供查看。
Ideogram 上线自定义模型训练功能,只需 15-100 张风格一致的图片即可训练专属模型,用于延续品牌视觉风格。该功能延续 Ideogram 模型一贯的清晰文字渲染能力。
Ideogram 发布 Custom Models,可基于用户自己的图片而非互联网数据训练模型,使每次生成都遵循品牌的视觉风格、字体排版与视觉识别。该功能已面向 Team、Pro 和 Enterprise 套餐及 API 开放。
Anthropic Labs 推出 Claude Design,用户可通过与 Claude 对话制作原型、slides 和 one-pager。该功能由 Claude Opus 4.7 驱动,官方称其为能力最强的视觉模型,目前以研究预览形式在 Pro、Max、Team 和 Enterprise 套餐上线,当天陆续推送。
Midjourney V8.1 正式上线,回归标志性美学风格并支持原生 2K HD 渲染,相比 V8 快 3 倍、便宜 3 倍。其 1K 模式的完整画质已快于 V7 的草稿模式,同时恢复了图像提示(image prompts),并新增 Describe、moodboards 与 srefs 功能。
阿里巴巴 Wan 2.7-Image 已在 Poe 上线,可从单条提示词生成角色、风格与上下文一致的系列图像,并支持 bounding box 编辑,只重绘指定区域而无需重新生成整张图。用户可在全平台的 Poe app 及 Poe API(poe.com/Wan2.7-Image)中试用。
World Labs 展示了一个完全由单人创作者构建的赛博朋克世界,使用 1 亿个 Gaussian splats,其中几乎所有表面和结构都由 Marble 生成。李飞飞称这标志着个人能够构建完整世界的时代正在到来。
Midjourney v8 预览版已可通过 alpha.midjourney.com 登录访问。
Midjourney v8 早期预览已在 alpha 站点开放测试。据该推文,新版本原生 HD 模式速度提升 5 倍,文本渲染更好,提示词遵循度更高,并建议搭配个人化和 SREF 使用以获得最佳体验。
职业调色师 Ray 在播客中从《罪人》《F1》《惊变28年》等项目切入,讨论胶片与数字交替、数字中间片与 Log 曲线的由来,以及"在场"经验对创作的意义。节目还谈及 Sora、Runway 等 AI 工具对分镜、特效与预演的冲击,诺兰、柯达推动的胶片复兴,以及手机厂商在相册等影像闭环环节的缺位。
World Labs 的 Marble 可将一张图像转化为由数百万 splats 组成的庞大世界,生成从古代遗迹到飞船内部的可大规模探索环境。李飞飞表示,既然想象力没有边界,我们创造的世界也不该有边界。
Nano Banana 2 现已在 Monica AI 上线,主打更锐利的细节、更好的构图和更一致的风格,官方称其为最强图像生成模型。用户可通过 monica.im 使用,官方建议视觉创作者将其作为新的默认选择。
Midjourney --v 8 即将发布。作者用同一提示词对比 Midjourney(左)与 Nano banana(右)的生成效果,认为 Midjourney 在美学和情感细腻度上明显胜出,能准确还原提示词中"quiet distress""cold, intense stare"等情绪描述。
李飞飞与 Alan Baade 等提出 Latent Forcing,通过安排联合扩散轨迹先揭示 Latent 再生成 Pixel,在编码无损、推理端到端的前提下改善收敛。该方法回应了扩散应选原始数据还是 Latent 空间的问题,答案是两者兼用。
吴恩达在 Sundance 电影节参加 AI 主题座谈,与 Daniel Dae Kim、Dan Kwan、Jonathan Wang、Janet Yang 同台,用一天时间了解好莱坞对 AI 的不安并试图搭建沟通桥梁。他指出好莱坞的担忧集中在三点:AI 公司未经同意和补偿使用其作品训练、SAG-AFTRA 等工会担心配音演员等岗位流失,以及这波技术变革比以往更像被强加而非可自由选择。
Grok Imagine 新增多图编辑功能,可组合风格、角色与环境。有观点认为,未来这类工具将几乎不再需要文字提示词,AI 会直接理解用户意图并即时生成,交互以手势为主、动态为默认、玩法自发涌现。
Nick St. Pierre 更新称,有人通过机器人调用 Midjourney 服务并转售给 Hailuo AI,该服务将很快被关停。此前他曾表示可在 Hailuo AI 内使用 Midjourney,--sref 参数同样可用。
现在可以在 Hailuo AI 内使用 Midjourney,--sref 参数同样生效。该消息来自一条社交平台帖子,未披露具体支持范围或上线时间。
Fei-Fei Li 在 X 上表示,World Labs 的 Marble 让用户能搭建庞大的世界,数百万个 splats 组合出一个巨型科幻场景。她用 Marble Studio 中飞船内部逐步成形的效果展示这一能力。
加州大学伯克利分校团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,且任何建模误差只会高估、不会低估真实信息。该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证,信息估计能预测下游解码器性能,优化出的设计达到端到端 SOTA 水平,同时所需内存和算力更少,也无需任务专用解码器。相关论文发表于 NeurIPS 2025。
一段提示词演示展示了如何用 AI 生成"大制作动画电影"质感的短片:女主角穿短病号服在冷冻舱中醒来,走出实验室沿走廊爬上黑色梯子,从井盖钻出后置身萤火虫飞舞、鹿群跑过的茂密森林,远景是植物覆盖的废墟城市。画面强调干净线条与流畅动作,提示词由 @EccentrismArt 提供。