Google AI Studio 推出 NanoBanana 2.1 图像生成模型
Google AI Studio 发布图像生成模型 NanoBanana 2.1,称在视觉设计、基于 mask 的编辑、主体一致性和画面自然度上全面优于此前模型,并已在 ai.studio 开放试用。Lovart 转发了这一消息,并以 Made with Lovart 展示其生成效果。
Google AI Studio 发布图像生成模型 NanoBanana 2.1,称在视觉设计、基于 mask 的编辑、主体一致性和画面自然度上全面优于此前模型,并已在 ai.studio 开放试用。Lovart 转发了这一消息,并以 Made with Lovart 展示其生成效果。
Notion 宣布其平台已可调用 Claude Haiku 5.5。引用 Anthropic 的介绍,Haiku 5.5 是其发布的最便宜、最快且能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线。OpenRouter 称这是首个支持 reasoning efforts 的 Haiku 模型,价格比上一代便宜约 75%,速度实测 100+ TPS,基准测试中能力也有明显提升,可通过 openrouter.ai/anthropic/clau… 使用。
StepFun 的 Step 5 Preview 已在 OpenRouter 上线,定价为输入 $1.00/M、输出 $2.70/M,发布期缓存命中价再打五折至 $0.05/M。发布方称该模型面向智能体与专业工作场景,并提供为期一周的免费访问,逐步覆盖 opencode、cline、NousResearch、kilocode 等平台。
Anthropic 宣布将 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 token 0.10 美元。官方称这一调整让 Sonnet 5.5 在多数长时运行任务上的成本降低约 20%。
Genspark 宣布 Claude Haiku 5.5 已在其 AI Chat、Code Agent 和 Claw 中上线,并称这是 Anthropic 目前最便宜、最快、能力最强的小模型。Anthropic 官方介绍称,Claude Haiku 5.5 平均运行成本比 Claude Haiku 4.5 低约 75%。
OpenRouter 宣布 OpenAI GPT-6.1 Sol 的 Ultrafast 模式已在其平台上线,链接指向 openrouter.ai/openai/gpt-6.1。
OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价,为每百万输入 token 12 美元、每百万输出 token 60 美元。该模式面向对速度和智能同时有要求的场景,例如排查线上故障、智能体操作应用,以及分秒必争的实时体验。
Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。
OpenAI于10月7日宣布GPT-6进入ChatGPT日常对话,并推出Intelligent UI智能交互界面,向全球超过12亿周活跃用户开放。Plus、Pro、Business、Enterprise自10月7日起陆续获得GPT-6 Sol,Free和Go用户从10月8日起陆续获得GPT-6 Luna,企业工作区可用性还取决于管理员权限设置。
梳理了GPT-6在ChatGPT全员开放的分批安排,以及Intelligent UI如何把回答变成可交互界面。
ChatGPT 官方宣布 GPT‑6 with Intelligent UI 今日起在 Chat 标签页面向 ChatGPT Plus、Pro、Business 和 Enterprise 档位全球上线,明天起扩展至 Free 和 Go 档位。
官方账号给出 GPT‑6 在 ChatGPT 各订阅档位的上线节奏与对应模型,读者可据此确认自己何时能用上。
Claude Haiku 5.5 在编码、computer use 和知识工作方面相比 Haiku 4.5 有显著提升,同时速度更快、价格便宜 75%。作者提到 Haiku 4.5 发布于 2025 年 10 月 15 日,两代间隔不到一年。
AI SDK 宣布支持使用 Claude Haiku 5.5。其引用的 Anthropic 介绍称,Claude Haiku 5.5 是该方发布过的最便宜、最快且能力最强的小模型,运行成本平均比 Claude Haiku 4.5 低约 75%。
Vercel AI Gateway 现已上线 Anthropic 的 Claude Haiku 5.5,这一版本面向摘要、上下文压缩、数据库查询和分类等高频、成本敏感任务,也可作为子智能体配合更大的 Claude 模型处理编码工作。
Mistral 发布 Mistral Large 4(Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是欧美聚合基准上最好的开放权重模型,在视觉 grounding 上超过闭源前沿模型。
ElevenLabs 的 Eleven v4 和 Eleven v4 Turbo 占据 Artificial Analysis 文本转语音榜单前两名。
Black Forest Labs 发布 FLUX 3 Image,支持多轮精确编辑且不改变其他像素,可用 bounding boxes 指定布局、最高 4K 生成、最多 10 个参考图组合,并为企业提供商用权重,开放权重版本将在未来几周推出。Justine Moore 用一张旧 Chloe 广告实测,连续九轮替换连衣裙、沙发、墙纸、妆容和 logo 后仍保持结构,未出现 artifacts。
Ideogram 4.5 是主打高精度局部编辑与超强一致性的图像编辑模型,连续多轮改图时可减少偏色、细节走样和异常纹理,保留上一轮已满意的结果,而不是重新生成全新的图。它支持换色调光、改图中文字、产品换场景、老照片修复等;大图可裁出局部编辑再拼回高清原图。文中举例先给烤面包机换色,再换旁边的水果,后一次修改仍会沿用前一次已确定的机身颜色、按钮与镀铬细节。
Google DeepMind 推出 SynthID Bio,将 SynthID 水印技术扩展到合成生物学,可在生物代码中嵌入不可感知的签名,并能在合成出的物理蛋白质上验证,同时保持其生物学功能。
GPT-6.1 Sol 已在 v0 上线,可在 v0.app 试用。v0 引用的 Vercel Developers 消息称,GPT-6.1 Sol 已在 AI Gateway 上线,相比 GPT-6 Sol 在编码、computer use、多步工作流和复杂文档分析方面有所改进。
Claude Sonnet 5.5 已上线 Genspark,接入 AI Chat、Code Agent 和 Claw。Genspark 称这是 Anthropic 目前最快的 Sonnet,输出速度提升 30% 以上,单任务成本比 Sonnet 5 最多降低 30%,价格保持不变。
Cognition 转述 Anthropic 的数据:Sonnet 5.5 的 token 价格与 Sonnet 5 保持一致,但输出生成速度提升超过 30%,单任务成本最多降低 30%。同一价格下的速度与成本变化,对使用 Claude 驱动编码智能体的团队更直接。
v0 宣布 Claude Sonnet 5.5 已在 v0 上线,用户可通过 v0.app/?sonnet55 使用。Anthropic 介绍该模型是 Claude 5.5 家族第二款模型,相比 Sonnet 5 运行速度提升超过 30%,多数任务成本最多降低 30%。
Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年费订阅用户上线。
Anthropic 的 Claude Sonnet 5.5 已在 AI Gateway 上线,模型标识为 anthropic/claude-sonnet-5.5。
Fireworks 的 Ember-1 已在 Vercel AI Gateway 上线,这是一个基于 Kimi K3 构建、面向编码与智能体工作流的研究预览版推理模型。
作者提醒,现在有了音频版的 Nano Banana,模型和 demo 均已开源在 GitHub 与 Hugging Face 上,可实现秒级克隆声音、像编辑文本一样编辑音频、改变音色音调与情绪、去除口音、增强或分离人声,甚至加入咳嗽和笑声等效果。腾讯还发布了更快更小的 flash 变体。
Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
腾讯混元 Hy Image3.5 preview 上线,提供专业级图像生成,人工评测胜率比 Hy Image3.0 高 30%,支持文生图和图生图,最高 2K,一致性更好。API 按每张 0.024 美元计费,参考图不收费,Miora 和 OnSolo 提供两周免费试用。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已上线 Vercel AI Gateway。
Anthropic 的 Claude Opus 5.5 已在 Vercel AI Gateway 上线,模型标识为 anthropic/claude-opus-5.5,支持 1M token 上下文窗口和最多 128K 输出 token,面向智能体编码、长时智能体任务和专业知识工作。
Claude Opus 5.5 上线 Vercel AI Gateway,同时列出两项会导致 400 报错的 API 不兼容变更,便于现有调用方迁移。
Qwen 在 Hugging Face Spaces 上线 Qwen-Image-2.1 在线 demo,浏览器即可试用,无需本地配置。该模型为 7B 参数的原生图像生成与编辑模型,支持最多 10 张图像参考,自带提示词增强 LLM,并集成 diffusers 与 ComfyUI。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
Qwen-Image-2.1 现已支持在 ComfyUI 中使用,并开放权重,单个 7B checkpoint 同时支持生成和编辑。该模型支持原生 2K 图像生成、单次基于最多 10 张参考图的指令编辑,以及包含 alpha 通道的 RGBA 输出。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称这是其目前最先进的实时对话音频模型。Google Labs 的实验项目 Dreambeans 转为正式可用,可为用户每日精选个性化故事集;同属 Labs 的 CC 从个人生产力工具扩展为共享智能体,用于帮助家庭协调事务、日程和日常任务。
World Labs 用 NVIDIA Voyager 总部的 32 张图像测试其世界模型 Atlas,展示从 32 张输入图像到实时飞行浏览的效果。Atlas 把文本、图像、视频和 3D 纳入共享空间上下文,可生成新视角、重建场景并模拟世界,并支持像素级精确的相机控制。该模型在 NVIDIA Blackwell GPU 上从零预训练。
DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。
Fireworks 与 Genspark 推出 Gen-1 Slides,一个开源模型,在幻灯片生成上匹配 Claude Opus 5,输入 token 价格约为其 1/17。该模型基于 MiniMax M3 底座,由 Genspark 用 Fireworks Lab 的长程 RL 后训练而成,现已在 Genspark AI Slides 中作为默认模型上线。
Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。