Google AI 发布文章:Gemini 新进展
Google AI 在 X 平台发布一篇新文章,附链接指向 x.com 的文章页面。该帖获得 62 条回复、218 次转发、1747 个点赞,浏览量达 115832。
Google AI 在 X 平台发布一篇新文章,附链接指向 x.com 的文章页面。该帖获得 62 条回复、218 次转发、1747 个点赞,浏览量达 115832。
Space Bunny Alpha 的隐身测试期已结束,官方感谢所有参与测试并反馈的用户,称这些反馈帮助塑造了最终模型。官方表示,Space Bunny Alpha 背后的正式模型将很快揭晓,更多信息有待公布。
Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。
Recraft V4.1 发布,主打自然摄影、强构图与真实日常瞬间,可将简单提示词转化为自然、有意图且生动的图像。该版本由 Recraft 官方账号在社交平台公布,具体参数与上线范围未披露。
Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。
外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。
据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。
Aleph Alpha 发布 Kolibri,参数规模 78B、激活参数 3.46B,上下文最高支持 1M tokens,权重以 Apache 2.0 许可开放,可在自有硬件上运行。Cohere 转发该消息并称其表现不错,同时预告双方将合作推出新成果。
Cohere 使用 WMT26 基准测试其翻译模型 North Small Translate,该基准在模型创建之后才发布,因此模型无法针对其指标进行训练。
Cohere 推出开源机器翻译模型 North Small Translate,称其为 1T 参数以下全球最佳。该模型权重与流程均对外开放,并由 Cohere 本地化负责人 Tom Kocmi 出镜讲解。
Kling AI 展示了创作者使用 Kling 4.0 和 Kling 4.0 Flash 生成的作品,强调新的想象、新的故事与新的创作方式。两条模型版本号分别为 Kling 4.0 与 Kling 4.0 Flash,配以 #Kling4 与 #klingai 话题发布。原文未披露参数规模、benchmark 分数或开放方式等细节。
智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。
StartLux(原点星辉)开源决策模型 StartLux-Decision,一次推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型用于说话人分离,即使多人声音重叠也能追踪谁在何时说话,最多支持 8 位说话人,参数量 100M。官方感谢下载者,并回应了部分提问。
有人用 Opus 5.5 做出了一个可交互的 3D 喷气发动机,支持剖切和拆解查看内部结构。该内容在浏览器中运行,原帖为视频展示形式,已获得 1563 个点赞和 25 万余次浏览。
Claude Sonnet 5.5 展示了一项生成能力:在平面画布上绘制出每栋建筑都由纸张折叠而成的立体城市。演示由 Sonnet 5.5 完成,相关视频发布在 Twitter 上。
Claude Opus 5.5 被用于制作浮雕卡片,相关演示以视频形式发布。该内容在社交平台获得 1256 个点赞、42 次转发和 22 条回复,浏览量约 10.2 万次。
一个 3D 网站用 Opus 5.5 实现了从银河系外飞掠到木星卫星的连续镜头。该站点可在浏览器中播放这段太空飞行视频内容。
OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。
Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。
Claude Sonnet 5.5 在 Agent Arena 排名第 3,单任务中位成本 2.74 美元,净提升分数 +12.5%。Claude Opus 5.5 排名第 2,单任务成本 1.58 美元且得分更高,这一权衡使 Sonnet 5.5 未能进入 Agent Arena 的帕累托前沿。
Arena.ai 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次登榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High)(+4.4%)高出 8.1 个百分点。
OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。
Black Forest Labs 发布 FLUX 3 Image,支持多轮精确编辑且不改变其他像素,可用 bounding boxes 指定布局、最高 4K 生成、最多 10 个参考图组合,并为企业提供商用权重,开放权重版本将在未来几周推出。Justine Moore 用一张旧 Chloe 广告实测,连续九轮替换连衣裙、沙发、墙纸、妆容和 logo 后仍保持结构,未出现 artifacts。
Recraft V4.1 可生成兼具气场、氛围与个性的角色图像,涵盖不同面孔、视角、环境与情绪,从电影感特写到全身场景,每条提示词都能形成独立的视觉故事。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
Ideogram 新模型已在 Ideogram 平台、API 和首发合作伙伴上线。开放权重仍处于即将推出的预告阶段,尚未给出具体日期。更多案例与详细介绍见 best.xiaohu.ai。
Ideogram 4.5 是主打高精度局部编辑与超强一致性的图像编辑模型,连续多轮改图时可减少偏色、细节走样和异常纹理,保留上一轮已满意的结果,而不是重新生成全新的图。它支持换色调光、改图中文字、产品换场景、老照片修复等;大图可裁出局部编辑再拼回高清原图。文中举例先给烤面包机换色,再换旁边的水果,后一次修改仍会沿用前一次已确定的机身颜色、按钮与镀铬细节。
Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。
GPT-6.1 Sol 在 Browser Use Bench 2.1 上跑出该基准测得的最高分,超过 Astra,估算成本低 7.8 倍。其便宜的原因是 95% 的提示词 token 被缓存,而缓存 token 单价是 Astra 的 1/10。Opus 5.5 与 Grok 4.7 得分更低且成本更高。
Perplexity 开源多模态决策模型 pplx-decider-27b,并推出由 pplx-decider-v1-27b 驱动的 Decisions API。该模型被训练为输出固定答案集合上的概率分布而非文本,定价为每百万输入 token 4 美分、输出 token 免费,跨基准测试得分 85.71%,官方称未来几天还会进一步降价。
Black Forest Labs 发布 FLUX 3 Image,可生成最高 4K 分辨率图像,支持用包围框精确定位布局、一次进行多处定向编辑并在编辑间保持一致,还可使用最多 10 张参考图合成图像。该模型面向大规模图像生成的企业提供商用权重,开放权重版本将在未来几周推出,上线首周半价。Replicate 已提供该模型。
Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。
Cloudflare 开源了首批自研决策模型 clef 和 clef-flash,两者已在 Cloudflare Workers AI 上线。Harrison Chase 评论称,此前就有人预言决策模型领域会迎来更多入局者,如今连开放权重也出现了,并称 harness 应该能像替换主模型一样轻松替换决策模型。
Cloudflare 的 workers ai 团队发布首个自研模型系列 clef,包含两个快速、准确的决策模型,在质量与延迟基准上登顶。模型已开源,权重可在 Hugging Face 获取(Cloudflare/clef),也可直接使用 workers ai 的托管版本。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
Sam Altman 表示,6.1 Sol 是迄今增长最快的模型,此前在负载下略显缓慢,现已大幅改善。原文未披露该模型的具体参数、性能数据或可用性信息。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。