小红书 AllSpark 发布开源 Search Agent Iris,35B 版本逼近万亿参数模型
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
LovartAI 展示了一段 GPT-Image 2.5 的演示,用户只需说“GPT-Image 2.5, help me arrange the flowers.”,模型便能完成插花安排。该内容在 X 上获得 31 个点赞、7 条评论和约 2 万次浏览。
ChatGPT Work 和 GPT-6 Astra(作者用的是 "Max")能基于 OSM 数据,从给定地址生成 5K/10K 环形跑步路线。该体验由 Simon Willison 分享,称其"挺不错"。
GPT-VI ASTRA 亮相,相关视频已在 X 上发布,该帖获得 4431 次点赞、196 次转发和 298 条回复,浏览量达 550388。目前公开信息仅包含该视频演示,尚未披露模型参数、上下文长度或可用性细节。
Mustafa Suleyman 在 X 上发帖,引导读者前往 microsoft.ai/models/mai-tra… 了解该模型详情,正文未披露模型名称、参数规模或评测数据。
GPT-Image 2.5 在像素艺术上表现出色,相关演示视频已在 Twitter 发布,获得 639 次点赞、48 次转发和 5.6 万余次浏览。该推文由 xgo.ing 提供支持。
DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。
腾讯混元团队在北京接待 Ivan Fioravanti 后预告,Hy4 Preview 只是冰山一角,未来还会有更多 AI 产品发布。Fioravanti 参观了腾讯北京总部,并与混元团队讨论了混合 AI 场景等话题,称期待看到腾讯近期交付的新成果。
Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。
Cognition 发布 SWE-2,称这是其目前最接近前沿的模型,在主要评测上与近期前沿模型持平,成本最高降低 70%。该模型将强化学习扩展到数万亿参数规模,使用改进后的配方同时推进能力与成本两个维度。Fireworks 表示参与了其背后的基础设施栈,并链接了自家关于 RL 的博客文章。
GPT-6 Astra 在抗体可开发性预测基准测试中成为表现最好的前沿模型,在聚集性、稳定性、成药性等可开发性属性上的预测优于其他受测前沿模型。展示抗体工作机理的交互式可视化同样由 Astra 构建,耗时约 1 小时。
Cognition 发布 SWE-2,官方称这是其迄今最接近前沿水平的模型,在主流评测上得分与近期前沿模型持平,成本最高低 70%。Scott Wu 表示,这是团队第一个性能可与前沿水平相比的模型,将把 RL 扩展到数万亿参数规模,并在能力与成本两端同时推进帕累托曲线。SWE-2 面向 Devin 套餐用户免费开放一个月。
Genspark 推出首个自研 AI 模型 Gen-1 Slides,官方称其性能与最先进的前沿模型相当,价格仅为后者的 1/17。该模型已在 genspark.ai 上线,可通过 ai_slides 页面体验。
Genspark 与 Fireworks 发布开源模型 Gen-1 Slides,在幻灯片生成任务上对标 Claude Opus 5,输入 token 价格约为后者的 1/17。该模型基于 MiniMax M3 通过 Fireworks Lab 的长时程 RL 后训练而来,已在 Genspark AI Slides 中作为默认模型上线。
Genspark 发布其首个面向知识工作的 AI 模型 Gen-1 Slides,基于开源权重基座并与 Fireworks AI 共同训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其生成质量对标前沿模型,价格约为 Opus 5 的 1/17。
Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,由 Genspark 与 Fireworks AI 基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其质量达到前沿水平,价格约为 Opus 5 的 1/17,完整说明见 Genspark 博客。
Cognition 发布 SWE-2,称其是在前沿能力上最接近自家前沿水平的模型,在主要评测上得分与近期前沿模型相当,成本最多低 70%。该模型已可在 Devin Desktop 和 CLI 使用,Pro、Teams 用户及接下来一个月可无限使用。团队称将 RL 扩展到数万亿参数规模,配方在能力与成本上同时推进帕累托曲线。
Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,与 Fireworks AI 合作基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其可生成前沿质量幻灯片,价格约为 Opus 5 的 1/17,博客全文见 genspark.ai/blog/gen-1-sli。
Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。
腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。
DeepSeek 宣布将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时开放 2000 块 GPU 加存储集群的大规模部署合作洽谈。相关模型已发布在 Hugging Face 的 deepseek-ai 主页。
DeepSeek 宣布 V4.1-Flash 采用更高效的架构,可以更低成本服务更多用户,并将节省的成本让利给用户。新价格于 2026 年 9 月 10 日 04:00 UTC 生效,继续采用峰谷定价以平衡需求,非高峰时段费率为高峰时段的 50%,灵活负载可安排到非高峰时段以节省费用。
DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。
DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。
DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。
DeepSeek 发布 DeepSeek-V4.1-Flash,是新架构家族中体量最小的模型,原生支持视觉理解。该模型主打更强能力、更快推理与更高吞吐,并可扩展至更大模型。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。
Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。
Google 的 Logan Kilpatrick 表示,Gemini 3.8 Cyber 在许多网络防御基准和真实用例上比 Mythos 更强。该模型已在 Google 内部被 Chrome、Wiz 和 Cloud 广泛使用,并将很快向外部扩展。原文附有 deepmind.google/models/gemini/ 链接。
OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。
面壁(ModelBest)发布 100% 开源的 MiniCPM5-2B,仅 2B 参数、2GB RAM 即可在任意笔记本甚至手机上完全离线运行智能体,支持编码、智能体和工具调用任务。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
Arena.ai 数据显示,OpenAI 的 GPT-Image-2.5-Sunburst 在 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单均排名第一,Flare 排名第二。
Manus 在自家评估中称 GPT-Image-2.5 是明显进步,其 Flare 能以 GPT-Image-2 两到四倍的速度生成高质量图像,透明背景生成也有改进,适合 Manus 上的品牌素材、演示和网站等创意工作,并邀请用户在 Manus 中体验。被引用的 OpenAI 推文介绍 ChatGPT Images 2.5 生成更快、还原度更高、多次编辑细节一致,并支持基于评论的局部编辑。
OpenAI 发布 Images 2.5,Sam Altman 表示它可能无法解决特别困难的数学问题,但表现很好,希望用户喜欢;介绍页面链接为 openai.com/index/introduc…。
OpenAI 将于 9 月 16 日在旧金山举办 GPT-6 用户聚会,聊模型本身以及下一步该做什么,申请截止 9 月 10 日。此前 GPT-5.5 也曾办过同类活动。
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,主打精准、智能的实时转写。官方同时放出了详细介绍链接,未披露参数量、benchmark 分数或开放方式等细节。
DeepMind 发布 AlphaGenome Atlas。继 AlphaFold 绘制蛋白质宇宙之后,该工具用于绘制人类基因组,可预测全部 90 亿个可能的单字母 DNA 变异带来的影响,帮助科研人员更好地理解疾病。该资源面向学术研究免费开放,地址为 alphagenome.google/atlas。
DeepLearning.AI 称,近期走红的 Ox Alpha 模型已确认为智谱的 GLM-5.3-Flash。该模型为 320B 参数、每 token 激活 18B,采用线性注意力与稀疏注意力混合架构,在 GDPval AA v2 等真实任务上表现领先,单任务成本仅 0.09 美元。智谱此次大规模免费预览全部运行在中国产硬件上,用于验证内存优化可突破硬件限制。