OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款模型,二者基于 GPT-6 Astra 的技术进展,将其中多项能力带入更快、更便宜的模型,以支持规模化工作负载。OpenAI 同时优化了缓存与推理效率,并将节省的成本直接让渡给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款模型,二者基于 GPT-6 Astra 的技术进展,将其中多项能力带入更快、更便宜的模型,以支持规模化工作负载。OpenAI 同时优化了缓存与推理效率,并将节省的成本直接让渡给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,在大多数任务上达到 Claude Fable 5.1 的水平。其运行成本比 Opus 5 低 40%。AI SDK 表示已可用 AI SDK 调用 Claude Opus 5.5。
Mike Krieger 表示 Anthropic 将在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5,这两款模型将带来与近期发布相近的性能、效率和安全性改进。他同时称今天只是开始,后续还有更多内容。
Anthropic 将在未来数周推出 Claude Sonnet 5.5 和 Haiku 5.5。这两款模型将带来性能、效率与安全方面的多项相同改进。
Anthropic 的 Opus 5.5 经过了广泛的对齐测试,并接受 METR 等外部机构评估,同时针对网络与生物等高风险领域引入了防护措施。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称其在编码和知识工作方面领先,写作能力也较强。该模型多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Mike Krieger 转发了这一发布并邀请用户试用。
Claude 发布 Claude Opus 5.5,这是新 Claude 5.5 系列的首个模型,多数任务表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Alex Albert 表示使用 Opus 5.5 的体验很好,认为它聪明、写作清晰、速度快且成本低得多。
Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型,面向 Pro、Max 和 Team 套餐开放。
Anthropic 宣布 Claude Opus 5.5 今日上线,是其全新 Claude 5.5 家族的首款模型。官方称它在大多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。
原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
阿里巴巴在云栖大会推出 Logics-Parsing-V3 开源文档解析模型,通过循环滑动窗口与结构状态传递处理跨页内容,解决表格截断、文本割裂和标题层级错位问题。
Qwen-Image-2.1 在发布当天获得 Intel OpenVINO 的 Day-0 支持,可在 Intel 硬件上优化运行。该模型以单一开放权重 checkpoint 同时支持图像生成与编辑。
阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。
腾讯混元上线 Hy Image3.5 预览版,官方称在人类评估中相较 Hy Image3.0 胜率提升 30%,支持文生图与图生图,最高 2K 分辨率,一致性更好。API 已在腾讯云上线,每张图 0.024 美元,参考图不计费,并提供两周免费试用(仅限 OnSolo 与 Miora)。
腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),一款高性价比专业级生图模型,对比 Hy Image3.0 综合能力提升约 30%。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。
Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。
Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。
v0 宣布 Grok 4.7 已在其平台上线,9 月 27 日前提供 40% 折扣,可通过 v0.app 使用。引用内容显示 SpaceXAI 称 Grok 4.7 相比 Grok 4.6 有显著提升,价格与速度保持不变。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态,权重已上传 Hugging Face。作者称其得分与 GPT-5.6-Sol Max 大致相当,输入 token 便宜 9 倍、输出 token 便宜 23 倍,也比 Opus 5 便宜约 20 倍。
小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上得 46,成为该榜单最高分开源模型,前代 MiMo-V2.5-Pro 为 26。
xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。
Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。
Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。
xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。
xAI 宣布 Grok 4.7 已在 Cursor、Grok Build 和 Grok API 中上线,并给出 x.ai/news/grok-4-7 的了解更多链接。
xAI 发布 Grok 4.7,官方称其在相同价格和速度下较 Grok 4.6 有明显提升。目前公开信息仅有这一句说明,未给出具体能力指标或开放方式。
xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。
马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。
LangSmith Gateway 将开源决策模型 SemIf 免费开放一周,该模型基于 Qwen3.5。SemIf 属于新型的 decision models(决策模型),兼容 TypeSafe SDK,只需改动一个字符串即可试用。
Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。
阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。
Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。
阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。