Perplexity 实测:提示词使模型规避原失败案例比例从 75.1% 升至 93.7%
在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。
在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。
Genspark Slides Benchmark 已被纳入 Fireworks AI 的 Specialized Intelligence Index(SII)。Genspark 首个自研模型 Gen-1 Slides 在其评测中实现前沿级演示文稿(deck)质量,输入 token 价格约为前者的 1/17。评测结果可在 fireworks.ai/specialized-in… 查看。
Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。
OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,将 Astra 的多数能力带入更快、更便宜的模型以支持规模化使用。官方称同时提升了缓存与推理效率,并将节省的成本直接传导给用户:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。AI SDK 同步发推介绍可在 AI SDK 中使用这两款模型。
GPT-6 Sol 已在 Perplexity 和 Computer 中上线,同时成为 Computer 努力程度选择器中的默认 Light 选项。该消息由 Perplexity 官方账号发布。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两款模型基于 GPT-6 Astra 背后的进展,把其在专业工作、事实性、编码、计算机使用和对齐方面的能力带入更快、更便宜的版本,以支持规模化工作。OpenAI 同时提升了缓存与推理效率,并把节省直接让给用户:Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。
OpenAI 发布 GPT-6 Sol 与 Luna 两款更快更便宜的模型,并给出 API 价格降幅,便于判断成本与能力取舍。
Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,称两款模型基于 GPT-6 Astra 的技术进展,把其部分优势带到更快、更便宜的模型中,以支持规模化工作。OpenAI 表示缓存与推理效率也有提升,Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。
这条信息给出了新模型的定位与 API 价格降幅,可据此了解 GPT-6 系列在速度与成本上的取舍。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两者基于 GPT-6 Astra 的技术积累,把其部分能力下放到更快、更便宜的模型以支持规模化使用。OpenAI 同时提升了缓存与推理效率,并将节省直接让利:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。
Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。
OpenAI 宣布免费与 Go 用户可在桌面应用中试用 GPT-6 Luna,即日起开始推送,并附上官方介绍页面链接 openai.com/index/introduc…。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,当天起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户推送。
GPT-6 Sol 与 Luna 基于 Astra 的对齐进展构建,较各自的 GPT-5.6 同类模型有所提升。该消息由 OpenAI 发布,未披露参数规模、benchmark 分数或可用性信息。
OpenAI 面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 与 Codex 中上线 GPT-6 Sol 和 Luna,两款模型同时开放 API。Free 和 Go 用户可在桌面应用试用 GPT-6 Luna。
OpenAI 官方公布 GPT-6 Sol 与 Luna 的开放范围,读者可据此确认不同订阅档位和 API 的可用差异。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款模型,二者基于 GPT-6 Astra 的技术进展,将其中多项能力带入更快、更便宜的模型,以支持规模化工作负载。OpenAI 同时优化了缓存与推理效率,并将节省的成本直接让渡给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。
Opus 5.5 在 Cognition 的 FrontierCode 1.1 基准上取得 Extended 65.3% 的成绩,超越 Fable 5 登顶,且成本仅为后者的一小部分。该基准针对真实工程任务,评估代码的可合并性与质量。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,在大多数任务上达到 Claude Fable 5.1 的水平。其运行成本比 Opus 5 低 40%。AI SDK 表示已可用 AI SDK 调用 Claude Opus 5.5。
Mike Krieger 表示 Anthropic 将在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5,这两款模型将带来与近期发布相近的性能、效率和安全性改进。他同时称今天只是开始,后续还有更多内容。
Anthropic 将在未来数周推出 Claude Sonnet 5.5 和 Haiku 5.5。这两款模型将带来性能、效率与安全方面的多项相同改进。
Anthropic 的 Opus 5.5 经过了广泛的对齐测试,并接受 METR 等外部机构评估,同时针对网络与生物等高风险领域引入了防护措施。
Anthropic 发布 Claude 5.5 系列的首个模型 Claude Opus 5.5,官方称其在编码和知识工作上领先,写作能力也较强。该模型在多数任务上表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。
Anthropic 新模型系列的定价与能力对照信息,可看出成本与性能的取舍方向。
v0 宣布用户现在可以在 v0 中使用 Claude Opus 5.5,并附上试用入口 v0.app/?opus55。引用 Anthropic 的介绍,Claude Opus 5.5 是 Claude 5.5 系列的首个模型,多数任务上表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
Claude 发布 Claude Opus 5.5,这是新 Claude 5.5 系列的首个模型,多数任务表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Alex Albert 表示使用 Opus 5.5 的体验很好,认为它聪明、写作清晰、速度快且成本低得多。
Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型,面向 Pro、Max 和 Team 套餐开放。
Anthropic 宣布 Claude Opus 5.5 今日上线,是其全新 Claude 5.5 家族的首款模型。官方称它在大多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。
原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。
TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
腾讯混元 Hy Image3.5 preview 上线,提供专业级图像生成,人工评测胜率比 Hy Image3.0 高 30%,支持文生图和图生图,最高 2K,一致性更好。API 按每张 0.024 美元计费,参考图不收费,Miora 和 OnSolo 提供两周免费试用。
阿里巴巴在云栖大会推出 Logics-Parsing-V3 开源文档解析模型,通过循环滑动窗口与结构状态传递处理跨页内容,解决表格截断、文本割裂和标题层级错位问题。
Qwen-Image-2.1 获得 Intel OpenVINO 的 Day-0 支持,可在 Intel 硬件上优化运行。该模型以单一开放权重 checkpoint 同时支持图像生成与编辑。Intel Devs 表示已为 Qwen-Image-2.1 提供 Day-0 OpenVINO 支持。
腾讯混元上线 Hy Image3.5 预览版,官方称在人类评估中相较 Hy Image3.0 胜率提升 30%,支持文生图与图生图,最高 2K 分辨率,一致性更好。API 已在腾讯云上线,每张图 0.024 美元,参考图不计费,并提供两周免费试用(仅限 OnSolo 与 Miora)。
腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),一款高性价比专业级生图模型,对比 Hy Image3.0 综合能力提升约 30%。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已上线 Vercel AI Gateway。
Anthropic 的 Claude Opus 5.5 已在 Vercel AI Gateway 上线,模型标识为 anthropic/claude-opus-5.5,支持 1M token 上下文窗口和最多 128K 输出 token,面向智能体编码、长时智能体任务和专业知识工作。
Claude Opus 5.5 上线 Vercel AI Gateway,同时列出两项会导致 400 报错的 API 不兼容变更,便于现有调用方迁移。