Dify 上线 OpenAI GPT-5.6 支持,插件默认协议切换至 Responses API
Dify 现已支持 OpenAI GPT-5.6,可处理多模态输入、精确结构化输出和实时流式响应,并降低复杂执行中的错误。为此 Dify OpenAI 插件完成大版本重写,默认协议从 Chat Completions 切换为 OpenAI 新的 Responses API,将消息、推理、工具调用和执行结果统一到单一流程。
Dify 现已支持 OpenAI GPT-5.6,可处理多模态输入、精确结构化输出和实时流式响应,并降低复杂执行中的错误。为此 Dify OpenAI 插件完成大版本重写,默认协议从 Chat Completions 切换为 OpenAI 新的 Responses API,将消息、推理、工具调用和执行结果统一到单一流程。
Satya Nadella 表示 GPT-5.6 与 Work IQ 于当天接入 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry。他称该组合覆盖多步智能体工作、分析与内容创作,带来更强推理和更高质量输出,同时不牺牲效率。
Poe 宣布上线 OpenAI 的 GPT-5.6 系列,包含 Sol、Terra、Luna 三款模型。据其说明,GPT-5.6-Sol 是 OpenAI 目前最强的模型,面向复杂推理、高级编码和智能体工作流;GPT-5.6-Terra 侧重日常办公、编码、分析与研究的均衡能力;GPT-5.6-Luna 主打快速、低成本,适合高并发和常规任务。
Replicate 上线 OpenAI GPT-5.6,提供 Luna、Terra、Sol 三个版本,对应的模型页面链接已同步公布。
Taranjeet 发布 openmemory v2,一个开源 CLI,用于在 Codex、Claude Code 和 OpenCode 之间迁移编码会话,让上下文随模型走。作者提到 GPT-5.6 正在 Codex 中逐步上线,并引用 OpenAI 消息称 GPT-5.6 家族模型 Sol、Terra、Luna 开始在 ChatGPT、Codex 和 API 中推出。
Vercel 的 AI SDK 新增对 OpenAI 提供商的支持,用户可通过 ai-sdk.dev 的 providers 文档了解接入方式。该消息由 AI SDK 官方账号发布并 @vercel、@OpenAI 和 @OpenAIDevs。
GPT 5.6 现已登陆 Devin 与 Devin Desktop。在 FontierCode 1.1 Extended 上,GPT-5.6 系列以强劲分数与出色成本效率见长,其中 GPT 5.6 Sol 以近乎次优模型一半的成本达到顶级性能。
爆料者 leo 称 GPT-5.6 将是 5.x 系列最后一个模型,OpenAI 决定直接推 GPT-6,并在一个月内(甚至 7 月底)发布。
Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。
Sam Altman 宣布 GPT-5.6 sol 将于周四发布,并附上"happy building"。该推文获得 391 个赞、32 条回复、4 次转发和 64095 次浏览,引发外界讨论 Google 此时相对 OpenAI 的领先之处。
Coinbase 已把编码任务交给 GLM 和 Kimi,费用砍半;视频还讨论了如何用国产模型"白嫖" Claude Code 全生态。中国能把 TOKEN 成本压到海外的 1/5 并免费开放,豆包一宣布收费就被骂"忘记初心",WorkBuddy 和 Trae 也突然爆火。
播客「AI 炼金术」中,徐文浩分享做大项目的 Harness 设计,认为纯 vibe coding 做大项目一定会塌掉,但不该得出 AI 没用的结论,而是要靠一整套基建管理复杂度并持续迭代。
Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。
Lilian Weng 在 Lil'Log 发表长文,系统梳理 harness engineering 与递归自我改进(RSI)的研究脉络。文章把 harness 定义为围绕基座模型、负责编排执行与上下文管理的系统,并归纳出工作流自动化、文件系统作持久记忆、子智能体与后台任务三类设计模式。
微软推出 Frontier Co.,目标是帮每家企业建立自己的 AI 能力,把知识、工作流和判断力转化为可持续自我改进的 AI 系统。其设想的未来企业是一个人类资本与 token 资本共同复利的学习循环,并希望借此形成一个人人可参与的前沿生态。
Epoch AI 的数据分析显示,2026 年 6 月多家机构披露约 1500 个高危和严重级 CVE,超过 Mythos 发布前月度纪录的 3.5 倍。
Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。
晚点聊发布 2026 年 Q2 AI 季报,嘉宾为 MoE Capital 创始合伙人 Henry Yin,围绕推进智能前沿和智能扩散两条脉络回顾本季度进展。
播客讨论 GLM 5.2 是否带来又一个 DeepSeek R1 时刻,并与 Codex 对比:Codex 像按时收费的律师,GLM 是不花钱的大侄子。节目指出 GLM 5.2 最大缺点是"瞎",同时认为 CLI 正成为智能体之间的母语,未来被消灭的不是 GUI,而是 90% 的输入操作本身。
《晚点聊》「具身季报 26Q2」邀请 Alphaist 创始合伙人陈哲盘点本季具身智能 TOP 5 进展:人形机器人马拉松、Figure AI 连续 200 小时直播、中国高自由度灵巧手亮相 ICRA、英伟达 Cosmos 3 世界模型从生成视频转向直接生成动作,以及 π0.7 与 Gen-1 的模型进展。节目还讨论 OpenAI Robotics 团队官宣、世界模型创投热与具身落地节奏。
XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。
METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。
GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。
一条调侃式评论指出,GPT-5.6 越早发布,人们就能越早开始讨论 GPT-5.7,借此吐槽模型版本迭代节奏过快。该帖获得 7 条回复、2 次转发和 81 个点赞,浏览量约 1.1 万。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。
6 月 20 日,Junyang Lin(@JustinLin610)发帖吐槽 Codex 这几天表现很笨,该帖获 102 个点赞、2 次转发、23 条回复,浏览量 93359。帖中未给出具体版本号、参数或 benchmark 数据,也未说明问题原因。
Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。
NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。
SpaceX 宣布行使选择权,以全股票交易收购 Cursor,目标是打造全球最实用的 AI 模型。过去几个月 SpaceXAI 一直在与 Cursor 联合训练一个模型,即将在 Cursor 和 Grok Build 中发布。
硅谷华人创业者 Shane 创立 Animotion Robotics,想做外表像迪士尼动画、内部由模型驱动的仿生机器人,能察言观色并拥有自己的性格。其上一份创业曾为特斯拉、OpenAI 做情绪模型训练,新机器人采用模块化人脸结构,用户可自行更换眼睛、鼻子、耳朵,第一代 IP 名为伊洛瓦。产品由 8 个子模型并联模拟认知,记忆、性格与灵魂承载在芯片上,数据不上传云端,先通过社区预售推进。
高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。
Anthropic 推出的 Claude Design 能凭一句话生成高精度可交互原型,而 Codex 迟迟没有同类产品,原因是 GPT-5.5 的模型能力还扛不住这个活。作者指出 Claude Design 与 Codex 属于 Harness 产品层,真正的差距在模型层:可交互原型要求模型在画 UI 前先想清数据结构与状态管理,目前只有 Claude Opus 4.8 做到了。
财经作家沈帅波在播客「知行小酒馆」讨论 AI 崛起后自媒体行业的变化:AI 可写文案、做图片、生成视频,有人用它同时运营几十个账号。他认为追热点的门槛已不是写作水平,而是能否搭起「内容工厂」,平台算法则是黑盒,规律和打法往往很快失效。
Epoch AI 汇总约十五个网络安全基准构建 Cyber-ECI,评估 Anthropic Claude Mythos 系列在攻防能力上的真实位置。
Citrini Research 发布 2026 年 6 月《State of the Themes》,指出市场叙事已从 tokenmaxxing 转向 tokenpanic:agent 与更强推理模型推动 token 用量激增,但成本压力随之爆发,Uber 四个月烧完全年 AI 预算、Anthropic ARR 自年初增长 5 倍至 5 月达 450 亿美元。
锦秋基金合伙人臧天宇、郑晓超在播客中复盘 2026 上半年 AI 行业,用「重估」与「世界模型」概括,并梳理三场模型战争:OpenAI vs Anthropic vs Google、视频模型的「GPT-3 时刻」、具身智能的 VLA 与世界模型路线之争。对创业者,核心问题是中国还是美国、以及模型吞噬应用下垂类 AI 的活路。
谷歌在 Google I/O 2026 上缺席 Gemini 3.5 Pro、未更新 Veo,被外界视为遗憾,但极客公园播客邀请亲赴现场的 Bryan Liu 与作者 Alan 解读这场发布会背后的野心。节目指出谷歌把模型分成「干活的」和「思考的」,并借 Gemini Spark、Gemini 重写操作系统及谷歌眼镜,展现将讲故事权利还给所有人、成为用户「外置大脑」的方向。
OpenAI 和 Anthropic 开始组建团队、把 AI Forward Deployed Engineer(FDE)派驻到客户组织内,推动这一岗位在硅谷复兴。FDE 需兼具技术、沟通乃至业务能力,负责把现成 LLM 定制成贴合客户需求的智能体工作流。吴恩达认为 AI Engineer 的岗位数量将远超 FDE,因为企业更愿意让自家员工做项目,且厂商中立的 FDE 难以寻找。
有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。
播客《枫言枫语》第 167 期盘点近期科技新闻:OpenAI 与微软终止独家合作,Anthropic 的 Project Glasswing 发现大量高危漏洞,企业面临大模型 Token 成本压力。