跳到正文

#OpenAI

今日 70 条
7月10日周五
  1. Dify(@dify_ai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 上线 OpenAI GPT-5.6 支持,插件默认协议切换至 Responses API

    Dify 现已支持 OpenAI GPT-5.6,可处理多模态输入、精确结构化输出和实时流式响应,并降低复杂执行中的错误。为此 Dify OpenAI 插件完成大版本重写,默认协议从 Chat Completions 切换为 OpenAI 新的 Responses API,将消息、推理、工具调用和执行结果统一到单一流程。

  2. Satya Nadella(@satyanadella)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 携 Work IQ 接入 Copilot Chat、M365、GitHub 与 Foundry

    Satya Nadella 表示 GPT-5.6 与 Work IQ 于当天接入 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry。他称该组合覆盖多步智能体工作、分析与内容创作,带来更强推理和更高质量输出,同时不牺牲效率。

  3. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 OpenAI GPT-5.6 系列:Sol、Terra、Luna

    Poe 宣布上线 OpenAI 的 GPT-5.6 系列,包含 Sol、Terra、Luna 三款模型。据其说明,GPT-5.6-Sol 是 OpenAI 目前最强的模型,面向复杂推理、高级编码和智能体工作流;GPT-5.6-Terra 侧重日常办公、编码、分析与研究的均衡能力;GPT-5.6-Luna 主打快速、低成本,适合高并发和常规任务。

  4. Replicate(@replicate)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replicate 上线 OpenAI GPT-5.6 的 Luna、Terra、Sol 三个版本

    Replicate 上线 OpenAI GPT-5.6,提供 Luna、Terra、Sol 三个版本,对应的模型页面链接已同步公布。

  5. Taranjeet(@taranjeetio)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    openmemory v2 发布:开源 CLI 支持跨 Codex、Claude Code 和 OpenCode 迁移编码会话

    Taranjeet 发布 openmemory v2,一个开源 CLI,用于在 Codex、Claude Code 和 OpenCode 之间迁移编码会话,让上下文随模型走。作者提到 GPT-5.6 正在 Codex 中逐步上线,并引用 OpenAI 消息称 GPT-5.6 家族模型 Sol、Terra、Luna 开始在 ChatGPT、Codex 和 API 中推出。

  6. AI SDK(@aisdk)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 与 OpenAI 合作:AI SDK 新增 OpenAI 提供商支持

    Vercel 的 AI SDK 新增对 OpenAI 提供商的支持,用户可通过 ai-sdk.dev 的 providers 文档了解接入方式。该消息由 AI SDK 官方账号发布并 @vercel、@OpenAI 和 @OpenAIDevs。

  7. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 5.6 现已上线 Devin Desktop

    GPT 5.6 现已登陆 Devin 与 Devin Desktop。在 FontierCode 1.1 Extended 上,GPT-5.6 系列以强劲分数与出色成本效率见长,其中 GPT 5.6 Sol 以近乎次优模型一半的成本达到顶级性能。

7月9日周四
  1. 稀土掘金技术社区AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    爆料称 OpenAI 可能跳过 5.x 直接推 GPT-6,一个月内发布

    爆料者 leo 称 GPT-5.6 将是 5.x 系列最后一个模型,OpenAI 决定直接推 GPT-6,并在一个月内(甚至 7 月底)发布。

  2. Scott Wu(@ScottWu46)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-1.7,推理速度达 1000 tok/s

    Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。

7月8日周三
  1. AI Breakfast(@AiBreakfast)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 凭什么在这个发布后领先 OpenAI?

    Sam Altman 宣布 GPT-5.6 sol 将于周四发布,并附上"happy building"。该推文获得 391 个赞、32 条回复、4 次转发和 64095 次浏览,引发外界讨论 Google 此时相对 OpenAI 的领先之处。

  2. 人民公园说AIAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用什么Fable 5?都给我去用国产模型!当顶级模型变奢侈品,普通人怎么用 AI?

    Coinbase 已把编码任务交给 GLM 和 Kimi,费用砍半;视频还讨论了如何用国产模型"白嫖" Claude Code 全生态。中国能把 TOKEN 成本压到海外的 1/5 并免费开放,豆包一宣布收费就被骂"忘记初心",WorkBuddy 和 Trae 也突然爆火。

7月7日周二
  1. AI炼金术AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    徐文浩拆解做大项目的 Harness 设计:纯 Vibe Coding 做大项目一定会塌

    播客「AI 炼金术」中,徐文浩分享做大项目的 Harness 设计,认为纯 vibe coding 做大项目一定会塌掉,但不该得出 AI 没用的结论,而是要靠一整套基建管理复杂度并持续迭代。

  2. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象

    Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。

7月4日周六
  1. Lilian Weng — Lil’LogAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 长文梳理 Harness Engineering 与自我改进研究

    Lilian Weng 在 Lil'Log 发表长文,系统梳理 harness engineering 与递归自我改进(RSI)的研究脉络。文章把 harness 定义为围绕基座模型、负责编排执行与上下文管理的系统,并归纳出工作流自动化、文件系统作持久记忆、子智能体与后台任务三类设计模式。

7月2日周四
  1. Satya Nadella(@satyanadella)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Frontier Co.:让企业把知识与工作流变成自有 AI 系统

    微软推出 Frontier Co.,目标是帮每家企业建立自己的 AI 能力,把知识、工作流和判断力转化为可持续自我改进的 AI 系统。其设想的未来企业是一个人类资本与 token 资本共同复利的学习循环,并希望借此形成一个人人可参与的前沿生态。

  2. Epoch AIAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:Claude Mythos 发布后披露的高危 CVE 数量上涨 3.5 倍

    Epoch AI 的数据分析显示,2026 年 6 月多家机构披露约 1500 个高危和严重级 CVE,超过 Mythos 发布前月度纪录的 3.5 倍。

  3. Epoch AIAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4 在 ECI 榜首停留时间远超其他任何模型

    Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。

  4. 晚点聊 LateTalkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与 Henry 的 AI 季报 26Q2:从 coding 到 RSI,强者愈强的未来?

    晚点聊发布 2026 年 Q2 AI 季报,嘉宾为 MoE Capital 创始合伙人 Henry Yin,围绕推进智能前沿和智能扩散两条脉络回顾本季度进展。

6月30日周二
  1. 人民公园说AIAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 + Codex 实现 Token 自由?CLI 成智能体母语后 GUI 会被消灭吗

    播客讨论 GLM 5.2 是否带来又一个 DeepSeek R1 时刻,并与 Codex 对比:Codex 像按时收费的律师,GLM 是不花钱的大侄子。节目指出 GLM 5.2 最大缺点是"瞎",同时认为 CLI 正成为智能体之间的母语,未来被消灭的不是 GUI,而是 90% 的输入操作本身。

6月29日周一
  1. 晚点聊 LateTalkAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    晚点聊具身季报 26Q2:英伟达 Cosmos 3、Figure 直播、π0.7 与 Gen-1 进展

    《晚点聊》「具身季报 26Q2」邀请 Alphaist 创始合伙人陈哲盘点本季具身智能 TOP 5 进展:人形机器人马拉松、Figure AI 连续 200 小时直播、中国高自由度灵巧手亮相 ICRA、英伟达 Cosmos 3 世界模型从生成视频转向直接生成动作,以及 π0.7 与 Gen-1 的模型进展。节目还讨论 OpenAI Robotics 团队官宣、世界模型创投热与具身落地节奏。

6月26日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    XLANG NLP Lab 发布 OSWorld 2.0,评测长时程计算机操作智能体

    XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。

  2. METRAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 GPT-5.6 Sol 部署前评估:作弊率高于此前所有公开模型

    METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。

6月25日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 与 Kimi K2.7 在 FrontierCode Extended 上分别得分 43.0% 和 39.5%

    GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。

6月22日周一
  1. AI Breakfast(@AiBreakfast)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 越早发布,越早能开始聊 GPT-5.7

    一条调侃式评论指出,GPT-5.6 越早发布,人们就能越早开始讨论 GPT-5.7,借此吐槽模型版本迭代节奏过快。该帖获得 7 条回复、2 次转发和 81 个点赞,浏览量约 1.1 万。

  2. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。

6月20日周六
  1. Junyang Lin(@JustinLin610)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 近几日为何这么笨

    6 月 20 日,Junyang Lin(@JustinLin610)发帖吐槽 Codex 这几天表现很笨,该帖获 102 个点赞、2 次转发、23 条回复,浏览量 93359。帖中未给出具体版本号、参数或 benchmark 数据,也未说明问题原因。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

  2. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 ENPIRE:让 Codex 智能体驱动机器人自主实验

    NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。

6月16日周二
  1. Aman Sanger(@amanrsanger)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceX 行使选择权以全股票交易收购 Cursor

    SpaceX 宣布行使选择权,以全股票交易收购 Cursor,目标是打造全球最实用的 AI 模型。过去几个月 SpaceXAI 一直在与 Cursor 联合训练一个模型,即将在 Cursor 和 Grok Build 中发布。

  2. 开始连接LinkStartAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从迪士尼机器人到 OpenAI 情绪模型:Animotion Robotics 创始人 Shane 想做有「生命感」的仿生机器人

    硅谷华人创业者 Shane 创立 Animotion Robotics,想做外表像迪士尼动画、内部由模型驱动的仿生机器人,能察言观色并拥有自己的性格。其上一份创业曾为特斯拉、OpenAI 做情绪模型训练,新机器人采用模块化人脸结构,用户可自行更换眼睛、鼻子、耳朵,第一代 IP 名为伊洛瓦。产品由 8 个子模型并联模拟认知,记忆、性格与灵魂承载在芯片上,数据不上传云端,先通过社区预售推进。

  3. 晚点聊 LateTalkAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    访谈 Cerebras 早期投资人周楠:英伟达挑战者、Scaling Law 的萌芽与被遗忘的百度美研

    高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。

6月13日周六
  1. 宝玉的分享AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为啥 Codex 还不推出类似 Claude Design 的产品?

    Anthropic 推出的 Claude Design 能凭一句话生成高精度可交互原型,而 Codex 迟迟没有同类产品,原因是 GPT-5.5 的模型能力还扛不住这个活。作者指出 Claude Design 与 Codex 属于 Harness 产品层,真正的差距在模型层:可交互原型要求模型在画 UI 前先想清数据结构与状态管理,目前只有 Claude Opus 4.8 做到了。

6月12日周五
  1. 知行小酒馆AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话沈帅波:AI 时代,普通人从零做自媒体还有机会吗?

    财经作家沈帅波在播客「知行小酒馆」讨论 AI 崛起后自媒体行业的变化:AI 可写文案、做图片、生成视频,有人用它同时运营几十个账号。他认为追热点的门槛已不是写作水平,而是能否搭起「内容工厂」,平台算法则是黑盒,规律和打法往往很快失效。

6月11日周四
  1. Epoch AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 分析:Mythos 的网络安全能力被高估了吗?

    Epoch AI 汇总约十五个网络安全基准构建 Cyber-ECI,评估 Anthropic Claude Mythos 系列在攻防能力上的真实位置。

6月8日周一
  1. Citrini ResearchAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 发布 2026 年 6 月主题投资报告:从 tokenmaxxing 转向 tokenpanic

    Citrini Research 发布 2026 年 6 月《State of the Themes》,指出市场叙事已从 tokenmaxxing 转向 tokenpanic:agent 与更强推理模型推动 token 用量激增,但成本压力随之爆发,Uber 四个月烧完全年 AI 预算、Anthropic ARR 自年初增长 5 倍至 5 月达 450 亿美元。

  2. 开始连接LinkStartAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    锦秋基金复盘 2026 上半年 AI:硅谷大转弯、模型吞噬应用与创业者的真机会

    锦秋基金合伙人臧天宇、郑晓超在播客中复盘 2026 上半年 AI 行业,用「重估」与「世界模型」概括,并梳理三场模型战争:OpenAI vs Anthropic vs Google、视频模型的「GPT-3 时刻」、具身智能的 VLA 与世界模型路线之争。对创业者,核心问题是中国还是美国、以及模型吞噬应用下垂类 AI 的活路。

6月4日周四
  1. 开始连接LinkStartAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌还在追赶 OpenAI 和 Anthropic?这是 Google I/O 2026 最大的误读

    谷歌在 Google I/O 2026 上缺席 Gemini 3.5 Pro、未更新 Veo,被外界视为遗憾,但极客公园播客邀请亲赴现场的 Bryan Liu 与作者 Alan 解读这场发布会背后的野心。节目指出谷歌把模型分成「干活的」和「思考的」,并借 Gemini Spark、Gemini 重写操作系统及谷歌眼镜,展现将讲故事权利还给所有人、成为用户「外置大脑」的方向。

6月1日周一
  1. Andrew Ng(@AndrewYNg)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达谈 AI Forward Deployed Engineer:FDE 岗位复兴,但 AI Engineer 需求更大

    OpenAI 和 Anthropic 开始组建团队、把 AI Forward Deployed Engineer(FDE)派驻到客户组织内,推动这一岗位在硅谷复兴。FDE 需兼具技术、沟通乃至业务能力,负责把现成 LLM 定制成贴合客户需求的智能体工作流。吴恩达认为 AI Engineer 的岗位数量将远超 FDE,因为企业更愿意让自家员工做项目,且厂商中立的 FDE 难以寻找。

  2. 强少来了AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.169(2026.06.01):Codex国内也能畅快用,亲测有效

    有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。

5月28日周四
  1. 枫言枫语AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    枫言枫语 Vol. 167:Token 如流水,Agent 似朝阳

    播客《枫言枫语》第 167 期盘点近期科技新闻:OpenAI 与微软终止独家合作,Anthropic 的 Project Glasswing 发现大量高危漏洞,企业面临大模型 Token 成本压力。