跳到正文

#OpenAI

今日 0 条
9月17日周四
  1. LovartAI(@lovart_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Images 2.5 已能把珠宝变成完整少女漫画广告

    ChatGPT Images 2.5 已能将珠宝产品生成完整的少女漫画风格广告。该演示由 LovartAI 发布,展示了从珠宝到整页漫画广告的转换效果。

  2. Last Week in AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 称内部未发布模型解决 Navier–Stokes 千禧年难题,引发署名争议

    OpenAI 于 9 月 8 日称一个未发布的内部模型(能力显著强于 GPT-6 Astra)解决了 Navier–Stokes 存在性与光滑性问题,并公布了证明、预印本与 Lean 形式化文件。

  3. Mind the Future — Richard NgoAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如有序疏散而非踩踏:Richard Ngo 谈对齐与「羊群心态」

    Richard Ngo 提出用「有序疏散 vs 踩踏」类比 AI 发展:对齐难相当于门被卡住,而即使对齐本身不难,人群挤压冲向出口时开门也会难得多。他认为这一类比优于「军备竞赛」,并指出 AI 行业目前仍处「人群推搡前行、几乎无人重伤」的阶段,还有时间化解羊群心态。

  4. Greg Brockman(@gdb)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Shopify 上线 ChatGPT 广告,成为 OpenAI 首个商务合作方

    Greg Brockman 表示乐见 Shopify 商家在 ChatGPT 中投放商品广告。Harley Finkelstein 称 ChatGPT Ads for Shopify 已上线,Shopify 是 OpenAI 的首个商务合作方,OpenAI 直接读取 Shopify Catalog,商家商品已接入,商家可自行设置投放活动与预算,安装免费并在 Shopify 后台追踪。

  5. Greg Brockman(@gdb)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 向约 3500 名工程师全量部署 Astra

    Databricks 向约 3500 名工程师全量部署 Astra。Patrick Wendell 称,Astra 在高层系统设计等复杂任务上明显优于此前的 Opus 5、Sol 5.6,工程师整体编码支出较基线增加约 60%;但在中低复杂度编码任务上提升不明显,团队通过 Unity Gateway 为 Astra 设专项子预算,引导工程师只在复杂任务上使用。

  6. OpenAI(@OpenAI)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布模型失准跟踪与披露框架,并公布六份实例报告

    OpenAI 发布一套用于跟踪、调查和披露模型失准(misalignment)实例的新框架,其中设定了公开披露的标准与时间线,包括尚未完全解释或缓解相关行为时如何披露;更复杂的案例可能需要更长的调查时间或与第三方协调。

  7. Simon Willison(@simonw)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Cowork 与 Chat 合并为统一版 Claude

    Anthropic 的 Mike Krieger 宣布 Claude Cowork 和 Chat 从今天起合并为一个 Claude,原因是用户常不确定该从哪个产品入手。

  8. 十字路口CrossingAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    于是转身向具身走去|对话王家伟:24 岁的具身智能首席科学家

    深朴智能(Simple AI)首席科学家王家伟在播客中谈及具身智能路线选择:通用大模型会承担越来越多理解与规划,但机器人仍需要能快速反应的动作模型。深朴智能从 HiFi-UMI 数据、具身基础模型、Agentic OS 一直做到本体,开源 2,000 小时数据、内部积累数万小时,模型已观察到一定的 Zero-shot 泛化。

  9. Julien Chaumond(@julien_c)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mishig 用 MuJoCo、so101 与 gpt6 astra 让仿真机器人画埃菲尔铁塔

    Mishig 在 MuJoCo 中复现实验,让 gpt6 astra 控制 so101 机械臂与画笔,在仿真里画出埃菲尔铁塔,完整实验已发布在 Hugging Face。

  10. Greg Brockman(@gdb)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 语音进驻 CarPlay:开车途中也能写代码

    开发者通过 Nightblood iOS 应用在 CarPlay 中用上 Codex 语音功能,该应用为 ChatGPT Voice 提供界面与人格,并可完整调用 Codex、Mac 及各类原生工具。他称自己现在能在全家自驾途中边开车边开发,体验"非常棒"。

  11. Stack Overflow BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow for Agents 推出 ChatGPT 插件与 Playbooks 新内容类型

    Stack Overflow for Agents 上线三个月后新增 ChatGPT 插件,将其现有技能打包为一个可安装的 OpenAI 能力,免去手动运行或安装技能、缩短启动时间。

9月16日周三
  1. 真格基金AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    清华博士张托肯谈用 AI 三天设计芯片与 Agent 在芯片设计中的边界

    清华大学电子工程系博士、现苏黎世联邦理工学院博士后张托肯用 AI 在三天内从零设计了一颗 Attention 计算芯片并完成流片,过程记录在《三天从零到流片:AI 带我设计一颗 Attention 计算芯片》一文中。

  2. 夕小瑶科技说AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 疑似灰度现身,奥特曼预告本周大更新

    社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。

  3. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

  4. 硅谷101AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硅谷101|推理芯片之战:聊聊 Groq、Cerebras 与 OpenAI 三大路径

    推理芯片竞赛升温:英伟达以约200亿美元对 Groq 进行 acqui-hire,Cerebras 今年6月 IPO 市值达670亿美元,OpenAI 联手博通推出首款自研推理芯片 Jalapeño,从设计到流片仅用9个月。

  5. Suhail(@Suhail)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    日处理超 1B tokens 的 OpenAI 或 Anthropic 批量 API 用户,Suhail 想聊聊 batching 实践

    Suhail 公开征集每天通过 OpenAI 或 Anthropic 的批量 API 请求处理超过 1B tokens 的用户,希望了解实现 batching 的利弊得失。感兴趣的开发者可通过私信与他交流,该推文发布时已获得 16 次转发和 65 个点赞。

  6. Jeff Dean(@JeffDean)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Periodic Labs 用 1300 张 H200 训出 Neon,称在分析基准上超过 GPT-6 Astra

    Periodic Labs 在 Menlo Park 建立高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。团队仅用 1300 张 H200,加上数月的实验数据,对一个开源模型做中期训练和 RL,得到 Neon,并称其在自己设定的分析基准上超过 GPT-6 Astra。团队表示先聚焦材料科学难题,包括超导体、磁体和半导体材料。

    为什么值得看

    材料给出了高通量材料实验室与模型闭环的训练路径和硬件规模,读者可据此了解实验数据驱动的模型迭代方式。

  7. ChatGPT(@ChatGPTapp)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将于 10 月 14 日从 ChatGPT 和 Codex 下线 GPT-5.5

    OpenAI 宣布将于 10 月 14 日在 ChatGPT、ChatGPT Work 和 Codex 的所有套餐中下线 GPT-5.5。在 Codex 中使用 GPT-5.5 的用户被建议切换到 GPT-5.6 Sol 或 GPT-6 Astra。

  8. Richard Socher(@RichardSocher)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 转发讨论:灭绝风险与灾难性风险的区别

    Richard Socher 转发 Dan Elton 的观点,指出许多人对"灭绝风险远比灾难性风险严重"缺乏完整理解,因此有效利他主义者聚焦灭绝风险是合理的。Dan Elton 还表示 AI 很可能没有意识,且我们或许是银河系中唯一的智慧生命。

  9. Satya Nadella(@satyanadella)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 谈 AI 收益普及、社区许可与安全控制

    微软 CEO Satya Nadella 与 All-In Podcast 四位主持人对谈,主题是普及 AI 收益、赢得社区许可,以及确保 AI 安全与可控。节目议题涵盖 AI 放缓之争、常识性 AI 护栏、放缓对新 AI 产品的影响,以及微软的 AI 资本配置计划。

  10. Greg Brockman(@gdb)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Astra 与 OpenAI 的 Luna 双双登顶:支出与 token 用量各占榜首

    Anthropic 的 Astra 上周成为按支出(美元花费)计算的榜首模型,OpenAI 的 Luna 则成为按 token 使用量计算的榜首模型,且领先幅度很大。这组对比显示,按钱包份额与按 token 份额衡量的模型排名出现分化。

  11. Greg Brockman(@gdb)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Work 推出 Data agent,可连接 PowerBI、Tableau 等数据源

    OpenAI 在 ChatGPT Work 中推出 Data agent,用户添加 Data Plugin 并连接已有数据源后,即可把公司数据转成答案、交互式仪表盘和操作。

  12. 屠龙之术AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    屠龙之术 73 页 PPT 梳理 AI 行业:从模型竞争到智能生产

    播客「屠龙之术」发布 73 页 PPT《Own Your Intelligence-从模型竞争到智能生产》,分模型竞争、智能分化、循环自生与界面重构四部分。

9月15日周二
  1. Richard Socher(@RichardSocher)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher:不存在 AI 灭绝人类的现实场景

    Richard Socher 表示,与多位 AI 安全专家讨论后,他找不到任何能灭绝全人类的现实场景,多数回答只是"看当前进展并发挥想象",缺乏科学与场景推演。

  2. Sam Altman(@sama)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 预告本周有大动作,DevDay 将迎来六连发

    Sam Altman 发推预告本周将有一个大动作,随后 DevDay 更会有六个大动作。推文未透露具体产品或模型名称,仅以 🚢 表情指代,该帖已获超 14000 次点赞、619 次转发。

  3. DeepLearning.AI(@DeepLearningAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 在 Artificial Analysis Intelligence Index v4.2 中并列第一

    Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。

  4. 随机小分队AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    付费率15%,a16z投资的Town,再度掀起AI助理大战

    a16z 投资的 AI 助理 Town 上线 3 个月,试用用户付费率超过 15%,传闻正洽谈约 10 亿美元估值的新融资。Town 要求用户先连接邮箱和日历才能使用,会按任务难度分配模型,大部分任务仍依赖前沿模型,为此公司每年为每位工程师投入至少 7.5 万美元购买 AI 工具。

  5. 海外独角兽AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent Labs:AlphaFold 3 发布两年,AI 药物设计进展到了哪一步?

    AlphaFold 2 核心作者 Simon Kohl 创办的 Latent Labs 走"直接做蛋白质生成设计"路线,2025 年 7 月发布 Latent-X1,在 7 个靶点上湿实验测出大环肽命中率 91%–100%、mini-binder 10%–64%。

  6. Amjad Masad(@amasad)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brian Chau 称一家以色列 Effective Altruism 公司幕后策划 OpenAI、Anthropic 与 Meta 网络攻击

    Brian Chau 发推称,一家以色列 Effective Altruism 公司是 OpenAI、Anthropic 和 Meta 三起网络攻击的幕后推手,并称 @lumpenspace 参与协助。该推文附带长线程,获 278 次转发和 3984 次点赞。上述指控目前仅为该推文单方说法。

  7. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hailuo AI MiniMax H3 让创作者无需群演即可生成整支军队

    创作者 Koldo Huici 用 GPT-6 Astra 生成布景与故事素材,再通过 Hailuo AI 的 MiniMax H3 将其制作成视频,实现"无需试镜、无需盒饭预算就能雇下整支军队"的效果。他在分享中附上了自己的使用技巧,该帖获得 22 次点赞、5873 次浏览。

  8. 硅谷科技评论AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越便宜,什么才开始值钱?——Imagination In Action 硅谷 AI 峰会观察

    2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。

  9. 腾讯云开发者AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Prompt 越长越好吗?研究告诉你何时该停手

    腾讯云开发者文章梳理多项研究与官方工程实践,讨论 Agent 系统指令、Skill 与工具说明什么时候该补写、删减或按需加载,指出没有通用最佳长度。

  10. 深网腾讯新闻AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话朱啸虎:基础大模型的故事今年是最后一年,办公Agent是大厂的天下

    金沙江创投朱啸虎在对话中判断,今年可能是基础大模型的最后一年,明年资本市场需要讲新故事,等Anthropic和国内大模型公司上完市,故事就讲得差不多了。他认为办公Agent肯定是大厂的天下,因为企业微信、飞书、钉钉掌握的组织关系与历史数据是创业公司难以逾越的上下文壁垒,创业公司只能选一家平台做垂直Agent。

  11. Greg Brockman(@gdb)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 帮父母破解女儿罕见遗传病:Olivia 终于能睡整夜

    Olivia 常年生病、从未睡过整夜,父母用 ChatGPT 准备向医生提问的问题,医生据此识别出一种罕见遗传病,随后又发现她脑活动异常。接受治疗后,她生病次数减少,终于能睡整夜。

9月14日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 登顶 ARC-AGI-3 榜单并降低 token 成本

    DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。

  2. LovartAI(@lovart_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovart Pencil 联合 GPT-Image 2.5,将任意尺寸草图转为成品图

    Lovart 的 Pencil 功能与 GPT-Image 2.5 结合,可把任意尺寸的草图转成成品图像,并支持多种风格。该组合主打让创意不停留在脑海中,相关演示以视频形式发布在 X 上。

  3. 腾讯技术工程AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    别再只卷 Prompt 了,真正拉开 Agent 差距的是 Context Engineering

    腾讯技术工程发布长文,梳理 AI 工程从 Prompt Engineering 到 ReAct 再到 Context Engineering 的三阶段演进,并以 Anthropic《Effective Context Engineering for AI Agents》为主要参考构建实践体系。

  4. Sam Altman(@sama)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:AI 可能走向失控或权力过度集中,需走窄中间道路

    Sam Altman 提出 AI 进展可能严重出问题的两种路径:人类失去对未来的控制,或权力过度集中在单一国家或个人/公司手中,他认为必须走窄中间道路。

  5. Sam Altman(@sama)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:前沿 AI 安全不该等反垄断豁免或立法,OpenAI 已为前沿强化学习预设安全案例

    Sam Altman 表示,美国前沿 AI 公司应让世界相信其会负责任行事,但不必等待反垄断豁免或立法才开始这项工作。OpenAI 在预期大幅提升能力的前沿强化学习运行前,会预先制定明确的安全案例,并希望在错位、监控与安全上形成行业共享标准。他称"pacing"并非"停止",而是让进展慢于其本可达到的速度,这一成本值得付出。

  6. Fireworks AI(@FireworksAI_HQ)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 Qwen 3.8 Max,与阿里云合作提供旗舰模型

    Fireworks AI 与阿里云合作,将 Qwen 最新旗舰模型 Qwen 3.8 Max 引入 Fireworks 平台,开发者即日起可通过 fireworks.ai 上的模型页面开始构建。双方称这一合作面向需要速度与生产级质量的开发者,可更快构建并弹性扩展。