跳到正文

#OpenAI

今日 0 条
9月23日周三
  1. Guillermo Rauch(@rauchg)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍

    最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。

  2. Augment Code(@augmentcode)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 GPT-6 Sol 与 Luna 上线 Cosmos

    Augment Code 宣布 OpenAI 的 GPT-6 Sol 与 Luna 已在 Cosmos 中可用。该公司表示将在未来几天把全部工作流从 GPT-5.6 系列模型升级到新模型,并评估其对软件工厂的影响。

  3. Sam Altman(@sama)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 澄清此前所指为语音而非视频

    Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。

  4. Simon Willison(@simonw)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:GPT-6 Luna 价格仅为 5.6 Luna 的一半

    Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。

  5. AI SDK(@aisdk)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 新增 OpenAI 与 Vercel 相关支持,详情见 ai-sdk.dev

    AI SDK 官方账号 @aisdk 发布指向 ai-sdk.dev/providers/ai-sdk 的文档链接,并 @OpenAI、@OpenAIDevs 与 @vercel 三个账号。该帖未披露具体的模型版本、功能范围或上线时间,仅提示前往文档页面了解更多。

  6. AI SDK(@aisdk)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,将 Astra 的多数能力带入更快、更便宜的模型以支持规模化使用。官方称同时提升了缓存与推理效率,并将节省的成本直接传导给用户:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。AI SDK 同步发推介绍可在 AI SDK 中使用这两款模型。

  7. Perplexity(@perplexity_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 上线 Perplexity 与 Computer,并成为 Computer 默认 Light 选项

    GPT-6 Sol 已在 Perplexity 和 Computer 中上线,同时成为 Computer 努力程度选择器中的默认 Light 选项。该消息由 Perplexity 官方账号发布。

  8. Lovable(@lovable_dev)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 接入 Claude Opus 5.5 与 GPT-6 Sol 两个新模型,并支持 Fable 5.1

    Lovable 宣布其构建能力现由 Claude Opus 5.5 和 GPT-6 Sol 两个新模型驱动,用户无需自行选择用哪个模型。Lovable 会对每个新模型进行测试、调优并决定路由方式,以保证构建效果最佳,同时平台也已支持 Fable 5.1 构建。

  9. Greg Brockman(@gdb)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两款模型基于 GPT-6 Astra 背后的进展,把其在专业工作、事实性、编码、计算机使用和对齐方面的能力带入更快、更便宜的版本,以支持规模化工作。OpenAI 同时提升了缓存与推理效率,并把节省直接让给用户:Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 Sol 与 Luna 两款更快更便宜的模型,并给出 API 价格降幅,便于判断成本与能力取舍。

  10. Sam Altman(@sama)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:初创公司天然擅长快速组队,大公司要保持这一点很难

    Sam Altman 认为,初创公司天然擅长围绕最关键的事快速集结精干团队,大公司要保持这种能力则很难,且这是一个尚未被充分探索的领域。他引述 Pranav 的观点称,OpenAI 的超能力正是在任何时间点都能迅速组建一支被充分授权的强能力团队,不讲究组织架构线,从而保持灵活、抓住机会并从错误中恢复。

  11. Sam Altman(@sama)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称赞 Michelle Pokrass 在 OpenAI 四年,预告新项目

    Sam Altman 发推祝贺 Michelle Pokrass 在 OpenAI 满四年,称 OpenAI 幸运受益于她所做的一切,并表示人们会很高兴看到她和团队接下来在做的东西。他形容 OpenAI 的特别之处在于每三个月就像一家新公司,团队不断做出高信念、反共识的押注,且大多正确,他也期待分享当前正在酝酿的一些押注。

  12. GitHub(@github)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 上线 GPT-6 Sol 与 GPT-6 Luna 两款模型

    GitHub 宣布 GitHub Copilot 的 GPT-6 系列新增两款模型并正式开放使用。GPT-6 Sol 定位为兼顾交互与智能体编码的均衡模型,GPT-6 Luna 则是面向较小任务的轻量低成本模型,为该系列中成本最低的选项。用户可在 GitHub Copilot 应用或 code 中使用。

  13. Sam Altman(@sama)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 预告下周有开发者相关消息

    Sam Altman 发推称"We ❤️ developers. See you next week.",预告下周将有面向开发者的消息公布,但未透露具体产品或版本细节。

  14. Sam Altman(@sama)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:筹备 DevDay 首次出现"要发布的东西太多了"

    Sam Altman 称,筹备这届 DevDay 是他印象中 OpenAI 历史上第一次说出"要发布的东西太多了"。该表态来自其个人账号,未透露具体发布内容或数量。

  15. Sam Altman(@sama)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI API 目标:在每个价位和每种模态上提供最佳模型

    OpenAI 称要让 OpenAI API 在每个价位点都提供最佳模型,并在文本、代码、图像、视频等每种模态上做到最好,希望用户基于此提出好想法并构建产品。该表述未给出具体的模型名称、版本号或发布时间。

  16. Sam Altman(@sama)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称 GPT-6 Sol 和 Luna 在多项能力上较 5.6 家族大幅提升

    Sam Altman 表示 GPT-6 Sol 和 Luna 相比 5.6 家族前代,在智能、对齐、工作产出、编码和计算机操作等方面都有大幅提升,每 token 价格减半,按任务计费则更低。他还称若按每任务价格这一应当关键的指标衡量,市场上没有可竞争的产品,并希望人们能大量使用 AI。

  17. Sam Altman(@sama)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:GPT-6 Sol 与 Luna 在智能、对齐、代码等能力上大幅超越 5.6 系列,价格减半

    Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。

  18. Sam Altman(@sama)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 模型

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,称两款模型基于 GPT-6 Astra 的技术进展,把其部分优势带到更快、更便宜的模型中,以支持规模化工作。OpenAI 表示缓存与推理效率也有提升,Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    这条信息给出了新模型的定位与 API 价格降幅,可据此了解 GPT-6 系列在速度与成本上的取舍。

  19. Jerry Liu(@jerryjliu0)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两者基于 GPT-6 Astra 的技术积累,把其部分能力下放到更快、更便宜的模型以支持规模化使用。OpenAI 同时提升了缓存与推理效率,并将节省直接让利:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

  20. Cognition(@cognition_labs)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 评测:GPT-6 Sol 比 GPT-5.6 Sol 少读约 17% 上下文

    Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。

  21. Cognition(@cognition_labs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 与 Luna 接入 Devin,FrontierCode 1.1 上成本最高降约 75%

    GPT-6 Sol 和 Luna 已在 Devin 上线。在 FrontierCode 1.1 上,GPT-6 Sol 与 GPT-5.6 Sol 得分持平,但每任务成本低 61%;GPT-6 Luna 得分高于 GPT-5.6 Luna,成本约为后者的四分之一,每任务低于 $0.10,是该榜单上最便宜的模型。

  22. ChatGPT(@ChatGPTapp)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向免费与 Go 用户开放 GPT-6 Luna 桌面端

    OpenAI 宣布免费与 Go 用户可在桌面应用中试用 GPT-6 Luna,即日起开始推送,并附上官方介绍页面链接 openai.com/index/introduc…。

  23. ChatGPT(@ChatGPTapp)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,面向 ChatGPT Work 和 Codex 推送

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,当天起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户推送。

  24. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 与 Luna 延续 Astra 对齐进展,较 GPT-5.6 同类模型提升

    GPT-6 Sol 与 Luna 基于 Astra 的对齐进展构建,较各自的 GPT-5.6 同类模型有所提升。该消息由 OpenAI 发布,未披露参数规模、benchmark 分数或可用性信息。

  25. OpenAI(@OpenAI)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT Work 与 Codex 上线 GPT-6 Sol 和 Luna

    OpenAI 面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 与 Codex 中上线 GPT-6 Sol 和 Luna,两款模型同时开放 API。Free 和 Go 用户可在桌面应用试用 GPT-6 Luna。

    为什么值得看

    OpenAI 官方公布 GPT-6 Sol 与 Luna 的开放范围,读者可据此确认不同订阅档位和 API 的可用差异。

  26. OpenAI(@OpenAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 提高使用额度并降低价格,给用户更多迭代空间

    OpenAI 宣布提高使用额度并降低价格,让用户有更大灵活性和更多迭代余地。该消息未披露具体的模型名称、额度数值或降价幅度。

  27. OpenAI(@OpenAI)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款模型,二者基于 GPT-6 Astra 的技术进展,将其中多项能力带入更快、更便宜的模型,以支持规模化工作负载。OpenAI 同时优化了缓存与推理效率,并将节省的成本直接让渡给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

  28. Lovable(@lovable_dev)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 现已接入 GPT-6 Sol,0-to-1 构建基准全面超越 GPT-5.6 Sol

    Lovable 现已支持使用 GPT-6 Sol 构建应用。在其 0-to-1 构建基准上,GPT-6 Sol 在每个 effort level 下得分比 GPT-5.6 Sol 高 6% 至 12%,其中意图对齐(理解需求)提升 10% 至 15%,设计基础能力提升 8% 至 10%。

  29. OpenAI(@OpenAI)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 提出支持独立评估的四大重点方向与原则

    OpenAI 表示将支持第三方独立评估,在训练、评估和部署各环节提供深度访问权限,让评估者能够质疑其假设、发现可能遗漏的风险,并自行判断其安全防护措施的有效性。OpenAI 同时列出四个优先推进深度评估的方向,以及保障评估严谨、安全和独立的原则。

  30. mem0(@mem0ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DolphinBench 公布 Hermes 与 Claude Code 两套测试框架下 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 的官方结果

    DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。

9月22日周二
  1. Sam Altman(@sama)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 提议让 AI 实验室之外的人参与技术发展决策

    Sam Altman 提出,AI 实验室之外的人应对技术发展有真正发言权,并有明确方式判断其是否安全推进。标准应帮助防止权力集中,确保新公司和开源模型公司能够竞争,同时让各国和企业比对证据、从失败中学习。他认为美国应主导这一进程,并附上了 OpenAI 的完整提议。

  2. AI科技大本营AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    “当年在 OpenAI 像在疯人院”:Jev 作者 Diogo Almeida 访谈谈反叛 RLHF 与可编程 AI

    前 OpenAI 核心研究员、TypeSafe AI 创始人 Diogo Almeida 在播客 Latent Space 完整访谈中,解释其新模型 Jev 为何完全不做文本生成,只向程序输出带概率和置信度的决策,并以代码作为唯一消费者。

  3. 硅谷101AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理芯片之战:Groq、Cerebras与OpenAI三大路径及Bill Dally的设计哲学

    硅谷101对话两位AI芯片创业者,拆解推理芯片三条路径:英伟达约200亿美元与Groq达成技术授权并吸纳Jonathan Ross等核心团队,Cerebras今年6月IPO市值达670亿美元,OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。

  4. Founder ParkAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 创始人 Diogo Almeida 谈为何做只做判断的 System 1 模型

    TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。

  5. 海外独角兽AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?

    拾象整理了一场与来自多家模型厂商的 AI Researchers 的线下闭门交流,讨论 Astra 的 Computer Use、RSI、模型蒸馏和训练数据等方向,保留其中的共识与分歧。

  6. 51CTO技术栈AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI教父辛顿:模型出问题现在还靠内部员工爆料,AI工程师最先失去的可能是说"不"的权力

    辛顿在CNN访谈中表示,外界目前基本依靠内部员工爆料才能知道模型在哪些地方出了问题,他支持独立机构进入头部AI公司验证模型开发与测试过程。CNN调查指出,AI人才稀缺让研究人员当下拥有公开质疑公司和要求暂停发布的筹码,但当AI能参与生成训练数据、编写评测和改进下一代模型时,这种话语权可能被压缩。辛顿认为"关机键"只能应对部分风险,真正的问题是谁有权按下它。

  7. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 组建数学家独立顾问组,规范 AI 数学成果的发布与评估

    OpenAI 正与一个由数学家组成的独立顾问组合作,以负责任地分享 AI 与数学领域的进展。该顾问组将就如何评估和传达新的数学成果、维护学术与职业标准、以及构建支持数学研究与学习的工具提供建议。OpenAI 表示希望数学家处于核心位置,共同塑造 AI 如何支持数学理解并让更广泛社区受益。

  8. 深思圈AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z合伙人Josh Elman:10亿美元消费级AI App背后的产品逻辑

    a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。

  9. Epoch AIAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 推理成本每季度下降约 47%,快于 DNA 测序与算力

    Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。

  10. Vercel NewsAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6 Sol 与 GPT-6 Luna 上线 Vercel AI Gateway

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已上线 Vercel AI Gateway。