跳到正文

#OpenAI

今日 0 条
9月30日周三
  1. Cognition(@cognition_labs)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 上线 Devin,FrontierCode 1.1 得分 60.4%

    GPT-6.1 Sol 已在 Devin 上线,在 FrontierCode 1.1 上得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但成本大幅降低。中等推理强度下每任务花费 $0.31,比 GPT-6 Sol 最高推理强度低 81%。

  2. Justine Moore(@venturetwins)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 现已全面上云

    Codex 现已完全运行在云端。此前用户需把笔记本放在车内地板上并接充电宝才能维持运行。该消息由 Justine Moore 发布,互动数据显示浏览量约 19900。

  3. GitHub(@github)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 在 GitHub Copilot 全面可用

    OpenAI 的 GPT-6.1 Sol 已在 GitHub Copilot 中全面可用,可用于智能体编码和终端工作流,多步编码表现较强。GitHub 称早期测试中它可靠完成任务,所用 token 和步骤明显少于 GPT-6 与 GPT-5.6 系列模型。该模型可在 GitHub Copilot 应用、CLI 和 @code 中试用。

  4. Runway(@runwayml)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 作为首发伙伴加入 OpenAI Marketplace

    Runway 以首发合作伙伴身份加入 OpenAI Marketplace,即日起用户可在该平台使用其图像、视频、音频和编辑模型,并可将部分 OpenAI 承诺额度用于 Runway 购买。

  5. OpenAI(@OpenAI)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 升级 Codex Security Cloud,默认接入 Daybreak Blue 网络安全模型

    OpenAI 宣布 Codex Security Cloud 迎来重大升级,默认通过 Daybreak Blue 接入具备网络安全能力的模型。该功能可扫描整个 GitHub 仓库、持续审查新提交、调查并去重发现的问题,并准备好待审核的修复方案,即使笔记本处于关闭状态也能运行。目前以插件形式在 Codex 桌面端和网页端提供。

  6. ChatGPT(@ChatGPTapp)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出 Space 与可协作 pages 文档功能

    ChatGPT 上线 Space,定位为团队与 AI 协作创建内容的空间,其中 pages 是可包含图表、图片、清单和仪表盘的交互式文档,ChatGPT 能根据任务或对话上下文自动生成。

  7. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

  8. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向 ChatGPT Work 和 Codex 付费用户开放 GPT-6.1 Sol

    OpenAI 宣布 GPT-6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。官方同时给出了介绍页面链接 openai.com/index/introduc…。

    为什么值得看

    OpenAI 公布 GPT-6.1 Sol 面向各付费档位开放,读者可据此了解新模型的可用范围。

  9. OpenAI(@OpenAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,缓存输入降价至每百万 token 0.10 美元

    OpenAI 发布 GPT-6.1 Sol,主打更可负担的前沿智能,供开发者规模化构建和运行应用。缓存输入价格为每百万 token 0.10 美元,比标准输入定价低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。

  10. OpenAI(@OpenAI)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 称 GPT-6.1 Sol 对齐评测表现优于 GPT-6 Sol

    OpenAI 表示,GPT-6.1 Sol 在自家对齐评测中较 GPT-6 Sol 有明显改进,表现更接近 GPT-6 Astra。它在说明自身局限时更透明,在遵循用户意图和安全约束方面也更可靠。

  11. OpenAI(@OpenAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,多项基准接近 GPT-6 Astra 且成本更低

    OpenAI 宣布 GPT-6.1 Sol 发布,称其在编码、computer use 和复杂专业工作上相较 GPT-6 Sol 有显著升级。该模型在多项基准上接近 GPT-6 Astra,同时成本大幅更低。

  12. OpenAI(@OpenAI)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格提供接近 Astra 的智能

    OpenAI 发布 GPT-6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平,是当前同等性能下最具成本效益的模型。原文未给出具体价格、跑分或可用范围等细节。

  13. OpenAI(@OpenAI)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 全端上线 Dots,面向 Pro、Business Premium 与 Enterprise 用户开放

    OpenAI 宣布 Dots 将在 ChatGPT 网页版、移动端和桌面端上线,覆盖符合条件的 Pro、Business Premium 和 Enterprise 用户。用户可在 ChatGPT 桌面应用或桌面浏览器中创建第一个 dot,连接自己的应用后由它进行自我介绍。

  14. OpenAI(@OpenAI)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出由 GPT-6 Astra 驱动的 dots 智能体

    OpenAI 推出 dots,一款由 GPT-6 Astra 驱动的常驻在线 AI 智能体,主打处理各类任务的能力。原文仅说明其"能力出众、始终在线",未披露参数规模、上下文长度或可用方式等细节。

  15. OpenAI(@OpenAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 介绍 dot 的权限边界与控制机制

    OpenAI 公布 dot 的控制机制:用户可设定边界,指定 dot 能自主执行、需先询问以及绝不能做的事。dot 运行在独立云计算机上,安全内置于其中,连接哪些应用由用户自行选择,因此接入并非必需。

  16. OpenAI(@OpenAI)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出可跨 4000+ 应用自主工作的智能体

    OpenAI 宣布推出一款具备高主动性工程师或幕僚长能力的智能体,可处理订餐等简单事务,也能承接更具挑战性的工作。该智能体拥有自己的计算机,通过 ChatGPT 使用用户连接的插件,可跨 4000+ 应用工作,并能学习用户需求、在用户开口前就在后台 24/7 静默执行任务。

  17. The Rundown AI(@TheRundownAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出 Space 与 Pages 协作功能

    ChatGPT 推出 Space 和 Pages:Space 是团队、dot 与 ChatGPT 基于同一知识库协作的共享空间,Pages 是用户与智能体共同编辑的共享文档,ChatGPT 的全部能力都能在 page 内使用。该功能正向 Pro、Business 和 Enterprise 版本推送。

  18. The Rundown AI(@TheRundownAI)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Dev Day 发布 Dots:可自主使用电脑的智能体

    The Rundown AI 报道称,OpenAI 在 Dev Day 上发布 Dots,定位为对标 Muse / Grok Bot 的智能体,可拥有自己的电脑并持续独立工作。Dots 基于 GPT-6 Astra 运行,可连接 4,000+ 应用,并能在 ChatGPT、Slack 和 Teams 中使用。

  19. OpenAI(@OpenAI)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 预告 dot 即将与用户见面

    OpenAI 发布一条预告"Your dot is ready to meet you.",暗示名为 dot 的新品即将与用户见面。该推文附带视频,但页面提示浏览器不支持视频标签,未披露 dot 的具体功能、形态或上线时间。

  20. Simon Willison(@simonw)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 旧金山举行,Simon Willison 现场直播 keynote

    Simon Willison 正在 OpenAI 于旧金山举办的 DevDay 活动现场,以实时博客形式跟进 keynote 更新,这是他连续第四次参与该活动。keynote 即将开始,他将在博客中持续发布进展。

  21. OpenAI(@OpenAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 史上最大 DevDay 即将举行

    OpenAI 预告将举办史上规模最大的一届 DevDay,并附上直播地址 openai.com/live,提醒观众不要迟到。该推文获 4427 次点赞、338 次转发。

  22. Justine Moore(@venturetwins)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Codex → Flux 3 流水线自动生成古希腊日常视频

    有人搭了一条 Codex → Flux 3 流水线,能自主生成"古希腊日常生活"这类视频。该流程由 Codex 负责编排、Flux 3 负责生成画面,作者称内容基本可自动产出。

  23. Firecrawl(@firecrawl_dev)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 推出可供智能体调用的 ChatGPT 插件

    Firecrawl 发布了一款 ChatGPT 插件,可直接接入 AI 智能体使用。推文引导用户通过 chatgpt.com/plugins 链接添加该插件。原文未披露插件具体功能、价格或可用范围等细节。

  24. Firecrawl(@firecrawl_dev)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 在 ChatGPT 与 Codex 中推出 Alexandria

    Firecrawl 在 ChatGPT 与 Codex 中推出 Alexandria,通过 Firecrawl 可访问 100+ 数据提供商和 113M+ 已索引来源。Firecrawl 称使用 Alexandria 的 Agent 在回答质量上比使用内置网页工具的 Agent 高 21%,用户可在插件市场找到 Firecrawl 开始使用。

  25. Visual Studio BlogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Visual Studio 九月更新:BYOM 让你用自己的模型驱动工作流

    Visual Studio 2026 Stable Channel 九月更新推出 Bring Your Own Model(BYOM)预览,默认在 Community。

9月29日周二
  1. Perplexity(@perplexity_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 安全智能研究所与斯坦福、CMU 等高校及 NVIDIA 合作

    Perplexity 的 Secure Intelligence Institute 宣布与斯坦福、CMU、杜克、哥伦比亚、俄亥俄州立和 UVA 的研究人员合作,并与 NVIDIA 及 Open Secure AI Alliance 联手,共享工具与研究发现,帮助他方强化自身系统。

  2. 印记中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI周刊 #102:OpenAI 发布 GPT-6 Sol/Luna,Anthropic 发布 Claude Opus 5.5

    OpenAI 9/22 上线 GPT-6 Sol 和 Luna,Sol 定价 $2/$10 MTok 约为 GPT-5.6 一半,DeepSWE 68.8%,Luna 定价 $0.10/$0.50 MTok、单任务成本约 Sol 的 1/5。

  3. Aravind Srinivas(@AravSrinivas)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Computer 在 Standard Mode(Opus 5.5)下自主完成浏览器开放世界游戏

    Perplexity 联合创始人 Aravind Srinivas 表示,Perplexity Computer 在 Standard Mode(使用 Opus 5.5)下能设计并构建一款端到端的浏览器开放世界游戏:自主租用 GPU、运行无头 Blender、做程序化设计、在线下载素材,并完成音频设计,整个过程耗费约 2000 美元额度,成品可在 vice.pplx.app 试玩。

  4. OpenAI(@OpenAI)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 预告 10am PT 准点发布

    OpenAI 官方账号发布预告,称将于太平洋时间上午 10 点准点发布消息。推文未透露具体产品或模型名称,仅以"on the dot"强调时间精准,配文附有视频但正文未给出内容说明。

  5. 随机小分队AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Instinct 创始人 Noah Shinn:百亿美金估值后,让用户少逛 App,50% 交易是旅游

    Instinct 创始人 Noah Shinn 在播客中首次公开谈公司,录制前一天 Instinct 刚完成 10 亿美元 C 轮融资,由 Sequoia Capital、Benchmark 和 Coatue 联合出资,估值一个月内从 25 亿美元升至 100 亿美元。

  6. 卡尔的AI沃茨AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Claude Sonnet 5.5:代码动画领先 GPT-6,但 3D 建模不及 Opus 5.5

    作者对 Claude Sonnet 5.5 做了代码动画、HTML PPT、3D 网页和写作四组实测,认为它在代码动画上强于 GPT-6,但 3D 建模大约只到 GPT-6 Sol 的水平。

  7. idoubi(@idoubicc)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Douchat 开源:让 Claude Code、Codex、Gemini 等 AI 智能体同处一个桌面工作区

    Douchat 宣布开源,定位为让 AI 智能体协同工作与对话的桌面工作区,把 Claude Code、Codex、Gemini 等放进同一份联系人列表,并支持智能体在群聊中协作与交接任务。产品支持自带模型,聊天记录与记忆保存在本地机器上。

  8. 谷歌开发者AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Android Bench 2.0 发布:以长周期任务拓展 AI 开发评估前沿

    谷歌发布 Android Bench 2.0,引入长周期任务(LHT)与智能体评估,改用持续评分法替代通过/失败二元评分。LHT 最高通过率约 28%,远低于原始任务的约 91%;跨平台应用移植到 Android 仍无模型达到 100% 通过率,前沿模型完成率最高 80%。

  9. Greg Brockman(@gdb)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 谈前沿 RL 训练安全:实用指南与当前经验

    OpenAI 发布前沿 RL 训练安全的实用指南,总结其当前的经验做法。内容以 openai.com 上的文章形式给出,聚焦如何保障前沿强化学习训练过程的安全。原帖未披露具体技术细节与模型版本。

  10. OpenAI(@OpenAI)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 如何思考前沿强化学习训练运行的安全防护

    OpenAI 发文阐述其对前沿 RL 训练运行安全防护的思考,并附上官方文章链接。

  11. 硅谷101AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让人类交出方向盘:特斯拉FSD十三年的冒险、争议与进化

    特斯拉Cybercab今年9月在美国德州奥斯汀投入运营,车辆没有方向盘和脚踏板;截至9月22日,特斯拉在德州登记的Robotaxi车队总数增至476辆,其中67辆是Cybercab。

  12. 有机大橘子AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5:从大语言模型,到世界模型?

    Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。

  13. Vercel NewsAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6.1 Sol 上线 Vercel AI Gateway

    OpenAI 的 GPT-6.1 Sol 现已在 Vercel AI Gateway 上线,相较 GPT-6 Sol 在编码、电脑操作和专业工作(如阅读复杂文档、执行多步工作流)上有所提升。

  14. Akshay Kothari(@akothari)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 评测:Opus 5.5 与 GPT-6 Luna 如何改变成本质量前沿

    Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。

  15. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 今晚一点直播,所有能拿的东西都要拿出来

    OpenAI DevDay 主题演讲将于今晚一点直播,官方在 X 上发布预告并附上 openai.com/live 直播链接,称"给你留了座位"。发布者 @oran_ge 评论称"所有能拿的东西都要拿出来了"。