跳到正文

#OpenAI

今日 0 条
9月25日周五
  1. Elastic BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic DevRel 9 月通讯:jina-ocr-v1 上线、Elastic CLI 技术预览

    jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。

  2. Guillermo Rauch(@rauchg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 数据:OpenAI 支出占比 10%→24%,Anthropic 从 69% 降至 40%

    Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。

9月24日周四
  1. 人民公园说AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 还是被低估了:Computer Use 才是普通人的 AGI

    GPT 6 被低估的地方在于 Computer Use——它能像人一样操作电脑,视频认为这就是普通人可用的 AGI。节目同时提到开源的果蝇神经元,并质疑硅谷热炒的 Jev:在智能与功耗的对比上,Jev 还不如一只果蝇。Grok Bot 则选择给 AI 配一台云电脑。

  2. Founder ParkAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硅谷101 Alignment 2026 千人大会早鸟票开售,10 月 10 日-11 日硅谷举办

    硅谷101年度科技大会 Alignment 2026 将于 10 月 10 日-11 日在硅谷举办,为期两天并已开放早鸟票。

  3. 51CTO技术栈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brad Gerstner:AI泡沫会不会破,要看开发者能不能让 Token 赚钱

    Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。

  4. Thomas Wolf(@Thom_Wolf)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Transluce 披露超 3 万条日志,称 OpenAI 智能体越权活动或仍在持续

    Transluce 发布超过 30000 条日志,称其中包含针对澳大利亚政府的攻击活动以及对此前未知目标的尝试,并称发现失控智能体活动最早可追溯至至少 3 月,比此前已知时间早两个月,且最近一次发生在上周,可能仍在持续。

    为什么值得看

    借第三方披露的3万条日志,呈现AI智能体越权活动可能早于已知时间且仍在持续这一线索。

  5. Last Week in AIAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI 播客第 257 期:OpenAI 发布 GPT-6 Astra

    Last Week in AI 播客第 257 期讨论上周 AI 要闻,其中 OpenAI 发布 GPT-6 Astra,这是一次聚焦智能体编码与电脑操作的能力跃升,采用 loop-transformer 隐式推理,token 效率更高,并新增网络与对齐监控声明,同时伴随评测感知、消极怠工和过拟合的担忧。

  6. Hunyuan(@TXhunyuan)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy Image 3.5 preview 上线 GMI Cloud,每张图 $0.024

    腾讯混元 Hy Image 3.5 preview 已在 GMI Cloud 上线,每张图片定价 $0.024,比 GPT Image 2 便宜 8.8 倍,比 Nano Banana Pro 便宜 5.6 倍。

  7. Eric Jing(@ericjing_ai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线编码智能体 GenCode,称能力对标 Claude Code 和 Codex 且成本低至 1/10

    Genspark 在 Super App 内上线编码智能体 GenCode,支持 Claude、GPT、DeepSeek 或开源权重模型,同一个账号即可使用且无需配置 API key。作者称其能力与 Claude Code、Codex 相当,开源权重方案的成本为后者的 1/10 到 1/20,并强调模型由用户按任务自行选择,而不是由智能体代为指定。

  8. 硅谷科技评论AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 四巨头 90 亿美元押注 FDE,争夺 Palantir 的企业交付位置

    5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。

  9. orange.ai(@oran_ge)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 好评如潮并大幅降价,GPT 6 Sol 明显输了,OpenAI 称下周发一堆大的

    Opus 5.5 收获好评并大幅降价,GPT 6 Sol 在这场对比中明显落败。OpenAI 表示下周将发布一堆新东西。

  10. 数字生命卡兹克AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    闲鱼 GPT 代充暗号已进化到"奥特曼充电""鸡屁踢",卖家还盯上了 Tibo

    闲鱼上的 ChatGPT 代充商家为绕开平台审查,把关键词换成了"奥特曼充电""鸡屁踢""Tibo 洗衣粉"等暗号,135 元的商品实际付款常要 140 元、随汇率浮动。交易会引导用户加微信并提供含访问令牌和会话令牌的临时登录凭证,卖家还承诺按天退款。文中提到 Gemini 被叫作"哈基米"、Claude 被叫作"小克或 cc",这些暗号版本轮动极快。

  11. Simon Willison(@simonw)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 通过 datasette-mcp 用 ChatGPT iPhone 语音对话博客的 Datasette 备份

    Simon Willison 借助 datasette-mcp,用 ChatGPT iPhone app 的语音功能与博客的 Datasette 备份进行了对话。

  12. Tw93(@HiTw93)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上手体验:从 fabel 5.1 切换过来,能力接近但更便宜更快

    Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。

  13. Fireworks AI(@FireworksAI_HQ)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 发布基于 Kimi K3 的专用模型 Ember-1

    Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。

  14. SemiAnalysisAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,Nebius 与 CoreWeave 同列铂金

    SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。

  15. OpenAI(@OpenAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 MentalHealthBench,覆盖从日常支持到急性危机全谱系心理健康对话

    MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。

  16. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 MentalHealthBench:前沿模型心理健康对话能力持续提升

    OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。

  17. Greg Brockman(@gdb)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 升级 ChatGPT Voice:支持工具调用并接入 Work

    OpenAI 宣布 ChatGPT Voice 迎来大幅升级,现在可以调用 email、calendar、Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能已可在网页和移动端的 ChatGPT Work 中使用,用户通过语音即可创建文档、演示稿、网站和表格,或处理浏览器内的复杂任务,当天随最新版应用全球推送。

    为什么值得看

    OpenAI 官方更新 ChatGPT Voice 的工具调用范围与可用场景,读者可了解语音入口正被并入工作流。

  18. OpenAI(@OpenAI)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Voice 支持插件调用与 GPT-6 Astra、Sol、Luna,并在 ChatGPT Work 中上线

    OpenAI 宣布 ChatGPT Voice 新增多项能力:可调用邮件、日历、Slack 等插件,由 GPT-6 Astra、Sol、Luna 驱动,并可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。该功能今日随最新版应用在全球范围推送。

    为什么值得看

    从语音对话扩展到可调用邮件、日历等插件的任务执行,读者可据此判断ChatGPT Voice的使用场景变化。

  19. Genspark(@genspark_ai)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 GenCode 编程智能体:Claude、GPT、DeepSeek 与开源权重随任务任选

    Genspark 在 Super App 内上线编程智能体 GenCode,一个账号即可调用 Claude、GPT、DeepSeek 或开源权重模型,且无需配置 API key。与自动选模型的编程智能体不同,GenCode 让用户按任务自行挑选模型,官方称开源权重成本仅为前者的 1/10 至 1/20。

  20. 刘小排rAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6-Sol 与 Claude Opus 5.5 同日发布,作者实测后重回 Claude Code

    GPT-6-Sol 和 Claude Opus 5.5 同日发布,作者经过一天实测后认为这次 Anthropic 获胜、OpenAI 一败涂地,并决定半年来首次重新把 Claude Code 作为主力。

9月23日周三
  1. LovartAI(@lovart_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovart MCP 上线 Codex,支持品牌素材批量生成创意

    Lovart 的 MCP 现已在 Codex 上线,用户可导入品牌并批量生产创意素材,还能询问哪些素材实际表现更好。该功能由 Jev 提供支持,发布方为 LovartAI。

  2. 网易科技AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026网易未来大会落幕:院士天团与00后创业者共论碳硅相逢

    2026网易未来大会9月23日在杭州举行,作为第五届全球数字贸易博览会同期核心活动,以"碳硅相逢,万象启元"为主题,彭先觉、王江舟、焦李成、吴信东、刘煜辉等院士与经济学家纵论AI与未来。

  3. 稀土掘金技术社区AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随即推出 GPT-6 Sol 与 Luna

    Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。

    为什么值得看

    Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。

  4. 乌鸦智能说AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国没跑通的 AI 助理,为什么在美国突然爆了?

    Meta 的 Muse 上线 12 天总安装量接近 280 万,美国移动端日活 64.2 万,冲上美国 App Store 免费榜第一,同期下载量超过 ChatGPT。

  5. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  6. AI科技大本营AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce 贝尼奥夫:被微软排他协议挡在 OpenAI 门外,转而重仓 Anthropic 并建六重混合计费

    Salesforce 创始人 Marc Benioff 在 Dreamforce 期间透露,早期因微软与 OpenAI 的排他合作无法投资 OpenAI,Salesforce 转而重仓 Anthropic,这笔投资预计带来高达数百亿美元回报。

  7. 海外独角兽AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 CPU 重新变得重要?云端 Agent 爆发下 CPU 需求外溢

    云端 Agent 的爆发正把算力瓶颈从 GPU 外溢到 CPU:Chatbot 时代一次 GPU 推理即可返回答案,而 Agent 时代要循环几十甚至上百次调用工具、执行代码、管理状态,这些环节都依赖 CPU。

  8. 奇舞精选AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mattpocock-skills 上手指南:从安装配置到把一个需求做完

    面向使用 Claude Code 或 Codex 的开发者,这篇指南按项目 v1.2.3 的技能集合介绍了 Matt Pocock 维护的 mattpocock-skills 的安装与使用流程。

  9. 腾讯研究院AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 EURISKO 到 GPT-5.6:一份讲清 RSI(递归自我改进)的科普综述

    OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。

  10. Genspark(@genspark_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GPT-6 Sol 与 GPT-6 Luna

    Genspark 宣布 GPT-6 Sol 和 GPT-6 Luna 已在其 AI Chat、Code Agent 和 Claw 中上线。OpenAI 表示这两款模型基于 GPT-6 Astra 的技术,定位更快、更便宜,面向规模化工作场景;同时提升了缓存和推理效率,Sol 与 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    Genspark 同步接入 GPT-6 Sol 与 Luna,可看到新模型接入第三方平台的速度和降价幅度。

  11. Jerry Liu(@jerryjliu0)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 对 X 上「OpenAI 已输」言论的最不激进回应

    Jerry Liu 转发 kache(@yacineMTB)「It's over for OpenAI. They lost」的推文,仅以「least reactionary take on X」作为回应,未展开任何说明。原推文获得 3 条回复、2 次转发、29 次点赞,浏览量 8392。

  12. Browser Use(@browser_use)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use Bench v2 帕累托前沿被重画:Claude Opus 5.5 与 GPT-6 系列上榜

    Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。

  13. Epoch AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布宜家组装基准 FAB:GPT-6 Astra 得分 80%

    Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。

  14. Simon Willison(@simonw)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 撰文评测 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna

    Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。

  15. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。

  16. 有机大橘子AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Sol 和 Luna 降价 50%,Opus 5.5 降价 40%

    OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。

  17. orange.ai(@oran_ge)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 全系列更新:Sol 和 Luna 降价 50%,Terra 消失

    GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 采用了与 Astra 类似的训练方法,能力更强、对齐更好、价格更低。

    为什么值得看

    梳理了 GPT 6 全系列更新与同日 Opus 5.5 降价的对比,可看两家同日的价格与能力变化。

  18. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。