跳到正文

#Anthropic

今日 0 条
9月24日周四
  1. Firecrawl(@firecrawl_dev)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 上线 Claude 目录:claude.ai/directory/fire 可查

    Firecrawl 已出现在 Claude 目录中,地址为 claude.ai/directory/fire,可通过该页面查看。

  2. Firecrawl(@firecrawl_dev)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 在 Claude 中推出 Alexandria:接入 100+ 数据提供商与 1.13 亿+ 索引源

    Firecrawl 在 Claude 中推出 Alexandria,可通过其连接接入 100 多个数据提供商和 1.13 亿以上索引源。使用 Alexandria 的智能体答案质量得分比使用内置网络工具的高出 21%。用户现可通过 Firecrawl connector 开始使用。

  3. 51CTO技术栈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brad Gerstner:AI泡沫会不会破,要看开发者能不能让 Token 赚钱

    Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。

  4. Last Week in AIAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI 播客第 257 期:OpenAI 发布 GPT-6 Astra

    Last Week in AI 播客第 257 期讨论上周 AI 要闻,其中 OpenAI 发布 GPT-6 Astra,这是一次聚焦智能体编码与电脑操作的能力跃升,采用 loop-transformer 隐式推理,token 效率更高,并新增网络与对齐监控声明,同时伴随评测感知、消极怠工和过拟合的担忧。

  5. NVIDIA AI(@NVIDIAAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenEvidence 与 Anthropic 合作,向中低收入国家医生免费提供医疗 AI

    OpenEvidence 宣布与 Anthropic 合作,在联合国大会期间公布将 OpenEvidence 免费提供给中低收入国家的医生使用。该合作旨在让全球医生无论经济条件如何都能用上这一医疗 AI。

  6. 硅谷科技评论AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 四巨头 90 亿美元押注 FDE,争夺 Palantir 的企业交付位置

    5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。

  7. orange.ai(@oran_ge)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 好评如潮并大幅降价,GPT 6 Sol 明显输了,OpenAI 称下周发一堆大的

    Opus 5.5 收获好评并大幅降价,GPT 6 Sol 在这场对比中明显落败。OpenAI 表示下周将发布一堆新东西。

  8. 山行AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:Claude Code 中真正拉开差距的是领域专长

    Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。

  9. Anthropic(@AnthropicAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 助力刚果民主共和国应对罕见埃博拉变异株疫情

    在刚果民主共和国,CEPI、WHOAFRO 和 inrb_kinshasa 等全球卫生组织正使用 Claude 加速应对一种罕见埃博拉变异株的疫情。Anthropic 发布了相关完整报道。

  10. Tw93(@HiTw93)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上手体验:从 fabel 5.1 切换过来,能力接近但更便宜更快

    Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。

  11. SemiAnalysisAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,Nebius 与 CoreWeave 同列铂金

    SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。

  12. Simon Willison(@simonw)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 TTS 模型上线:支持多语音对话且价格低廉

    Gemini 3.8 TTS 模型发布,作者称其价格非常低,并支持多语音之间的对话生成,可选 2000 多种声音或克隆自己的声音。作者为此搭了一个小界面,并让 Claude 写了一段脚本,让两只鹈鹕辩论搬到 Pacifica Pier 的事。

  13. Dario Amodei(@DarioAmodei)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei 称 Claude 主导发现一种潜在新型基因编辑机制的分子机器

    Anthropic 的 Dario Amodei 宣布 Claude 主导发现了一种分子机器,研究团队怀疑它可能代表一种新的基因编辑机制,但其具体功能、生物技术用途和重要性尚不明确。

  14. Anthropic(@AnthropicAI)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 分子生物学实验室公布首个成果

    Anthropic 公布其新分子生物学实验室的首个研究成果。该实验室由 Anthropic 生物学家团队使用 Claude 梳理数据与文献、生成假设和候选生物系统,经科学家审阅后由科学家完成全部实验验证。Anthropic 希望将这一方法扩展到基因组学及其他领域,并公开征集研究问题提案。

  15. Anthropic(@AnthropicAI)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic:Claude 在噬菌体 DNA 中发现未知酶系统

    Anthropic 表示 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,其基因旁有一段重复 DNA 阵列,结构上与 CRISPR 有些相似。Anthropic 称目前还不清楚该系统的作用,已知只有少数系统具备类似特征,而它们都能剪切、复制和粘贴 DNA;要弄清其功能及能否有类似用途还需要大量工作。

  16. AI Breakfast(@AiBreakfast)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一夜一次性生成完整冒险游戏 Epicurious

    Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。

  17. Genspark(@genspark_ai)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 GenCode 编程智能体:Claude、GPT、DeepSeek 与开源权重随任务任选

    Genspark 在 Super App 内上线编程智能体 GenCode,一个账号即可调用 Claude、GPT、DeepSeek 或开源权重模型,且无需配置 API key。与自动选模型的编程智能体不同,GenCode 让用户按任务自行挑选模型,官方称开源权重成本仅为前者的 1/10 至 1/20。

  18. 刘小排rAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6-Sol 与 Claude Opus 5.5 同日发布,作者实测后重回 Claude Code

    GPT-6-Sol 和 Claude Opus 5.5 同日发布,作者经过一天实测后认为这次 Anthropic 获胜、OpenAI 一败涂地,并决定半年来首次重新把 Claude Code 作为主力。

9月23日周三
  1. Akshay Kothari(@akothari)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 在写作上有巨大升级

    Claude Opus 5.5 在写作能力上迎来大幅升级,表达更自然,并回应了 Opus 5 收到的最常见反馈。它会将最重要的信息前置,并遵循用户给出的写作规则,让长会话更易跟进。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 报告:未经授权代理将用户提示词转发至 Claude API,催生大规模蒸馏

    Anthropic 最新报告披露,未经授权的代理通过代理查询路由,把用户提示词转发到 Claude API,支撑起跨商业平台的大规模蒸馏活动。这类查询转发会造成严重的数据隐私风险。

  3. 稀土掘金技术社区AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随即推出 GPT-6 Sol 与 Luna

    Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。

    为什么值得看

    Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。

  4. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  5. AI科技大本营AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce 贝尼奥夫:被微软排他协议挡在 OpenAI 门外,转而重仓 Anthropic 并建六重混合计费

    Salesforce 创始人 Marc Benioff 在 Dreamforce 期间透露,早期因微软与 OpenAI 的排他合作无法投资 OpenAI,Salesforce 转而重仓 Anthropic,这笔投资预计带来高达数百亿美元回报。

  6. 海外独角兽AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 CPU 重新变得重要?云端 Agent 爆发下 CPU 需求外溢

    云端 Agent 的爆发正把算力瓶颈从 GPU 外溢到 CPU:Chatbot 时代一次 GPU 推理即可返回答案,而 Agent 时代要循环几十甚至上百次调用工具、执行代码、管理状态,这些环节都依赖 CPU。

  7. 奇舞精选AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mattpocock-skills 上手指南:从安装配置到把一个需求做完

    面向使用 Claude Code 或 Codex 的开发者,这篇指南按项目 v1.2.3 的技能集合介绍了 Matt Pocock 维护的 mattpocock-skills 的安装与使用流程。

  8. orange.ai(@oran_ge)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    看指标 Claude Opus 5.5 非常强悍,把 fable 和 astra 都比下去了?

    Claude Opus 5.5 在默认 effort 设置下即可取得前沿结果,每任务成本仅为其他模型的一小部分,常常击败以最高设置运行的模型,输出速度比 Opus 5 快 30% 以上。有观察者据此认为它把 fable 和 astra 都比了下去。

  9. Genspark(@genspark_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 接入 Claude Opus 5.5,覆盖 AI Chat、Code Agent 和 Claw

    Claude Opus 5.5 已在 Genspark 上线,覆盖 AI Chat、Code Agent 和 Claw 三个入口。据 Genspark 引用的 Anthropic 介绍,该模型是 Claude 5.5 家族首个模型,多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%,速度比 Opus 5 快 30%。

  10. cat(@_catwu)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何试用 Opus 5.5 与 Slack 中的 Claude Tag

    Boris Cherny 用 Opus 5.5 对 Claude Agent SDK 做形式化验证,几段简短提示词就产出 16 个 PR,修复多个 bug 和竞态条件,TLA+ 同样适用,他还常把 Lean 与 TLA+ 结合排查数据流、并发与状态管理问题。他表示自己并不熟悉这两门语言,但 Claude 都很擅长,认为这种方式能发现人眼难以察觉的 bug。

  11. Browser Use(@browser_use)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use Bench v2 帕累托前沿被重画:Claude Opus 5.5 与 GPT-6 系列上榜

    Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。

  12. Epoch AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布宜家组装基准 FAB:GPT-6 Astra 得分 80%

    Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。

  13. Simon Willison(@simonw)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 撰文评测 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna

    Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。

  14. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。

  15. 有机大橘子AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Sol 和 Luna 降价 50%,Opus 5.5 降价 40%

    OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。

  16. orange.ai(@oran_ge)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 全系列更新:Sol 和 Luna 降价 50%,Terra 消失

    GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 采用了与 Astra 类似的训练方法,能力更强、对齐更好、价格更低。

    为什么值得看

    梳理了 GPT 6 全系列更新与同日 Opus 5.5 降价的对比,可看两家同日的价格与能力变化。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 在 ParseBench 拿下 93.9%,成 PDF 表格解析最强前沿模型

    Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。

  18. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。

  19. Guillermo Rauch(@rauchg)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍

    最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。

  20. Augment Code(@augmentcode)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Claude Opus 5.5 上线 Cosmos,智能体任务成本降至 Opus 5 的 40%

    Anthropic 的 Claude Opus 5.5 现已在 Cosmos 上线,运行其上的智能体任务成本仅为 Opus 5 的 40%。官方称这是 Claude 重度用户的必选升级,并期待该模型为客户的软件工厂带来更好的结果。

  21. Lovable(@lovable_dev)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 接入 Claude Opus 5.5 与 GPT-6 Sol 两个新模型,并支持 Fable 5.1

    Lovable 宣布其构建能力现由 Claude Opus 5.5 和 GPT-6 Sol 两个新模型驱动,用户无需自行选择用哪个模型。Lovable 会对每个新模型进行测试、调优并决定路由方式,以保证构建效果最佳,同时平台也已支持 Fable 5.1 构建。

  22. Alex Albert(@alexalbert__)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 用 Blender 重建 1906 年旧金山市场街,要求全程可溯源

    一条在 Claude 中输入的提示词要求用 Blender 重建 1906 年 4 月 17 日旧金山市场街,范围从 Ferry Building 沿 Market 街至 Fifth Street,涵盖 Palace Hotel、Call Building、Chronicle Building、Lotta's Fountain 和 Emporium。