跳到正文

#现象/趋势

今日 0 条
10月9日周五
  1. meng shao(@shao__meng)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 benchmark 领先 GPT-6 Luna,用户从 CodeX 迁移到 Claude Code

    Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。

  2. 宝玉(@dotey)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉指出 Haiku 5.5 上下文超 100K 后价格涨 5 倍且被价格页隐藏

    宝玉指出 Haiku 5.5 的价格看似很低,但上下文一旦超过 100K,价格会上涨 5 倍,这一细节在价格页被隐藏起来。他引用其他用户的说法称这是阶梯定价,对比之下 GPT 的分界线是 272K,并认为这种设计相当于面向 Benchmark 的特化优化。

10月7日周三
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的一批数学结果

    OpenAI 发布由内部前沿模型产出的一批新数学结果,并公开了 github.com/openai/math 仓库。OpenAI 称在发布过程中咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考其建议和公开推荐意见来确定发布方式。Thomas Wolf 转引该消息时评价没有炒作、只有结果。

9月29日周二
  1. Simon Willison(@simonw)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:Sonnet 5.5 成为 claude.ai 免费版所用模型

    Simon Willison 指出,Sonnet 5.5 最重要的变化是它现在为 claude.ai 免费版提供支持,因此免费用户也能使用这些能力。他同时对比称,ChatGPT 免费版目前仍是能力弱得多的 GPT-5.6 Luna。该推文还引用了一组 Sonnet 5.5 的早期实验,其中包括用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器。

9月20日周日
  1. Browser Use(@browser_use)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 表现提升但价格明显上涨,DeepSeek v4.1 Flash 更胜一筹

    GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。

9月16日周三
  1. 夕小瑶科技说AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 疑似灰度现身,奥特曼预告本周大更新

    社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。

9月14日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 登顶 ARC-AGI-3 榜单并降低 token 成本

    DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。

8月26日周三
  1. Qwen(@Alibaba_Qwen)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-27B 在 Image-to-WebDev Arena 开放模型中排名第一

    Arena.ai 公布 Image-to-WebDev Arena 榜单,阿里 Qwen3.8-27B 在开放模型中排名第一、总榜第七,得分 1574,定价为每百万输入/输出 token 0.40/3 美元。Qwen 官方回应称该模型仅 27B 参数,性能与参数量约为其 100 倍的模型相当,并预告当晚将有新发布。

8月15日周六
  1. Augment Code(@augmentcode)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 接入 Cosmos 三天,创下该平台最快采用曲线

    Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)

7月20日周一
  1. Interconnects AI — Nathan LambertAI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 发布:开放权重的升级与生态新格局

    Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。

    为什么值得看

    从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。

7月16日周四
  1. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

2月21日周六
  1. Nick St. Pierre(@nickfloats)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    眨眼约需 0.4 秒,整本小说约 7 秒读完:xgo.ing 展示极速文本处理

    一段演示显示,速度参照眨眼约 0.4 秒,一本完整小说约 7 秒、Harry Potter and the Goblet of Fire 约 16 秒、一部电影长片剧本约 2 秒、10 万行代码约 38 秒。该演示由 xgo.ing 提供支持。