跳到正文

#评测/基准

今日 19 条
10月7日周三
  1. Mistral AI(@MistralAI)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 AutomationBench 上登顶,领先 Kimi K3、DeepSeek V4 Pro

    Mistral Large 4 在 AutomationBench 上跑了 657 条业务流程,覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用,成绩超过 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。该基准围绕周一典型工作流设计,四个应用全部纳入测试。

  2. AICodeKingAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4(Le Chonk)实测:它真是最好的开源模型吗?

    AICodeKing 对 Mistral Large 4(代号 Le Chonk)进行了完整实测,围绕它是否是目前最好的开源模型展开评测。

  3. lmarena.ai(@lmarena_ai)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 上线 Code Arena WebDev 排行榜

    LMArena 推出 Code Arena WebDev 排行榜,可通过 arena.ai/leaderboard/co… 查看。原文未披露上榜模型、分数及评测方法等细节。

  4. Epoch AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 调查:美国成年人遭遇网络事件的比例与 Claude Fable 5 发布时相比没有变化

    Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。

  5. Epoch AIAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 更新 EBR-bench:GPT-6 Astra 因利用单卡漏洞满分,官方禁用该卡

    Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。

  6. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 InnovationEval:AI 能自动完成 AI 研发吗?

    Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。

  7. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 跻身消费级 AI 应用支出 Top 10,流量却排在倒数 5 名

    a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列 Top 10,按流量却排在倒数 5 名,流量与收入呈现出两套不同的叙事。榜单由 @omooretweets 在 Cosign 发布,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。

  8. AI Engineer(@aiDotEngineer)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ArizeAI 的 Fuad Ali:如何把智能体线上失败转化为 evals 测试

    ArizeAI 的 Fuad Ali 展示了一套方法:把 AI 智能体的生产环境失败案例转化为 evals,用于测试修复是否引入回归,并加入人工审核环节。相关内容将在 10 月 12 日 AI Engineer New York Workshops 上讲解,该工作坊为会议附加环节。

  9. lmarena.ai(@lmarena_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 上线 Multi-Image Edit Arena 多图编辑排行榜

    LMArena 推出 Multi-Image Edit Arena,并在 arena.ai/leaderboard 上线对应榜单,用于比较多图编辑能力。原文未披露参与模型、评分指标或具体排名的更多细节。

  10. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Nano Banana 2.1 登陆 LMArena 图像竞技场

    Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。

  11. lmarena.ai(@lmarena_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Nano Banana 2.1 上线 LMArena 三个图像榜单

    Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。

  12. elvis(@omarsar0)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用好 eval 构建能力,就能快速站上领域前沿

    有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。

  13. Justine Moore(@venturetwins)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Justine Moore 实测 Tavus 新模型 Griffin 的实时交互视频

    Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。

  14. OpenRouter(@OpenRouterAI)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Nano Banana 2.1 上线 OpenRouter:Flash 速度实现 Pro 级图像生成与编辑

    Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。

  15. GitHub(@github)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 发布 ReviewBench:基于 1.039 亿 PR 分析的开源代码审查评测基准

    GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。

  16. elvis(@omarsar0)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    每个智能体基准都应审计其验证器:Parsewave 修复 AutomationBench 206 个验证器 bug,发布 AutomationBench Verified

    Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。

  17. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Parsave 审计 Zapier AutomationBench:600 个任务查出 206 个验证器 bug,发布 AutomationBench Verified

    Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。

  18. Aravind Srinivas(@AravSrinivas)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 在 Hugging Face Decision Index 登顶,模型开放权重

    Perplexity 在 Hugging Face Decision Index(决策模型基准)上排名第一。该模型采用开放权重,所有人均可访问。

  19. Simon Willison(@simonw)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilypond Bach Benchmark:GPT-6 Astra 首次写出经过音

    GPT-6 Astra 在 Lilypond Bach Benchmark 上取得迄今最佳结果,其四声部众赞歌没有声部进行错误,和声语汇复杂到包含那不勒斯六和弦,并且是首个在该 benchmark 上写出经过音的模型。测试使用 Extra High effort,提示词要求在 LilyPond 2.24 中按巴赫风格写 G 小调 3/4 拍四声部众赞歌并只返回代码块。

  20. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 携手 Artificial Analysis 评测开源模型

    NVIDIA Nemotron Labs 与 Artificial Analysis 合作,对开源模型展开评测。相关内容以直播形式发布。

  21. Microsoft Research(@MSFTResearch)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 播客:Jennifer Neville 谈以更实用的评估推动当今 AI 系统

    Microsoft Research 新一期播客中,Jennifer Neville 讲述自己辗转多轮才走入计算机科学的经历,以及如何用更实用的评估方法推动当今 AI 系统。她认为研究进展往往是一条曲折的路。

  22. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 的一致性特性可用于构建智能体工作流的可靠评审器

    作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。

10月6日周二
  1. Aravind Srinivas(@AravSrinivas)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider 被称最强决策模型,8 款模型俄罗斯方块对战测试居首

    Perplexity Decider 在一项对标测试中被评为最佳决策模型,测试让 8 款决策模型对战俄罗斯方块,Decider 成绩始终位居榜首。该测试由 Alok Bishoyi 分享,并可在 app.routerplus.com 的 playground 中体验。

  2. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev-as-a-Judge:用一致性提升 LLM 评判可靠性

    Jev-as-a-Judge 通过一致性提升 LLM judge 的可靠性,适合用作评判器、验证器和持续监控。该用例被评价为 Jev 最亮眼的应用之一,作者长期从事 agent evals、judges 和 verifiers 相关工作。

  3. AI寒武纪AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测:200 美元档 Claude 的 API 等价 Token 价值约为 ChatGPT 的 5 倍

    SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面、智谱等厂商的订阅套餐做极限压力测试,结论是同等月费下 Anthropic 给用户的 Token 实际价值是 OpenAI 的 5 倍以上。

  4. hidecloud(@hidecloud)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 居首,Claude 升至网页端第三

    a16z 发布第七版 Top 100 消费级 AI 应用榜,首次加入收入榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第三,月访问量近 1B。

  5. elvis(@omarsar0)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    flow-1:用 RL 训练、比 GPT-6-sol 便宜 23 倍的 agent trace 错误检测模型

    flow-1 是用 RL 训练的新模型,用于在 agent trace 中查找错误,其 trace intelligence 与 GPT-6-sol 相当,但成本低 23 倍,运行成本也比 GPT-6-luna 低 25%。它让监控和理解每一次 agent 运行、且无需采样成为可能。

  6. QdrantAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google EmbeddingGemma 2 能压到多小?1-bit 量化省 30 倍向量内存

    Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。

  7. Lenny Rachitsky(@lennysan)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pangram 不检测 50 词以下帖子,AI 生成内容或更多

    Pangram 不评估 50 词以下的帖子,因此作者推测这类短帖中由 AI 生成的比例可能更高。该帖互动数据为 4 条评论、46 次点赞、8782 次浏览。

  8. 宝玉(@dotey)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测:同 200 美元订阅,Claude 的 Token 用量约为 OpenAI 的 5 倍

    半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。

  9. Thomas Wolf(@Thom_Wolf)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 希望 Opus 4.6 长期保留

    Thomas Wolf 表示希望 Opus 4.6 能长期保留,起因是 David Holz 让 LLM 自由玩耍并自评谁玩得最开心,结果较新的模型似乎乐趣更少。多数模型选择了文字游戏,而 Opus 4.6 反复胜出,方式是想象由矛盾构成、存在于下落水滴中的短暂世界。

  10. lmarena.ai(@lmarena_ai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 分类榜单上线,可查看各智能体类别排行

    Agent Arena 现已按类别提供智能体排行榜,用户可通过 arena.ai/leaderboard/ag 查看各分类下的排名情况。该榜单由 lmarena.ai 发布。

  11. lmarena.ai(@lmarena_ai)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 智能体能力排名:Anthropic 与 OpenAI 领跑各领域

    Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。

  12. Simon Willison(@simonw)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 复测 Qwen 3.8 27B 本地长数字加法,对比推理与非推理模式

    Simon Willison 重跑了 Colin Fraser 早前针对 GPT-4o 的长数字加法实验,这次改用本地运行的 Qwen 3.8 27B,并分别测试推理模式与非推理模式。原帖未给出具体得分,仅附上实验记录链接。

10月5日周一
  1. 向阳乔木(@vista8)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多款 ASR 实测:豆包语音(极速)、Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR、小米 MiMo-ASR 对比

    为给无字幕的 Youtube 和 B 站视频做转写,作者实测了豆包语音(极速)、硅基流动上的 Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR 和小米 MiMo-ASR 多家 ASR。豆包语音表现最完善,自带毫秒时间轴且速度较快。相关功能将上线乔木剪藏插件,新增本地 Whisper 与本地 Qwen3 ASR,并支持各类云端语音转文本 API。

  2. 十字路口CrossingAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1 Flash Preview 前端能力:三个案例对比 Opus 5.5

    MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。

  3. Anton Osika – eu/acc(@antonosika)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    关于 benchmark "饱和"的讨论:基准是否只适用于人类而非 ASI

    Judith Dada 发布可视化后,Anton Osika 提出质疑:"饱和"是否意味着 benchmark 只对人类有效,对 ASI 并不适用?Dada 回应称这是合理批评,她此前被过去的锯齿状可视化所影响,并表示现在的图形应更接近新的样子。

10月4日周日
  1. 新智元AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 首测:纯代码生成3分钟人类史短片

    外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 在 ExploitBench 漏洞利用任务上与 Claude Mythos 接近

    据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。

  3. AI Engineer(@aiDotEngineer)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    W&B 的 Zubin Aysola 如何把 ARIA 生产 trace 变成 eval 并验证修复

    W&B 的 Zubin Aysola 演示了把 ARIA 的一次生产 trace 转成 eval,并用它来基准测试修复效果。这是「智能体出错后能否变成测试」的实操分享,完整录播见 youtu.be/XyV6bSMyq-I。相关活动将于 10 月 12–14 日在纽约举行,报名入口 ai.engineer/nyc/2026。