跳到正文

#评测/基准

今日 3 条
今天10月10日周六
  1. OpenRouter(@OpenRouterAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Luna 与 Astra 带动 Codex 使用量大增

    OpenRouter 指出,Luna 与 Astra 正带动 Codex 使用量大幅增长。该帖互动数据为 11 条回复、1 次转发、129 个点赞、11089 次浏览,由 xgo.ing 提供支持。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体接管构建后,AI Engineer 做什么?Arize AI 的 Aparna Dhinakaran 将于 10 月 13 日登台演讲

    Arize AI 的 Aparna Dhinakaran 将于 10 月 13 日登上 keynote 舞台,探讨当 AI 智能体承担构建工作后 AI Engineer 的角色定位,以及"好"由谁定义、如何衡量。Arize AI 是本次大会的 presenting sponsor,活动于 10 月 12 日至 14 日在纽约举行。

  3. LangChain(@LangChainAI)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Signals:Claude Sonnet 5 模型采用率升至第 2,gpt 5.6 luna 调用量登顶

    LangSmith Signals 上月数据显示,Claude Sonnet 5 在模型采用率上从第 9 升至第 2,使用它的组织数量增加 51%;gpt 5.6 luna 在调用足迹上从第 3 升至第 1,调用量增加 65%。两个开源权重模型进入采用率前 10,但调用量未进前列,更小更快的模型主导调用足迹。

10月9日周五
  1. Z PotentialsAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI模型评测平台Arena完成2亿美元B轮融资,估值31亿美元

    AI模型评测平台Arena宣布完成2亿美元B轮融资,估值达31亿美元,本轮由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、a16z、Felicis等跟投。

  2. 歸藏(guizang.ai)(@op7418)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    歸藏批评 Anthropic Haiku 5.5 低价狙击国产模型

    Anthropic 的 Haiku 5.5 定价专门针对中国竞品,价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash;在 Terminal Bench 4.0 上,AA 测试比 GLM 5.3 flash 高一分,也与其他两个竞品持平或更高。歸藏批评此举“恶心”,并质疑外界因降价而淡忘 Anthropic 过往行为。

  3. Lenny Rachitsky(@lennysan)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Every 招聘 PM:构建个人基准测试平台 Checks

    Every 已构建个人基准测试平台 Checks,帮助任何人衡量新模型在其实际工作中的表现,目前正招聘产品经理。该岗位面向理解这一方向重要性、并希望参与塑造人类借助 AI 完成工作方式的人。

  4. lmarena.ai(@lmarena_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 追加投资并推出 Alignment Index

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。

  5. lmarena.ai(@lmarena_ai)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 AI Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。

  6. lmarena.ai(@lmarena_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce Ventures 投资 Arena 的 B 轮融资

    Salesforce Ventures 宣布投资 Arena 的 B 轮融资。Arena 让真实用户对匿名模型输出投票,覆盖文本、编程、视觉、图像生成和智能体任务,其排行榜被实验室用于决定训练和发布哪些模型,也被开发者用于选型。投资方强调,这套机制成立的前提是没有实验室拥有这块记分牌。

10月8日周四
  1. AI Engineer(@aiDotEngineer)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 10 月 12 日设工作坊日,动手实践智能体工作流与评估

    AI Engineer New York 将 10 月 12 日设为工作坊日,参会者需自带笔记本电脑,在讲师带领下动手实践智能体工作流与评估。工作坊为会议附加环节,需另行选择场次,参会者可现场提问。

10月7日周三
  1. Epoch AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 调查:美国成年人遭遇网络事件的比例与 Claude Fable 5 发布时相比没有变化

    Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。

10月6日周二
  1. AI寒武纪AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测:200 美元档 Claude 的 API 等价 Token 价值约为 ChatGPT 的 5 倍

    SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面、智谱等厂商的订阅套餐做极限压力测试,结论是同等月费下 Anthropic 给用户的 Token 实际价值是 OpenAI 的 5 倍以上。

  2. 宝玉(@dotey)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测:同 200 美元订阅,Claude 的 Token 用量约为 OpenAI 的 5 倍

    半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。

10月3日周六
  1. lmarena.ai(@lmarena_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 帕累托前沿实时结果上线

    Agent Arena 帕累托前沿的实时结果已可查看,访问 arena.ai/leaderboard/ag 即可查看该排行榜。

10月1日周四
  1. Y Combinator(@ycombinator)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Halluminate 构建强化学习环境与基准,让 AI 模型胜任编程之外的金融知识工作

    Halluminate 正在构建强化学习环境与基准,让 AI 模型掌握编程之外的知识工作,首个落地领域为金融。团队不足 10 人,已与 5 家美国头部闭源 AI 实验室中的 4 家合作,并完成 3000 万美元 A 轮融资。其路径从浏览器智能体测试延伸到金融建模等训练环境,并强调更好的验证机制比更多训练任务更关键,未来目标是构建 AI 智能体团队协作的模拟公司。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:Gemini 新版本发布前会经数千名 Google 工程师测试数周

    Logan Kilpatrick 表示,Google 现在在大规模模型测试上已有明显改进,多数新的 Gemini 版本在发布前会经过数千名软件工程师(SWE)为期数周的测试。他认为这有望以可观幅度缩小 benchmark 与真实表现之间的差距。

9月29日周二
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    韩国小团队如何在开源模型上拿下 AA II 得分前五 | Nemotron Labs

    Nemotron Labs 讲述一支韩国小团队如何在开源模型上取得 AA II 得分前五。该内容以直播形式发布,正文未披露模型名称、参数规模或具体分数。

  2. Fireworks AI(@FireworksAI_HQ)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Normal 携 CAD Arena 加入 Fireworks AI 专业智能指数,评测 AI 跨五大 CAD 平台建模能力

    Normal 以 CAD Arena 加入 Fireworks AI 的专业智能指数(SII),把该指数扩展到工程设计领域。该基准测试 AI 智能体能否将工程图纸转成准确且可编辑的 CAD 零件,覆盖五个 CAD 平台。

9月25日周五
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FactoryAI 携 Legacy-Bench 加入 Fireworks AI 的 Specialized Intelligence Index

    FactoryAI 以 Legacy-Bench 加入 Fireworks AI 的 Specialized Intelligence Index(SII),该基准测试模型处理薪资、金融结算等遗留软件的能力。SII 持续扩容,专有基准的团队现可提交申请,通过 fireworks.ai 联系页面获取收录。

9月24日周四
  1. SemiAnalysisAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,Nebius 与 CoreWeave 同列铂金

    SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。

9月15日周二
  1. Elastic BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 在 2026 年 AV-Comparatives EPR 测试中拿下唯一满分

    Elastic Security 在 AV-Comparatives 2026 年 Endpoint Prevention and Response(EPR)测试中获得唯一的 100% 防护得分,并在 14 家厂商中实现最低的建模运营占用与零误报。

9月14日周一
  1. 大淘宝技术AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    淘天自研编码器 S266 斩获 MSU 2025 视频编码器大赛 6 项冠军

    淘天音视频技术团队自研的 H.266/VVC 编码器 S266 在第19届 MSU 世界视频编码器大赛(MSU 2025 FullHD 赛道)包揽 1 FPS、5 FPS、30 FPS 三个速度档位的 VMAF 冠军,S26X 则在 1 FPS 档位拿下 SSIM、PSNR 和主观评价三项第一,累计 6 项冠军及 1 项季军。

9月8日周二
  1. Latent.Space(@latentspacepod)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 推出 Frontier AEO 追踪器,解析 Astra 与 Fable 的优先来源

    Latent.Space 发布 Frontier AEO 追踪器项目,用于分析 Astra 优先关注什么、使用哪些来源,以及从 Sol 到 Astra、从 Opus 到 Fable 发生了哪些变化。相关答案已收录在 latent.space/p/aeo。

  2. SemiAnalysisAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 首次第三方实测 TPUv7 Ironwood 推理:每美元性能最高领先 B300 96%

    SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。

8月27日周四
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 试点前沿 AI 双盲评估,行业首创

    Google DeepMind 正在试点前沿 AI 的双盲评估,为行业首创。该方法构建安全环境,测试提示词与模型权重均不公开,使外部对模型的安全与性能评估保持私密、稳健且可信。

9月22日周日
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weights & Biases LLM-Evaluator Hackathon:担任评委见闻

    Weights & Biases 举办 LLM-Evaluator Hackathon,100 多人、15 支团队参赛,项目涵盖从文档构建与验证知识图谱、评估 LLM 的 MBTI 特质与创造力、优化评估提示词、评估多轮对话等。作者受邀担任评委并做开场分享,讨论 LLM 评估器的基线、打分方式、评估指标及评估器与 guardrail 的取舍。冠军团队每人获得一副 Meta Ray-Bans。