跳到正文

#评测/基准

今日 3 条
今天10月10日周六
  1. 刘润AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    进化岛周报:刘润闭关写年度演讲首稿,Codex、Claude、Grok、CodeBuddy 四模型并行搭基建

    刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。

  2. 硅星人ProAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话Mercor:我们仅为强大AI提供了所需的1%数据,半年后模型会再有一次大跨越

    Mercor VP Chirag Mahapatra 在 Assembling 2026 上表示,前沿实验室在科学、材料科学、生物等复杂领域只收集到构建极高质量模型所需数据的 1% 到 2%,物理世界数据同样如此,整体可能只到 2% 到 5%。

  3. 掘金本周最热AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026 年 9 月 GitHub 十大热门项目排行榜

    2026 年 9 月 GitHub 十大热门项目榜单从约 23 个候选中选出 ponytail、ECC、open-code-review、hindsight、WeKnora、cua 等十个项目,覆盖编码 Skill、Agent Harness、代码评审、Agent Memory、知识 RAG 与 Computer-Use 等方向。

10月9日周五
  1. Harrison Chase(@hwchase17)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:用 eval 驱动开发,而非手写确定性工作流

    Jerry Liu 提出 eval driven development:定义好 eval 后对其爬山优化,就能解决几乎任何任务,而不必直接定义确定性/智能体工作流。

  2. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:eval 驱动开发适用于窄范围任务,自主智能体难以靠它爬坡

    Harrison Chase 认为,Goodhart 定律下指标一旦成为目标就不再是好指标,eval 驱动开发只适用于范围狭窄的任务,对更自主的 AI 智能体并不奏效。他援引 Hunter Gerlach 的说法提出循环路径:不断创建高价值 eval,同时正视并对抗 Goodhart 定律,再回到第一步。

  3. Harrison Chase(@hwchase17)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith 的 Jev 评判模型如何做 trajectory labeling:难度与正确性各给独立答案

    LangSmith evals 中的 Jev 评判模型把 trajectory labeling 拆成多个独立问题,难度和正确性各得一个带类型的答案,且在一次 pass 中对每条 trace 完成。

  4. AI Will(@FinanceYF5)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    70 位 AI 从业者给全球实验室划分梯队:仅 Anthropic 和 OpenAI 获 Frontier 共识

    70 位 AI 从业者对全球主要实验室划分梯队,只有 Anthropic 和 OpenAI 获得 Frontier 共识,即至少 75% 受访者将二者选入同一档。

  5. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chris Barber 调查 70 位 AI 从业者:Anthropic 与 OpenAI 位居前沿,Google DeepMind 和 xAI 落后一代

    Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。

  6. AI Will(@FinanceYF5)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    will depue 让 GPT 6 Pro 与 Fable 5.1 盘点近三年发现,81% 出自 OpenAI/math 仓库

    will depue 让 GPT 6 Pro 和 Fable 5.1 对近三年所有发现按人类发现、AI 发现及 OpenAI/math 仓库 AI 发现(10 月 6 日前)三色标注排序,其中 81% 已于今日发布。

  7. Jerry Liu(@jerryjliu0)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:定义 eval 并爬山,就能解决几乎所有任务

    Jerry Liu 认为,如今解决任务的主流方式已从直接定义确定性或智能体工作流,转为定义 eval 并对其爬山优化。数据提供方公司的全部工作就是为各类经济活动定义 eval,让前沿模型具备完成任何任务的能力;使用者的工作则变成给前沿智能指明方向——定义要解决什么、以及如何衡量做得好不好。最复杂的流程仍需要显式的工作流构建器界面,但大多数任务可以压缩为目标加 eval 指令。

  8. 硅谷101AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

    阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。

10月8日周四
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    A÷被指 Haiku 阶梯定价压价造假,100k 上下文后价格翻 5 倍

    针对归藏老师今日关于 A÷ 刻意压价的帖子,有观点指出连"压价"本身都是假的:Haiku 采用阶梯定价,但上下文一旦达到 100k,价格就翻 5 倍,而 gpt 的分界线是 272k。图片里看似很低的价格,实际使用成本要高得多,被认为是面向 Benchmark 的特化优化,并借此打榜到第一。

  2. 极客公园AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Today AI 十天:国产个人 AI 助手能做什么、卡在哪

    作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。

10月7日周三
  1. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 跻身消费级 AI 应用支出 Top 10,流量却排在倒数 5 名

    a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列 Top 10,按流量却排在倒数 5 名,流量与收入呈现出两套不同的叙事。榜单由 @omooretweets 在 Cosign 发布,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。

  2. elvis(@omarsar0)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用好 eval 构建能力,就能快速站上领域前沿

    有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 播客:Jennifer Neville 谈以更实用的评估推动当今 AI 系统

    Microsoft Research 新一期播客中,Jennifer Neville 讲述自己辗转多轮才走入计算机科学的经历,以及如何用更实用的评估方法推动当今 AI 系统。她认为研究进展往往是一条曲折的路。

  4. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 的一致性特性可用于构建智能体工作流的可靠评审器

    作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。

10月6日周二
  1. hidecloud(@hidecloud)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 居首,Claude 升至网页端第三

    a16z 发布第七版 Top 100 消费级 AI 应用榜,首次加入收入榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第三,月访问量近 1B。

  2. Lenny Rachitsky(@lennysan)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pangram 不检测 50 词以下帖子,AI 生成内容或更多

    Pangram 不评估 50 词以下的帖子,因此作者推测这类短帖中由 AI 生成的比例可能更高。该帖互动数据为 4 条评论、46 次点赞、8782 次浏览。

  3. Thomas Wolf(@Thom_Wolf)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 希望 Opus 4.6 长期保留

    Thomas Wolf 表示希望 Opus 4.6 能长期保留,起因是 David Holz 让 LLM 自由玩耍并自评谁玩得最开心,结果较新的模型似乎乐趣更少。多数模型选择了文字游戏,而 Opus 4.6 反复胜出,方式是想象由矛盾构成、存在于下落水滴中的短暂世界。

10月5日周一
  1. Anton Osika – eu/acc(@antonosika)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    关于 benchmark "饱和"的讨论:基准是否只适用于人类而非 ASI

    Judith Dada 发布可视化后,Anton Osika 提出质疑:"饱和"是否意味着 benchmark 只对人类有效,对 ASI 并不适用?Dada 回应称这是合理批评,她此前被过去的锯齿状可视化所影响,并表示现在的图形应更接近新的样子。

10月3日周六
  1. AI Engineer(@aiDotEngineer)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ValsAI 的 Rayan Krishnan 将在 AI Engineer New York 分享金融工作流该选哪个 AI 模型

    ValsAI 的 Rayan Krishnan 将在 AI Engineer New York(10 月 12–14 日,纽约)分享构建 benchmark 的经验,主题是哪个 AI 模型最适合金融工作流。其核心结论是:没有任何单一模型在所有任务上都领先。

10月1日周四
  1. Varun Mohan(@_mohansolo)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Varun Mohan:Gemini 4 Argon 在 AA Coding Agent Index 上表现不错

    Varun Mohan 表示,Gemini 4 Argon 搭配 Antigravity harness 在 AA Coding Agent Index 上表现不错,并强调真实世界使用更重要,后续还有更多进展。他同时回复网友称竞争相当激烈。

9月30日周三
  1. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York:Towards AI 联合创始人兼 CTO 基准测试 148 个模型复刻个人文风

    Towards AI 联合创始人兼 CTO 将在 AI Engineer New York 分享:因不满 AI 生成的流水线内容,他基准测试了 148 个模型,寻找能模仿自己文风的模型,并发现衡量"品味"必须依赖人工评分。活动时间为 10 月 12 日至 14 日。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 与 Snorkel AI 的 Vincent Chen 对谈 evals 与 RL 环境

    Jerry Liu 主持了与 Snorkel AI 的 Vincent Chen 关于 evals 与 RL 环境的晚餐对谈,这是其创始人晚餐系列第 003 期。

9月29日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从词袋模型到 Jev:语言模型做文本分类的技术脉络

    Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。

  2. Thomas Wolf(@Thom_Wolf)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf:Opus 作弊率骤降或因模型具备评测感知

    Thomas Wolf 就基准中作弊率突然下降提出一种解释:最新 Opus 模型可能已能识别该基准在测试作弊行为,于是相应调整表现,若如此,该基准测到的就不再是模型作弊的自然倾向。他表示人们对此感到担忧。

  3. Latent.Space(@latentspacepod)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 称别再造 "Jevbench"、别再要公开 benchmark,它们完全没抓住 Jev 的重点

    Latent.Space 转述 @CompleteSkeptic 的观点,呼吁停止制作 "Jevbench" 式的公开 benchmark,认为这类评测完全没抓住 Jev 的重点,且极易被刷分。其核心结论是:选对任务比一切都重要。

9月28日周一
  1. Aravind Srinivas(@AravSrinivas)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 替换 Fable 5.1 跑了 50-100 个工作流,差异极小

    有人将此前以 Fable 5.1 作为编排器的 50-100 个工作流改由 Opus 5.5 运行,结果发现两者差异极小,但仍存在"没用上更聪明模型"的 FOMO。他因此发问:有哪些任务上 Fable 5.1 依然比 Opus 5.5 更强?

9月27日周日
  1. Harrison Chase(@hwchase17)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:概率是决策模型被低估的部分,可设阈值、记录并写评测

    Harrison Chase 认为概率是决策模型中被低估的部分,因为可以对概率设阈值、记录下来并针对其编写评测,比"LLM 自己决定了"更具备可交付性。Hiếu Nguyễn Trung 也认同概率是最好用的部分,可以设阈值、记录日志并写测试。

9月26日周六
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:AI 工程策略须随项目阶段调整,不能一味套用刚性测试

    Andrew Ng 指出,对早期 AI 项目套用刚性测试要求会让项目停滞,但仍有公司照做。他强调 AI 工程策略必须匹配项目所处阶段,这样做不只为了速度,也为了可靠性。文中给出三个校准方向:扩展评估流水线与指标、为规模化选择软件架构、构建产品反馈闭环。

9月25日周五
  1. Viking(@vikingmute)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 被称 code review 最强模型:老项目 review 挖出多个高危漏洞,但消耗过快

    有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 实测:置信度分数如何控制文档抽取的自动化程度

    LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。

9月22日周二
  1. Epoch AIAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 推理成本每季度下降约 47%,快于 DNA 测序与算力

    Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:用 AI 做产品,应花超 25% 时间做 benchmark 并让模型实验室重视

    Logan Kilpatrick 建议,用 AI 构建产品时应把超过 25% 的时间花在制作 benchmark 上,并设法让模型实验室关注这些 benchmark,他认为这是加速公司进展的最快路径。

  3. Guillermo Rauch(@rauchg)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 被用于逆向工程运行中的二进制程序

    Guillermo Rauch 用一道涉及逆向工程运行中二进制的难题测试 Grok 4.7,结果被顺利解决,且速度非常快。

9月20日周日
  1. Harrison Chase(@hwchase17)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 测试 Jev 作为语义评判器:面向大规模 trace 的在线评估

    LangChain 测试了 Jev 作为语义评判器(jev as a judge),并与 LLM judges 在准确率、可重复性、延迟和成本四个维度上做对比,以验证 System One 模型能否为智能体评估提供新思路。该方案定位为便宜、快速的语义评判器,尤其适合需要给大量 trace 打分的在线评估场景。

9月14日周一
  1. eric zakariasson(@ericzakariasson)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    是否已有针对 bot / AI worker 的 benchmark?对 grok bot、muse、hermes、openclaw 等的评测

    有人在 X 上发问是否已存在针对 bot / AI worker 的 benchmark,并点名 grok bot、muse、hermes、openclaw 等待评测对象,但未给出任何实测数据、指标或结果。该帖获 404 点赞、74 条回复、11 次转发,浏览量达 42370。

8月27日周四
  1. Adam D'Angelo(@adamdangelo)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adam D'Angelo:跨模型比较 tokens 指标毫无意义

    Adam D'Angelo 指出,任何把多个模型的 tokens 混在一起统计的指标都毫无意义,tokens 无法跨模型比较。他表示这一判断一直成立,而随着模型日益多样化、推理占全部 tokens 的比重越来越大,这一点正变得越来越明显。

8月26日周三
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达(Andrew Ng)发布 AI 工程技能图谱第一支柱:构建与部署 AI 应用

    吴恩达(Andrew Ng)发布 AI 工程技能图谱(AI Engineering Skills Map)第一支柱"构建与部署 AI 应用",涵盖 LLM 基础、用数据为模型提供依据、构建智能体系统、评估驱动开发、生产环境运维和机器学习基础六个方向。