跳到正文

#评测/基准

今日 18 条
9月21日周一
  1. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 能否替代 RAG 中的 reranker?在 Milvus 短名单上实测三种方案

    在 Milvus 短名单上对 80 条 SciFact 查询实测三种方案:qwen3.7-text-rerank 将 nDCG@10 提升 0.0446,Jev 提升 0.0778,排名最优。但 Jev 的 P50 重排延迟是 qwen 的 10.2 倍,单次运行成本约为 6.7 倍。以 0.5 为阈值直接按概率过滤时,top-5 精确率 49.4%,但有 18.8% 的金标准相关文档被滤除。

  2. LangChain BlogAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 实测 TypeSafe AI 的 Jev 能否成为更好的 Agent 评估器

    LangChain 用 Deep Agents 构建天气 agent,在 LangSmith 数据集上对比 TypeSafe AI 的 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 三种 LLM 评委。

  3. Qdrant(@qdrant_engine)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实验:向量检索候选深度如何影响重排序效果

    Qdrant 在五个公开数据集上实验了向量检索的候选深度:若最终只要 5 条结果,先召回 100 个候选能给重排序或融合阶段更多素材。把 limit 从 10 提到 500,最优可能的 nDCG@10 最多提升 0.28,但实际得分变化不超过 0.01——有时文档已被召回,只是排名不够高。

  4. 卡尔的AI沃茨AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:网页复刻追平第一梯队,价格只要三分之一

    阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。

  5. 沃垠AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:五项任务表现如何

    作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。

9月20日周日
  1. Harrison Chase(@hwchase17)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 测试 Jev 作为语义评判器:面向大规模 trace 的在线评估

    LangChain 测试了 Jev 作为语义评判器(jev as a judge),并与 LLM judges 在准确率、可重复性、延迟和成本四个维度上做对比,以验证 System One 模型能否为智能体评估提供新思路。该方案定位为便宜、快速的语义评判器,尤其适合需要给大量 trace 打分的在线评估场景。

  2. 袋鼠帝AI客栈AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃 Step 5 Preview 实测:接入 Claude Code 连跑三小时交付五个项目

    作者参与阶跃新一代旗舰模型 Step 5 Preview 内测,将其接入 Claude Code 完成五个项目:three.js 昆明 3D 网站跑了近 3 小时、把自研 Mac 截图工具 Ta 移植成 Windows 版、手机端 MD+HTML 阅读器墨读、广告小游戏复刻,以及网页虚拟机械臂接入 GLM-5.3-Flash 画画。

  3. 腾讯混元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合清华北大提出 WebCraftBench:让智能体实测 AI 生成的网页

    腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。

  4. GitHub(@github)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 分享从原型到生产的 LLM 评测实践

    GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。

9月19日周六
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Dynamo AIPerf:测量 LLM 端点的 TTFT、ITL、延迟与吞吐

    NVIDIA Dynamo AIPerf 用于在流量增长时衡量 LLM 端点的 TTFT、ITL、延迟和吞吐,并可用可重复的真实流量模式进行测试。该工具面向规模化场景,帮助回答 LLM 端点在高负载下的性能表现。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muse Image、MAI-Image-2.6 与 GPT Images 2.5 刷新文生图性价比前沿

    Artificial Analysis 指出,近几周 Muse Image、MAI-Image-2.6 和 GPT Images 2.5 显著推动了文生图在价格与速度两条帕累托前沿的移动,生成高质量图像比以往更便宜、更快。Mustafa Suleyman 转发称这是全球图像生成领域最佳的性价比表现。

9月18日周五
  1. 奇舞精选AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奇舞周刊第597期:Agent 工程与研发实践

    奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。

  2. Yangyi(@Yangyixxxx)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 做分类任务:邮件分类与线索评分的最佳使用场景

    Jev 在分类任务上表现突出,做邮件分类和对线索评分都很好用。有用户为验证 Jev 的判断速度,让其进行邮件分类,并与各家 AI 的高速模型 Luna、Sonnet、Flash 对比,Jev 结果领先。

  3. Hamel HusainAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Evals 常见问题大全:从错误分析到评估器验证

    Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。

  4. Vercel NewsAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel Sandbox 支持运行 Terminal-Bench 等 Harbor 评测

    Vercel Sandbox 现已支持运行 Harbor 评测,Harbor 是 Terminal-Bench 背后的开源评测框架,其注册表还包含 SWE-bench、tau3-bench 和 OSWorld 等基准。

9月17日周四
  1. 阿真IreneAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-pro 0915 版本多模态 Coding 与长任务实测

    豆包 Doubao-Seed-2.1-pro 升级到 0915 版本,官方称重点提升 Coding、Agent 与多模态能力。作者实测了用平面图和作品资料生成三维电子展馆网页、从零策划含 Office 三件套的完整游戏项目、以及借助 Blender MCP 生成白模运镜参考视频再交给 Seedance 出片等案例。

9月16日周三
  1. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

  2. Fireworks AI(@FireworksAI_HQ)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 实测:DeepSWE 智能体成本 99.6% 命中缓存,单任务 $0.43 对 $6.52

    Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。

9月15日周二
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 在 Artificial Analysis Intelligence Index v4.2 中并列第一

    Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。

  2. Hunyuan(@TXhunyuan)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 EvolveScaler:可执行状态机生成的信息演化评测基准

    腾讯混元推出 EvolveScaler,把世界定义为可执行状态机再渲染成自然语言,模拟记录被撤回、更正、回填的"信息演化"。该基准含 117 个原型、159 个问题算子、5 个难度层级,单样本事件量最高约 1,200。14 个前沿模型在最难层级上 avg@5 中位数降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。

  3. Elastic BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 在 2026 年 AV-Comparatives EPR 测试中拿下唯一满分

    Elastic Security 在 AV-Comparatives 2026 年 Endpoint Prevention and Response(EPR)测试中获得唯一的 100% 防护得分,并在 14 家厂商中实现最低的建模运营占用与零误报。

9月14日周一
  1. eric zakariasson(@ericzakariasson)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    是否已有针对 bot / AI worker 的 benchmark?对 grok bot、muse、hermes、openclaw 等的评测

    有人在 X 上发问是否已存在针对 bot / AI worker 的 benchmark,并点名 grok bot、muse、hermes、openclaw 等待评测对象,但未给出任何实测数据、指标或结果。该帖获 404 点赞、74 条回复、11 次转发,浏览量达 42370。

  2. 大淘宝技术AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    淘天自研编码器 S266 斩获 MSU 2025 视频编码器大赛 6 项冠军

    淘天音视频技术团队自研的 H.266/VVC 编码器 S266 在第19届 MSU 世界视频编码器大赛(MSU 2025 FullHD 赛道)包揽 1 FPS、5 FPS、30 FPS 三个速度档位的 VMAF 冠军,S26X 则在 1 FPS 档位拿下 SSIM、PSNR 和主观评价三项第一,累计 6 项冠军及 1 项季军。

  3. 夕小瑶科技说AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测5款国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 与开源 Zing-0.5 各有什么能耐

    夕小瑶科技说实测了5款已开放体验的国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 和 8月26日开源的 Zing-0.5,从漫游、导演、联合控制三类能力评估输入还原度、运动一致性、物理合理性与导演表现。

9月10日周四
  1. Browser Use(@browser_use)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1 Flash 在浏览器任务上成本比 Sol 和 Opus 低 50 倍

    Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。

  2. Perplexity(@perplexity_ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 评测 13 个检索模型:pplx-embed-v1-4b 在 Web Ranking 与 Combined 居首

    Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。

  3. Perplexity(@perplexity_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Q2D-Web 用 agent 引用、生产网页排名与 LLM 判断扩充的相关性集合测试模型表现

    Q2D-Web 采用三套相关性集合:agent 引用、生产环境网页排名,以及用 LLM 判断扩充的合并集合。这三套集合旨在降低漏判、减少对单一标注流程的依赖,同时测试相关性定义如何影响模型表现。

  4. Perplexity(@perplexity_ai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 推出 Q2D-Web 基准与公开榜单,评测 agentic RAG 检索

    Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。

9月9日周三
  1. Greg Brockman(@gdb)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-Image-2.5 的 Sunburst 与 Flare 登顶图像 Arena 榜单

    Arena.ai 数据显示,OpenAI 的 GPT-Image-2.5-Sunburst 在 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单均排名第一,Flare 排名第二。

  2. Cursor(@cursor_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 公布 CursorBench 完整评测结果

    Cursor 公布了 CursorBench 的完整评测结果,成绩页面已在 cursor.com/cursorbench 上线。该结果帖获得 39267 次浏览、98 个点赞与 14 条回复。

9月8日周二
  1. Latent.Space(@latentspacepod)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 推出 Frontier AEO 追踪器,解析 Astra 与 Fable 的优先来源

    Latent.Space 发布 Frontier AEO 追踪器项目,用于分析 Astra 优先关注什么、使用哪些来源,以及从 Sol 到 Astra、从 Opus 到 Fable 发生了哪些变化。相关答案已收录在 latent.space/p/aeo。

  2. SemiAnalysisAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 首次第三方实测 TPUv7 Ironwood 推理:每美元性能最高领先 B300 96%

    SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。

9月6日周日
  1. Browser Use(@browser_use)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 在 Browser Use Benchmark v2 上以 77.3% 大幅领先 Opus 5 与 GPT-5.6

    Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。

9月5日周六
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 前端生成能力实测:孩子几轮对话做出「咪咪小镇」

    有用户用 GPT 6 给孩子做「咪咪小镇」项目,给出参考后几轮对话就生成了界面,孩子被界面吸引。室内原本没有 3D 场景,孩子用一句话提出让居民能"现实进去"、每栋楼都要能看到里面,随即也生成了。该帖称 GPT 6 的前端能力比之前强多了。

  2. Windsurf(@windsurf_ai)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 现已登陆 Devin Desktop 与 Devin CLI

    GPT-6 Astra 已在 Devin Desktop 和 Devin CLI 上线。在 FrontierCode 1.1 上,Astra 的成绩与 Fable 5 相差 0.4 分以内,成本却低 64%,并在内部测试基准上刷新 SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据。

  3. LlamaIndex 🦙(@llama_index)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 实测:每页贵 5 倍的文档抽取系统真的更准吗?

    LlamaIndex 评测了 14 个前沿系统在 370 份企业文档上的表现,将准确率与每页成本对照后发现,成本更高并不等于抽取更准。Agentic Plus 以不到第二名 1/3 的成本取得最高准确率,Agentic 与 Cost Effective 也常胜过每页贵数倍的系统。注册 LlamaParse 可获 10,000 免费额度试用 Extract。

9月4日周五
  1. Philipp Schmid(@_philschmid)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 多模态任务实用性获赞,图像推理与数据提取排第一

    Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。

  2. 向阳乔木推荐看AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 七个项目实测:网页、游戏与 PPT 表现如何

    作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6 Astra 发布,Terminal-Bench-Science 成头号评测基准

    OpenAI 发布 GPT-6 Astra,其在 Terminal-Bench-Science 0.1 上的成绩从 GPT-5.6 Sol 的 22.4% 跃升至 64.6%,提升 42.2 个百分点。

9月3日周四
  1. Patrick Loeber(@patloeber)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 征询早期反馈:该在哪些方面改进?

    Gemini 3.8 Flash 正在公开征集早期使用反馈,询问用户希望在哪些方面改进。该帖获得 945 条回复、1233 次点赞和 188485 次浏览。