Jev 能否替代 RAG 中的 reranker?在 Milvus 短名单上实测三种方案
在 Milvus 短名单上对 80 条 SciFact 查询实测三种方案:qwen3.7-text-rerank 将 nDCG@10 提升 0.0446,Jev 提升 0.0778,排名最优。但 Jev 的 P50 重排延迟是 qwen 的 10.2 倍,单次运行成本约为 6.7 倍。以 0.5 为阈值直接按概率过滤时,top-5 精确率 49.4%,但有 18.8% 的金标准相关文档被滤除。
在 Milvus 短名单上对 80 条 SciFact 查询实测三种方案:qwen3.7-text-rerank 将 nDCG@10 提升 0.0446,Jev 提升 0.0778,排名最优。但 Jev 的 P50 重排延迟是 qwen 的 10.2 倍,单次运行成本约为 6.7 倍。以 0.5 为阈值直接按概率过滤时,top-5 精确率 49.4%,但有 18.8% 的金标准相关文档被滤除。
LangChain 用 Deep Agents 构建天气 agent,在 LangSmith 数据集上对比 TypeSafe AI 的 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 三种 LLM 评委。
Qdrant 在五个公开数据集上实验了向量检索的候选深度:若最终只要 5 条结果,先召回 100 个候选能给重排序或融合阶段更多素材。把 limit 从 10 提到 500,最优可能的 nDCG@10 最多提升 0.28,但实际得分变化不超过 0.01——有时文档已被召回,只是排名不够高。
阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。
作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。
LangChain 测试了 Jev 作为语义评判器(jev as a judge),并与 LLM judges 在准确率、可重复性、延迟和成本四个维度上做对比,以验证 System One 模型能否为智能体评估提供新思路。该方案定位为便宜、快速的语义评判器,尤其适合需要给大量 trace 打分的在线评估场景。
作者参与阶跃新一代旗舰模型 Step 5 Preview 内测,将其接入 Claude Code 完成五个项目:three.js 昆明 3D 网站跑了近 3 小时、把自研 Mac 截图工具 Ta 移植成 Windows 版、手机端 MD+HTML 阅读器墨读、广告小游戏复刻,以及网页虚拟机械臂接入 GLM-5.3-Flash 画画。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。
NVIDIA Dynamo AIPerf 用于在流量增长时衡量 LLM 端点的 TTFT、ITL、延迟和吞吐,并可用可重复的真实流量模式进行测试。该工具面向规模化场景,帮助回答 LLM 端点在高负载下的性能表现。
Artificial Analysis 指出,近几周 Muse Image、MAI-Image-2.6 和 GPT Images 2.5 显著推动了文生图在价格与速度两条帕累托前沿的移动,生成高质量图像比以往更便宜、更快。Mustafa Suleyman 转发称这是全球图像生成领域最佳的性价比表现。
奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。
Jev 在分类任务上表现突出,做邮件分类和对线索评分都很好用。有用户为验证 Jev 的判断速度,让其进行邮件分类,并与各家 AI 的高速模型 Luna、Sonnet、Flash 对比,Jev 结果领先。
Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。
Vercel Sandbox 现已支持运行 Harbor 评测,Harbor 是 Terminal-Bench 背后的开源评测框架,其注册表还包含 SWE-bench、tau3-bench 和 OSWorld 等基准。
豆包 Doubao-Seed-2.1-pro 升级到 0915 版本,官方称重点提升 Coding、Agent 与多模态能力。作者实测了用平面图和作品资料生成三维电子展馆网页、从零策划含 Office 三件套的完整游戏项目、以及借助 Blender MCP 生成白模运镜参考视频再交给 Seedance 出片等案例。
Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。
Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。
Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。
腾讯混元推出 EvolveScaler,把世界定义为可执行状态机再渲染成自然语言,模拟记录被撤回、更正、回填的"信息演化"。该基准含 117 个原型、159 个问题算子、5 个难度层级,单样本事件量最高约 1,200。14 个前沿模型在最难层级上 avg@5 中位数降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。
Elastic Security 在 AV-Comparatives 2026 年 Endpoint Prevention and Response(EPR)测试中获得唯一的 100% 防护得分,并在 14 家厂商中实现最低的建模运营占用与零误报。
有人在 X 上发问是否已存在针对 bot / AI worker 的 benchmark,并点名 grok bot、muse、hermes、openclaw 等待评测对象,但未给出任何实测数据、指标或结果。该帖获 404 点赞、74 条回复、11 次转发,浏览量达 42370。
淘天音视频技术团队自研的 H.266/VVC 编码器 S266 在第19届 MSU 世界视频编码器大赛(MSU 2025 FullHD 赛道)包揽 1 FPS、5 FPS、30 FPS 三个速度档位的 VMAF 冠军,S26X 则在 1 FPS 档位拿下 SSIM、PSNR 和主观评价三项第一,累计 6 项冠军及 1 项季军。
夕小瑶科技说实测了5款已开放体验的国产世界模型:蚂蚁 LingBot-World 2.0、阿里 HappyOyster 1.0、腾讯混元 HY-World 2.1、爱诗 R1 和 8月26日开源的 Zing-0.5,从漫游、导演、联合控制三类能力评估输入还原度、运动一致性、物理合理性与导演表现。
Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。
Q2D-Web 采用三套相关性集合:agent 引用、生产环境网页排名,以及用 LLM 判断扩充的合并集合。这三套集合旨在降低漏判、减少对单一标注流程的依赖,同时测试相关性定义如何影响模型表现。
Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。
Arena.ai 数据显示,OpenAI 的 GPT-Image-2.5-Sunburst 在 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单均排名第一,Flare 排名第二。
Cursor 公布了 CursorBench 的完整评测结果,成绩页面已在 cursor.com/cursorbench 上线。该结果帖获得 39267 次浏览、98 个点赞与 14 条回复。
Latent.Space 发布 Frontier AEO 追踪器项目,用于分析 Astra 优先关注什么、使用哪些来源,以及从 Sol 到 Astra、从 Opus 到 Fable 发生了哪些变化。相关答案已收录在 latent.space/p/aeo。
SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。
Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。
有用户用 GPT 6 给孩子做「咪咪小镇」项目,给出参考后几轮对话就生成了界面,孩子被界面吸引。室内原本没有 3D 场景,孩子用一句话提出让居民能"现实进去"、每栋楼都要能看到里面,随即也生成了。该帖称 GPT 6 的前端能力比之前强多了。
GPT-6 Astra 已在 Devin Desktop 和 Devin CLI 上线。在 FrontierCode 1.1 上,Astra 的成绩与 Fable 5 相差 0.4 分以内,成本却低 64%,并在内部测试基准上刷新 SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据。
LlamaIndex 评测了 14 个前沿系统在 370 份企业文档上的表现,将准确率与每页成本对照后发现,成本更高并不等于抽取更准。Agentic Plus 以不到第二名 1/3 的成本取得最高准确率,Agentic 与 Cost Effective 也常胜过每页贵数倍的系统。注册 LlamaParse 可获 10,000 免费额度试用 Extract。
Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。
作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。
OpenAI 发布 GPT-6 Astra,其在 Terminal-Bench-Science 0.1 上的成绩从 GPT-5.6 Sol 的 22.4% 跃升至 64.6%,提升 42.2 个百分点。
Gemini 3.8 Flash 正在公开征集早期使用反馈,询问用户希望在哪些方面改进。该帖获得 945 条回复、1233 次点赞和 188485 次浏览。