Recraft 上线新模型体验入口并公布 API 速度基准
Recraft 开放了新功能的试用入口,并附上对比结果与 API 速度基准,该基准测量于 2026 年 9 月 21 日。用户可直接体验,或先查看对比数据了解表现。
Recraft 开放了新功能的试用入口,并附上对比结果与 API 速度基准,该基准测量于 2026 年 9 月 21 日。用户可直接体验,或先查看对比数据了解表现。
作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。
Qwen 发布 Benchmark suite,来源为 Qwen 官方账号 @Alibaba_Qwen。该帖互动数据为 2 条回复、0 次转发、46 次点赞、15491 次浏览,数据由 xgo.ing 提供。
Claude Opus 5.5 在默认 effort 设置下即可取得前沿结果,每任务成本仅为其他模型的一小部分,常常击败以最高设置运行的模型,输出速度比 Opus 5 快 30% 以上。有观察者据此认为它把 fable 和 astra 都比了下去。
Qwen-Image-2.1 成为 Image Edit Arena 和 Text-to-Image Arena 的双料第一开源模型。其在 Image Edit Arena 拿下 1367 分,位列开源模型榜首,总榜排名第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 仅差 3 分。该模型由阿里 Qwen 团队推出,现已开放试用。
Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。
Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。
作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。
Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。
LangChain 发文介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准后的评估器和自动化发布门禁。
Genspark Slides Benchmark 已被纳入 Fireworks AI 的 Specialized Intelligence Index(SII)。Genspark 首个自研模型 Gen-1 Slides 在其评测中实现前沿级演示文稿(deck)质量,输入 token 价格约为前者的 1/17。评测结果可在 fireworks.ai/specialized-in… 查看。
Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。
Fireworks AI 发布 Specialized Intelligence Index(SII),这是一个汇集各行业真实工作基准的统一入口,由日常使用这些基准的团队构建。联合创始人 @the_bunny_chen 说明了专业化基准的重要性。
Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。
Lovable 现已支持使用 GPT-6 Sol 构建应用。在其 0-to-1 构建基准上,GPT-6 Sol 在每个 effort level 下得分比 GPT-5.6 Sol 高 6% 至 12%,其中意图对齐(理解需求)提升 10% 至 15%,设计基础能力提升 8% 至 10%。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
Claude Opus 5.5 现可在 Devin Desktop 和 Devin CLI 中使用。在 FrontierCode 1.1 上,Opus 5.5 以远低于 Fable 5 的成本拿下第一。
Opus 5.5 在 Cognition 的 FrontierCode 1.1 基准上取得 Extended 65.3% 的成绩,超越 Fable 5 登顶,且成本仅为后者的一小部分。该基准针对真实工程任务,评估代码的可合并性与质量。
Claude Opus 5.5 现已在 Devin 中可用。在 FrontierCode 1.1 上,Opus 5.5 从 Fable 5 手中拿下第一,且成本仅为其一小部分。
Claude Opus 5.5 现已在 Perplexity Computer 中作为 Standard effort 级别提供。在 WANDR benchmark 上,它以每任务 4.13 美元得分 0.610,略优于 Claude Fable 5.1,且每任务成本低 67.6%。
mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。
mem0 发布 DolphinBench,这是一个面向 AI 智能体记忆的评测基准,把准确率、成本与延迟放在同一张榜单上。它不再像传统记忆评测那样只出题判分,而是考察长历史之后智能体能否在工具调用中采取正确行动。DolphinBench 已在 dolphinbench.ai 上线。
腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。
Fireworks 在 DeepSWE 上让 18 个模型跑 113 个真实编码任务,再假设每个任务都交给处理最好的模型,得到 97.6% 解决率、每任务 1.88 美元,而最佳单模型为 74.1%、每任务 6.52 美元。其结论是下一步方向在于路由器。完整分析见 fireworks.ai/blog/the-front…
Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。
Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。
Logan Kilpatrick 建议,用 AI 构建产品时应把超过 25% 的时间花在制作 benchmark 上,并设法让模型实验室关注这些 benchmark,他认为这是加速公司进展的最快路径。
Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。
Grok 4.7 现已在 Devin 中可用,在 FrontierCode 1.1 的 Extended 测试中得分 59.4%。Cognition 的评测显示,该模型在困难的后端工程任务上表现优异。
NVIDIA 提出 AI 智能体评估需从单一函数调用打分转向整个任务完成度,核心是能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对"几乎无法说明任务是否真正完成,这正是智能体评估必须演进的原因。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。
HyperFrames 联合 Google DeepMind 和 Kaggle 推出 Code2Video Bench,用于衡量模型生成的代码能否渲染成值得观看的视频。该基准指出,SWE-bench 意义上的代码能力与"代码转视频"是两回事,目标是让前沿实验室在智能体视频任务上取得进展。
xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。
Guillermo Rauch 用一道涉及逆向工程运行中二进制的难题测试 Grok 4.7,结果被顺利解决,且速度非常快。
Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。