Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。
Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。
Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。
xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。
Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。
xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。
xAI 发布 Grok 4.7 与 Grok 4.6 的对比演示,两者分别用提示词构建开放世界城市游戏,4.7 的生成结果排在前面、4.6 排在后面。该对比由 xAI 官方账号发布,附有两段演示视频。
xAI 宣布 Grok 4.7 已在 Cursor、Grok Build 和 Grok API 上线,并给出 x.ai/news/grok-4-7 了解详情。
xAI 发布 Grok 4.7,称其相较 Grok 4.6 有显著提升,且价格与速度保持不变。
xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。
马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
xAI 转发 LatchBio 博客,内容为其对 Grok 4.6 生物学能力与安全防护措施的评估。该博客由 LatchBio 发布,原文未披露具体评测指标与结论。
LatchBio 评估了 Grok 4.6 在生物安全监控和对抗性生物任务上的表现,发现其能正确识别并拒绝危险查询,包括经过恶意混淆的生物任务,同时仍可回答有益的科学问题。xAI 已在博客中公布这些结果。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
xAI 宣布 Grok Voice Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 上排名第一。该指数衡量语音智能体能否对听到的语音进行推理、解决真实客户问题,并通过智能体工具正确完成任务。
Grok 4.6 结合 Cursor 数据后,在长时间运行的 knowledge work 任务上所需轮次仅为其他领先模型的一半,轮次减少意味着复杂智能体应用的成本更低。该模型由 xAI 推出,官方同步放出了架构细节。
Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)
Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。
Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。
SpaceXAI 推出 Grok 4.6,定位可日常使用的主力模型,在同等价格下相比 Grok 4.5 有显著提升。该模型具备前沿智能水平,被评价为一款好用的日常主力模型。
SpaceXAI 发布 Grok 4.6,称其具备前沿智能,并在保持与 Grok 4.5 相同价格的前提下带来显著提升。发布者同时提到更大更强的模型即将到来,但未给出具体型号或时间。
AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。
Grok 4.6 今日起在 Grok Build、Cursor、Grok Bot 和 API 中上线。首周在 Cursor 和 Grok Build 内提供 2 倍使用额度,详情见 x.ai/news/grok-4-6。
xAI 发布 Grok 4.6,称其速度超过同类模型,且能处理比 Grok 4.5 更具挑战性的任务。定价为每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,为其他前沿模型价格的一半。
xAI 发布 Grok 4.6,称其具备前沿智能水平,相较 Grok 4.5 有显著提升,且价格保持不变。
xAI 发布下一代语音模型 Grok Voice Think Fast 2.0,官方称其在智能水平、转写准确率和对话能力上均有提升。相关介绍见 x.ai/news/grok-voic…。
xAI 发布 Grok Voice Think Fast 2.0,专为真实世界语音智能体打造,可在嘈杂环境中清晰收音,能对复杂工作流进行推理,对话听起来也更自然。
Grok 4.5 使用体验获好评,Dan Shipper 称其已成为 Kieran Klaassen 第二常用的模型,并直言需要更新自己的认知。
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
Poe 平台现已上线 Grok 4.5。据 Poe 介绍,这是 xAI 的最新旗舰模型,带来更强的推理、编码能力和改进的长上下文处理,面向复杂多步工作和智能体任务。用户可通过 poe.com/grok-4.5 试用。
SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。
Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个面向软件工程以外领域打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升且完全从零训练,并期待后续模型。
Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。