Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
xAI 围绕 Grok Bot 重建客户支持体系,由其自主响应客户、解决工单并管理队列,从而在不增加人手的情况下扩展业务。团队回忆约 1.5 年前为应对巨大咨询量曾做出第一版粗糙实现,当时总结的「爬、走、跑」经验至今仍适用,并强调要找到持续改进的飞轮、保持系统运转。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。
用户让 Grok 4.7 参考此前的视频,制作了一段 SpaceX Starship 发射的定格动画,并用 Starship 真实发射视频作为参考以提升素材准确度。作者称视频中的所有内容均由 Grok 生成。
Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。
Grok 4.7 现已在 v0 上线,9 月 27 日前使用可享 40% 折扣,入口为 v0.app 的 SpaceXAI 空间。SpaceXAI 称 Grok 4.7 相比 Grok 4.6 有显著提升,价格与速度保持不变。
Grok 4.7 已在 Devin Desktop 和 Devin CLI 上线,Cognition 同步确认该模型接入 Devin。在 FrontierCode 1.1 的 Extended 测试中,Grok 4.7 得分 59.4%,官方评估称其在高难度后端工程任务上表现优异。
Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。
Grok 4.7 现已在 Devin 中可用,在 FrontierCode 1.1 的 Extended 测试中得分 59.4%。Cognition 的评测显示,该模型在困难的后端工程任务上表现优异。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。
xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。
Guillermo Rauch 用一道涉及逆向工程运行中二进制的难题测试 Grok 4.7,结果被顺利解决,且速度非常快。
Grok 4.7 已在 Vercel 的 AI Gateway、fx 和 eve 上线,主打快、聪明、便宜。9 月 27 日前所有调用享受 40% 折扣,用户可通过 Gateway 配合 fx.sh 或 eve 试用。
Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。
xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。
xAI 发布 Grok 4.7 与 Grok 4.6 的对比演示,两者分别用提示词构建开放世界城市游戏,4.7 的生成结果排在前面、4.6 排在后面。该对比由 xAI 官方账号发布,附有两段演示视频。
xAI 宣布 Grok 4.7 现已在 Cursor、Grok Build 以及 Grok API 中可用,并给出 x.ai/news/grok-4-7 的了解更多链接。
xAI 发布 Grok 4.7,称其在保持与 Grok 4.6 相同价格和速度的前提下有明显改进。
xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。
马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
硅谷正围绕 Personal Agent 展开新一轮入口争夺,Town、Instinct、Grok Bot 和 Meta Muse 走出四条不同路线:Town 先做深邮箱,Instinct 取消独立 App 并把交代任务压缩成一条消息、进一步接管支付,Grok Bot 给每个人组一支 Bot 队伍,Muse 则靠免费、分发和专用虚拟机培养市场。
有人发帖征集 Grok bot 的周末使用技巧,邀请用户分享自己的最佳玩法。该帖获得 67 条回复、166 次点赞和 26046 次浏览。
这段说唱式内容以 Grok Bot、Raindrop 为主角,强调其基于上下文(context)运行、承接用户任务并在云端批量处理作业。歌词提到 routines、back-ends、tools、sandbox、token 等能力,并称其会通过 routine 而非一次性任务执行,最终以 Uber 方式发送报告。
Grok Voice API 现已上线 Transcribe 2.0,批处理定价 $0.10/小时,流式定价 $0.20/小时。详细内容见 xAI 官方博客。
Atlassian 在 Loom 中使用 Transcribe 2.0,发现它捕捉用户指令时更准确。用户可以用 Loom 口述变更需求,再直接导出到 Cursor 编写代码。
xAI 推出 Grok Voice Transcribe 2.0,在客服通话、口述凭证和短语音指令场景下,转录准确率是上一代的两倍。该消息由 xAI 官方账号发布,推文互动数据显示获得 123 次点赞、6 次转发。
xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转录模型。该消息由 SpaceXAI 在 X 上公布,未提及具体参数、评测数据或开放方式。
Grok Bot 现已支持开启自动更新,用户需升级至 0.40 版本才能启用该设置。官方表示过去 7 天共发布了 49 个新版本,自动更新可帮助用户及时用上最新功能。
Grok 的 bot 现在支持 webhook 触发,从任意位置唤醒。创建 routine 后点击「add trigger」选择 webhook,即可接入 WhatsApp 特定联系人消息、Notion 页面变更、家庭温度传感器阈值、桌面按钮、GitHub Action 完成或服务器错误率飙升等事件。
Grok Bot 新增 marketplace 和 Bot 模板功能,用户可从 marketplace 添加模板。官方首批分享的 Haggle Bot 用于谈判供应商合同、查找闲置 SaaS 席位并为经常性采购比价,上线一周已为其节省超 10 万美元。
Grok Bot 现在支持语音模式,可以开口说话了。该消息由 Grok Bot 官方账号发布,并附带了演示视频。
Grok Voice 已在 fal 上线,这款来自 SpaceXAI 的最新语音模型可在 0.70 秒内作答,并在句子说完前完成工具调用。它支持词级时间戳转写、25+ 种语言的 30+ 种音色文本转语音,以及用两分钟音频完成音色克隆。
有人在 X 上发问是否已存在针对 bot / AI worker 的 benchmark,并点名 grok bot、muse、hermes、openclaw 等待评测对象,但未给出任何实测数据、指标或结果。该帖获 404 点赞、74 条回复、11 次转发,浏览量达 42370。
Firecrawl 将 Developer Index 接入 Grok Build 插件,Grok 在写代码时可检索覆盖代码仓库、文档和 issue 的 7000 万+ 一手来源,用于核对 API 并查找修复方案。用户运行 /plugin 安装 Firecrawl 即可试用。
Copilot 迎来更多模型选择,SpaceXAI 的 Grok 模型开始在 Word、Excel 和 PowerPoint 的 Copilot 中滚动上线,首批面向 Microsoft Frontier 计划客户定向发布。
三个新 skills 可给任意应用加上语音能力:/add-dictation 说话即输入文字,/add-voice 与 Grok 实时对话,/add-read-aloud 把任意回复朗读出来。这些 skills 可从 marketplace 安装。
结合热点做的站点交给 GrokBot 自动更新,本以为只有第一天有流量,几天没管后流量依然稳定。作者正寻求变现方法,向社区征集建议。