跳到正文

#xAI

今日 0 条
9月23日周三
  1. Guillermo Rauch(@rauchg)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 评测:Opus 5.5、GPT 6 Sol、Fable 5.1 并列 97%,Grok 4.7 得分 94% 但便宜 2-7 倍

    最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。

9月22日周二
  1. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  2. 数字生命卡兹克AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo V2.6 系列模型并全面开源

    小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。

    为什么值得看

    作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。

  3. eric zakariasson(@ericzakariasson)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,并在视频编辑上表现突出

    Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。

  4. eric zakariasson(@ericzakariasson)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 实战用例:飞行模拟器对比 GPT-6 Astra

    Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。

  5. Cognition(@cognition_labs)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 在 FrontierCode 1.1 上得分略低于 Grok 4.6

    Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。

  6. Browser Use(@browser_use)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,Long Horizon Browser Use Benchmark v2 得分 39.9 仍落后 DeepSeek

    Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。

  7. eric zakariasson(@ericzakariasson)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7 模型卡:Terminal-Bench 从 20.3% 升至 38.0%

    xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。

  8. AI SDK(@aisdk)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Grok 4.7

    Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。

  9. eric zakariasson(@ericzakariasson)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,称在相同价格与速度下较 4.6 有明显改进

    xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。

  10. xAI(@xai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 与 4.6 对比:搭建开放世界城市游戏

    xAI 发布 Grok 4.7 与 Grok 4.6 的对比演示,两者分别用提示词构建开放世界城市游戏,4.7 的生成结果排在前面、4.6 排在后面。该对比由 xAI 官方账号发布,附有两段演示视频。

  11. xAI(@xai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 上线 Grok 4.7,接入 Cursor、Grok Build 与 Grok API

    xAI 宣布 Grok 4.7 已在 Cursor、Grok Build 和 Grok API 上线,并给出 x.ai/news/grok-4-7 了解详情。

  12. xAI(@xai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,称在同等价格与速度下较 Grok 4.6 有明显提升

    xAI 发布 Grok 4.7,称其相较 Grok 4.6 有显著提升,且价格与速度保持不变。

  13. xAI(@xai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,强化长任务处理、自检与安全防护

    xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。

  14. 向阳乔木推荐看AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok 4.7 上线,目前仅 Grok CLI 可用

    马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。

9月21日周一
  1. Vercel NewsAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 上线 SpaceXAI 的 Grok 4.7,9 月 27 日前调用享 40% 折扣

    Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。

9月2日周三
  1. xAI(@xai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LatchBio 发布 Grok 4.6 生物能力与安全防护评估

    xAI 转发 LatchBio 博客,内容为其对 Grok 4.6 生物学能力与安全防护措施的评估。该博客由 LatchBio 发布,原文未披露具体评测指标与结论。

  2. xAI(@xai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LatchBio 评估 Grok 4.6 生物安全监控与对抗性生物任务表现

    LatchBio 评估了 Grok 4.6 在生物安全监控和对抗性生物任务上的表现,发现其能正确识别并拒绝危险查询,包括经过恶意混淆的生物任务,同时仍可回答有益的科学问题。xAI 已在博客中公布这些结果。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

8月25日周二
  1. xAI(@xai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 的 Grok Voice Think Fast 2.0 登顶 Artificial Analysis Speech-to-Speech Index

    xAI 宣布 Grok Voice Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 上排名第一。该指数衡量语音智能体能否对听到的语音进行推理、解决真实客户问题,并通过智能体工具正确完成任务。

8月24日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 结合 Cursor 数据,智能体效率大幅提升

    Grok 4.6 结合 Cursor 数据后,在长时间运行的 knowledge work 任务上所需轮次仅为其他领先模型的一半,轮次减少意味着复杂智能体应用的成本更低。该模型由 xAI 推出,官方同步放出了架构细节。

8月15日周六
  1. Augment Code(@augmentcode)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 接入 Cosmos 三天,创下该平台最快采用曲线

    Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)

8月13日周四
  1. Poe(@poe_platform)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Poe,面向长时间运行智能体与编码,上下文 500K token

    Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。

  2. Windsurf(@windsurf_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Devin Desktop 与 Devin CLI

    Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。

8月12日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布:同价位下的日常主力模型

    SpaceXAI 推出 Grok 4.6,定位可日常使用的主力模型,在同等价格下相比 Grok 4.5 有显著提升。该模型具备前沿智能水平,被评价为一款好用的日常主力模型。

  2. Aman Sanger(@amanrsanger)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.6,同价下较 Grok 4.5 显著提升

    SpaceXAI 发布 Grok 4.6,称其具备前沿智能,并在保持与 Grok 4.5 相同价格的前提下带来显著提升。发布者同时提到更大更强的模型即将到来,但未给出具体型号或时间。

  3. AI SDK(@aisdk)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Grok 4.6

    AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。

  4. xAI(@xai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Grok Build、Cursor、Grok Bot 与 API

    Grok 4.6 今日起在 Grok Build、Cursor、Grok Bot 和 API 中上线。首周在 Cursor 和 Grok Build 内提供 2 倍使用额度,详情见 x.ai/news/grok-4-6。

  5. xAI(@xai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,速度与复杂任务能力超 Grok 4.5

    xAI 发布 Grok 4.6,称其速度超过同类模型,且能处理比 Grok 4.5 更具挑战性的任务。定价为每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,为其他前沿模型价格的一半。

  6. xAI(@xai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,称能力较 Grok 4.5 显著提升且价格不变

    xAI 发布 Grok 4.6,称其具备前沿智能水平,相较 Grok 4.5 有显著提升,且价格保持不变。

7月30日周四
  1. xAI(@xai)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0,官方称其在智能水平、转写准确率和对话能力上均有提升。相关介绍见 x.ai/news/grok-voic…。

  2. xAI(@xai)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 推出 Grok Voice Think Fast 2.0,面向真实场景语音智能体

    xAI 发布 Grok Voice Think Fast 2.0,专为真实世界语音智能体打造,可在嘈杂环境中清晰收音,能对复杂工作流进行推理,对话听起来也更自然。

7月22日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 上手感获好评,成为重度用户第二常用模型

    Grok 4.5 使用体验获好评,Dan Shipper 称其已成为 Kieran Klaassen 第二常用的模型,并直言需要更新自己的认知。

7月16日周四
  1. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

7月9日周四
  1. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 xAI 的 Grok 4.5

    Poe 平台现已上线 Grok 4.5。据 Poe 介绍,这是 xAI 的最新旗舰模型,带来更强的推理、编码能力和改进的长上下文处理,面向复杂多步工作和智能体任务。用户可通过 poe.com/grok-4.5 试用。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.5,GDPval-AA v2 排名第四

    SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。

  3. Sualeh Asif(@sualehasif996)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sualeh Asif 称单智能体迭代中更偏好 Grok 4.5 而非 Opus

    Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。

  4. Sualeh Asif(@sualehasif996)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 联合训练 Grok 4.5,成为其最强大模型

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。

  5. Aman Sanger(@amanrsanger)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作训练 Grok 4.5

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个面向软件工程以外领域打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升且完全从零训练,并期待后续模型。

5月19日周二
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作从头训练更大模型,总算力提升 10 倍

    Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。