跳到正文

全部动态

今日 17 条
7月22日周三
  1. Google AI Developers(@googleaidevs)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 称 Gemini 3.6 Flash 在 BU Benchmark 达 68%

    Browser Use 表示,Gemini 3.6 Flash 是他们测试过的浏览器智能体中性价比最高的模型,在其 BU Benchmark 上达到 68%。该成绩超过 GPT-5.6-sol 的 67% 和 Sonnet 4.6 的 62%,仅次于 Opus 4.8 的 74%,但成本仅为后者的一小部分。

  2. Google AI Developers(@googleaidevs)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenCode 上线 Gemini 3.6 Flash 与 3.5 Flash Lite,支持 1M 上下文

    OpenCode 现已接入 Gemini 3.6 Flash 和 3.5 Flash Lite,均支持 1M 上下文。其中 3.6 Flash 的输出价格比 3.5 Flash 便宜 17%,Flash Lite 则便宜 80%。

  3. Google AI Developers(@googleaidevs)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 上线 Vercel AI Gateway

    Vercel 将 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 接入 AI Gateway,模型标识分别为 'google/gemini-3.6-flash' 和 'google/gemini-3.5-flash-lite'。开发者可经 Vercel AI Gateway 调用这两款模型。

  4. Google AI Developers(@googleaidevs)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    合作伙伴如何将 Gemini 3.6 Flash 与 3.5 Flash-Lite 集成进日常工具

    Google 展示了合作伙伴如何把最新的 Gemini 3.6 Flash 和 3.5 Flash-Lite 模型集成进用户日常使用的工具中。原文未披露具体合作方、参数规模或 benchmark 数据。

  5. Microsoft Research(@MSFTResearch)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 感谢数据集创建者与社区贡献者,并征集下一版本的语言支持

    Microsoft Research 公开致谢数据集创建者、社区贡献者、维护者与合作伙伴,称他们持续推动这项工作。该团队同时开放征集额外语言支持,以用于下一个版本的发布。

  6. Varun Mohan(@_mohansolo)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.6 Flash 上线 Antigravity,全体每周配额重置

    Gemini 3.6 Flash 已在 Antigravity 上线。发布者同时宣布重置所有人的每周配额,方便用户继续构建。

  7. Google AI(@GoogleAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash Cyber,专攻网络安全漏洞

    Google 推出 Gemini 3.5 Flash Cyber,基于 3.5 Flash 构建,在 CyberGym 等基准上达到前沿竞争力,面向规模化发现与修复网络安全漏洞场景优化,成本更低。该模型将在 AI 代码安全智能体 CodeMender 中独家提供给政府和可信伙伴,作为限时访问试点项目的一部分。鉴于技术的双用途性质,Google 对部署采取了审慎方式。

  8. Google AI Developers(@googleaidevs)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.6 Flash 与 3.5 Flash-Lite 上线 Gemini API

    Google AI Developers 宣布 Gemini 3.6 Flash 和 3.5 Flash-Lite 即日起在 Gemini API 中可用,开发者可通过 Google AI Studio 和 Android Studio 使用。此外,Gemini 3.6 Flash 还可在 Antigravity 和 Gemini Enterprise Agent Platform 中构建。

  9. Google AI Developers(@googleaidevs)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash-Lite

    Google 发布 Gemini 3.5 Flash-Lite,官方称其是面向低延迟、高吞吐开发者工作流的最快且最具成本效益的模型。该模型针对规模化重复任务、并行 subagent、agentic search 和大批量文档处理做了优化。

  10. Google AI Developers(@googleaidevs)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite

    Google AI Developers 宣布发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,两款模型面向可扩展的智能体工作流,强调 token 效率与更低延迟。推文提示可阅读后续线程了解更多细节。

7月21日周二
  1. Patrick Loeber(@patloeber)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者实测 Gemini 3.6 Flash:token 效率更高、速度更快

    开发者 Patrick Loeber 表示自己过去几周用 Gemini 3.6 Flash 做开发,感觉它明显更好,token 效率更高,因此往往也更快,并为此写了一篇包含全部细节的开发指南,链接为 ai.google.dev/gemini-api/doc…。

  2. Jeff Dean(@JeffDean)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.6 Flash 等三款新模型

    Google DeepMind 推出三款新模型,用于让 AI 智能体更快、更聪明且更便宜。Gemini 3.6 Flash 用比 3.5 Flash 更少的 token 在相同成本下完成更高质量的工作;Gemini 3.5 Flash-Lite 面向文档处理和智能体搜索等日常任务;Gemini 3.5 Flash Cyber 用于发现并修补关键软件漏洞。

  3. Patrick Loeber(@patloeber)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.6 Flash 与 3.5 Flash-Lite

    Google 发布 Gemini 3.6 Flash 和 3.5 Flash-Lite。3.6 Flash 修复了关键问题并提升 token 效率,价格低于 3.5 Flash;3.5 Flash-Lite 相比 3.1 FL 大幅提升,定位超低成本、高吞吐任务。

  4. Google DeepMind BlogAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,主打规模构建 AI 智能体的效率、延迟与可靠性。

  5. Microsoft Research(@MSFTResearch)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aurora 1.5 扩展开放预测能力,Flint 重定义可视化,FlowDAgger 加速自适应

    微软研究院推出 Aurora 1.5,将开放预测能力进一步扩展,同时发布 Flint 重定义可视化、FlowDAgger 加速自适应。此外,AI 智能体攻破了 Rowhammer 防御,内存技术正在重塑对话式 AI。

7月20日周一
  1. Interconnects AI — Nathan LambertAI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 发布:开放权重的升级与生态新格局

    Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。

    为什么值得看

    从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。

  2. 通义大模型AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含面向实时交互的 Flash 版和面向高质量生成的 Plus 版,Flash 首包延迟约 300ms。

  3. 字节跳动SeedAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布 Seed Audio 1.0 音频创作模型

    字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,已在火山方舟体验中心上线。该模型支持一条 prompt 统一编排对白、音效与环境声并做时间控制,当前时间控制精度为 100ms,单次可生成约 2 分钟音频并支持延展,保持角色音色一致,覆盖 20+ 语种。

7月17日周五
  1. Google DeepMind BlogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,专门用于快速查找、验证并修复漏洞。

  2. 通义大模型AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室发布 Wan-Streamer v0.2:端到端响应延迟 550ms

    通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。

  3. AI SDK(@aisdk)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Moonshot 发布 Kimi K3 模型,2.8 万亿参数、100 万上下文,将开放权重

    Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。

    为什么值得看

    Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。

7月16日周四
  1. Junyang Lin(@JustinLin610)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布多模态模型 Inkling,全量权重开放但小模型未开源

    Thinking Machines 发布多模态模型 Inkling,可跨文本、图像和音频模态高效推理,全量权重已开放,并可在 Tinker 上微调。林俊旸(@JustinLin610)对此表示称赞,同时追问小模型为何没有开源。

  2. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

  3. Lilian Weng(@lilianweng)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布开放权重模型 Inkling

    Thinking Machines 推出开放权重模型 Inkling,定位为在广泛能力类别上表现扎实的基础模型,可用于实际使用与定制。Inkling 能跨文本、图像和音频模态高效推理,官方公开完整权重,并已在 Tinker 上开放微调,同时提供 Inkling Playground 供试用。

  4. Hugging Face(@huggingface)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 发布新的开源权重模型

    Hugging Face 宣布发布新的开放权重模型,未披露具体模型名称、参数规模与性能数据。

7月15日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy3 的 1-bit 与 4-bit 量化版本,295B 模型单卡可跑

    腾讯混元发布旗舰级 295B 模型 Hy3 的 1-bit 与 4-bit 版本,可在单 GPU 上部署。该模型支持通过 llama.cpp 运行并开启 MTP,在更低硬件门槛下获得强大智能,相关 benchmark 与下载链接已放出。

  2. Hunyuan(@TXhunyuan)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy3 获开发者实测好评:小模型在 OpenRouter 用量最高,3 条提示词生成应用

    腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。

  3. 通义大模型AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里通义发布 Qwen-Audio-3.0-Realtime 实时语音交互模型

    阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。

  4. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 首次在 IQ 测试中得分超过 130

    GPT-5.6 在 IQ 测试中取得 136 分的初始成绩,据称比 99% 的人类更聪明,并成为首个得分超过 130 的模型。

7月12日周日
  1. 阶跃星辰AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布端侧模型全家桶 Step Edge

    阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。

7月10日周五
  1. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 OpenAI GPT-5.6 系列:Sol、Terra、Luna

    Poe 宣布上线 OpenAI 的 GPT-5.6 系列,包含 Sol、Terra、Luna 三款模型。据其说明,GPT-5.6-Sol 是 OpenAI 目前最强的模型,面向复杂推理、高级编码和智能体工作流;GPT-5.6-Terra 侧重日常办公、编码、分析与研究的均衡能力;GPT-5.6-Luna 主打快速、低成本,适合高并发和常规任务。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报

    Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报,面向真实场景的天气、气候和能源应用。该版本由 Microsoft Research 发布。

7月9日周四
  1. AI at Meta BlogAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测

    Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。

    为什么值得看

    Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。

  2. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 xAI 的 Grok 4.5

    Poe 平台现已上线 Grok 4.5。据 Poe 介绍,这是 xAI 的最新旗舰模型,带来更强的推理、编码能力和改进的长上下文处理,面向复杂多步工作和智能体任务。用户可通过 poe.com/grok-4.5 试用。

  3. Sualeh Asif(@sualehasif996)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.5,GDPval-AA v2 排名第四

    SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。

  4. Sualeh Asif(@sualehasif996)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sualeh Asif 称单智能体迭代中更偏好 Grok 4.5 而非 Opus

    Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。

  5. Sualeh Asif(@sualehasif996)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 联合训练 Grok 4.5,成为其最强大模型

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。

  6. Aman Sanger(@amanrsanger)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作训练 Grok 4.5

    Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个不止面向软件工程打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升,完全从零训练。

  7. Scott Wu(@ScottWu46)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-1.7,推理速度达 1000 tok/s

    Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。

  8. Windsurf(@windsurf_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-1.7,上线 Devin Desktop 与 Devin CLI

    Cognition 发布其迄今最强的模型 SWE-1.7,已在 Devin Desktop 和 Devin CLI 上线。官方称其成绩与最强前沿模型仅差几分,成本仅为后者一小部分,并以 1000 tok/s 的闪电模式提供服务,团队表示在扩展规模时仍持续看到 RL 带来收益。