跳到正文

全部动态

今日 20 条
9月3日周四
  1. Google DeepMind BlogAI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,称前者在软件工程、智能体任务和多步推理上有明显提升,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    为什么值得看

    官方披露了两款新模型的基准表现、定价与访问渠道,可用于对比 Flash 系列在编码与网络安全能力上的迭代节奏。

  2. Sundar Pichai(@sundarpichai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 3.8 Flash Cyber 在真实 Chrome 安全漏洞评测中修复补丁数达更大模型 2.6 倍

    在真实 Chrome 安全漏洞评测中,3.8 Flash Cyber 生成的正确漏洞修复补丁数量是更大模型的 2.6 倍。凭借这一能力,Google 通过 Fairwind 计划向政府机构和网络安全合作伙伴开放该模型的使用权限。

  3. Sundar Pichai(@sundarpichai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash Cyber 网络安全模型

    Google 推出 Gemini 3.8 Flash Cyber,称其为能力最强的网络安全模型,在漏洞发现和规模化修复上达到前沿水平,同时保持 Flash 级速度与定价。该模型在 CyberGym 基准上取得 86.2%,在 CWE-Bench 修复任务上取得 47.2%,内部基准上跨 20 种编程语言的漏洞发现成功率超过 70%。

  4. AI SDK(@aisdk)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 支持使用 Gemini 3.8 Flash

    AI SDK 宣布支持使用 Gemini 3.8 Flash。Google 发布 Gemini 3.8,称其为目前推理与编码能力最强的模型,并基于 3.7 Flash 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个新变体,依托长时间运行的智能体循环构建。

  5. Philipp Schmid(@_philschmid)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    3.8 相比 3.7 大幅提升,速度极快

    3.8 相比 3.7 不仅性能大幅提升,速度也极快。原文未披露具体模型、参数或 benchmark 数据。

  6. Sundar Pichai(@sundarpichai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 3.8 Flash 模型,六周内第三次 Flash 更新

    Google 发布新 3.8 Flash 模型,这是六周内的第三次 Flash 发布。官方称其在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,在 DeepSWE v1.1 上能以更低成本自主端到端解决复杂工程问题,表现超过多数更大的前沿模型。

9月2日周三
  1. Varun Mohan(@_mohansolo)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 发布,在 agentic 编码与通用知识工作上较 3.7 Flash 明显提升

    Gemini 3.8 Flash 发布,相比 3.7 Flash 在 agentic 编码和通用知识工作上都有明显提升。作者表示团队内部使用体验良好,该模型现已在 Antigravity 上向所有人开放。

  2. Google AI Developers(@googleaidevs)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 用 ThreeJS 在 Google AI Studio 生成 3D 硬件拆解可视化

    Gemini 3.8 Flash 面向复杂推理打造,Google 用它与 ThreeJS 在 Google AI Studio 搭建了一个交互式 3D 可视化工具。该模型能生成比例真实的硬件拆解图,自动将设备分解为多个图层,用户可通过拆解滑块逐层展开查看。

  3. Google AI Developers(@googleaidevs)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 3.8 Flash 上手构建指南

    Google 发布 3.8 Flash,并给出如何用它开始构建的说明。推文附上 blog.google 的官方博客链接,可直接查看具体接入方式。内容未提及参数规模、benchmark 或定价信息。

  4. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 在 DeepSWE 1.1 上得分 73.7%

    Gemini 3.8 Flash 在 DeepSWE 1.1 上取得 73.7% 的分数。该结果由 Logan Kilpatrick 在社交平台公布,帖文获得 3634 次点赞、551411 次浏览。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber

    Google 发布 Gemini 3.8,称其为目前最强的推理与编码模型,并推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,依托长时运行的智能体循环。

  6. Philipp Schmid(@_philschmid)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 正式发布,价格不变并成为默认模型

    Gemini 3.8 Flash 正式 GA,这是 6 周内第三次 Flash 发布,官方称其在所有领域整体优于 3.7 Flash,价格保持每 1M token $0.75 / $3.75 不变。

  7. Patrick Loeber(@patloeber)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,智能体与编码能力较 3.7 Flash 提升

    Google 发布 Gemini 3.8 Flash,在智能体与编码能力上较 3.7 Flash 有显著提升,且价格与 3.7 Flash 保持一致。

  8. Google Gemini App(@GeminiApp)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 上线,面向 Pro 和 Ultra 用户开放

    Google 最新 Gemini 3.8 Flash 模型今日起面向 Pro 和 Ultra 用户开放。该模型主打更可靠、更全面的回答,可处理日常话题的实用建议,以及文本分析、复杂编程等深度任务。

  9. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash:价格与速度接近 3.7,已上线 Gemini API 等平台

    Google 发布 Gemini 3.8 Flash,其价格与 3.7 相同,速度也大致相当,可通过 Gemini API、AI Studio、Antigravity、Gemini App 等渠道使用。作者称团队正努力保持在前沿水平,并附上官方博客链接供了解更多。

  10. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,称智能体与编码能力再进一步

    Google 发布 Gemini 3.8 Flash,官方称其在智能体与编码能力上又有提升。这是 Gemini 在六周内第三次更新 Flash 模型。

  11. Google AI(@GoogleAI)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash,主打智能体与多步骤任务

    Google 发布 Gemini 3.8 Flash,定位为面向复杂智能体和多步骤任务的最智能主力模型,在推理上有明显提升,可处理模糊且高摩擦的任务并参与复杂项目。3.8 Flash 提供一贯的 effort 控制,让任务所需的思考量与 tokens 消耗成比例。官方演示中,它结合原生视频理解与高级编码,在 @antigravity 中自主构建 3D 游戏、试玩找错并在智能体循环中执行代码修改。

  12. Google AI(@GoogleAI)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 面向 Gemini 应用、搜索 AI Mode 等产品开放新 Gemini 能力

    Google AI 宣布该能力面向 Google AI Pro 和 Ultra 订阅用户开放,覆盖 Gemini App、Google Search 的 AI Mode 和 Google Sheets。

  13. Google DeepMind(@GoogleDeepMind)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款模型

    Google DeepMind 发布两款新 Gemini 模型。Gemini 3.8 Flash 官方称为目前最智能的模型,在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升;Gemini 3.8 Flash Cyber 面向网络安全,具备前沿水平的漏洞检测与自动修复能力。

  14. 阿里研究院AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    千问 Qwen3.8-Max 升级 0902 版本,主打编程与专业办公

    千问 Qwen3.8-Max 升级到 0902 版本,围绕编程(Coding)和专业办公(Cowork)进行后训练,更适合企业真实复杂任务、科研和长周期任务。在 CodeArena 前端编程总榜中,该版本提升 22 分至 1691 分夺得冠军,在多步推理、工具调用、端到端 app 生成方面刷新成绩。

  15. Qwen(@Alibaba_Qwen)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 在 Code Arena 登顶,1,691 分、$5/MToken 居性价比前沿

    阿里 Qwen 发布 Qwen3.8-Max-0902,在 Code Arena 的 WebDev 榜以 1,691 分登顶总榜第一,并以 $5/MToken 成为性价比前沿上得分最高的模型。

  16. Qwen(@Alibaba_Qwen)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 登顶 CodeArena WebDev 榜单

    Qwen3.8-Max-0902 在 CodeArena WebDev 排行榜升至第一,得分从 1669 提升到 1691,创下智能体编码(WebDev)工作流的新纪录,在多步推理、工具调用和完整应用生成方面表现突出。

  17. Qwen(@Alibaba_Qwen)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3.8-Max-0902,2.4T 参数、1M 上下文

    Qwen 将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,上下文窗口 1M tokens。该版本在 Coding 与 Cowork 方向做了后训练,官方称在复杂企业任务、科研和长周期工作流上表现更强。API 定价为每 1M tokens 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25,现已在 QwenCloud 上线。

    为什么值得看

    官方给出参数规模、上下文长度和 API 定价,读者可据此判断它在长流程任务上的接入成本。

  18. cat(@_catwu)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为面向编码和知识工作的最先进模型。一位用户转述称,团队借助 Fable 5.1 承接了此前需数月才能完成的更大项目,并可在 Claude Code、Claude Cowork、Claude Tag 中调用该模型。

  19. Mike Krieger(@mikeyk)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,宣称是面向编码与知识工作最先进的模型。Fable 系列面向可自主运行的复杂多步任务,Fable 5.1 在编码、知识工作和长时程问题求解上设定了新标准。

  20. AI SDK(@aisdk)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Claude Fable 5.1

    AI SDK 现已支持通过其调用 Claude Fable 5.1。Anthropic 新推出的 Claude Fable 5.1 与 Claude Mythos 5.1 号称是全球最强的编码与知识工作模型,此次集成让开发者可直接在 AI SDK 中接入这一模型。

  21. Alex Albert(@alexalbert__)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 与 Claude Mythos 5.1 发布

    Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为全球最先进的编程与知识工作模型。Fable 5.1 能根据几句含糊描述补全需求细节,被评价为真正好用的模型。

  22. Google AI Developers(@googleaidevs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 用智能体视频理解能力数掌声

    Gemini 3.7 Flash 借助新的智能体视频理解能力,能准确识别并数清每一次拍手。由于静态处理默认以固定 1 FPS 读取视频,拍手这类瞬间动作容易被漏掉或与响指、点击声混淆,新能力会按需自动调整处理速度。

  23. Fei-Fei Li(@drfeifei)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 发布多模态世界模型 Atlas

    World Labs 发布多模态世界模型 Atlas,称其为首个从零训练的多模态世界模型,支持像素级精确的相机控制生成画面。Atlas 可从单张输入图像重建大场景,通过重构视频模拟时空,并能从一张或多张图像原生输出 3D 空间、将多张位姿图像合成为一致的 3D 世界。团队称其可应用于 VFX 和机器人等领域。

  24. Google DeepMind(@GoogleDeepMind)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 最新模型引入智能体视频理解,token 用量最多减少 88%

    Google DeepMind 为最新 Gemini 模型引入智能体视频理解能力,模型分析视频的准确率提升,token 用量最多减少 88%。

  25. xAI(@xai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LatchBio 发布 Grok 4.6 生物能力与安全防护评估博客

    LatchBio 发布博客,评估 Grok 4.6 在生物领域的能力与安全防护措施。xAI 官方推荐阅读该评估内容。

  26. xAI(@xai)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LatchBio 评估 Grok 4.6 生物安全监控与对抗性生物任务表现

    LatchBio 对 Grok 4.6 在生物安全监控和对抗性生物任务上的评估显示,该模型能正确识别并拒绝危险查询,包括经过恶意混淆的生物任务,同时仍可回答有益的科研问题。xAI 在博客中公布了这一结果。

9月1日周二
  1. Patrick Loeber(@patloeber)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 发布 TimesFM-3 时间序列基础模型,已在 GitHub 和 Hugging Face 上线

    Google Research 推出 TimesFM-3,这是一个时间序列基础模型,可在单次前向传播中完成多变量时间序列预测,在主要基准上显著优于其他预测模型。该模型已在 GitHub 和 Hugging Face 上线。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 的 GLM-5.3 在 CyberGym 漏洞基准上达到 84.5%

    Z.ai 的 GLM-5.3 在 CyberGym 漏洞基准上达到 84.5%,超过多家头部闭源模型,也明显高于前代 GLM-5.2。据 DeepLearning.AI 介绍,这一提升完全来自对模型智能体能力的微调与优化,未改动基座模型;由于该模型在寻找和定位潜在漏洞方面能力过强,Z.ai 暂缓开放权重以进行安全测试。

  3. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 Max 让每个问题实时变成可视化解释

    MiniMax 发布 H3 Max,主打实时交互式教育场景:用户的每个问题都能实时生成可视化讲解。开发者 gokaygokay 在演示中称该模型"具有革命性",并展示了 Realtime Interactive Education 的实际效果。

  4. Hunyuan(@TXhunyuan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元披露 Hy4 preview 自主发现推理瓶颈并提升 31.8% 吞吐

    腾讯混元介绍 Hy4 preview 在 AI 研究中自主发现推理瓶颈,通过算子融合与通信优化将端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型为 770B 参数、49B 激活、1M 上下文,已开源并登陆 HuggingFace 与 GitHub。

  5. Two Minute PapersAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 发布:强 AI 能力正变得近乎免费

    Two Minute Papers 在视频中介绍了 GLM 5.3,标题指出强 AI 能力正变得近乎免费。

  6. DeeplearningAIAI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3,网络安全能力提升并推迟开源权重

    Z.ai 通过微调前代 GLM-5.2 推出旗舰模型 GLM-5.3,总参数 7530 亿、每 token 激活 400 亿,输入最多 100 万 token、输出最多 128,000 token,速度每秒 90 token。

    为什么值得看

    以独立测试数据对比 GLM-5.3 与 Kimi K3、Claude Opus 5 等模型,并呈现开源权重网络安全争议中双方的实际依据。

  7. 腾讯混元AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 轻量量化版,权重从 1.5 TB 压到 214 GB

    腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。

  8. Microsoft Research(@MSFTResearch)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 GigaPath-Flash 与 GigaTIME-Flash:病理基础模型如何用更少算力保持强性能

    微软研究团队推出 GigaPath-Flash 与 GigaTIME-Flash,在保持强性能的同时降低计算需求,为更大规模研究和更广泛探索打开空间。