跳到正文

全部动态

今日 19 条
8月21日周五
  1. Patrick Loeber(@patloeber)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 上的成绩与成本

    ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 基准上的成绩:ARC-AGI-2 得分 84.6%,每任务成本 0.25 美元;ARC-AGI-1 得分 95.5%,每任务成本 0.12 美元。Patrick Loeber 引用该数据表示,相对其他前沿模型,Gemini 3.7 Flash 在低成本和两代 ARC-AGI 高分上表现突出。

  2. DeepSeek(@deepseek_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4-Flash-Vision-Exp 展示多模态智能体能力

    DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。

  3. DeepSeek(@deepseek_ai)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台

    DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,这是一款实验性多模态模型,文本能力与 DeepSeek-V4-Flash 持平,涵盖智能体、推理和世界知识。

  4. Microsoft Research BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并集成至 Psi4、FHI-aims、ORCA、VASP

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首个公开版本增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,以 meta-GGA 的计算成本超越当前最昂贵的全局杂化泛函。

8月20日周四
  1. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Image-2.5-Pro 登顶 Artificial Analysis 图像编辑榜

    微软 AI 的 MAI-Image-2.5-Pro 在 Artificial Analysis 图像编辑榜单首次登顶,超过 Reve 2.1、GPT Image 2 和微软自家的 MAI-Image-2.5,在文生图榜单排名第 7。

8月19日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hyra 数学能力再进阶:3D Blaschke–Lebesgue 等四项问题取得新进展

    腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。

  2. ollama(@ollama)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 Kimi K3 模型页面

    Ollama 模型库新增 Kimi K3 页面,地址为 ollama.com/library/kimi-k3。该条目已获 21 个点赞、10871 次浏览,相关数据由 xgo.ing 提供。

  3. 智谱AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 上线,API 开放且权重下周五开源

    智谱 GLM-5.3 正式上线并开放 API,在 Artificial Analysis Intelligence Index 中取得 60 分,进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 处于同一水平,并与 Kimi K3 并列开源模型第一。

  4. Windsurf(@windsurf_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 Sol 在 FrontierCode 1.1 上的表现解读

    GPT-5.6 Sol 在 FrontierCode 1.1 上的性能表现已有详细解读,原文链接指向 devin.ai 的博客。该内容由 Windsurf 转发分享,但正文未给出具体分数或评测细节。

  5. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MAI-Image-2.6 在文生图与图像编辑榜单分列第 2、第 3

    MAI-Image-2.6 在文生图 benchmark 排名第 2,同一模型在图像编辑排行榜上拿下第 3。该模型由此被定位为可胜任各类图像生成任务的全能选手。

  6. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Image-2.6-Preview 登 Arena.ai 图像编辑榜第 3,超越 Google Nano Banana

    微软 AI 的 MAI-Image-2.6-Preview 在 Arena.ai 单图编辑榜以 1,420 分升至第 3 名,较 MAI-Image-2.5 提升 19 分、排名从第 5 前进两位,超过 Google Nano Banana 和 Meta Muse Image。

8月18日周二
  1. Paul Couvert(@itsPaulAi)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 3.8 27B 在 Artificial Analysis 上取得 52 分

    Qwen 3.8 27B 在 Artificial Analysis 上取得 52 分。作者指出,这是首次有能在笔记本本地运行的模型基本与最强的模型持平,本地且开放权重的模型已足以完成多数日常任务。

8月17日周一
  1. 哔哩哔哩技术AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩发布 IndexTTS 2.5,支持五语种零样本配音并提速约 2.28 倍

    哔哩哔哩 Index 语音团队发布 IndexTTS 2.5,支持中、英、日、西、阿五语种零样本配音,开放语速控制,并补齐上代的速度短板。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 约 8 秒解出 @unixpickle 的题目

    Logan Kilpatrick 转发 @unixpickle 的结果称,Gemini 在约 8 秒内解出了题目。该帖获得 1099 个点赞、54 条回复和 170251 次浏览。

8月15日周六
  1. Augment Code(@augmentcode)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 接入 Cosmos 三天,创下该平台最快采用曲线

    Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)

  2. Google Gemini App(@GeminiApp)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 向 Pro 和 Ultra 用户开放

    Google 宣布 Gemini 3.7 Flash 已面向所有 Pro 和 Ultra 用户在 Gemini 聊天中开放。官方称此次模型更新提升了多步任务的推理能力与准确率,例如把数十个文件和邮件整合成一份总文档。

8月14日周五
  1. Paul Couvert(@itsPaulAi)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源 Qwen3.8-27B 多模态模型,27B 参数对标 Opus 4.6 Max

    阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。

    为什么值得看

    原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。

  2. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:Gemini 4 是迄今最具雄心的预训练

    Logan Kilpatrick 称 Gemini 4 是迄今最具雄心的预训练。该说法转自 @haider1,原帖为 Gemini 4 预热内容,目前仅披露预训练定位,未公布参数规模、benchmark 分数或发布时间。

  4. Varun Mohan(@_mohansolo)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 上线 Google Antigravity,API 成本减半

    Google Antigravity 宣布 Gemini 3.7 Flash 上线,称其为面向编码和智能体任务的最强主力模型,可下载或升级 Antigravity 试用。原推作者(Varun Mohan)转发时评价能力大幅提升且 API 成本减半。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash

    Google 发布 Gemini 3.7 Flash,作者称其是同等智能水平下效率最高的模型之一,表现优于 Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2。

  6. Google AI Developers(@googleaidevs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,主打编码与智能体任务

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体任务最智能的主力模型,带来更高的指令遵循、首轮代码准确率和智能体任务执行质量。

  7. Patrick Loeber(@patloeber)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 发布,价格较 3.6 Flash 降低 50%

    Gemini 3.7 Flash 发布,相比 3.6 在多项任务上有较大提升。Logan Kilpatrick 介绍该版本速度快,价格比 3.6 Flash 低 50%(截至年底),并在约 3 周内依靠算法改进实现智能水平明显提升,已在 API、AI Studio、Antigravity 等平台上线。

  8. Demis Hassabis(@demishassabis)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 发布,软件工程与网页开发能力升级

    Google DeepMind 发布 Gemini 3.7 Flash,在软件工程、网页开发和知识工作方面带来较大升级。该版本的首发价格为原 Gemini 3.6 Flash 成本的一半。Demis Hassabis 表示这一版本在编码、知识工作和网页开发上更强。

  9. Google AI(@GoogleAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 3.7 Flash,Pro 与 Ultra 订阅者可在 Gemini App 中体验

    Google 宣布 3.7 Flash 上线,Google AI Pro 与 Ultra 订阅者即日起可通过 Gemini App 中的 Spark 体验该模型。

  10. Google AI(@GoogleAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,面向编码与智能体并推出半价优惠

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。

    为什么值得看

    Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。

  11. Sundar Pichai(@sundarpichai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周

    Google 在 3.6 Flash 发布仅三周后推出 3.7 Flash,称其在编码和智能体任务上有显著提升,并在软件工程、知识工作和网页开发方面带来改进,首发价格为 3.6 Flash 原价的一半。该模型已在 Antigravity 中供 Google 内部工程师使用,同时通过 Gemini API 在 Google AI Studio、Gemini Enterprise 等渠道提供。

  12. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash:价格较 3.6 Flash 低 50%,智能水平提升

    Google 发布 Gemini 3.7 Flash,官方称其速度很快,价格比 3.6 Flash 低 50%(优惠持续至年底),并在约 3 周内通过算法改进实现智能水平明显提升。该模型已在 API、AI Studio、Antigravity 等渠道上线。

    为什么值得看

    Google 员工发布 Gemini 3.7 Flash,价格与推理提升幅度及可用渠道都给出了具体数字。

  13. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,输入百万 token 0.75 美元

    Google DeepMind 发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 仅三周,定位为面向编码和智能体的主力模型。

  14. Google DeepMind(@GoogleDeepMind)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 3.7 Flash,在调试与问题解决等编码任务上升级

    Google DeepMind 发布 3.7 Flash,相比 3.6 Flash 在调试、问题解决等关键编码任务上有明显提升,并能用更少提示词设计更实用的网页布局和应用,在真实业务工作流中的推理与准确率也有改善。

  15. Google DeepMind(@GoogleDeepMind)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,官方称其在编码、知识工作和网页开发方面表现更强。该条推文未披露具体参数、价格或开放范围。

8月13日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro

    DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。

  2. DeepSeekAI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro 正式版上线并调整 API 定价

    DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。

    为什么值得看

    官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。

  3. Poe(@poe_platform)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Poe,面向长时间运行智能体与编码,上下文 500K token

    Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。

  4. Paul Couvert(@itsPaulAi)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国封禁 Fable 5,DeepSeek V4 Pro 正式发布并可下载

    美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。

  5. Windsurf(@windsurf_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Devin Desktop 与 Devin CLI

    Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。

  6. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 分享 MAI Thinking 1 试用链接

    Mustafa Suleyman 在 X 上放出 MAI Thinking 1 的试用链接 aka.ms/mai-thinking-1,未附更多说明。该帖获得 49 次点赞、5 条回复、3 次转发和 17646 次浏览。

  7. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 发布首个推理模型 MAI-Thinking-1,上线 Microsoft Foundry

    Mustafa Suleyman 宣布 Microsoft 首个推理模型 MAI-Thinking-1 从零构建,并已在 Microsoft Foundry 上线。

8月12日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布:同价位下的日常主力模型

    SpaceXAI 推出 Grok 4.6,定位可日常使用的主力模型,在同等价格下相比 Grok 4.5 有显著提升。该模型具备前沿智能水平,被评价为一款好用的日常主力模型。

  2. Aman Sanger(@amanrsanger)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.6,称同价位下较 Grok 4.5 显著提升

    SpaceXAI 发布 Grok 4.6,称其提供前沿智能水平,并在同一价格下较 Grok 4.5 有显著提升。来源推文还提到更大、更好的模型即将到来,并提及 1.5T 规模。