跳到正文

#模型发布

今日 21 条
8月13日周四
  1. DeepSeekAI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro 正式版上线并调整 API 定价

    DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。

    为什么值得看

    官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。

  2. Poe(@poe_platform)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Poe,面向长时间运行智能体与编码,上下文 500K token

    Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国封禁 Fable 5,DeepSeek V4 Pro 正式发布并可下载

    美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。

  4. Windsurf(@windsurf_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 上线 Devin Desktop 与 Devin CLI

    Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。

  5. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 分享 MAI Thinking 1 试用链接

    Mustafa Suleyman 在 X 上放出 MAI Thinking 1 的试用链接 aka.ms/mai-thinking-1,未附更多说明。该帖获得 49 次点赞、5 条回复、3 次转发和 17646 次浏览。

  6. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 发布首个推理模型 MAI-Thinking-1,上线 Microsoft Foundry

    Mustafa Suleyman 宣布 Microsoft 首个推理模型 MAI-Thinking-1 从零构建,并已在 Microsoft Foundry 上线。

8月12日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布:同价位下的日常主力模型

    SpaceXAI 推出 Grok 4.6,定位可日常使用的主力模型,在同等价格下相比 Grok 4.5 有显著提升。该模型具备前沿智能水平,被评价为一款好用的日常主力模型。

  2. Aman Sanger(@amanrsanger)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpaceXAI 发布 Grok 4.6,称同价位下较 Grok 4.5 显著提升

    SpaceXAI 发布 Grok 4.6,称其提供前沿智能水平,并在同一价格下较 Grok 4.5 有显著提升。来源推文还提到更大、更好的模型即将到来,并提及 1.5T 规模。

  3. AI SDK(@aisdk)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Grok 4.6

    AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。

  4. xAI(@xai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,上线 Grok Build、Cursor、Grok Bot 和 API

    xAI 发布 Grok 4.6,已在 Grok Build、Cursor、Grok Bot 和 API 中可用。首周在 Cursor 和 Grok Build 内提供 2 倍用量,详情见 x.ai/news/grok-4-6。

  5. xAI(@xai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,速度与复杂任务能力超 Grok 4.5

    xAI 发布 Grok 4.6,称其速度超过同类模型,且能处理比 Grok 4.5 更具挑战性的任务。定价为每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,为其他前沿模型价格的一半。

  6. xAI(@xai)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,称能力较 Grok 4.5 大幅提升且价格不变

    xAI 发布 Grok 4.6,称其具备前沿智能水平,相比 Grok 4.5 有显著提升,且保持相同价格。

  7. Google DeepMind(@GoogleDeepMind)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind SL2T 在学术基准上达到 SOTA,并针对单手手语等真实场景优化

    Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。

  8. Google DeepMind(@GoogleDeepMind)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。

  9. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。

  10. Hugging Face(@huggingface)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 3.8 27b 将于周三美国东部时间上午 11 点发布

    Qwen 3.8 27b 将于周三美国东部时间上午 11:00 发布。有用户称其热度甚至会超过 @UseCorgi cafe,并表示人们排起长队等待体验这款新模型的能力。

  11. Modal BlogAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-2.4T-A95B 开放权重发布并上线 Modal

    Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。

  12. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 发布新代码模型,效率提升 25%、成本降至四分之一并上线 GitHub Copilot

    Mustafa Suleyman 宣布最新代码模型上线 GitHub Copilot,相比 6 月发布的模型效率提升 25%、质量更高、成本仅为四分之一。他邀请用户在 GitHub Copilot 中试用该模型。

8月11日周二
  1. Rowan Cheung(@rowancheung)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布开放权重模型 Muse Glimmer,Muse Spark 1.2 即将推出

    Meta 发布新的开放权重模型 Muse Glimmer,扎克伯格同时披露 Muse Spark 1.2 即将推出,并阐述其个人超级智能愿景:一个 24/7 面向所有人可用的 AI 智能体,可覆盖工作、学习、人际关系与心理健康等场景。Meta 还宣布在相关人才与社区上投入,包括 America's Workforce Academy 以及与其数据中心扩张挂钩的 10 亿美元社区基金。

  2. Rowan Cheung(@rowancheung)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 开源 Muse Glimmer 权重,Muse Spark 1.2 即将发布

    Meta 宣布开放 Muse Glimmer 的模型权重,这是一个可在本地运行的 30B 参数稠密模型,Muse Spark 1.2 的权重也将在不久后发布。扎克伯格称 Meta 是开源的支持者,并向 @alexandr_wang 和 MSL 团队致意。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Image-2.6 登文生图竞技场第二

    微软的 MAI-Image-2.6 在 Text-to-Image Arena 以 1336 分位列第二,比第一名的 GPT Image 2(Medium)低 45 分,领先第三名 Grok Imagine Image 2.0(Low)20 分,超过 Nano Banana、Meta 等对手。

  4. Andrew Ng(@AndrewYNg)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达致谢 Meta 开源 Muse Glimmer 30B 等模型权重

    吴恩达公开致谢 Mark Zuckerberg、Alexandr Wang 及 Meta 团队对开放权重 AI 的贡献。所引 Mark Zuckerberg 表示 Meta 当天开放 Muse Glimmer 的权重,这是一个可本地运行的 30B 参数稠密模型,并称不久后还将发布其最新基础模型 Muse Spark 1.2 的权重。

8月10日周一
  1. Paul Couvert(@itsPaulAi)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 30B 开源模型 Muse Glimmer 并预告开放 Muse Spark 1.2 权重

    Meta 发布 30B 参数稠密模型 Muse Glimmer 并开放权重,该模型可本地运行。扎克伯格同时表示将很快开放其最新基础模型 Muse Spark 1.2 的权重,并称 Meta 是开源的支持者。

8月6日周四
  1. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其在预测气旋路径、强度和风场结构上达到 SOTA。

    为什么值得看

    Google DeepMind 公开气象模型权重与代码,并说明其预报精度提升大致相当于十年气象学进展。

  2. Hunyuan(@TXhunyuan)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布混元 Hy3,主打实用 AI 与旗舰级性能

    腾讯发布混元 Hy3,官方称其为实用 AI 设计,兼具旗舰级性能与紧凑、低成本的特点,并带入先进的推理与 Agent 能力,覆盖研究、编码、办公生产力、设计和云工作流。该模型现已在腾讯产品、API 和开发者平台上面向全球开放,官方给出官网 hy.tencent.ai、OpenRouter 上的 API 定价页,以及 WorkBuddy、Miora、腾讯云 TokenHub 等入口。

8月5日周三
  1. 字节跳动SeedAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线

    字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。

    为什么值得看

    字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。

  2. Mistral AI(@MistralAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 的 Shieldstral 以 Apache 2.0 许可开放

    Mistral 的 Shieldstral 现以 Apache 2.0 许可开放,可在 Hugging Face 上获取并使用。该模型由 Mistral AI 发布,官方同时给出了试用链接。

  3. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Shieldstral 3B 开源内容安全模型

    Mistral 发布 Shieldstral,一个 3B 开源权重的内容安全模型,可在设备端部署。官方给出 mistral.ai/news/shieldstral 链接,未披露更多能力细节。

  4. Mistral AI(@MistralAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Shieldstral:单张 16GB GPU 上的多模态内容审核模型

    Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。

8月4日周二
  1. Microsoft Research(@MSFTResearch)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软推出 PRISM2:基于真实病理报告训练的病理多模态基础模型

    微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。

  2. Hunyuan(@TXhunyuan)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布 Hy ASR 3.0 preview,由 Hy3 语言大脑驱动

    腾讯 Hy ASR 3.0 preview 今日发布,由 Hy3 的语言能力驱动,主打精准语音识别加深度语义理解。官方称其在通用识别、上下文感知、多场景鲁棒性和方言覆盖上表现领先,多语言 WER 约为 3%,可将嘈杂的真实音频转成连贯转录并准确理解意图。

  3. 腾讯混元AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy ASR 3.0 preview 语音识别模型

    腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。

  4. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 开源 24 小时,超百家企业 Day 0 上线

    MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。

    为什么值得看

    可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 新模型发布:几乎免费且足以构建任何应用

    新发布的 DeepSeek 被评价为史上最重要的 AI 发布之一:模型能力足以构建几乎任何东西,而成本几乎可以忽略。此前预算一直是许多人和项目的最大障碍,如今这一障碍已消失。

8月3日周一
  1. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    jina-reranker-v3.5 在四个基准上处于 Pareto 前沿

    jina-reranker-v3.5 在四个基准的质量-参数量对比中均处于 Pareto 前沿,评估范围内没有任何模型同时做到更小且更好。

  2. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v3.5 重排序模型发布

    Jina AI 发布 v3.5 重排序模型(reranker),同步公开博客、arXiv 论文(2607.18152)及 HuggingFace 模型页。

  3. Jina AI(@JinaAI_)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-reranker-v3.5:0.6B 列表式重排模型,BEIR nDCG@10 达 63.20

    Jina AI 发布 jina-reranker-v3.5,一个 0.6B 的列表式重排模型,在 v3 的 late interaction 基础上提速并强化企业搜索数据表现。它在 BEIR 上取得 63.20 nDCG@10,以约 7 倍更少的参数超过 Qwen3-Reranker-4B。

  4. Interconnects AI — Nathan LambertAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Interconnects 推出 Artifacts Hub 与 Adoption Dashboard,追踪开源模型生态

    Interconnects 发布两个免费数据项目:Artifacts Hub 覆盖近两年 792 个模型,整合 Hugging Face、Open Router 推理 token 量、Artificial Analysis 智能指数与自研采用度指标 RAM;Adoption Dashboard 则按地域和机构每日更新下载量与衍生模型数,呈现中美开源生态差距。

  5. Last Week in AIAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #253:Claude Opus 5、Gemini 3.6、Kimi K3 与 Hugging Face 被黑事件

    Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。

  6. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 正式开源通用视频模型 MiniMax H3

    MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。

    为什么值得看

    H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。