跳到正文

#模型发布

今日 20 条
8月29日周六
  1. Hunyuan(@TXhunyuan)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview,已在 Cline 开放试用

    腾讯混元发布 Hy4 preview,该模型采用 770B 总参数、49B 激活参数,支持 1M 上下文,并在 SWE-bench Pro 上领先。官方称这是其迄今测得的最大代际提升,并给出在 Cline 中通过 npm i -g cline、/model 选择 Hy4 preview 的试用步骤。

  2. Hunyuan(@TXhunyuan)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hy 4 preview 上线 OpenCode Go,面向编程智能体

    腾讯混元 Hy 4 preview 已在 OpenCode Go 上线,规格为 770B/49B、1M 上下文,面向编程智能体场景打造。

  3. Midjourney(@midjourney)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 更新 V8.2 编辑模型,图像质量提升

    Midjourney 更新 V8.2 编辑模型以提升图像质量。若用户在过去 24 小时内遇到问题,可重新尝试并继续反馈。官方表示后续还有更多更新。

  4. Google Gemini App(@GeminiApp)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Omni 1.1 Flash 支持视频续接延展

    Gemini Omni 1.1 Flash 现可让你从视频结束的位置继续延展,把在 Gemini 中创作的视频无缝接续,构建连贯、动态的故事线。该功能由 Gemini App 官方账号公布。

  5. Greg Brockman(@gdb)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Greg Brockman:GPT 5.6 Terra 和 Luna 在 OpenRouter 打折后 token 用量暴涨 13.8 倍,印证杰文斯悖论

    GPT 5.6 Terra 和 Luna 在 OpenRouter 大幅打折后,token 用量暴涨 13.8 倍。Greg Brockman 借此指出杰文斯悖论:技术让资源使用更高效时,该资源的总消耗量反而上升而非下降。

8月28日周五
  1. Patrick Loeber(@patloeber)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 推出 Gemini 3.5 Transcribe 与 Transcribe Live 两款转写模型

    Google 发布两款面向转写和语音识别的新模型 Gemini 3.5 Transcribe 与 Gemini 3.5 Transcribe Live。前者用于转写已录制音频,支持说话人归属和词级时间戳;后者用于构建实时语音应用。

  2. ollama(@ollama)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 glm-5.3-flash 模型页

    Ollama 上线 glm-5.3-flash 模型页面,用户可通过 ollama.com/library 查看该模型信息。该模型页链接已在社交平台发布,帖文获得 34 个点赞和 2 次转发。

  3. Google DeepMind(@GoogleDeepMind)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini Omni 1.1 Flash

    Google DeepMind 正在推出 Gemini Omni 1.1 Flash,目标是让生成视频具备更高的可控性、更快的迭代速度,并更精细地适配生产级使用。官方表示可在 Flow by Google 等入口试用,并附有详情链接 goo.gle/4zHEzJ2。

  4. Hunyuan(@TXhunyuan)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 上线 WorkBuddy,两周免费

    腾讯混元 Hy4 preview 已在 WorkBuddy 上线,并在研究、Office 任务、前端开发和游戏开发等真实智能体工作流中完成测试,可跨文件分析 Excel 与 PPT 排版,并根据自然语言指令构建可玩原型。Hy4 preview 在 WorkBuddy 上免费开放两周,Hy3 则免费至 9 月底。

  5. Midjourney(@midjourney)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 开始测试首个 V8.2 编辑模型

    Midjourney 宣布当天开始测试其首个 V8.2 编辑模型。该模型支持按指令编辑、用其他图片生成图像(最多 4 张参考图)、基于笔刷的 inpainting 和 outpainting,并可与 personalization、moodboards 和 srefs 配合使用。

  6. Hunyuan(@TXhunyuan)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 在 Code Arena WebDev 获 1633 分排第 5

    Arena.ai 公布,腾讯混元 Hy4 preview 在 Code Arena WebDev 榜单以 1633 分(AutoEval)位列约第 5,较 Hy3 整体第 31 名提升 115 分;在开源模型中排约第 3,Hy3 当时为第 7。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 上线 OpenCode Go:125B/6B、1M 上下文、多模态

    Qwen3.8-Flash 已在 OpenCode Go 上线,采用 125B/6B 参数配置,支持 1M 上下文窗口和多模态输入。该模型由 OpenCode 提供接入,面向编码场景使用。

  8. Hunyuan(@TXhunyuan)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布 Hy4 preview:770B 参数、49B 激活、1M 上下文并开源

    腾讯发布 Hy4 preview,总参数 770B、激活参数 49B、上下文窗口 1M,定位生产力场景并采取开源路线,主打一致且可负担的价格。官方同时给出博客、Hugging Face 与 GitHub 链接,并邀请用户反馈使用中遇到的问题。

  9. 腾讯混元AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 旗舰模型并开源

    腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。

    为什么值得看

    腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。

  10. Replicate(@replicate)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Omni 1.1 Flash 视频生成与编辑模型

    Replicate 上线 Google DeepMind 的 Gemini Omni 1.1 Flash,官方称其为最新的多模态视频生成与编辑模型。该更新支持场景延长、指定镜头首尾帧、添加视频输入参考、最高 4K 放大以及用 360p 快速验证想法。

  11. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Omni 从初版到融入 Veo 热门功能,后续版本仍在开发中

    Google Omni 从首次发布到将用户喜爱的 Veo 功能融入 Omni 模型,经历了大量工作。团队表示未来 Omni 版本还有更多内容正在打磨,并继续征求反馈。

  12. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini Omni Flash 1.1,升级多模态输入输出世界模型

    Google 发布 Gemini Omni Flash 1.1,这是对其 anything in, anything out 世界模型的更新。新版本支持 360p 草稿与 4K 上采样、延长时最多 10 秒视频上下文、以 10 秒为单位递增的视频延展,以及视频参考功能。

  13. Patrick Loeber(@patloeber)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini Omni 1.1 Flash,面向开发者开放视频生成能力

    Google AI Studio 推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧和末帧、以 360p 更高效地草稿视频,并可放大到 4K 分辨率,还支持在多模态输入中加入视频参考。该模型现可通过 Gemini API 和 AI Studio 使用。

  14. Google AI(@GoogleAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini Omni 1.1 Flash 视频生成与编辑模型

    Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。

8月27日周四
  1. 向阳乔木推荐看AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱认领匿名模型 Ox-Alpha 为 GLM-5.3-Flash,开源并以 Opus 4.8 的 1/40 价格提供

    智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。

    为什么值得看

    文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。

  2. Qwen(@Alibaba_Qwen)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 上线 OpenRouter,主打编程助手与智能体工作流

    Qwen3.8-Flash 已在 OpenRouter 上线,一次 API 调用即可支持编程助手、智能体工作流和长视频理解。该模型为多模态推理模型,面向代码库与文档分析、桌面交互、图表和长视频等场景。

  3. AI产品黄叔AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    匿名模型 ox-alpha 确认为 GLM-5.3-Flash,作者实测两个任务

    智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。

  4. Qwen(@Alibaba_Qwen)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LightSeek TokenSpeed 为 Qwen 3.8 Flash Next 提供 Day 0 支持

    LightSeek Foundation 的 TokenSpeed 已对 Qwen 3.8 Flash Next 实现 Day 0 支持,覆盖 GDN + Qwen Sparse Attention 混合架构、门控残差连接和 N-gram embedding。其中 N-gram embedding 还支持 FP8 精度。LightSeek 表示将持续优化,作为 Qwen 4 的预览。

  5. 阿里研究院AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Flash 多模态 MoE 模型并开源 Next 权重

    阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

    为什么值得看

    官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。

  6. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布新模型,已为多项 Google 产品体验提供支持

    Google 发布一款新模型,该模型已在 Google 多项产品体验中投入使用,并成为其 Gemini Audio 产品组合的又一关键组成。相关内容发布在 Google 官方博客。

  7. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Transcribe 语音转文本模型

    Google 发布 Gemini 3.5 Transcribe 语音转文本模型,支持智能转写、函数调用和实时流式传输,转写更精确(WER 更低)。该模型还支持自定义词表、多说话人识别,并覆盖超过 85 种语言。

  8. Patrick Loeber(@patloeber)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Transcribe 与 Transcribe Live 两款转录模型发布

    Google 推出两款 Gemini 转录模型:Gemini 3.5 Transcribe 用于转录录音,支持说话人归属和词级时间戳;Gemini 3.5 Transcribe Live 用于构建实时语音应用。

  9. Google AI(@GoogleAI)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Transcribe 转录模型

    Google 发布转录模型 Gemini 3.5 Transcribe,支持 85+ 种语言的语境感知语音转文字,可自动过滤填充词并格式化非结构化语音。该模型还能结合屏幕上下文执行语音指令,把杂乱的语音输入和本地文件转成邮件草稿。

  10. Google AI Developers(@googleaidevs)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google AI Developers 发布 Gemini 3.5 Transcribe,一款号称能理解代码库的语音转文字模型。官方演示中,该模型可过滤口语中的犹豫停顿,并针对当前上下文精确还原技术术语、文件名和代码变量;它通过视觉偏置为复杂开发者工作流引入屏幕感知上下文,演示场景为在 Antigravity 中构建。

  11. Sundar Pichai(@sundarpichai)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe,可让应用理解用户语音与意图,并支持多说话人场景。该模型开箱即可自动检测 85 种以上语言,并提供针对专业术语的自定义词表适配。API 现已在 Google AI Studio 和 Gemini Enterprise 上线,也可在 macOS 的 Gemini 应用或 Android 的 Rambler 中试用。

  12. Google DeepMind(@GoogleDeepMind)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Transcribe 发布:Google DeepMind 推出新一代语音转文本模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,定位为面向精准、智能转写的最新语音转文本模型。官方称其可实现精确且智能的转录,具体参数、支持的语种与上线方式尚未在公告中披露。

  13. Google DeepMind BlogAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文本模型,可将原始音频直接转为准确、格式化的文本。

8月26日周三
  1. Qwen(@Alibaba_Qwen)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布开源多模态 MoE 模型 Qwen3.8-Flash,Qwen4 架构早期预览

    Qwen 发布 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重,API 上线 QwenCloud。

    为什么值得看

    Qwen3.8-Flash 以 1/9 训练成本超越前代,并作为 Qwen4 架构的早期预览开放权重,可据此观察下一代架构取向。

  2. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3-Flash:320B-A18B、1M 上下文、MIT 许可

    Z.ai 发布 GLM-5.3-Flash,原生多模态、支持 100 万 token 上下文窗口,模型规模为 320B-A18B,以 MIT 许可证开放权重,此前以 Ox Alpha 为名预览并完全运行在中国 AI 芯片上。

    为什么值得看

    从公开定价、上下文窗口和 MIT 开源许可三个维度,可以判断这款模型对日常任务的成本影响。

  4. 智谱AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线并开源 GLM-5.3-Flash,定价为 GLM-5.3 的 1/10

    智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。

    为什么值得看

    智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash-Next 的 QSA 注意力内核:1M 上下文下 prefill 提速 7.6×、decode 提速 4.9×

    在 1M-token 上下文长度下,QSA 的注意力内核在 prefill 阶段最高提速 7.6×,decode 阶段提速 4.9×。当 prefix-cache 命中率为 90% 时,Qwen3.8-Flash-Next 的 prefill 吞吐量达到 Qwen3.7-Plus 的 8.6 倍。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3.8-Flash-Next-Base,6B 激活参数在 14 项基准中领先 8 项

    阿里 Qwen 发布 Qwen3.8-Flash-Next-Base,仅 6B 激活参数就在 14 项基准中的 8 项登顶,包括 MMLU-Pro、SuperGPQA、BBH 和 GSM8K,其余项目与 Qwen3.7-Plus-Base 相比仍具竞争力。该模型还包含 51B 的 N-gram 嵌入参数,使用确定性查找,不增加每 token 的矩阵乘法开销。

  8. Qwen(@Alibaba_Qwen)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    千问(Qwen)公布模型架构四项核心升级:GDN+QSA 混合注意力、门控残差、N-gram 嵌入与 Muon 优化器

    千问(Qwen)公布模型架构四项核心升级:注意力采用 GDN + QSA 混合,Gated DeltaNet 压缩历史,Qwen Sparse Attention 用轻量索引器做微块上下文选择,降低长序列注意力成本;残差改为 4 分支的门控残差(GR),强化跨层信息流并提升训练稳定性。