Ollama 上线 GLM-5.3,并提供云端 Flash 版本
Ollama 正在上线 GLM-5.3,提供私有、快速、美国和欧洲托管、不留存数据的服务,并推出云端版本 GLM-5.3-Flash 供试用。
为什么值得看
GLM-5.3 在 Ollama 上线并提供云端 Flash 版本,读者可了解在 Claude Code 等工具中的接入方式与开源权重入口。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Ollama 正在上线 GLM-5.3,提供私有、快速、美国和欧洲托管、不留存数据的服务,并推出云端版本 GLM-5.3-Flash 供试用。
GLM-5.3 在 Ollama 上线并提供云端 Flash 版本,读者可了解在 Claude Code 等工具中的接入方式与开源权重入口。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。
腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。
智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。
文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
Qwen 发布 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重,API 上线 QwenCloud。
Qwen3.8-Flash 以 1/9 训练成本超越前代,并作为 Qwen4 架构的早期预览开放权重,可据此观察下一代架构取向。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
Z.ai 发布 GLM-5.3-Flash,原生多模态、支持 100 万 token 上下文窗口,模型规模为 320B-A18B,以 MIT 许可证开放权重,此前以 Ox Alpha 为名预览并完全运行在中国 AI 芯片上。
从公开定价、上下文窗口和 MIT 开源许可三个维度,可以判断这款模型对日常任务的成本影响。
智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
阿里 Qwen 团队发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。模型总参数 125B,另有 51B N-gram 嵌入,每个 token 仅激活 6B;生产版本将很快通过 QwenCloud API 提供,价格为每 1M 输入 token 0.16 美元、每 1M 输出 token 0.47 美元。
Qwen3.8-Flash 以 6B 激活参数和低价 API 给出成本效率数据,并开源权重预览 Qwen4 新架构。
DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。
梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。
Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。
以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。
阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。
原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
DeepSeek 发布 DeepSeek Harness v0.1 开发者预览版,面向全球构建 agent harness 的开发者开放,并以 MIT 许可证开源代码库。该工具基于 Cordis 元框架,核心思路是“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 均以插件实现,可混搭、替换和扩展。代码库地址为 github.com/deepseek-ai/de…。
官方给出插件化 agent harness 的开放入口与 MIT 许可,可据此判断现有智能体工作流的可替换程度。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其在预测气旋路径、强度和风场结构上达到 SOTA。
Google DeepMind 公开气象模型权重与代码,并说明其预报精度提升大致相当于十年气象学进展。
MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。
可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。
MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。
H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。
MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。
MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重、技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 开放权重、技术报告与 Infra 技术,读者可了解其 2.8 万亿参数 MoE 与 3 倍规模化效率的具体做法。