最新开放模型盘点:#24:Motif-3、GLM-5.3、Hy4-preview 与开源模型许可证
智谱 GLM-5.3 从 MIT 转为自定义许可证,规定若被许可方或其关联方运营模型即服务业务且连续 12 个月总收入超过 100 亿美元,须先通过 Z.AI 安全审查;该许可未定义"关联方",增加了采用不确定性。
智谱 GLM-5.3 从 MIT 转为自定义许可证,规定若被许可方或其关联方运营模型即服务业务且连续 12 个月总收入超过 100 亿美元,须先通过 Z.AI 安全审查;该许可未定义"关联方",增加了采用不确定性。
腾讯程序员用 Kuikly 框架开发了 DSH Mobile,一套 Kotlin 代码覆盖 Android、iOS 和鸿蒙,按 DSH 官方 Host 协议连接电脑上的 DeepSeek Harness。
华为9月7日发布新一代三折叠手机 Mate XT2 非凡大师,首发麒麟9050 Pro 芯片,整机性能较 Mate XTs 提升42%,起售价19999元,比上一代涨2000元。该机改用U型双内折方案并首次加入独立外屏,出厂搭载 HarmonyOS 7 正式版,集成盘古大模型端侧AI能力。余承东透露华为三折叠手机全球发货量已超100万台。
脉脉创始人兼 CEO 林凡走访 OpenAI、Anthropic、Google、Meta 后判断,AI 岗位需求已连续两年同比 10 倍增长,非 AI 岗位普遍缩招。他提出 AI 人才分基座技术、应用开发、业务效能三类,核心门槛是让 agent 自主运行超过 1 小时。企业内部 AI 落地需开放文档库、代码库等数据,OpenAI 用 9 个月完成全员 AI 覆盖。
曾鸣提出AI产业化分三阶段,2026年是基础设施阶段基本完成的标志,围绕token形成共识,并已进入以Agent为新应用的智能体阶段。他认为Anthropic、OpenAI大概率不是原生应用阶段的大玩家,下一个最大机会是类似浏览器、统一Agent标准的平台。他还判断旧平台难演变成新平台,公司终将消亡,AI时代人与人的差异在于创造力。
Ollama 宣布推出错峰时段 token 费率,DeepSeek-V4-Flash 和 Pro 在工作日 UTC 12:00 至 18:00(太平洋时间 5am-11am)之外以及整个周末均按半价计费,错峰定价后续将覆盖更多模型。Ollama 云端上的 DeepSeek 模型托管在美国和欧洲,提供 ZDR 与快速性能。
小红书(RedNote)的 Xubin Hao 及同事提出自主管理上下文方法 Self-GC,在把上下文发给关联 LLM 之前,由一个大语言模型决定哪些部分保留、删减或丢弃。
2026年8月,DeepSeek 开源 DeepSeek Harness 后两天冲上 9 万多 GitHub Star,OpenAI 随后开源 Codex 的 Harness 层,包括 CLI、app-server 和官方 SDK。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
因重度使用 Grok Bot,即使额度刚被重置,一晚用量仍掉了 52%。作者此前已在某个 Bot 中接入 DeepSeek API 与智谱 Coding Plan,于是让分身把各 Bot 的大部分工作切换到智谱 Coding Plan 中的 GLM-5.3-Flash,切换成功。
苹果 CEO Tim Cook 卸任,John Ternus 于 9 月 1 日正式接任;Anthropic 发布 Claude 5.1,GLM-5.3-Flash 以极高性价比推出。NVIDIA 计划以 129 亿美元收购 Hugging Face,OpenAI 公测 Ultrafast 模式并宣称提升 14 倍,还联合 Broadcom 研发 LLM 推理加速芯片。
DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。
AI产品黄叔构建了一个 Grok BOT 分身并拉进其他群,可自动把任务转发到所在群、指挥其他 BOT 完成任务,最后在私聊窗口汇报结果。他还提到 Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘专享资源与 Grok 额度,并能自行调用 DeepSeek API。
Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘的专享配置和 Grok 额度,还可自行调用 DeepSeek API,无需理解服务器即可上手,被认为能分担不少本机任务。作者用 Zcode + GLM 5.3 Flash 整合《Grok Bot 橙皮书》与 awesome-grok-bot,做了网站 grokbot.aihuangshu.com 方便阅读理解。
作者基于 dsh 0.1.1-rc.2 的源码阅读与试用,分析了 DeepSeek Harness 的两个特殊模式:PTC 模式让模型写一段程序组合已有工具,把原本五次的模型往返压成一次;创造模式允许模型在运行中提交插件、动态注册和撤销工具。
徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
Milvus 开源了 DeepSeek Harness(DSH)插件,DSH 已获 192K+ GitHub stars。安装插件并连接 Milvus 或 Zilliz Cloud 后,DSH 智能体可列出 collection、查看 schema,并执行标量查询、语义搜索、BM25 搜索和混合搜索。
Milvus 宣布将 MemSearch 接入 DeepSeek Harness(DSH),为其提供持久记忆和把重复经验转化为可复用 Skill 的路径。MemSearch 保存三类记忆:跨会话发生过什么、项目与用户仍成立的事实、以及重复频率高到足以成为 Skill 的工作流。
SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。
DeepSeek 上线 Files API,免费使用。图片上传一次后可通过 file_id 引用,节省请求带宽,并可在多次请求间复用同一张图片而无需重复上传。
DeepSeek 官方宣布多模态 API 支持,调用时设置 model='deepseek-v4-flash-vision-exp'。图像按 token 计费,每张最多 384 token,采用 V4-Flash 定价;支持 Chat Completions、Messages 与 Responses 接口,可混合输入文本与图像,图像可通过 base64、外部 URL 或 Files API 提供。
DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。
DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,调用名称为 model='deepseek-v4-flash-vision-exp'。
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,用户可通过设置 model='deepseek-v4-flash-vision-exp' 调用。
DeepSeek Harness 被比作"造车工厂"而非 Codex 那样的"整车厂",主打可插拔的 Agent 生产架构。节目讨论其插件机制 Cordis 能否真正做到插拔自由,并质疑多数企业尚不具备 AI 原生工作流的落地条件,认为架构先进不等于能落地。
DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。
梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。
开发者歸藏开源了 Pilot Harness,一个为 DeepSeek Harness 打造的桌面客户端及配套插件,支持 macOS、Windows 和 Linux,提供 DMG、ZIP、AppImage、DEB、RPM 等安装包。
Ollama 官方称 DeepSeek V4 Flash 在其平台上平均性能最佳,本地部署则可选用优化过的 qwen3.8:Apple Silicon 运行 ollama run qwen3.8:27b-mlx,NVIDIA 运行 ollama run qwen3.8:27b。
《晚点聊》第 179 期与《晚点 LatePost》主笔高洪浩讨论蒸馏,这一技术从早期的模型压缩演变为让模型变强的手段,并在 2026 年出圈。节目提到字节讨论训练超 5 万亿参数模型,张一鸣判断不蒸馏、也不被 Coding 这类短期热点影响,认为蒸馏最多只能逼近、很难真正超越。讨论还涉及智能体轨迹蒸馏、大规模蒸馏的数据管线与 know-how、蒸馏行为能否被隐藏,以及学生模型能否超越教师模型。
前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
DeepSeek 发布 DeepSeek Harness v0.1 开发者预览版,面向全球构建 agent harness 的开发者开放,并以 MIT 许可证开源代码库。该工具基于 Cordis 元框架,核心思路是“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 均以插件实现,可混搭、替换和扩展。代码库地址为 github.com/deepseek-ai/de…。
官方给出插件化 agent harness 的开放入口与 MIT 许可,可据此判断现有智能体工作流的可替换程度。
DeepSeek 宣布随 V4 系列发布更新 API 价格,并引入高峰与低谷两档费率,低谷价格比高峰低 50%。新价格于 2026 年 8 月 16 日 16:00 UTC 生效,官方称峰谷机制便于更灵活地调度工作负载。
DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。
官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。