腾讯混元开源统一语音生成与编辑模型 AuK,并推出 4 步推理的 AuK-Flash
腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。
腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。
DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。
月之暗面 Kimi 启动企业合作伙伴计划,与 IT 服务商、集成商共建前线部署工程师(FDE)队伍,把 AI 部署进企业核心业务。合作伙伴可接入 Kimi 模型能力,基于 Agent 运行底座 Kimi Hosted Agents 完成定制开发,并将项目成果沉淀为可复用行业方案。华胜天成、金山云、亚康股份、亚信科技、中软国际等已签约加入。
Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。
腾讯开源跨端框架 Kuikly 基于 Kotlin Multiplatform 与共享 UI 体系,支持 Android、iOS、HarmonyOS、H5、微信小程序、Mac 六大平台,日活用户超 5 亿。
AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。
真格基金 Z News 回顾 8 月被投企业动态:月之暗面开源 2.8T 参数的 K3 成为仅次于 Fable 5 和 GPT5.6 的模型,也是目前参数最大的开源模型;赛博昆仑联合智谱 GLM 5.3 发现并报告三枚影响微软企业邮件与办公系统的重大漏洞。无问芯穹携手国家中试基地、广东联通发布新一代全栈国产 AI PC,潞晨科技单日最高 Token 提供量已接近万亿。
面壁(ModelBest)发布 100% 开源的 MiniCPM5-2B,仅 2B 参数、2GB RAM 即可在任意笔记本甚至手机上完全离线运行智能体,支持编码、智能体和工具调用任务。
Qdrant 上线面向零基础学习者的 Beginner Course,从传统搜索的局限、嵌入向量表意和相似度原理讲起,带学员搭建第一个 Qdrant collection,并理解向量、payload、HNSW 以及 dense、sparse、hybrid 搜索的差异。
法律、新闻和金融等高度监管领域正快速采用定制模型。用专有数据重新训练开源模型,可获得更高准确率和严格的指令遵循能力。DeepLearning.AI 认为,专用 AI 是企业技术的重要未来范式。
小红书 AI 通信库团队开源 CommInsight,一个面向大规模分布式训练与推理的系统级诊断平台,从 NCCL 底层事件流恢复通信组角色与 Step、Forward/Backward、梯度同步等训练语义,并定位 Hang、Failure 和 Straggler。
淘天集团直播技术团队分享了基于 Spring AI Alibaba 框架(版本 1.1.2.0)的 Agent 长程任务断点续传方案,采用框架层 Checkpoint 加上层任务调度的两层架构,且不修改框架源码。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
智谱 GLM-5.3 从 MIT 转为自定义许可证,规定若被许可方或其关联方运营模型即服务业务且连续 12 个月总收入超过 100 亿美元,须先通过 Z.AI 安全审查;该许可未定义"关联方",增加了采用不确定性。
EverMind 发布 EverOS v1.3.0,新增用 Milvus 或 Zilliz Cloud 为 AI 智能体记忆建索引的能力,LanceDB 仍为默认后端。Markdown 继续作为数据源,切换后端需从记忆文件重建索引,已使用 Milvus 的团队可直接接入现有技术栈。
Hugging Face 正在升级其基础设施,以便托管 Le Chaton Fat。该消息由 Julien Chaumond 发布,并祝贺相关团队。同一推文引用的 Arthur Mensch 内容提到 Mistral 已融资 3B€,用于扩展训练与推理算力,推动开放与主权 AI 成为技术前沿。
Mistral 表示其开放权重模型、产品与基础设施让组织能自主选择 AI 的运行方式和部署位置,而不只是获得模型访问权限,从而实现前沿性能且不被锁定。
FastClaw 新版本发布,定位仍是 Agent 工厂,目标是降低 Agent 制造与分发的门槛。Agent 作为一等公民,可独立配置模型、Soul、Skills 和知识库,支持一键接入常用 IM 渠道,并可导出 API 作为 Managed Agent 为其他产品提供 Agent Runtime。
斯坦福 CS146S 发布了面向与 coding agents 协作开发的课程大纲,内容涵盖 MCP、agent skills、上下文工程、agent-ready 仓库、代码审查、安全与软件工厂。Milvus 以开源合作伙伴身份支持其中的 The Modern Software Developer 课程,并邀请开发者访问其 GitHub 仓库参与社区。
OpenBMB 开源 MiniCPM5-2B,这是一个 2B 参数语言模型,主打端侧高智能密度,可在手机上本地离线运行,面向智能体、编码与工具调用优化。
Hugging Face 加入 NVIDIA 的意向获得 99% 正面反响,Satya Nadella、Sundar Pichai、Mira Murati、Ali Ghodsi、Aravind Srinivas、Michael Dell、Elon Musk 等科技界人士公开表示支持,认为这将壮大开源模型生态。Hugging Face 表示将在未来数月到数年用行动证明会继续做好这项工作。
Qdrant 将在 9 月 16-17 日举办 3 场免费社区活动。9 月 16 日为 Discord Office Hours 与柏林 Bring Your Own Demo Night(联合 cognee。
作者 lencx 介绍了自己新项目采用的围绕 AI 反馈闭环的技术栈,包括 pnpm v12、TypeScript v7、Vite v8、Oxlint、Oxfmt、React 与基于 StyleX 的 Astryx,目标是缩短 AI agent 从修改代码到获得有效反馈的周期。
42章经将于北京时间 9 月 12 日上午 10:30 举办线上免费活动,邀请播客嘉宾逯雨鑫分享后训练模型经验。他此前无 AI Lab 经历、也非 AI PhD,仅用 2 周和数百美元就后训练出两个登顶 Hugging Face Model Trending 榜首的小模型,并完整分享了自己的 pipeline。报名优先通过回答认真且背景匹配者(非投资行业),尤其欢迎应用创始人。
Tanishq Mathew Abraham 发推祝贺 Hugging Face 团队被 NVIDIA 收购,并称 NVIDIA 正加大对开源 AI 的投入。
Mistral 将 AI Engineer 大会带回巴黎,这是继去年售罄之后的再度举办,其工程 VP Lélio Renard-Lavaud 将同 Black Forest Labs、Cognition、Hugging Face 等公司的演讲者一同登台。活动详情与报名入口为 ai.engineer/paris。
DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。
Milvus 宣布以 OSS 合作伙伴身份支持 Mihail Eric 的斯坦福课程 The Modern Software Developer。
LangChain 重构了对 MCP 的支持,MCP 支持移入主包 langchain.mcp,不再需要单独安装 langchain-mcp-adapters,基于 FastMCP 构建,可同时兼容新旧两种协议规范。
Next.js 团队在约三周内关闭了 1,462 个 GitHub issue,把积压从 2026 年 8 月 10 日的 2,244 降到 9 月 4 日的 995,期间还新增 218 条报告。
OpenClaw 发布 2.0 版,共有 933 位贡献者、合并 16000 个 PR,作者据此判断这些 PR 几乎都未经代码审查、由 AI 直接合并,并再次建议不要在办公电脑上运行它。文章还提到 SolidJS 创始人 Ryan Carniato 感叹 AI 推动技术栈向 React、Rust 等主流方案迁移,担忧软件生态走向单一化。
NVIDIA 将收购 Hugging Face。黄仁勋称这对 NVIDIA 和 Hugging Face 是重要的一天,认为开放模型能增强安全与网络安全、加速创新与扩散并实现主权,让每个开发者、初创公司、大学、行业和国家都能构建、定制并受益于 AI。Satya Nadella 表示期待与 NVIDIA 和 Hugging Face 的生态继续合作,见证开放模型持续繁荣成长。
Scott Wu 发推祝贺 Clement Delangue 和 Hugging Face 团队,称这是对行业非常重要的工作。
材料披露 NVIDIA 收购 Hugging Face 的消息及黄仁勋的表态,读者可了解开源模型生态的一次归属变动。
Milvus 3.0 的 External Collection 支持直接连接存储在 Parquet、Apache Iceberg、Lance、Vortex 或受支持的 Milvus 快照中的数据,无需先把源数据行搬进 Milvus。
NVIDIA 宣布收购 Hugging Face,黄仁勋称 NVIDIA 将成为 Hugging Face、其社区以及开源模型未来的归宿,并感谢 Clement Delangue 前来会面。Ollama 转发该推文表示祝贺,称看好开源模型以及一路结识的合作伙伴。黄仁勋还表示,开源模型能增强安全与网络安全、加速创新与扩散并实现主权,让开发者、初创公司、大学、行业和国家都能构建、定制并受益于 AI。
Philipp Schmid 公开祝贺 Hugging Face 的 Clement Delangue、Julien Chaumond、Thom Wolf 及全体团队成员,称自己曾与这支团队一起构建了 4 年,为曾是其中一员感到自豪。
2026年8月,DeepSeek 开源 DeepSeek Harness 后两天冲上 9 万多 GitHub Star,OpenAI 随后开源 Codex 的 Harness 层,包括 CLI、app-server 和官方 SDK。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。