开源模型烧向硅谷:企业用开放权重模型重构AI成本账
腾讯科技报道,随着AI支出上升,美国企业正越来越多地转向价格更低的开放权重模型。AlphaSense 数据显示,今年 8 月和 9 月美国企业财报电话会议和投资者会议中提及开放权重或开源模型的次数是去年同期的 6 倍。
腾讯科技报道,随着AI支出上升,美国企业正越来越多地转向价格更低的开放权重模型。AlphaSense 数据显示,今年 8 月和 9 月美国企业财报电话会议和投资者会议中提及开放权重或开源模型的次数是去年同期的 6 倍。
前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。
作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。
Anthropic 发布 Opus 5.5,价格更低、速度更快、基准测试成绩强劲,并扩大面向防御方的网络安全访问权限。OpenAI 推出更低价的 GPT-6 层级 Sol 和 Luna;Meta 的 Muse 登陆 Mac 并开放电脑操作能力,但被 Amazon 以政策与隐私安全为由封禁。
南京工业大学适配的校园 Agent 项目 CourseRaptor 把课表、成绩、考试、通知、待办、文档生成和日历订阅拆成 31 个可调用工具,终端 TUI、本地 Web UI(127.0.0.1:3210)、QQ 机器人和无头 CLI 共用同一个 ToolLoopAgent 内核。
Bolt 为所有用户重置了 Forge tokens,并在模型选择器中加入 GLM、DeepSeek 和 Kimi。官方以"去构建点什么"号召用户使用这些新可用模型。
Andrew 在 The Batch 本周通讯中指出,开源权重模型 GLM-5.3 在漏洞利用测试中达到 12%,逼近 Claude Mythos 的 14%。同期内容还包括小米新的开源权重模型、Gemini 3.8 Live、DeepSeek-V4.1-Flash 以及 AREX 智能体中心。
DeepSeek 发布了 DeepSeek Harness 的打包桌面版,现已支持 macOS 和 Windows。Linux 用户可通过 npm 上的 @deepseek-ai/dsh 包获取,详情见 deepseek.com/harness。
Claude Code 支持安装 Mod,用户可用 TypeScript 写模块,也可直接让 Claude 现场生成并热加载,改造界面、操作逻辑和底层功能,官方已把 /diff 和 AGENTS.md 支持改为 Mod 实现。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
三台 PVE 同时挂了两台,作者称用 Qwen3.8-Max 修了一天,感觉其表现强于 Grok-4.7 和 DeepSeek-V4.1-Flash,目前一台已修好,并因此对 Qwen3.8 刮目相看。
一位用户三台 PVE 同时挂了两台,用 Qwen3.8-Max 修了一天,称其表现比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打,目前已修好一台。该用户表示因此对 Qwen3.8 刮目相看。
在 OpenAI 宣布企业套餐加入 GLM 5.3 等开源模型后,Anthropic 发布报告批评开源模型安全问题。报告称 GLM 5.3 是网络安全能力最强的开源模型、落后美国前沿模型约 4 个月,且是测试中唯一具备漏洞利用能力的模型,但可通过 abliteration 移除拒绝行为,单次成本约 4400 美元。
2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。
DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。
DeepSeek 推出 Harness,访问入口为 deepseek.com/harness/。登录该服务可获赠 6 元额度。
DeepSeek Harness 桌面版正式发布,macOS 和 Windows 安装包同步上线,并伴随 DeepSeek Harness v0.2 预览版更新。
材料完整列出桌面版、v0.2 预览版的插件管理与创造模式等变化,可据此判断其工作流整合程度。
SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。
Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。
Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。
Command Code 将 $10/月 GOAT 套餐中 DeepSeek V4.1 Flash 的使用额度永久提升至 $60。该套餐被其称为市场上面向开源模型的最佳方案。
图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。
从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。
ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。
SemiAnalysis 推出 SemiAnalysis China Datacenter Model,追踪中国 60 多家运营商的 1000 多个数据中心设施,显示中国数据中心容量超过 24GW,超过 EMEA 和亚洲其他地区。
Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。
Dify Marketplace 新增精选展示位,并上线点赞、星级评分与文字反馈功能,插件和模板详情页均可提交,创作者中心会汇总所有反馈。目前平台已收录 1,000+ 插件和 300+ 开箱即用模板,用户可调用 DeepSeek 做内容生成与复杂推理,或用通义千问处理多模态内容。
Genspark 正式上线编码智能体 GenCode,集成在 Genspark Super App 中,可在 Claude、GPT、DeepSeek 或开放权重模型之间按任务自行选择,无需配置 API key。引用推文称开放权重方案的成本为前沿模型的 1/10 到 1/20,作者表示该工具原为内部开发工具,现已对外开放。
Bolt Forge 上线开放模型一周后,GLM 5.3 Flash 拿下 63% 的调用占比,DeepSeek V4.1 Flash 为 17%,两款 Flash 模型合计承接 80% 的提示词。更大模型就在选择器里,开发者仍持续选择快速模型,另有 9 美元/月的 bolt.new/lite 方案。
Genspark 在 Super App 内上线编程智能体 GenCode,用户可在同一账号内按任务选择 Claude、GPT、DeepSeek 或开放权重模型,无需自行配置 API key。官方称开放权重模型成本仅为 1/10 至 1/20,且模型选择权交给用户而非由智能体代为决定。
2026网易科技未来大奖获奖名单揭晓,梁文锋(DeepSeek CEO)、杨植麟(月之暗面kimi CEO)等10人获评"AI创新先锋人物"。宇树科技、智元等10家企业获"具身智能先锋企业",京东JoyAI、蚂蚁百灵、理想VLA、百川智能、水木分子、面壁智能CPM for Legal入选"行业大模型应用标杆"。
小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。
作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。
Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
Ollama 上 deepseek-v4.1-flash 模型的部分请求因费率错误被多扣用量,官方已致歉并重置用户月度(或旧方案的周度+会话)用量,同时把该模型造成的额外消耗额度返还到账户。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。
小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。