跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–12 条 · 共 12 条
今天10月10日周六
  1. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe 的 Jev 十类真实用例:从 Agent 路由到自动驾驶的低成本决策

    TypeSafe AI 于 2026 年 9 月 15 日推出 Jev,并宣布获得 DCVC 领投的 4,000 万美元种子轮融资。Jev 不聊天不写文本,接收 state 与 typed questions,返回带校准概率的 Choice、Score 和 Noul 答案,通常耗时 70 到 500 毫秒,输入每百万 tokens 收费 0.042 美元、输出免费。

    为什么值得看

    梳理 Jev 的十类真实用例与每类成本延迟数据,可对照现有 LLM 工作流判断哪些小决策值得下放。

  2. 国际大厂AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软在 Windows 发布会推出混合智能,GitHub Copilot 可调用本地模型

    微软在 10 月 8 日的 Windows 发布会上宣布将混合智能引入 Windows,通过模型路由、Windows ML 和本地 AI 能力,让 Copilot 等产品按任务复杂度、成本和隐私要求在云端与本地模型之间自动切换,GitHub Copilot 的 HydraFusion 首次可直接调用运行在 Windows PC 上的本地模型。

    为什么值得看

    微软把混合智能与模型路由引入 Windows,并让 GitHub Copilot 直接调用本地模型,读者可了解 AI PC 向 Agent 运行环境演进的具体路径。

10月9日周五
  1. 爱范儿AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Surface Laptop Ultra 与 Windows 混合智能更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。

    为什么值得看

    梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。

  2. 技术前沿AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Gemini 中引入智能体能力,先从企业客户开始

    Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。

    为什么值得看

    Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。

10月6日周二
  1. The Rundown AI(@TheRundownAI)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1T 参数开源模型 Mistral Large 4,代号 Le Chonk

    Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,已在 API 上线,开放权重将于 10 月底发布。

    为什么值得看

    原文列出 Mistral Large 4 在多类工作负载上的对照数字,读者可据此判断开源权重模型的竞争位置。

9月30日周三
  1. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

9月22日周二
  1. Vercel NewsAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 上线 Vercel AI Gateway

    Anthropic 的 Claude Opus 5.5 已在 Vercel AI Gateway 上线,模型标识为 anthropic/claude-opus-5.5,支持 1M token 上下文窗口和最多 128K 输出 token,面向智能体编码、长时智能体任务和专业知识工作。

    为什么值得看

    Claude Opus 5.5 上线 Vercel AI Gateway,同时列出两项会导致 400 报错的 API 不兼容变更,便于现有调用方迁移。

8月27日周四
  1. 向阳乔木推荐看AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱认领匿名模型 Ox-Alpha 为 GLM-5.3-Flash,开源并以 Opus 4.8 的 1/40 价格提供

    智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。

    为什么值得看

    文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。

  2. LangChain BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangGraph Platform 正式 GA,面向长时间运行的有状态 Agent 提供部署与管理

    LangChain 宣布 LangGraph Platform 正式 GA,定位为部署和扩展长时间运行、有状态 Agent 的基础设施与管理层;自去年 6 月 beta 以来,已有近 400 家公司用它把 Agent 部署到生产环境。

    为什么值得看

    原文列出 1-click 部署、30 个 API 端点和持久化层等能力,并给出三种部署选项的适用边界。

8月26日周三
  1. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

8月25日周二
  1. SemiAnalysisAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Jalapeño 芯片实测:能效超过 Nvidia Blackwell

    OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。

    为什么值得看

    SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。

7月27日周一
  1. Modal BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K3,Modal 发布首日上线并给出推理性能数据

    月之暗面发布 Kimi K3,一个 2.8 万亿参数的多模态模型,具备 1M token 上下文窗口和原生视觉能力。

    为什么值得看

    读者可看到 2.8T 参数开源模型在发布当天上线的推理性能数据与 Moonshot 的架构取舍,理解大模型可服务性背后的工程细节。