NVIDIA:CoreWeave 用 Dynamo 加速 RL 后训练模型重载,提速 15 倍
CoreWeave 新服务借助 NVIDIA Dynamo 中的 ModelExpress 和 Router,将 RL 后训练中的模型权重重载速度提升至基线的 15 倍,并把停机时间降到最低。该结果在 CoreWeave 与 NVIDIA、You.com 合作后训练 Nemotron 3.5 Lightning 时取得。
CoreWeave 新服务借助 NVIDIA Dynamo 中的 ModelExpress 和 Router,将 RL 后训练中的模型权重重载速度提升至基线的 15 倍,并把停机时间降到最低。该结果在 CoreWeave 与 NVIDIA、You.com 合作后训练 Nemotron 3.5 Lightning 时取得。
Elastic 委托 Forrester Consulting 开展 Total Economic Impact 研究,基于金融科技、电信等五个行业企业访谈构建了一个营收 $10 billion、服务 25 million 客户的复合企业模型。
Spring AI 发布模块化 RAG 实践教程,用 RetrievalAugmentationAdvisor 的 builder 把查询改写、查询扩展、向量检索、JevDocumentFilter 与 JevDocumentReranker 后处理拼成一条流水线。
Harrison Chase 称每个 agent harness 都需要 durable runtime,并点名 pi-durable、deepagents 和 langgraph 三个方向。Pi 团队宣布 Pi 1.0 随 Pi Durable 一同发布,官方博客链接为 earendil.com/posts/pi-1-0/。
Fireworks AI 指出,rollout 驱动了 RL 的大部分算力开销,但把 rollout 与训练拆分到不同引擎会带来数值不匹配,在 MoE 模型中甚至会把 token 路由到不同的专家。Fireworks 选择自研并协同构建两个引擎,使训练保持快速且一致。
OpenRouter 的图像生成支持 1K 或 2K 分辨率输出,宽高比可在 21:9 到 9:21 之间任意选择,也可交给 auto 模式自动决定。
LangSmith for Startups Spotlight 介绍了 Corridor 的使用方式:用 LangSmith 开发并运行新型智能体安全评估、构建并追踪推理管线,以及管理为不同产品界面提供专门上下文的记忆图谱。Corridor 提供了演示地址 corridor.dev/demo。
Replit 面向用户注册增长场景,支持在平台内分析漏斗数据并追问“Where can we increase activation?”,再跟进一句“Make it a dashboard.”即可生成仪表盘。用户无需预先知道最终产出,从一个问题出发就能得到洞察和可用结果。
LangChain JS 的 @langchain/mcp-adapters 2.0 发布,让 TypeScript 智能体接入 MCP 服务器更简单。新版本支持最新的无状态版 MCP,工具可在需要时向用户确认,并大幅简化了认证集成,还带来大量体验优化。
Bolt.new 官方演示了如何用 UTM 参数让同一个站点针对不同来源的访客自动调整落地页内容,而不是把所有访客都导向同一个页面。该做法面向 Bolt.new 建站场景,正文未给出具体模型版本、参数或性能数据。
LangChain Academy 更新了《Introduction to Deep Agents》课程,Deep Agents 让构建智能体更简单,Managed Deep Agents 则支持用单条 CLI 命令完成部署。课程还演示了如何把智能体部署到 Slack。
Azure Cosmos DB 推出 Global Secondary Indexes,把 AI 智能体的读密集型后台工作与实时智能体流量拆分开,无需搭建复制管道。该方案面向需要持续读写、工具调用和数据库访问的 AI 智能体场景。
Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。
Docker 在 WeAreDevelopers World Congress North America 上发布 Cloud Sandboxes,为智能体提供隔离 microVM 运行环境,开发者可用同一命令行工具 sbx 在本地启动、将沙箱迁移至云端长时间运行再取回结果,计算按秒计费,目前可用。
NVIDIA 发布 DOCA Agent Skills,为通用 AI 智能体补上 DOCA 这一基础设施软件领域的专业知识,减少其在开发中因缺乏领域知识而产生的猜测性错误,从而缩短反复纠错占用的时间。DOCA 是 NVIDIA BlueField 的统一软件平台,该技能面向在 BlueField 上构建应用的开发者。
Do Inference Now (DIN) Deploy 是一个开源 C++ 示例集合,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者把模型 checkpoint 推向原生本地应用。它面向需要可移植模型格式、可靠运行时和跨目标系统加速的本地 AI 应用场景。
Cloudflare 开源了首批自研决策模型 clef 和 clef-flash,两者已在 Cloudflare Workers AI 上线。Harrison Chase 评论称,此前就有人预言决策模型领域会迎来更多入局者,如今连开放权重也出现了,并称 harness 应该能像替换主模型一样轻松替换决策模型。
Harrison Chase 与 Sydney Runkle 讨论如何正确实现 model routing:先理解任务、理解模型,再把路由器构建在 harness 内,并追踪结果,从而在成本更低的同时不损失性能。
LangChain 分享了在 harness 中构建模型路由器的四个步骤:理解任务、理解模型、在 harness 中实现路由器、追踪任务结果。据其披露,该方案将每线程中位成本降低了 64%,且质量没有变化。
Cloudflare 的 workers ai 团队发布首个自研模型系列 clef,包含两个快速、准确的决策模型,在质量与延迟基准上登顶。模型已开源,权重可在 Hugging Face 获取(Cloudflare/clef),也可直接使用 workers ai 的托管版本。
Vercel CEO Guillermo Rauch 表示,MicrosoftAI 团队正在训练出色的模型,Vercel 将在这些模型发布的第一天(day zero)就提供接入支持。推文未披露具体的模型名称、版本或上线时间。
OpenRouter 上线 IP allowlist 功能,管理员可将 API 访问限制在已批准的 IP 地址范围内,来自其他地址的请求将被直接拦截。该功能面向需要收紧 API 调用来源管控的管理员。
OpenRouter 的 Key Safety 标签页可集中查看所有工作区的 API keys,并支持按风险、所有者和不活跃状态筛选。用户还能为 key 设置额度上限、禁用或归档,既可逐个操作也可批量处理。
LlamaIndex 发布 Extract v2.5,一组专为文档抽取调优的前沿智能体,分为 cost-effective、agentic、agentic plus 三档,价格比 Opus 5.5 和 GPT-6 Sol 便宜 30%-4x。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,目标到 2027 年底培养 1 万名 Frontier Deployed Engineer(FDE)。
Sam Altman 表示 6.1 Sol 是增长最快的模型,此前在高负载下响应偏慢,目前已大幅改善。该帖获 922 条回复、345 次转发、12242 次点赞和 831630 次浏览。
OpenRouter 审计自家账号时发现,85 名员工名下有 1000+ 个活跃 API key,其中许多已数月未被使用。为此其推出 Security Center,可展示各工作区中的所有 key 并标记风险原因,支持批量禁用、归档或设置上限,单次最多处理 500 个。
Datalex 与 AWS 在 2025 年 12 月合作开展为期三天的 Experience-Based Acceleration(EBA)工作坊,16 名 Datalex 工程师与 6 名 AWS 专家将 EJB/Java 8 迁移到 Spring/Java 21。
三台 PVE 同时挂了两台,作者称用 Qwen3.8-Max 修了一天,感觉其表现强于 Grok-4.7 和 DeepSeek-V4.1-Flash,目前一台已修好,并因此对 Qwen3.8 刮目相看。
Perplexity 在 Computer 中推出由 Amex 精选的即用技能库,面向符合条件的美国 Amex Business 小企业卡会员开放。这些预置工作流可处理现金流预测、营销活动生成等日常业务任务,用户只需在 Computer 中选择任务并补充业务信息,无需从零编写指令。
Modal 宣布 Modal Clusters 正式可用,通过 @modal.clustered 装饰器即可调用,并可与 Volumes、Cloud Bucket Mounts、Queues 等既有原语配合使用。
Recraft V4.1 Flash 已在 OpenArt 上线,可与其他模型并排对比效果。OpenArt 称其为市面上最快的图像模型,出图仅需 1.3 秒,工作流零延迟。
在华盛顿一场科技圆桌论坛上,马斯克称美国平均用电负荷约 500 GW,每新增 5 GW 基荷电力约拉动 1% GDP(约 3000 亿美元),并主张把算力送上太空,SpaceX 计划与特斯拉联手实现每年 200 GW 太阳能组件产能。
Mole App 即将推出 AI 工具清理功能,可清理不再需要的 AI 缓存、旧会话和 worktree,并卸载长期未用的 AI 工具。作者测试了 30 多款 AI 软件,实测收集对话、缓存、worktree、临时文件和安装位置等信息,目前功能处于 Preview 版本,下个版本放出。
TypeSafe AI 发布 System One 模型 Jev,它不生成文本,而是接收状态和问题后返回带概率的类型化答案,公司称在分类任务上推理速度最高快 200 倍、成本低 400 倍。
Vercel AI Gateway 称其是全球 AI token 流向最大的可信数据源,因为它掌握真实客户在规模化平台上的真实用量,且零加价,平台已有 40 万+付费客户和数千家企业。
AMD 与魔搭社区推出开发者激励计划 2.0,开发者可在魔搭模型库直接调用运行于 AMD Instinct GPU 上的 DeepSeek、GLM 等热门大模型,每位用户享 10 次初始免费调用额度。
Vercel 与 Microsoft AI 合作,将 MAI 模型接入 AI Gateway,支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming。
Modal 宣布 VM Sandboxes 正式可用,用户通过 runtime="vm" 一个参数即可让智能体获得完整 Linux 虚拟机,同时沿用原有 API、modal.Image、亚秒级冷启动与 CPU/内存突发能力。
Modal 发布 Sidecars,一种与主 Sandbox 在同一主机上并行运行、但保持隔离的容器,用于在可信与不可信代码之间建立安全边界。