Modal Runtime 大会发布 VM Sandboxes、Modal Clusters 等多项更新
Modal 在首届 Runtime 大会宣布 VM Sandboxes,为 AI 智能体提供完整 Linux 计算机,已在 Linear、Legora、Snorkel 用于编码智能体与评测,并同步推出同主机隔离的 Sandbox Sidecars。
Modal 在首届 Runtime 大会宣布 VM Sandboxes,为 AI 智能体提供完整 Linux 计算机,已在 Linear、Legora、Snorkel 用于编码智能体与评测,并同步推出同主机隔离的 Sandbox Sidecars。
Vercel Agent 现已能通过存储在 Vercel 共享环境变量中的凭据,从 npm 和自定义 registry 安装私有依赖,会话中的 npm、pnpm 与经典 Yarn 认证方式与 Vercel 构建一致。
Cognition 成为首个运行 NVIDIA Vera Rubin 的客户,算力由 CoreWeave 提供。在 SWE-2 推理上,新芯片在相同解码速度下 token 吞吐量约为 GB200 的 4.8 倍。Cognition 此前已先后用上 2022 年的 Hopper 与 2024 年的 Blackwell。
Vercel AI Gateway 现已接入 Browserbase 的 Search 和 Fetch 工具,让模型能获取实时信息、查找并抓取网页内容。开发者用同一个 API key 即可跨模型提供商调用这些工具,切换模型时工具配置保持不变,需 AI SDK 7.0.116 及以上版本。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统,将推荐任务重构为对用户行为的序列建模。用户的交互、上下文、候选物品与动作都被转化为高基数事件流中的 token,取代了原本割裂的召回、排序与预测多阶段流程,从而面向大规模个性化场景。
Vercel 推出 Connect,允许服务方提交接入,触达 2000 万+ 开发者和他们构建的智能体。提交流程包括描述服务、添加 OAuth 或 API key 认证、用真实 token 验证并送审。官方称 Connect 用 OAuth/API key 认证取代分散的静态凭证,对智能体和应用都更简单、更安全。
NVIDIA AI 将于明天太平洋时间上午 9 点直播,演示如何用单个提示词构建一个视觉 AI 智能体,并在 YouTube 上开放提问。
Dia 发布 Windows Wednesday 第 10 期,由 Farah 演示 Windows 版 Dia 中的连接 Apps 功能,以及如何为日常工作添加更强的上下文。
NVIDIA 发布 cuObject 和 SCADA Server SDK,为 AI 工作负载提供对文件与对象存储的高速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询都需要高速数据访问,而这些数据大量存放在本地与云端文件及对象中。
Grafana Labs 发布 Tempo 3.1,为基于 Kafka 的接入新增 TLS 和 SCRAM-SHA-256、SCRAM-SHA-512、OAUTHBEARER、AWS_MSK_IAM 四种 SASL 机制,并加入 client_rack 机架感知拉取、producer_compression 压缩配置以及采样感知的 TraceQL metrics 查询。
GLM 5.3 Flash 现已在 Fireworks AI 的 Serverless Training API 上开放训练,所有人可用,同时支持视觉与文本。该模型在智能体编程、文档分析和工具调用等基准测试中表现优异,且服务成本较低。
MHK 基于 Amazon Bedrock、Amazon ECS 与事件驱动模式构建了 HIPAA-eligible 的智能体工作流框架 SmartProminence AI Orchestrator,将人工病历审核工作量减少 90%,原本需 3 个月以上部署的新 AI 功能现在 2 周即可上线。
Recraft V4.1 Flash 已在 Runware 平台上线,可通过 Playground 试用或经 API 接入工作流。该闪速级模型支持 14 种宽高比预设、最高 1536×768 分辨率,可用目标色板或固定背景色引导输出,定价为每张图 $0.007。Recraft 表示其提示词遵循度优于同类快速模型,并在人像、复杂场景和 logo 概念上表现较强。
Next.js 发布 v16.3.8(Active LTS)和 v15.5.27(Maintenance LTS)安全更新,修复 Image Optimization 中的 SSRF(CVE-2026-94483)和一个高severity漏洞。
LangSmith Roadshow 明日继续在洛杉矶举行,活动聚焦智能体开发现状与 2026 年生产部署要点。参与者可上手体验 LangSmith Engine 和 Deep Agents,ServiceTitan 将分享其生产环境中的 LangSmith 使用案例。名额有限,需通过 events.langchain.com 报名。
Crosby Legal 让 Devin 承担一线响应,每天调查 20–40 个 bug 和告警,将 Sentry 噪音降低 50%;在其法务团队扩张 5 倍的情况下,on-call 仍只保留一名工程师,背后是 12 名工程师支撑 50+ 律师。
Stack Overflow 宣布将 Stack Internal 平台开放给更多人和团队,把组织内部知识汇入共享层,并通过 chat、API 和 MCP 提供。该平台强调"决策级知识"的五个要素:来源可追溯、适用条件明确、权限受控、冲突可见、有人能裁决,人类专家负责验证和修正知识,AI 负责检索、比对来源并发现缺口。
Fireworks AI 详解何时启用 GLOBAL 选项,并介绍其多区域路由架构如何把全球工作负载调度移出推理热路径,以优化低延迟、韧性与运维简便性。
NVIDIA 与 Nous Research 合作演示了用 NVIDIA NeMo Relay 为 Hermes Agent 采集 trace,跑通两个示例场景并在 Arize Phoenix 中查看智能体的完整调用与重试链路。博客还介绍了 Nous 如何借助 trace 和任务结果,在多次重复运行中评估各项修复。
Dify 演示了与 Jev 的联动:工作流编排把 MON/USDC 实时订单簿数据转成结构化信号,驱动 20 轮纸面交易,每步决策均被记录并以图表呈现,形成可测试、可检查、可调整、可发布的应用。该插件已在 Dify 插件市场 marketplace.dify.ai 上线。
NVIDIA NeMo Relay 用于追踪 Agent Harness 行为,解决智能体完成任务却走低效路径的问题:失败的搜索会触发重复搜索,被截断的文件读取会引发命令重复获取同一内容,最终答案正确却掩盖了这些增加延迟、消耗 tokens 的多余步骤。低效步骤会带来更多失败机会,该工具旨在帮助改进智能体的行为。
微软研究院开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成位置级空间天气风险估计,可提前 30 至 60 分钟预警。
Stack Overflow 宣布 Stack Internal 正式开放,任何人都可在 stackinternal.com 免费创建 Starter 工作区,连接最多三个数据源并邀请少量队友协作。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,预计到 2026 年底 Claude Code 覆盖其 50% 开发者,2027 年覆盖多数软件工程师。
NVIDIA 提出在 Jetson 上进行智能体式(Agentic)开发的新方式,用于构建边缘 AI。原帖未披露具体的模型版本、参数规模、性能数字或可用性信息,正文仅附有一场 X 直播链接。
Gemini Enterprise Agent Platform(原 Vertex AI)现已上线 Interactions API,可直接调用 Gemini 模型,并继续沿用同一套 `google-genai` SDK。
Cohere Embed 5 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 提供,也可直接在 North 中使用。Embed 5 的 Pro 与 Fast 两个版本共享同一嵌入空间,因此可用其中一个建索引、另一个做检索,同时保持性能表现。
2026 高通骁龙峰会在夏威夷茂宜岛开幕,高通围绕 Agentic AI 发布两颗 2nm 旗舰芯片,设备形态从手机延伸到眼镜、耳机甚至 AI Pin,并与阿里、Google 等厂商合作 AI 笔记本电脑,提出手机从以 App 为中心转向以智能体为中心。节目还讨论手机在多入口下的中枢地位、终端 AI 的付费意愿,以及高通在 Snapdragon 设备间推进互操作协议并计划开放为行业标准的思路。
阿里云栖大会分论坛上,Qoder 技术负责人谢吉宝披露 Qoder 上线一年超过 80% 的用户已不再亲自写代码,非编程任务占比超 50%。9 月 23 日发布的 Qoder v0.4.0 新增项目、讨论、自定义 Agent 与 Agent Team 四项能力,把项目目标、任务状态和讨论结论统一留存,Agent 协作可跑在当前设备或 Qoder Cloud Agents 上,目前面向企业订阅开放。
WorkBuddy 5.6.1 及以上版本可一站式开发微信小程序,生成、预览、发布都在同一窗口完成,并以微信第三方服务商身份代传代码和提审,免去开发者工具、AppID 与手动传包。
得物上线 3D 空间图片功能,用户发布图片时带上 #空间图片 话题,服务端即用单图前馈生成 3D Gaussian Splatting 三维场景模型,客户端按手机姿态实时渲染。该方案通过属性量化与紧凑编码把文件体积相比压缩前减少约 81.5%,并采用 GPU 稳定 Radix Sort 使排序耗时降低 60%–75%。经真机测试,iOS、Android 帧率稳定在 60FPS。
高德推进 BI AI 化,面向本地生活业务建设数据分析 Agent,把业务知识整理进知识库、分析方法写成 Skills,由 Agent 调用数据和工具完成分析。该体系采用 L0–L4 能力分级,绝大部分任务已具备 L3 特征,可沿业务链路回答"收入为什么下降";到 S1 末已支撑本地生活多个业务单元的例行经营诊断,全行业经营简报一小时内产出。文章还复盘了分析执行、知识复用、经营判断三段返工与取舍。
2.8万亿参数、104B激活参数的Kimi K3因数据搬运和内存带宽瓶颈,普通服务器难以支撑推理。9月21日浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,用紧耦合128芯本土AI芯片单机承载K3,Token生成时延首次低于5.85毫秒,并通过超级算子智能体让K3参与自身优化,性能再度提升50%。
AI产品黄叔借助 Opus5.5 跑通几种内容类型后沉淀出多个 skill,将战争解读视频的大部分流程自动化,并用 listenhub 克隆语音配音。成本约为 Claude Max 100 美元周额度的 2%-3%,一周 token 能产出 30 条以上视频,单条配音消耗约 10 元。他准备开新号专门做经典战役解说。
小红书引擎架构团队与质效研发部公开推荐系统 Agentic 发布的 Harness 实践:一次发布横跨十几个部署组、数千个 Pod,平均持续 10 多个小时,并需等待次日真实流量验证。
Ollama 现已支持在本地运行 Jev 类决策模型,可调用 Nimble 等模型处理工单分流、模型路由和内容审核任务,通过 ollama pull nimble 即可获取。Nimble 还能借助新增的本地 /v1/systemone API 实时做出决策,例如驱动 Ollama racer 运行。
临界点让旗舰灵巧手 OmniHand 3 Ultra 向苏绣传承人学习上绷、劈丝、穿针、捻线、挑线与合绣,全程实拍无 CG。OmniHand 3 Ultra 具备 21 个主动自由度,触觉覆盖指尖、指腹和掌面,每个指尖内置米粒大小相机;所用真实绣花针针孔关键尺寸不超过 0.15 毫米,劈丝则从一根蚕丝分到十六股。前段劈丝由它自主完成,线股变细后由老师手把手带做,合绣时人手与机器在同一绷面交替落针。
LlamaIndex 对 Jev 与多个开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、拆分等文档任务上进行基准测试,评测维度为准确率、成本和延迟,Jev 在三个维度上的多数基准中领先。相关代码已在 GitHub 开源,并附有视频讲解。
有开发者反映,为简单简历开发 BOSS 直聘插件时,让 ChatGPT 通过 CDP 操作 Chrome、或用 grok bot 云端操作,都会被网站直接打到空白页面。现在不少网站会记录鼠标移动轨迹和按键等操作,用来分析是否为真人,国内很多平台可能也已采取类似反自动化手段。除非能做出完全拟人的操作,否则这类自动化封锁目前没有好的解决方案。
架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。