NVIDIA OpenShell 为 AI 智能体添加运行时控制
NVIDIA 发布 OpenShell,为 AI 智能体加入运行时控制能力,使其在获得工作区、算力、数据、凭证与外部服务访问权限的同时可被约束。AI 智能体可被赋予目标、编写代码、调用工具,并在新信息出现时持续工作,支撑软件故障排查、实验运行以及跨越数天或数周的关键业务操作与研究。
NVIDIA 发布 OpenShell,为 AI 智能体加入运行时控制能力,使其在获得工作区、算力、数据、凭证与外部服务访问权限的同时可被约束。AI 智能体可被赋予目标、编写代码、调用工具,并在新信息出现时持续工作,支撑软件故障排查、实验运行以及跨越数天或数周的关键业务操作与研究。
大淘宝商家财务团队用 Ontology 四层图谱(业务/系统/交付/治理)加 decision_function 结构化决策,替代预设 workflow 和打包 Skill,让 Agent 按"先取证、再决策、后行动"闭环动态生成流程,3 个月在 Agent Room 完成 120+ 需求与工作项,覆盖需求开发、工单处理、数据订正和业务运维。
Milvus 社区将于 10 月 7 日在 Criteo 巴黎办公室举办线下活动,聚焦向量搜索在生产环境中的难点。Zilliz 解决方案架构师 Simon Hearne 将可视化向量索引并讲解召回率下降的原因,Criteo 与 Gorgias 的工程师将分别分享分布式向量搜索系统的落地历程与 RAG 索引模式。活动 18:00–22:00 CEST 举行,演讲为英文,需提前注册且名额有限。
Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。
Vercel CEO Guillermo Rauch 将 Mini 网页浏览器移植到 Rust 和 Swift,称其更快、更安全,且迭代体验优于 Electron + Bun。
针对每秒20w写、1k读的写多读少定长value场景,无锁缓存通过写入定长value加16bit CRC签名、读取时校验签名,签名不一致则返回NULL视为cache miss,以牺牲一致性换取零锁冲突。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,解决 AI 工厂为应对 GPU 峰值功耗而预留保护缓冲、导致正常运行时基础设施利用率不足的问题,从而提升 AI 工厂吞吐量与效率。
Vercel Sandbox 的可观测性现已纳入内存用量数据,可在仪表盘和 CLI 的 vercel metrics 命令中查看。仪表盘的 Memory Usage 卡片给出各沙箱的平均、P75 和 P95 内存,沙箱详情页图表会按沙箱内存上限自动缩放 y 轴,并在上限 85% 处加一条虚线参考线。
Anthropic 的 Claude Sonnet 5.5 已在 AI Gateway 上线,模型标识为 anthropic/claude-sonnet-5.5。
Tw93 重新介绍了他在过年期间开发的 Mac 终端 Kaku,安装后无需配置即可使用,对 AICoding 友好,并结合自己的编程习惯做了不少顺手优化。该项目已开源并迭代 21 个版本,保持 0 issue,作者称其为自己做过的最复杂的项目。项目地址为 github.com/tw93/Kaku。
一位 Devin 付费用户称,因 Cognition 拒绝其按季度付款的请求,他用两天时间基于自有基础设施搭建了替代方案 Hermes,功能与 Devin 几乎完全等价,成本约为 Devin 的 25%。该用户此前 Devin 使用量年化已超 10 万美元,原计划为获得 BAA(HIPAA 合规协议)将支出提升至约 1.5 倍。他认为问题不在 Devin 本身,而在于销售策略。
METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。
AI Agent 管理平台 Paperclip 登上 GitHub 热榜第一,单日新增 2000 多 Star,总 Star 超 8.5 万,支持接入 Claude Code、Codex、Cursor 等 Agent,并提供组织架构、审批、预算与审计记录。
一个号称"决策模型界 Ollama"的项目可本地拉取并服务 Laya、decider、NLI、GLiClass 等开放决策模型,并暴露 TypeSafe 兼容 API,可用于 LLM 路由和零样本分类的本地推理底座。项目地址为 github.com/ollaya-dev/oll。
Node 中文周刊 #244 盘点了 12 个可取代 axios、dotenv、nodemon、chalk 等 npm 包的 Node 内置模块,并逐一标注其在 Node 24 LTS 中的稳定性等级。
微软 CEO Satya Nadella 在 Sources Podcast 访谈中称,agent 时代创造的市场规模会比云计算大几个数量级,并批评 AI 行业只顾炫技、忽视普通人真实体验。
华为联合中国信通院、中科院沈阳自动化研究所等发布《物理智能云边端协同架构研究报告》,提出"三域协同·一网贯通"架构,让端侧负责微秒/毫秒级实时控制、边缘侧负责区域自治与多机协作、云端负责大模型训练与全局规划。报告将落地划分为三阶段,中期(2028—2030年)走向区域自治,并已在WAIC发布全国首个异构人形机器人具身智能训练场"麒麟训练场"作为样板点。
TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。
对 16 款前沿 VLM 的文档解析评测显示,提高 effort 通常能改善 PDF 读取表现,Opus 5.5 在同价位中性能最强,尤其擅长解析表格;Astra 表现也不错但起价更高,GPT-6 Luna 在低价端更有吸引力。
Andrew Ng 指出,AI 工程策略必须随项目生命周期调整:早期 AI 项目不需要严格的测试,但成熟产品需要。本期 The Batch 还提到 Claude Opus 5.5 的性能指标、Jev 分类模型走红、Devin Fusion 在同一 harness 中引入 lead 与 sidekick 模型,以及面向去中心化智能体的 Message Passing。
LlamaIndex 指出,表格中的空白单元格会让 Agent 决策出错,许多文档 OCR 工具读取多个空白单元格时会把数值错移行列,导致下游数值解读错误。官方用 LlamaParse 解析美联储 2026 年 9 月预测表第 2 页,GDP 中位数摘录的九个数字与原始 PDF 全部一致,且在返回的 HTML 中保持对齐。该表因含 2029 年列而对比行留空,正是文档解析器的常见隐性失效点。
GitHub 官方账号抛出讨论:聊天是否永远是合适的 UI?@burkeholland 认为不是,至少在 GitHub Copilot 应用中有了 canvases 之后并非如此。该观点以文章形式发布,帖文互动量为 56 条回复、20 次转发、234 次点赞。
fal 的 3D 转视频模型上线 H3 Max,可将最长 15 秒的 Blender 预演转成写实视频,同时保留镜头运动与镜头时序,并支持添加参考图把特定角色和环境带入成片;该模型被称为市面上最快的视频模型,在视频编辑方面排名第一。Justine Moore 让 Astra 制作了人们站在田野中观看 UFO 的场景,反复调整时序与机位后交由 H3 Max 生成写实片段。
Genspark 上线 Nemotron 3 Ultra 与自研 Gen-1 Slides 模型,官方称达到前沿质量而价格仅为 Opus 5 的 1/17。这两个模型与 Nvidia 生态合作落地,Genspark 早前已加入 Open Weights and American AI Leadership 公开信及 Open Secure AI Alliance。
GitHub 将于 9 月 29 日举办网络研讨会,介绍如何在开发流程的每个环节用 GitHub Advanced Security 验证代码。该研讨会针对“写代码和交付代码的速度前所未有,但能否信任这些代码”的问题,现已开放注册。
SemiAnalysis 推出 SemiAnalysis China Datacenter Model,追踪中国 60 多家运营商的 1000 多个数据中心设施,显示中国数据中心容量超过 24GW,超过 EMEA 和亚洲其他地区。
LlamaIndex 用 LlamaParse 解析美联储 2026 年 9 月经济预测表格第 2 页,与原始 PDF 比对,展示的 9 个 GDP 中位数数字全部匹配,且返回的 HTML 中数据保持对齐。该表格包含 2029 年列,但 6 月对比行对应单元格为空,空白单元格是文档解析器常见却不易察觉的失败点。LlamaParse 可用于这类表头和缺失单元格都关键的表格。
ElevenLabs 推出 ElevenLabs for Students,为学生提供 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI 的使用权限,外加一年 ElevenReader Ultra。官方称,让学生用上专业工具,是为他们毕业后工作做准备的最简单方式。
Groq 回应微软 Brad Smith 提出的 AI"安全刹车"主张,认为"安全云"不该变成少数供应商的代名词,安全应是一套运营标准,涵盖访问控制、监控、事件响应与可审计性。Groq 称其 Groq Cloud 从设计之初就面向 AI 构建,在各层级内置防护措施,并对新风险快速响应。
Stack Overflow 播客对话 BrowserStack 开发者关系与开源负责人 David Burns,讨论 AI 时代职业怀疑精神的价值,以及如何把测试驱动开发用于智能体工程。Burns 认为,修复 flaky test 的关键在于管理应用状态。
归藏(藏师傅)用 Opus 5.5 为 CodePilot 产品一键生成了一支产品宣传视频,称其在图像图形类前端表现突出,效果"吊打"他所说的 GPT-6 Astra。他表示后续会把相关经验沉淀进自己的 guizang-product-video-skilll,让较弱的模型也能获得不错的效果,并已就此展开 skill 测试。
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
Vercel 在 AI Gateway 以 stealth/pixel-canary 形式上线 Pixel Canary,隐身期内限时免费,该模型擅长编码,包括构建应用、重构代码以及前端开发和移动端应用设计。
Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。
LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。
SonarSource CEO Tariq Shaukat 确认在 AI Engineer New York 演讲,主题为“The Machine that Changed the World, vAI”,提出面向智能体软件工厂的验证优先框架,目标是在快速交付的同时不牺牲信任。活动时间为 10 月 12 日至 14 日。
Nous Portal 订阅用户在 Hermes Agent 中已默认启用 Perplexity Fast Search。该搜索面向智能体任务,单次搜索调用延迟为 p50 160 ms、p95 230 ms。
Recraft V4.1 Flash 已上线 ComfyUI,单张图像生成耗时 1.3 秒,官方称其为市面上最快的图像模型。用户可先快速生成草稿图用于迭代,再将满意的结果精修至 2048×2048 的 Pro 画质。
Fireworks AI 宣布成为 LangChain LangSmith Fine-Tuning 和 smithtune 的首发训练合作伙伴,用户可用 LangSmith traces 在 Fireworks 上完成托管 SFT,再经 eval 到部署,全程一个 CLI、无需训练基础设施。
LlamaIndex 发布新文章,从"能否用于决定自动化与人工审核"的角度审视文档抽取中的置信度评分,覆盖置信度阈值、精度与召回、分数覆盖率、分数粒度和人工审核量。借助 ExtractBench,其对比了不同抽取系统在置信度过滤后的表现:在 97% 精度目标下,LlamaParse Agentic Plus 过滤后在预期字段上达到 66.48% 召回。