niteshift.dev 推出自然语言触发器,将高并发事件接入 Jev 过滤后分派智能体
niteshift.dev 上线"自然语言触发器",可把 Slack 消息、Datadog 告警等高并发事件流接入由 Jev 驱动的自然语言过滤器,再分派给对应的 agent、模型或沙箱。
niteshift.dev 上线"自然语言触发器",可把 Slack 消息、Datadog 告警等高并发事件流接入由 Jev 驱动的自然语言过滤器,再分派给对应的 agent、模型或沙箱。
作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。
Fireworks、E2B 与 Braintrust 将于 9/30 联合举办技术分享会,主题覆盖不可信代码沙箱隔离、以智能体循环速度服务模型,以及如何判断改动是否真正奏效。活动需通过 luma.com/e2b-0e34 报名。
GitHub 借助 napi-rs 垫片,在持续每日发版的同时把 Copilot 运行时从 Node 分段移植到 Rust,动因是启动时间与内存占用,过程中踩到数字类型、`||` 语义和阻塞事件循环等回归。
NVIDIA Dynamo AIPerf 用于在流量增长时衡量 LLM 端点的 TTFT、ITL、延迟和吞吐,并可用可重复的真实流量模式进行测试。该工具面向规模化场景,帮助回答 LLM 端点在高负载下的性能表现。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理的基准测试。文章指出用 curl 命令、手写 asyncio 脚本或临时压测工具测推理性能,都会受单进程性能上限和 Python GIL 并发限制影响,导致测得的数字不可靠。
Dify 用 New Agent 在一家真实家居用品商店上落地售前场景,从"帮我找 40 英镑以内的乔迁礼物"这类商品发现任务起步。它通过对话持续迭代同一个 Agent,把最初的产品发现扩展为能力更强的售前体验。Dify 称电商的难点不只是展示商品,而是帮顾客从浏览走向有把握的决定,并发布了完整案例博客。
mcp-handler@2.2.0 新增对 WebMCP 的实验性支持,可将现有 MCP 工具暴露给浏览器内智能体。只需在站点加入一个 script 标签,并在 experimental_webMcp 的 tools 中声明工具,脚本会将这些工具注册到页面并把调用代理回 MCP 服务器,以已登录用户身份执行,无需浏览器端 OAuth 流程。
Vercel 的 v0 现可读取 Vercel 上共享环境变量中存储的凭据,从 npm 及自定义 registry 安装私有包。NPM_TOKEN 用于 registry.npmjs.org 上的私有包,NPM_RC 可配置自定义或多个 registry,支持作用域 registry 与环境变量引用,例如 @acme 作用域或私有 JFrog Artifactory。
Fireworks 宣布为 @phylo_bio 提供 day-zero 访问和快速无服务器推理路径,让研究智能体能触达更多科学家。该推文指出开放模型在生物学领域能力日益增强,但部署服务难度更高。
Milvus 在 GitHub 上的 star 数达到 46K,官方发文感谢社区贡献者。Milvus 3.0 将带来新的存储格式、索引、查询能力、原生文本去重和行级 TTL 等功能,官方将于 9 月 23 日举办 Milvus 2.6 → 3.0 升级 webinar,由 Jael Gu 和 Jiang Chen 讲解升级路径。
LlamaIndex 推出 Parsed by LlamaParse 系列,首篇以美国能源信息署 2026 年 9 月短期能源展望报告为例,说明解析错误如何影响关键文档。
SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。
Qdrant 举办的 Vector Space Stream 直播结束,全程超过 4 小时,覆盖 token 原生存储、向量压缩、机器人、新型嵌入向量几何、双编码器、自适应混合搜索、十亿级规模评估以及计算与存储分离等主题。错过直播的观众现可在 YouTube 观看回放,并可通过 Qdrant 的 Discord 社区继续讨论。
Lovable 已收购成立五年的 Sutro,Sutro 团队曾自研编程语言、编译器和托管平台以构建安全可靠的软件。Sutro 工程师将加入 Lovable 参与平台建设,其联合创始人 Tomas Halgas 则负责技术布道,对外分享相关工程实践。
MiniMax Design 上线自定义模型支持,用户可以用自己偏好的模型进行创作。同时年付方案限时优惠 20%。
交互模型正成为一个尚未收敛的热门赛道,Loopit、Reverie AI、SigmaZ AI 等团队各以「交互世界模型」「交互模型」「下一代 AI Interface」等不同称呼切入,Runway 也推出实时角色 Characters、可交互世界 GWM Worlds 和生成交互界面的 Solaris。
SemiAnalysis 披露其公司 AI token 开销已占员工薪酬的 30%,每位员工每月消耗约 50 亿 token。文章指出模型开源与 Agent 开源是两件事,真正承载用户资产的是负责调度模型、连接工具、管理记忆的 Agent Runtime,并以 DeepSeek Harness、网易有道 LobsterAI 为例讨论执行层开源。
巨日禄推出「本入剧出」,不再让创作者先选模型,而是按高、中、低三档产出标准由系统自动决策,低档1500块可跑60集。其模型路由会按镜头难度自动调度不同模型,并保留剧本解析、分镜管理、剪辑等全流程人工干预,已服务7万+影视制作团队。
browser-use 开源了 Jev,它通过将"思考"与"下一步动作"拆分,由大模型负责复杂推理,小模型只负责从页面真实按钮中挑选点击、输入、滚动等操作。该方案面向浏览器智能体、自动 QA、交易循环、Agent 路由等需要反复选择动作的场景,已有 NewMax 正在接入。
Tony Dinh 用 Jev 做了一个开源 Chrome 扩展,实时监听 YouTube 音频、检测赞助片段并自动跳过,每条视频成本约 $0.005。该项目为原型、采用 BYOK 模式,代码已发布在 GitHub。
智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。
Dify 与 TiDB 将于 2026 年 9 月 24 日 11:00–12:00 SGT 举办炉边对话,Lusha Chen 和 Terry Purcell 将讨论开发者从应用转向 AI 智能体后,数据层哪些假设开始失效。AI 智能体的流量不遵循人类用户的节奏,会分支、重试、保持状态,并在数据层制造并发突发流量。活动无幻灯片,含实时问答,需在 pingcap.com 报名。
大淘宝技术针对策略效果类 Agent 提出“五层、四步、三阶段”评测方法论:五层评测对象界定评什么,四步质量归因(诊断、定位、优化、验证)决定评完怎么办,三阶段上线治理(准入、灰度、监控)解决如何上线。团队同时提出 Auto Rubrics 方法,用结构化 Rubrics 替代黑盒 Reward Model,通过三层架构构建可解释的业务效果 Judge 体系,规避位置偏差与选择过拟合等陷阱。
TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。
Z.ai 的多模态编码模型 GLM 5.3 FlashX 现已上线 AI Gateway,提供约 200 tokens/s 的高速推理服务,适合编码智能体、工具循环和交互式应用。模型 ID 为 zai/glm-5.3-flashx,可在各 API 格式和编码智能体中调用。AI Gateway 按供应商价格原价计费,不收取推理平台费,BYOK 请求同样适用。
Himalayas 已用 Qdrant Cloud 支撑其远程职位平台的语义职位匹配,覆盖 10 万+在招职位与 30 万+公开人才档案,当前每天处理数十万次请求、每月超 2500 万次,约 300 万个 point,Qdrant 内耗时中位数约 30 ms、p95 约 200 ms。
Elastic 推出内置于其平台的 SNAP 支付错误检测方案,用规则、机器学习与 Elastic Agent Builder 对话式调查三层能力,在案件入索引时实时识别资格错误与欺诈,而非依赖隔夜批量规则引擎。
ChatGPT 桌面应用推出 Appshots 功能,可将屏幕上的上下文内容直接带入桌面应用,实现"分享"而非"描述"。macOS 用户按下两侧 Command 键、Windows 用户按下两侧 Alt 键即可启用。
Vercel CLI 现已支持亚秒级部署静态产物,运行 vercel deploy 可跳过构建步骤直接返回线上 URL,官方示例显示 802ms 即就绪。该功能自动识别符合条件的部署,支持最多 10 个 HTML 或 Markdown 文件、总大小不超过 5 MB,扩展名限 .html、.htm 和 .md。需升级至 Vercel CLI 59.16.0 或更高版本。
Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个开源模型优化推理,平均提速 4 倍,部分工作是为 GPU 编写定制软件。这些模型面向分子系统结构建模、类药物分子设计和基因突变影响预测等生物学科研任务,此前运行成本较高。Anthropic 表示将开源全部优化代码。
Character.AI 披露其全栈多模态基础设施 CAI-MM-Studio,支持多种艺术风格和 245 个相机机位,多角色场景中每个角色即使初始造型不同也能保持统一画风。平台还推出漫画专用模型,可在整部漫画中保持角色与对话一致,已有创作者产出超过 100 页。官方称自研全链路让新能力数周内即可上线,推理在消费级规模下保持快速且低成本。
AI SDK 支持在 code mode 下搭配 Tool Search 使用,以保留工具缓存。该能力由 AI SDK 官方账号发布,正文未披露具体版本号、参数或性能数字。
Vercel Sandbox 现已支持运行 Harbor 评测,Harbor 是 Terminal-Bench 背后的开源评测框架,其注册表还包含 SWE-bench、tau3-bench 和 OSWorld 等基准。
Equinix 将原先自建在 Amazon EC2 上的自管理 Kubernetes 迁移到 Amazon EKS,改用多账号共享服务架构:Workloads、Platform、Network 三个核心账号分别承载应用服务、共享基础设施与网络枢纽,由云运维团队集中治理。成效包括部署速度提升 4 倍,运维开销显著下降。
Included Health 基于 LangGraph 和 Deep Agents 搭建了联邦式多智能体架构,支撑其 AI 医疗导航产品 Dot。主 LangGraph 图被称为 Dot supergraph,Dot 负责对话路由,子工作流覆盖急诊接诊、预约挂号、专科医生匹配和行为健康等场景,不同产品团队各自拥有图中的不同部分。
Cognition 的实验让 Devin 获得一张 Ramp 卡并被告知去赚钱,Devin 自主完成了冷启动外联、搭建支付门户、试验商业计划,最终赚到 75 美元。该实验旨在测试这一 AI 智能体能否独立运营一门生意。
Fireworks 团队将在 AI Engineer 2026 期间与 AI 工程师、技术负责人线下交流,并开放现场动手环节:参与者自带笔记本电脑,即可体验在 Fireworks 上微调、评估和部署模型。报名入口为 luma.com/gydwrqt6。
NVIDIA AI 转发 World Labs 的测试:给世界模型 Atlas 输入 32 张 NVIDIA Voyager 总部图像,Atlas 以前述图像作为 3D 空间上下文生成新视角,并支持实时飞行浏览与像素级精确的相机控制。
Perplexity 的 Computer 通过多模型编排实现"最低成本下的最大智能",并将持续优化与模型无关的 harness,随着前沿模型演进而调整各 effort level 背后的 orchestrator 与 subagent 组合。