三名工程师让 GPT、Claude 和 Grok 驾驶丰田卡罗拉去买 In-N-Out
三名工程师把 GPT、Claude 和 Grok 接入一辆真实的丰田卡罗拉,让它们分别负责驾驶,目标是开到 In-N-Out。三家模型里只有一个成功完成任务。
三名工程师把 GPT、Claude 和 Grok 接入一辆真实的丰田卡罗拉,让它们分别负责驾驶,目标是开到 In-N-Out。三家模型里只有一个成功完成任务。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 采用实时 ACL 校验,在查询时直接向 Google Drive 等权威来源核实权限,作为预检索过滤之外的第二层防护。该两阶段架构先用索引中缓存的 ACL 做语义检索,再实时验证候选文档,未授权的文档不会传入 LLM。AWS 称权限一旦被撤销,AI 响应可在数秒内而非数小时内反映变化。
NVIDIA 分享了教机器人组装 Grace Blackwell GB300 超级芯片测试托盘的经验,并由此探讨机器人学习、机械智能与传统工程实践。GB300 是支撑现代基础模型训练与推理的引擎,其托盘组装此前依赖全球工厂中的熟练体力劳动。
微软发布 Surface Laptop Ultra,这是首款搭载 NVIDIA RTX Spark 芯片的产品,该芯片为 Arm 架构 PC 芯片,将 CPU 与 GPU 合一。
微软 Surface RTX Spark Dev Box 已开启预售,售价 5,999 美元,预计 11 月发货。该设备搭载 Nvidia Arm 架构 RTX Spark 平台和 128GB 统一内存。
微软公布首款“builder class PC”Surface Laptop Ultra,搭载 NVIDIA RTX Spark 芯片,最高 20 核 CPU、128GB 统一内存,可提供 1 petaflop FP4 AI 算力,即日起以 $2,599 起预售。
GitHub 披露,如今每 3 个 PR 就有 1 个涉及 AI 智能体,一年前这一比例不足 1/10。
Databricks Apps 正式 GA,支持 on-behalf-of-user 授权,让开发者能在 Databricks 平台上构建并部署权限感知的数据与 AI 应用。该授权机制使应用以用户身份访问数据,从而遵循用户自身的权限范围。
Google Cloud 在 Next '26 上宣布 Ultra Low Latency(ULL)Solution 正式可用,并同步推出全新 U4 机器家族。
NVIDIA 提出用数字孪生与 AI 智能体验证 AI 工厂的变更:AI 工厂由 GPU、CPU、交换机、DPU 与 SuperNIC 组成,并叠加调度器、编排服务、安全控制和快速迭代的软件栈。这类基础设施、软件与策略是否能为目标负载协同工作,本身就难以验证。
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
AWS 提出 Agentic Value Model 框架,用于替代 RPA 时代的 ROI 模型,衡量智能体自动化的四类价值:工时节省、异常处理、决策质量与变更韧性,并以价值实现机制决定收益能否落到 P&L。
NVIDIA cuOpt 的 mPDLP 求解器可将决策优化问题扩展到 1 亿变量以上,以应对供应链 SKU、线路与约束持续增长,以及电网实时平衡更多分布式源的需求。cuOpt 的 GPU 加速决策优化相较 CPU 已能带来 10 倍以上加速,帮助团队在可接受的规划窗口内评估更大模型和更多不确定性。
Milvus 提出一套五步架构,把语义检索、BM25 关键词搜索与标量过滤结合,用于在持续增长的题库中找题。
ManusAI 表示已简化多人游戏的技术环节,让开发者能以更少投入跑起服务器,从而做出可供更多人联机游玩的游戏。
微软 Azure 硬件系统与基础设施团队将智能体(agentic)与 AI 工具引入云基础设施全生命周期,覆盖覆盖 80 多个区域、500 个数据中心园区的供应链、部署与机队运营。
Bolt 上线评论功能,用户可在预览中点击任意元素留下评论,并直接发送给 Bolt 执行构建,不再需要截图、Slack 讨论串或 Loom 视频再人工转成修改。该功能现已可在 bolt.new 使用。
Stacklok 由 Kubernetes 两位创始人 Craig McLuckie 与 Joe Beda 打造,目标是把 AI 智能体 harness 完整带入云端,做成"云原生 harness"。他们认为,尽管 OpenAI 和 Anthropic 近期进展显著,云端智能体 harness 至今仍未完全解决,也因此不再需要一直开着笔记本电脑。
Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。
JetBrains 发布 TeamCity 插件 Warm Agents,可为指定云镜像维持目标数量的空闲预启动代理,空闲数低于目标值时立即新建实例,让构建无需排队等待启动。
Latent Space 文章讨论 Stacklok 提出的“云原生 harness”思路,认为编码智能体可像容器一样由 Kubernetes 式控制循环管理。
Cisco 为 Webex 云协作平台推出智能体工具集 Dialog,作为"agentic harness"调度 AI 智能体处理客户交互,并可在对话结束后继续代表客户工作,跨人员、智能体和后端系统协调。更新后的 Webex 允许工作区成员将 AI 智能体直接拉入空间、会议和通话,执行跨平台及第三方应用的多步骤任务,并借助 Splunk 提供安全能力。
JetBrains 对从 16 人软件公司到数千人开发团队的工程组织调研发现,个人开发者用 AI agent 提速明显,但团队层面收益停滞:某金融数据商约 80% 工程师每天使用 agent,却出现 20% 工程师产出 80% 代码的鸿沟。瓶颈转移到代码审查与规划阶段,有团队测得 PR 时间反而增加;把重复工作交给 agent 也带来新的维护负担。
Qdrant 提前测试了 Google EmbeddingGemma 2 的 Matryoshka 兼容嵌入在 Qdrant 中的压缩效果。结合更短向量、量化与重排序,向量内存占用降低约 77 倍,同时保留基线检索质量的 94.5%。Google 在 EmbeddingGemma 2 发布公告中引用了该工作。
极限编程(XP)创始人 Kent Beck 在 Prodacity 2026 演讲中指出,AI 生成 20 万行代码只属于 Effort 和 Output,离 Outcome 与 Mission 还有两层,不能代表生产力。
Sigil Wen 的 Conway Research 完成由 a16z 领投的种子轮,Khosla Ventures、SV Angel 及 Anthology Fund 参投,天使投资人包括 Stripe 联创 Patrick Collison 和前 OpenAI 研究员 Noam Brown。
IntelliJ IDEA 2026.3 EAP 升级命令补全功能,在编辑器中输入 `..` 即可按当前代码与光标位置调出可用操作。新版支持直接为表达式或代码块添加 Logpoints、用同一入口触发 AI 解释代码、生成文档和重构,并会将上下文(文件、语言、行号、选中表达式)传给 AI 智能体。
Mistral 4 以 3800 块 Grace Blackwell 实现约 72% 的智能水平,GPU 用量仅为 GPT-6 Astra 的 3.8%,后者公开用量为 10 万块以上 Grace Blackwell。同组对比中,Grok 4.7 估算约 20 万块 GPU,Claude Opus 5.5 估算约 50 万块 Trainium2。
一位开发者用 Codex 把接亲、典礼流程整理成手机端静态网页,通过腾讯云 CloudBase 静态网站托管加自购域名部署,并让 Codex 代为完成域名申请、备案与微信访问拦截申诉。他称 GPT-6 生成前端页面的审美能力已足够强,无需额外 skill,后续修改直接在会话中提需求,还能加上亲友签名送祝福功能。
LMArena 推出 Code Arena WebDev 排行榜,可通过 arena.ai/leaderboard/co… 查看。原文未披露上榜模型、分数及评测方法等细节。
Microsoft 被列为 2026 Gartner® 全球工业 AIoT 平台魔力象限领导者。其工业 AIoT 平台以 Azure IoT Hub、Azure IoT Operations。
Google 宣布 Spanner Omni 正式 GA,这是其分布式 SQL 数据库的可部署到任意环境的版本,可运行在客户自有数据中心、其他云或笔记本上。为脱离 Google 基础设施,它用类似 Colossus 的抽象层替代分布式文件系统 Colossus,用软件实现误差有界的时间同步替代基于原子钟和 GPS 的 TrueTime。
至简动力强化学习负责人冯宗宝在 IROS 2026 介绍,其团队让机器人单机自主值守两台 CNC 机床,在工件与卡盘间隙仅 0.5 毫米的条件下完成抓取、上料、插入、取件与放置,精密插入任务成功率达 100%,训练仅用 600 条真实机器人轨迹。
一名开发者因 Vibe Coding 写出的 Cloudflare Durable Object alarm 死循环,产生一万刀账单,读写达 6 万亿次。Durable Object alarm 是持久定时器,无请求也会唤醒对象并按次计费,且没有账户级硬顶,只能收到告警邮件。
哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。
Browser Use 推出 Profile Sync,一条命令即可将本地 Chrome 的登录状态复制到云端,让每次运行的 AI 智能体无需从登出状态开始,云端浏览器直接以已登录状态启动。该功能免去了在提示词中填写密码或 2FA 验证码的步骤。
Elastic 入选 2026 Gartner 企业 AI 搜索魔力象限领导者,全部受评厂商中仅三家获此评级,Elastic 在执行能力上排名最高、愿景完整性上最靠前。
Vercel AI Gateway 现已上线 Anthropic 的 Claude Haiku 5.5,这一版本面向摘要、上下文压缩、数据库查询和分类等高频、成本敏感任务,也可作为子智能体配合更大的 Claude 模型处理编码工作。
Cursor 发布 iOS App,用户下载后可将其与自己的电脑配对使用。企业版用户需请管理员开启该功能,更多信息见官方更新日志。
Vercel AI Gateway 上线 beta 版置信度阈值功能,当主模型置信度低于设定阈值时,会自动在备用模型上重跑该决策,将不确定的决策升级给备用模型处理。发布者认为这一简单功能将对规模化 AI 决策产生极大影响。