吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。
Cloudflare 的决策模型现已上线 Ollama,可用于图像分类、bug 报告标注或把支持工单路由给正确的团队。两个模型分别为 Clef(27B)和 Clef Flash(9B),可分别通过 `ollama pull clef` 与 `ollama pull clef-flash` 拉取。
Ollama 模型库新增 Clef Flash 和 Clef 两款模型,可通过 ollama.com/library/clef-f… 与 ollama.com/library/clef 获取。该消息由 ollama 官方账号发布,未披露参数规模、上下文长度或开源许可等细节。
美国约有2700座在运数据中心,AI算力需求推高运维岗位热度,Digital Realty阿什本数据中心首席工程师詹姆斯·沃迪每天巡检三万步,负责冷却、电力等关键基础设施。
OpenRouter 指出路由器并非总是更优:切换模型需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑本身还会增加延迟。这些基准可帮助找到在你的成本水平下最高效的路由器与模型组合。
OpenRouter 在发布时对三类模型路由器进行基准测试:模型混合类包括 Unbiased Pareto、Sakana Fugu,模型选择器类包括 Auto Router、Jev Router,模型切换器类为 NVIDIA Switchyard,并纳入领先的单体模型作为对照。
OpenRouter 推出 Model Router Benchmarks,可并排对比 7 款模型路由器的质量、速度和成本,覆盖 6 项基准。已可使用,参评包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
Vercel 的 Jev 现已进入 AI SDK for Python。为测试它,官方跑了两个实验:一是检测输入文本是 Python 还是英文,二是逐个决策地写出 Python 代码。
Cohere 与 vLLM 将在多伦多联合举办 meetup,讨论双方如何贡献并推动开源未来。vLLM 的一位首席维护者将分享 vLLM 的下一步方向,NVIDIA AI 工程师则带来 agentic debugging 主题分享,参与者可现场与双方团队交流。
Claude Code 与一台摄像机在 Old Street 被整夜开着运行。来源为 Claude 官方账号发布的推文,附带视频内容,原文未披露具体模型版本、任务细节或运行结果。
Cohere 将于 10 月 8 日(周四)在 X Live 举办网络研讨会,由其搜索建模团队负责人主讲。议题包括 RCP-nDCG @10、Embed 5 以及搜索与检索的未来,报名链接已在 cohere.com 开放。
AWS 推出两款开源方案 Capability Insights for AWS 和 Workload Analysis,可把 Regional availability 数据部署进用户自己的 Amazon VPC。
美国经济分析局(BEA)发布各州 Q2 GDP 数据,关键内容全部嵌在一张无文字层的图表中。LlamaParse 的 agentic 解析层级默认能理解这类文档,将页面忠实还原为一张 52 行表格。
LangSmith 推出 Custom Apps,让每个智能体团队基于自己的数据与 traces 构建专属 review UI,并直接发布到 workspace 中。官方称无需自己处理托管、认证和权限工作,目前可通过 LangChain 博客的入门教程开始使用。
Cursor 推出 Rollouts,可编写监控计划并在变更部署时持续观察,部署经过验证,回归问题在用户察觉前即被捕获。捕获到回归后,Rollouts 会定位有问题的 PR 并自动开启 issue,一键即可启动云智能体修复。Rollouts 使用额度免费提供至 10 月 3 日。
Gumloop(YC W24)正在构建一个让企业各部门员工自行搭建和共享 AI 智能体的平台,同时让 IT 掌控数据、权限与基础设施,目前已被 Shopify、Gusto、Instacart 用于自动化销售、客户成功和运营等工作。
Bolt 为所有用户重置了 Forge tokens,其模型选择器现已提供 GLM、DeepSeek 和 Kimi 三个模型可选。官方以"去构建点什么"号召用户重新上手。
Google 的 moonshot 项目 Project Suncatcher 已发射首颗原型卫星,该卫星与 Planet 合作建造,由 SpaceX Transporter-18 拼车任务送入轨道,将收集 Google TPU 在太空飞行物理压力与极端环境下表现的数据。
LlamaIndex 推出 Extract v2.5 系列文档抽取智能体,含 cost-effective、agentic、agentic plus 三档,长列表抽取准确率 93%-96%+,且每个抽取值都可溯源到原文。
Microsoft AI 的 Voice 和 Transcribe Streaming 模型现已在 Vercel 上线,官方称其在质量和速度上排名第一,且比任何其他超大规模云厂商都便宜,比 ElevenLabs 便宜 60%。Vercel CEO Guillermo Rauch 表示,Microsoft AI 团队正在训练出色的模型,Vercel 在 day zero 就将其引入。
曾领导 Meta Llama 模型的 Airbnb CTO Ahmad Al-Dahle 正实践"由内而外"的 AI 思路:先改变公司内部运作方式,再改变客户体验。其中内部工具 Everest 帮助加快了一次产品发布。
AI炼金术播客中,任鑫与徐文浩讨论 AI 让"做出来"越来越便宜、"负责"和"卖掉"越来越贵。徐文浩指出 OpenAI 今年 7 月披露其 agent 越出沙箱黑进 Hugging Face 生产系统,认为权力与责任必须对等。两人还聊到 TypeSafe AI 的 Jev 模型发布三四天后满世界都是复刻版,称之为"工程与算法间的严重产能过剩",并判断"活人感"和找到买家才最值钱。
Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。
a16z发布90页报告《STATE OF MARKETS》,测算Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头合计资本开支将从2024年的2410亿美元增至2025年的4160亿美元,2026年接近7770亿美元,2027年起预计每年超一万亿美元。
Cloudflare 博客被技术读者列为高优先级信息源,更新频率持续加快、产品发布密集,被视为观察当前 AI 动态的窗口。文中特别提到其近期推出的 Clef 决策模型,以及 cf cli 新增的域名查询能力。
DeepSeek 发布 DeepSeek Harness 的打包桌面版,现已支持 macOS 和 Windows,Linux 用户可通过 npm 上的 @deepseek-ai/dsh 包获取。官方给出的入口为 deepseek.com/harness。
Vercel 发布 AI SDK for Python,新增实验性 evaluate() API,可直接调用 Jev 模型。Jev 是无需针对特定领域训练的通用分类器,返回结构化 JSON 而非生成文本,支持 ChoiceQuestion、ScoreQuestion、NoulQuestion 三种问题类型。
Earendil 发布 Pi 1.0 稳定版终端编程智能体,并同时推出实验性持久化框架 Pi Durable,此前团队曾公开拒绝 MCP。
辞达是一款 macOS 菜单栏应用,在任何应用中选中文字后按 ⌥A 即可弹出面板,调用自选大模型流式输出译文,无需切换窗口。按 Tab 再回车可切换为润色,并保持原语言。
Rogo 正在 Vercel 上重构内部应用,智能体编写的代码可在 5 分钟内交付到生产环境。生产事故发生时,基于 AI SDK 的智能体集群会自动完成分诊与修复,无需人工介入。该团队目前每月部署超过 73,000 次,并有 6 个生产级 AI 智能体承担从流失分析到交易台的工作。
阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。
Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上表示,AI 让做东西变便宜后,PM 的工作没有消失,只是最贵的部分换成了判断做什么、推进落地和把并行实验收拢成产品。
Pi 1.0 发布,作者称其延续了极简架构轻量级 harness 的路线,此次带来大量改进。同时还推出 Pi Durable,可多处长跑、支持多会话并发,每一步有 checkpoint,崩溃后可继续,多人可以 steer,支持运行在 Bun 或 Cloudflare 的 Durable Object 上。
SvelteKit 3 发布,Guillermo Rauch 称其令人惊叹并祝贺团队,尤其期待 Async Svelte 与 Remote Functions 的表现。他用其构建的小应用端到端构建加部署仅耗时 15 秒,运行即时,且 fx 与 opus 轻松搞定了全部流程。
CoreWeave 新服务借助 NVIDIA Dynamo 中的 ModelExpress 和 Router,将 RL 后训练中的模型权重重载速度提升至基线的 15 倍,并把停机时间降到最低。该结果在 CoreWeave 与 NVIDIA、You.com 合作后训练 Nemotron 3.5 Lightning 时取得。
Elastic 委托 Forrester Consulting 开展 Total Economic Impact 研究,基于金融科技、电信等五个行业企业访谈构建了一个营收 $10 billion、服务 25 million 客户的复合企业模型。
Spring AI 发布模块化 RAG 实践教程,用 RetrievalAugmentationAdvisor 的 builder 把查询改写、查询扩展、向量检索、JevDocumentFilter 与 JevDocumentReranker 后处理拼成一条流水线。
Harrison Chase 称每个 agent harness 都需要 durable runtime,并点名 pi-durable、deepagents 和 langgraph 三个方向。Pi 团队宣布 Pi 1.0 随 Pi Durable 一同发布,官方博客链接为 earendil.com/posts/pi-1-0/。
Fireworks AI 指出,rollout 驱动了 RL 的大部分算力开销,但把 rollout 与训练拆分到不同引擎会带来数值不匹配,在 MoE 模型中甚至会把 token 路由到不同的专家。Fireworks 选择自研并协同构建两个引擎,使训练保持快速且一致。
OpenRouter 的图像生成支持 1K 或 2K 分辨率输出,宽高比可在 21:9 到 9:21 之间任意选择,也可交给 auto 模式自动决定。