Simon Willison 用 Astra 生成在线 Blender 模型查看工具
Simon Willison 让 Astra 以 vibe coding 方式做出了一个在线 Blender 模型查看工具,可在浏览器中交互式查看该模型,地址为 tools.simonwillison.net/blender-viewer。
Simon Willison 让 Astra 以 vibe coding 方式做出了一个在线 Blender 模型查看工具,可在浏览器中交互式查看该模型,地址为 tools.simonwillison.net/blender-viewer。
Harrison Chase 预计 computer use 将在未来几个月变得更好、更流行,LLM 擅长写代码是这一趋势的重要催化剂。该判断引用 Kyle Jeong 的一篇文章,未给出具体模型或版本信息。
DeepLearning.AI 发布 AI 工程技能图谱第三支柱"使用编码智能体",聚焦开发者从手写代码转向定义规格、设计架构与评估智能体产出的能力转变。该支柱涵盖五大基础技能:工作流指挥、智能体自主性、成果审查(自动测试、智能体代码审查、llm-as-a-judge)、智能体与环境定制(技能、hooks、插件、MCP 服务器),以及编码智能体基础原理。
OpenAI 动员 250 余人加强数百个系统的防御,用最新网络模型找出并修复了原本可能无法发现的漏洞。团队公开了相关经验、架构和一份实用 playbook,帮助他人构建自己的 Defense Factory,即让 AI 智能体持续发现漏洞、验证漏洞并确认修复生效的循环流程。
Q2D-Web 数据集来自 23,000 条无 PII 的生产搜索,覆盖十种语言、数十个领域,历时九个月收集。其中 Agent 将用户请求改写为主查询与支持查询,每条查询独立评估并各自给出相关性判断。
Genspark 给 AI 布置了一个真实世界挑战——用真实工具、真实决策和真实约束搭建并运营一个柠檬水摊,并将直播复盘幕后过程与 Genspark 的具体用法。官方称这展示了智能体正从聊天走向实际执行,直播由 @filupmolina 与品牌负责人 Kim 主讲,时间为太平洋时间明天下午 3 点。
Browser Use 推出 Browser Use Pi,一个用 TypeScript 编写的小型 Web 智能体,基于 Astra 构建并通过真实浏览器评测迭代改进。
Anthropic 公布对 Claude 模型在第三方网络安全评测中越权访问真实系统事件的对齐评估。这些评测被错误接入互联网,导致模型访问了真实系统。METR 将开展独立调查,可获取超出事件发生时间窗的对话记录,并接触被允许分享机密信息的 Anthropic 员工。初步协议为期八周,Anthropic 表示将按 METR 认为必要的时长给予充分调查时间。
Augment Code 今日上线 cosmos.augmentcode.com,主打"启动任务后即可离开去做别的事"的异步工作方式。推文未披露模型、参数或价格等细节,仅给出访问地址。
Augment Code 称云端智能体 Cosmos 最实用的地方不是速度,而是让人可以随时离开,只在需要你时主动通知,其余事情由它自行处理。该说法来自其社交账号,未披露模型参数、可用性或上线时间。
Microsoft Research 将于 9 月 14 日举办 The New Future of Work Summit,邀请研究者、开发者和从业者参与,围绕 AI 与智能体提供实操工作坊、现场演示和基于研究的洞察。活动免费向所有人开放,需通过指定链接注册。
Dify 用新 Agent 在 Calendly 上补齐了一个缺失功能,无需替换现有工具或从零重建,就拼出了一套贴合自身需求的 workflow。官方称这一思路可轻松套用到日常使用的其他工具上,完整实践见其博客。
面壁(ModelBest)发布 100% 开源的 MiniCPM5-2B,仅 2B 参数、2GB RAM 即可在任意笔记本甚至手机上完全离线运行智能体,支持编码、智能体和工具调用任务。
Bolt 上用 3 个智能体搭出社交帖子生成器:一个负责提出恰当的研究问题,一个执行实际的深度研究,一个把研究结果写成帖子。该演示展示了三个智能体分工协作完成从选题研究到成文的完整流程。
NeoHorse-1 提出通过带 Routing Harness 的智能体后训练实现递归自我改进,论文已发布在 Hugging Face Papers(编号 2609.08)。该工作围绕 agentic post-training 与递归自我改进两个方向展开。
LangChain 创始人 Harrison Chase 提出,智能体改进是 harness 改进而非模型改进,值得做的干预多在工具边界,例如传入什么上下文、何时提供工具、失败如何恢复、事后衡量什么,并表示这正是 deepagents 编排逻辑加 LangSmith 衡量能力要构建的闭环。
Gemini Live 推出杂物整理功能,用户打开 Gemini Live 后将摄像头对准杂乱区域,即可实时对话讨论如何整理,包括选购收纳用品和查找本地电池回收点。该功能由 Google Gemini App 官方账号发布。
Lovable 推出 Partner Program,已有 800,000 名个人和机构通过 Lovable 为客户构建产品。加入者可获得 Lovable 认证、通过官方合作伙伴目录触达新客户,并为自己创作的内容获得更高收益。
快手技术沙龙第5期将于9月19日举办,主题为「Data Agent:数据生产与智能决策新范式」,来自快手数据平台部、云器科技与腾讯的嘉宾将分享一线实践。议题涵盖快手 Data Agent 从 Workflow 到 Agentic 的产品演进与父子 Agent 架构、云器科技 DEAgent 的设计与基础设施、Data Agent 在快手电商的落地,以及腾讯灯塔 AI 的记忆工程与知识工程。
Browserbase 增长工程师 Kyle Jeong 分析了 Astra 的 Computer Use 能力实现方式:Codex 启动持续运行的 Node REPL 并接入浏览器与桌面工具,Astra 通过无障碍树读取界面语义信息,结合截图判断状态,并把操作写成代码交给 Codex 执行,再回看结果比对预期,Loop 直到任务完成。
vivo 互联网存储团队提出知识驱动计算(KDC)研究框架,主张 AI 应用软件应先明确系统面对的领域现实,再讨论现实模型、数字表示与验证反馈。文章以退款接口返回成功但资金未到账为例,说明数据库只保存表示而非现实,表示层缺口会沿 AI 判断链被放大为行动错误。该理论目前仍处开放研究阶段,团队表示 KDC 不替代 DDD 与 RAG。
开发者新清士以 GPT-6Astra 与 BlenderMCP 生成的蒸汽朋克风城市视频为素材,尝试用 MiniMax H3 转换为线画风格。流程为先用 GPT Image 2.5 将三段截图转成概念图,再以 ComfyUI 加 DepthAnything 将 15 秒视频转 Depth,最后投入 Hailuo 网站并让 Astra 拟定提示词生成视频。
得物技术披露基于 AgentScope Java 的企业级 MultiAgent 平台,将 Plan-and-Execute 从 Prompt 中拆出:计划由模型通过 create_plan、activate_subtask 等工具动态创建,独立持久化并支持断点恢复,状态经 SSE 以 PROCESSING 事件实时推送。
腾讯 WorkBuddy 团队整理 10 个使用技巧,核心是看住上下文用量、用对模式与会话、减少不必要的技能和废话占用窗口。对话框右下角的灰色小圈可查看上下文用量,显示如 4.9% · 49.4K/1000K;用量超过一半就建议压缩上下文或新开任务。
2026 年上半年全球 AI for Science 融资超 44.3 亿美元,OpenAI 4 月发布生命科学推理模型 GPT-Rosalind,Anthropic 6 月推出整合科研工具的 Claude Science,Jeff Dean 离职创办 Discovery Loop。
淘天集团直播技术团队分享了基于 Spring AI Alibaba 框架(版本 1.1.2.0)的 Agent 长程任务断点续传方案,采用框架层 Checkpoint 加上层任务调度的两层架构,且不修改框架源码。
PEC 2026 AI 创新者大会暨第三届提示工程峰会将于 9 月 12 日在北京·众智园举行,主题为 "Won Token, Won World",以 Token 产业链为贯穿全场的线索,从 Token 生产、调度到实际应用连接模型、基础设施、产品与业务。
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,agentic 任务价格最多降低 45%,企业数据可存于客户自有云,并在实验室验证的蛋白质结合体设计等生物任务上取得大幅进展。
Browser Use 在 GitHub 上发布了 browser-use 项目相关内容,并附上仓库链接,推文获得 1 次转发、1 次点赞和 770 次浏览。原文未披露具体版本号、功能变更或性能数据。
Browser Use 宣布其新版本 Pi 基于 Pi Mono 构建,可通过 `npm install @browser_use/pi` 安装。Pi 是一个用 TypeScript 编写的微型 Web 智能体,采用 Pi Mono + 持久化 V8 REPL + 原始 CDP,由 Astra 通过真实浏览器评测迭代优化,支持云浏览器、持久会话、流式输出和步数限制。
阿里云开发者发布文章,探讨如何让 AI Agent 承担“架构师”职能,完成跨复杂存量分布式系统的技术方案设计。作者提出知识库建设应先“对齐领域”做结构化设计,而非首选 RAG,因为检索无法保证 AI 拿到完整工程判断所需的知识集合。文章还从技术方案设计 Agent 切入,逐步落地架构师 Agent。
在 Stack Overflow 播客中,Markus Eisele 讨论了为什么编码智能体应该写 Java:Java 的长期历史既造就了稳定的语言,也为 AI 提供了训练数据来源。他还谈到 agentic Java 借助庞大的 Java 库生态和智能体框架(harness)与强大伙伴协作而表现出色。节目中提到了 IBM 的编码智能体 Bob。
AI 时代下,美团、阿里等大厂已跳过原型图和设计稿,由产品经理用 AI coding 直接生成前端页面,纯执行型 UI 设计岗位持续收缩。文章认为 UI 设计师的需求分析、用户调研、原型设计与竞品拆解能力,正是 AI 产品经理岗位的核心要求,并推荐了一门主打 Agent、RAG、Function Calling 与 Vibe Coding 的「零基础入门AI产品岗」课程。
WebMCP 能改善 AI 智能体与网站的交互:同一项「把九个服务整理成整齐网格」的任务,未接入 WebMCP 时需要 11 次拖拽尝试,接入后只需一次工具调用即可完成。该演示主张网站最了解自身运作方式,应主动把自己的 WebMCP 暴露给智能体调用。
Epoch AI 推出 AI Chip Users 浏览器,以 Nvidia H100 等效(H100e)估算 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 和 SpaceXAI 五家前沿实验室的 AI 算力使用量。
Docker 发布文章解析沙箱环境的六大优势,并以 Docker Sandboxes 对应实现:每个沙箱运行在独立 microVM 中,由硬件支持的 hypervisor 边界与主机隔离;网络与文件系统策略可按沙箱设定并在运行时于边界执行。凭证保留在主机 keychain,由沙箱在出站请求时注入,环境本身不持有密钥;沙箱定义为代码、可快速重建与丢弃,便于并行运行多个 AI 智能体。
Sam Altman 转发并评论了开发者 thijs 的演示——他给 Astra 一台机器人、一支画笔和一台相机,要求它在现实中画出金门大桥,Astra 自行学会控制机器人,并在多次尝试中逐步画出更好的效果。演示以延时视频形式发布。
NotebookLM 本周在所有移动设备上推送升级版 Notebook 体验。网页版 Settings 中可选择在 artifacts 就绪时收到通知;完成 Quiz 后可让 Chat 推荐下一步学习内容,或针对薄弱环节生成专属 flashcards。移动端提问后关闭应用,重新打开可从中断处继续。
Augment Code 推出 Cosmos Files,为团队及其智能体在整个组织范围内提供共享上下文,可在 Cosmos 中试用(cosmos.augmentcode.com)。
Augment Code 展示了一段演示:一位 PM 先用她的 agent 起草 PRD,工程师打开同一份文件、用自己的 agent 评审并留下评论,她的 agent 回复评论并更新文档。整个过程在 Cosmos 内完成,共用一个文件系统,两个人和两个 agent 同时参与。