美国政府发布 America.gov,用 AI 聊天框整合 2.9 万个政府网站
美国政府发布 America.gov,将 2.9 万个政府网站整合为一个 AI 聊天框入口。首页是一个提问框,用户可用自然语言咨询办护照、Medicare 资格、退伍军人补贴、国家公园露营预订等事项,无需注册账号,也没有商业广告。特朗普在开场中称这不只是一个网站,而是对建国承诺的恢复。
美国政府发布 America.gov,将 2.9 万个政府网站整合为一个 AI 聊天框入口。首页是一个提问框,用户可用自然语言咨询办护照、Medicare 资格、退伍军人补贴、国家公园露营预订等事项,无需注册账号,也没有商业广告。特朗普在开场中称这不只是一个网站,而是对建国承诺的恢复。
Claude Code 团队在跑了几百个 skill 后总结,skill 不是一条提示词,而是一个文件夹,整个文件系统本身就是上下文工程。
用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。
主流 Personal Agent 虚拟机配置对比显示,Grokbot 在 CPU、内存和硬盘上给得都很充足,Dot 的配置也很高。不过 Dot 可能并非独享虚拟机,存在共用情况。
TypeSafe AI 发布 System One 模型 Jev,它不生成文本,而是接收状态和问题后返回带概率的类型化答案,公司称在分类任务上推理速度最高快 200 倍、成本低 400 倍。
一款室内设计应用可读取 Zillow 房源、抓取每个房间的照片,并让用户更换所有装修饰面,分割用 SAM 3.1,编辑用 Ideogram 4.5。整套房子的布置成本为 1.50 美元,每次编辑 0.06 美元。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,当天起通过 Fairwind Program 向一批可信测试者开放。有使用者形容初次体验时被吓到眩晕瘫坐在椅子上,彷佛看到原子弹爆炸。发帖者表示自己一个月前花 20 元买了两个 Pro,正在等待开放,并抱怨首批只开放给 Fairwind 计划的可信人员。
AMD 与魔搭社区推出开发者激励计划 2.0,开发者可在魔搭模型库直接调用运行于 AMD Instinct GPU 上的 DeepSeek、GLM 等热门大模型,每位用户享 10 次初始免费调用额度。
OpenAI 在 DevDay 发布个人助手 Dots,Meta 的 Muse 则于 9 月 8 日上线并在 16 天内突破 340 万下载,引爆个人助理热潮。OpenAI 的 GPT-6 Astra 在 OSWorld 2.0 上从 65% 升至 72%,任务耗时缩短 47%。OpenAI 的 ARR 在 1 个半月内从超 400 亿美元涨至近 700 亿美元,涨幅约 70%。
Instinct 是一个没有 App 的 AI 个人助理,通过短信、电话、邮件替用户订机票、管订阅、规划行程,创始人 Noah Shinn 称产品每天增长约 10%,平台年交易额已超十亿美元。它采用免费模式,在用户完成交易时从商家侧收取 take rate,其中 50% 交易额来自旅行;用户入驻满三周后有 40% 会主动分享信用卡信息,留存率随之跳到 80%。
AMD 宣布以约 82 亿美元全股票收购李飞飞创立的 World Labs,交易完成后李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报。这是 AMD 史上第二大收购,World Labs 约 70 人团队以相对独立的研究单元并入,Justin Johnson 和 Ben Mildenhall 继续带队负责模型研发。
Varun Mohan 表示,现实世界使用更重要,但很高兴看到 Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 表现不错,并称还有更多内容。
苹果计划 10 月 13 日推出智能家居产品线,核心是代号 J490、约 6 英寸方形屏幕的家庭控制中枢,并同步更新 HomePod mini 和 Apple TV,用于展示新版 Siri AI。
Modal 宣布 VM Sandboxes 正式可用,用户通过 runtime="vm" 一个参数即可让智能体获得完整 Linux 虚拟机,同时沿用原有 API、modal.Image、亚秒级冷启动与 CPU/内存突发能力。
Modal 发布 Sidecars,一种与主 Sandbox 在同一主机上并行运行、但保持隔离的容器,用于在可信与不可信代码之间建立安全边界。
Modal 在首届 Runtime 大会宣布 VM Sandboxes,为 AI 智能体提供完整 Linux 计算机,已在 Linear、Legora、Snorkel 用于编码智能体与评测,并同步推出同主机隔离的 Sandbox Sidecars。
OpenRouter 联合创始人 Alex Atallah 在被 Stripe 以据报道约 70 亿美元以上收购后首次接受采访,谈及两家公司为何契合,以及双方共同判断未来不应由单一模型或单一巨型实验室主导。
Latent.Space 转述 OpenAI 的 AriX 和 nikunjhanda 介绍的新智能体栈,包括 Computer Use、Dots、Decisions API、UltraFast 与 AI Cloud。
Vercel Agent 现已能通过存储在 Vercel 共享环境变量中的凭据,从 npm 和自定义 registry 安装私有依赖,会话中的 npm、pnpm 与经典 Yarn 认证方式与 Vercel 构建一致。
Mintlify 联合创始人兼 CTO Hahnbee Lee 将在 AI Engineer New York 发表演讲,主题是把文档作为 AI 智能体的知识基础设施。她将分享 Coinbase 的实践数据:智能体流量占比达到 59%,并完成了 30,000+ 次 MCP 调用。会议于 10 月 12-14 日举行。
论文 Omni-IO Skills 提出让 AI 智能体具备 Omni-Native 能力,论文已在 Hugging Face 上线。该工作由 AK(@_akhaliq)发布,配文包含演示视频,附论文链接 huggingface.co/papers/2609.31…。
LEGO-Anything 提出用编码智能体(Coding Agents)做 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36)。该工作把 3D 场景重建任务交给编码智能体完成,具体方法与实验结果见论文原文。
谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。
谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。
谷歌宣布推出新一代模型 Gemini 4 Argon,重点面向长流程软件工程、法律与金融等企业知识工作以及网络安全防御;输出 Token 上限从此前 64K 提升至 100 万。
Cognition 成为首个运行 NVIDIA Vera Rubin 的客户,算力由 CoreWeave 提供。在 SWE-2 推理上,新芯片在相同解码速度下 token 吞吐量约为 GB200 的 4.8 倍。Cognition 此前已先后用上 2022 年的 Hopper 与 2024 年的 Blackwell。
LangGraph 新增带类型响应 schema 的 interrupt:智能体暂停等待人工时,可预先定义合法响应格式。响应在回传给智能体前会先经过校验,UI 中还能渲染真正的响应表单,而不只是 JSON 输入框,官方称其为类型安全的人在回路。
Vercel 推出 Connect,允许服务方提交接入,触达 2000 万+ 开发者和他们构建的智能体。提交流程包括描述服务、添加 OAuth 或 API key 认证、用真实 token 验证并送审。官方称 Connect 用 OAuth/API key 认证取代分散的静态凭证,对智能体和应用都更简单、更安全。
Google 发布新一代前沿模型 Gemini 4 Argon,用于在复杂、长周期工作流中维持深度推理,性能覆盖真实软件工程、法律和金融等企业知识工作以及网络安全防御场景。该模型的输出 token 上限提升至行业领先的 1M tokens,目前正面向 Fairwind Program 中的一批可信网络防御者逐步开放,后续将尽快扩大可用范围。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流。该模型今日起通过 Fairwind Program 向一组受信任的测试者开放。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。
一则以笔记形式讨论提示词工程:提示词取决于心智模型是否匹配、以及是否具备足够领域词汇,而非把指令写得更长;领域词汇来自实际做过该工作。作者指出 MCP 只是无头 API、Artifact 是短生命周期 UI,二者可跨 MCP 组合,并把这套"brain / hands / surface"读作智能体原生的经典软件架构版本:未来开发从写前端转向写 MCP server,由智能体组合 UI。
LangChain 与 Modal、Cogent Security 合作,在 SF Tech Week 期间举办一场实时团队制 AI Heist 挑战赛,参赛者需在虚构的隔离云环境中指挥 AI 智能体闯过多个关卡式安全挑战,找到隐藏的 proof token。活动设有实时排行榜和奖品,名额有限,需通过 partiful 报名。
NVIDIA AI 将于明天太平洋时间上午 9 点直播,演示如何用单个提示词构建一个视觉 AI 智能体,并在 YouTube 上开放提问。
xAI 在 Grok Bot Marketplace 上线工程机器人,可把编码任务交接给 Cursor,并通过 GitHub 与 Origin 插件管理 PR,还能分享所构建内容的视频演示。
OpenAI 发布新报告,聚焦小企业如何用 AI 智能体寻找客户、打造产品和管理财务。OpenAI 同时与 ASBDC 达成新合作,为更多小微企业主提供实操 AI 培训与本地指导,帮助他们上手。
GLM 5.3 Flash 现已在 Fireworks AI 的 Serverless Training API 上开放训练,所有人可用,同时支持视觉与文本。该模型在智能体编程、文档分析和工具调用等基准测试中表现优异,且服务成本较低。
Perplexity 的 Computer 功能现在可通过邮件使用,把邮件发送、转发或抄送到 computer@perplexity.com 即可派发任务,智能体在后台完成并保留邮件上下文。所有邮件任务会作为 Computer 中的普通会话运行,可在网页和移动端查看,并带有与应用内任务相同的审计记录。该功能无需 Perplexity 账号即可使用,限时免费处理所有通过邮件派发的任务。
Runway 在 AI Summit 上公布首个 World Interface Model Solaris,一种随交互自我构建的新型操作系统,每一帧都依据用户意图实时生成。CTO Kamil Sindi 在主题演讲中提出所有软件都由生成产生、无需一行代码的未来愿景。
LlamaIndex 同晚在纽约和旧金山举办活动,讨论 AI 智能体文档处理:智能体往往只能拿到文字而丢失版面结构,因此不得不靠猜。纽约场与 Kernel 合作、亮相 Braintrust 的 Agent Builders Night,旧金山场与 WorkOS 合作、参与 Daytona 的 AI Builders 活动,旧金山到场近 600 人并已开启候补名单。
MHK 基于 Amazon Bedrock、Amazon ECS 与事件驱动模式构建了 HIPAA-eligible 的智能体工作流框架 SmartProminence AI Orchestrator,将人工病历审核工作量减少 90%,原本需 3 个月以上部署的新 AI 功能现在 2 周即可上线。