Today 中国版上线:从提醒你到替你办,Personal AI 走到哪一步?
Today 中国版于9月24日正式在国内首发上线,基础版永久免费,新用户注册即领1亿token并畅享1个月Pro权益。作为会在使用中逐渐了解用户的 AI 助理,Today 覆盖会前资料准备、旅行安排及学习、健康、个人财务等长期跟进事项,并能在用户开口前主动多想一步。
Today 中国版于9月24日正式在国内首发上线,基础版永久免费,新用户注册即领1亿token并畅享1个月Pro权益。作为会在使用中逐渐了解用户的 AI 助理,Today 覆盖会前资料准备、旅行安排及学习、健康、个人财务等长期跟进事项,并能在用户开口前主动多想一步。
Browser Use 展示了 Luna(planner)与 Jev(actor)配合打扑克并获胜的演示。在这套规划器—执行器架构中,Luna 负责规划、Jev 负责执行动作,两者协同完成牌局决策。
Genspark 在 Super App 内上线编码智能体 GenCode,支持 Claude、GPT、DeepSeek 或开源权重模型,同一个账号即可使用且无需配置 API key。作者称其能力与 Claude Code、Codex 相当,开源权重方案的成本为后者的 1/10 到 1/20,并强调模型由用户按任务自行选择,而不是由智能体代为指定。
AI Engineer Paris 2026 开幕主题演讲嘉宾包括 Mistral AI、Liam McBride、rawert 和 thekitze,活动在巴黎 Station F 举办并通过 YouTube 直播。
Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。
5 月至 7 月,OpenAI、Anthropic、亚马逊云科技和微软各自成立或组建企业 AI 交付实体,按公开口径合计投入约 90 亿美元。
Guillermo Rauch 发布 ShellPerfBench,用于衡量新 shell 会话的启动时间。他表示 Opus 5.5 找到了许多其他模型漏掉的优化点,并建议用户让智能体去优化 .zshrc 等配置文件。
Grok Bot 支持跨频道发送通信,可让一个 bot 给另一个 bot 发信息,对方执行完成后再发通知回来,类似 herdr 的跨 panel 通信。该技巧被评价为实际使用中相当实用。
Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。
在刚果民主共和国,CEPI、WHOAFRO 和 inrb_kinshasa 等全球卫生组织正使用 Claude 加速应对一种罕见埃博拉变异株的疫情。Anthropic 发布了相关完整报道。
Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。
XCircle 联合创始人小飞称,正在陪企业正式取消层级和部门,建议小队规模从 1-8 人缩到 2-4 人,核心考核指标改为闭环运转周期,而非个人用 AI 提效。她认为传统科层里靠统筹、汇报、周报、PPT 存活的管理者会被转出去,而经验丰富、AI 用得好的专家价值可放大十倍。徐文浩则指出,AI 带来成倍效率提升却未带来成倍收入提升,老组织转型的第一阻力是背锅而非分钱。
Hugging Face Hub 上的 Agent Traces 现在为每次运行附带一份回执,可查看 tokens、缓存命中率和成本。该更新由 Caleb 公布,但原文标题中提到的 Agent cyberattack traces 何时上线并未给出时间。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
Cursor 推出 Rollouts,它会先编写一份监控计划,再在部署过程中持续观察变更。部署经过验证,因此回归问题能在用户接触到之前被捕获。
HeyGen 宣布加入 Muse,用户只需告诉 AI 智能体想说的内容,它就能与 HeyGen 协作,用你的数字人和声音生成可直接发布的视频。HeyGen 称 Muse 此前已能替用户生产内容,此次公布了两分钟的 HeyGen 配置流程、早上 7 点的提示词以及让数字人视频以多语言发布的那条回复。
Replit 在纽约 7 号线上发起 "Hacking the 7" 活动,邀请 35 位创作者挑战在列车抵达终点站前,用 Replit 完成从想法到应用上线。活动全程横跨整条 7 号线,创作灵感来自沿途流动的城市景观,完整视频已发布在 YouTube。
Anthropic 公布其新分子生物学实验室的首个研究成果。该实验室由 Anthropic 生物学家团队使用 Claude 梳理数据与文献、生成假设和候选生物系统,经科学家审阅后由科学家完成全部实验验证。Anthropic 希望将这一方法扩展到基因组学及其他领域,并公开征集研究问题提案。
Devin 现已原生支持 Microsoft 365,可被授予访问 Outlook、Calendar、OneDrive、SharePoint 和 Directory 的权限,以获取持续工作所需的全部上下文。权限按用户和按应用分别限定范围,为团队提供精细控制与灵活性。
Cognition 宣布 Devin 现在可以在 Microsoft Teams 内使用,用户无需离开聊天即可私信 Devin、发起群聊,或从 Teams 频道创建 Automations。Devin 还能 @ 提及同事提问、发送文件附件,并在完成任务后将自己静音。
Cognition 为 Devin 推出面向 Microsoft 用户的两项更新:原生支持 Teams,并上线第一方 Microsoft 365 集成,可连接邮件、日历文件、聊天等内容。此前 Devin 主要在自有 PC 上构建应用,如今在用户自己的设备上表现更好。
OpenAI 宣布 ChatGPT Voice 迎来大幅升级,现在可以调用 email、calendar、Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能已可在网页和移动端的 ChatGPT Work 中使用,用户通过语音即可创建文档、演示稿、网站和表格,或处理浏览器内的复杂任务,当天随最新版应用全球推送。
OpenAI 官方更新 ChatGPT Voice 的工具调用范围与可用场景,读者可了解语音入口正被并入工作流。
Vercel 发布 Sandbox 的持久化存储 Drives,目前已进入公开测试,所有套餐可用,单个 Sandbox 最多挂载四个 Drives,每个容量上限 16 TiB。Drives 可将文件存储从智能体运行环境中解耦,直接读写文件而无需启动完整智能体计算机,用于存放工作区、数据、模型与依赖,并支持跨并行 Sandbox 读取快照。
AI Engineer World's Fair 2026 的 Vision & OCR Track 正在直播,核心观点是"模型能看见了,但仍在学习如何观察"。
Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。
OpenAI 宣布 ChatGPT Voice 新增多项能力:可调用邮件、日历、Slack 等插件,由 GPT-6 Astra、Sol、Luna 驱动,并可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。该功能今日随最新版应用在全球范围推送。
从语音对话扩展到可调用邮件、日历等插件的任务执行,读者可据此判断ChatGPT Voice的使用场景变化。
Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更精简的提示词、选择性工具加载、更好的缓存以及压缩文件读取。开发者建议构建智能体的人给智能体阅读相关发现并让其落地实现。
Genspark 在 Super App 内上线编程智能体 GenCode,一个账号即可调用 Claude、GPT、DeepSeek 或开源权重模型,且无需配置 API key。与自动选模型的编程智能体不同,GenCode 让用户按任务自行挑选模型,官方称开源权重成本仅为前者的 1/10 至 1/20。
LangChain 的 Managed Deep Agents 现可添加定时调度,智能体在后台自主运行。用户只需在 schedules/ 目录添加含 cron 表达式和提示词的文件,然后部署即可。相关文档见 docs.langchain.com。
GitHub 将于 9 月 24 日起举办 GitHub Copilot SDK 入门直播,讲解如何用该 SDK 构建智能体应用而无需自己实现 agent loop,并设有 .NET 和 Java 专场。直播提供英语、中文、葡萄牙语、西班牙语、日语和韩语报名。
Gemini 现已支持通过 Webflow 构建响应式布局、设置页面样式并更新网站 CMS。用户只需对 Gemini 说"为我的艺术工作室网站添加响应式 FAQ 区块,并在 Webflow 上发布更改",即可完成建站与发布操作。
Google Gemini App 支持通过 @Squarespace 构思和搜索域名,用户只需对 Gemini 说“Find domains for my new interior design business in Squarespace.”即可完成。该功能由 Gemini 与 Squarespace 联动实现,示例场景为室内设计业务找域名。
Gemini 现可对接 Peloton,支持搜索并预约课程,还能创建多日训练计划。用户只需对 Gemini 说“Find a 30-minute advanced strength class focusing on core with Peloton”这类指令即可完成操作。
Firecrawl 推出 Jev 与 Alexandria,前者用后者数据在 3.6 秒内完成 5000 次决策。Alexandria 汇总了财富 1000 强公司的数据,并接入 100+ 数据源,目前已向 Jev 及其他用户开放。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。
真格基金出品的播客《此话当真》由 AI 担任主播,与真格管理合伙人刘元完成一期约一小时的对话。AI 在节目中追问自己能否胜任早期投资、要不要训练一个「刘元 AI」,并讨论人因脆弱而更想连接和表达、AI 可模拟人但缺乏感受。
Cursor 宣布其 token 成本降低 7%,智能体质量没有下降。节省来自更紧凑的提示词、选择性工具加载、更好的缓存以及压缩文件读取。
Cursor 公布了对自家 agent harness 的改进方案,说明如何提升其 AI 智能体的运行表现。原文未披露具体模型版本、参数规模或 benchmark 数据,仅指向官方博客的详细说明。
作者给豆包工作派了三件跨度较大的活:拍短剧、养自媒体号、搭AI新品雷达。拍短剧方面,它先列人物、分镜和衔接供确认,再切目标模式检查人物一致性和字幕配音并交出成片。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。