Grok Bot 定时任务自动生成 AI 早报视频,全程跑在云端虚拟机
歸藏用 Grok Bot 设置定时任务,每天早上自动产出一条 AI 早报视频,内容收集、写代码和视频渲染全部在 Grok 的云端虚拟机上完成,未使用本地电脑。他公开了自己使用的提示词,复制后其他 Grok bot 也能执行同样的任务。
歸藏用 Grok Bot 设置定时任务,每天早上自动产出一条 AI 早报视频,内容收集、写代码和视频渲染全部在 Grok 的云端虚拟机上完成,未使用本地电脑。他公开了自己使用的提示词,复制后其他 Grok bot 也能执行同样的任务。
港大教授孔令鹏创立的扩散语言模型公司 DiffuSpace 完成 dLLM 方向全球最大规模融资,高鹄资本担任交易方。其开源模型 Dream 7B 在 Hugging Face 累计下载量超过 250 万,今年内计划发布参数规模更大的新模型,并针对性适配代码 Agent 与智能推理等任务。
GhosttyEXTREME 是 Ghostty 1.3.1 的 macOS 分支,用于在同时运行 Claude Code、Codex 等多个 AI 编码代理时,通过侧边栏、跟随编辑的代码编辑器和代码地图把代理过程可视化。它还提供权限应答、回合撤销和变更审查功能。
Agent Economy Gala 在 a16z TECH WEEK 期间满员 400 人,其中 203 位创始人累计融资超 $1B,295 位嘉宾正在构建智能体应用或基础设施。
一篇论文提出 HERMES harness,在同一模型与相同 effort 设置下把 GPT-5.6 Sol 的整仓库迁移成功率从 6.5% 提升到 31.0%,提升来自 harness 本身。
Aether AI 展示因果驱动的机器人智能系统 CRIS-0,以任务状态为共同依据协调因果世界模型、动作策略和验证工具,让机器人在环境变化后判断动作继续、重试或回退。演示覆盖抗干扰、长程任务和个性化交互三个维度,测试中系统平均 2 秒内识别环境变化并重新规划,10 次干扰完成 9 次有效恢复,微波炉场景下 0.2s 内停止动作。
Manus 母公司蝴蝶效应完成超 5 亿美元新一轮融资,由博裕投资、IDG 资本领投,腾讯、红杉中国、真格基金继续加持。OpenAI 宣布面向全球所有 ChatGPT 用户上线 GPT-6,并聘请 SpaceX AI 高管出任欧洲、中东和非洲地区销售副总裁。腾讯 WorkBuddy 上线“独立文件浏览器”,生数科技发布 Vidu Q4 Preview,视频生成单价 0.09 元每秒起。
DeepLearning.AI 介绍了一个名为 AREX 的智能体研究模型与 harness,它逐条核验答案,保留已核实内容,只针对空白部分继续研究。AREX 在 BrowseComp 上达到 82.5%,在 WideSearch-en 上为 82.0 F1,仅 harness 本身即可带来最高 10 分的提升。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发公开信称因"把安全置于公司短期利益之上"被辞退,OpenAI 称其不当处理机密信息。
Richard Ngo 撰文梳理社会学与智能体基础研究的联系,重点讨论社会均衡、博弈论均衡、规范内化与集体行为三部分,主张将理性社会与政治行为理论作为 Von Neumann 和 Morgenstern 理性经济行为理论的扩展或替代。
一篇名为 Agent Plasticity 的论文发布,提出通过经验衡量 AI 智能体自我改进能力的方法。论文已在 HuggingFace 上线(编号 2610.08…),但摘要未披露具体模型、参数规模或 benchmark 分数。
Google Cloud 开源 AQuA(Ambient Quality Agent),一个与生产环境 AI 智能体并行运行的参考实现,可扫描并核验失败聚类、对照对话记录,并按实际部署的源码快照定位根因。它针对的是智能体上线后难以察觉的质量回归——这类问题往往仍返回 HTTP 200 OK。
个人 AI 智能体有时会过度分享信息——比如把你的银行对账单发进工作聊天群,还会过度承诺、过度消费。
AlixPartners 的 Natalia Connolly 与 Kevin Madura 用 Claude Code 审查合同和支出数据,并探讨如何识别重复的节省主张。两人将在 10 月 14 日的 AI Engineer New York 上分享这一内容,门票见 ai.engineer/nyc。
阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。
Atomic Agent Desktop 发布,这是一款采用 MIT 开源协议、覆盖 macOS/Windows/Linux 的本地 AI 智能体桌面应用,可将对话占用内存压缩最高 80%。
GrokBot 近期更新加入原生 X 监控能力,可自动执行搜索、筛选与推送。作者分享 4 个可直接复制的例程:每工作日 9:15 筛选 X 上真实 AI 工作流并剔除「10 prompts」类炒作帖,每工作日 9:00 抓取品牌提及并分类后在 Slack 提醒,以及每 4 小时捕捉正在评估其产品品类的用户帖子。
Google 与 Beth Israel Deaconess Medical Center(BIDMC)团队在《柳叶刀》发表研究,在 BIDMC 门诊开展真实临床研究,98 名患者在紧急就诊前先与 Google 研究型诊断 AI 聊天机器人 AMIE 对话。
Replit 支持在同一段对话中延续已完成的调研结果,直接基于分析结论继续操作。用户可下达“Draft an action plan”“Create a presentation”“Prepare a research brief”等指令,把已探索的发现作为下一步工作的起点。
Databricks 发文介绍 Lakebase 与 Agentic SDLC,提出用数据库分支支撑编码智能体工作流。其思路是让编码智能体像操作代码分支一样对数据库进行分支,从而在开发流程中隔离和并行推进变更。
a16z 引用 AWS CEO Matt Garman 的观点指出,AI 智能体消耗的 token 几乎是人类的 5 倍,六个月内增长了 14 倍。Garman 表示 AWS 正在为智能体这类新“用户”改造云服务,包括三秒启动数据库、计算沙箱、网关,以及区分智能体与人类或服务角色的权限体系。他提到许多智能体只需创建数据库、完成少量工作后就让数据库销毁,因此并不需要五个九的持久性。
针对 Grok Bot 电脑空间不足的情况,Disk Saver 机器人可通过提出清理建议帮助释放磁盘空间。该机器人由 xgo.ing 提供支持。
LangChain 联合 AWS 和 NVIDIA 举办活动,探讨随着智能体工作负载增长、架构演进、基础设施需求日益复杂,全球团队如何应对生产级智能体系统背后的基础设施层。活动报名链接已开放。
Baseten 用 Notion Agents 搭了一套自动问答系统:问题发进 Slack,答案自动回复;当系统不知道答案时,它会学习并更新所有来源,供下次使用。Baseten 一边帮 Notion 做模型训练与推理,一边用该知识库支撑内部 GTM 团队维护 wiki。
Cursor 新增 /visualize 功能,可在聊天窗口内直接生成图表和示意图,用 /visualize 分析数据并就地查看结果。该功能已在 Agents Window 中开放使用。
Stack Overflow 博客给出 LLM 生产系统成熟度模型 Level 5 的运维规范,核心是一个模型流量收口、一个贯穿全链路的 decision_id,以及不让业务感知具体供应商。
AWS CEO Matt Garman 表示正为 AI 智能体重构云服务,团队越来越需要"对智能体友好"而非仅面向人的云。AWS 已把数据库启动时间压缩到三秒,并新增计算沙箱、网关、智能体权限等全新构建模块。他指出许多智能体只需临时建库做少量工作,并不需要五个九的持久性。
Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。
Anthropic 为 Claude 上线两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Notion 内部最常用的智能体之一是 Data Scout,可连接 Snowflake 与 Notion、Slack 等数据源,让任何人用自然语言提问,并展示答案来源以便核实和深入分析。它还能被其他智能体调用以生成周期性报告,Notion 正帮助一小批客户构建自己的数据智能体。
LangChain 的 Sam 在 First Pass 对话中讨论了决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev。Jev 由 typesafeai 推出后迅速走红,随后 OpenAI 和 Databricks 分别发布了 Decisions API 和 ai_decide function 等相关产品。
Claude Docs、Slides 和 Design 即日起结束 beta 阶段,面向包括 Free 在内的所有套餐开放。团队和 Claude 可以在同一份文档、演示稿或设计稿上共同编辑。
Claude 发布 Claude Motion,可将报告、图表或产品演示转成短动画。每段动画由 Claude 以代码方式生成,不涉及视频模型,因此可修改任意文字、数字或时间点,并导出 MP4。目前面向 Team 和 Enterprise 套餐开放 beta。
AI Engineer 发布面向金融领域的 AI 指南,聚焦研究、智能体评测以及金融操作的权限控制,核心问题是模型给出的数字能否追溯到来源。该指南在纽约活动(10 月 12 日至 14 日)前发布,活动门票已在 ai.engineer/nyc 开放。
Anvisha 发布 Voyager,一个面向视频、图形和游戏创作的开放 harness,被形容为创意工作的 Codex。它自带免费的图形、音乐和视频编辑工具,也能在桌面端驱动 Blender、DaVinci Resolve、After Effects、Ableton 等 100 多个应用,并支持 Opus、Astra、DeepSeek 等模型。
Incarna 借助 Amazon Bedrock AgentCore payments,让 AI 智能体逐次向 BlockRun 支付模型推理费用,把接入 x402 支付的工作从数月缩短到数天,并已将端到端按次付费流程投入生产。
NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其系统核心思路是让智能体的 harness 更小、更清晰、更易于验证。该竞赛要求智能体针对数据库、CSV 和 JSON 文件、散文文档、PDF 及简报视频等异构数据源回答自然语言问题。
OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价:输入 $12/百万 token,输出 $60/百万 token。该模式面向对速度和智能都有要求的场景,例如排查线上故障、智能体操作应用,以及分秒必争的实时体验。
Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。
Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。
Google 在 Gemini at Work 活动上发布新的 Gemini agent,定位为面向工作的单一通用智能体,可处理问答、知识工作、图像与媒体生成以及代码编写与运行,全部通过一个提示框完成。