微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行的智能体 RL 框架
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
AWS 提出 Agentic Value Model 框架,用于替代 RPA 时代的 ROI 模型,衡量智能体自动化的四类价值:工时节省、异常处理、决策质量与变更韧性,并以价值实现机制决定收益能否落到 P&L。
Manus Game Dev 让用户无需编程即可构建和定制游戏,从模板库中选取可玩模板并在 Preview 中测试想法。演示的赛车游戏中,一条提示词即可为赛道添加加速垫。
微软 Azure 硬件系统与基础设施团队将智能体(agentic)与 AI 工具引入云基础设施全生命周期,覆盖覆盖 80 多个区域、500 个数据中心园区的供应链、部署与机队运营。
OpenAI 产品负责人 Alexander Embiricos 将于 10 月 13-15 日在旧金山 Moscone West 的 TechCrunch Disrupt 2026 发表演讲,主题为“What Comes After the Chatbot?
Google Labs 正在开发名为 Playground 的 AI 游戏创作平台,用户可通过简单的文本提示词构建浏览器游戏。该项目目前处于实验阶段。
Stacklok 由 Kubernetes 两位创建者 Craig McLuckie 和 Joe Beda 创立,目标是把 agent harness 完整搬上云端。该播客指出,尽管 OpenAI 和 Anthropic 近期进展明显,云端 agent harness 仍未完全解决。
Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。
Latent Space 文章讨论 Stacklok 提出的“云原生 harness”思路,认为编码智能体可像容器一样由 Kubernetes 式控制循环管理。
Mistral Large 4 在 Harvey 的 Legal Agent Benchmark(LAB)上成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,xgo.ing 提供支持。
Mistral Large 4 在 AutomationBench 上完成 657 个模拟办公应用中的业务流程任务,覆盖 Gmail、Google Sheets、Slack、Salesforce,成绩领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
Mistral AI 发布 Mistral Large 4,官方称其可运行通用智能体,在复杂工作流中收集信息并产出成品交付物。
Cisco 为 Webex 云协作平台推出智能体工具集 Dialog,作为"agentic harness"调度 AI 智能体处理客户交互,并可在对话结束后继续代表客户工作,跨人员、智能体和后端系统协调。更新后的 Webex 允许工作区成员将 AI 智能体直接拉入空间、会议和通话,执行跨平台及第三方应用的多步骤任务,并借助 Splunk 提供安全能力。
前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。
个人 AI 助手 Tab 宣布结束隐身状态,估值 3 亿美元,具体融资细节未披露,投资方包括 SV Angel、Valar Ventures 和 American Spirit。
杭州学军中学在国庆期间举办首届高中校园黑客松「回响·48H 青年创造营」,450 人报名、216 人到场组成 59 支队伍,48 小时开发后 18 支队伍路演。参赛者年龄从 12 岁到 26 岁,最小获奖团队是四名 12 岁男孩,其「课堂回声」用 AI 对话帮走神学生查漏补缺。杭州「润苗计划」首期基金规模 20 亿元、存续期 20 年,优秀项目可进入杭州人才集团人才库。
JetBrains 对从 16 人软件公司到数千人开发团队的工程组织调研发现,个人开发者用 AI agent 提速明显,但团队层面收益停滞:某金融数据商约 80% 工程师每天使用 agent,却出现 20% 工程师产出 80% 代码的鸿沟。瓶颈转移到代码审查与规划阶段,有团队测得 PR 时间反而增加;把重复工作交给 agent 也带来新的维护负担。
橘AI 发布开源 MIT 许可的「播客转文章」Skill,用于把播客逐字稿改写成文章。其核心做法是按话题而非时间线重新梳理内容,并规定数字和原话一条都不砍,只删掉与本节无关的段子、蹭新闻和举例。作者称实测阅读量与互动不错,用户反馈没有人吐槽 AI 味儿。
Xreal 公布 Android XR 平台混合现实眼镜 Aura 起售价 1,279 美元,比 Meta VR Glasses 的 1,299 美元便宜 20 美元,且今年内出货,Meta 的要到明年年初。
Aadit Sheth 指出 Instinct、Muse、Hark、Dots、Grok Bot 等智能体产品都在做同样的东西,定价也清一色是免费、$20/mo、$100/mo,他认为最终只会有一两个赢家,且大概率出自已经获得用户信任的大型科技公司 Google 或 Apple。
马斯克表示 Grok bot 会根据特定任务选用当前任务的最佳模型,不再局限于 Grok 4.7 或 4.6,还会接入 Opus 5.5、Midjourney、Suno 等 API 帮用户构建内容或执行任务。作者指出,部分任务已由 Opus 5.5 驱动但用户无法主动选择,Midjourney 和 Suno 尚未上线。
OpenAI 推出常驻在线智能体 Dots,用于自动完成购买家具等在线任务。实测中该智能体存在不少 bug,连 captcha 都无法通过。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
Personal Agent 被质疑是伪需求,但大厂仍在争抢,视频围绕 Muse、JEV 一个月估值涨 50 倍、给 Agent 配电脑的难点展开讨论。谷歌被指收紧免费策略,Google Spark 被比作超市里带锁的购物车,大模型进入基建化与低毛利时代,比拼谁能把 Token 成本压到最低并实现变现。
Apple 在智能家居上采取比预期更聪明的路线,通过与 LG 等合作伙伴深度整合切入。Amazon 面对智能体标准问题需要作出应对。
极限编程(XP)创始人 Kent Beck 在 Prodacity 2026 演讲中指出,AI 生成 20 万行代码只属于 Effort 和 Output,离 Outcome 与 Mission 还有两层,不能代表生产力。
从农业就业占比由 90% 降至约 1%、电话接线员和打字员岗位消失,到 Minneapolis 市议会要求自动驾驶汽车配备人类安全员、New Jersey 要求加油需专人操作,技术进步一贯以岗位冗余为代价。软件创造成本骤降可能带来应用与服务爆发,同时需要智能体管理者,但部分公司对程序员的需求会减少,另一些则会首次招聘或大幅扩编。
花叔把自己做艺术动画的方法整理成开源 skill huashu-art-motion,面向 Claude Code 这类 coding agent,用代码画出不同艺术风格场景并让角色和画面动起来,也能把口播配成白板、Vox、3b1b 等风格解说动画。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造 ChatGPT 插件,让旅客在规划行程时即可查找、比较和预订酒店。
一位开发者用 Codex 把接亲、典礼流程整理成手机端静态网页,通过腾讯云 CloudBase 静态网站托管加自购域名部署,并让 Codex 代为完成域名申请、备案与微信访问拦截申诉。他称 GPT-6 生成前端页面的审美能力已足够强,无需额外 skill,后续修改直接在会话中提需求,还能加上亲友签名送祝福功能。
Microsoft 被列为 2026 Gartner® 全球工业 AIoT 平台魔力象限领导者。其工业 AIoT 平台以 Azure IoT Hub、Azure IoT Operations。
培生已同意收购 AI 原生技能平台 Workera,交易金额未披露,预计 2026 年下半年完成交割。Workera 结合代理式 AI、心理测量学和自适应评估衡量员工技能,已验证超 1 亿项技能,收入接近 100% 同比增长,客户包括 ServiceNow、埃森哲和美国太空军。交易完成后 Workera 将并入培生企业学习与技能部门,其 CEO Kian Katanforoosh 加入培生。
OpenAI 在 28 天挑战中为 GPT-6 Astra 和 Sol 提速 50% 至 50 tokens/s,并上线免费 auto-review 与 ChatGPT Meetings 插件;Gemini 4 Argon 发布,主打长时间多步骤编码与网络防御,输出上限 100 万 token。
美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 对谈,主张 AI 批量生成样板代码的时代应废掉传统 Pull Request,转向附带思考链路与脱敏 Prompt 的「Prompt Request」。
有开发者通过约 15 组视觉约束和 Opus 编写的 tokens 模版,让 DeepSeek 生成 Opus-5.5 同款动效视频:产品介绍视频耗时 1 小时 40 分钟、消耗 384K tokens 和 38.5 积分,概念科普视频耗时 1 小时 20 分钟,音乐 MV 由 DeepSeek Harness 耗时 1 小时 1 分钟完成。
当地时间 10 月 5 日,被称作“美版 DeepSeek”的 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出迄今最大的 Mistral Large 4。
OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。
法国 Mistral AI 发布新旗舰 Mistral Large 4(昵称 Le Chonk),这是一个原生多模态 MoE 模型,总参数约 1 万亿,每步激活约 500 亿参数,支持文本和图片输入,可推理、写代码和调用工具,现已开放 API 公测,权重计划在 10 月底放出。
Mistral 新旗舰在自有欧洲数据中心训练并开放 API,读者可对照其评测成绩与中美模型的位置。
Claude Code 开发者 @trq212 分享了插件 html-plan,运行 /html-plan 后不再输出纯文本 Markdown,而是生成自包含的单文件 HTML 页面。