Suhail 分享 cleanbranch Skill:从改动中提取最小功能分支
Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。
Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。
微软把近期模型生态的新模型接入 Copilot,使其从快速问答、委派任务扩展到通过 Autopilot 承接跨小时甚至跨天的完整工作。
快看漫画创始人兼 CEO 陈安妮在播客对谈中披露,她正从零打造 AI Native 产品 Livo,定位"一个实时活着的 AI 世界",其中 AI 角色拥有自己的故事和梦想,用户言行会触发蝴蝶效应,核心功能名为"命运"。她同时回顾了创业 12 年的现金流断裂、2 亿美元融资与身体疼痛,并提出用"游戏精神"面对 AI 时代的内容行业变化。
吴恩达指出,让编码智能体长时间自主运行既昂贵又往往低效。他总结顶尖 AI 从业者的真实工作流:依靠娴熟的人类判断、高度迭代的规划和频繁的输出验证,开发者应学会引导智能体工作流、校准其自主程度并建立稳健的测试机制,把时间花在架构与规格撰写而非逐行写代码上。
Mind Lab 研究员逯雨鑫以个人开发者身份,用约两周时间、一张 5090 显卡和数百美元成本(含 200 美元的 Claude Max Plan)后训练出两个登顶 Hugging Face Model Trending 榜的模型,把 agentic 场景的 benchmark 从底座模型的 15 分提升到 55-60 分。
GPT-6 Astra 能代操作 Blender、Audacity 等专业软件,但作者实测认为它没有补上领域知识:模糊目标仍会越调越偏,卡点从不会点按钮变成不知道改哪里。他还发现 Astra 上线后接替 Sol 成为 Codex 默认模型,因更倾向请求澄清,常只回复"下一步该做什么"却不执行。
Astra 被用于检查一批论文复现包,发现大量代码错误,多数无关紧要,但部分直接推翻了高 ranking 期刊论文的核心结果,还发现许多模型根本没有被正确运行。
实测豆包后,作者认为它能干活,但前提是需求要拆到足够细、记忆要跟得上;多轮任务总崩溃的命门在记忆,需求打分只有10分时会被AI直接回怼。他还提出办公场景本质仍是Office三件套,并用"水桶模型"强调办公别缺模态。
Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。
用 GPT6 对 AgentWork 首页做了 3D 可视化调整,画面中每个人物都对应真实社群用户,可关注和添加需求,方便彼此形成社交。该功能仍处初期,先看社群用户反馈。
Greg Isenberg 列出 9 个值得尝试的 GPT 6 Astra 提示词,涵盖账单砍价、把代理服务逆向工程为 AI 产品、二手市场捡漏、一人公司仪表盘、企业智能体机会审计、浏览器操作员和自动化 QA 等场景。其中"代理变软件"提示词要求拆解某细分服务业务的工作流,并设计可收费 $500-$5,000/月的最简 AI 产品。
在 X 工作近 7 年的 ML Infra 工程师赵迪已加入 OpenAI,他称马斯克是"the biggest asshole"但仍然敬佩,认为马斯克裁员、按第一性原理做事能让人做到不可能的事。他自研的 Rust 推理引擎 Navi 曾将 X 推理性能提升一个数量级,为平台省下几百万美元。他还表示 OpenAI 内部 Codex 使用量年初至今增长 8 到 10 倍,亚太地区涨幅达 12 倍。
Genspark 宣布 GPT-6 Astra 已接入其 Code agent 和 Claw。所引 OpenAI 内容称,用户在电脑上能做的事 Astra 都能代为完成,主打速度。Genspark 称该模型为工作场景打造,并附上 genspark.ai 试用入口。
OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。
GPT-6 Astra 已在 Perplexity Computer 中上线,面向 Pro 和 Max 订阅用户开放。该消息由 Perplexity 官方账号发布,未披露更多模型能力或接入细节。
OpenAI 的 GPT-6 Astra 已在 Work/Codex 中向全部 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,Plus 和 Business 用户将在之后开始逐步 rollout。
原文给出 GPT-6 Astra 已向哪些用户开放与后续节奏,读者可据此判断自己何时能用上。
Anthropic 表示,上月 Claude 完成了费马大定理的首个形式化证明,即把数学推理转成 Lean 等计算机证明助手可验证的形式,该项目此前被认为需耗时多年。
NVIDIA 团队用 NVIDIA NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,解决企业 AI 智能体每次启动都需重建上下文的问题。该智能体维护一层人类可读的知识层,称为 self model,作为对相关信息的智能体记忆。企业工作横跨消息、决策、项目和不断变化的义务,缺乏这些上下文的智能体必须先重建才能参与协作。
Google Gemini 宣布,Daily Brief 从今天起面向美国更多 Gemini 应用用户免费开放。该功能在后台运行,打通 Google 各应用,把邮件、日历、对话和关注内容中最相关的细节汇总成一份可快速浏览的待办与优先级清单。官方同时给出了上手方式和可用范围的说明链接。
DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。
Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。
GitHub Copilot 引入 HydraFusion,通过多模型协同完成规划、构建、批评与补全等编码任务,最高可降低 67% 成本。Satya Nadella 称其体现了异构模型生态的价值,标志着行业从模型选择转向模型编排,并推动成本与成果边界的持续优化。
X Scout 可从你的时间线自动复制最佳 Grok 机器人配置:它学习你的工作方式(机器人/工作流和你的帖子),再在 X 上搜寻值得复制的配置,并全部按你个人定制。入口为 x.ai/bot/4iz8VYK_cG。
GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。
OpenAI 发布 GPT-6 Astra,官方描述为"凡是你能在电脑上做的事,Astra 都能替你做",主打速度。AI SDK 已提供集成支持,可通过其调用 GPT-6 Astra。
Andrew Ng 发布 AI Engineering Skills Map,用于指导如何高效使用 AI 编程智能体。该技能图谱聚焦使用编程智能体所需的最重要技能,完整内容以 X 文章形式发布。
DeepLearning.AI 携手 Google Cloud 推出免费新课程,教你构建一个可依据品牌规范自我批判并迭代的 UI 设计智能体。课程指出,单张优质 AI 图像容易实现,但规模化的一致质量本质上是评估问题。
ZCode 被验证不止是编程工具:把 2 小时 19 分的直播回放和 mp3 丢给它,41 分钟就自动产出图文并茂的飞书云文档,截图位置由 GLM-5.3-Flash 的视觉能力自行挑选。
Anaconda 提出"默认安全"的 AI 编程智能体构建思路,用于保障 Python 数据科学与机器学习场景下的软件供应链安全与企业级 AI 基础设施。该公司定位为 Python 数据科学与机器学习的基础平台,提供安全的软件供应链治理能力。
Milvus 宣布以 OSS 合作伙伴身份支持 Mihail Eric 的斯坦福课程 The Modern Software Developer。
LangChain 重构了对 MCP 的支持,MCP 支持移入主包 langchain.mcp,不再需要单独安装 langchain-mcp-adapters,基于 FastMCP 构建,可同时兼容新旧两种协议规范。
小红书(RedNote)的 Xubin Hao 及同事提出自主管理上下文方法 Self-GC,在把上下文发给关联 LLM 之前,由一个大语言模型决定哪些部分保留、删减或丢弃。
Hailuo AI 的 H3 宇宙近日热度攀升,Charlie Clark 上线了 diiverge.co——一款持续生成、无限延展的点选式冒险,每张图都是一个分叉点,点击其中元素即可决定后续走向,世界朝该方向生长。
每个高管职能都可以由 AI 智能体代表,再由一个 COO 智能体统管,这是工作中正在成形的组织方式。作者由此发问:个人场景的对应版本是什么,家庭、个人理财、健康、休闲旅行之外还能有什么?
Next.js 团队在约三周内关闭了 1,462 个 GitHub issue,把积压从 2026 年 8 月 10 日的 2,244 降到 9 月 4 日的 995,期间还新增 218 条报告。
Dify 新版 Agent 上线已满一周,官方公开征集使用反馈。该 Agent 支持通过对话构建、发布为 Web App,并可接入 Workflow,由 Agent 决定下一步动作、Workflow 维持整体流程可控。每次运行可查看日志,并通过监控观察长期表现,构建一次即可复用。
Jim Fan 回顾 OpenAI 2016 年的 World of Bits 项目,当时智能体靠看屏幕像素、移动鼠标在 United 上订机票,却因依赖手工设计的分任务奖励函数和 Pascal Titan X GPU 从头做 RL 而失败。
作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。
淘宝百亿补贴团队上线 bybt-data-analysis-assistant 数据分析智能体,用自然语言提问即可完成找表、写 SQL、执行到深度归因的全流程。
论文 HarnessDev 探讨 LLM 能否自行创建并演化其 Agent Harness,论文地址已发布在 Hugging Face。原文未给出模型版本、参数规模或 benchmark 分数等具体结果。