跳到正文

#Agent

今日 151 条
9月7日周一
  1. Suhail(@Suhail)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail 分享 cleanbranch Skill:从改动中提取最小功能分支

    Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。

  2. Satya Nadella(@satyanadella)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将新模型接入 Copilot,推出可完成长任务的 Autopilot

    微软把近期模型生态的新模型接入 Copilot,使其从快速问答、委派任务扩展到通过 Autopilot 承接跨小时甚至跨天的完整工作。

  3. 十字路口CrossingAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快看漫画陈安妮谈 AI Native 新产品 Livo:一个实时活着的 AI 世界

    快看漫画创始人兼 CEO 陈安妮在播客对谈中披露,她正从零打造 AI Native 产品 Livo,定位"一个实时活着的 AI 世界",其中 AI 角色拥有自己的故事和梦想,用户言行会触发蝴蝶效应,核心功能名为"命运"。她同时回顾了创业 12 年的现金流断裂、2 亿美元融资与身体疼痛,并提出用"游戏精神"面对 AI 时代的内容行业变化。

9月6日周日
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:别让编码智能体自主跑数小时,人类判断与频繁验证才是关键

    吴恩达指出,让编码智能体长时间自主运行既昂贵又往往低效。他总结顶尖 AI 从业者的真实工作流:依靠娴熟的人类判断、高度迭代的规划和频繁的输出验证,开发者应学会引导智能体工作流、校准其自主程度并建立稳健的测试机制,把时间花在架构与规格撰写而非逐行写代码上。

  2. 42章经AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型

    Mind Lab 研究员逯雨鑫以个人开发者身份,用约两周时间、一张 5090 显卡和数百美元成本(含 200 美元的 Claude Max Plan)后训练出两个登顶 Hugging Face Model Trending 榜的模型,把 agentic 场景的 benchmark 从底座模型的 15 分提升到 55-60 分。

  3. 浮之静AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 不会让外行秒变专家

    GPT-6 Astra 能代操作 Blender、Audacity 等专业软件,但作者实测认为它没有补上领域知识:模糊目标仍会越调越偏,卡点从不会点按钮变成不知道改哪里。他还发现 Astra 上线后接替 Sol 成为 Codex 默认模型,因更倾向请求澄清,常只回复"下一步该做什么"却不执行。

  4. Greg Brockman(@gdb)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 用于核查科学论文,发现复现包大量代码错误

    Astra 被用于检查一批论文复现包,发现大量代码错误,多数无关紧要,但部分直接推翻了高 ranking 期刊论文的核心结果,还发现许多模型根本没有被正确运行。

  5. 人民公园说AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包到底能不能工作?产品老炮被AI骂垃圾,才发现是我不配

    实测豆包后,作者认为它能干活,但前提是需求要拆到足够细、记忆要跟得上;多轮任务总崩溃的命门在记忆,需求打分只有10分时会被AI直接回怼。他还提出办公场景本质仍是Office三件套,并用"水桶模型"强调办公别缺模态。

  6. Browser Use(@browser_use)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 在 Browser Use Benchmark v2 上以 77.3% 大幅领先 Opus 5 与 GPT-5.6

    Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。

9月5日周六
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT6 把 AgentWork 首页改成 3D 可视化:每个画面人物都是真实社群用户

    用 GPT6 对 AgentWork 首页做了 3D 可视化调整,画面中每个人物都对应真实社群用户,可关注和添加需求,方便彼此形成社交。该功能仍处初期,先看社群用户反馈。

  2. Greg Brockman(@gdb)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Greg Isenberg 分享 9 个值得一试的 GPT 6 Astra 提示词

    Greg Isenberg 列出 9 个值得尝试的 GPT 6 Astra 提示词,涵盖账单砍价、把代理服务逆向工程为 AI 产品、二手市场捡漏、一人公司仪表盘、企业智能体机会审计、浏览器操作员和自动化 QA 等场景。其中"代理变软件"提示词要求拆解某细分服务业务的工作流,并设计可收费 $500-$5,000/月的最简 AI 产品。

  3. 向阳乔木推荐看AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 X 跳槽 OpenAI 的赵迪:马斯克是"最大的混蛋"但依然敬佩

    在 X 工作近 7 年的 ML Infra 工程师赵迪已加入 OpenAI,他称马斯克是"the biggest asshole"但仍然敬佩,认为马斯克裁员、按第一性原理做事能让人做到不可能的事。他自研的 Rust 推理引擎 Navi 曾将 X 推理性能提升一个数量级,为平台省下几百万美元。他还表示 OpenAI 内部 Codex 使用量年初至今增长 8 到 10 倍,亚太地区涨幅达 12 倍。

  4. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 在 Code agent 与 Claw 中接入 GPT-6 Astra

    Genspark 宣布 GPT-6 Astra 已接入其 Code agent 和 Claw。所引 OpenAI 内容称,用户在电脑上能做的事 Astra 都能代为完成,主打速度。Genspark 称该模型为工作场景打造,并附上 genspark.ai 试用入口。

  5. Augment Code(@augmentcode)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 上线 Cosmos,长程编码与多步智能体能力大幅提升

    OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。

  6. Perplexity(@perplexity_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 上线 Perplexity Computer,面向 Pro 和 Max 订阅用户

    GPT-6 Astra 已在 Perplexity Computer 中上线,面向 Pro 和 Max 订阅用户开放。该消息由 Perplexity 官方账号发布,未披露更多模型能力或接入细节。

  7. Greg Brockman(@gdb)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Astra,先向 Pro、Enterprise 与 Business Premium 用户开放

    OpenAI 的 GPT-6 Astra 已在 Work/Codex 中向全部 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,Plus 和 Business 用户将在之后开始逐步 rollout。

    为什么值得看

    原文给出 GPT-6 Astra 已向哪些用户开放与后续节奏,读者可据此判断自己何时能用上。

  8. Anthropic(@AnthropicAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 称 Claude 完成费马大定理首个形式化证明

    Anthropic 表示,上月 Claude 完成了费马大定理的首个形式化证明,即把数学推理转成 Lean 等计算机证明助手可验证的形式,该项目此前被认为需耗时多年。

  9. NVIDIA Technical BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA NemoClaw 构建记忆驱动智能体:打造"幕僚长"式企业助手

    NVIDIA 团队用 NVIDIA NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,解决企业 AI 智能体每次启动都需重建上下文的问题。该智能体维护一层人类可读的知识层,称为 self model,作为对相关信息的智能体记忆。企业工作横跨消息、决策、项目和不断变化的义务,缺乏这些上下文的智能体必须先重建才能参与协作。

  10. Google Gemini App(@GeminiApp)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 的 Daily Brief 向更多美国用户免费开放

    Google Gemini 宣布,Daily Brief 从今天起面向美国更多 Gemini 应用用户免费开放。该功能在后台运行,打通 Google 各应用,把邮件、日历、对话和关注内容中最相关的细节汇总成一份可快速浏览的待办与优先级清单。官方同时给出了上手方式和可用范围的说明链接。

  11. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Batch 本周亮点:编程智能体技能、OpenAI 与 Anthropic 企业数据留存政策、GLM-5.3-Flash 等开放权重模型

    DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。

  12. Google AI(@GoogleAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash、Lyria 3.5 与 WeatherNext 3 等模型

    Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。

  13. Satya Nadella(@satyanadella)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 推出 HydraFusion:从模型选择走向模型编排

    GitHub Copilot 引入 HydraFusion,通过多模型协同完成规划、构建、批评与补全等编码任务,最高可降低 67% 成本。Satya Nadella 称其体现了异构模型生态的价值,标志着行业从模型选择转向模型编排,并推动成本与成果边界的持续优化。

  14. eric zakariasson(@ericzakariasson)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    X Scout 上线:自动复制时间线中最佳 Grok 机器人配置

    X Scout 可从你的时间线自动复制最佳 Grok 机器人配置:它学习你的工作方式(机器人/工作流和你的帖子),再在 X 上搜寻值得复制的配置,并全部按你个人定制。入口为 x.ai/bot/4iz8VYK_cG。

9月4日周五
  1. Milvus(@milvusio)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 释放信号:长时运行智能体光靠上下文压缩不够,Milvus 3.0 补上记忆检索层

    GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。

  2. AI SDK(@aisdk)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 GPT 6 Astra

    OpenAI 发布 GPT-6 Astra,官方描述为"凡是你能在电脑上做的事,Astra 都能替你做",主打速度。AI SDK 已提供集成支持,可通过其调用 GPT-6 Astra。

  3. Andrew Ng(@AndrewYNg)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 发布 AI Engineering Skills Map,梳理高效使用 AI 编程智能体的关键技能

    Andrew Ng 发布 AI Engineering Skills Map,用于指导如何高效使用 AI 编程智能体。该技能图谱聚焦使用编程智能体所需的最重要技能,完整内容以 X 文章形式发布。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepLearning.AI 与 Google Cloud 推出免费课程:构建能自我批判迭代的 UI 设计智能体

    DeepLearning.AI 携手 Google Cloud 推出免费新课程,教你构建一个可依据品牌规范自我批判并迭代的 UI 设计智能体。课程指出,单张优质 AI 图像容易实现,但规模化的一致质量本质上是评估问题。

  5. AI产品黄叔AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ZCode 不止编程工具:2 小时直播 41 分钟转成图文飞书文档

    ZCode 被验证不止是编程工具:把 2 小时 19 分的直播回放和 mp3 丢给它,41 分钟就自动产出图文并茂的飞书云文档,截图位置由 GLM-5.3-Flash 的视觉能力自行挑选。

  6. Stack Overflow BlogAI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anaconda 如何构建默认安全的 AI 编程智能体

    Anaconda 提出"默认安全"的 AI 编程智能体构建思路,用于保障 Python 数据科学与机器学习场景下的软件供应链安全与企业级 AI 基础设施。该公司定位为 Python 数据科学与机器学习的基础平台,提供安全的软件供应链治理能力。

  7. Milvus(@milvusio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 成为斯坦福 The Modern Software Developer 课程 OSS 合作伙伴

    Milvus 宣布以 OSS 合作伙伴身份支持 Mihail Eric 的斯坦福课程 The Modern Software Developer。

  8. LangChain BlogAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 重构 MCP 支持:并入主包、无状态规范与 elicitation

    LangChain 重构了对 MCP 的支持,MCP 支持移入主包 langchain.mcp,不再需要单独安装 langchain-mcp-adapters,基于 FastMCP 构建,可同时兼容新旧两种协议规范。

  9. DeeplearningAIAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书团队提出 Self-GC,用 LLM 自主管理智能体上下文

    小红书(RedNote)的 Xubin Hao 及同事提出自主管理上下文方法 Self-GC,在把上下文发给关联 LLM 之前,由一个大语言模型决定哪些部分保留、删减或丢弃。

  10. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hailuo AI 的 H3 宇宙玩法愈发疯狂:diiverge.co 上线可无限分叉的点选式冒险

    Hailuo AI 的 H3 宇宙近日热度攀升,Charlie Clark 上线了 diiverge.co——一款持续生成、无限延展的点选式冒险,每张图都是一个分叉点,点击其中元素即可决定后续走向,世界朝该方向生长。

  11. andrew chen(@andrewchen)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    工作里有 CFO、CMO 等智能体,那个人生活该有哪些?

    每个高管职能都可以由 AI 智能体代表,再由一个 COO 智能体统管,这是工作中正在成形的组织方式。作者由此发问:个人场景的对应版本是什么,家庭、个人理财、健康、休闲旅行之外还能有什么?

  12. Next.js BlogAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 团队如何在一个月内关闭 1,500 个 GitHub issue

    Next.js 团队在约三周内关闭了 1,462 个 GitHub issue,把积压从 2026 年 8 月 10 日的 2,244 降到 9 月 4 日的 995,期间还新增 218 条报告。

  13. Dify(@dify_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 新版 Agent 上线一周,官方征集使用反馈

    Dify 新版 Agent 上线已满一周,官方公开征集使用反馈。该 Agent 支持通过对话构建、发布为 Web App,并可接入 Workflow,由 Agent 决定下一步动作、Workflow 维持整体流程可控。每次运行可查看日志,并通过监控观察长期表现,构建一次即可复用。

  14. Jim Fan(@DrJimFan)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 回忆 OpenAI 2016 年 World of Bits:十年后 Astra 让智能体真正订上机票

    Jim Fan 回顾 OpenAI 2016 年的 World of Bits 项目,当时智能体靠看屏幕像素、移动鼠标在 United 上订机票,却因依赖手工设计的分任务奖励函数和 Pascal Titan X GPU 从头做 RL 而失败。

  15. 向阳乔木推荐看AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 七个项目实测:网页、游戏与 PPT 表现如何

    作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。

  16. 大淘宝技术AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    淘宝百亿补贴数据分析助手 Agent 实战:多 Agent 协同的 NL2MDL2SQL 取数归因系统

    淘宝百亿补贴团队上线 bybt-data-analysis-assistant 数据分析智能体,用自然语言提问即可完成找表、写 SQL、执行到深度归因的全流程。

  17. AK(@_akhaliq)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HarnessDev:LLM 能否创建并演化自己的 Agent Harness?

    论文 HarnessDev 探讨 LLM 能否自行创建并演化其 Agent Harness,论文地址已发布在 Hugging Face。原文未给出模型版本、参数规模或 benchmark 分数等具体结果。