美团技术团队:Agent评测漫谈——从观测到长程Agent的评测方法论
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。
在 Go 中为实时对话 AI 平台构建 Kafka 消息层,用一致性哈希把同一会话的消息路由到固定 worker,再以每会话一个 goroutine 串行处理,从而在数千并发会话下保证会话内严格有序。系统已在生产处理超 4000 万条消息、未观察到乱序,测试中发送侧吞吐突破 100,000 条/秒。重试在会话 goroutine 内原地进行并配合指数退避,避免消息被后发消息超越。
Orange AI 发布实用 skill「播客转文章」,解决录完 Next Token 播客后想转成文章的问题。作者称照录音直接整理像会议纪要,交给 AI 润色又会丢失数字和细节,于是改为按话题而非时间线重新梳理,并定下规则:数字和原话一条不砍,砍掉与本节无关的段子、顺带蹭的新闻和自家产品举例。作者表示实测阅读量和互动不错,用户反馈没有吐槽 AI 味,该 skill 以 MIT 协议免费开源。
AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。
LangChain Academy 发布了一个两分钟讲解视频,解释什么是 agent skill,以及它如何保护智能体的上下文窗口。该内容出自 LangChain 的 Deep Agents 课程,课程地址为 academy.langchain.com/courses/founda…。
美团搜索团队披露 LLM 语义表征在服务零售排序场景的三期实践,累计完成 3 个 Launch Review 并全量上线,一期将 Query 与 POI 的语义向量 cosine 相似度分桶注入精排,带来大盘搜索支付订单 +0.20%、服务零售订单 +0.27%、长尾 NDCG@5 +2.21pp。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。
AI Will(@FinanceYF5)提出,营销人只需掌握 Claude Code 和 GitHub 两个基础工具,学会"营销工程"并搭建自己的 Agent,就能为公司创造真正的收入。该帖列出 11 个练习方向,并引导关注账号、点赞转发首条帖子。
营销 Agent 可连接 Meta 和 Google Ads,支持定时运行、预算限制与操作日志。示例规则为每小时检查账户:50 次转化后暂停 CPA 超目标 3 倍的广告,连续 3 天胜出则加预算 20%,并为最佳广告写 3 个新版本,每次操作及原因同步到 Slack。规则相同时,评论、竞品和真实混合 CAC 等独有数据决定胜负。
营销人只需掌握 Claude Code 和 GitHub 两个基础工具,就能学会"营销工程"这套能力,甚至搭建自己的 Agent。真正会用它们并自建 Agent 的营销人,能为公司创造真正的收入。原文列出 11 个练习方向。
斯坦福大学 CS146S「The Modern Software Developer」第三周课程已公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,内容涵盖 SKILL.md 与脚本编码工作流、Web skills 扩展 Agent 能力边界及 CLI 高效工作方式。
Skills For Real Engineers 开源项目作者 Matt Pocock 分享了 AI Coding Agent 该用多重流程的决策框架:小改动不要用 /grill-with-docs。
GrokBot 近期更新加入原生 X 监控能力,可自动执行搜索、筛选与推送。作者分享 4 个可直接复制的例程:每工作日 9:15 筛选 X 上真实 AI 工作流并剔除「10 prompts」类炒作帖,每工作日 9:00 抓取品牌提及并分类后在 Slack 提醒,以及每 4 小时捕捉正在评估其产品品类的用户帖子。
NVIDIA 给出 5 步流程,用前沿 AI 模型把 CAD 资产转成机器人仿真可用的 SimReady 资产。该流程基于 OpenUSD,需要配置并验证材质、碰撞几何、关节等物理属性,才能测试机器人行为。NVIDIA Omniverse 库遵循 SimReady Foundation 规范,并由智能体化的 NVIDIA 技能引导完成转换与验证。
DeepLearning.AI 与 Qdrant 合作推出由 Dylan Couzon 讲授的免费课程,教你亲手搭建一个无需网络连接、无需远程服务器就能记住钥匙位置的记忆助手。课程已开放免费报名。
Stack Overflow 博客给出 LLM 生产系统成熟度模型 Level 5 的运维规范,核心是一个模型流量收口、一个贯穿全链路的 decision_id,以及不让业务感知具体供应商。
NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其系统核心思路是让智能体的 harness 更小、更清晰、更易于验证。该竞赛要求智能体针对数据库、CSV 和 JSON 文件、散文文档、PDF 及简报视频等异构数据源回答自然语言问题。
LangChain 发布样例项目 Restock,一个运行在 Slack、基于 Managed Deep Agents 的办公用品智能体,可搜索商品、组建购物车并通过 Stripe 的消费者钱包 Link 付款。
上戏毕业的山音与广告公司职员 KK 用两年时间成为 AI 导演,作品登上国内外电影节。他们最常使用的 AI 视频产品是 CapCut Video Studio,同一部片子会混用 Seedance、MiniMax 等多个模型。两人在播客中讨论了 AI 视频产品在底层模型趋同后的壁垒,以及"AI 无限,人生有限"的创作者困境。
bolt.new 分享了一条可直接复用的提示词:用 wavesurfer.js 构建播客剪辑播放器,支持可拖动波形、播放/暂停以及沿波形分布的可点击章节标记,并使用示例音频文件。该提示词面向在 bolt.new 中生成的场景。
GitHub 在网络安全意识月专访 VIP 漏洞赏金研究员 @vaib25vicky,其专注授权与访问控制方向,挑选目标的标准是功能足够复杂、难以理解,一旦发现可疑点就持续使用和探索该功能直至出现异常。
LlamaIndex 将 Markdown 作为解析的默认输出格式,因为 Markdown 能保留标题、列表和表格结构,避免解析器读对每个词却丢失数字所属列、迫使模型猜测的问题,且调试错误答案时仍可读。对于存在合并表头的表格,则改用 HTML 输出。
serverlesshorrors.com 汇集了 Cloudflare、Vercel、Google、AWS 等云平台被刷爆的案例,最近几条都出自 Cloudflare 的 Durable Object。作者据此建议 Vibe Coding 时直接别用 Durable Object。
Lovable 分享了一条提示词,用户可在 Lovable 里自建一个能对话的日历应用:左侧聊天面板、右侧 Google Calendar 周视图,通过 Google OAuth 读写事件。聊天由 GPT-6 Astra 驱动,用工具调用列出、创建、更新、删除事件并按需查找空闲时间,删除前会先确认。
小米蓝牙遥控器 2 Pro 到货后,搭配开源 App「无线麦」即可作为 AI 语音输入硬件,通过 Codex 完成安装并简单设置。该方案可配合豆包输入法、TypeLess,或直接使用 Raycast 内置语音输入。
铁锤人 @lxfater 用本地部署的千亿参数大模型写游戏代码,一天做出四驱兄弟风格的 3D 赛车游戏,内置 4 款赛车模型、5 种可搭配组件和 3 个赛道,还能放大招压扁对手。赛车模型由 Tripo3D 传入四张参考图生成,部件拆出后接入 Godot 做成可选配装备,玩法再由本地大模型串联。
火山方舟 Agent Plan 中的专属 Harness CUA 可自动操控云桌面里的 Blender,把一句武侠创意先做成白模预演,再作为参考喂给生视频模型,产出 20 秒成片。套餐集成 Seedance、Seedream 生图生视频模型,兼容 Claude Code、Codex 等工具,以 AFP 统一计量用量,Medium 及以上套餐可开通 CUA,Large 及以上支持 Seedance。
H-Company 借助 NVIDIA Dynamo 优化面向 Computer Use Agents 的 VLM 服务。该内容以直播形式发布,未披露具体的性能数据、模型版本或部署规模。
Spotify Ads 高级工程师 Pratik Rasam 披露了 Spotify Ads Manager 内部的多智能体广告生成平台 Ads AI:上线一年来超过 70% 的广告使用 AI 工具,已为 7000 多家广告主生成约 20000 个创意素材。
LovartAI 在 X 上放出一段用于生成人像的提示词,画面为长卷深棕发、雀斑、榛色眼睛的年轻女性,白色罗纹吊带配金色叠戴项链,背景是郊区前院的白色花丛与砖房。提示词强调金色黄昏逆光、树叶斑驳光影与真实皮肤毛孔质感,模拟 iPhone 拍摄的自然随手自拍风格与浅景深胶片颗粒感。
优化配置后本地推理速度提升到 100+ token/s,但内存仍不够用,作者估计再加两根内存条就够。推文未说明所用模型、硬件与具体优化方式。
姚金刚开源17套知识付费提示词,源自其《课程营销学》一书,覆盖课程定位、课程设计、课程售卖和课程运营四大核心模块,供正在做课程的老师、知识创作者和教育产品团队直接使用。同时,其搭档透露接下来两个月将推进深圳GEO大会,并启动招商,已有GEO相关工具厂商、AI Agent产品和Token算力平台支持。
Unsloth 发布本地训练教程与开源仓库,可将 Qwen3.8、Gemma 4 等 LLM 微调为输出选项概率的决策模型。Unsloth 报告,Qwen3.5 0.8B 在三个决策基准上的合计准确率从 20.7% 提升至 74.3%,并称仅需 4GB 显存。
张佳宣布《AI产品经理转型特训营-2026版》课纲开始更新,共14大模块、76章节、330+知识点、24小时课程时长,计划每周更新一轮、争取2个月内更完全部内容。新版融合2025版技能特训课、项目实训课、线下课、AI编程课与智能体课程内容,增加Agent、Skill的篇幅和颗粒度,并重构教学方式以适应零散时间学习。更新期间报名按2025版早鸟价2999元,更新完成后涨价至3999元。
作者整理了一套面向 Codex 的提问模板卡,覆盖修 Bug、加改功能、优化代码、改已有功能、还原设计稿、修启动构建问题和对接接口 7 个场景。每个模板给出可直接复制替换的提示词,明确任务边界、处理要求与完成即停止等约束,并说明同一需求涉及多项工作时可使用通用组合模板。
iOS 27 新增通知自动化,任何能发送通知的 App 都可作为快捷指令触发条件,并可按通知标题、副标题、正文三个字段组合筛选。作者用十个案例展示具体玩法,包括重要联系人连续消息换墙纸提醒、自定义图标后补回角标、按 App 颜色生成墙纸、联系人专属铃声、英文通知自动翻译以及用 AI 总结当天通知。文中也指出限制,通知自动化只能获取实际显示出来的内容,微信等长消息会被省略号截断。
架构师沈剑在《AI时代的架构设计100讲》第9讲指出,AI写代码会踩的四类缓存坑没变——耦合、雪崩、不一致、互相挤兑,但踩坑的从程序员变成了AI。他建议把四条红线写进spec禁止条款:禁止用缓存当服务间数据管道、禁止调用方缓存服务底层数据、禁止多服务共用缓存实例、未做容量预估与雪崩预案禁止上线。雪崩预案可用高可用缓存集群或缓存水平切分,并需通过缓存宕机演练验收。
李继刚(@lijigang_com)发起提问:过去一百年里,对人类进步「影响最大」的十篇论文是哪些?该条内容获得 38 条回复、27 次转发、295 次点赞、148562 次浏览和 134 次引用,由 xgo.ing 提供支持。
全程由 AI 编写的小程序「厨菜记」9 月 18 日上线,19 天后累计独立访客 601、日均新增 30 人,是作者乐观预测上限的三倍,并已开通流量主。作者将预测失误归因于内容传播呈脉冲式,以及家庭内 2 到 4 人的裂变乘数。流量主开通两天累计收入几块钱,他只保留菜谱列表底部一个 Banner。
freeCodeCamp.org 发布一小时视频教程,演示在笔记本或普通 CPU 上从零构建、预训练并微调一个 2500 万参数语言模型。课程涵盖混合线性/稀疏注意力、MoE、绑定嵌入权重和多模态图像 patch 输入等现代架构,并搭建轻量 RL 循环让模型写代码、跑单元测试、拿奖励,任务成功率从 0% 提升到通过多数评测。教程还讲解如何形成可检验假设、调节温度与奖励结构并检查统计显著性。