大淘宝技术:Loop engineering 如何把 agent 放进工程循环
大淘宝技术会员技术团队提出 Loop engineering 理念,工程师不再逐轮提示 agent,而是设计包含读取状态、判断任务、执行、验证、记录状态和判断停止条件的自动化循环。
大淘宝技术会员技术团队提出 Loop engineering 理念,工程师不再逐轮提示 agent,而是设计包含读取状态、判断任务、执行、验证、记录状态和判断停止条件的自动化循环。
一个被分享的小技巧是:找个好环境打开 GPT live 进行讨论,在心情愉悦的状态下,模糊的想法很快就能收敛。原文未给出更多模型版本或参数细节。
美图设计室支持上传一张商品平铺图,即可批量生成不同模特、姿势与场景的穿戴效果图,并支持AI服装换色出SKU变体图、替换服装与灵活切换模特场景。首页对话框还可一句话生成模特套图、1:1复刻同行爆款图的背景与版式,以及一站式生成带脚本、运镜、转场和背景音乐的带货视频;生成素材可存入资产库沉淀品牌视觉资产。该工具已首批接入WorkBuddy、Codex等主流大模型,并支持手机APP出图。
GitHub Podcast 最新一期讨论软件开发中涌现的一批 AI 新词汇,聚焦开发者当下正在学习的 AI 术语。节目可在 github.blog 的 AI 与机器学习板块收听。
GitHub 法务团队正在用 Copilot CLI 处理更多法律相关工作,相关做法在 GitHub 官方博客的 AI 与 ML 板块公开分享。帖子未披露具体模型版本、参数或性能数字。
为让 Mac 清理工具 Mole 卸载更彻底,作者整理 300 多款 Mac 软件共约 100 多 G,分成 30 组,用最强 Extra High Fast 模型借 computer use 每次 10 个自动下载、安装、卸载并查找残留。过程补充了 13 类通用规则、90 多条精确清理路径,修正 30 多个误清点,并新增 100 多条单元测试。
飞书 CLI 现已支持搜索公开文档,我在即刻看到超级峰提到后实测可用。随后我用 Codex 批量关闭了大部分个人飞书云文档的公开阅读权限。
AI寓言绘本系列更新《守株待兔》,采用新国风绘本风格,固定农夫、树桩、田地等元素以保证前后画面像同一本故事书。配色以土黄、灰绿、米色为主并加入纸张纹理,靠人物表情和庄稼从整齐到荒废的变化推进剧情。作者表示连续剧情的关键是人物与场景一致性,完整提示词可在评论区索取。
作者分享用 GPT-6 Astra、Meshy 和 Blender 把个人 IP 夕小瑶做成 3D 手势交互网页的完整流程,网页已上线可体验。
快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。
GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。
作者从做AI海报的经验出发,指出画面元素多却仍显模板化、廉价科技感的问题,多出在风格词太空、信息层级太乱、装饰元素太多和提示词没说清楚这几点。文章按这几个常见问题给出改法,包括控制信息量、拉开主次、把高级感说得更具体,以及海报提示词该按什么顺序写。
作者分享从 X 上看到的 QBS 方法,让 GPT-6 针对卡住的问题找一本相关书籍、读完相关章节,再把方法提炼成可直接使用的规则 skill,并用新任务试跑验证,流程为 Question 问题到 Book 书籍再到 Skill。
夸克网盘 Skill 可在线提取视频逐字稿,88VIP 用户可无限使用,支持多路同时转写,平均不到 1 分钟完成 30 分钟音视频转写,后续可用 DeepSeek API 润色。此前作者用本地 FunASR 转写太吃电脑资源,也曾改用 GrokBot 云端处理。
袋鼠帝把 AI 短片制作流程沉淀为 3 个 Skill 并开源:视觉资产提示词、动作打戏提示词和 Miora 视频执行规范,可直接装入 WorkBuddy 使用。
作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理的基准测试。文章指出用 curl 命令、手写 asyncio 脚本或临时压测工具测推理性能,都会受单进程性能上限和 Python GIL 并发限制影响,导致测得的数字不可靠。
奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。
Jev 在分类任务上表现突出,做邮件分类和对线索评分都很好用。有用户为验证 Jev 的判断速度,让其进行邮件分类,并与各家 AI 的高速模型 Luna、Sonnet、Flash 对比,Jev 结果领先。
React 19.3 正式发布,View Transitions 与 Fragment Refs 转为稳定,并加入 Trusted Types 支持。
Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。
有人尝试用 ChatGPT 的 live 模式打电话改文章,方案是先在 Codex 里打电话并提前把 md 文件路径给它,写作则指定 Codex 调用 gemini 3.8 flash(可通过 agy cli 接入),再用任意 md 阅读器打开文件随时聊着改内容。
大淘宝技术针对策略效果类 Agent 提出“五层、四步、三阶段”评测方法论:五层评测对象界定评什么,四步质量归因(诊断、定位、优化、验证)决定评完怎么办,三阶段上线治理(准入、灰度、监控)解决如何上线。团队同时提出 Auto Rubrics 方法,用结构化 Rubrics 替代黑盒 Reward Model,通过三层架构构建可解释的业务效果 Judge 体系,规避位置偏差与选择过拟合等陷阱。
一篇综述把 Agent 的能力来源从模型转向模型之外的 Harness,按「一个循环、四个子系统、生产化、长时运行、评测、选型」展开。
Equinix 将原先自建在 Amazon EC2 上的自管理 Kubernetes 迁移到 Amazon EKS,改用多账号共享服务架构:Workloads、Platform、Network 三个核心账号分别承载应用服务、共享基础设施与网络枢纽,由云运维团队集中治理。成效包括部署速度提升 4 倍,运维开销显著下降。
Milvus 发布教程,介绍如何把 Milvus 用作 EverOS 的搜索后端。EverOS 来自 @evermind,GitHub 星标超过 13,000,用 LLM 从对话中提取记忆并保存为 Markdown 文件,让智能体跨对话保留长期记忆。
多院区医院网络可将传统本地 PACS 迁移为 AWS 云原生架构,把各院区独立 SAN/NAS 存储替换为集中式对象存储并按生命周期策略自动分层。
DHI Group 与 AWS 合作推出 Hackathon Acceleration Package(HAP),通过三天黑客松让 20 名参与者分 3 组构建原型,覆盖雇主分析、候选人匹配与 ClearanceJobs–AgileATS 集成三类用例。
基于 Claudian 改造的版本新增了对 antigravity cli 的支持,并可通过 OpenCodex 接入 Codex,同时该 Claudian 插件已可安装到 Obsidian 中使用。原推未披露模型版本、参数或性能数据。
腾讯云轻量云团队在多 Agent 开发工作流 DevFlow 中定位到,Token 消耗主要来自长上下文在多轮请求中被反复携带,而非代码本身;Developer 阶段上下文曾达到约 120K tokens。
智能体 AI 工作流可用于为物理 AI 系统准备并验证数字孪生:智能体检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按仿真就绪(SimReady)要求校验结果。该流程演示了从 Blender 中的场景到交付给 NVIDIA 的仿真就绪 OpenUSD 的完整过程。
Unsloth 放出配套免费 Google Colab Notebook 与 GitHub 仓库,并提供专门文档页,供用户上手其微调流程。
在免费 Google Colab 中可借助 Unsloth Studio 微调 500+ 开源模型,并支持上传 PDF/CSV 转成可用的合成数据集。流程为安装 Unsloth Studio、选择模型、上传数据集后直接开跑,完成后可导出模型。
长时运行的 AI 智能体面临上下文限制与信息丢失问题,一款新工具正帮助开发者优化记忆管理并削减 API 成本。高效的信息检索被视为生产级 AI 的关键技能。完整分析刊于 The Batch。
开发者 Suhail 发布了新技能 /deslop-shared-libs,从最近两周的 commits 和 PRs 入手,找出可抽取共享代码以减少重复、提升可靠性的位置。他指出 AI 智能体倾向于大量编写全新代码,往往不做模块化和共享组件,导致技术债增加、测试变多、编译变慢;该技能可用于定期清理这类代码冗余。
NVIDIA 展示用智能体 AI 把 CUDA Tile 运算从 Python 转译到 Rust。目标系统 cuTile Rust(cutile-rs)是一个基于 tile 的 GPU kernel 编写框架,将 Rust 的所有权模型扩展到 tile 级 kernel,把可变输出拆分为互不相交的分片,并在 kernel 启动间保持主机端所有权契约;开发者也可在需要底层控制时局部退出该约束。
LlamaIndex 将举办网络研讨会,由解决方案架构师 Abrar Mahi 讲解如何用 LlamaParse 和 Extract 把保险文档转为结构化数据,用于核保、保单审查和理赔流程。内容涵盖解析保单等复杂表单、按既定 schema 抽取保单与财产信息及理赔历史,并用引用和边界框校验抽取结果。还会结合置信度分数与验证规则,决定哪些环节自动放行、哪些需人工复核。
IntelliJ IDEA 2026.2 改进了 Logpoints,新增在任意两行可执行代码之间的 gutter 处点击即可输入日志表达式的方式,无需重建或重新部署即可修改日志。文章用一个 gRPC 客户端-服务器示例演示如何用 Logpoints 定位租户名未规范化导致折扣为 0 的 bug,并可在调试中直接验证修复效果。
清华博士、苏黎世联邦理工博士后张托肯用 AI 三天完成从零到流片的 Attention 计算芯片设计,并借真格「Token Grant」算力支持推进「芯片开卷」计划。
vivo IT 技术团队用 1 个编排器 dev-workflow 加多个单职责 Skill 组成 AI 协作流水线,把存量代码变更拆成增量流程 A 和存量流程 B,流程 B 依次执行影响面分析、处理原则提取、最小侵入分析、埋点与回归用例生成。