大淘宝技术基于GEPA的提示词自进化优化方案
淘天集团营销与交易技术团队基于ICLR 2026论文GEPA(Reflective Prompt Evolution)设计并实现了一套Prompt自进化系统,构建推理→评分→反思→选择闭环,让LLM自动分析Badcase、归因至Prompt具体规则并生成候选变体,再按帕累托前沿多目标择优。
淘天集团营销与交易技术团队基于ICLR 2026论文GEPA(Reflective Prompt Evolution)设计并实现了一套Prompt自进化系统,构建推理→评分→反思→选择闭环,让LLM自动分析Badcase、归因至Prompt具体规则并生成候选变体,再按帕累托前沿多目标择优。
Antigravity 上的 Gemini 3.8 Flash 因高负载出现请求报错,现已修复并向所有用户重置配额。Varun Mohan 表示此前正在积极修复,问题解决后即刻重置速率限制。
Harrison Chase 指出,「org harness」或企业级 AI(相对于个人 AI)最难的部分是 auth,以及在 Slack 这类多人频道中管理授权。他表示团队正在认真思考如何为托管的 deepagents 做好这件事。
NVIDIA 发布技术解析,解释 30B 参数模型为何每 token 只激活 3B 参数却仍能调用全部模型容量。文章对比稠密模型与 MoE 模型在参数使用方式上的差异,并说明这对吞吐量、内存占用和部署复杂度的影响。
Elastic 宣布 Elastic Cloud Serverless 跨项目搜索(CPS)正式 GA,用户可在多个 serverless 项目间执行单条查询,覆盖所有区域、项目类型与云厂商,数据原地查询、无需迁移。
Epoch AI 将其 AI Data Centers explorer 从 13 个数据中心扩展到 86 个,覆盖全球 AI 算力估计从 15% 升至 44%,2026 年已捕捉到当年新增部署算力的约 53%。页面新增 Directory 标签页,可按算力、IT 功率或成本排名,并按所有者、主要用户或国家筛选,同时提供卫星影像对比。Epoch AI 称对中国数据中心的覆盖仍偏低,为 9-31%。
推理芯片竞赛升温:英伟达以约200亿美元对 Groq 进行 acqui-hire,Cerebras 今年6月 IPO 市值达670亿美元,OpenAI 联手博通推出首款自研推理芯片 Jalapeño,从设计到流片仅用9个月。
Perplexity 推出 CobbleDB,这是一款专为重复批量读取 prepared page records 打造的数据库,用于优化其搜索负载的性能与成本。Perplexity 计划将 CobbleDB 开源,供其他构建 AI 搜索的团队使用。
Perplexity 发布研究,介绍其为搜索网页内容服务的键值数据库 CobbleDB 的构建过程,由两名工程师和数百个常驻 AI 智能体在两个月内完成核心基础设施。该数据库用于为 Perplexity 搜索提供网页内容支持。
Fireworks AI 在 Astra 与 DeepSeek V4.1-Flash 上运行 DeepSWE,输入 token 与输出 token 比例为 174:1,其中 99.6% 为缓存命中,缓存命中占账单的 60%。两者质量相同,但单任务成本分别为 $0.43 与 $6.52。
Gemini 3.8 Flash 在 Antigravity 上遭遇高负载,出现请求报错。官方表示正在积极修复,问题解决后将重置速率限制。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户添加 Data Plugin 并连接已有数据源后,即可把公司数据转成答案、交互式仪表盘和操作。
NVIDIA 技术博客解析 Dense 与 MoE 两类模型架构的差异:以 Nemotron 3.5 Lightning 为例,30B 参数模型通过 MoE 架构每个 token 仅激活 3B 参数,仍能利用更大模型的容量。文章对比两者的激活参数与吞吐量,并给出各自的选型时机。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需完成数千次集合通信以同步梯度;推理阶段非计划停机则会直接减少请求处理量,压缩收入。
NVIDIA 详解 Groq 3 LPX 的确定性执行如何在 NVIDIA Vera Rubin 平台上驱动高能效、高交互性推理。文章指出,功耗是 AI 工厂的核心约束,衡量 AI 平台价值的关键指标是每瓦性能而非未归一化的原始吞吐量。
mem0 推出 Gateway,为每个 AI 智能体发放一把只包含被授权工具的密钥,MCP server 与自有 API 共用同一把,任务变化时可随时调整授权,智能体始终接触不到真实凭证。该产品已进入 Beta,已有客户各通过它运行超过 95,000 次调用。
LlamaIndex 分享了借助 Stainless 为 LlamaParse 生成并维护 SDK 的经验,指出每次 API 变更都会带来更新、测试和发布成本,而代码中暴露的不一致命名与 schema 也更难被忽视。Stainless 团队已加入 Anthropic,George He 和 Yong Park 撰文回顾了做对了什么、学到了什么,以及更换 SDK 生成器为何比预想更需谨慎。
Dify 将于 9 月 18 日在悉尼与 TiDB、Eagle Cloud 共同举办 Tech Night,主题为“Scaling AI: From Prototype to Trusted Production”。
mem0 发布 Gateway,解决智能体 API key 权限过宽的问题:同一把 key 既能查支付也能退款、既能起草页面也能删除工作区,而 Gateway 让开发者只授予意图内的操作。查支付、起草页面可以,其余动作保持禁止。
Perplexity 在受支持的 HP PC 上推出 Portable Computer,这是 Computer 的本地优先版本,可用本地模型完全在设备端运行任务。该版本将私密数据留在用户机器上,且不消耗云额度。
Perplexity Computer 将预装于 HP ZBook Ultra G3a,用户可通过简单界面运行复杂的多步骤工作。Computer 智能体基于深度研究,并可连接数百种工具,其中新增 Autodesk。
NVIDIA FLARE 支持在 Docker、Kubernetes 和 Slurm 上扩展联邦学习,解决项目规模扩大后 GPU 按需分配、多个研究任务相互隔离的问题,同时让每个参与机构保留对自有数据的控制权。该方案将联邦学习的挑战从运行算法转向共享基础设施的运营。
当前 UI 设计师招聘中 10 家有 6 家以上要求 AI 技能,Vibe Coding 在大厂 JD 中出现频次极高。Vibe Coding 即指挥 AI 生成代码,能让人体验产品从零到上线的完整生命周期、认识 AI 的能力边界并积累技术框架认知。入门方式是打开 Codex、Workbuddy、豆包工作等工具,从待办管理、番茄钟等自用本地小工具做起,再部署到服务器跑通。
Linkloud 沙龙第44期将于 9 月 19 日在成都举办,主题为 Agent 如何从“能做”走向“能用”与“能卖”。SandBaseAI 创始人李样兵、VMEG.AI 创始人胥彪、Deotaland 联合创始人兼 CTO 凌星炜、Crescendia 创始人王斌将围绕 Agent 工程化、FDE 角色、海外 0 到 1、AI Agent 智能硬件与 GEO 增长展开对话。
京东一次性发布四款企业级 AI 办公产品:JD JoyWork、JoyDesk 2.0、京东百灵数字员工和研发生产力平台 JoyCode,主打从“能干活”转向“能交付结果”。其中百灵数字员工按 KPI 验收交付,客服场景使某保险客户转人工率下降 50%。这些产品已落地北京市“京办”,并服务五粮液、荣耀、雀巢等客户。
飞连将安全能力融入豆包工作的使用过程,覆盖工作成果保护、Agent 运行安全和整体 AI 办公治理。飞连可识别并保护豆包工作处理、生成的文件内容,按企业策略控制敏感数据流转,并对 Skill 下载进行检测、阻断恶意 Skill、扫描隔离本地风险文件。飞连还能从终端、网络和应用行为中持续发现 AI 资产,支持对高风险 Agent、AI 工具和 AI 网站设置访问限制。
做协作类 agent 的关键在于把 claude、codex、gemini、grok 等 10 余个 agent 拉进同一群组,在无人干预下自主分工。作者提出冗余备份分组、leader 协调监控与选举、worker 定时上报进度、checkpoint 断点恢复与幂等重入等设计,以解决 agent 罢工、leader 挂掉和任务冲突等问题,并已在 termany.sh 中实现多项策略。
Schneider Electric、Vodafone 和 monday.com 分享了规模化运营 AI 智能体的经验:Schneider Electric 建立 350 人内部 AI Hub,支撑 60 多个智能体,以可观测性、评估和部署为核心构建 LLMOps 体系。
LangChain 公开其付费媒体智能体的构建过程,该智能体常驻 Slack,每周一汇总各广告平台数据并生成报告,六个月内把付费媒体对营销管线的贡献从 0 提升到 20%,6 月至 8 月单条合格线索成本下降 30%。
2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。
具身智能初创公司芝诺机器人完成总额数亿元人民币种子轮融资,投资方包括舜宇光学、沐曦股份、网新集团、赛意产业基金等。该公司自研3B参数基础模型Zeno-1与机器人Malo,采用去中心化架构实现多机协作,据称单策略可连续运行超10分钟、完成8个子任务。芝诺机器人于2025年11月展业,预计2027年上半年启动规模化进程。
NVIDIA 在 IBC2026 为 AI for Media 合集新增 SDK、NIM 微服务、playbooks 和 blueprints,面向媒体生产场景,可用于核验素材是否由 AI 生成、制作更平滑的慢动作回放,以及为节目提供口型同步的配音翻译。
SemiAnalysis 用自研 AgentX 智能体推理基准实测 NVIDIA Vera Rubin NVL72,在 Apples to Apples TRTLLM NVFP4 Dense 配置下。
Fireworks AI 帮助 Juicebox 用定制专用模型,把数十万份人才档案的实时搜索延迟降低 80%,推理成本从每年 400 万美元降至 80 万美元。Juicebox 需要多个实时搜索智能体在数秒内完成检索。
Augment Code 将于本周四在 TheLeadDev NYC 期间举办一场半天工作坊,主题是构建你自己的软件工厂(software factory)。活动为实战性质,需通过其 luma.com 页面申请名额。
NVIDIA 工程师针对 Nemotron 3 Ultra NIM 优化了缓存、内存、并行与解码等环节,在 4 块 B200 GPU 上支持最高 2.5 倍的并发用户数,同时维持 50 TPS/user 的生成速度。官方已发布这次推理优化的工程深度解析。
NVIDIA 在技术博客中介绍如何用 Transformer Engine 加速 JAX 框架下的 Dropless MoE 训练。MoE 已成为大规模 AI 模型训练的标志性架构趋势,DeepSeek、Qwen、Mixtral 等模型以远低于稠密模型的训练算力达到甚至超越其性能,其核心在于条件计算——不再共享单一稠密 FFN。
SemiAnalysis 分析机器人与 LLM 的硬件逻辑差异:LLM 是模型先行、硬件适配,机器人则因实时控制环路和整机成本约束,硬件固定、模型去适配 Jetson 或 H100 等可量产硬件。
Bolt 发布 Bolt Forge,合作方包括 Arcee、Microsoft、Vercel、Fireworks 和 DigitalOcean,目标是推动开源权重模型达到前沿水平并提供充足 token。为庆祝上线,Bolt 向 100 人赠送免费 Bolt Pro,在评论区留言"Forge"即可通过私信领取兑换码。
Bolt 推出 Bolt Lite,定价 $9/月,包含 Forge 的 50x 用量,面向学生、周末开发者和值得上线的副业项目。邀请本周开始发放,报名将于 Oct 14 截止,加入后价格永久保持 $9。