小度如何用 Agent 研发闭环把需求吞吐量提升 6 倍
小度 AI 智能助手团队以信息类 Bot Aries 为试点,打通从 bad case 发现、归因到上线解决的 Agent 研发闭环,主张“不确定的交给 Agent,确定的交给代码,不可逆的交给人”。
小度 AI 智能助手团队以信息类 Bot Aries 为试点,打通从 bad case 发现、归因到上线解决的 Agent 研发闭环,主张“不确定的交给 Agent,确定的交给代码,不可逆的交给人”。
LibTV 上线 Seedance 2.5 实测体验,火山引擎底层生成模型负责画面质感与动作逻辑,720p 限时 58 折、低至 0.4 元/秒,最高送 60 条免费生成。平台侧新增 AutoLink 多素材智能引用、片段重拍、逐帧拉片和 iOS 风格 TVC 等 Skill,所有生成任务带独立 taskid 可追溯消耗明细。
企业 AI 落地的竞争焦点正从模型能力转向企业上下文,真正需要的是能持续接入、加工、治理、调用知识的知识引擎,而非只存文件的传统知识库。文章给出八个自查问题,并拆解知识引擎的五项核心能力:知识接入、知识工程、知识治理、知识应用与反馈优化。文中指出,RAG 只是知识应用链路中的一个技术环节,Agent 时代对可信、可追溯、带权限的企业上下文需求更强。
在 Qdrant 集合中,重复点占据 top-5 结果槽位会拖垮回答质量:把 8,416 个独立点重复写入至 22,946 个点后,37 个测试问题中有 36 个 top-5 含重复,去重后降至 2 个,回答正确率从 0.57 升到 0.76。
Agent Infra 创业公司 Runta 刚完成由 a16z 投资的 2000 万美元 Seed 轮,Jeff Dean、李飞飞以个人天使身份参与。创始人戴冠兰认为模型能力已经够了,下一场竞争在 infra:未来 agent 数量会超过人类,关键问题变成它们跑在哪、怎么管、出事谁负责。他同时提到 token maxxing 在半年内转向 token minimizing。
Milvus 指出 AI 智能体答错时问题常出在检索层——系统取错上下文、漏掉正确内容或在 LLM 看到前就过滤掉了。Simon Hearne 的分享用可视化方式讲解向量搜索,覆盖暴力搜索、IVF、HNSW、DiskANN 的取舍,量化对速度与存储的影响,以及过滤器可能切断最佳匹配路径。他建议直接用 recall@k、分数分布和过滤命中率调试检索,把索引和嵌入向量的改动当作质量改动。
v0 新增 Usage & Activity Dashboard,可按天追踪 credit 消耗,按成员或项目分析活动,并按日期、模型和成本下钻查看每条消息,入口位于 Settings → Usage & Activity。
Jeff Dean 在 YC 现场访谈中提出 AI 正从预测工具演变为可运行数天至数周的长期智能体,并预测 2027 年 ML 系统本身将实现大幅自动化,通过自动拆解问题与实验循环产出更优系统。
Milvus 3.0 引入 lake-native External Collections,并支持分组、分面、排序、过滤和聚合等更丰富的检索能力,让 Milvus 可直接处理数据所在位置的数据。这使应用对检索的控制不再局限于语义相似度,但也带来嵌入向量存放位置、混合搜索调优、过滤对召回与延迟权衡等问题,Milvus 为此开设 Office Hours,提供 20 分钟 1:1 专家咨询。
Qdrant 不采用前置过滤或后置过滤,而是让过滤在 HNSW 图遍历过程中原地执行,并由查询规划器按每次查询在可过滤 HNSW、开启 ACORN、直接走 payload 索引和全量扫描四条路径中选择。文中基准显示,宽值过滤会把召回率降到 90.8%,两个宽值的 AND 过滤降到 39.7%,而其他过滤形态均高于 97%;这两种失效形态在开启 ACORN 后恢复到 100%。
Qdrant 在百万点 deep-image-96 基准上测试了四种过滤向量搜索策略:普通 HNSW 在 1% 选择性过滤下 Recall@10 仅 0.1%。
Cursor Router 每周基于数百万次产品内用户交互持续改进,通过对请求进行智能分类与路由,按任务类型降低延迟并削减成本。
Milvus 3.0 引入 lake-native External Collection 以及 grouping、faceting、sorting、aggregation 等结构化查询,让向量数据库更贴近团队已有的数据系统。
Weaviate 数据库现可直接说 MCP,Claude Code、Cursor、VS Code 等兼容客户端无需单独运行 MCP 服务,直接连接与 REST API 同端口的 `/v1/mcp`。
Vercel 在 Next.js 16.3 中引入即时导航能力,并将其应用于自家全栈编码平台 v0,使登录与未登录首页、会话详情页和设置下各子页面从阻塞变为即时。
v0 宣布新 API 正式上线,官方列出三类用法:搭建自己的应用构建器、让 Agent 具备构建和部署应用的能力、通过脚本或 CI 任务生成应用。推文附有详情链接 v0.link/v0api。
Milvus 3.0 支持在线 schema 演进与回填,团队可在集合持续服务流量时增删字段,无需停机重建或安排迁移窗口。新增字段只创建可空列、不重写既有数据,删除字段则在运行时更新集合元数据,两项操作都只更新 collection manifest。回填方面,Milvus 3.0 支持内联回填,可直接从文本字段生成 BM25 稀疏向量,外部回填(如用 Spark 计算新列值再写回)已在路线图中。
xAI 前推理团队负责人、开源推理引擎 SGLang 发起人盛颖离开 xAI,联合创立 RadixArk,原因是 SGLang 社区快速扩张后仅靠开发者业余时间维护已无法支撑项目继续向前。她曾在早期 xAI 参与搭建生产级推理系统,并称那段时间同时拥有 "support" 和 "freedom"。
腾讯混元 Hy3 已上线 WorkBuddy 全球版,面向全球用户免费开放至 2026 年 8 月 31 日(PT)。用户可在智能体 AI 工作区中完成研究、数据分析、文档与演示文稿创建以及职场沟通,无需配置。Hy3 同时可通过腾讯设计 Miora 和腾讯云 TokenHub 使用,试用入口为 workbuddy.ai。
FDE(前线部署工程师)成为 AI 行业爆火新职业,OpenAI、Anthropic、AWS 等公司争抢相关人才,一年内招聘增长约 7 倍。FDE 需把 AI 能力带进真实业务流程,搭建可运行的工作流并将一线经验反哺产品。国内 FDE 月薪大多 2–5 万,顶尖可达 8 万,硅谷以 mini CTO 标准招人但薪水未必匹配。
Qdrant 1.19.0 发布,新增 Turbo4 数据类型,仅保留 4-bit TurboQuant 压缩表示、不保存全精度副本,存储相比 36 bits/坐标降至 4 bits,减少九倍。
Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。
Milvus 3.0 推出 Collection Snapshot 和 Spark connector,为持续变化的 AI 数据提供一致的只读视图与分布式批处理能力。
Weaviate 指出,导入返回 HTTP 200 不代表校验结束,单个对象仍会因限流、向量化器报错或 schema 不匹配而失败。其建议的弹性导入流程包括流式传输数据、由服务端处理批处理与背压、用稳定源键生成确定性 UUID、只重试失败对象,以及记录检查点并将反复失败的对象送入死信队列。确定性 ID 可让重试具备幂等性,避免重复创建对象。
ShipAny Image Lite 图片站模板上线,核心功能为 AI image generator 加落地页,主打极速上线。该模板采用扁平化设计,访问地址为 shipany.ai/zh/templates/i…
Modal 已完成所有 Functions 向新区域化 I/O 平面的迁移,Function Call 端到端延迟在 p50 下降约 80ms。此前所有输入输出都要绕经 us-east 的 I/O 服务器,可能给每次调用增加最多几百毫秒网络延迟。新 I/O 平面覆盖至少 4 个区域,可通过 routing_region 标志指定路由区域,服务端已用 Go 重写。
Elastic 9.5 正式 GA,为 Elasticsearch 引入列式存储 Columnar Mode 技术预览、开箱即用的 VectorDB 索引模式与自动校准,并原生支持 Prometheus 和 PromQL。
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。
Microsoft Research 推出开源框架 Orchard,供研究社区跨任务类型训练和评估 AI 智能体,通过复用同一套基础设施降低复杂度,并帮助较小模型保持强劲表现。
v0 上线 v0.app/docs/api/v2 文档页面,供开发者查阅其 API v2 的使用方式。该消息由 v0 官方账号发布,原文未披露更多细节。
v0 发布新的 v0 API,将其应用构建能力开放为程序化访问。该 API 支持从提示词、代码仓库或 ZIP 包发起对话,渲染 dev server 预览,发送后续消息,并部署到 Vercel。
Google 展示了如何用其生态构建并部署 AI 原生应用,相关演示面向 Build with Gemini @XPrize Hackathon,该活动持续至 8 月 17 日。视频内容聚焦于创意规划完成后的应用搭建与上线环节。
Next.js 16.3 正式发布,Turbopack 在 next dev 下最高减少 90% 内存占用,磁盘缓存默认启用于 next build,部分项目 CI 构建提速 5.5 倍,App Router 改用原生 Node.js 流后负载下请求处理量提升 22%。
Milvus 3.0 引入低成本、时间点、只读的集合快照,解决持续变化的生产数据与稳定离线计算之间的冲突。快照通过引用已有数据、索引和元数据文件而非复制全量数据集来降低开销,支持 A/B 评测、去重、回填验证和离线测试等隔离批处理流程,并通过对象存储服务端复制加速数据恢复与克隆。
mem0 把向量搜索延迟降低 70 倍,从 8–14 秒降到约 110–120 ms,关键在于将向量搜索迁移到 turbopuffer,让 Postgres 专注其擅长的事。这一改动面向构建 AI 智能体记忆基础设施的开发者。
Genspark 开源 GenOffice,称其为面向 PC 和 Mac 的首个全功能开源 AI Office,免费且无广告,包含 Docs、Sheets、Slides 和 PDF 等编辑工具。
Agent Infra 的机会正沿两条主线展开:提高 Agent 可控性与拓展能力边界,其中 Runtime、Identity、Eval 负责可控性,Search、Payment、Context 负责能力拓展。
播客节目结合团队近几个月使用经验,讨论 OpenClaw 能否真正进入实际工作,而非又一个需要折腾的新工具。节目指出接入 IM 是 OpenClaw 与普通 AI 客户端的重要差异,Memory 和 Skill 让它有持续演化的可能;但没有结构化数据,它只是另一个聊天机器人,且目前还不能替代员工。
前端开发者 Tapir 借助 Codex 在 ESP32-S3 开发板 LILYGO T-Embed 上做出名为 CadenzaOS 的操作系统,随后尝试让 AI 用 kicad-happy 画 PCB,却在嘉立创 SMT 环节因大量报错崩溃。他退回做 PCB Art 艺术板跑通闭环,并新开项目 PCB Atelier,可像 PS 一样操作图层并导出嘉立创 EDA 工程直接下单。
企业Agent的有效性被拆解为大模型能力、企业上下文、工具能力与治理评测四者相乘,其中企业上下文被视为最难被复制、也最可能拉开差距的差异。企业上下文分为规则、事实、经验、任务、组织与用户五类,需按任务动态装配最小充分上下文,而非把文件一股脑塞给模型。作者认为,企业Agent的竞争最终是知识管理、流程与组织治理能力的竞争。