奇舞周刊第596期:字节跳动如何用 Memory Graph 让头条抖音 OOM 崩溃率下降 50%+
字节跳动技术团队基于内存快照研发线上 Memory Graph 方案,还原对象引用关系、识别异常内存来源并辅助归因,落地三个月内使头条和抖音的 OOM 崩溃率下降超过 50%。该方案针对 iOS 应用因内存占用过高被系统终止、却缺乏普通崩溃日志的定位难题。滴滴则复盘了 HDFS 从 2.7 滚动升级至 3.2 的完整实践,在不中断业务的前提下完成长期升级。
字节跳动技术团队基于内存快照研发线上 Memory Graph 方案,还原对象引用关系、识别异常内存来源并辅助归因,落地三个月内使头条和抖音的 OOM 崩溃率下降超过 50%。该方案针对 iOS 应用因内存占用过高被系统终止、却缺乏普通崩溃日志的定位难题。滴滴则复盘了 HDFS 从 2.7 滚动升级至 3.2 的完整实践,在不中断业务的前提下完成长期升级。
Anaconda 提出"默认安全"的 AI 编程智能体构建思路,用于保障 Python 数据科学与机器学习场景下的软件供应链安全与企业级 AI 基础设施。该公司定位为 Python 数据科学与机器学习的基础平台,提供安全的软件供应链治理能力。
Next.js 团队在约三周内关闭了 1,462 个 GitHub issue,把积压从 2026 年 8 月 10 日的 2,244 降到 9 月 4 日的 995,期间还新增 218 条报告。
淘宝百亿补贴团队上线 bybt-data-analysis-assistant 数据分析智能体,用自然语言提问即可完成找表、写 SQL、执行到深度归因的全流程。
NVIDIA 技术博客解析如何让用户身份跨越联邦 Kubernetes 集群与 AI 平台边界:用户从中央门户打开受治理数据集、启动 notebook 并调用另一集群中的助手服务,身份每步都要穿越控制面与数据面,传统单点登录在此失效。
YOLO Mode 指 AI 智能体自动批准所有操作、不再弹出确认提示,Claude Code 的对应开关是 --dangerously-skip-permissions,Codex CLI 为 --full-auto,Gemini CLI 用 --yolo,GitHub Copilot CLI 为 --allow-all,Cursor 则在设置中提供 auto-run。
一套 Wispr Flow + Claude 工作流把语音碎念转成结构化数据:先用 Wispr Flow 把会议或灵感口述进 Apple 备忘录,同步到 Mac 后由定时的 Claude 任务在夜间读取,次日早晨在 Notion 中整理出关键想法、行动项,并在 GCal 里自动排好深度工作时段。作者称其收益是承诺的跟进事项被标出、半成型的想法得到结构化,全年想法也变成可搜索的日志。
小红书与 vivo 联合打通从相册生成到社交发布的完整 3D 内容链路,双方共同设计移动社交场景 3D 内容格式,将原始产物压缩至约 4MB。
快手电商商家与运营赋能中心构建了覆盖需求、Spec、Dev、Test、Oncall 全生命周期的自动化交付流水线(Harness Engineering),目标需求吞吐率提升 30%、平均交付时长下降 40%。
Stanford 今年秋季首次开设 CS329Z「Engineering AI Agents」课程,由 Diyi Yang、Michael Ryan、Jyang Ballin 授课,内容为从零构建 AI 智能体。课程为首次在 Stanford 开课。
Dify 发布新手指南,教用户从一个目标出发,通过与 Dify 对话逐步搭建出可用的 Agent,并演示如何在过程中持续调整它。官方同时提供了指南全文和用于构建首个 Agent 的入口 cloud.dify.ai。
在电脑上运行 Grok Bot 后,该机器会变成一台主机,可以从手机访问。用户能在手机上让 Grok Bot 在自己的电脑上执行操作。
因重度使用 Grok Bot,即使额度刚被重置,一晚用量仍掉了 52%。作者此前已在某个 Bot 中接入 DeepSeek API 与智谱 Coding Plan,于是让分身把各 Bot 的大部分工作切换到智谱 Coding Plan 中的 GLM-5.3-Flash,切换成功。
Dify 发布指南,教你从一个目标出发,通过与 Dify 对话逐步构建出可用的 Agent,并在过程中持续调整优化。用户可按照该指南完成首个 Agent 的搭建,也可直接通过 cloud.dify.ai 开始构建。
AI产品黄叔指出,群聊若每2小时自动讨论一遍、且每次 bot 都读历史内容,会非常消耗用量,昨晚仅 grokbot 网站更新的抓取和上站就吃掉了 44% 的用量。其分享的玩法是训练一个黄叔分身,只给它安排活,它会自己去群里 @ 其他 bot、完成工作后直接汇报,类似董事长布置工作、总经理组织人员后回报。相关 GrokBot 玩法全景手册已开源,页面由图中的 Bot 协作自动更新。
NVIDIA 用一篇实战教程演示如何借助 Compute Sanitizer、CCCL API、NVTX、CUB、池化容器、pinned 内存和每线程独立 stream,分六步优化一条 RGB 转灰度并求 32×32 分块中值的 CUDA 图像处理流水线。每步只需少量代码改动,即可让示例更安全、易维护且更快,配套代码支持在 Google Colab 上运行。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,介绍如何用投机解码在保持准确率的前提下加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的 5 条准则。
Giles Edwards-Alexander 记录了一个团队意外触发一队 AI 智能体,让它们在 git 仓库内自发搭起一套黑板协调系统。该案例发布在 martinfowler.com。
Grok Bot 被训练成"黄叔分身"后,只需给它安排任务,它就会自己到群里 @ 其他 bot 组织协作,完成后直接向用户汇报,像董事长给总经理派活。配套的 GrokBot 玩法全景手册已开源,由图中 Bot 协作自动更新。
作者发布开源的 SBX AI Evaluation Kit,一个基于 Docker Sandboxes 的 Mixin Kit,用于让 AI 评测工作流更容易重跑、检查和对比。
得物小摊从 0 到 1 孵化中由一人同时负责 H5、运营后台、Node 网关和 Go 服务,AI 并行参与多模块后,作者把重点从写 Prompt 转向 Delivery Harness,用 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件接管交付状态。
名为 grokbot.aihuangshu.com 的网站已实现用 Grok Bot 自动更新,每日新案例在顶部呈现,方便查看 Grok Bot 的最新变化。
Kling 发布教程,讲解如何在 Kling MCP 中使用 Elements 功能,在不同镜头之间保持角色身份一致,从而生成更具连贯性的 AI 故事。该教程以视频形式呈现,发布于 Kling AI 官方账号。
Anthropic 的 Claude 博客发布电商 AI 智能体解剖指南,基于与零售商、电商平台及旅游、娱乐、电信团队的落地合作,主张在标准智能体循环中运行单一模型,用技能承载长尾需求而非拆分多个子智能体。
NVIDIA 发布基于 Nemotron 构建自适应智能体网络安全系统的方案,用于应对现有告警、预定义工作流和已知攻击行为难以覆盖的防御盲区。该系统让智能体跨安全运营环节协同工作、在长周期内追求复杂目标,重点识别防御遗漏并将缺口转化为改进方向。
Visual Studio 支持在 IDE 内直接查看和审查 GitHub PR:通过 Git → GitHub → View Pull Requests 打开列表,PR 按分配给我、仓库全部以及 Copilot 代为创建三类分组。
NVIDIA 技术博客解析如何为 AI 推理负载合理规划 GPU 资源并优化总拥有成本(TCO),避免超支。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让企业难以确定 GPU 规模,需在推理需求与成本之间找到平衡。
MCP 于 2026 年 7 月 28 日发布其发布以来最大的一次修订,协议核心改为无状态:initialize 握手和 Mcp-Session-Id 头被移除,每个请求自带协议版本与客户端上下文,首个消息即可直接发起工具调用,任一 server 实例都能响应。
Qdrant 公开了面向生产环境的向量搜索基准、数据集与 Supernova 代码,目标场景是数十亿向量、数千 RPS 且尾部延迟紧张,现有公开基准无法覆盖。数据集已托管在 HuggingFace,代码以 qdrant-labs/supernova 开源,配套说明见官方博客。
Agent“忘事”的根因在于记忆并非模型原生能力,而是应用层围绕上下文构建的工程系统,核心问题是每轮请求该把哪些历史信息带给模型。文章将记忆分为工作记忆、情节记忆、语义记忆和过程记忆四层,对应上下文、文档库与向量索引、KV/关系库、版本化配置等不同载体,并比较截断滑动窗口、滚动摘要、RAG 式记忆、事实抽取、知识图谱与主动调页等实现方式。
Bolt 官方给出了一段重构提示词,让 Bolt 及其他编码智能体在不改变 App 行为的前提下逐步清理代码,同样的按钮、同样的行为,底层更整洁。提示词按一次一步的方式执行,以降低重构风险。
作者基于 dsh 0.1.1-rc.2 的源码阅读与试用,分析了 DeepSeek Harness 的两个特殊模式:PTC 模式让模型写一段程序组合已有工具,把原本五次的模型往返压成一次;创造模式允许模型在运行中提交插件、动态注册和撤销工具。
有用户发现 Grok Bot 的云端资源可用来批量提取视频截图和文案,处理完再把结果存到本地,全程只需三次交互。他此前用 Zcode 配合 GLM 5.3 Flash 蹭周末赠送的 3 亿 Token,但会占用 Mac 的内存和硬盘、速度慢,还一度导致电脑重启两三次。Grok Bot 提供 8 核、16G 内存、126G 硬盘的云端环境,并支持开启多线程处理。
得物技术两位司龄5年的校招生海狸(Hayley)和骅征(huazheng)分享了各自的成长经历。海狸在交易平台做后端开发,参与AI导购项目,经历了方案多次调整与反复试错;骅征在国际技术做后端开发,参与香港仓寄售、日本开仓、美国自建站等项目,并在国际火山云多云迁移中将RT涨幅控制在10-13毫秒,实现用户无感知的平稳迁移。
AI 博主宝玉在腾讯内部用自己做三年的字幕翻译 App 串起 AI 产品全流程:找需求看模型能力边界,同一提示词在模型具备检索能力后从无人问津到 Google CEO 致谢。他把成本优化做到调用从 33 次降至 12 次、单集处理从 31 分钟降至 18 分钟,并提出以终为始重设计、把 App 做成 Agent 插件的三条准则。
Mind Lab 研究员逯雨鑫以个人开发者身份,用 2 周和数百美元后训练出两个小模型,两次登顶 Hugging Face Model Trending 榜首。他没有 AI Lab 经历,也非 AI PhD,走的是蒸馏与 SFT 路线,认为最大卡点是数据和 Capacity Gap。他同时讨论了主权 AI、Personal Intelligence 与 Local AI 的普及门槛。
Qdrant 支持把 dense vectors、HNSW 图、量化向量和 payload 分别放到 Pinned、Cached、Cold 三种内存层级,Dense vectors 和 payload 无法 pinned。
黄叔计划把孙割昨晚的爆款小作文融入自己的 Agent 自动化内容工厂,用于在原有选题雷达、素材归类、初稿生成、直播精剪、中视频改写等环节上增加热点判断。他强调热点只是辅助、专业内容才是基础,Agent 是增强而非取代自己,并将在今晚直播分享该工作流,回放仅面向 Agent 社群付费会员。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
Claude 博文《How Warp builds self-improving agents on Claude》介绍了终端工具 Warp 的内部实践:让 Agent 做代码审查时,问题不在于能力而在于缺少项目规范和历史经验的记忆,手动改系统提示词、完善 AGENTS.md 效果都不理想。