对话 AppLovin 技术 VP 葛小川:2 年市值增长 25 倍,千亿美金广告平台的传奇成长史
AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。
AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。
Cursor 发布 0.50 版本,推出新的标签页模型并预览后台 agent,新标签页模型在跳转方面有大幅提升,用户可在 Cursor 的远程副本中立即与 agent 交互。该版本还带来 1M+ 上下文的窗口。
作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。
有开发者公开致谢 turbopuffer 提供的真正无服务器向量搜索,并透露其团队已用 aurora limitless 处理元数据,目前承载超过 1M txn/s。两条信息均指向 AWS 生态下的无服务器基础设施组合。
LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。
Elastic 在 9.0 版本中弃用 App Search 与 Workplace Search,两项产品在最新 8.x 版本中仍可用,并将在 EOL 公告后继续支持 27 个月。
Eugene Yan 与 Chip 受邀在 NVIDIA GTC 2025 的"构建 LLM 应用的经验与教训"圆桌论坛上分享。录像已在 NVIDIA GTC 参会者门户上线,需登录观看,并将在 NVIDIA On-Demand 面向公众开放。
工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。
这期播客回顾了扎克伯格从10岁开始编程、高中写出价值100万美元音乐播放器,到创立Facebook的全过程,并梳理了股权稀释、肖恩·帕克与彼得·蒂尔入局、收购Instagram和WhatsApp等关键节点。节目还讨论了信息流广告、假新闻、美国大选中的信息操控,以及扎克伯格转向元宇宙和人工智能的新赛道。
DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。
Next.js 官方博客发布《Building APIs with Next.js》指南,介绍如何用 Next.js 构建 API,正文仅给出学习该主题的说明,未披露具体版本、接口或代码细节。
DeepSeek 在开源周第 5 天发布 Fire-Flyer File System(3FS),一个利用现代 SSD 和 RDMA 网络全带宽的并行文件系统。
Next.js 15.2 带来重新设计的错误界面与更清晰的堆栈追踪,并加入流式 metadata,让 generateMetadata 未完成时也能先发送初始 UI。Turbopack 编译时间最高提升 57.6%,vercel.com 本地开发内存占用下降 30%,同时实验性支持 React View Transitions 和 Node.js Middleware。
DeepSeek 在 OpenSourceWeek 第 3 天发布 DeepGEMM,一个支持稠密和 MoE GEMM 的 FP8 GEMM 库,已用于 V3/R1 的训练与推理。
DeepSeek 在开源周第二天发布 DeepEP,这是首个面向 MoE 模型训练与推理的开源 EP 通信库。它提供优化的 all-to-all 通信,支持 NVLink 与 RDMA 的节点内和节点间通信,并包含面向训练与推理预填充的高吞吐 kernel、面向推理解码的低延迟 kernel、原生 FP8 dispatch 支持,以及用于计算通信重叠的灵活 GPU 资源控制。
DeepSeek 在开源周第一天发布 FlashMLA,这是面向 Hopper GPU 的高效 MLA 解码内核,针对可变长度序列优化并已投入生产使用。它支持 BF16 和 Paged KV cache(block size 64),在 H800 上达到内存受限 3000 GB/s、计算受限 580 TFLOPS,代码已在 GitHub 开源。
DeepSeek 为部署 DeepSeek-R1 给出推荐设置:不使用 system prompt,Temperature 设为 0.6,并公布搜索与文件上传的官方提示词及缓解模型绕过思考的指南。官方部署与开源版本运行同一模型,可获得完整的 DeepSeek-R1 体验。
Next.js 详解可组合缓存机制,核心是 'use cache' 这一 API 设计,用于在应用中实现可组合的缓存策略。文章介绍了该 API 的设计思路及其带来的优势。
Eugene Yan 的 2024 年度回顾显示,他今年把 2023 年的原型推向生产,交付了服务客户的 ML/LLM 系统,并发布了 AlignEval,用户已上传 538 个数据集文件、其中 84 个文件标注 50 条以上样本并优化了 LLM-evaluator。
OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。
Eugene Yan 整理了 2024 年机器学习会议笔记,归纳出 39 条构建机器学习系统的经验,涵盖奖励函数设计、评估框架、数据飞轮与规模化生产等主题。他指出,评估体系正在成为团队的差异化护城河,而数据本身不是竞争优势,能更快转动数据飞轮的一方才会赢。在规模化方面,他引用 Will Larson 的观点:最贵的 LLM 对 B2B 来说不算贵,最便宜的 LLM 对 C 端来说也不算便宜。
Eugene Yan 推出 AlignEval,一个把搭建 LLM-evaluator 简化为上传 CSV、二分类标注、编写评估标准、用 dev-test 切分优化四步的应用,已集成 LangSmith。它主张先从数据出发而非预设标准,避免不可达或无关的评估准则,支持 gpt-4o-mini 与 claude-3-haiku,标注 20 条后可解锁评估模式。
Next.js 官方博客回顾了 Next.js App Router 的缓存演进历程,梳理了其缓存机制的设计思路与实践经验。
OpenAI 发布文章,讲解如何将 AI 投入实际工作,以自动化并扩展财务运营。文章聚焦财务流程的自动化与规模化落地。
OpenAI 基于数百次成功部署经验,总结了让 AI 真正投入工作的方法。内容面向企业落地场景,但正文未披露具体模型、版本或部署数据。
为比较 FastAPI、FastHTML、Next.js 和 SvelteKit,作者用每个框架各写了一个「Look at Your Data」应用,实现 CSV 上传建表、浏览、改字段、删行、下载的完整 CRUD。
Elastic 正式发布 Support Assistant,面向所有拥有试用或正式订阅的客户及试用用户在 Support Hub 上线,提供覆盖全部 Elastic 产品的生成式 AI 聊天问答。该工具基于检索增强(RAG)架构,可访问 Elastic 博客、114 个主次版本的产品文档、技术支持文章与入门指南,无需依赖部署版本或订阅等级;Elastic 内部已有 200 多名员工每日使用。
Elastic 携手 Google Cloud 和 Kyndryl 打造覆盖 SAP 环境的全栈可观测体验,通过 Kibana 呈现从裸金属到业务流程的四层视图。方案以 Elastic Agent 统一采集日志、指标和追踪数据,并支持 Google Cloud 多项服务的日志流,Google Cloud 的 Agent for SAP 则负责采集 SAP Host Agent 指标与进程监控指标。
经过一年构建 LLM 应用的实践,经验覆盖从战术细节、日常运营到长期业务战略三个层面。
Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。
机器学习代码学的是逻辑而非包含逻辑,因此单元测试不应像普通软件那样 mock 模型。建议用小型内联样本数据、随机或空权重测试输出形状与设备迁移,并对真实模型保留损失下降、过拟合、输出语义等关键测试并标记为 slow。
Next.js 官方发文说明 App Router 中 React Server Components(RSC)的安全思路,重点防范意外数据暴露,并给出三种数据处理模型:HTTP APIs 适合已有大型项目、Data Access Layer 适合新项目、组件级数据访问仅适合原型开发。
Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。
Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。
开发者用 Raspberry Pico 加 e-ink 屏幕做了 raspberry-llm,通过调用第三方 LLM API 读取 WSJ 和 HackerNews RSS 内容并生成文本,最初用来做押韵时钟。
机器学习项目可通过四种机制提升成功率:为每个项目配备 pilot 与 copilot,后者每投入约 10% 工时做评审,及早发现训练数据错误、train-validation split 无效等致命问题;项目启动先做文献综述,重点关注问题如何被框定、输入数据处理与离线评估;在拿到初始实验结果后开展方法论评审,排查数据泄漏、时间切分等问题;并对各项目阶段和任务做时间盒约束。
大型 Transformer 模型推理受限于巨大显存占用与难以并行:KV cache 在 batch size 512、上下文长度 2048 时可达 3TB,是模型体积的 3 倍,且注意力计算随输入长度呈平方增长。文章梳理并行化、内存卸载、智能批处理、剪枝、量化、知识蒸馏及注意力层架构改造等推理加速路径,并详解知识蒸馏与量化方法。
Lilian Weng 撰文系统梳理在多 GPU 上训练超大模型的并行范式,包括数据并行、模型并行、流水线并行与张量并行,并对比 GPipe、PipeDream、Megatron-LM 与 PTD-P 等方案。