跳到正文

#部署/工程

今日 0 条
4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

4月15日周二
  1. Elastic BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 宣布 App Search 与 Workplace Search 独立产品在 9.0 版本中弃用

    Elastic 在 9.0 版本中弃用 App Search 与 Workplace Search,两项产品在最新 8.x 版本中仍可用,并将在 EOL 公告后继续支持 27 个月。

3月18日周二
  1. Eugene YanAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA GTC 2025:构建 LLM 应用的洞见与经验

    Eugene Yan 与 Chip 受邀在 NVIDIA GTC 2025 的"构建 LLM 应用的经验与教训"圆桌论坛上分享。录像已在 NVIDIA GTC 参会者门户上线,需登录观看,并将在 NVIDIA On-Demand 面向公众开放。

3月16日周日
  1. Eugene YanAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 LLM 时代改进推荐系统与搜索:架构、数据与统一框架

    工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。

3月13日周四
  1. 保持偏见AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据之王扎克伯格:操控世界的程序员

    这期播客回顾了扎克伯格从10岁开始编程、高中写出价值100万美元音乐播放器,到创立Facebook的全过程,并梳理了股权稀释、肖恩·帕克与彼得·蒂尔入局、收购Instagram和WhatsApp等关键节点。节目还讨论了信息流广告、假新闻、美国大选中的信息操控,以及扎克伯格转向元宇宙和人工智能的新赛道。

3月1日周六
  1. DeepSeek(@deepseek_ai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V3/R1 推理系统概览

    DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。

2月28日周五
  1. Next.js BlogAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Next.js 构建 API

    Next.js 官方博客发布《Building APIs with Next.js》指南,介绍如何用 Next.js 构建 API,正文仅给出学习该主题的说明,未披露具体版本、接口或代码细节。

  2. DeepSeek(@deepseek_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 开源并行文件系统 3FS 与数据处理框架 Smallpond

    DeepSeek 在开源周第 5 天发布 Fire-Flyer File System(3FS),一个利用现代 SSD 和 RDMA 网络全带宽的并行文件系统。

2月27日周四
  1. Next.js BlogAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 15.2 发布:错误调试界面重做、Turbopack 编译提速 57.6%

    Next.js 15.2 带来重新设计的错误界面与更清晰的堆栈追踪,并加入流式 metadata,让 generateMetadata 未完成时也能先发送初始 UI。Turbopack 编译时间最高提升 57.6%,vercel.com 本地开发内存占用下降 30%,同时实验性支持 React View Transitions 和 Node.js Middleware。

2月26日周三
  1. DeepSeek(@deepseek_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 开源 FP8 GEMM 库 DeepGEMM,支持稠密与 MoE 布局

    DeepSeek 在 OpenSourceWeek 第 3 天发布 DeepGEMM,一个支持稠密和 MoE GEMM 的 FP8 GEMM 库,已用于 V3/R1 的训练与推理。

2月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 开源 MoE 通信库 DeepEP

    DeepSeek 在开源周第二天发布 DeepEP,这是首个面向 MoE 模型训练与推理的开源 EP 通信库。它提供优化的 all-to-all 通信,支持 NVLink 与 RDMA 的节点内和节点间通信,并包含面向训练与推理预填充的高吞吐 kernel、面向推理解码的低延迟 kernel、原生 FP8 dispatch 支持,以及用于计算通信重叠的灵活 GPU 资源控制。

2月24日周一
  1. DeepSeek(@deepseek_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 开源 FlashMLA:面向 Hopper GPU 的 MLA 解码内核

    DeepSeek 在开源周第一天发布 FlashMLA,这是面向 Hopper GPU 的高效 MLA 解码内核,针对可变长度序列优化并已投入生产使用。它支持 BF16 和 Paged KV cache(block size 64),在 H800 上达到内存受限 3000 GB/s、计算受限 580 TFLOPS,代码已在 GitHub 开源。

2月14日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 公布 DeepSeek-R1 部署推荐设置:无 system prompt、Temperature 0.6

    DeepSeek 为部署 DeepSeek-R1 给出推荐设置:不使用 system prompt,Temperature 设为 0.6,并公布搜索与文件上传的官方提示词及缓解模型绕过思考的指南。官方部署与开源版本运行同一模型,可获得完整的 DeepSeek-R1 体验。

1月3日周五
  1. Next.js BlogAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 可组合缓存:use cache 的 API 设计与优势

    Next.js 详解可组合缓存机制,核心是 'use cache' 这一 API 设计,用于在应用中实现可组合的缓存策略。文章介绍了该 API 的设计思路及其带来的优势。

12月22日周日
  1. Eugene YanAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2024 年度回顾:LLM 系统投产、AlignEval 与健康改善

    Eugene Yan 的 2024 年度回顾显示,他今年把 2023 年的原型推向生产,交付了服务客户的 ML/LLM 系统,并发布了 AlignEval,用户已上传 538 个数据集文件、其中 84 个文件标注 50 条以上样本并优化了 LLM-evaluator。

12月17日周二
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直播回放:什么是开发大模型应用的新一代底层技术栈?对谈贾扬清、PingCAP 黄东旭和 AWS Bedrock 核心成员

    OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。

11月3日周日
  1. Eugene YanAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 39 条机器学习系统构建、扩展与执行经验

    Eugene Yan 整理了 2024 年机器学习会议笔记,归纳出 39 条构建机器学习系统的经验,涵盖奖励函数设计、评估框架、数据飞轮与规模化生产等主题。他指出,评估体系正在成为团队的差异化护城河,而数据本身不是竞争优势,能更快转动数据飞轮的一方才会赢。在规模化方面,他引用 Will Larson 的观点:最贵的 LLM 对 B2B 来说不算贵,最便宜的 LLM 对 C 端来说也不算便宜。

10月27日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AlignEval:让 LLM 评估器搭建更简单、自动化的应用

    Eugene Yan 推出 AlignEval,一个把搭建 LLM-evaluator 简化为上传 CSV、二分类标注、编写评估标准、用 dev-test 切分优化四步的应用,已集成 LangSmith。它主张先从数据出发而非预设标准,避免不可达或无关的评估准则,支持 gpt-4o-mini 与 claude-3-haiku,标注 20 条后可解锁评估模式。

10月24日周四
  1. Next.js BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js App Router 的缓存探索之路

    Next.js 官方博客回顾了 Next.js App Router 的缓存演进历程,梳理了其缓存机制的设计思路与实践经验。

9月30日周一
  1. OpenAI NewsAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 如何用 AI 自动化并扩展财务运营

    OpenAI 发布文章,讲解如何将 AI 投入实际工作,以自动化并扩展财务运营。文章聚焦财务流程的自动化与规模化落地。

9月10日周二
  1. OpenAI NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 分享数百次成功部署经验:如何让 AI 真正投入工作

    OpenAI 基于数百次成功部署经验,总结了让 AI 真正投入工作的方法。内容面向企业落地场景,但正文未披露具体模型、版本或部署数据。

9月8日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 FastAPI、FastHTML、Next.js 和 SvelteKit 构建同一个 Web 应用

    为比较 FastAPI、FastHTML、Next.js 和 SvelteKit,作者用每个框架各写了一个「Look at Your Data」应用,实现 CSV 上传建表、浏览、改字段、删行、下载的完整 CRUD。

9月4日周三
  1. Elastic BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 推出生成式 AI 客服工具 Support Assistant

    Elastic 正式发布 Support Assistant,面向所有拥有试用或正式订阅的客户及试用用户在 Support Hub 上线,提供覆盖全部 Elastic 产品的生成式 AI 聊天问答。该工具基于检索增强(RAG)架构,可访问 Elastic 博客、114 个主次版本的产品文档、技术支持文章与入门指南,无需依赖部署版本或订阅等级;Elastic 内部已有 200 多名员工每日使用。

7月8日周一
  1. Elastic BlogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 联合 Google Cloud 与 Kyndryl 推出 SAP 全栈可观测方案

    Elastic 携手 Google Cloud 和 Kyndryl 打造覆盖 SAP 环境的全栈可观测体验,通过 Kibana 呈现从裸金属到业务流程的四层视图。方案以 Elastic Agent 统一采集日志、指标和追踪数据,并支持 Google Cloud 多项服务的日志流,Google Cloud 的 Agent for SAP 则负责采集 SAP Host Agent 指标与进程监控指标。

5月12日周日
  1. Eugene YanAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建 LLM 应用一年来学到了什么

    经过一年构建 LLM 应用的实践,经验覆盖从战术细节、日常运营到长期业务战略三个层面。

4月12日周五
  1. Hamel HusainAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用对抗验证(Adversarial Validation)调试 AI 中的数据漂移

    Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。

2月25日周日
  1. Eugene YanAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不要在单元测试中 mock 机器学习模型

    机器学习代码学的是逻辑而非包含逻辑,因此单元测试不应像普通软件那样 mock 模型。建议用小型内联样本数据、随机或空权重测试输出形状与设备迁移,并对真实模型保留损失下降、过拟合、输出语义等关键测试并标记为 slow。

10月23日周一
  1. Next.js BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 如何思考 App Router 中的安全:RSC 数据暴露风险与防护

    Next.js 官方发文说明 App Router 中 React Server Components(RSC)的安全思路,重点防范意外数据暴露,并给出三种数据处理模型:HTTP APIs 适合已有大型项目、Data Access Layer 适合新项目、组件级数据访问仅适合原型开发。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。

6月11日周日
  1. Eugene YanAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Obsidian-Copilot:一款辅助写作与反思的助手

    Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。

4月16日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Raspberry-LLM:把 Raspberry Pico 变得更聪明一点

    开发者用 Raspberry Pico 加 e-ink 屏幕做了 raspberry-llm,通过调用第三方 LLM API 读取 WSJ 和 HackerNews RSS 内容并生成文本,最初用来做押韵时钟。

1月22日周日
  1. Eugene YanAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    高效机器学习项目的四种机制:Pilot 与 Copilot、文献综述、方法论评审与时间盒

    机器学习项目可通过四种机制提升成功率:为每个项目配备 pilot 与 copilot,后者每投入约 10% 工时做评审,及早发现训练数据错误、train-validation split 无效等致命问题;项目启动先做文献综述,重点关注问题如何被框定、输入数据处理与离线评估;在拿到初始实验结果后开展方法论评审,排查数据泄漏、时间切分等问题;并对各项目阶段和任务做时间盒约束。

1月11日周三
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型 Transformer 模型推理优化:蒸馏、量化与架构改进

    大型 Transformer 模型推理受限于巨大显存占用与难以并行:KV cache 在 batch size 512、上下文长度 2048 时可达 3TB,是模型体积的 3 倍,且注意力计算随输入长度呈平方增长。文章梳理并行化、内存卸载、智能批处理、剪枝、量化、知识蒸馏及注意力层架构改造等推理加速路径,并详解知识蒸馏与量化方法。

9月24日周五
  1. Lilian Weng — Lil’LogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在多 GPU 上训练真正的大模型?

    Lilian Weng 撰文系统梳理在多 GPU 上训练超大模型的并行范式,包括数据并行、模型并行、流水线并行与张量并行,并对比 GPipe、PipeDream、Megatron-LM 与 PTD-P 等方案。