跳到正文

#教程/实践

今日 37 条
2月11日周日
  1. Eugene YanAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何生成与使用合成数据做微调

    合成数据由模型或模拟环境生成,可在预训练、指令微调与偏好微调中使用,比人工标注更快更便宜,质量与多样性常超过人工标注者,并规避隐私与版权问题。生成方式主要有两种:从更强模型蒸馏,或基于模型自身输出自我改进;前者优化响应质量与计算效率,后者无需外部依赖但受限于模型初始能力并可能放大偏见与错误。

2月10日周六
  1. Lilian Weng(@lilianweng)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 谈数据质量与人类因素,并招募 Human-AI Interaction 研究工程师

    Lilian Weng 就数据质量与流程中的人类因素这一话题撰写了短文,并在帖中表示其团队正为新的 Human-AI Interaction 子团队招募 Research Engineer。

2月5日周一
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 谈高质量人类数据:从任务设计到评分者一致性

    高质量数据是深度学习训练的燃料,但社区存在"人人想做模型、没人愿做数据"的倾向。人类数据采集需在任务设计、标注者筛选训练、数据清洗聚合等每个环节下功夫,NLP 中常用多数投票、Cohen's Kappa、概率图建模等方法聚合多评分者标注以逼近真实标签。

1月7日周日
  1. Eugene YanAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    语言建模论文阅读清单:从 Transformer 到 RAG 的一年份必读论文

    Eugene Yan 与朋友组建每周论文俱乐部,整理出一份语言建模基础论文清单,每篇附一句话总结,涵盖 Attention Is All You Need、GPT、BERT、T5、Chinchilla、LLaMA、InstructGPT、LoRA、QLoRA、RAG、FlashAttention、CLIP、DPO、LCM 等。

12月31日周日
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2023 年度回顾:LLM 探索、角色转型与写作

    Eugene Yan 发布 2023 年度回顾,记录自己因 gpt-3.5-turbo 的跃升式改进而转向语言模型研究,并做出一系列原型,包括 Discord 机器人和基于词汇与嵌入向量 RAG 的 Obsidian copilot,还微调了一个面向域外数据的幻觉分类器。他随后将工作重心转向 GenAI,Charter 扩展到跨组织的 GenAI 部署与成本优化,并已上线两个原型、另有四个在推进。

12月24日周日
  1. Eugene YanAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推送通知该推什么、不该推什么,以及推送频率如何把握

    推送通知可视为一种推荐系统,但用户意图更模糊、时效性要求更高、空间与频次受限,单条推送往往只能突出一个推荐项。Alibaba 发现,推荐互补商品(而非替代品)并说明推荐理由的个性化推送能提升打开率。推送还需控制频次:活跃用户或可接受每天多条,低活跃用户则更适合每周少量。

10月23日周一
  1. Next.js BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 如何思考 App Router 中的安全:RSC 数据暴露风险与防护

    Next.js 官方发文说明 App Router 中 React Server Components(RSC)的安全思路,重点防范意外数据暴露,并给出三种数据处理模型:HTTP APIs 适合已有大型项目、Data Access Layer 适合新项目、组件级数据访问仅适合原型开发。

10月9日周一
  1. Eugene YanAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 谈 LLM 系统构建模块:评估、RAG、Guardrails 与反馈收集

    Eugene Yan 在首届 AI Engineer Summit 上提出构建 LLM 系统与产品的四大模式:评估、检索增强生成(RAG)、Guardrails 与反馈收集。他认为评估是基础,可用于指导提示工程、检索增强和微调;针对特定任务手工构建约 40 条评测集即可起步,并需警惕 MMLU 等学术基准与自身任务不匹配。

9月3日周日
  1. Eugene YanAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    抽象摘要的评估与幻觉检测:ROUGE、METEOR 与 NLI/QA 方法

    抽象摘要的评估难点在于幻觉:Kryściński et al. 发现 CNN/DailyMail 上多达 30% 的摘要存在幻觉,Pagnoni et al. 在该数据集上测得 43% 忠实性错误,XSum 高达 92%。

8月13日周日
  1. Eugene YanAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为不同 LLM 问题匹配相应模式

    作者继此前 LLM patterns 文章后,梳理使用 LLM 时可能遇到的各类问题及其对应的缓解模式。文中先区分外部与内部 LLM,并按数据在模式中的作用划分:evals 和微调依赖数据,缓存、防御式 UX、guardrails 偏基础设施与界面,RAG 和收集用户反馈居中。

7月30日周日
  1. Eugene YanAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建 LLM 系统与产品的七种关键模式

    Eugene Yan 总结出构建 LLM 系统与产品的七种关键模式:Evals 衡量性能、RAG 注入外部知识、微调提升特定任务表现、缓存降低延迟与成本、Guardrails 保障输出质量、防御式 UX 优雅处理错误、收集用户反馈形成数据飞轮。

6月23日周五
  1. Lilian Weng — Lil’LogAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 驱动的自主智能体:规划、记忆与工具调用

    Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。

5月21日周日
  1. Eugene YanAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图解 Attention 与 Transformer 的直觉理解

    针对 ChatGPT、Bard、Claude 等聊天机器人带火大语言模型后涌入的圈外读者,Eugene Yan 撰文解释 Attention 与 Transformer 的核心直觉。

4月23日周日
  1. Eugene YanAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器学习系统的更多设计模式

    机器学习系统可复用多种设计模式,包括原始数据只处理一次、Human-In-The-Loop 数据标注、数据增强、难负样本挖掘、重定义问题、级联、数据飞轮、业务规则层和部署前评估。其中原始数据只处理一次可减少冗余、降低计算与存储成本,并可由特征存储集中特征计算与存储。

4月16日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Raspberry-LLM:把 Raspberry Pico 变得更聪明一点

    开发者用 Raspberry Pico 加 e-ink 屏幕做了 raspberry-llm,通过调用第三方 LLM API 读取 WSJ 和 HackerNews RSS 内容并生成文本,最初用来做押韵时钟。

4月9日周日
  1. Eugene YanAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 做研究、反思与规划:LangChain + GPT 实践

    作者用 gpt-3.5-turbo 和 gpt-4 配合 LangChain、Pinecone 与 Discord 搭建了一套个人助理,实现 /summarize、/sql-agent、/search、/board 等工具,用于摘要、查询与提供建议。

3月15日周三
  1. Lilian Weng — Lil’LogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 长文梳理 Prompt Engineering:从少样本提示到 CoT 与工具调用

    Lilian Weng 在 Lil'Log 发布 Prompt Engineering 综述,将提示工程定义为在不更新模型权重的前提下通过 In-Context Prompting 引导 LLM 行为,并指出其效果因模型差异很大、需要大量实验。

3月12日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何撰写数据标注指南:来自 Google 与 Bing 搜索指南的经验

    撰写数据标注指南需要回答五个问题:任务为何重要、任务是什么、术语含义、标注者如何判断、任务如何执行。Google 与 Bing 的搜索指南中解释了标注输出如何改进搜索结果,并给出查询类型、页面质量等术语定义和示例。指南还应说明标注工具使用方法,并提供“Unsure”标签或释放任务的选项以减少错误判断。

2月26日周日
  1. Eugene YanAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    内容审核与欺诈检测:行业中的五种模式

    内容审核与欺诈检测系统可归纳出五种行业通用模式:通过 human-in-the-loop 收集 ground truth、增强数据补充初始标签、用级联模式拆分问题、结合监督与无监督 ML、以及用可解释性理解模型输出。

1月27日周五
  1. Lilian Weng — Lil’LogAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 更新《The Transformer Family》2.0 版

    Lilian Weng 将三年前的《The Transformer Family》一文重构扩充至 2.0 版,篇幅约为旧版两倍,是按时间顺序整理新论文的旧作超集。文中重新梳理了章节层级,并补充了 2020 年后提出的多项 Transformer 架构改进。

1月22日周日
  1. Eugene YanAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    高效机器学习项目的四种机制:Pilot 与 Copilot、文献综述、方法论评审与时间盒

    机器学习项目可通过四种机制提升成功率:为每个项目配备 pilot 与 copilot,后者每投入约 10% 工时做评审,及早发现训练数据错误、train-validation split 无效等致命问题;项目启动先做文献综述,重点关注问题如何被框定、输入数据处理与离线评估;在拿到初始实验结果后开展方法论评审,排查数据泄漏、时间切分等问题;并对各项目阶段和任务做时间盒约束。

1月18日周三
  1. Andrej KarpathyAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 从零用代码手把手构建 GPT

    Andrej Karpathy 发布视频教程,从零开始、以代码逐行讲解的方式构建 GPT。

1月15日周日
  1. Eugene YanAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    告别 Roam Research,转向 Obsidian

    Eugene Yan 用一个周末、不到一小时把笔记从 Roam Research 迁到 Obsidian,并用 obsidian-git 实现跨设备同步。他将 1k+ 图片分批提交,超过 1,024kb 的图片转成 jpg 后同步,首次同步上传 GitHub 约 15 分钟。作者称 Obsidian 启动和使用比网页版 Roam 更流畅、更可定制,暂不打算回到 Roam。

1月11日周三
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型 Transformer 模型推理优化:蒸馏、量化与架构改进

    大型 Transformer 模型推理受限于巨大显存占用与难以并行:KV cache 在 batch size 512、上下文长度 2048 时可达 3TB,是模型体积的 3 倍,且注意力计算随输入长度呈平方增长。文章梳理并行化、内存卸载、智能批处理、剪枝、量化、知识蒸馏及注意力层架构改造等推理加速路径,并详解知识蒸馏与量化方法。

12月11日周日
  1. Eugene YanAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Autoencoders 与 Diffusers:简要对比

    自编码器与扩散模型在学习范式和架构上颇为相似:两者都从输入重建输出、都能学习数据的低维流形,且都用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 作为条件输入,使单套参数即可处理不同噪声水平,并支持以文本提示词生成图像。

11月27日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 DALL·E 到 Stable Diffusion:扩散模型、文本条件、引导与潜空间的原理梳理

    扩散模型通过前向加噪、反向去噪生成图像,DALL·E、DALL·E 2、Imagen 到 Stable Diffusion 都基于这一思路。DDPM(2020)将反向过程建模为高斯分布,让神经网络从纯噪声中逐步去噪还原图像,训练时学习预测所加噪声,采样时每个时间步只减去一小部分噪声再补回少量噪声。

6月10日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Lilian Weng 与 Greg Brockman 分享大规模神经网络训练技巧

    OpenAI 的 Lilian Weng 与 Greg Brockman 发布文章,介绍训练大型神经网络的技术,并称其可能比想象中更容易。两人同时表示 OpenAI 正在招聘。

4月16日周六
  1. Lilian Weng — Lil’LogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据不足时如何学习 Part 3:数据生成

    Lilian Weng 在"数据不足时如何学习"系列第三篇中,梳理了用合成数据训练的两条路径:对已有样本做增强,或用预训练大语言模型直接生成新数据。

2月20日周日
  1. Lilian Weng — Lil’LogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据不足时如何学习(下):主动学习

    面对标注数据有限的监督学习任务,主动学习在固定标注预算 B 下,从无标注数据中挑选最值得标注的样本,以最大化模型性能提升,特别适用于医学图像等标注昂贵场景。

12月5日周日
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据不够怎么学?第一部分:半监督学习

    Lilian Weng 在 Lil'Log 发布“数据不够怎么学”系列第一篇,聚焦半监督学习,即在标注数据有限时同时利用有标注和无标注样本训练模型。

9月24日周五
  1. Lilian Weng — Lil’LogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在多 GPU 上训练真正的大模型?

    Lilian Weng 撰文系统梳理在多 GPU 上训练超大模型的并行范式,包括数据并行、模型并行、流水线并行与张量并行,并对比 GPipe、PipeDream、Megatron-LM 与 PTD-P 等方案。

7月11日周日
  1. Lilian Weng — Lil’LogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    什么是扩散模型(Diffusion Models)?

    扩散模型受非平衡热力学启发,通过马尔可夫链在 T 步中向数据逐步加入高斯噪声,再学习逆向过程从噪声重建样本,与 VAE、Flow 模型不同,其隐变量维度与原始数据相同。该框架涵盖 diffusion probabilistic models(2015)、NCSN(2019)与 DDPM(2020)。

5月31日周一
  1. Lilian Weng — Lil’LogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对比表示学习(Contrastive Representation Learning)综述

    对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对相互远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。训练目标已从早期单一正负样本对演进为在一个 batch 内纳入多对正负样本,包括 Contrastive Loss、Triplet Loss、Lifted Structured Loss、N-pair Loss 以及 NCE。

3月21日周日
  1. Lilian Weng — Lil’LogAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何降低语言模型的有害内容(Toxicity)

    大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程做强管控。Lilian Weng 在文中讨论了 toxic 内容的定义争议,并介绍了 Zampieri et al. (2019) 提出的三级有害语言分类体系(OFF/NOT、TIN/UNT、IND/GRP/OTH)及其对应的 OLID 数据集,以及专家标注、众包、专业审核等数据收集方式与质量保障实践。

1月2日周六
  1. Lilian Weng — Lil’LogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    可控神经文本生成:Lilian Weng 综述可控文本生成方法

    Lilian Weng 在 Lil'Log 发布《可控神经文本生成》综述,梳理用无条件下预训练语言模型实现可控内容生成的三类路径:引导式解码在测试时筛选输出、优化提示词设计、以及微调基础模型或可操控层。文中还介绍了基于重要性重采样、能量模型(EBM)残差引导与 AutoPrompt 梯度搜索提示词等具体方法。

10月29日周四
  1. Lilian Weng — Lil’LogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何构建开放域问答系统?解析 Retriever-Reader 等三大框架

    开放域问答(ODQA)要求模型在无相关上下文的情况下回答事实型问题,可分为开放书与闭卷两类。基于 DrQA 的 retriever-reader 框架先用 TF-IDF 等检索器从 Wikipedia 取回相关文档,再由 reader 抽取答案;Lewis 等人发现公开 QA 数据集训练集与测试集重叠严重,58-71% 的测试答案曾出现在训练集中。

8月6日周四
  1. Lilian Weng — Lil’LogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    神经架构搜索(NAS)详解:搜索空间、搜索算法与评估策略

    神经架构搜索(Neural Architecture Search, NAS)被 Elsken 等人 2019 年的综述归纳为三大组件:定义卷积、全连接、池化等操作及其连接方式的搜索空间,采样候选架构并根据准确率、延迟等指标优化的搜索算法,以及评估大量候选模型性能的评估策略。

6月7日周日
  1. Lilian Weng — Lil’LogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度强化学习中的探索策略

    针对深度强化学习中"探索"这一尚未解决的开放问题,文章梳理了从 epsilon-greedy、UCB、Boltzmann 探索到 Thompson sampling 的经典策略,以及熵损失项和噪声注入等深度 RL 探索方法。

4月7日周二
  1. Lilian Weng — Lil’LogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Transformer 家族综述:从原始架构到各类改进模型

    Transformer 依赖缩放点积注意力和多头自注意力机制,原始版本采用编码器-解码器架构,编码器由 6 个相同模块堆叠,每模块含多头自注意力层和逐位置全连接前馈网络,各子模块带残差连接和层归一化。此后简化版 Transformer 在语言建模任务上表现出色,如仅编码器的 BERT 和仅解码器的 GPT。

1月29日周三
  1. Lilian Weng — Lil’LogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    强化学习中的课程学习(Curriculum Learning)综述

    课程学习早在 1993 年就由 Jeffrey Elman 提出:先用简单数据训练、再逐步提升样本复杂度,否则模型可能完全学不会。