跳到正文

全部动态

今日 33 条
10月5日周日
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    详解 LLM 评测的 4 种主要方法(附从零实现代码)

    LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。

10月1日周三
  1. Hamel HusainAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何选择合适的人工智能评估工具:Langsmith、Braintrust 与 Arize Phoenix 对比

    数据科学家小组让 Langsmith、Braintrust 和 Arize Phoenix 完成同一评估作业,从工作流、人工介入、透明度与生态集成四方面进行比较。结论是没有一个工具在所有维度都最优,选择取决于团队技能、技术栈与成熟度。作者本人通常将这些工具用作后端数据存储,并配合 Jupyter notebook 和自建标注界面。

9月30日周二
  1. MongoDB BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    选择混合搜索方案时的核心考量

    混合搜索将传统关键词搜索的精确性与向量搜索的上下文理解能力结合,成为满足当前用户期望的关键方案。随着 RAG 等生成式 AI 用例兴起,高质量检索需求推动向量搜索与词汇搜索走向融合,主要融合技术包括倒数排名融合(RRF)和相对分数融合(RSF),二者无需依赖可直接比较的分数尺度即可合并结果。

9月29日周一
  1. Thinking Machines — ConnectionismAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 研究:LoRA 在何种条件下不逊于全量微调

    Thinking Machines 发布研究《LoRA Without Regret》,用 Llama 3 与 Qwen3 系列模型在 Tulu3、OpenThoughts3 数据集的监督微调及数学推理强化学习实验,考察 LoRA 与全量微调(FullFT)的差距。

9月24日周三
  1. MongoDB BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何构建值得长期保留的 AI 智能体:Canvas 框架

    MongoDB Blog 提出 Canvas 框架,用于解决企业 AI 智能体项目大量停留在试点阶段的问题。文章援引数据称近八成公司使用生成式 AI,但部署用例中不到 10% 能走出试点,MIT 研究样本中失败率甚至高达 95%。

9月14日周日
  1. Eugene YanAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Semantic IDs 训练 LLM-推荐混合模型,实现可操控推荐

    作者用 Semantic IDs 将商品编码进语言模型词表,在 Amazon Reviews 2023 视频游戏数据上训练出一个能在英文与 item ID 间"双语"对话的 LLM-推荐混合模型。数据经筛选后保留 66k 商品、737k 条行为记录,构建出 79k 条用户购买序列,平均长度 6.5 个商品。该模型推荐精度不及专门的多阶段推荐系统,但支持用自然语言操控推荐并对其选择给出推理与解释。

9月10日周三
  1. Thinking Machines — ConnectionismAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 详解 LLM 推理不确定性成因与确定性实现

    Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。

9月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用纯 PyTorch 从零实现 Qwen3

    Sebastian Raschka 发布文章,用纯 PyTorch 从零讲解并实现 Qwen3 的稠密与 Mixture-of-Experts 架构。

8月9日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 GPT-2 到 gpt-oss:架构演进细节解析

    OpenAI 本周发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重模型,这是其自 2019 年 GPT-2 以来首次公开完整的开放权重模型。

7月27日周日
  1. 牛油果烤面包AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛油果烤面包 #140:主播圆桌聊大模型如何改变生活与工作

    牛油果烤面包播客几位主播圆桌闲聊各自用 AI 工具的感受,覆盖文本润色、心理咨询、知识学习、图像生成、育儿辅助、编程辅助、播客与音视频制作、工作流自动化、AI Agent、多层次搜索与内容整合、AI 导游、旅行规划、写段子与小说创作等场景,也谈到 AI 的另一面。

6月22日周日
  1. Eugene YanAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何评估长上下文问答系统

    长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。

5月4日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 MCP、Amazon Q 和 tmux 构建每日新闻摘要智能体

    作者基于 Amazon Q CLI 与 MCP 构建了一个 news-agents,用于生成每日新闻摘要,并用 tmux 为每个子智能体单独开窗展示其工作过程。

4月13日周日
  1. OpenAI NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 如何用 canvas 从 PRD 快速做出 HTML/React 原型

    OpenAI 展示如何用 ChatGPT 的 canvas 从产品需求文档(PRD)直接生成可运行的 HTML/React 原型。演示覆盖从需求文档到可交互原型的完整流程,帮助用户快速验证产品想法。

4月8日周二
  1. OpenAI NewsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 如何支持战略规划

    ChatGPT 可用于支持战略规划,通过分析背景信息、生成多个选项,并将决策转化为后续行动步骤。

3月24日周一
  1. Hamel HusainAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快速改进 AI 产品的实战指南

    Hamel Husain 基于为 30 多家公司提供咨询的经验,总结出快速改进 AI 产品的方法:核心不是选工具和框架,而是测量与迭代。

3月18日周二
  1. Eugene YanAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA GTC 2025:构建 LLM 应用的洞见与经验

    Eugene Yan 与 Chip 受邀在 NVIDIA GTC 2025 的"构建 LLM 应用的经验与教训"圆桌论坛上分享。录像已在 NVIDIA GTC 参会者门户上线,需登录观看,并将在 NVIDIA On-Demand 面向公众开放。

3月16日周日
  1. Eugene YanAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 LLM 时代改进推荐系统与搜索:架构、数据与统一框架

    工业搜索与推荐系统正引入 LLM 与多模态能力改造传统 ID 架构。YouTube 用 transformer 视频编码器加 RQ-VAE 生成 Semantic IDs,N-gram 与 SPM 方法优于随机哈希,尤其缓解冷启动;快手 M3CSR 通过 K-means 将多模态嵌入聚类为可训练类别 ID,A/B 测试点击提升 3.4%、点赞 3.0%、关注 3.1%。

2月18日周二
  1. Elastic BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IT 领导者 AI 采用之旅的 7 条经验

    Elastic、Comcast 和 Adobe 的 IT 高管分享 AI 采用经验:先从高价值业务问题出发,而非为 AI 而 AI,并鼓励员工在创新中心实验。要用 RAG 接入自有高质量数据,持续量化 NPS、响应时间等指标,同时警惕多供应商点状方案带来的技术债与数据孤岛。

2月14日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 公布 DeepSeek-R1 部署推荐设置:无 system prompt、Temperature 0.6

    DeepSeek 为部署 DeepSeek-R1 给出推荐设置:不使用 system prompt,Temperature 设为 0.6,并公布搜索与文件上传的官方提示词及缓解模型绕过思考的指南。官方部署与开源版本运行同一模型,可获得完整的 DeepSeek-R1 体验。

11月30日周六
  1. Hamel HusainAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何通过技术写作建立受众:策略与常见错误

    Hamel Husain 分享了在 AI 领域通过技术写作建立受众的 5 个策略:在他人优秀工作上做延伸、保持稳定输出、提升文案写作能力、搭建语音转内容流水线和善用独特视角。

11月24日周日
  1. Eugene YanAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent Space Paper Club:如何每周办一场论文研读会并建成学习社区

    Latent Space Paper Club 已连续 18 个月每周举办一次论文研读会,累计讨论至少 80 篇论文,覆盖 Attention、LoRA/QLoRA、RLHF、RAG 等主题。组织者建议固定每周三 12pm PST 举行一小时会议,提前预读可将讨论收获提升约 80%,并轮流由志愿者主持,偶尔邀请论文作者参与答疑。

11月17日周日
  1. Eugene YanAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的极简 MacBook Pro 配置指南

    Eugene Yan 将个人笔记本从 2019 Intel MacBook Pro 升级到 M4 MacBook Pro,选择不恢复备份而从零搭建极简开发环境。配置涵盖 macOS 设置、Homebrew、Warp、Fish、Cursor 等开发工具,以及用 Ollama + Open WebUI 本地运行 llama3.2 和 nemotron 模型。

11月12日周二
  1. Elastic BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic Security 检测工程能力全览:预置规则定制、告警抑制与 AI 辅助

    Elastic Security 面向检测工程师梳理其检测工程工具集,内置超过 1,300 条 SIEM 检测规则、覆盖 54 种数据源,另有 70 多个机器学习任务。

11月3日周日
  1. Eugene YanAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 39 条机器学习系统构建、扩展与执行经验

    Eugene Yan 整理了 2024 年机器学习会议笔记,归纳出 39 条构建机器学习系统的经验,涵盖奖励函数设计、评估框架、数据飞轮与规模化生产等主题。他指出,评估体系正在成为团队的差异化护城河,而数据本身不是竞争优势,能更快转动数据飞轮的一方才会赢。在规模化方面,他引用 Will Larson 的观点:最贵的 LLM 对 B2B 来说不算贵,最便宜的 LLM 对 C 端来说也不算便宜。

10月29日周二
  1. Hamel HusainAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-a-Judge 评估完全指南:Critique Shadowing 七步法

    Hamel Husain 发布 LLM-as-a-Judge 评估完全指南,提出名为 Critique Shadowing 的方法,分七步搭建评估体系:找到核心领域专家、构建数据集、让专家做通过/失败判断并给出点评、修复错误、迭代构建 LLM 评判器、错误分析、按需创建更专门的评判器。

10月24日周四
  1. Next.js BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js App Router 的缓存探索之路

    Next.js 官方博客回顾了 Next.js App Router 的缓存演进历程,梳理了其缓存机制的设计思路与实践经验。

9月10日周二
  1. OpenAI NewsAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 分享数百次成功部署经验:如何让 AI 真正投入工作

    OpenAI 基于数百次成功部署经验,总结了让 AI 真正投入工作的方法。内容面向企业落地场景,但正文未披露具体模型、版本或部署数据。

9月8日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 FastAPI、FastHTML、Next.js 和 SvelteKit 构建同一个 Web 应用

    为比较 FastAPI、FastHTML、Next.js 和 SvelteKit,作者用每个框架各写了一个「Look at Your Data」应用,实现 CSV 上传建表、浏览、改字段、删行、下载的完整 CRUD。

8月18日周日
  1. Eugene YanAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何评估 LLM 评审员(即 LLM-as-a-Judge)的有效性

    Eugene Yan 基于二十余篇论文系统梳理了 LLM-evaluators(又称 LLM-as-a-Judge)的使用要点:直接评分适合忠实度、毒性等客观评估,成对比较在说服力、语气等主观评估上更稳定,与人类标注差异更小,基于参考的评估则依赖人工标注参考文本。

7月29日周一
  1. Hamel HusainAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hamel Husain 等人发布开源 LLM 课程 Mastering LLMs

    Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。

7月7日周日
  1. Eugene YanAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何面试和招聘 ML/AI 工程师

    Eugene Yan 与 Jason 分享了面试和招聘 ML/AI 工程师的经验:评估技术能力之外,更看重候选人如何拆解问题、写可维护代码和回应反馈。数据素养是 ML/AI 岗位最易被忽视的关键技能,包括亲手理解数据、用分析直觉识别可疑结论。文章还给出电话筛选校准、面试 loop 与 debrief 的实操建议。

  2. Lilian Weng — Lil’LogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 的外在幻觉:成因、检测与缓解

    大语言模型幻觉被区分为上下文幻觉与外在幻觉两类,后者指模型输出无法被预训练数据所代表的世界知识所支撑。Gekhman et al. 2024 发现,模型学习含新知识的微调样本明显更慢,一旦学会这些样本,其幻觉倾向随之上升。

5月26日周日
  1. Eugene YanAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    提示词基础与有效应用方法

    Eugene Yan 总结提示词工程的基础做法,指出做大规模提示词优化前需要可靠的评估,并给出“标注约100条评估样本、写初版提示词、跑评估并迭代、上线前在留出测试集上验证”的流程。

5月12日周日
  1. Eugene YanAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建 LLM 应用一年来学到了什么

    经过一年构建 LLM 应用的实践,经验覆盖从战术细节、日常运营到长期业务战略三个层面。

4月12日周五
  1. Hamel HusainAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用对抗验证(Adversarial Validation)调试 AI 中的数据漂移

    Hamel Husain 介绍用对抗验证检测 AI 数据漂移:给两组数据集分别打 0/1 标签,训练二分类器,AUC 达到 0.60 以上即说明存在漂移,再用特征重要性定位根因。他还发布 CLI 工具 ft_drift,可检测两个多轮对话 jsonl 文件之间 prompt 模板和 token 层面的漂移。

  2. Lilian Weng — Lil’LogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    视频生成的扩散模型:从 3D U-Net 到 Sora 的 DiT

    扩散模型已从图像合成扩展到视频生成,需额外处理帧间时序一致性并依赖更多世界知识。从零训练路线中,VDM 用 3D U-Net 将空间与时间操作分解处理,Imagen Video 则以 7 个扩散模型级联输出 1280x768、24 fps 视频,并通过渐进蒸馏将采样步数降至每个模型 8 步。OpenAI 的 Sora 则改用 DiT 架构,在视频与图像潜码的时空 patch 序列上运算。

4月7日周日
  1. Eugene YanAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Vapi 和 Claude 3 搭建一个语音 AI 教练

    作者 Eugene Yan 用 Vapi 平台和 claude-3-sonnet 搭建了一个可电话拨打的语音 AI 教练 Tara,并给出约 10 分钟的搭建指南。

3月31日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任务专属 LLM 评估:哪些有效,哪些无效

    Eugene Yan 总结了分类/抽取、摘要、翻译等任务中真正有效的 LLM 评估方法:分类用 recall、precision、ROC-AUC、PR-AUC,摘要用 NLI 测一致性并以 reward model 和长度检查测相关性,翻译用 chrF、BLEURT、COMET、COMETKiwi,另加版权逐字复现与毒性生成比例检测。他还提醒需通过人工评估校准评估标准,在潜在收益与风险间取得平衡。

2月25日周日
  1. Eugene YanAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不要在单元测试中 mock 机器学习模型

    机器学习代码学的是逻辑而非包含逻辑,因此单元测试不应像普通软件那样 mock 模型。建议用小型内联样本数据、随机或空权重测试输出形状与设备迁移,并对真实模型保留损失下降、过拟合、输出语义等关键测试并标记为 slow。

2月11日周日
  1. Eugene YanAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何生成与使用合成数据做微调

    合成数据由模型或模拟环境生成,可在预训练、指令微调与偏好微调中使用,比人工标注更快更便宜,质量与多样性常超过人工标注者,并规避隐私与版权问题。生成方式主要有两种:从更强模型蒸馏,或基于模型自身输出自我改进;前者优化响应质量与计算效率,后者无需外部依赖但受限于模型初始能力并可能放大偏见与错误。