跳到正文

#数据/训练

今日 40 条
5月18日周一
  1. Andrej Karpathy(@karpathy)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 谈 nanochat 视频:8XH100 首次开机成第一道门槛

    Andrej Karpathy 在录制 nanochat 视频时意识到,"先从你常用的服务商处首次开机一台 8XH100"这一步会让观众直接卡在视频第 1 步。该帖获得 1983 次点赞、201513 次浏览。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    剑桥教授用 Google Co-Scientist 追踪新发传染病的分子开关

    剑桥大学教授 Clare Bryant 用 Google 的 Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 给出的假设中有一个她此前未关注的蛋白,与多个她感兴趣的信号通路相关,假设随后细化到具体氨基酸。她称确定精确氨基酸通常需 2 到 3 年实验,如今有望在 6 个月内完成。

  2. Google DeepMind BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Calico 用 Google Co-Scientist 推进衰老研究,提出 ISR 调控新假说

    Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google Co-Scientist 整合分散的衰老生物学发现并生成可验证假说。团队借此就整合应激反应(ISR)如何受代谢调控提出新假说,并用 Co-Scientist 优化实验设计、随结果更新信息,实验已产生对 ISR 在健康与疾病中作用有重要意义的新发现,计划发表。

  3. Google DeepMind BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Co-Scientist 如何连接两个实验室,用 RNA 机制探索 ALS 新疗法

    Google DeepMind 的 Co-Scientist 促成 MIT 机械工程师 Ritu Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 合作,将组织模型与 RNA 表面研究结合,寻找可用于靶向 ALS 的新型 RNA 机制乃至 RNA 药物。

  4. Google DeepMind BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford 用 Co-Scientist 筛选抗肝纤维化药物,候选药在实验中抑制 91% 损伤反应

    Stanford 大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从既有药物文献中筛选可重定位治疗肝纤维化的候选药。

5月15日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 推出新课 Transformers in Practice,与 AMD 合作讲解 Transformer 推理

    Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。

5月12日周二
  1. Hugging Face(@huggingface)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face Hub 开源数据集突破 100 万

    Hugging Face Hub 上的开源数据集数量突破 100 万,Hugging Face 称这一里程碑离不开 AI 社区的支持,并强调开源模型需要开放数据。

  2. Citrini ResearchAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 半导体备忘录:供应链继承

    Citrini Research 在最新半导体备忘录中提出"供应链继承"逻辑:AI 数据中心资本开支正直接继承电动车与太阳能产业建成的功率半导体供应链,德州仪器(TXN)、NXP 等厂商不再扩产而是提价,ASP 上行。Nvidia 2025 年 5 月关于 800V DC 机架架构的技术博客已将底层技术归功于"电动车和太阳能产业"。

  3. Demis Hassabis(@demishassabis)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Isomorphic Labs 获 21 亿美元新融资,加速 AI 药物研发

    Demis Hassabis 宣布 Isomorphic Labs 获得 21 亿美元新融资,用于加速以 AI 重塑药物研发、最终攻克所有疾病的使命。他称 AI 的第一大应用应是改善人类健康,这一方向始于 AlphaFold,如今在 Isomorphic Labs 延续。

  4. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sapu 如何用 Qdrant 索引 2800 万条 PubMed 摘要加速癌症研究

    Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。

5月11日周一
  1. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 1.18 发布 TurboQuant:压缩率翻倍、召回率接近标量量化

    Qdrant 1.18 引入 Google Research 开发的量化方法 TurboQuant,在压缩率是标量量化两倍的情况下,召回率和速度与其接近,且适配任意嵌入模型。新增集合内存监控(按向量、payload、索引拆分磁盘/RAM/页缓存占用)与命名向量在线增删,无需重建集合。该版本还改进了审计日志并新增按集合的 API 指标与两项严格模式护栏。

  2. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调查:349 名技术工作者自述 AI 带来的工作价值中位数提升 1.4–2 倍

    METR 在 2026 年 2–4 月调查了 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),受访者自述 AI 工具带来的工作价值中位变化为 1.4–2 倍,速度中位变化为 3 倍。

5月10日周日
  1. 宝玉的分享AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    机器人的终局:英伟达 Jim Fan 宣告 VLA 时代结束,WAM 登场

    英伟达 GEAR Lab 负责人 Jim Fan 在 Sequoia AI Ascent 2026 的《Robotics' End Game》演讲中宣布 VLA 路线过时,包括他此前主推的 GR00T,提出以世界动作模型(WAM)为新范式,代表作是 2 月发布的 140 亿参数 DreamZero。

5月8日周五
  1. Jim Fan(@DrJimFan)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 谈机器人终局:从 VLA 到世界动作模型 WAM 的 Physical AGI 路线图

    Jim Fan 在红杉 AI Ascent 演讲《Robotics: Endgame》中,把解决 Physical AGI 的路线类比 LLM 的成功路径,指出 VLA 的不足,并提出视频世界模型作为第二预训练范式、World Action Models(WAM)以及机器人数据飞轮等方向。

  2. Jan Leike(@janleike)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 与 Samuel Marks 发布 NLA:将 LLM 内部状态转成可读文本的无监督方法

    Samuel Marks 等人发布新论文提出 NLAs,一种将 LLM 内部状态转换为人类可读文本的无监督方法。Jan Leike 称其为可解释性工具箱中的新工具,并表示结果令人惊讶,认为 NLAs 实质推进了对 LLM 在想什么的理解以及安全审计能力。

5月7日周四
  1. MongoDB BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 8.3 发布:为 AI 工作负载提速,写入吞吐提升 35%

    MongoDB 8.3 正式发布,相比 8.0 写入吞吐提升 35%、读取提升 45%、ACID 事务提升 15%,且无需改动应用代码。MongoDB 称 8.0 客户已获得 36% 更快的读取和 59% 更高的更新吞吐。Atlas 覆盖 AWS、Google Cloud、Microsoft Azure 共 130 个区域,并支持跨云集群。

5月1日周五
  1. Epoch AIAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 解析 AI 芯片:Nvidia、TPU 与 TSMC 供应链全景

    Epoch AI 的 AI Chip Sales 数据集显示,截至 2025 年底五大芯片设计商累计出货约 2000 万颗 AI 芯片,Nvidia 占约一半销量和超过 66% 的 AI 算力。

4月24日周五
  1. 语言即世界language is worldAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话罗福莉:OpenClaw触发AI范式巨变,Agent时代1T基座只是入场券

    小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。

4月22日周三
  1. Google DeepMind BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为相互解耦的计算岛屿并采用异步数据流,使单点硬件故障不中断其他部分。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。

4月17日周五
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布首个科研前沿模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,称其为首个面向生物学、药物发现和转化医学等科学研究的前沿模型,训练覆盖化学、蛋白质工程、基因组学,并内置研究者常用数据库与工具的相关知识。该模型通过可信访问部署结构向合格客户开放,以防范生物领域的滥用风险。同时 OpenAI 面向所有人推出 Codex 的生命科学插件,可搭配主线模型及 GPT-Rosalind 使用。

4月15日周三
  1. MongoDB BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IDC 研究:破解旧版技术债务是亚太企业 AI 成功的关键

    MongoDB 委托 IDC 调研亚太八个市场 1400 家组织后发现,已将现代化融入战略的领先企业数字化收入接近同行的三倍,而 43% 的企业称现有架构已成为主要障碍。IDC 预测,未启动数据债务修复的 CIO 到 2027 年将面临 50% 的 AI 失败率,38% 的亚太企业把云端数据管理平台列为 2026 年现代化投资首要方向。

4月8日周三
  1. MongoDB BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB Atlas 预测性自动扩缩容已投产:用负载周期与趋势提前扩容

    MongoDB 已将预测性自动扩缩容在 MongoDB Atlas 投产,利用负载的周期与趋势模式在副本集过载前提前扩容,缩容仍由现有响应式算法负责。该能力源于 2023 年的原型研究,当时评估了哪种机器学习模型预测效果最好,并估算其对性能与客户成本的改善。

4月1日周三
  1. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实验:少量微调即可提升推理模型 CoT 可控性

    METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。

3月25日周三
  1. Modal BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Doppel 如何用 Modal 消除机器学习基础设施负担

    安全公司 Doppel 将大部分机器学习工作流迁移至 Modal,训练端用 map() 并行跑 K-fold 交叉验证等实验,推理端借镜像层缓存与模型权重持久卷把构建时间最多缩短 10 倍,复杂模型也能实现亚分钟级热构建。此前其 GCP 推理栈依赖 Cloud Run 单 GPU 实例,镜像构建常需 10–30 分钟,且面临冷启动与扩容延迟。

3月24日周二
  1. Jim Fan(@DrJimFan)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 转发 EgoVerse:用第一人称人类数据做机器人学习

    Jim Fan 转发并评论 Danfei Xu 发布的 EgoVerse,这是一个基于第一人称人类数据进行机器人学习的生态。他称自 EgoScale 和灵巧度扩展定律公布后,直接对人类行为做行为克隆已成为打破遥操作限制的路径,2026 年的重点是无需机器人本体来扩展机器人学习。

  2. Lex Fridman(@lexfridman)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 对话 NVIDIA CEO 黄仁勋:谈 AI 扩展定律、供应链与 AGI 时间表

    Lex Fridman 发布了对 NVIDIA CEO 黄仁勋的访谈,话题覆盖 AI 全栈工程、内存、电力与供应链(TSMC、ASML 等),以及 AI 扩展定律及其最大阻碍。对话还涉及黄仁勋的管理方式、NVIDIA 的护城河、中国与台海、太空 AI 数据中心,以及"NVIDIA 市值会到 10 万亿美元吗"、AGI 时间表、编程的未来、意识与死亡等话题。

3月21日周六
  1. Aman Sanger(@amanrsanger)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 的 Composer-2 以 Kimi k2.5 为基座并经 CPT 与 RL 训练

    Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。

3月18日周三
  1. Mistral AI(@MistralAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI 推出企业级系统 Forge,用私有知识训练前沿级模型

    Mistral AI 推出 Forge,一套供企业基于自有专有知识构建前沿级 AI 模型的系统,目的是让模型理解企业内部系统、工作流和政策中的语境,而不是依赖公开数据。Mistral 表示已与 ASML、新加坡 DSO National Laboratories、Ericsson、欧洲空间局、新加坡 HTX 和 Reply 等机构合作,用其专有数据训练模型。

3月17日周二
  1. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 pgvector 起步:为什么你会比预想更快地遇到瓶颈

    基于对 Hacker News 和 Reddit 上 110+ 社区讨论的分析,多数应用会比预期更早触达 pgvector 的极限。维持 pgvector 舒适运行需同时满足六个条件:向量数据低于约 1M、不需要精确的元数据过滤、嵌入向量与关系数据紧耦合、不需要混合搜索、Postgres 已承担核心业务逻辑、团队小且 SQL 搜索逻辑可控。

3月13日周五
  1. Berkeley AI Research BlogAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件三类归因中大规模识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,在约少 10 倍消融次数下达到 SPEX 的性能。

3月12日周四
  1. Citrini ResearchAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research:AI 光互连之后,下一个瓶颈在光子学供应链

    Citrini Research 认为 AI 光互连交易已成熟拥挤,下一个非对称机会在更底层的光子学供应链,包括光子组件、基板与资本设备,以及 CPO 成为必需品后的受益企业。其互连篮子自发布以来已涨逾三倍,年内迄今上涨 35%,领涨的是 Lumentum。超大规模厂商 2026 年资本支出预计达 6500 亿至 7000 亿美元,该机构同时建议对部分早期标的不必再追高、考虑获利了结。

3月11日周三
  1. Hugging Face(@huggingface)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 推出 Storage Buckets:面向 AI 高吞吐场景的类 S3 可变存储

    Hugging Face 上线 Storage Buckets,提供类 S3 的可变存储,主打快速写入、覆盖写和目录同步,由 Xet 去重驱动,使连续 checkpoint 可跳过已存在的字节。官方称该方案比 Git 更适合 AI 高吞吐场景,覆盖 checkpoint、处理后的数据、智能体 trace 和日志等,且成本更低、速度更快。

  2. Lilian Weng(@lilianweng)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 与英伟达合作,为前沿模型训练和可定制 AI 平台提供算力

    Thinking Machines 宣布与英伟达达成合作,由英伟达为其前沿模型训练和提供可定制 AI 的平台提供算力支持。该公司同时表示正在打造相关技术,以在下一代硬件上大规模实现更好的人机协作。

3月9日周一
  1. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么稀疏嵌入在电商搜索中胜过 BM25:微调 SPLADE 教程第一部分

    稀疏嵌入经微调后在 Amazon ESCI 数据集上相对 BM25 实现 17% 的提升。稀疏向量维度约 3 万、每个商品仅 100-400 个非零值,用倒排索引做精确匹配,能区分「iPhone 15 Pro Max 256GB」与 128GB 这类稠密嵌入会混淆的细节。

  2. QdrantAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Modal 上训练 SPLADE:电商搜索稀疏嵌入微调实战(第二部分)

    这是稀疏嵌入微调教程第二部分,使用 Amazon ESCI 数据集在 Modal 无服务器 A100 GPU 上训练 SPLADE 模型,以 Exact 和 Substitute 商品对作为正样本进行对比学习,10 万样本训练成本约 0.35 美元。

  3. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何在 Modal 上用 Amazon ESCI 数据集训练 SPLADE 稀疏嵌入模型

    该系列第二部分展示了在 Modal 无服务器 GPU 上训练 SPLADE 稀疏嵌入模型的完整流程,训练数据为 Amazon ESCI 数据集,包含 120 万+查询-商品对及四级相关性标注。

3月5日周四
  1. Andrew Ng(@AndrewYNg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 与 Google 合作推出 JAX 大模型构建与训练新课

    Andrew Ng 与 Google 合作推出短课程《Build and Train an LLM with JAX》,由 @chrisachard 讲授,教你用 JAX 从零构建并训练一个 2000 万参数的语言模型,实现完整的 MiniGPT 架构并通过图形界面对话。

3月2日周一
  1. Hamel HusainAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hamel Husain 与 Shreya Shankar 发布 evals skills 评估技能包

    Hamel Husain 和 Shreya Shankar 发布 evals skills,一套面向 AI 产品评估的 Agent 技能包,帮助避开评估中的常见踩坑。

2月26日周四
  1. Jim Fan(@DrJimFan)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 感谢灵巧手硬件供应商 Sharpa 的支持

    Jim Fan 公开致谢灵巧手硬件供应商 Sharpa,感谢其提供的支持。Sharpa 为其项目提供灵巧手硬件。