跳到正文

#现象/趋势

今日 103 条
6月27日周四
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 回顾 AI Engineer 2024 闭幕主题演讲:一年 LLM 实践心得

    Eugene Yan 与《What We've Learned From A Year of Building with LLMs》的合著者在 AI Engineer World's Fair 2024 发表闭幕主题演讲,采用六人配对(2 x 2 x 2)形式,相关 slides 已发布、录像稍后放出。

6月13日周四
  1. OnBoard!AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EP 55. 对话UCSD副教授苏昊:从学术到创业,深度解读具身智能的实现路径

    OnBoard! 播客第55期对话 UCSD 计算机科学副教授苏昊,他同时是智能机器人创业公司 Hillbot 的联合创始人兼CTO。节目围绕大模型如何影响具身智能的技术路径、机器人数据采集与示范学习、模拟器与 sim2real 等问题展开,苏昊还介绍了自己的创业项目 Hillbot。

6月7日周五
  1. OnBoard!AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度对谈顶尖 AI 开源项目:通义千问 Qwen、vLLM、OpenDevin 与中国开源力量

    阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。

5月31日周五
  1. Eugene YanAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Netflix PRS 2024:将 LLM 应用于推荐体验

    Netflix 2024 个性化、推荐与搜索研讨会上,Amazon 高级应用科学家 Eugene Yan 分享了在消费者规模下构建和部署 LLM 驱动推荐体验所面临的挑战与经验。同场议题还包括 Meta 的万亿参数生成式推荐序列转换器、Netflix 的对话式 RecSys,以及 Spotify、Airbnb、Google、OpenAI 等团队在推荐与 AI 鲁棒性方面的工作。

12月31日周日
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2023 年度回顾:LLM 探索、角色转型与写作

    Eugene Yan 发布 2023 年度回顾,记录自己因 gpt-3.5-turbo 的跃升式改进而转向语言模型研究,并做出一系列原型,包括 Discord 机器人和基于词汇与嵌入向量 RAG 的 Obsidian copilot,还微调了一个面向域外数据的幻觉分类器。他随后将工作重心转向 GenAI,Charter 扩展到跨组织的 GenAI 部署与成本优化,并已上线两个原型、另有四个在推进。

12月4日周一
  1. Mind the Future — Richard NgoAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Moloch 到 Mot:我们能否把技术停滞也归咎于一位迦南神?

    借两位老友对话,《Mind the Future》的 Richard Ngo 把 Scott Alexander 笔下的 Moloch(协调失败之神)与迦南死寂之神 Mot(技术缺失之神)并列审视:既然缺乏技术同样是默认状态、需要努力才能逃脱,为何把苦难归咎于协调失败就更合理?文中指出车轮与罗马玩具蒸汽机显示,缺乏需求也会让突破延误两千年,而 Moloch 不仅是外部障碍,更是一种心态。

11月25日周六
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton 回应 Yann LeCun:认为 AI 接管风险极小,等于只信自己

    Geoffrey Hinton 公开反驳 Yann LeCun 关于"AI 接管人类风险极小"的判断,认为这等于给自身观点极高权重、给众多同等资历专家的意见极小权重。该帖获 4208 点赞、469 转发,浏览量超 288 万。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。

6月12日周一
  1. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Barsee 发布 2023 年 AI 发展年度盘点长线程

    2023 年发布的 AI 进展将永久改变世界。Barsee 在 X 上发布了一条附带资源清单的 MEGA THREAD,汇总今年值得关注的 AI 进展,截至发布已获得 1199 次点赞、290 次转发和 56 万次浏览。

4月30日周日
  1. Eugene YanAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用最少对话与 LLM 交互:Eugene Yan 的点击式 LLM 应用原型

    Eugene Yan 提出用"最少对话"替代聊天框作为 LLM 应用的主要交互方式,让用户以点击为主、输入为辅。其原型融合推荐系统、NLP 与 LLM:通过物品嵌入的近似最近邻检索相似项,用 LTR 模型或启发式排序,关键词(如"女性作者的书")预先缓存而非实时用 LLM 抽取;用户历史行为被存储,因此简单提问也能获得个性化回答。

4月1日周六
  1. Barsee 🐶(@heyBarsee)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 生成的《速度与激情》新片片段看起来有点怪

    一条推文展示的 AI 生成《速度与激情》新片片段被吐槽“看起来有点怪”,推文获得 895 个点赞、111 次转发和约 26 万次浏览。

3月19日周日
  1. Eugene YanAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4、Claude 等 LLM 为我写传记:谁记得更准?

    为测试 LLM 的训练数据与表现,Eugene Yan 让 gpt-4、claude-v1.2、cohere-xlarge 等模型为自己写传记,结果 gpt3.5/4 整体表现最好,大意正确但细节多有错误。他指出不同模型在记忆与复述程度上差异明显,且这些模型无法联网,输出完全基于训练数据。

12月31日周六
  1. 奇想驿 by 产品沉思录AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2022 年的吉光片羽:以苦酿蜜,方知甘甜

    奇想驿主播在 2022 年终总结中回顾,自己在合伙人 @Light 影响下重新理解「实事求是」,更追求「真」而非叙述意义上的「美」,尝试以工程视角做事而非依赖灵感。他提到创业第一年需发散思维捕捉机会,业务进入轨道后则要切换到工程模式,一边解决问题一边设计解决问题的机器。文末附有音乐与私人推荐清单,并邀请听众通过奇想驿邀请码注册 flomo。

12月24日周六
  1. Eugene YanAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2022 年度回顾与 2023 年目标

    Eugene Yan 发布 2022 年度回顾:全年写了 18/26 篇文章,拿到 L5 到 L6 晋升,在 RecSys 线上推荐系统 workshop 做主旨演讲,并创办 ML Meetups Virtual,7 月至 12 月办 7 场活动,群组成员达 1,400 人。2023 年目标仍是写 26 篇文章,其中与编辑合作至少 4 篇,并深入学习搜索基础、Python、工程与 MLOps。

9月7日周三
  1. 奇想驿 by 产品沉思录AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与理想屯的球姐聊聊:斯多葛学派、模仿欲望、知识管理以及中国科幻

    播客「奇想驿」主播少楠与「理想屯」球姐对谈,围绕斯多葛学派、勒内·吉拉德的模仿欲望理论和科幻爱好展开。节目还聊到信息爆炸时代的知识输入与个人知识管理体系搭建、Notion 的设计运营理念,以及如何用 AI 工具辅助科幻创作,并推荐了《纳瓦尔宝典》《像哲学家一样生活》等延伸阅读。

4月26日周日
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    可解释 AI 未做到的:@lvinwan 谈如何让模型兼具神经网络精度与可解释决策过程

    @lvinwan 在 BAIR 新博客中介绍了如何让模型达到与神经网络相当的精度,同时具备可解释的决策过程。文章围绕可解释 AI 未能解决的问题展开,探讨兼顾准确性与可解释性的建模思路。

3月14日周四
  1. Lilian Weng — Lil’LogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度神经网络真的严重过拟合了吗?

    Lilian Weng 撰文探讨深度神经网络参数极多却仍能泛化的问题,梳理了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度等经典压缩与模型选择理论,并借"生物学家能修好收音机吗"类比揭示局部观察难以还原系统全貌。文章后续更新增补了 Lottery Ticket Hypothesis 一节。