Eugene Yan 回顾 AI Engineer 2024 闭幕主题演讲:一年 LLM 实践心得
Eugene Yan 与《What We've Learned From A Year of Building with LLMs》的合著者在 AI Engineer World's Fair 2024 发表闭幕主题演讲,采用六人配对(2 x 2 x 2)形式,相关 slides 已发布、录像稍后放出。
Eugene Yan 与《What We've Learned From A Year of Building with LLMs》的合著者在 AI Engineer World's Fair 2024 发表闭幕主题演讲,采用六人配对(2 x 2 x 2)形式,相关 slides 已发布、录像稍后放出。
OnBoard! 播客第55期对话 UCSD 计算机科学副教授苏昊,他同时是智能机器人创业公司 Hillbot 的联合创始人兼CTO。节目围绕大模型如何影响具身智能的技术路径、机器人数据采集与示范学习、模拟器与 sim2real 等问题展开,苏昊还介绍了自己的创业项目 Hillbot。
阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。
Netflix 2024 个性化、推荐与搜索研讨会上,Amazon 高级应用科学家 Eugene Yan 分享了在消费者规模下构建和部署 LLM 驱动推荐体验所面临的挑战与经验。同场议题还包括 Meta 的万亿参数生成式推荐序列转换器、Netflix 的对话式 RecSys,以及 Spotify、Airbnb、Google、OpenAI 等团队在推荐与 AI 鲁棒性方面的工作。
Eugene Yan 发布 2023 年度回顾,记录自己因 gpt-3.5-turbo 的跃升式改进而转向语言模型研究,并做出一系列原型,包括 Discord 机器人和基于词汇与嵌入向量 RAG 的 Obsidian copilot,还微调了一个面向域外数据的幻觉分类器。他随后将工作重心转向 GenAI,Charter 扩展到跨组织的 GenAI 部署与成本优化,并已上线两个原型、另有四个在推进。
借两位老友对话,《Mind the Future》的 Richard Ngo 把 Scott Alexander 笔下的 Moloch(协调失败之神)与迦南死寂之神 Mot(技术缺失之神)并列审视:既然缺乏技术同样是默认状态、需要努力才能逃脱,为何把苦难归咎于协调失败就更合理?文中指出车轮与罗马玩具蒸汽机显示,缺乏需求也会让突破延误两千年,而 Moloch 不仅是外部障碍,更是一种心态。
Geoffrey Hinton 公开反驳 Yann LeCun 关于"AI 接管人类风险极小"的判断,认为这等于给自身观点极高权重、给众多同等资历专家的意见极小权重。该帖获 4208 点赞、469 转发,浏览量超 288 万。
Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。
2023 年发布的 AI 进展将永久改变世界。Barsee 在 X 上发布了一条附带资源清单的 MEGA THREAD,汇总今年值得关注的 AI 进展,截至发布已获得 1199 次点赞、290 次转发和 56 万次浏览。
Eugene Yan 提出用"最少对话"替代聊天框作为 LLM 应用的主要交互方式,让用户以点击为主、输入为辅。其原型融合推荐系统、NLP 与 LLM:通过物品嵌入的近似最近邻检索相似项,用 LTR 模型或启发式排序,关键词(如"女性作者的书")预先缓存而非实时用 LLM 抽取;用户历史行为被存储,因此简单提问也能获得个性化回答。
一条推文展示的 AI 生成《速度与激情》新片片段被吐槽“看起来有点怪”,推文获得 895 个点赞、111 次转发和约 26 万次浏览。
为测试 LLM 的训练数据与表现,Eugene Yan 让 gpt-4、claude-v1.2、cohere-xlarge 等模型为自己写传记,结果 gpt3.5/4 整体表现最好,大意正确但细节多有错误。他指出不同模型在记忆与复述程度上差异明显,且这些模型无法联网,输出完全基于训练数据。
奇想驿主播在 2022 年终总结中回顾,自己在合伙人 @Light 影响下重新理解「实事求是」,更追求「真」而非叙述意义上的「美」,尝试以工程视角做事而非依赖灵感。他提到创业第一年需发散思维捕捉机会,业务进入轨道后则要切换到工程模式,一边解决问题一边设计解决问题的机器。文末附有音乐与私人推荐清单,并邀请听众通过奇想驿邀请码注册 flomo。
Eugene Yan 发布 2022 年度回顾:全年写了 18/26 篇文章,拿到 L5 到 L6 晋升,在 RecSys 线上推荐系统 workshop 做主旨演讲,并创办 ML Meetups Virtual,7 月至 12 月办 7 场活动,群组成员达 1,400 人。2023 年目标仍是写 26 篇文章,其中与编辑合作至少 4 篇,并深入学习搜索基础、Python、工程与 MLOps。
播客「奇想驿」主播少楠与「理想屯」球姐对谈,围绕斯多葛学派、勒内·吉拉德的模仿欲望理论和科幻爱好展开。节目还聊到信息爆炸时代的知识输入与个人知识管理体系搭建、Notion 的设计运营理念,以及如何用 AI 工具辅助科幻创作,并推荐了《纳瓦尔宝典》《像哲学家一样生活》等延伸阅读。
@lvinwan 在 BAIR 新博客中介绍了如何让模型达到与神经网络相当的精度,同时具备可解释的决策过程。文章围绕可解释 AI 未能解决的问题展开,探讨兼顾准确性与可解释性的建模思路。
Lilian Weng 撰文探讨深度神经网络参数极多却仍能泛化的问题,梳理了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度等经典压缩与模型选择理论,并借"生物学家能修好收音机吗"类比揭示局部观察难以还原系统全貌。文章后续更新增补了 Lottery Ticket Hypothesis 一节。