跳到正文

#现象/趋势

今日 100 条
8月12日周二
  1. METRAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 谈科学传播:如何准确传达 AI 令人意外的研究结果

    METR 在发布《Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity》后,撰文说明其科学传播策略:在"AI 让开发者变慢"与"开发者高估 AI 加速效果"两种表述间,最终选择突出实测到的变慢结果。

7月26日周六
  1. 保持偏见AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    爆发前夜:自动驾驶的百年进化史

    自动驾驶的研究已走过一个多世纪,从达·芬奇画出的发条自动车草图,到1939年世博会上通用汽车的"电子高速公路"模型,再到DARPA无人车大赛和Google 2008年启动的自动驾驶项目,这条技术路线横跨美国、日本与欧洲。节目按"史前—上古—当代—未来"的时间轴,串起鸽子制导导弹、斯坦福月球车、NavLab、Waymo 商用与特斯拉第一性原理等关键节点。

7月10日周四
  1. OnBoard!AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话硅谷增长顾问陈唱:拆解 HeyGen、Gamma、Otter.ai 的百万用户增长实践

    硅谷增长顾问陈唱在 OnBoard! 播客中拆解了 HeyGen、Gamma、Otter.ai 等 AI 产品的增长实践,并提到 Cartesia 成立不到两年融资超 $90M。

7月3日周四
  1. OnBoard!AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 AppLovin 技术 VP 葛小川:2 年市值增长 25 倍,千亿美金广告平台的传奇成长史

    AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。

6月28日周六
  1. 保持偏见AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    播客《赌徒孙正义》:从英伟达到星际之门,软银创始人的豪赌人生

    一档播客梳理孙正义从软银创立、投资Yahoo!和阿里巴巴,到收购ARM、设立愿景基金及WeWork巨亏的赌徒式历程。节目提到黄仁勋称孙正义曾是英伟达最大股东,以及OpenAI、甲骨文与软银联合打造的5000亿美元星际之门AI项目。

6月27日周五
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 谈前沿 AI 模型风险披露:公司应共享哪些信息?

    METR 提出前沿 AI 风险透明度框架,认为仅靠公开部署时的 system card 不足以发现模型不对齐或后门,需披露训练与开发过程信息。该框架覆盖模型能力是否超过公开认知、内部与外部能力差距、不对齐证据等议题,并建议每 3 个月由外部风险审查团队出具报告、经可信中介匿名化后共享给董事会与相关政府机构。

6月4日周三
  1. Eugene YanAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer 2025:用 LLM 技术改进推荐系统与搜索

    Eugene Yan 在旧金山 AI Engineer World's Fair 2025 主持了 RecSys track,并公开了开场 slides 与整场 YouTube 录像。该 track 聚焦如何用 LLM 技术改进推荐系统与搜索。

5月30日周五
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton 转发 AI 就业冲击合辑:The Great AI Job Displacement Is Closer Than You Think

    Geoffrey Hinton 转发并称赞了一部汇集多方观点的合辑视频,主题是 AI 即将带来的变化。该合辑出自 Scr0nkf1nkle,标题为 The Great AI Job Displacement Is Closer Than You Think。

5月23日周五
  1. Barsee 🐶(@heyBarsee)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一周 AI 大事:Google Veo 3、Anthropic Claude 4 等集中发布

    Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。

  2. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 AI 大事件:Google Veo 3、OpenAI 与 Jony 的 IO、Anthropic Claude 4 等

    Google 发布 Veo 3,OpenAI 与 Jony 推出 IO,Anthropic 发布 Claude 4,同时传出 Apple Glasses、Google Glasses 及 Tesla Optimus 的新进展。Anthropic CEO 还给出 2026 年 AI 预测。

5月13日周二
  1. Lilian Weng(@lilianweng)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 吐槽数据集泛滥:又见 meta-mixed 拼盘,担忧数据污染

    Lilian Weng 表示,每次新数据集发布她都会去看,但发现又是把已有数据集拼在一起的 meta-mixed 数据集,第一反应就是"数据污染"。她直言不想再看到 meta-meta-mixed 数据集。

5月1日周四
  1. Lilian Weng — Lil’LogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么我们会思考:测试时计算与思维链综述

    Lilian Weng 撰文综述测试时计算与思维链推理的近期进展,解释让模型想更久为何有效。文章从心理学类比、算力资源和隐变量建模三方面给出动机,梳理并行采样与顺序修订两类解码策略,并分析 DeepSeek-R1 等基于 RL 的推理训练方法。文中还讨论思维链忠实性的失败模式,以及连续空间思考、思考 token 和测试时计算缩放规律等方向,并列出待解开放问题。

4月29日周二
  1. Lilian Weng(@lilianweng)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 回应"听说过 arXiv 吗":ICLR OpenAI 招聘活动上的对话

    Lilian Weng 回应了一条推文:Isa Fulford 在 ICLR 的 OpenAI 招聘活动上被人问"你听说过 arXiv 吗"。该推文获得 243 次点赞和 8.4 万次浏览。

  2. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 称 ResearchGate 推送假冒其与 Yann LeCun 署名的 AI 论文

    Geoffrey Hinton 表示 ResearchGate 向他推送了一篇假冒论文《The AI Health Revolution: Personalizing Care through Intelligent Case-based Reasoning》,声称作者是他与 Yann LeCun。他指出该论文超过三分之一的引用指向 Shefiu Yusuf。

4月23日周三
  1. 奇想驿 by 产品沉思录AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    flomo 5 周年:AI 时代用自己的话记录还有意义吗

    flomo 迎来 5 周年,仍坚持「一个笔记的长期主义」,没有外部融资、团队独立运营。在随时能得到答案的 AI 时代,其创始人重新回应"用自己的话记录是否还有意义":记录是为了更好地思考和行动,AI 有替代思考与促进思考两条道路,真实的思考痕迹更能代表真实的自己。

4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

4月19日周六
  1. 保持偏见AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    劳模雷军:从金山、小米到造车,假如生命明天就会终止你还会创业吗?

    播客《保持偏见》第23期回顾雷军从写程序、创办三色公司、加入金山到创办小米、投资UC浏览器与凡客诚品,再到造车与芯片的多次转身。节目以“假如生命明天就会终止的话,你今天还会创业吗”为线索,串起他与求伯君、董明珠、周鸿祎、黄章等人的恩怨与赌约。

3月13日周四
  1. 保持偏见AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据之王扎克伯格:操控世界的程序员

    这期播客回顾了扎克伯格从10岁开始编程、高中写出价值100万美元音乐播放器,到创立Facebook的全过程,并梳理了股权稀释、肖恩·帕克与彼得·蒂尔入局、收购Instagram和WhatsApp等关键节点。节目还讨论了信息流广告、假新闻、美国大选中的信息操控,以及扎克伯格转向元宇宙和人工智能的新赛道。

2月8日周六
  1. Jan Leike(@janleike)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 挑战赛 4 天:12 人通关 level 4,1 人攻破 level 5

    Jan Leike 发起的挑战赛进行 4 天,已有 12 人通关 level 4,1 人攻破 level 5,挑战仍在继续。

2月6日周四
  1. Jan Leike(@janleike)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 的越狱挑战开赛 48 小时:无人通过第 4 关

    Jan Leike 发起的越狱挑战开赛约 48 小时,尚无人通过第 4 关,但通关第 3 关的人数明显增多。

12月30日周一
  1. OnBoard!AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! EP 66 深度解读 Coding Agent 与 OpenAI o3:中美创业者、研究员与投资人的未来判断

    OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。

12月25日周三
  1. OnBoard!AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Comfy 核心中国力量:多模态生成全球狂奔之年,开源与商业化发生了什么

    Comfy 中国社区创始团队发起的 Comfy Community Summit 第二站在东京举办,主理人 AJ、前 Stability AI 工程师 Yizhou、HuggingFace 工程师 Tiezhen 与 TheSEA AI 创始人 Yanjin 共同回顾多模态生成与 ComfyUI 开源社区的兴起。

12月22日周日
  1. Eugene YanAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2024 年度回顾:LLM 系统投产、AlignEval 与健康改善

    Eugene Yan 的 2024 年度回顾显示,他今年把 2023 年的原型推向生产,交付了服务客户的 ML/LLM 系统,并发布了 AlignEval,用户已上传 538 个数据集文件、其中 84 个文件标注 50 条以上样本并优化了 LLM-evaluator。

12月17日周二
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直播回放:什么是开发大模型应用的新一代底层技术栈?对谈贾扬清、PingCAP 黄东旭和 AWS Bedrock 核心成员

    OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。

11月30日周六
  1. Hamel HusainAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何通过技术写作建立受众:策略与常见错误

    Hamel Husain 分享了在 AI 领域通过技术写作建立受众的 5 个策略:在他人优秀工作上做延伸、保持稳定输出、提升文案写作能力、搭建语音转内容流水线和善用独特视角。

11月28日周四
  1. Lilian Weng — Lil’LogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    强化学习中的 Reward Hacking:从奖励函数设计到 RLHF 的隐患

    Lilian Weng 撰文梳理强化学习中的 reward hacking,即智能体利用奖励函数的缺陷或歧义刷高奖励、却不真正完成任务。该现象源于奖励函数难以精确设定,随着 RLHF 成为语言模型对齐训练的默认方法,模型改写单元测试以通过编程任务、或输出迎合用户偏好的偏见回答,已成为 AI 模型更自主部署的主要障碍之一。

9月19日周四
  1. OnBoard!AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度访谈 Castbox 王小雨:50+ 款出海产品、5 千万月活,播客 App 如何完成 AI 转型

    Castbox 创始人兼 CEO 王小雨在播客访谈中回顾,2016 年创立的 Castbox 注册用户曾达 3000 万,位列第三方播客产品榜首。其公司如今拥有 50 多款产品和全球 5000 多万月活用户,已上线数款 AI native 产品并把 AI 融入各产品工作流。她谈到 AI 应用带来公司历史最快增长,而懂 AI 边界是当下 AI 产品经理的关键能力。

9月13日周五
  1. OnBoard!AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全英文对话 CRV 投资人与 LanceDB 创始人:向量数据库下半场,大模型和多模态需要怎样的数据基建?

    LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。

7月11日周四
  1. OnBoard!AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! X 十字路口:哪些华人创办的 AI 产品正在"闷声赚大钱"?

    OnBoard! 与播客「十字路口」串台,盘点华人创办、分布在国内、硅谷、新加坡、日本等地的 AI 产品,包括 PictureThis、Speak、UMU、HeyGen、Opus Clip、Monica.im、Devin 等。

7月5日周五
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! 听友会实录:Monica.im、Answer AI、Logto 创始人谈出海如何打造百万用户产品

    Monica.im 创始人肖弘、Answer AI 创始人周立与 Logto 产品市场负责人李铭在 OnBoard! 听友会上分享出海实战经验,三家公司分别面向知识工作者、北美七至十二年级及大学生、全球开发者。

6月27日周四
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 回顾 AI Engineer 2024 闭幕主题演讲:一年 LLM 实践心得

    Eugene Yan 与《What We've Learned From A Year of Building with LLMs》的合著者在 AI Engineer World's Fair 2024 发表闭幕主题演讲,采用六人配对(2 x 2 x 2)形式,相关 slides 已发布、录像稍后放出。

6月13日周四
  1. OnBoard!AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EP 55. 对话UCSD副教授苏昊:从学术到创业,深度解读具身智能的实现路径

    OnBoard! 播客第55期对话 UCSD 计算机科学副教授苏昊,他同时是智能机器人创业公司 Hillbot 的联合创始人兼CTO。节目围绕大模型如何影响具身智能的技术路径、机器人数据采集与示范学习、模拟器与 sim2real 等问题展开,苏昊还介绍了自己的创业项目 Hillbot。

6月7日周五
  1. OnBoard!AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度对谈顶尖 AI 开源项目:通义千问 Qwen、vLLM、OpenDevin 与中国开源力量

    阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。

5月31日周五
  1. Eugene YanAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Netflix PRS 2024:将 LLM 应用于推荐体验

    Netflix 2024 个性化、推荐与搜索研讨会上,Amazon 高级应用科学家 Eugene Yan 分享了在消费者规模下构建和部署 LLM 驱动推荐体验所面临的挑战与经验。同场议题还包括 Meta 的万亿参数生成式推荐序列转换器、Netflix 的对话式 RecSys,以及 Spotify、Airbnb、Google、OpenAI 等团队在推荐与 AI 鲁棒性方面的工作。

12月31日周日
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2023 年度回顾:LLM 探索、角色转型与写作

    Eugene Yan 发布 2023 年度回顾,记录自己因 gpt-3.5-turbo 的跃升式改进而转向语言模型研究,并做出一系列原型,包括 Discord 机器人和基于词汇与嵌入向量 RAG 的 Obsidian copilot,还微调了一个面向域外数据的幻觉分类器。他随后将工作重心转向 GenAI,Charter 扩展到跨组织的 GenAI 部署与成本优化,并已上线两个原型、另有四个在推进。

12月4日周一
  1. Mind the Future — Richard NgoAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Moloch 到 Mot:我们能否把技术停滞也归咎于一位迦南神?

    借两位老友对话,《Mind the Future》的 Richard Ngo 把 Scott Alexander 笔下的 Moloch(协调失败之神)与迦南死寂之神 Mot(技术缺失之神)并列审视:既然缺乏技术同样是默认状态、需要努力才能逃脱,为何把苦难归咎于协调失败就更合理?文中指出车轮与罗马玩具蒸汽机显示,缺乏需求也会让突破延误两千年,而 Moloch 不仅是外部障碍,更是一种心态。

11月25日周六
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton 回应 Yann LeCun:认为 AI 接管风险极小,等于只信自己

    Geoffrey Hinton 公开反驳 Yann LeCun 关于"AI 接管人类风险极小"的判断,认为这等于给自身观点极高权重、给众多同等资历专家的意见极小权重。该帖获 4208 点赞、469 转发,浏览量超 288 万。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。

6月12日周一
  1. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Barsee 发布 2023 年 AI 发展年度盘点长线程

    2023 年发布的 AI 进展将永久改变世界。Barsee 在 X 上发布了一条附带资源清单的 MEGA THREAD,汇总今年值得关注的 AI 进展,截至发布已获得 1199 次点赞、290 次转发和 56 万次浏览。

4月30日周日
  1. Eugene YanAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用最少对话与 LLM 交互:Eugene Yan 的点击式 LLM 应用原型

    Eugene Yan 提出用"最少对话"替代聊天框作为 LLM 应用的主要交互方式,让用户以点击为主、输入为辅。其原型融合推荐系统、NLP 与 LLM:通过物品嵌入的近似最近邻检索相似项,用 LTR 模型或启发式排序,关键词(如"女性作者的书")预先缓存而非实时用 LLM 抽取;用户历史行为被存储,因此简单提问也能获得个性化回答。