跳到正文

#现象/趋势

今日 98 条
11月18日周二
  1. 无人知晓AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    孟岩对话微软中国 CTO 韦青:沉默的主角

    播客「无人知晓」E42 中,孟岩与微软(中国)首席技术官韦青对谈五个多小时,主题为「沉默的主角」。韦青提出「想、能、应、可、已、正、将」框架与「认错、知错、改错」三错法,并谈及微软从 Know-it-all 到 Learn-it-all 的文化转型、异常值的价值以及 AI 时代人如何自处。

11月17日周一
  1. 语言即世界language is worldAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    自动驾驶系统的局部最优陷阱

    自动驾驶长期依赖数据飞轮与端到端模型,通过挖掘海量路测数据打补丁来提升能力,但这一数据优先路径正遭遇瓶颈:长尾场景成本剧增、泛化能力受限。作者主张从自动驾驶2.0的“数据优先”转向以推理为核心的3.0,需要推理能力、常识、长时程记忆与解释交互四大支柱。英伟达2025年10月发布Alpamayo-R1,将显式因果推理与轨迹规划整合进统一VLA架构;特斯拉也计划在下一代FSD中引入推理增强。

11月10日周一
  1. 牛油果烤面包AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大模型时代的AI该如何以人为本:芝加哥大学谭宸浩谈人本AI与AI科研

    芝加哥大学谭宸浩教授做客「牛油果烤面包」,讨论大模型时代AI的透明度与公平性变化,以及人类与AI在科研中可扮演的角色。他还谈到NLP业内如何看待大模型时代,并探讨了全自动AI科研的假设与如何让科学发展以人为本。

11月8日周六
  1. Adam D'Angelo(@adamdangelo)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adam D'Angelo 与 Amjad Masad 对谈:未来五年智能体、AI 廉价劳动力与单人创业

    Quora CEO Adam D'Angelo 与 Replit CEO Amjad Masad 在 a16z 节目中对话,认为围绕 AGI 时间线和泡沫的炒作之下,智能体仍在快速进步,已初现可靠的计算机使用能力,未来将大幅提升单人创业能力并自动化大量知识工作。

11月5日周三
  1. 此话当真AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话秦宇迪:清华极客用 AI 智能体做能源管理,链宇科技落地 V2G

    清华本博连读、两次创业的秦宇迪创立链宇科技,用 AI 智能体实现能源智能调度,让能源像金融资产一样稳定产生现金流。链宇已承担全国数量最多的国家级车网互动 V2G 试点,2024 年与中建集团合作的绿色智能住宅方案在中国建筑科技展亮相,获李强总理参观与肯定。

11月4日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    超越标准 LLM:线性注意力混合架构等替代方案解析

    当前最强的开源权重 LLM,从 DeepSeek R1 到 MiniMax-M2,仍基于自回归 decoder 式 Transformer 与多头注意力机制,但文本扩散模型、线性注意力混合架构等替代方案近年来不断涌现。

10月30日周四
  1. 硬地骇客AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP116:AI 浏览器深度解析,OpenAI Atlas 与效率、隐私及市场格局

    OpenAI 传闻已久的 "Atlas" 浏览器正式发布,硬地骇客在 EP116 中解析 AI 浏览器的独特价值、与插件的差异及隐私安全问题。节目还讨论了 AI 原生浏览器的合规性与设计理念、Atlas 收购 Dia 的战略意义,以及 Chromium 开源项目对 AI 浏览器未来的影响。

10月26日周日
  1. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    过去六个月最令人兴奋的 LLM 突破是什么?

    过去六个月最令人兴奋的 LLM 突破是什么?这条帖子获得 317 条回复、43 次转发、816 次点赞,浏览量达 258421 次。

10月22日周三
  1. 此话当真AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    真格基金戴雨森谈 AI 投资:只做天使、只投中国创业者,支持创造风口的人

    真格管理合伙人戴雨森在与李翔的对话中回顾了从聚美优品到 2017 年加入真格、从互联网转向 AI 投资的历程。真格坚持「只做天使、只投中国创业者」的「投人」哲学,Manus 创始人肖弘从大四黑客松第一笔投资到今天的 Manus 是其典型案例。戴雨森认为 ChatGPT、Kimi、Manus、Genspark 带来的生产力提升让人从「做不到」变成「能做到」,但这还只是开始。

10月21日周二
  1. Mind the Future — Richard NgoAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Ngo 与 Samo Burja 发布 21 世纪文明课程,聚焦现代政治基础问题

    Richard Ngo 与 Samo Burja 合作发布了一套关于现代政治基础问题的课程,共 11 个部分,10 月 27 日前可报名参加首批每周讨论小组,完整内容发布于 www.21civ.com。课程以西方文明为主题,探讨其如何在 21 世纪持续衰退,以及 AI 加速发展下未来数十年的不可预测性。内容偏重非正式博客与文章,兼顾政治事实与健康的政治情感和伦理立场,最终周聚焦德性的培养。

10月16日周四
  1. 硬地骇客AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP115:AI 时代我们是不是还在做老软件?

    播客「硬地骇客」EP115 围绕 A16z 合伙人 Alex Rampell 提出的"软件吞噬劳动力市场"展开讨论,认为 SaaS 不应只盯 3000 亿美元既有市场,而应看向美国一年 13 万亿美元的劳动力市场。节目指出传统 SaaS 侧重补充人脑与组织协同,AI 则直接交付结果、替代中间环节,新 AI 原生软件的主体是一个或多个 agent 的感知、计划执行与复盘调整,人在关键节点介入。

10月1日周三
  1. Arthur Mensch(@arthurmensch)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arthur Mensch 支持 Liam Fedus 创立 Periodic Labs,用自主实验室打造 AI 科学家

    Liam Fedus 与 Ekin Dogus 宣布创立 Periodic Labs,目标是打造 AI 科学家及供其运行的自主实验室,Arthur Mensch 公开表示支持。

9月11日周四
  1. Lilian Weng(@lilianweng)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines Lab 推出研究博客 Connectionism,首篇文章聚焦 LLM 推理中的非确定性

    Thinking Machines Lab 上线研究博客 Connectionism,首篇文章题为《Defeating Nondeterminism in LLM Inference》。该博客将覆盖从内核数值到提示词工程等研究话题,名称致敬 1980 年代研究神经网络与生物大脑相似性的联结主义学派。

8月20日周三
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 与 FRI 试点研究:AI 研发自动化加速的预测结果

    METR 与 Forecasting Research Institute 对 8 位 AI 预测专家和 10 位超级预测者开展试点调查,预测 AI 研发自动化后的加速与社会影响。研究设定的关键事件包括:若 2027 年前 AI 在 AI 研发任务上追平顶尖人类研究员,AI 进步速度出现 3 倍以上提升的概率,以及这种加速是否会带来全球能耗一年内翻倍或减半等极端后果。

8月17日周日
  1. Mind the Future — Richard NgoAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Ngo 论悲观化:直接、间接与反常三种形式

    Richard Ngo 提出"pessimization"(悲观化)概念,指行为导致与目标相反结果的现象,并将其分为三类:直接悲观化(对手蓄意损害你的利益,如恐怖袭击、种族灭绝)、间接悲观化(你的行动反而帮助他人达成你所反对的目标)和反常悲观化(一个名义上致力于某目标的机构或联盟实际在追求相反结果)。他认为理解这三类悲观化有助于更好地识别和推广相应的补救措施。

8月15日周五
  1. 此话当真AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话陈锴杰:97 年创业者三次转型,他做了世界上第一个 Personal Agent Macaron

    97 年出生的陈锴杰历经三次创业转型——智能家居中控机器人做到年营收 1000 万、基于 GPT-2 的 AI 游戏、300 万用户的 AI 互动故事平台 MidReal——如今推出 Macaron(macaron.im),称其为世界上第一个 personal agent。

8月12日周二
  1. METRAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 谈科学传播:如何准确传达 AI 令人意外的研究结果

    METR 在发布《Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity》后,撰文说明其科学传播策略:在"AI 让开发者变慢"与"开发者高估 AI 加速效果"两种表述间,最终选择突出实测到的变慢结果。

7月26日周六
  1. 保持偏见AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    爆发前夜:自动驾驶的百年进化史

    自动驾驶的研究已走过一个多世纪,从达·芬奇画出的发条自动车草图,到1939年世博会上通用汽车的"电子高速公路"模型,再到DARPA无人车大赛和Google 2008年启动的自动驾驶项目,这条技术路线横跨美国、日本与欧洲。节目按"史前—上古—当代—未来"的时间轴,串起鸽子制导导弹、斯坦福月球车、NavLab、Waymo 商用与特斯拉第一性原理等关键节点。

7月10日周四
  1. OnBoard!AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话硅谷增长顾问陈唱:拆解 HeyGen、Gamma、Otter.ai 的百万用户增长实践

    硅谷增长顾问陈唱在 OnBoard! 播客中拆解了 HeyGen、Gamma、Otter.ai 等 AI 产品的增长实践,并提到 Cartesia 成立不到两年融资超 $90M。

7月3日周四
  1. OnBoard!AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 AppLovin 技术 VP 葛小川:2 年市值增长 25 倍,千亿美金广告平台的传奇成长史

    AppLovin 技术副总裁葛小川在 OnBoard! 播客中回顾了这家广告技术平台从游戏营销公司到千亿美金市值公司的两次转型历程,并解析其核心广告推荐引擎 Axon AI 如何在微秒级处理上万亿次竞价、以 ROAS 而非 CTR 驱动投放决策。

6月28日周六
  1. 保持偏见AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    播客《赌徒孙正义》:从英伟达到星际之门,软银创始人的豪赌人生

    一档播客梳理孙正义从软银创立、投资Yahoo!和阿里巴巴,到收购ARM、设立愿景基金及WeWork巨亏的赌徒式历程。节目提到黄仁勋称孙正义曾是英伟达最大股东,以及OpenAI、甲骨文与软银联合打造的5000亿美元星际之门AI项目。

6月27日周五
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 谈前沿 AI 模型风险披露:公司应共享哪些信息?

    METR 提出前沿 AI 风险透明度框架,认为仅靠公开部署时的 system card 不足以发现模型不对齐或后门,需披露训练与开发过程信息。该框架覆盖模型能力是否超过公开认知、内部与外部能力差距、不对齐证据等议题,并建议每 3 个月由外部风险审查团队出具报告、经可信中介匿名化后共享给董事会与相关政府机构。

6月4日周三
  1. Eugene YanAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer 2025:用 LLM 技术改进推荐系统与搜索

    Eugene Yan 在旧金山 AI Engineer World's Fair 2025 主持了 RecSys track,并公开了开场 slides 与整场 YouTube 录像。该 track 聚焦如何用 LLM 技术改进推荐系统与搜索。

5月30日周五
  1. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton 转发 AI 就业冲击合辑:The Great AI Job Displacement Is Closer Than You Think

    Geoffrey Hinton 转发并称赞了一部汇集多方观点的合辑视频,主题是 AI 即将带来的变化。该合辑出自 Scr0nkf1nkle,标题为 The Great AI Job Displacement Is Closer Than You Think。

5月23日周五
  1. Barsee 🐶(@heyBarsee)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一周 AI 大事:Google Veo 3、Anthropic Claude 4 等集中发布

    Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。

  2. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 AI 大事件:Google Veo 3、OpenAI 与 Jony 的 IO、Anthropic Claude 4 等

    Google 发布 Veo 3,OpenAI 与 Jony 推出 IO,Anthropic 发布 Claude 4,同时传出 Apple Glasses、Google Glasses 及 Tesla Optimus 的新进展。Anthropic CEO 还给出 2026 年 AI 预测。

5月13日周二
  1. Lilian Weng(@lilianweng)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 吐槽数据集泛滥:又见 meta-mixed 拼盘,担忧数据污染

    Lilian Weng 表示,每次新数据集发布她都会去看,但发现又是把已有数据集拼在一起的 meta-mixed 数据集,第一反应就是"数据污染"。她直言不想再看到 meta-meta-mixed 数据集。

5月1日周四
  1. Lilian Weng — Lil’LogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么我们会思考:测试时计算与思维链综述

    Lilian Weng 撰文综述测试时计算与思维链推理的近期进展,解释让模型想更久为何有效。文章从心理学类比、算力资源和隐变量建模三方面给出动机,梳理并行采样与顺序修订两类解码策略,并分析 DeepSeek-R1 等基于 RL 的推理训练方法。文中还讨论思维链忠实性的失败模式,以及连续空间思考、思考 token 和测试时计算缩放规律等方向,并列出待解开放问题。

4月29日周二
  1. Lilian Weng(@lilianweng)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 回应"听说过 arXiv 吗":ICLR OpenAI 招聘活动上的对话

    Lilian Weng 回应了一条推文:Isa Fulford 在 ICLR 的 OpenAI 招聘活动上被人问"你听说过 arXiv 吗"。该推文获得 243 次点赞和 8.4 万次浏览。

  2. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Geoffrey Hinton 称 ResearchGate 推送假冒其与 Yann LeCun 署名的 AI 论文

    Geoffrey Hinton 表示 ResearchGate 向他推送了一篇假冒论文《The AI Health Revolution: Personalizing Care through Intelligent Case-based Reasoning》,声称作者是他与 Yann LeCun。他指出该论文超过三分之一的引用指向 Shefiu Yusuf。

4月23日周三
  1. 奇想驿 by 产品沉思录AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    flomo 5 周年:AI 时代用自己的话记录还有意义吗

    flomo 迎来 5 周年,仍坚持「一个笔记的长期主义」,没有外部融资、团队独立运营。在随时能得到答案的 AI 时代,其创始人重新回应"用自己的话记录是否还有意义":记录是为了更好地思考和行动,AI 有替代思考与促进思考两条道路,真实的思考痕迹更能代表真实的自己。

4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

4月19日周六
  1. 保持偏见AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    劳模雷军:从金山、小米到造车,假如生命明天就会终止你还会创业吗?

    播客《保持偏见》第23期回顾雷军从写程序、创办三色公司、加入金山到创办小米、投资UC浏览器与凡客诚品,再到造车与芯片的多次转身。节目以“假如生命明天就会终止的话,你今天还会创业吗”为线索,串起他与求伯君、董明珠、周鸿祎、黄章等人的恩怨与赌约。

3月13日周四
  1. 保持偏见AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据之王扎克伯格:操控世界的程序员

    这期播客回顾了扎克伯格从10岁开始编程、高中写出价值100万美元音乐播放器,到创立Facebook的全过程,并梳理了股权稀释、肖恩·帕克与彼得·蒂尔入局、收购Instagram和WhatsApp等关键节点。节目还讨论了信息流广告、假新闻、美国大选中的信息操控,以及扎克伯格转向元宇宙和人工智能的新赛道。

2月8日周六
  1. Jan Leike(@janleike)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 挑战赛 4 天:12 人通关 level 4,1 人攻破 level 5

    Jan Leike 发起的挑战赛进行 4 天,已有 12 人通关 level 4,1 人攻破 level 5,挑战仍在继续。

2月6日周四
  1. Jan Leike(@janleike)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 的越狱挑战开赛 48 小时:无人通过第 4 关

    Jan Leike 发起的越狱挑战开赛约 48 小时,尚无人通过第 4 关,但通关第 3 关的人数明显增多。

12月30日周一
  1. OnBoard!AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! EP 66 深度解读 Coding Agent 与 OpenAI o3:中美创业者、研究员与投资人的未来判断

    OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。

12月25日周三
  1. OnBoard!AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Comfy 核心中国力量:多模态生成全球狂奔之年,开源与商业化发生了什么

    Comfy 中国社区创始团队发起的 Comfy Community Summit 第二站在东京举办,主理人 AJ、前 Stability AI 工程师 Yizhou、HuggingFace 工程师 Tiezhen 与 TheSEA AI 创始人 Yanjin 共同回顾多模态生成与 ComfyUI 开源社区的兴起。

12月22日周日
  1. Eugene YanAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 的 2024 年度回顾:LLM 系统投产、AlignEval 与健康改善

    Eugene Yan 的 2024 年度回顾显示,他今年把 2023 年的原型推向生产,交付了服务客户的 ML/LLM 系统,并发布了 AlignEval,用户已上传 538 个数据集文件、其中 84 个文件标注 50 条以上样本并优化了 LLM-evaluator。

12月17日周二
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直播回放:什么是开发大模型应用的新一代底层技术栈?对谈贾扬清、PingCAP 黄东旭和 AWS Bedrock 核心成员

    OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。