跳到正文

全部动态

今日 0 条
9月23日周三
  1. Jerry Liu(@jerryjliu0)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 分享视频制作过程

    Jerry Liu(@jerryjliu0)发布了一条说明自己如何制作视频的内容。该帖获 35 个点赞、1 次转发、1929 次浏览,数据由 xgo.ing 提供。 (说明:原文正文极短,仅含互动数据与「how i made the video 😂」,未提及任何模型、版本、参数或产品功能,故摘要不补写原文之外的推断。)

  2. Citrini ResearchAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research:Meta 消费级智能体 Muse 或成智能体拐点

    Meta 消费级智能体 Muse 以每周 1 亿 token 免费额度上线,首日下载量超过 70 万并登上 App Store 榜首。Citrini Research 认为,Muse 的意义不在技术能力,而在于触达规模,标志着大众首次真正从消费级智能体中获益。该机构同时复盘其 2023 年 6 月提出的“AI 冲击”框架,认为由智能体消除摩擦带来的商业模式颠覆正在逐步被市场定价。

  3. Sam Altman(@sama)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:初创公司天然擅长快速组队,大公司要保持这一点很难

    Sam Altman 认为,初创公司天然擅长围绕最关键的事快速集结精干团队,大公司要保持这种能力则很难,且这是一个尚未被充分探索的领域。他引述 Pranav 的观点称,OpenAI 的超能力正是在任何时间点都能迅速组建一支被充分授权的强能力团队,不讲究组织架构线,从而保持灵活、抓住机会并从错误中恢复。

  4. Sam Altman(@sama)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI API 目标:在每个价位和每种模态上提供最佳模型

    OpenAI 称要让 OpenAI API 在每个价位点都提供最佳模型,并在文本、代码、图像、视频等每种模态上做到最好,希望用户基于此提出好想法并构建产品。该表述未给出具体的模型名称、版本号或发布时间。

  5. Aadit Sheth(@aaditsh)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandr Wang 在 X 上爆火:亲自发推、不靠公关团队

    Alexandr Wang 近期频繁出现在 X 信息流,原因是他完全自己发推,没有公关或传播团队审核每条内容,直接用 iPhone 发布真实想法。作者认为 AI 之后人人都会写,但写得好的人会立刻脱颖而出;科技高管在 X 上拿不到传播量是技能问题,不是算法问题。

  6. Paul Couvert(@itsPaulAi)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Couvert 盛赞 AGI 竞速短片:10/10 杰作,配得上每一座数据中心

    Paul Couvert 给一段 AGI 竞速主题短片打出 10/10,称其"配得上每一座数据中心",该片脚本由 Pocket FM 的 Sherpa 生成、视频由 Seedance 2.5 制作。这条推文已获 1942 个赞、99 次转发和 47 万次浏览。

  7. Genspark(@genspark_ai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark COO 谈 AI 普惠:无需开 F1 也能用好智能引擎

    Genspark COO @sang_wen 在 All-In on AI Summit 上表示,AI 不应只属于专家,每个人都应从中受益。Genspark 据此打造了易于使用的 AI workspace。

  8. Akshay Kothari(@akothari)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion AI 被用户调侃"拿走我的钱和孩子"

    有用户调侃 Notion AI"可以拿走我所有的钱,甚至我的孩子",Akshay Kothari 回应称乐意收下这笔钱,帮你把活干完,好让你有最多时间陪孩子。

  9. cohere(@cohere)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 发文:加拿大是 Cohere 诞生之地

    Cohere 表示加拿大是公司诞生之地,这片土地养育了团队、让创始人们接受教育,并塑造了他们构建技术时秉持的价值观。Cohere 称其价值观是 AI 不应让人远离所爱之事,而应让人有更多时间投入其中。

  10. 屠龙之术AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AICC2026 观察:从 Chat 到 Agent,智能、算力与芯片走向何处

    AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。

  11. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 探讨如何评估 Agent Skills

    NVIDIA Nemotron Labs 的 "Ask the Experts" 活动聚焦 AI 智能体技能(Agent Skills)的评估方法。内容以 x.com 直播形式发布,原帖互动为 7 条回复、14 次转发、65 次点赞,浏览量 12033。

  12. Guillermo Rauch(@rauchg)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch 称赞 Anthropic 的发布品味:Claude Opus 5.5 与 Next.js 展现设计前沿

    Vercel CEO Guillermo Rauch 称赞 Anthropic 的发布审美,认为 AI 让网页不再有借口不推进设计边界,并以 anthropic.com/claude-opus-5-5 页面为例称这是 Next.js 的最佳体现。他提到自己看好"headless"网页的原因正是每个页面都能呈现任意独特形态。

9月22日周二
  1. Sam Altman(@sama)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 提议让 AI 实验室之外的人参与技术发展决策

    Sam Altman 提出,AI 实验室之外的人应对技术发展有真正发言权,并有明确方式判断其是否安全推进。标准应帮助防止权力集中,确保新公司和开源模型公司能够竞争,同时让各国和企业比对证据、从失败中学习。他认为美国应主导这一进程,并附上了 OpenAI 的完整提议。

  2. Naval(@naval)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval 转发 @JordanSchachtel:联合国才有多少 GPU?

    Naval 转发了 @JordanSchachtel 的帖子“The UN! How many GPUs have they got?”,以调侃口气质疑联合国在算力问题上的发言资格。该帖获 228 次点赞、21 条回复、16 次转发,浏览量 18069。

  3. Interconnects AI — Nathan LambertAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 的 JS Denain 与 Nathan Lambert 辩论 RSI、中美差距与模型能力参差

    Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客中辩论了 RSI、机器人对 AI 加速的作用、中国模型落后程度以及蒸馏是否能解释这一差距。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻克 Navier-Stokes 方程,引发的争议带来重要启示

    10,000 个 AI 智能体在 Lean 中耗时 88 小时形式化复杂数学证明,围绕 Navier-Stokes 方程的结果引发争议。DeepLearning.AI 指出,智能体已能大规模形式化证明,但人类评估仍是解释证明为何成立的关键,企业数据隐私与零数据保留设置也是必需项。

  5. AI科技大本营AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    “当年在 OpenAI 像在疯人院”:Jev 作者 Diogo Almeida 访谈谈反叛 RLHF 与可编程 AI

    前 OpenAI 核心研究员、TypeSafe AI 创始人 Diogo Almeida 在播客 Latent Space 完整访谈中,解释其新模型 Jev 为何完全不做文本生成,只向程序输出带概率和置信度的决策,并以代码作为唯一消费者。

  6. 硅谷101AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理芯片之战:Groq、Cerebras与OpenAI三大路径及Bill Dally的设计哲学

    硅谷101对话两位AI芯片创业者,拆解推理芯片三条路径:英伟达约200亿美元与Groq达成技术授权并吸纳Jonathan Ross等核心团队,Cerebras今年6月IPO市值达670亿美元,OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。

  7. 海外独角兽AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?

    拾象整理了一场与来自多家模型厂商的 AI Researchers 的线下闭门交流,讨论 Astra 的 Computer Use、RSI、模型蒸馏和训练数据等方向,保留其中的共识与分歧。

  8. 乱翻书AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当AI给出所有答案,年轻人如何找到自己的问题?

    乱翻书第276期邀请上海外国语大学学生金贤婷、港科大(广州)博士生李俊伟与欧莱雅徐轶凡,讨论AI时代年轻人的成长路径。嘉宾认为AI接管学徒工作、打断传统职业成长路径,但缩短试错流程不等于消灭试错,实习生需要证明自己不是AI答案的搬运工。欧莱雅美妆科技黑客松已在2026世界人工智能大会启动,以"用AI造点美"为题,鼓励青年用AI回应产业真实需求。

  9. 51CTO技术栈AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI教父辛顿:模型出问题现在还靠内部员工爆料,AI工程师最先失去的可能是说"不"的权力

    辛顿在CNN访谈中表示,外界目前基本依靠内部员工爆料才能知道模型在哪些地方出了问题,他支持独立机构进入头部AI公司验证模型开发与测试过程。CNN调查指出,AI人才稀缺让研究人员当下拥有公开质疑公司和要求暂停发布的筹码,但当AI能参与生成训练数据、编写评测和改进下一代模型时,这种话语权可能被压缩。辛顿认为"关机键"只能应对部分风险,真正的问题是谁有权按下它。

  10. Arthur Mensch(@arthurmensch)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arthur Mensch 感谢参与其"troll 地图"实验

    Arthur Mensch 发文感谢参与者加入他的 troll 地图绘制实验,该帖获 1122 个点赞、326 条回复、40 次转发和 341522 次浏览,数据由 xgo.ing 提供。

  11. 腾讯研究院AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当 AI 数字员工上岗,会带来什么?腾讯云峰会圆桌谈智能体落地

    腾讯云城市峰会圆桌讨论聚焦 AI 数字员工落地:企业用 AI 分“能对话、能干活、能上岗”三级,其中“能上岗”最难。科拓把停车场收费、抬杆等管理权交给 AI 岗亭,蝉妈妈将客服 AI 接管研发问题响应后,研发被打断比例降低 70% 以上、响应时间缩短 80% 以上;华祥苑的“店效 AI 经营官”已开 10 万次门店会议,覆盖近 1000 家门店。

  12. Junyang Lin(@JustinLin610)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Junyang Lin 发推 "who the hell r u" 引热议

    Junyang Lin(@JustinLin610)发布了一条仅含 "who the hell r u" 的推文,获 248 个点赞、49340 次浏览与 17 条回复,无转发。帖子由 xgo.ing 提供数据支持。

  13. 李继刚(@lijigang_com)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚:LLM 像问答题,jev 像选择题?

    李继刚提出一个类比:LLM 相当于问答题,jev 相当于选择题,该帖获得 195 条评论、172 次点赞与 52331 次浏览。原文未对 jev 作进一步解释。

  14. 阿里研究院AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴泳铭云栖演讲:未来机器思考总量将达人类的1000倍以上

    阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。

  15. 深思圈AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z合伙人Josh Elman:10亿美元消费级AI App背后的产品逻辑

    a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。

  16. Jerry Liu(@jerryjliu0)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大家都在 X 上用 astra 做产品可视化

    大家在 X 上用 astra 做产品可视化,我一眼就能看出来,因为我自己也在做同样的事。各种架构动画和 benchmark 图表换着不同公司的品牌色出现。

  17. Epoch AIAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 推理成本每季度下降约 47%,快于 DNA 测序与算力

    Epoch AI 发布研究《The plunging price of thought》,测算达到同一性能水平的 AI 推理成本自 2023 年以来约每季度下降 47%,即每年约 13 倍。

  18. Simon Willison(@simonw)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 整理 Jev 与“系统一”决策模型新类别笔记

    Simon Willison 整理了一份关于 Jev 以及被称为“系统一”(system one)即决策模型(decision models)这一新类别的笔记。他在笔记中提出了将这类模型单列为一类的看法,相关内容发布在其个人博客上。

  19. 有机大橘子AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 背后的野心:用校准决策取代 RLHF,实现完全自动化

    TypeSafe 于 9 月 15 日发布首个模型 Jev,它不生成文本、只输出带置信度的判断,速度比前沿大模型快两百倍、价格便宜四百倍。CEO Diogo Almeida 认为 RLHF 把人类偏好放进训练循环,导致谄媚与幻觉,AI 因此无法离开人实现自动化,Jev 选择优化"校准的决策"这条第三条路。

  20. Latent.Space(@latentspacepod)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 与 System One Model:RLCD、智能/美元、可靠 AI,以及 chat-first AI 的终结

    TypeSafe CEO 解释为何 AI 能解决极难问题却仍无法自动化基础工作,Jev 因此不做 chat 而专注软件内的可靠决策,并在 API 层拒绝公开 benchmark 与拒绝回答。他认为数据与正确任务比堆算力更重要,System One Model 可能重塑 coding agent 与软件,即便有 10 亿美元他也不会从零预训练模型。

  21. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:用 AI 做产品,应花超过 25% 的时间做 benchmark

    Logan Kilpatrick 建议,用 AI 构建产品的团队应把超过 25% 的时间花在制作 benchmark、并推动模型实验室关注这些 benchmark 上。他称这是加速公司进展的最快路径。

  22. Andrew Ng(@AndrewYNg)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:AI 风险被炒作夸大,近两周恐慌是公关推动

    吴恩达称近两周针对 AI 危险的恐慌由一场组织化的公关活动推动,AI 技术并未出现意外危险转向,人类灭绝风险与几个月前相比没有上升。他认为变化最大的是 AI 的网络攻击能力,值得认真对待但不会导致世界末日;OpenAI 一个团队曾部署智能体集群入侵 Hugging Face,有报道称规模达 1200 个智能体,而 OpenAI 有缺陷的沙箱与监控流程是事件关键成因。

  23. Sahil Lavingia(@shl)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    政府是 vibe coder 的理想去处

    Sahil Lavingia 认为政府是 vibe coder 的理想去处。该观点以推文形式发布,获得 36 条回复、9 次转发和 204 个点赞,浏览量超过 2 万。

  24. Thomas Wolf(@Thom_Wolf)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf:开源高质量 RL 环境是推动开源前沿最有影响力的事

    Thomas Wolf 认为,在 RLVR 新范式下,发布大量高质量开源 RL 环境相当于当年共享高质量预训练数据,是当下推动开源前沿最有影响力的事。他转述 eliebakouch 的说法称,对方将开源约 7k RL 训练数据及框架,并已发布模型与技术报告,距启动最终 RL 训练不到 1 周。

  25. Harrison Chase(@hwchase17)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 谈类 "goal" 的多目标连续达成机制

    Harrison Chase 转推 Josh Rosen 的一篇文章,称其思路类似 "goal",但要求连续命中多个目标。原文未给出具体模型、参数或基准数据。

  26. Aadit Sheth(@aaditsh)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    旧金山科技广告牌像极了 X 时间线:Lovable、Warp、Superhuman 等集体刷街

    有人在旧金山街头看到 Lovable、Warp、Superhuman、Framer、Snowflake、Vercel、WorkOS、Nebius 的广告牌,感慨现实中的科技公司阵容就像把 X 时间线搬到了线下。

  27. Guillermo Rauch(@rauchg)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nat Friedman:muse 从零构建,产品上深受 openclaw 启发

    Nat Friedman 表示 muse 是从零构建的,但产品上深受 openclaw 启发。他在 1 月使用 openclaw 后为 MSL 团队购入数百台 Mac mini,团队许多人爱上了 openclaw 及其他个人智能体,他认为 @steipete 的 harness 从一开始就具有开创性。muse 的目标是打造类似 openclaw 但安全、易用、可扩展至数十亿人的产品。

  28. Andrej Karpathy(@karpathy)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:低延迟单 token 模型是 LLM 帕累托最优曲线上被低估的一点

    Andrej Karpathy 认为存在一类"无思考、单 token、低延迟可接受智能"的 LLM 帕累托最优区间,其潜在需求已被大量揭示,却因业界竞逐更高智能而投资不足。他是在回复 @willdepue 时提出这一观点的。