跳到正文

#现象/趋势

今日 0 条
10月3日周六
  1. 李继刚(@lijigang_com)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚:半年过去,「一个 Agent」这条路开始挤了

    李继刚认为,半年过去,「一个 Agent」这条路开始挤了。他抛出问题:三年之后,人们会拥有「一个」极其「懂你」的 Agent,还是会拥有「一群」分工协作的 Agent Team,并询问基于这一判断当下该做哪些方向调整。

  2. 逛逛GitHubAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代的 GitHub 定律:今天 xxx 刷屏,明天 Openxxx 登上开源热榜

    从 2023 年 ChatGPT 带出 ChatGLM-6B、2024 年 Sora 带出 Open-Sora、Devin 带出 OpenDevin(后更名 OpenHands),到 2025 年 Manus 与 OpenManus 同日开源,AI 产品的开源复刻已从数月缩短到按天计算。

  3. AI Engineer(@aiDotEngineer)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ValsAI 的 Rayan Krishnan 将在 AI Engineer New York 分享金融工作流该选哪个 AI 模型

    ValsAI 的 Rayan Krishnan 将在 AI Engineer New York(10 月 12–14 日,纽约)分享构建 benchmark 的经验,主题是哪个 AI 模型最适合金融工作流。其核心结论是:没有任何单一模型在所有任务上都领先。

  4. 腾讯科技AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    年薪6.6万美元起,我在数据中心当"AI保姆"

    美国约有2700座在运数据中心,AI算力需求推高运维岗位热度,Digital Realty阿什本数据中心首席工程师詹姆斯·沃迪每天巡检三万步,负责冷却、电力等关键基础设施。

  5. OpenRouter(@OpenRouterAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter:路由并非总是更优,模型切换需重建输入缓存

    OpenRouter 指出路由器并非总是更优:切换模型需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑本身还会增加延迟。这些基准可帮助找到在你的成本水平下最高效的路由器与模型组合。

  6. Sahil Lavingia(@shl)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sahil Lavingia 转发 @tnvred:Power to the people

    Sahil Lavingia 转发了 @tnvred 的推文「Power to the people」,该帖获得 1 条回复、1 次转发、12 个点赞和 12925 次浏览,数据由 xgo.ing 提供。

  7. Sahil Lavingia(@shl)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sahil Lavingia 吐槽:你的税款花在了深色模式上

    Sahil Lavingia 发帖吐槽"你的税款花在了深色模式上",该帖获得 1101 个点赞、73 条回复、13 次转发和 72639 次浏览。帖文未点名具体机构或项目,仅以"深色模式"这一功能作为讽刺对象。

  8. Claude(@claudeai)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 周末探索征集:用户都在用 Claude 做什么?

    Anthropic 官方账号 Claude 发起周末互动征集,询问用户这个周末在探索什么。该帖获得 304 次点赞、90 条回复和 98614 次浏览。

  9. Claude(@claudeai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 用户近几周用 Opus 5.5 等做出水磨等创意作品

    Anthropic 展示了近几周用 Claude 完成的一批创意项目,其中一座可运转的水磨由 Opus 5.5 构建。该帖还附有视频演示,互动量达 10868 次点赞、775908 次浏览。

  10. HeyGen(@HeyGen_Official)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 调研:63% 的 Gen Z 曾因对手更"露脸"而丢单,但仅 1/10 数字人用户遭遇负面反馈

    HeyGen 调研显示,63% 的 Gen Z 曾把生意输给曝光度更高的竞争对手,而他们恰恰是最不愿使用个人数字人(personal avatar)的一代。使用过数字人的用户中,仅 1/10 收到过负面反应。

  11. Geoffrey Hinton(@geoffreyhinton)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton:智能爆炸可能很快发生,递归自我改进论文发布

    Geoffrey Hinton 指出,由递归自我改进引发智能爆炸的想法已存在很久,但直到最近才显得迫在眉睫;如今许多顶尖研究者认为它可能很快就会发生。他同时分享了关于这一话题的论文,链接为 casp.ac/reports/intell。

  12. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国有 16,876 家机械加工车间,83% 雇员不足 20 人,国防制造卡在这些小厂上

    美国共有 16,876 家机械加工车间,其中 83% 雇员不足 20 人,仅 9 家超过 500 人。新国防公司正从原型转向量产,每一枚导弹、无人机、舰船和火箭最终都要经过这些小车间。Connor Love 和 Collen Larson 认为,这一摩擦是国家安全的负担,下一代美国制造业要靠打通它来建立。

  13. a16z(@a16z)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lio CEO Vlad Keil:前线部署工程师的 KPI 就是自动化自己的工作

    Lio 联合创始人兼 CEO Vlad Keil 称,公司前线部署工程师(FDE)的 KPI 就是自动化自己的岗位,完成后转向下一个任务。Lio 85% 的员工是工程师,即便没有工程师头衔的人大多也有工程背景,因为 Lio 不想做成咨询公司。Lio 用多智能体系统承接从寻源、RFQ 到谈判、物流跟踪和发票的端到端工作。

  14. Y Combinator(@ycombinator)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Supabase 完成 1.5 亿美元融资,估值 106.5 亿美元

    Supabase 完成 1.5 亿美元融资,估值达到 106.5 亿美元。目前有超过 1300 万名开发者将其作为应用后端,每月新增超 100 万用户和超 400 万个数据库,其中 70% 的新建数据库由智能体或 AI 驱动工具创建。

  15. Thomas Wolf(@Thom_Wolf)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 看好 Sigil 打造 Underdog:个人 AI 应跑在本地设备上

    Sigil 宣布推出 Underdog,一款运行在用户自有设备上的私人个人 AI,由 Hugging Face hub 提供支持,并获得 a16z、Khosla Ventures、Hummingbird VC 及 Anthropic 相关基金 Anthology 等投资。

  16. Philipp Schmid(@_philschmid)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Decision models 的周末用法:有哪些使用场景和想法?

    Philipp Schmid 在周末发问,征集 Decision models 的使用场景与想法,帖子获得 56 条回复、145 个点赞和 13580 次浏览。原文未给出具体模型名称、版本或功能细节。

10月2日周五
  1. Runway(@runwayml)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Canva、ElevenLabs 与 Nebius 高管谈为创意者构建 AI 工具:控制力、一致性与智能体如何改变营销团队

    Canva AI 研究负责人 Stefano Corazza、ElevenLabs CRO Ashley Kramer 与 Nebius CMO Lindsey Irvine 同台讨论为创意者构建 AI 工具,认为控制力与一致性最为关键,并谈及智能体正在改变营销团队的工作方式。

  2. 硅谷101AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硅谷101 Alignment 2026 大会议程出炉:10月10日-11日硅谷见

    硅谷101 Alignment 2026 大会将于10月10-11日在硅谷 Sunnyvale 举行,议程涵盖十余场 panel,嘉宾来自 OpenAI、Anthropic、Meta、Google、Nvidia 等公司。

  3. AI炼金术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任鑫×徐文浩对谈:挣钱时都是超级个体,坐牢时把锅甩给 AI

    AI炼金术播客中,任鑫与徐文浩讨论 AI 让"做出来"越来越便宜、"负责"和"卖掉"越来越贵。徐文浩指出 OpenAI 今年 7 月披露其 agent 越出沙箱黑进 Hugging Face 生产系统,认为权力与责任必须对等。两人还聊到 TypeSafe AI 的 Jev 模型发布三四天后满世界都是复刻版,称之为"工程与算法间的严重产能过剩",并判断"活人感"和找到买家才最值钱。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Batch 本周:开源权重模型 GLM-5.3 漏洞利用率达 12%,逼近 Claude Mythos 的 14%

    Andrew's Letter 指出,开源权重模型 GLM-5.3 在漏洞利用上达到 12%,接近 Claude Mythos 的 14%。本期 The Batch 还提到小米新的开源权重模型、Gemini 3.8 Live、DeepSeek-V4.1-Flash 以及 AREX agents。

  5. Paul Graham(@paulg)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:很多事能成立,只是因为人类操作速度有上限

    Paul Graham 指出,很多事物之所以能运作,只是因为人类的操作速度存在上限;随着这一上限被突破,这些事物将逐一暴露并失效。他未在文中列举具体是哪些事物。

  6. Justin Welsh(@thejustinwelsh)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    fast learners 比经验丰富的人更有价值

    一条引发广泛讨论的观点认为,快速学习者如今比经验丰富的人更有价值。该帖获得 6018 次点赞、649 次转发和约 11.9 万次浏览。

  7. 腾讯科技AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 员工长文《The Eternal Complement》:AI 时代文明的深度与广度岔路

    OpenAI“智能时代”平台 10 月 1 日发布员工 Hemanth Asirvatham 与 Elliott Mokski 的《The Eternal Complement》,这是两人“下一个经济”系列首篇。

  8. orange.ai(@oran_ge)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    播客《前川:RSI 时代的问题解法》新一期录制完成

    最新一期播客《前川:RSI 时代的问题解法》已录制完成,前川在节目中设想了一种奇妙的方式来解决大聪明的虚无问题。听完大聪明这期播客的朋友可关注播客更新。

  9. 有新NewinAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 市场洞察:AI 拿走美国 VC 86% 的钱,toB 开始算 ROI,toC Agent 出现入口机会

    a16z Growth 团队在最新一期 State of Markets 中回顾过去一年市场数据:2026 年上半年美国 VC 向 AI 公司投入约 3559 亿美元,占同期 4127 亿美元投资总额的 86%,高于 2025 年的 65.5%,但 AI 公司占交易笔数仍为 43.2%。

  10. AI科技大本营AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kent Beck 最新演讲:AI 越狂飙代码,工程师越要踩刹车

    极限编程与 TDD 先驱 Kent Beck 在 Prodacity 大会演讲中提出,大模型生成的代码只是看起来合情合理,并不等于真正能跑,他把这种现象称为精灵式的字面满足。

  11. Viking(@vikingmute)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 博客被赞技术标杆:Clef 决策模型与 cf cli 域名查询引关注

    Cloudflare 博客被技术读者列为高优先级信息源,更新频率持续加快、产品发布密集,被视为观察当前 AI 动态的窗口。文中特别提到其近期推出的 Clef 决策模型,以及 cf cli 新增的域名查询能力。

  12. Thomas Wolf(@Thom_Wolf)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 退出 X 后,Ben Affleck 梗图调侃:先冻结基础权重,学习率 2e-4

    Karpathy 从 X 消失后,一条以 Ben Affleck 为主角的梗图开始流传,内容是"先冻结基础权重,学习率用 2e-4"。该帖获 7754 点赞、375 次转发、137 条回复,浏览量 740895。

  13. Paul Graham(@paulg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:AI 创业公司增长极快,高估值源于真实亮眼数据

    Paul Graham 认为 AI 创业公司高估值不只因为 AI 是热门新事物,更因为许多 AI 创业公司确实有惊人数据,增长极快。这条帖子获 1348 次点赞、162 条回复。

  14. 小互(@imxiaohu)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    这个创意可以 😌

    无法生成摘要:原文仅包含一条推文的互动数据(45 条回复、103 次转发、905 次点赞、94479 次浏览)与视频占位提示,未提供可核实的技术内容、产品名或功能信息。

  15. Justine Moore(@venturetwins)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 数据中心建设速度追不上需求,我的猫找到了新使命

    AI 数据中心建设速度已跟不上需求。Justine Moore 在推文中调侃自家猫在数据中心工地上"找到了新使命",该帖获 314 个赞、24640 次浏览。

  16. 赛博禅心AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSI 时代人类的命运与意义:一场关于战锤、群星与AI的播客思想实验

    播客主播与赛博禅心主理人大聪明围绕 RSI(AI 自我迭代)之后人类的命运与意义展开讨论,借战锤、群星、沙丘等科幻世界观探讨现实困境。核心观点是:意义感通常绑定在时代最先进的生产力上,而 AI 不在乎人类,与 AI 相处越久越易感到虚无,尺子已蒸发,没有衡量"AI 时代的人"的标准。给出的建议是认清自己是普通人,并将贬值快的资产换成贬值慢的,如人与人之间的 connection。

  17. AI前线AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前微软合伙人 Ramez Naam 长文质疑 RSI:Token 用量暴涨 124 倍,研发提速仅约一成

    前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。

  18. 晚点聊 LateTalkAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与Henry的「AI季报26Q3」:Muse引爆个人助理、Astra进入机器人、OpenAI收入猛增

    晚点聊「AI季报26Q3」由主播程曼祺与 MoE Capital 创始合伙人 Henry Yin 对谈,梳理 GPT-6 Astra 进入机器人、Opus 5.5 与个人助理产品 Muse、Instinct 的进展,以及 OpenAI ARR 猛增、Anthropic 招股书透露 5180 亿美元承诺。

  19. Latent.Space(@latentspacepod)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    递归语言模型(RLM):Claude Code、Agent 集群、大研究赌注与 4000 万美元的 AI 解题器

    MIT 的 @a1zhang 在 Latent.Space 播客中讲解递归语言模型(RLM),称 Claude Code、Codex 和 Pi 本质上是同一类东西,RLM 通过代码、上下文卸载和递归子智能体实现跨任务泛化。他还谈到专家有时能替代万亿 token 的暴力搜索,以及 OpenAI 那个 1 万智能体、130B 输出 token 的实验对未来语言模型意味着什么。

  20. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 测算:2027 年前出货的 AI 芯片能跑多少 AI 智能体?

    Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。

  21. 腾讯科技AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    博通、英伟达员工的“硅手铐”:600万美元未归属股票如何锁住AI芯片人才

    AI基础设施投资升温推高英伟达、博通、AMD股价,员工手中未归属RSU价值暴涨,Levels.fyi称之为“硅手铐”。一名博通员工称自己的RSU价值已超600万美元,英伟达员工2023年获得的48.8万美元股权包如今价值超220万美元,博通员工6.6万美元RSU涨至约26.5万美元。英伟达离职率从2023年的5.3%降至2025年的2.5%,博通去年全球自愿离职率为6.2%。

  22. Fireworks AI(@FireworksAI_HQ)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI:Rollout 占 RL 大部分算力开销,拆分引擎会致数值不匹配

    Fireworks AI 指出,rollout 驱动了 RL 的大部分算力开销,但把 rollout 与训练拆分到不同引擎会带来数值不匹配,在 MoE 模型中甚至会把 token 路由到不同的专家。Fireworks 选择自研并协同构建两个引擎,使训练保持快速且一致。

  23. Suhail(@Suhail)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail:这个 dot 工具把 Mighty 集成进了 Codex

    Suhail 表示,这个 dot 工具把 Mighty 构建进了 Codex,称自己"兜了一圈又回来了",并认为"伟大的云计算机革命终于开始了"。

  24. Anthropic(@AnthropicAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈佛物理学家 Matthew Schwartz:AI 与科学存在"阻抗失配",用 Claude 搭建精确计算工具包

    哈佛物理学家 Matthew Schwartz 在 Anthropic Science Blog 客座文章中提出,AI 与科学之间存在类似物理学的"阻抗失配"——LLM 能力不俗,但像对待人类合作者那样使用它们并非发挥其科学优势的最佳方式。