跳到正文

#大佬观点

今日 37 条
10月2日周五
  1. Paul Graham(@paulg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:AI 创业公司增长极快,高估值源于真实亮眼数据

    Paul Graham 认为 AI 创业公司高估值不只因为 AI 是热门新事物,更因为许多 AI 创业公司确实有惊人数据,增长极快。这条帖子获 1348 次点赞、162 条回复。

  2. 赛博禅心AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSI 时代人类的命运与意义:一场关于战锤、群星与AI的播客思想实验

    播客主播与赛博禅心主理人大聪明围绕 RSI(AI 自我迭代)之后人类的命运与意义展开讨论,借战锤、群星、沙丘等科幻世界观探讨现实困境。核心观点是:意义感通常绑定在时代最先进的生产力上,而 AI 不在乎人类,与 AI 相处越久越易感到虚无,尺子已蒸发,没有衡量"AI 时代的人"的标准。给出的建议是认清自己是普通人,并将贬值快的资产换成贬值慢的,如人与人之间的 connection。

  3. AI前线AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前微软合伙人 Ramez Naam 长文质疑 RSI:Token 用量暴涨 124 倍,研发提速仅约一成

    前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。

  4. 深思圈AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Ami Vora 和 Mike Krieger 谈:AI 时代为什么人人都要学当 PM

    Anthropic 的 Ami Vora 和 Mike Krieger 在 Lenny and Friends Summit 上表示,AI 让做东西变便宜后,PM 的工作没有消失,只是最贵的部分换成了判断做什么、推进落地和把并行实验收拢成产品。

  5. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:能微调 LLM 回答物理世界问题,不等于具备 6 岁儿童的物理直觉

    Yann LeCun 在 X 上发问:"我的家用机器人在哪?我的 L5 自动驾驶汽车在哪?"他指出,可以把 LLM 微调成能回答任何物理世界问题的模型,但这并不意味着它拥有足够的理解力和物理直觉,去预测一个 6 岁儿童就能预测的事情。

  6. Guillermo Rauch(@rauchg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SvelteKit 3 发布:Async Svelte 与 Remote Functions 引期待

    SvelteKit 3 发布,Guillermo Rauch 称其令人惊叹并祝贺团队,尤其期待 Async Svelte 与 Remote Functions 的表现。他用其构建的小应用端到端构建加部署仅耗时 15 秒,运行即时,且 fx 与 opus 轻松搞定了全部流程。

  7. Andrej Karpathy(@karpathy)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 谈如何理解 LLM 输出:用 ASD-STE100 写作、图表与定制讲解视频

    Andrej Karpathy 提出理解大语言模型输出的几种方法:让 LLM 用航空维护文档规范 ASD-STE100 改写文本,或要求生成图表、HTML 交互网页。他最看好定制讲解视频,可指定 "3b1b 风格" 并用 ElevenLabs API key 配音,这类输出已开始可行。他认为智能与代码日益充裕后,可随手生成一次性软件产物,人类工作将上移到监督与理解。

  8. Lenny Rachitsky(@lennysan)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElenaVerna:AI 目前是"平均智能",但已相当于随身的平均水准营销、工程、分析和设计人员

    ElenaVerna 在 Lenny Rachitsky 的分享中提出"AI = Average Intelligence",认为虽然 AGI 尚未到来,但随手可用一个平均水准的营销、工程、分析和设计人员已极具威力,甚至强于她带过的一些团队。

  9. Suhail(@Suhail)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail:这个 dot 功能把 Mighty 装进了 Codex

    Suhail 称 dot 这个功能真的把 Mighty 构建进了 Codex,并表示自己"兜了一圈又回来了",认为云计算革命终于开始。原帖未披露 dot 的具体能力、实现方式或可用范围。

  10. Lenny Rachitsky(@lennysan)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Marty Cagan:好的产品工作本质在于思考,人们会竭尽全力逃避思考

    Marty Cagan 在 Lenny Rachitsky 的分享中表示,好的产品工作本质上在于思考,他未曾料到人们为了逃避思考会走到何等程度。

  11. 跨国串门儿计划AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ray Dalio 2019 课堂实录:投资原则

    Ray Dalio 在 2019 年课堂实录中提出,投资的“圣杯”是找到 15 条或更多彼此不相关的收益流:加入 5 条不相关收益流风险已降低一半以上,增至 15 条风险降低将近 80%。他并指出投资者常把近期表现好的资产误当好投资,而忽略它只是变贵了,同时谈到债务周期、利润率翻倍与收入差距扩大,以及中国将在贸易、地缘政治与科技上扩大影响力。

  12. Guillermo Rauch(@rauchg)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:未来属于验证工程,证明、e2e 测试、基准与 linter 将并存

    Guillermo Rauch 提出"验证工程"将成为未来方向,手段包括证明、e2e 测试、benchmark 和 linter,其中部分测试是确定性的,部分由 AI 智能体驱动。

  13. andrew chen(@andrewchen)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    andrew chen 欢迎 abliteration_ai 团队与 founderengineer 加入 speedrun

    andrew chen 公开欢迎 @abliteration_ai 团队和 @founderengineer 加入 speedrun,并引用其定位"AI with guardrails that you control"。该帖获得 59 次点赞、4 次转发和 15116 次浏览。

10月1日周四
  1. Sam Altman(@sama)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:Sign In With ChatGPT 与 Plugin Extensions 的潜力被低估

    Sam Altman 认为 Sign In With ChatGPT 与 Plugin Extensions 蕴含的潜力远超外界认知。他未给出具体功能细节或上线时间,仅以"potential energy"形容这两项能力尚未被充分释放。

  2. Sam Altman(@sama)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 感叹 DevDay 开发者热情:有人一天内做出完整创业项目

    Sam Altman 称 DevDay 现场开发者热情高涨,仍让他感到不可思议的是,有人能在一天之内做出完整的创业项目。该帖获得 559 条回复、137 次转发和 4729 次点赞。

  3. Lenny Rachitsky(@lennysan)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claire Vo:我们现在可以把所有糟糕的想法都发布了,恭喜!

    Claire Vo 在 X 上发帖称"我们现在可以把所有糟糕的想法都发布了,恭喜!",这条帖子获得 297 个点赞、24 条回复和 15 次转发,浏览量约 2.7 万。

  4. Yann LeCun(@ylecun)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 发问:AI 放大人类智能,你支持还是反对智能?

    Yann LeCun 公开提问:"你是支持智能还是反对智能?"他认为 AI 像搜索引擎、图书馆、教育和语言一样放大人类智能,让人类更聪明、更有能力,并称希望智能被少数公司或政府控制的人是"新蒙昧主义者或新封建主义者"。

  5. Geek(@geekbb)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Qwen3.8-Max 修复 PVE 故障,用户称其比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打

    一位用户三台 PVE 同时挂了两台,用 Qwen3.8-Max 修了一天,称其表现比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打,目前已修好一台。该用户表示因此对 Qwen3.8 刮目相看。

  6. 跨国串门儿计划AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    比尔·阿克曼:投资前先想清楚十年后还愿意持有吗

    Pershing Square 创始人兼 CEO 比尔·阿克曼在播客中警告,AI 带来的颠覆风险让投资者更难判断企业护城河能否守住,市场终可能出现崩盘让很多人赔掉一大笔钱。他以 Netflix 推出广告模式打破原有投资逻辑为例,说明出现与逻辑相悖的新信息时应加仓或离场,并建议普通人尽早开始长期投资、可用指数基金。

  7. CSDNAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋、马斯克与 Anthropic 联创 Tom Brown 同台:太空发电、硬件熔断与代码不再值钱

    在华盛顿一场科技圆桌论坛上,马斯克称美国平均用电负荷约 500 GW,每新增 5 GW 基荷电力约拉动 1% GDP(约 3000 亿美元),并主张把算力送上太空,SpaceX 计划与特斯拉联手实现每年 200 GW 太阳能组件产能。

  8. Varun Mohan(@_mohansolo)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Varun Mohan:Gemini 4 Argon 在 AA Coding Agent Index 上表现不错

    Varun Mohan 表示,现实世界使用更重要,但很高兴看到 Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 表现不错,并称还有更多内容。

  9. Sahil Lavingia(@shl)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不用 AI 写代码就像做菜不放盐

    Sahil Lavingia 发帖称"不用 AI 写代码就像做菜不放盐",该帖获得 625 个点赞、134 条回复和 31 次转发,浏览量达 34962。

  10. Richard Socher(@RichardSocher)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 新书成为全国畅销书,谈 AI 与科学进步对文明的意义

    Richard Socher 的新书成为全国畅销书,他在推文中表示,想理解 AI 与科学进步对文明的上行空间以及未来走向,这本书值得一读。该书由 PublicAffairs 出版。

  11. 十字路口CrossingAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Sutton《苦涩的教训》:AI 研究为何应当相信 Scaling Law

    Richard Sutton 在《苦涩的教训》中指出,回顾 70 年 AI 研究,长期最有效的往往是能持续利用更多算力的通用方法,而非人类精心设计的领域知识。国际象棋、围棋、语音识别与计算机视觉的历史都显示,研究者起初想用人类理解减少搜索,真正的突破却来自拥抱搜索和学习。他因此认为,搜索和学习是当前最能随算力扩展的两类方法,而试图把人类对心智的理解直接写进系统,长期会停滞甚至阻碍突破。

  12. Runway(@runwayml)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway Research 团队深度问答:实时模型、生成式界面与机器人下一步

    Runway Research 团队在一场深度问答中讨论了实时模型、生成式界面以及机器人技术的下一步方向。

  13. Demis Hassabis(@demishassabis)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 为团队成果发声:详情见博客

    Demis Hassabis 发文表示为团队长期投入的工作感到自豪,并附上博客链接供了解详情。原文未披露具体模型、产品或技术细节。

  14. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 trq212 讨论提示词工程、MCP 与智能体原生架构

    一则以笔记形式讨论提示词工程:提示词取决于心智模型是否匹配、以及是否具备足够领域词汇,而非把指令写得更长;领域词汇来自实际做过该工作。作者指出 MCP 只是无头 API、Artifact 是短生命周期 UI,二者可跨 MCP 组合,并把这套"brain / hands / surface"读作智能体原生的经典软件架构版本:未来开发从写前端转向写 MCP server,由智能体组合 UI。

  15. Lenny Rachitsky(@lennysan)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lenny Rachitsky 喊话 Google:不是要 diss,是想激励其行动

    Lenny Rachitsky 发帖表示自己并非要 diss Google,而是希望激励其采取行动。该帖互动数据为 6 条回复、30 次点赞、3970 次浏览,由 xgo.ing 提供支持。

9月30日周三
  1. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York:Towards AI 联合创始人兼 CTO 基准测试 148 个模型复刻个人文风

    Towards AI 联合创始人兼 CTO 将在 AI Engineer New York 分享:因不满 AI 生成的流水线内容,他基准测试了 148 个模型,寻找能模仿自己文风的模型,并发现衡量"品味"必须依赖人工评分。活动时间为 10 月 12 日至 14 日。

  2. Paul Graham(@paulg)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:错误有限且不重犯,就能逼近完美

    Paul Graham 提出,若某个领域的可能错误是有限的,且你从不重犯同一个错误,就有机会最终逼近完美。他引用玻尔的话说明,专家就是在极窄领域里犯遍了所有能犯的错误的人。

  3. Founder ParkAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Instinct 创始人对谈:没有 App 的 Personal Agent 如何做到年化 10 亿美元交易额

    Instinct 创始人 Noah Shinn 在 Patrick O'Shaughnessy 播客上首次以长访谈形式介绍这款没有 App 的个人助理,用户通过短信、电话和邮件与它交互,它也能主动打电话提醒急事。

  4. 跨国串门儿计划AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    扎克伯格的优势:不领先,也不肯停下来

    Colossus 撰稿人 Jeremy Stern 为扎克伯格撰写人物特写,采访了 36 位相关人士。文章讲述 Llama 4 发布后扎克伯格重组 AI 团队、成立 Meta Superintelligence Labs 并大幅增加投入,以及 Meta 押注 AI 眼镜、试图用广告收入和数据中心把 AI 推给数十亿现有用户的路径。

  5. orange.ai(@oran_ge)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 报告批评开源模型安全,被指借机推销闭源模型

    在 OpenAI 宣布企业套餐加入 GLM 5.3 等开源模型后,Anthropic 发布报告批评开源模型安全问题。报告称 GLM 5.3 是网络安全能力最强的开源模型、落后美国前沿模型约 4 个月,且是测试中唯一具备漏洞利用能力的模型,但可通过 abliteration 移除拒绝行为,单次成本约 4400 美元。

  6. AI科技大本营AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克、黄仁勋、Anthropic 联创同台:太空发电、硬件熔断与代码不再值钱

    在华盛顿一场科技圆桌论坛上,黄仁勋、马斯克与 Anthropic 联合创始人 Tom Brown 同台对话。

  7. 51CTO技术栈AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Total TypeScript 作者 Matt Pocock:别把整个需求塞给 Agent,上下文一长模型会变笨

    Total TypeScript 作者 Matt Pocock 在 The Pragmatic Engineer 访谈中提出,多数前沿模型较可靠的工作区约在前 15 万 Token,即便标称拥有 100 万 Token 上下文,超过此线输出质量会下降。

  8. 深思圈AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 深度对话:personal agent 的正确打开方式是什么

    a16z General Partner Anish Acharya 与 Assistant Benchmark 创始人 David Pawlan 在播客中讨论 personal AI agent:David 追踪到 122 个同类产品并亲自测试 26 个,他认为 proactivity(主动性)才是真正的护城河,而非功能多少或底层模型。

  9. Jerry Liu(@jerryjliu0)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:希望 dots 是独立应用,而不是 ChatGPT 里的一个功能

    Jerry Liu 表示希望 dots 成为独立应用而非 ChatGPT 的一部分,认为它目前更像 GPTs 那样的产品功能,而不是一次令人兴奋的新发布。

  10. andrew chen(@andrewchen)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开放权重 AI 应走向客户可控的护栏,而非黑盒规则

    开放权重 AI 的发展方向应是客户可控的护栏,而非黑盒规则。该观点认为,让客户掌控护栏优于不透明的黑盒机制,是开放权重模型需要演进的方向。

  11. Suhail(@Suhail)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    dax 谈为何更喜欢"超级智能"而非"AI"这一说法

    dax(@thdxr)表示,比起"AI"这个词,他其实更喜欢"超级智能(superintelligence)"的说法。该表态来自 Suhail(@Suhail)对其推文的引用转发。

  12. Replit ⠕(@Replit)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit:Sutton 的苦涩教训正在冲击 harness 设计

    Replit 认为 Sutton 的"苦涩教训"正在冲击 harness 设计:明天的模型不应继承我们为昨天的模型所构建的每一项变通方案,这才是适应之道。相关内容已发布在其博客。