跳到正文

全部动态

今日 0 条
10月6日周二
  1. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:@SpeakerMenin 要求科技公司宣誓其系统遵守安全指令,但它们做不到

    Gary Marcus 引述 @SpeakerMenin 的呼吁,要求科技公司宣誓证明其系统会遵守自身的安全指令。他称这些公司做不到,原因是相关技术仍是一团糟。

  2. Justine Moore(@venturetwins)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Montana 到底发生了什么?一条 X 帖子引发 19.4 万次围观

    Justine Moore 发帖称"我需要知道 Montana 到底发生了什么",该帖获得 1778 次点赞、224 条回复、50 次转发和 19.4 万次浏览。帖子未说明 Montana 具体发生了什么。

  3. a16z(@a16z)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 的 Olivia Moore:消费级 AI 被忽视的赛道是「帮人花时间」而非省时间

    a16z 合伙人 Olivia Moore 指出,消费级 AI 被忽视的赛道是帮用户「花时间」而非省时间,多数现有 AI 产品只是让事情更快、更简单,对普通人缺乏每天甚至每小时的使用价值。她引用投资组合公司 Wabi CEO 的说法称,人们不是想省时间,而是想找到花时间的方式,这正是社交媒体、Netflix、TikTok、YouTube 成为最常用消费产品的原因。

  4. Lenny Rachitsky(@lennysan)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人:Dots 将成与 AI 对话的主要方式,模型选择器和循环编排只是过渡

    OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 认为,Dots 将成为人们与 AI 对话的主要方式,手动设置和调整循环(loops)的做法行不通。他还表示模型选择器很可能消失,loops 与 graphs 只是过渡阶段,互联网上大多数操作很快将由智能体完成。

  5. 宝玉(@dotey)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 会话交互多借鉴自 Slack,Claude 最新 Projects 脱胎于 Thread 设计

    Agent 会话的交互设计有很多借鉴自 Slack,Claude 最新的 Projects 就脱胎于 Thread 设计,简洁好用。有观点指出,OpenAI 的一切产品决定都是从 Slack 上交流和协调的,而当年收购 Slack 的却是 Salesforce。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    四家大型 AI 公司派政策人员而非 CEO 前往纽约

    四家大型 AI 公司并未派 CEO 前往纽约,而是派出了政策方面的运营人员。该消息来自 Gary Marcus 的社交媒体帖子。

  7. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发 @DKokotajlo:大公司的保密与竞赛动态有多危险

    Gary Marcus 转发 @DKokotajlo 的内容,提醒大公司内部的保密与竞赛动态极其危险。原帖未展开具体论据或案例。

10月5日周一
  1. Gary Marcus(@GaryMarcus)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:对华竞赛的副作用是 AI 可能成为最糟糕的对手

    Gary Marcus 转述 @Turn_Trout 的观点称,对华竞赛带来的副作用是 AI 可能成为最糟糕的对手。该帖互动数据为 1 条评论、4 次转发、16 次点赞、7694 次浏览。

  2. 宝玉(@dotey)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    “一个系统基本不更新就是最稳定的”:Gemini 能保持“最稳定”的秘密

    一条被广泛传播的说法称,Gemini 之所以能做到“最稳定”,原因在于“一个系统基本不更新就是最稳定的”。该帖由宝玉(@dotey)发出,获得 25 条回复、2 次转发、78 次点赞,浏览 27993 次。

  3. Gary Marcus(@GaryMarcus)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前 Google DeepMind 研究员在纽约 AI 听证会作证:Google 包括 Demis Hassabis 最终背弃 AI 安全承诺

    前 Google DeepMind 研究员 @Turn_Trout 在纽约 AI 听证会上作证,称他曾试图推动 Google 对 AI 安全作出承诺。他表示 Google 最终从早先的 AI 安全承诺上退缩,其中也包括 Demis Hassabis。

  4. Paul Graham(@paulg)AI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 分享创业者感慨:创业真的会占据你全部的时间与注意力

    Paul Graham 分享了一位刚开始创业的朋友的感慨:本以为创业只会占用自己全部的时间和注意力,实际上它占据的是你全部的时间和注意力。该帖获得 1521 个点赞、97 条回复和 35 次转发。

  5. Gary Marcus(@GaryMarcus)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton 承认 Ilya 是对的:规模比新架构更重要

    Geoffrey Hinton 表示,Ilya Sutskever 一直坚持把模型做大就是答案,而他当时觉得这太简单,真正的进步需要新想法和新架构。Hinton 最终承认,数据和算力的规模才是最关键的因素,并称当年没想到计算机会比 AlexNet 时代快上十亿倍。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发:AI 对齐问题识别能力已很差,未来还将大幅恶化

    Gary Marcus 引用 @DKokotajlo 的观点称,人类察觉 AI 对齐问题的能力本就很差,且短期内还会大幅恶化;叠加行业"快速行动、打破常规"的态度,整个行业面临巨大风险。

  7. Gary Marcus(@GaryMarcus)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 引述 NYC 听证会:大部分代码已由 AI 编写且审查不足

    在 NYC 听证会上,@DKokotajlo 呼应 @hilbertspaess 的观点,指出如今大部分代码由 AI 编写,且审查不够仔细,Gary Marcus 称这令人担忧。

  8. Gary Marcus(@GaryMarcus)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:多数代码已由 AI 编写,人们不再仔细检查,这样交给 AI 是不负责任的

    Gary Marcus 引用并认同 @hilbertspaess 的观点:如今多数代码由 AI 编写,人们已不再仔细检查这些代码,把如此多的内容交给 AI 是不负责任的。

  9. Lenny Rachitsky(@lennysan)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tibo 谈 AI 智能体的五大判断:模型选择器将消失,互联网大多数操作将由智能体完成

    Tibo 认为互联网上的大多数操作很快将由 AI 智能体完成,Notion 上线 MCP server 后流量激增、被迫重新考虑其经济模型,每个产品团队迟早都要决定是否为智能体而构建。

  10. Gary Marcus(@GaryMarcus)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 在纽约市议会听证会上称"我们尚不知如何控制生成式 AI"

    Jacob Coxon 与 @DKokotajlo 在纽约市议会听证会上发言,Coxon 开场称"我们还不知道如何控制任何 AI 系统"。Gary Marcus 反驳说这不准确:AlphaGo、GPS 导航等 AI 系统并不存在控制问题,真正无法控制的是生成式 AI,因此应暂停这项特定技术直到能控制为止。

  11. elvis(@omarsar0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与其等修复,不如自建个人 AI 智能体

    有开发者主张个人智能体应完全自有,从轨迹、记忆到输出全部掌控,并建议从零开始、保持极简、按需演进,或基于开源方案 Pi Durable 起步。他指出当前 muse、grok bot、instinct、dots 等个人智能体都不真正属于用户,数据安全、模型选型和产品定制都受制于厂商。

  12. a16z(@a16z)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜单发布,新增付费维度

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况这一维度。数据显示,目前仅少数消费者为 AI 付费,但支出高度集中在头部,开发者、创作者等重度用户是主力;Olivia Moore 与 Josh Elman 还讨论了个人智能体、ChatGPT、Claude、Gemini 的不同走向,以及 OpenAI 的 $1B 广告收入规模。

  13. Thomas Wolf(@Thom_Wolf)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 晒 microduck 首次 BBQ:交了不少朋友,什么也没吃

    Thomas Wolf 发文记录 microduck 的第一次 BBQ,称它交了不少朋友,但什么都没吃。配文还提到是在测试与当地野生动物的兼容性,推文获 1067 次点赞、123464 次浏览。

  14. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 仍居首,Claude 升至网页端第 3

    a16z 发布第七版 Top 100 消费级 AI 应用榜,首次新增收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 10 亿;Claude 升至网页端第 3,月访问量近 10 亿。

  15. Paul Graham(@paulg)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 引用 Trevor Blackwell:不存在完整的工具集

    Paul Graham 在 X 上引用 Trevor Blackwell 的话:"不存在所谓完整的工具集。"该帖获 718 次点赞、29 次转发,浏览量约 17 万。

  16. David Heinemeier HanssonAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你在杞人忧天什么?AI 时代的繁荣不值得被末日论淹没

    David Heinemeier Hansson 撰文反驳气候、不平等与 AI 的普遍末日论,认为人类物质指标从未如此之好,泛化的焦虑只会破坏心智。他指出,若因恐惧 AI 而错失其带来的智能繁荣与创造力爆发,才是真正的损失;气候末日论三十年也未能遏制全球排放增长,反而拖垮了欧洲经济。

  17. Viking(@vikingmute)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 重度用户提醒:量大产品 Serverless 可能比 VPS 更贵,做 TinyShip 坚持 no vendor locking

    一位 Cloudflare 重度用户指出,用户量上去后 Serverless 几乎一定比 VPS 贵,用 Durable Objects 等云平台还有出现天价账单的风险,VPS 被刷最坏只是机器打满、站点挂掉。

  18. Gary Marcus(@GaryMarcus)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:骰子没有意识,LLM 里的随机性也不等于意识

    Gary Marcus 反驳"LLM 具有意识"的说法,指出 LLM 中存在包括 temperature 以及服务器动态在内的多种随机性来源,但这些都不会让矩阵运算产生意识。他同时喊话读者去看国会议员 Lieu 想传达的内容。

  19. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑将 ELIZA、深蓝等旧系统一律称为"超级智能"

    Gary Marcus 反驳将 AI 一律冠以"超级智能"(SI)的说法,指出 1965 年的 ELIZA 只是关键词匹配,深蓝只会下棋,早期 Google 搜索算法只能做搜索,最初的 ChatGPT 因不可靠和幻觉严重更像演示而非产品。他讽刺称照此标准自己的 Apple Watch 也算超级智能。此番评论针对 Elon Musk 提出的"不再叫 AI,改叫 SI 更好"。

  20. Gary Marcus(@GaryMarcus)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 批评 Elon 混淆「AI」与「超级智能」概念

    Gary Marcus 指出 Elon 未理解「AI」与「超级智能」的区别:AI 一词自 1956 年起就是标准术语,而「超级智能」在 Nick Bostrom 2014 年的论述中有特定含义,指在所有领域大幅超越人类认知能力的 AI。他认为混淆这两个术语极具误导性,且对过去 70 年从事 AI 研究的数十万人不尊重。

  21. Julien Chaumond(@julien_c)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Clippy 与 ChatGPT 宠物 << Microduck:这只生物需要以 OS 级别融入我们的生活

    Julien Chaumond 转发并称赞 @mattt 的构想:把 Clippy 与 ChatGPT 宠物这类"生物"以操作系统级别集成进我们的日常生活。推文以 Microduck 作为示例形象。

  22. Paul Graham(@paulg)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 分享创业者关于创业消耗全部时间与注意力的感悟

    Paul Graham 引用一位刚创业的朋友的话:"你说它会占用我所有的时间和注意力,但它确实占用了你所有的时间和注意力。"这条推文获得 703 个点赞、90 次转发和约 3.9 万次浏览。

  23. Import AI — Jack ClarkAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 475:群体扩展、Google DeepMind 为生物内容加水印与 AI 科学经济

    Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。

  24. Anton Osika – eu/acc(@antonosika)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika 发文调侃:别问那个倒立的人是谁

    Anton Osika 发布一条内容称"别问那个倒立的人是谁",该帖获得 1 条回复、7 个点赞和 1604 次浏览。内容未透露倒立者身份或其他背景信息。

  25. Viking(@vikingmute)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户吐槽 ChatGPT 体验崩坏:Astra 太贵、Sol 6 又慢又幻觉、Luna 档也垮了

    一位用户抱怨近期 ChatGPT 使用体验灾难性:Astra 太贵用不起,Sol 6 又慢又有幻觉、忽略指令、来回拉扯,Luna 档也出现退化。原本能完成指令明确的小任务,如今还没做完就说提前完成,服务重启失败就直接放弃、不去修复,连 Coding 搭档也从享受变成折磨。

  26. CSDNAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 负责人 Yossi Matias:AI 正在终结岗位头衔,初级员工要一出道就硬抗判断力

    Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才积累的判断力,如今初级员工一出道就得硬扛。

  27. Geek(@geekbb)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    这条推文数据:43 条回复、31 次转发、477 个赞

    一条推文获得 43 条回复、31 次转发、477 个赞和 84540 次浏览,互动数据由 xgo.ing 提供。

  28. InfoQ 中文AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 负责人 Tibo:未来 28 天每天交付一项用户可感知改进,否则重置额度

    OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 承诺,未来 28 天每天推出一项对大多数 Codex 和 Work 用户明显有用的改进,否则进行一次完整的额度重置。

  29. Martin Fowler(@martinfowler)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 碎片集:Google 最新模型懂得更少,但装得更少

    Martin Fowler 发布 Fragments 碎片集,谈及 Google 最新模型懂得更少、但假装懂得也更少,并探讨读代码的未来、Ola Bini 被驱逐,以及与 Eric Evans 在 DDD Europe 的对谈。

  30. 极客公园AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为什么总在画美女?从 Lena 到模型默认值的五十年

    极客公园文章指出,AI 图像默认生成美女并非偶然:生成模型学习数据分布并从中心取样,而心理学研究显示「平均脸」恰是人眼中的美。Civitai 上 NSFW 图片占比从 2023 年 1 月的 41% 升至 2024 年 12 月的 80%,2024 年一项研究发现用 PickScore 微调模型会增加 NSFW 输出,Grok 的 Spicy 模式则直接向付费用户开放暗示性内容。

  31. 深思圈AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Tibo 谈 agent:留存就是分发,工作流只是过渡

    深思圈整理了 OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 上的访谈,他认为让用户自己设计循环、画流程图调教工作流只是过渡,未来是 Dots 这类会学习、永远在线的个人 agent。

  32. AI前线AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 研究员 Noam Brown:1 万个 Agent 解出千禧年难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,用 1 万个智能体在 88 小时内消耗 1300 亿 token 解决一道千禧年大奖难题,功劳主要不在多智能体,他估计多智能体的贡献不到 10%,核心原因是拥有一个强大的通用模型。

  33. meng shao(@shao__meng)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    反对个人 AI Agent:Nathan Baschez 提出共享「AI 工厂」范式

    Nathan Baschez 认为 99% 公司让员工各自折腾 Codex、Claude Code 等个人 AI Agent 的模式不是终局,下一步应是共享的「AI 工厂」。与 Skills 不同,工厂要求系统 Shared、Specific、Scrutinized——尤其可审视性决定反馈回路是否存在。他以两家百人咨询公司为例:集中建设共享工厂的一方在学习曲线上可深入约 5 倍。