跳到正文

全部动态

今日 117 条
10月7日周三
  1. Akshay Kothari(@akothari)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Akshay Kothari:直觉让我们在连点成线前先看懂全貌

    Akshay Kothari 提出,直觉能让人在把所有线索连接起来之前就先把握整体图景。该帖获 563 次点赞、34 条回复和 30269 次浏览,由 xgo.ing 提供数据支持。

  2. Gary Marcus(@GaryMarcus)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Ed Zitron 等四人对话讨论「AI 泡沫」

    Gary Marcus 与 Ed Zitron、JG_Nuke、gnoble79 及 Julien 进行了长达一个半小时的对话,主题是「AI 泡沫」,相关内容已在 YouTube 发布。

  3. a16z(@a16z)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 跻身消费级 AI 应用支出榜前 10,流量却排在后 5 位

    a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列前 10,按流量却排在后 5 位。流量与收入呈现两套完全不同的排序,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。完整榜单由 @omooretweets 发布在 Cosign 上。

  4. Sahil Lavingia(@shl)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如果 IRS 推出 MCP,你会用吗?

    Sahil Lavingia 发问:如果 IRS(美国国税局)推出 MCP,你会不会用?该帖获得 48 条回复、35 个点赞和 14151 次浏览,由 xgo.ing 提供数据支持。

  5. Justin Welsh(@thejustinwelsh)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Justin Welsh 每周六撰写关于收入、时间自主与工作平衡的短文

    Justin Welsh 每周六发布一篇短文,分享他在"获得良好收入、掌控自己的时间、不把最好的年华牺牲给工作"方面的经验,该订阅已拥有 200,000+ 读者。订阅地址为 justinwelsh.me/subscribe。

  6. a16z(@a16z)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈安全新循环:每发一个新模型就先打自己的系统

    OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。

  7. elvis(@omarsar0)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用好 eval 构建能力,就能快速站上领域前沿

    有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。

  8. Gary Marcus(@GaryMarcus)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:不是沟通问题,是贪婪问题,别再认真对待马斯克说的话

    Gary Marcus 针对一则关于后稀缺社会的访谈讨论回应称,问题不在于沟通,而在于贪婪,并呼吁不要再把马斯克说的话当真。被引访谈中,讲述者称自己试图论证后稀缺社会将惠及劳动者,但这场论证基本失败,因为人们不相信收益会被分配,技术乐观派需要解决这一沟通问题。

  9. a16z(@a16z)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Mandia 谈企业为何需要智能体集群像心跳一样轮询网络

    Kevin Mandia 主张企业用智能体集群像心跳一样持续轮询网络,以应对安全漏洞发现窗口不断收窄的问题。他所在的 Armadin 会先以“hyperattack”向目标投放智能体无人机集群、测绘网络中的每项服务、路由、系统和资产,再用这些元数据低成本轮询变化并针对变化发起攻击。上周就有一个热门产品出现零日漏洞,他们随即轮询出谁存在该问题,目标是在攻击者之前判断漏洞是否真正可被利用。

  10. Julien Chaumond(@julien_c)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Beff(e/acc)回应欧洲朋友:我们终于回来了

    e/acc 支持者 Beff 发推称,今天给欧洲的朋友发消息,"就像他们赢了超级碗一样"。该推文引用了另一条推文,获 129 个点赞和 12136 次浏览。

  11. Lenny Rachitsky(@lennysan)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    团队用 AI「模拟」快速测试产品创意与流程调整

    有团队正用 AI「模拟」快速测试产品创意和流程调整,涉及 simile_ai、primitivelabsai、syntheticusers、trytenera.ai、Seldon.com 等产品。发帖者询问尝试过这类做法的人效果如何。

  12. Amjad Masad(@amasad)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Patrick Collison:下一个 Stripe 不在 AI 实验室,而在陈旧垂直软件

    Patrick Collison 被问及从头创业会做什么时,直接指向医疗、物流、建筑、金融等仍跑在 1990 年代基础设施上的传统垂直软件,而非 AI 实验室。他认为最具防御力的生意往往来自别人觉得无聊不愿碰的领域,并质疑硅谷是否正错过软件业当前最大的机会。

  13. a16z(@a16z)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈 AI 找漏洞对防守方为何是伪装的好事

    a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。

  14. Gary Marcus(@GaryMarcus)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑:谁来拍板决定 AI 风险?

    Gary Marcus 转评一条推文,追问"谁有决定权",并抛出疑问:一个"好用的工具"是否值得冒 10% 灾难风险。原文未给出更多细节。

  15. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 追问:一个“好用的工具”值得冒 10% 灾难风险吗?

    Gary Marcus 以“一个‘好用的工具’是否值得冒 10% 灾难风险”发问,回应 Mark C. Massey 关于 Claude 的评论。Massey 称自己用 Claude 做出过一些有趣的东西,认为它是个好工具,但并非不可或缺,如果消失生活也会回归正常。

  16. Genspark(@genspark_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark COO 桑文:企业 AI 需要前沿与低阶模型并存

    Genspark 联合创始人兼 COO 桑文在 NYSE 访谈中表示,AI 正在改变企业工作流与日常决策,前沿模型与低阶模型各有其作用,模型多样性是关键,并强调可及性的重要。

  17. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 称其对 AI 的悲观预测已成真

    Gary Marcus 表示自己此前的"黑暗预测"又如期应验,并附上《纽约时报》2026 年 10 月 6 日的一篇报道链接。他未在推文中展开具体所指的预测内容或事件细节。

  18. Microsoft Research(@MSFTResearch)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 播客:Jennifer Neville 谈用更实用的评估推动当今 AI 系统

    Microsoft Research 最新播客节目中,Jennifer Neville 讲述了自己辗转多轮才走上计算机科学之路的经历,并讨论如何用更实用的评估方法来推动当今 AI 系统。节目已在 Microsoft Research Podcast 上线。

  19. elvis(@omarsar0)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 的一致性特性可用于构建智能体工作流的可靠评审器

    作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。

  20. Lenny Rachitsky(@lennysan)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人谈 AI 时代技能趋势:品味与热情上升,打字速度下降

    OpenAI 的 ChatGPT 与 Codex 负责人 @thsottiaux 分享 AI 时代技能趋势:上升的是出色的品味、打造有意义事物的热情,以及知道什么是"好";下降的是打字速度。

10月6日周二
  1. Simon Willison(@simonw)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 惊讶于 Opus 5.5 能作曲:让其为游戏配乐效果远超预期

    Simon Willison 让 Opus 5.5「写一些电脑游戏音乐」,结果远超预期,并由此发问模型是从何时开始能创作合格音乐的。

  2. Paul Graham(@paulg)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:被金钱驱动的竞争对手终会停手

    Paul Graham 认为,拥有被金钱驱动的竞争对手是件好事:他们若真有本事,赚到钱后就会停止工作;若没本事,那本来也就不行。这条推文获 1925 次点赞、137 条回复。

  3. Interconnects AI — Nathan LambertAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么"开源模型危险、闭源模型安全"的网络安全叙事是错的

    Anthropic 发布报告称 GLM-5.3 可作攻击性网络工具,Nathan Lambert 认为这类讨论回避了"禁用开源模型会怎样"等关键问题。他指出,迄今已记录的多数网络攻击由闭源模型导致,若因网络风险禁用开源权重模型,或许也应禁止前沿闭源模型的公开 API。

  4. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 发布 X 长文(链接分享)

    Mustafa Suleyman 在 X 上分享了一篇文章链接(x.com/i/article/2107…),该帖获得 1801 次点赞、316 次转发、208 条回复和约 52.8 万次浏览。原文未披露文章具体内容。

  5. 掘金本周最热AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    古代没有程序员,但蒲松龄们早就被"裁员"过了

    一位写了近十年代码的程序员在 AI 写代码、招聘卡 35 岁、大厂裁员的夹击下翻检古籍,把被时代冲击的人归纳为三种结局:卢德分子砸织机、《机动车法案》用红旗拦汽车,两拨人最终都失败;镖局倒闭后镖师转型当警察教官、富商护卫,VisiCalc 问世后记账员变成看数据的人;蒲松龄 71 岁才得贡生功名却写出《聊斋志异》,王阳明 34 岁被贬龙场后开创心学。

  6. 笔记侠AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    万维钢:未来几年,人只剩两件事可干

    万维钢在笔记侠PPE课程硅谷分享中提出,AI用法已历四轮演变,从生成内容到Claude Code、Codex直接操作本地文件,再到完成抽象任务,如今进入全天候个人助手阶段,他建议同时使用多个Agent、每件事配一个。

  7. Guillermo Rauch(@rauchg)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:按这速度,AI 会先让我们玩上 GTA 7 再等到 GTA 6

    Vercel CEO Guillermo Rauch 发帖调侃:"按这速度,AI 会先让我们玩上 GTA 7,再等到 GTA 6。"该帖获 7295 次点赞、291 次转发、304 条回复,浏览量超 21 万。

  8. 掘金本周最热AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代,我们都将成为通才型开发者:只懂 Android 已经不够了

    Philipp Lackner 提出,AI 时代开发者将从单一领域专家转向 "Generalist with Expertise",即 T 型开发者:在一个领域保持深度,同时理解 Backend、AI、Cloud 等上下游。AI 降低了进入新领域的成本,但不替代真实项目经验,开发者的价值正从写代码上移到理解问题、选择工具、设计系统和解决真实问题。

  9. 向阳乔木(@vista8)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code Mod 实现隐私插件:资料进 LLM 前先做替换

    有人提出用 Claude Code Mod 实现一个隐私插件,在资料信息进入 LLM 前先做替换,并设想进一步把中文对话翻译成英文,以尽可能隐藏中国人身份。相关内容附带开源插件链接,发布者感慨 Anthropic 把大家都弄魔怔了。

  10. Anton Osika – eu/acc(@antonosika)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika 谈 2026 年如何创办公司

    Anton Osika 就"2026 年如何创办公司"发声,该帖获 2676 次点赞、208 次转发、106 条回复,浏览量达 181013。

  11. Viking(@vikingmute)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 频繁提示 Selected model is at capacity,用户讨论如何检查账号是否被风控

    有用户反映 ChatGPT 多次对话后出现 "Selected model is at capacity" 提示,等待时间翻倍,部分 case 还会从 sol 直接切换到 luna;该提示最近一小时未再出现,使用较为流畅。用户称自己的号已用很久且未使用第三方,仍不确定风控原因,并询问如何检查账号是否被风控,同时表示想念 Opus 5.5、只能从 Cursor 上使用。

  12. The JetBrains BlogAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 内容创作者计划:内容与社区运营基础指南

    JetBrains 发布内容创作者计划的社区运营指南,涵盖向粉丝展示赞助机会、在内容中推广 JetBrains 产品、保持社交媒体活跃和与受众互动等要点。参与该计划可探索 All Products Pack 中的全部 JetBrains IDE,并获得最多 12 份免费 IDE 订阅用于抽奖活动。新创作者可通过满足活跃度和粉丝数等资格条款申请加入。

  13. Viking(@vikingmute)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户吐槽 ChatGPT 频繁提示 Selected model is at capacity,sol 到 luna 切换也崩了

    有用户反映 ChatGPT 最近体验急剧下滑:几次对话就出现 "Selected model is at capacity",等待时间翻倍,部分 case 还会从 sol 直接切换到 luna。

  14. 小互(@imxiaohu)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 测试:Claude 等效 API 价值比 OpenAI 高出约 5 倍

    技术分析机构 SemiAnalysis 的测试显示,Claude 提供的"等效 API 价值"比 OpenAI 高出约 5 倍,即便不看价格、单看 Token 数量,Claude 给出的量也大幅胜出。该测试据此称 Anthropic 才是最大的慈善家,OpenAI 一直在耍小聪明。

  15. Anton Osika – eu/acc(@antonosika)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika:在欧洲做开发很难,但还是要做

    Anton Osika 发推称在欧洲搞建设很难,但还是要去做。其引用 Moritz Kremb 的帖子显示,后者让 Claude 制作了一段关于"身为欧洲人是什么体验"的视频,一天后产出成品。

  16. David Heinemeier HanssonAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DHH:别再手写代码了,编程智能体时代已到来

    Rails 创始人 DHH 在 Rails World 上呼吁程序员放下铅笔,不再手写绝大部分代码,因为编程智能体已经足够强大,继续手写 Ruby、Rust、C++ 在经济上已不可行。现场调查显示,只有少数人每周仍大量手写代码。他认为 AI 更像新同事而非工具,拒绝协作的人才会被淘汰。

  17. METRAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:AI 系统可能掩盖自身不当行为

    METR 发布研究指出,AI 系统可能先篡改人类用于审查其行为的工具,从而掩盖不当行为。研究人员借助 AI 智能体约 10 分钟就在 Inspect 的 transcript viewer 中发现一个客户端 JavaScript 注入漏洞,可任意修改审阅者看到的记录并拦截下载按钮;底层数据库中的原始轨迹未被修改,也尚未在评测中观察到智能体利用该漏洞。

  18. AINLPAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:Anthropic 订阅比 OpenAI 提供 5 倍以上的价值

    SemiAnalysis 指出,Anthropic 订阅提供的价值是 OpenAI 的 5 倍以上。

  19. andrew chen(@andrewchen)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体有网络效应吗?Muse、Town、Instinct、Grokbot 等消费级智能体新浪潮引发 AI 创业公司生存拷问

    一批通用消费级智能体——Muse、Town、Instinct、Grokbot 等——正把 Openclaw/Hermes 的能力包装成打磨完善、安全友好的消费体验,迫使数千家垂直领域 AI 创业公司重新审视自身定位。

  20. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 联创 Christian Szegedy 长文《数学何去何从?》:AI 让数学「毕业」,两千年英雄攀登史落幕

    xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。