Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
Marc Andreessen 转发 Samo Burja 的观点:"内部人的故事最终会被他们讲给外人的故事淹没。"该推文获 125 个点赞、15 条回复和 7 次转发,浏览量约 7.1 万次。
Andrej Karpathy 回应 @btaylor 称,问题不只是 em dash,许多正当且有用的语言结构都突然且有些随意地变得极其别扭和尴尬。该帖获 4135 点赞、216 条回复。
微软 CVP Doug Burger 与 AI 研究员 Subutai Ahmad、Nicolò Fusi 讨论人类记忆与机器智能的根本差异,指出 Transformer 不受分心影响、能记住新密码,而人类在数小时干扰后回忆新密码则很困难。内容以视频形式发布。
半拿铁《中国手机江湖》下半场梳理国产手机混战史:从运营商补贴催生的「中华酷联」,到魅族、小米、锤子、OPPO、vivo 与华为的轮番崛起。2014 年运营商削减补贴动摇「中华酷联」渠道根基,小米当年销量突破 6000 万台登顶中国市场;2025 年市场形成华为、vivo、苹果、小米、OPPO 五家份额约 15%—17% 的格局,竞争重点转向 AI、芯片、汽车与折叠屏。
许多公司默认用户渴望更多 AI 功能,但现实是这些功能采用率和留存率普遍偏低,交付成本高且易损害口碑。原因在于 AI 往往作为外挂工具打断既有工作流,还需用户逐一核实模型幻觉,反而增加工作量。作者认为人们要的是快速、可靠、可预测地增强工作方式、接管枯燥任务的 AI,而非"AI 优先"的工具。
Pangram 以"100% AI"为卖点宣称能判定文本为 AI 生成。有网友借此调侃尼采惯用 em dash,按此标准其格言也是用 ChatGPT 写的。该帖获 209 次点赞、63641 次浏览。
Kevin Kelly 提出,人工智能除了回答问题、编写代码之外,其内部的潜在空间(latent spaces)将成为一种全新的创意媒介。他在自己的 Substack 文章中阐述了这一观点,认为 AI 本身所蕴含的潜在空间值得被当作创作载体来挖掘。
Trae Stephens 称自己十多年来主张强制公民服务能让美国更强,过去常被批为阻碍个人目标或违宪;随着 AI 引发的大规模失业逼近,这一想法变得更易被接受,他邀请人们去看 PirateWires 上的相关论述。Marc Andreessen 转发了这条推文。
Marc Andreessen 就 Gallup 一项民调结果发帖,称其为"死猫反弹"(dead cat bounce),并附上该民调链接。
Momenta 创始人曹旭东在 IPO 前后接受《晚点聊》专访,讲述公司十年"一个飞轮、两条腿"战略。Momenta 在第三方城区 NOA 份额已超 65%,比华为等对手总和还多。他还推演了面向具身智能与物理 AI 的下一个十年。
Marc Andreessen 转发 George Sivulka 的观点称“人类首次比软件更便宜”,并将其称为一次叙事反转。该推文附有 Sivulka 的文章链接,互动量达 293 次点赞、37 条回复。
Marc Andreessen 转发 Roy 的推文,称有些公司只招真正懂行的人,20 人就能完成别处 400 人的工作量,没有会议、全员每周只在 Slack 沟通一次。该推文获 1355 次点赞、195754 次浏览。
37signals 创始人 David Heinemeier Hansson 称新款 Dell XPS 系列彻底改变了他对 Dell 个人电脑的看法,他已把 XPS 14 当作主力机使用数月,上周又入手了 XPS 13。
微软研究院 AI 研究者 Subutai Ahmad、Nicolò Fusi 与微软 CVP Doug Burger 讨论认知的本质,以及当今 AI 系统在智能谱系中的位置。他们以“好奇的 3 岁孩童”与“顶尖 AI 模型”作对比,探讨两者谁更智能。
播客「自习室 STUDY ROOM」请来 Bot Auto 创始人、图森联合创始人侯晓迪,围绕 Google DeepMind 创始人 Demis Hassabis 的人生拆解智能问题,串联国际象棋、游戏设计、神经科学与 AI 的身份转换。节目一次性讲清深蓝、AlphaGo 与 AlphaZero 的区别、ChatGPT 开启新时代、LLM 涌现能力的来源,以及 AI 竞赛像淘金热的现状。
AI Talk 创始人赵汗青以自研虚拟歌手 Yuri 尤栗为例,讲述如何用 AI 合成形象与声线,并通过「撞种子」筛选和对话叙事构建「硅基人格」,其核心资产是人格化设定而非形象本身。他认为虚拟偶像短期优势是不会塌房、成本可控,但长期价值在于「AI 味儿」这种区别于人类的表达逻辑,一旦开放实时对话则可能因缺乏底线思维而「塌房」。
Mustafa Suleyman 表示,2023 年夏季他曾与 Ian Bremmer 在《Foreign Affairs》上提出设立 AI 金融稳定委员会的类似方案,并 @ 了 Eric Schmidt。该帖附上 foreignaffairs.com/world/artifici… 链接。
Epoch AI 估算,向免费聊天机器人发送 100 词提示词生成回复约耗 0.6 Wh 电,比微波炉运行 10 秒还少。AI 目前仅占美国年用电量的百分之几,低于空调(12%)和照明(8%),但数据中心电力需求大约每年翻一番。
从 Palantir 到 OpenAI、Anthropic,顶级 AI 公司正纷纷组建 FDE(前线部署工程师)团队。本期播客讨论 FDE 与 CSE 的角色差异,以及 AI 落地中"模型能力"与"业务价值"之间的鸿沟——为何企业 AI 需要有人深入现场完成最后一公里。节目还探讨了 AI Agent 会取代 SaaS 还是成为连接软件生态的超级触手。
Martin Fowler 发布新一期 Fragments,汇总 FOSD 上关于 harness engineering、自托管模型、宏大叙事和"bringing rocks"的讨论。文中还涉及用 fable 省钱、开发者教育的黯淡前景、Electron 是否还有未来,以及交互性专长与贡献性专长等话题。
Richard Socher 提出 AI 尚未显著推高 GDP 的三个原因:企业只是替换复杂流程中的部分环节,全栈 AI 原生创业公司仍需搭建 GTM 与销售体系,而经济中很大一部分本就不依赖高智能,如旅游、房地产、奢侈品、农业、体育和采矿。他认为知识工作、研究密集型产业、深科技和数字工作将从中大幅受益并超越这些传统行业。
李继刚发布《人生周报v081:方法》,记录本周遇到的好句子,分为「读」与「说」两部分。本周推荐书籍是笛卡尔的《谈谈方法》,他分享了其中明证、分解、次序、穷举四条思考原则如何成为自己思考习惯的底色。
今年上半年国内具身智能赛道已披露融资达 300-500 亿,超过去年全年,行业讨论其是否已走向泡沫。极客公园播客邀请蓝驰创投合伙人曹巍、具身智能投资人笔盒、诺亦腾机器人 CEO 戴若犁等嘉宾,探讨机器人公司估值逻辑、中美具身智能分岔及本体赛道未来一年半或进入平台期。嘉宾预测未来 12 个月真实商业场景开始造血、行业进入二八分化、2 万元级人形本体可能出现。
Nathan Lambert 认为开放权重模型正面临迄今最严峻的监管考验,多项信源提到白宫正在讨论通过新行政令管理开放模型,但尚无官方信息,可能只影响中国来源模型与政府用途。
Satya Nadella 在 X 上发布了一条指向 x.com 长文文章的链接,附带的数据显示该帖获得 15744 次点赞、3060 次转发和 992 条回复,浏览量约 1208 万。原文未披露文章标题与具体内容。
李继刚发布"人在做,AI 在看"一言,配文仅此一句。该帖获 32 条回复、1 次转发、15 次点赞、10857 次浏览,由 xgo.ing 提供支持。
播客《皮蛋漫游记》Vol.92 从克里斯·贝尔的《打破社交媒体棱镜》出发,讨论社交媒体如何放大身份与群体认同,以及为什么"打破信息茧房"有时反而让人更极端。节目还谈到少数高频发言者如何制造"全社会都在对立"的错觉,并延伸讨论青少年社交媒体禁令、网游争议等话题。
JetBrains 用 Claude Code 在 SkillsBench 的 86 个编程任务上实测 Caveman 电报体 Skill,发现输出 Token 实际只降 8.5%(从约 59.2 万降到 54.2 万),远低于其宣称的 65%。
Cognition 联合创始人 Scott Wu 称自己成长于路易斯安那、身边没人会写代码,如今在 Cognition 由 cog 团队带着工作。他转发的调查显示,在"身边有才华的人密度最高"的公司投票中,Cognition 与 Anthropic 各获 9 票并列第一,Modal 以 5 票居第三,OpenAI 4 票,Standard Intelligence 与 Cursor 各 3 票。
OpenAI 将 GPT-5.6 定位为小版本更新,实则把 ChatGPT、Codex、GPT Live 和 ChatGPTWork 塞进同一个入口,走向美国版超级 App。
Augment Code 的《We Built What?》最新一期节目深入探讨了当今工程师角色所需的技能。该期节目已在社交平台上发布完整内容。
罗永浩播客《罗永浩的十字路口》联合肆笑喜剧推出新一期,嘉宾小镟、继业、孙书恒、刘洪伟围绕爱情困局展开讨论。本期抛出"忠诚药""完美AI伴侣""删除出轨记忆""当真爱另有他人"等烧脑假设题,每道题都没有标准答案。节目还设有观众招募与话题征集环节。
Thinking Machines 提出要构建"扩展人类意志与判断"的AI,主张AI不应在少数地方训练后就被冻结,而应像人一样多样、分布式。为此它推进多模态交互与可定制化、支持用户训练模型权重、开发拓宽人机沟通的界面,并公开研究。
Richard Ngo 批评 AI Futures Project 的 AI 2040 场景:它既非预测也非建议,而是"乐观预测",导致读者无法分辨哪些部分是作者认为理想、哪些只是为求现实感而保留。
心理健康应用面临严重的留存危机:约 95% 的用户在第 1 天打开后 30 天内流失,30 天留存中位数仅 3.3%,即便是头部产品前 10 天也会流失约 50% 用户。文章指出,许多 UI 趋势以吸引注意和标榜创新为目标,与心理健康应用所需的降低认知负担、建立信任相冲突,新潮布局、隐藏导航和抽象图标会在用户最脆弱时增加使用成本。
短剧行业正分化为"卷规模"与"卷创作"两条路径,日新阅益文化董事长侯超与刚刚好影视董事长李佳佳在「乱翻书」播客中拆解两种打法:25万一部与80万一部对应不同策略,核心是"第一本金安全,第二利润规模"。两人认为卷剧本、卷体系可行,卷成本是卷错了方向,并指出 AI 与真人短剧已分属两条赛道——AI 保下限,真人冲上限。
Modal 认为自己是"一台计算机":用容器内存充当内存层级,通过 I/O Plane 出入数据,路由则经由 Routing Plane 或直接 Tunnels。
有人提议在 Kickstarter 上众筹一款 Claude Clock。原帖仅此一句,未透露该时钟的具体功能、价格或上线时间。
Sam Altman 宣布 GPT-5.6 sol 将于周四发布,并附上"happy building"。该推文获得 391 个赞、32 条回复、4 次转发和 64095 次浏览,引发外界讨论 Google 此时相对 OpenAI 的领先之处。