模型架构过度复杂会带来 eval 无法测出的未知问题
模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。
模型架构引入过多复杂性会带来连内部 eval 都无法测试的未知问题。但作者认为,随着基础模型越来越聚焦所谓 agentic 任务,有时可以为效率上的大幅收益接受这些小的未知成本。
Suhail 发文称,如今最让他厌烦的就是这个时刻,但正文未说明具体所指。该帖获得 21 个点赞、5 条回复、2 次转发和 2431 次浏览。
有用户感叹腾讯的小微有点厉害,该帖获得 34 条回复、5 个点赞和 5491 次浏览。原文未透露小微的具体能力、版本或使用场景。
Laravel 上周宣布新规定,禁止提交 issue,只能提交 Pull Request,作者认为此举可减少垃圾 issue、便于维护者理解问题,且 AI 时代用户可借 AI 生成 PR。周刊还提到 Anthropic 用 Claude 完成费马大定理的 Lean 语言机器证明,代码长达 1300 万行,消耗数十亿 Token,已公布在 GitHub 上。
Replit 联合创始人兼 CEO Amjad Masad 在 etn 访谈中谈到,Replit 在纽约之前先于伦敦开设办公室,他本人曾四度被 YC 拒绝。他还谈及不喜欢"vibe coding"这一说法,认为 AI 已超越 95% 的工程师,并称前沿研究者正出现"AI 精神病"现象。
Amjad Masad 表示 AI 确实存在诸多风险,他个人尤其担心网络安全问题,但“灭绝风险”——即 100% 人类死亡——远不属于其中之一。此番表态针对 David Sacks 称批评者陷入“AI 精神病”、并非冷静观察者的言论。
一段演示显示,果蝇大脑在解出 Navier-Stokes 方程后崩溃。原帖附带视频,未给出模型名称、参数或可用性等细节。
LangChain 分享的案例显示,Credit Genie 的编码智能体过去只能靠猜来理解代码库,如今改为直接查询 OpenWiki。这条内容聚焦企业在实践中如何采用和使用 OpenWiki。
Lovable 创始人 Anton Osika 称 AI 警告值得认真对待,主张能影响所有人的决策应接受公共问责,构建最强系统的人须证明其可控。他支持推动国际协调,包括在安全无法证明时放慢危险开发,并呼吁各国投资研究、基础设施与公司,让技术惠及更多人。
Google AI 转发了一条演示:给苍蝇大脑 100 美元去交易比特币,获利时多巴胺神经元受刺激,神经元活动控制买卖决策并在 Coinbase 上执行交易。原帖来自 Alex Wormuth(@nftechie_)。
Jan Leike 认为,我们仍有时间改变规模竞赛的规则,但窗口可能不大。AI 将持续快速进步,风险与利害随之上升;若没有适用于所有公司的节奏控制机制,企业就会因商业竞争压力而被迫加速。
Jan Leike 表示,AI 带来的巨大收益仍需多年才能兑现,人们应对这项技术多一些耐心,从而降低与之相关的风险。该表态未给出具体时间表或产品细节。
Jan Leike 认为现在是建立机构机制、为 AI 前沿发展定节奏的好时机。他指出行业正陷入一场全力冲刺超级智能的规模竞赛,或许需要给大家更多时间做安全与对齐缓解措施。
HuggingFace 正在组建 Open Alignment 团队,专注开放模型的安全与对齐研究,涵盖网络安全方向。Thomas Wolf 同时就 OpenAI/HF 事件在 FT 发表评论文章,并称该问题需要 100 倍的透明度和研究投入;Julien Chaumond 则对少数前沿实验室闭门解决该问题表示愈发怀疑。
Mustafa Suleyman 在 X 上发布了一条仅含文章链接的推文(x.com/i/article/2097…),未附任何说明文字。该帖获得 177 次点赞、22 次转发、16 条回复,浏览量约 23.3 万。
AI 研究者 Jacob Coxon 以安全风险为由辞职,在 AI 风险讨论升温的背景下迅速发酵成一场舆论野火,传播范围远超资深 AI 观察者的预期,背后还有《华尔街日报》独家报道和提前协调的媒体放大。
智能体记忆的存储方式决定产品能可靠做什么。非结构化记忆捕获快,结构化记忆便于代码查询,最好的智能体会有意同时使用两者。
1757 年,苏格兰哲学家休谟(David Hume)在《论品味的标准》(Of the Standard of Taste)中正面处理了"品味是否主观、能否争论"这一问题。在一群人争论同一部电影是杰作还是烂片、最终以"品味是主观的没法争"收场的场景里,原文提出:都在说 Taste 很重要,但 Taste 如何培养提升,不妨回头听听先哲们的声音。
播客「东腔西调」Vol.281 邀请上海外国语大学全球文明史研究所教授施展,从文牧野执导、沈腾主演的暑期档电影《欢迎来龙餐馆》谈起,讨论中国平民视角下的美伊冲突与文明裂痕。节目以东北大厨徐福从"独善其身"到自我牺牲的转变,延伸至中国企业出海从产品出海到能力出海的两阶段变化,并提及 TCL 收购波兰工厂的案例。该片由 TCL 与坏猴子影业"青年导演计划"支持。
36氪创投研究院发布「2026年度产业投资系列名册」,涵盖十大赛道产业投资机构榜与「中国最受投资人关注的小天才创始人TOP10」。人工智能与具身智能两份TOP30名单中有19家机构重合,超六成交集。十位入选创始人全部为00后,其中九位出生于2000至2001年,七家创办公司成立于2025年及以后。
李继刚提出,AI 时代的交互设计应像共舞一样因用户的舞步而移动,而非让用户迁就固定的产品流程。该观点由其社交账号发布,帖文获得 44 条回复、6400 次浏览。
前沿实验室的飞轮逻辑是让最聪明的人使用领先模型,再蒸馏他们的输入、模型自身输出以及由此产生的合成数据与环境。Naval 指出,这些人之所以必须使用领先模型,是因为他们彼此处于相互竞争之中。
Richard Socher 认可 Perry E. Metzger 关于 AI 与安全的判断:微软月度 Patch Tuesday 修复了 974 个安全漏洞,几乎全部由 AI 系统发现,创下新纪录,但这并非 AI 安全末日,而是清剿长期潜伏漏洞的开始。他认为代码行数有限的软件不可能有无限漏洞,随着 AI 持续排查并推动软件形式化验证,漏洞池会逐步枯竭,安全状况正在快速变好。
Naval 发帖称,上一代 AI 吞下互联网后只成了拼凑的平庸之作;今天的 AI 则转而"猎食"当代莫扎特、爱因斯坦和莎士比亚,以催生一批替我们写代码、开车、工作和运转世界的"幽灵天才"。该帖获 8680 点赞、576 次转发,浏览 419684 次。
Harrison Chase 预计 computer use 将在未来几个月变得更好、更流行,LLM 擅长写代码是这一趋势的重要催化剂。该判断引用 Kyle Jeong 的一篇文章,未给出具体模型或版本信息。
HuggingFace 被黑后,AI 圈的讨论氛围出现明显转变,围绕 AI 是"脱缰列车"、即将脱离人类掌控的恐惧言论明显增多,一种不确定性的阴云正在笼罩。原文还提到 2027 年将"至少可以说很不寻常"。
Marc Andreessen 在 X 上发布一篇长文,推文附带 x.com 文章链接,获得 6233 次点赞、716 次转发、344 条回复和超 104 万次浏览。
Martin Fowler 发布了一项针对其社交媒体帖子近期互动情况的调查,结果显示某一平台的互动量遥遥领先,而另一平台自 2025 年初以来互动量急剧下滑。具体平台名称与数据见其博文。
Sam Altman 称《塞尔达传说:时之笛》重制版是"很久以来最好的消息",并表示 11 月 5 日和 6 日将无法上线,因为要找一箱激浪汽水。
法律、新闻和金融等高度监管领域正快速采用定制模型。用专有数据重新训练开源模型,可获得更高准确率和严格的指令遵循能力。DeepLearning.AI 认为,专用 AI 是企业技术的重要未来范式。
Anthropic 经济团队发布了一个新模型,用于推演 AI 到 2030 年可能如何影响经济增长、就业和工资等。用户可以查看不同情景、提交自己的判断,并与超过 10,000 名美国人的回答进行对比。
李飞飞指出,研发领域正分化为「token 充裕的研究」与「token 匮乏的研究」两条路径,未来属于前者。她认为当今顶尖 AI 产业团队和 neolabs 的进展令人惊叹,研究者的才智正被 AI 辅助大幅放大。她呼吁每位研究型大学校长都阅读这份报告,反思高等教育研究的未来。
Patrick Loeber 发布推文"flashback to simpler times :)",向 Python 开发者打招呼问好,该推文获 93 个点赞、7 条回复、1 次转发和 7912 次浏览。
vivo 互联网存储团队提出知识驱动计算(KDC)研究框架,主张 AI 应用软件应先明确系统面对的领域现实,再讨论现实模型、数字表示与验证反馈。文章以退款接口返回成功但资金未到账为例,说明数据库只保存表示而非现实,表示层缺口会沿 AI 判断链被放大为行动错误。该理论目前仍处开放研究阶段,团队表示 KDC 不替代 DDD 与 RAG。
Sebastian Raschka 撰文讨论 GPT-6 Astra,认为其最大跃升在计算机使用能力,并称 Astra 很可能采用循环 Transformer(recurrent depth)变体,理由是 The Information 的报道与该方法在固定算力下可提升建模表现。
Interconnects 文章认为,AI 对普通人日常生活的影响目前仍只是"四舍五入误差",家庭、饮食、交通和娱乐几乎没有直接改变。作者指出,与工业革命带来的廉价衣物、家用机械等实体收益不同,AI 的收益偏间接,且知识工作约占美国经济一半,AI 主要服务于精英,恐引发类似美国核电的反弹。
在 OpenAI 和 Anthropic 从事预训练研究三年的 Jacob Coxon 宣布从 Anthropic 离职,称两家公司都没有负责任地行事,正径直竞赛冲向自我改进的超级智能,拿所有人的生命冒险。
AI 与大语言模型推动下,一批 Web 工具正转向"意图驱动设计",不再让用户点击菜单、填多步表单,而是直接捕捉高层目标并在后台完成任务。Perplexity AI 可在两秒内综合出带对比表格与引用的单一答案,替代开满标签页的搜索;Vercel v0 用提示词直接生成含 Tailwind CSS 与 React 代码的完整界面。
2026 年上半年全球 AI for Science 融资超 44.3 亿美元,OpenAI 4 月发布生命科学推理模型 GPT-Rosalind,Anthropic 6 月推出整合科研工具的 Claude Science,Jeff Dean 离职创办 Discovery Loop。
作者批评推特上刷屏的镭射风卡片是1:1的模仿、没有创新,并以小红书账号"蜉蝣物语"为例:该账号2022年底用MJ做图,靠黄皮纸上的蝴蝶走红,两年做到20万粉丝,后改名"白日臆想"直播卖可拍打翅膀的蝴蝶闪卡盲盒。作者认为复刻的意义在于习得与迁移,缺乏创造力和想象力的世界无法进步。