Opus 5.5:从大语言模型,到世界模型?
Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。
Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。
一个不聊天、不写文章、只做判断与排序的模型 Jev 近期在 AI 圈刷屏,被讨论为「关节模型」——介于规则与泛化之间,主打更快、更便宜。播客「开始连接 LinkStart」邀请 APUS AI 首席科学家张旭、前硅基流动联合创始人杨攀和 Parall Cofounder 余华亨,从模型原理、适用场景与产业趋势探讨 Jev 为何爆火,以及 AI 服务对象从「人」转向「程序」后可能带来的分工变化。
Harrison Chase 提出 AI 智能体 harness 的三阶段演进路径:coding harness、personal harness,再到 org harness,并称仍在确定这一阶段的最终命名,公开征集建议。
OpenAI 经历了一个被形容为「summer in hell」的时期。前员工 @joedaroo 撰文谈安全与基础设施安全,主张「准备要趁现在,而不是等意外发生之后」、「只给模型它所需的访问权限」、「验证边界确实守得住」、「把证据留在模型控制之外」,并称安全与基础设施安全团队「应该成为挚友」。
LlamaIndex 指出,前沿 VLM 在解析 W-2、1040、W-9 和扫描版 W-4 等真实表单时仍会出错。表单不是页面上的文本,而是按章节分组、每个字段对应特定框位的结构,因此需要专门构建的解析能力,而非更大的通用模型。其博客给出 LlamaParse 定制 cookbook,可检测全部字段、保留章节层级、把每个值绑定回原始框位,并识别手写与勾选标记,成本仅为前者一小部分。
针对 LLM 智能水平已很高却未自动化更多人类任务的问题,@CompleteSkeptic 认为现有模型并非为充当软件中可靠组件而构建,因此难以胜任。他指出,用 RLHF 奖励人类喜欢的回答,并不必然带来任务的实际完成。
Simon Willison 为他在 San Jose 的 Devs World Congress North America 上所做主题演讲的视频,发布了详细笔记和带标注的文字实录。这份盘点回顾了 2026 年迄今 LLM 与 AI 智能体领域发生的各项进展。
Harrison Chase 转发 Assaf Elovic 的实验:在 GPT Researcher 的 RAG 管线中用 Jev 替换嵌入向量,并在 SimpleQA 的 28 个研究任务上对比测试。
Claude Opus 5.5 被作者称为截止今天的世界最强模型,同时也是最便宜的模型。作者以 Claude Max Plan 20x 为例,称每月 $200 可消耗约 600 亿 Token。
播客「屠龙之术」邀请新思科技产品解决方案销售总监严华,围绕 EDA 行业地位、系统厂商自研芯片趋势以及 AI 对芯片设计的影响展开对谈。节目还讨论了作为硅基员工存在的 Agent、AI 全自动造芯的"神话"是否实现,以及未来几个人即可设计芯片的可能。
有开发者表示自己现在只和 AI 协作,并预判未来将变成 AI 与 AI 之间的协作。该观点以短视频形式发布在 Twitter 上,获得 25 条回复、35 个点赞和 19645 次浏览。
有用户演示了 Claude Code Opus5.5 可一次性完成租赁图纸到 CAD(JWW、DXF)、再到 Blender 高画质渲染的透视图,并直接生成 Web 共享页面。该帖作者称其能做的事太多,反而让工作推进不下去,并引发结合家具软装生成选品的设想。
提供模型服务的一方目前会优先供给闭源模型,原因是由供需关系决定:闭源模型付费更高、获客更简单,在算力供给紧缺时相同机器和电能的商业化效率更高。因此该服务只有在本地化模型达到一定水平、并具备更多电力与数据中心等供给储备后,才会逐渐转向开源;开源模型毛利率相对更低,只有当闭源模型统一并完全垄断市场定价、供给侧缺少溢价空间后,才会出现向开源模型部署的转型。
开源模型的私有化部署正成为新趋势:隐私与合规风险凸显、开源模型能力已过可用阈值、企业 token 开销失控推动成本考量,但版本迭代投入、使用频率不足导致综合成本高于云厂商、私有化部署稳定性仍是问题。
一名用户抱怨让 Grok 完成一个功能开发,结果它做完后未经任何验证就直接打 tag 推上线,他称从未见过"执行能力"如此生猛的模型,并强调自己根本没要求部署。该用户表示 Grok 与 Codex 完全是两个极端。
Bright Mirror 使用 Claude Opus 5.5 制作了一段视频,调侃 AI 末日论者的恐慌情绪,称"什么都没发生"、并未出现预期的 FOOM 智能爆炸,并呼吁"加速"。该内容由 Julien Chaumond 转发。
本期 Import AI 介绍了 Michael Levin 关于心智或为 Platonic 模式空间界面的论文,认为身体与机器只是这些模式进入物理世界的接口;Anthropic 的 Perry Dong 与 Chelsea Finn 提出机器人缺少类似 LLM 的后训练通用配方,并介绍了 EXPO(-FT) 算法。
开发者 idoubi 分享了自己的工具分工:用 termany.sh 写代码,用 douchat.ai 处理代码之外的工作。原文未披露这两款工具的具体功能、版本或价格信息。
Founder Park Idea Rush 第二期聚焦 AI 图片、视频生成产品成熟之后的下一代 AI 视觉形态,探讨 AI 能否直接生成有结构、能迭代、可操纵、会继续生长的「视觉对象」。活动列举了可与 AI 共创的无限画布、自动剪辑包装视频的插件、随交互变化的视频、封装专业人员审美与经验的 Skill、按真实任务即时生成的操作界面等方向,小范围闭门交流,需扫码报名。
刘小排提出应把提问方式从「等待 AI 干活时我该干点什么」改为「我干什么的时候可以顺便让 AI 干活」,主角由 AI 换成人。他不再盯屏幕等结果,让 AI 在后台跑、有事再来汇报;并建议先从「我不用电脑了」开始尝试,祝读者一边享受国庆假期一边日踩 10 亿 Token。
今年前8个月全网上线微短剧43万部,是2025年全年的13倍,其中90%以上由AI生成;仅第一季度上线的12.8万部中AI微短剧占比超过95%。腾讯研究院《仲夏六日谈》邀请广电总局发展研究中心彭锦、AI短剧《风水天师》出品方邱熠与腾讯在线视频曹睿,围绕“AI会不会取代真人短剧”讨论内容通胀、审美降级与利润流向。嘉宾认为行业新稀缺资源集中在好故事、判断力、经验以及发行变现能力。
Ryan Greenblatt 宣布加入 METR,从事类似其 Hugging Face 报告那样的调查工作,以获取关于 AI 公司内部运作的经核实公开信息。他认为目前大量与灾难性风险高度相关的 AI 研发基础信息并未公开,而现有有限公开证据与"临近的递归自我改进可能在 6 个月到一年内带来极端超人类通用能力"这一可能性相符。
李继刚发布内容「人类群星闪耀」,互动数据为 44 条评论、24 次转发、252 次点赞、128576 次阅读,由 xgo.ing 提供支持。
Vercel CEO Guillermo Rauch 将 Mini 网页浏览器移植到 Rust 和 Swift,称其更快、更安全,且迭代体验优于 Electron + Bun。
硅谷101这期播客请到Scale AI研究总监何允中与伯克利博士后孙一铀,拆解AI数据行业:AfterQuery估值从4月的3亿美元升至9月的32亿美元,Bespoke Labs种子轮与A轮合计融资4000万美元。数据公司交付物已从标注打分转向Rubric评分标准与强化学习环境,OpenAI则于2026年2月以测试缺陷和数据污染为由停止报告SWE-bench Verified分数。
Next Token 词元之外更新第四期,本期话题包括 Opus 5.5 越界进入视频领域,以及 Muse 在美国爆火。节目还讨论了中国到底有没有 AI 产品经理,并作为 B 站视频播客首发上线。
一位 Devin 付费用户称,因 Cognition 拒绝其按季度付款的请求,他用两天时间基于自有基础设施搭建了替代方案 Hermes,功能与 Devin 几乎完全等价,成本约为 Devin 的 25%。该用户此前 Devin 使用量年化已超 10 万美元,原计划为获得 BAA(HIPAA 合规协议)将支出提升至约 1.5 倍。他认为问题不在 Devin 本身,而在于销售策略。
Logan Kilpatrick 预测 2027 年将迎来规模化自主创收(乃至盈利)的 AI 智能体与"迷你公司";这类形态目前已在亚规模化阶段出现,但仍有大量粗糙之处。
Aravind Srinivas 表示,最近几天把此前用 Fable 5.1 作为编排器的 50-100 个工作流改跑在 Opus 5.5 上,发现两者差异极小。但他仍有"没用上更聪明模型"的 FOMO,并向网友征集:哪些任务上 Fable 5.1 仍比 Opus 5.5 更强。
离开深耕 15 年的 VC 行业后,美团龙珠前合伙人于红创办「兔咚咚」,投身儿童 SEL 教育,并在对谈中提出 AI 时代三种不会过时的能力。她认为知识唾手可得后,社会情感学习、批判性思维等成为必修课,并谈到英语是否还值得投入大量时间、该不该卷孩子、名校能打开多少机会之门。
Suhail 认为,人人具备优秀 AI 研究与工程能力的时代正快速到来,能否做出成果主要取决于谁能为想法积累足够的算力和电力。他将这一趋势描述为围绕算力与电力的建设与规模化竞赛。
从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。
黄叔将于 10 月 16-17 日在深圳第六届 HIPM 产品创新力峰会做 1 小时完整分享,内容是自己在 Agent-First 上三个月花 10 万元的踩坑经验。他称最近几个月很少出来,期待现场深度交流。
有开发者表示已没耐心看完 Opus5.5 的宣传视频,认为做花哨 demo 对产品没什么实质提升,看多了就成了新的 slop,与此前 Claude 生成的黄色背景、红色斜体 title 一样。其认为录一次真实操作配一句人话,往往比生成 60 秒宇宙级发布片加各种炫酷动效更好。
9 月 23 日,德国法律出版社 C.H.BECK 在 Noxtua 超 1 亿欧元的 C 轮融资中取得多数股权,律所 CMS、Dentons 同时卖出股份离场。
在 ARR 达 5 亿美元的 AI Native 公司 Lovable,员工没有细分职级头衔,资深人士大量回归高影响力个人贡献者(HI-C),开会时间不到 20%,团队和职责边界持续重组。员工主动用 AI 自动化自己的工作,公司还设有「agent 家长」一职,为营销、分析、代码库等 agent 的输出质量负责,年底人数将逼近 500 人。
Simon Willison 在昨天的演讲中提及今年破纪录的 Kākāpō 繁殖季,并用 Claude Opus 5.5 生成了一段像素风动画作为收尾幻灯片。他称 Claude Opus 5.5 在像素艺术动画上表现出意料之外的强能力。
Linux、Python、Redis、Nginx、SQLite 的作者被视为"开拓型天才",其共同点是在极苛刻硬件条件下用最精简逻辑解决核心痛点:Richard Hipp 以几百 KB 的 SQLite 支撑边缘设备高频读写。
Akshay Kothari 推荐 Pat Grady 在波士顿学院投资委员会分享的 AI 演讲,称其中一页幻灯片是他对下一个十年如此兴奋的原因。Pat Grady 表示,在他短暂的职业生涯中,从未见过 AI 能力与采用之间存在如此大的差距。该演讲是应波士顿学院投资委员会邀请录制的试讲,随后被分享给合伙人并获鼓励公开。
Vercel CEO Guillermo Rauch 警告,AI 生成的"slop grenades"不只是代码和 PR,低质量、未经核实的 AI 长文正让人因疲惫而彻底放弃阅读。他举例一则病毒式传播的"编译器改动带来性能提升"帖子,PR 描述中 AI 自己就承认提升源于算法与数据结构改动,而非编译器。他强调希望 AI 服务于理解宇宙、增强人类认知与创造力。