Opus 5.5 一句话生成产品宣传片,纯代码方式做视频
Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。
Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。
腾讯研究院发布新一期AI每周关键词Top50(0920-0924),覆盖算力、模型、应用、科技、观点与事件六大类。
一段用浏览器画 dario 的对比视频显示,Claude Opus 5.5 在其中的表现被 indigo 形容为"开悟了",并称这是 ego 的宣传视频,但对比效果"太残酷"。该推文被 orange.ai 转发,附带的视频在浏览器端无法播放。
Runway 联合创始人兼联合 CEO Anastasios Germanidis 阐述 AI 视频的终局是世界模型:Sora 曾触发 Runway 内部的生死冲刺,而扩大视频模型规模或许足以学到物理规律。他进一步提出实时生成可让世界模型充当机器人模拟器,软件的未来可能是直接以像素而非 HTML 和代码生成的界面,Runway 正朝完全神经操作系统推进。
Simon Willison 认为,coding agent 虽然能做出惊人的事,但要释放其全部潜力需要极高的纪律性和知识储备,因此软件工程反而变得更难。Gergely Orosz 回应称,自 Opus 4.6 和 GPT-5.2 及其配套 harness 出现后,这些工具写代码的能力已接近甚至超过自己最擅长的语言,但他认为非开发者短期内——甚至可能永远——不会直接推送生产代码。
Jerry Liu 在 X 上晒出数月前的一个吉祥物草案,并表示最终没有推进这个方案。该帖获得 4 个赞、2 条回复、3643 次浏览。
LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。
PureblueAI 创始人鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 GEO 拆成漏斗与因子挖掘,类比量化交易,主张研究 AI 可解释性而非文章写法。他还提出 prompt 就是 AI 时代的货架,豆包偏爱抖音视频、海外模型偏爱官网与 Reddit,酒旅品类已按 8 到 12 个点抽佣。
Opus 5.5 用一个文本模型、以纯代码方式一句话生成产品宣传片,效果超过此前供应商报价上万的同类片子。这一能力让不少视频 Skill 失去存在必要,被单个模型直接吃掉。
Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。
LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。
Virgin Voyages CMO Nathan Rosenberg 表示,当品牌和创意人员成为战略与愿景团队的一部分,创意会变得更丰富。该观点来自其关于品牌与创意参与战略制定的表态,未涉及具体产品或数据。
Replit 表示,模型能力没有放缓,风险同样在上升,围绕 AI 的讨论需要从「AI 安全」转向网络安全,聚焦谁拥有访问权、什么被连接以及如何加以保护,这正是 Replit 的发力方向。该表态引用 The Information 于 9 月 24 日发布的 TITV 内容。
有人在征集 LLM 数据检查工具,重点关注 SFT traces 和 RL env tasks 等场景的查看需求。该帖获得 19 条回复、5 次转发和 98 个点赞,浏览量 16626。
Zuck 在收购消费级团队与产品方面堪称 N=1 天赋,IG 和 WhatsApp 都是传奇收购,Muse 在 Alexandr 与 Nat 带领下开局强劲,预计前三周 DAU 将突破 100 万,并已连续 7 天位居 App Store 榜首。
花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。
Thomas Wolf 提出,智能价格下降可能是宇宙历史尺度上最深刻的事件之一,宇宙的自由能大多以热或黑洞形式耗散,生命、大脑与 AI 模型则是截流并建构低熵结构的载体。Epoch AI 数据显示,自 2023 年以来同等性能水平的 AI 成本每季度下降约 47%,比 DNA 测序快 4 倍、比算力快 6 倍、比锂电池快 18 倍,1973 年前相比电力快 54 倍。
Martin Fowler 在最新 Fragments 中提出,AI 的风险在于把它接入一切,彩色语法高亮反而妨碍代码理解,并讨论了 Forward Deployed Engineer 这一角色应有的含义。
Philipp Schmid 在 X 上发布了一条指向 x.com 文章的链接,该帖获得 8 条回复、8 次转发、107 次点赞和 33890 次浏览。原文未披露文章的具体主题与内容。
Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。
Martin Fowler 博客新文指出,反馈能改善人类协作,但做好并不容易。Anuja Karnik 与 Sumeet Gayathri Moghe 基于"表扬与批评都应被视为正向"的原则,给出了一系列实操建议。
一位用户称自己用某模型跑了一个耗时 2 小时的任务,最终效果"非常不错",评价其水平接近 P8 高级架构师、干活速度相当于 P6 熟练工程师,但成本只要实习生的工资。他认为 AI 时代正在让这个"不可能三角"慢慢变成可能。原文未点名具体模型。
网易智企副总经理段毓铮在2026网易未来大会演讲中提出,企业落地AI不应以员工提效为首要目标,而应先找准经营痛点,看收入、成本、新品研发周期等指标是否改善。网易智企已推出企业级AI Agent平台"帝王蟹",并在餐饮供应链、潮玩、充电桩等客户业务中探索全链路AI落地,其中充电桩运营商可借助AI将定价决策从每周一次提升至每天甚至小时级。
曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。
经济学家刘煜辉在2026网易未来大会上提出,美国AI正同时面对技术攻关与金融周期的冲突:自我迭代这一关若闯过就通向AGI,闯不过则在金融层面变成"飞刀"。他引用《华尔街日报》披露的数据称,美国九个巨头一年表外融资达3万亿美元,表内仅6000亿,而美国政府一年国债净增2.9万亿,AI融资成本高至7、8个点以上。他认为这一关若失败,冲击将先在美国金融市场显现,中国可能获得机会。
有开发者吐槽 6 sol 表现差:让它写一个新 feature,结果引入一堆 regression,e2e 测试大量失败,改半天速度还慢,现在直接改用 5.6 sol,感觉比它好多了。
GPT 6 被低估的地方在于 Computer Use——它能像人一样操作电脑,视频认为这就是普通人可用的 AGI。节目同时提到开源的果蝇神经元,并质疑硅谷热炒的 Jev:在智能与功耗的对比上,Jev 还不如一只果蝇。Grok Bot 则选择给 AI 配一台云电脑。
Sahil Lavingia 发文回顾自己代表 DOGE、在美国退伍军人事务部(Department of Veterans Affairs)担任软件工程师的工作经历,并附上 sahillavingia.com/doge 链接与原文引用推文。
腾讯研究院提出“十五五”期间应加快发展服务消费、推动消费转型升级,养老、医疗健康、教育文化娱乐、旅游四类传统服务消费仍有增长空间。2026年二季度AI大模型渗透率达97.5%、付费率13.8%,付费用户月均支出约151元。建议探索发放“AI服务消费券”,优先采用10%左右低比例补贴并设单个用户年度补贴上限。
Altimeter Capital 创始人兼 CEO Brad Gerstner 在 All-In Summit 上判断,目前还不是 2000 年式 AI 泡沫:英伟达收入一年约翻一倍,半导体公司贡献了纳斯达克约 70% 的回报,头部 AI 实验室合计年化收入约 1000 亿美元,但需要冲到 1800 亿美元才能跟上资本开支。
在云栖大会阿里巴巴 AI Native 研发实践论坛上,阿里、蚂蚁、飞猪等团队披露:编码仅占软件交付总时长 20%—30%,极端链路中编码不足 1%、约 1 小时,但需求到交付仍需约 21 天,时间耗在影响分析、环境准备、联调、审批、灰度和封网等环节。
Eight Sleep 的 Pod 智能床套通过液体循环动态控温、床体抬升减轻打鼾,最多可将睡眠表现提升 30%,公司现估值 15 亿美元、产品进入全球 35 个以上国家和地区,并于今年 4 月进入中国后成为中国增长最快的市场。
阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。
英伟达CEO黄仁勋在最新访谈中称AI危言耸听已走得太远,将当前AI浪潮视为一场新的工业革命,提出能源芯片、AI工厂、模型、应用、社会影响构成的"五层蛋糕"架构。他反驳AI终结就业的"有害神话",认为安全、对齐和沙盒化都是可通过工程手段解决的问题,产品不安全就不应发布,并强调世界既需要闭源也需要开源模型,以便各国和企业掌控自己的基础设施。
斯坦福大学校长乔纳森·莱文在 2026 年开学典礼演讲中提出,AI 时代大学仍应坚守三件事:保持探索的自由、尊重真正的专业知识、在与不同背景的人相处中成长。他同时给学生三条建议——带着目标探索、保持好奇而非急于评判、珍惜能来到斯坦福的幸运,并称“未来不是发生在你身上的事情,而是由你亲手创造的东西”。
一条推文以玩笑口吻表示希望名为 hayZee 的模型就是解开 Navier-Stokes 方程的那个,并呼吁把这位作者请到平台上。推文附带一段视频,互动量达 63 条回复、93 次转发、877 个点赞和 92,414 次浏览。
Suhail 表示,Slack bot 表现格外出色,他对此感到意外惊喜。该内容由 xgo.ing 提供支持,未披露具体模型或产品版本信息。
Jerry Liu 转发 Murtaza Khomusi 的一条推文,内容为"把自家顶尖工程师称作 baddies 这件事该正常化"。该推文获得 18 个点赞、5 条回复,浏览量 4307。
Andrew Chen 推荐了一篇 WSJ 经济报道,称其中每张图表都令人惊艳。该文链接指向 wsj.com/economy 下的 AI 相关专题页面。原文未展开具体数据或结论。
该帖获 2186 个点赞、398 次转发、136 条回复,浏览量达 5996568 次,由 xgo.ing 提供数据支持。