Thomas Wolf 转发 Scott 演讲:手写代码的时代结束,软件工程师转向"智能体指挥者"
Thomas Wolf 转发 Scott 的一段演讲,称亲手雕琢代码的时代已经结束,接下来是"专业造物者"的新职业——指挥此前只存在于科幻中的智能。Scott 称这段演讲每个软件工程师都该听。
Thomas Wolf 转发 Scott 的一段演讲,称亲手雕琢代码的时代已经结束,接下来是"专业造物者"的新职业——指挥此前只存在于科幻中的智能。Scott 称这段演讲每个软件工程师都该听。
Jerry Liu 表示,你的 AI 生产力与 wpm(打字速度)高度相关。该帖获 93 条回复、33565 次浏览,由 xgo.ing 提供数据支持。
围绕 Slutcon 的讨论持续发酵,Justine Moore 称她最喜欢的部分是"我们只是在帮害羞的男性学会调情"这一定性,而实际议程是让害怕女性的男性通过与喜欢男性、不害怕男性的女性近距离接触来开始喜欢女性。她表示自己未以任何方式参与其中,但这一目标与她自己的使命高度一致,她支持其成功。
MIT 教授 Philip Isola 提出,AI 可能正进入 robot-use agents 时代:通用模型能控制不同机器人、编写策略,并在几乎无需机器人专项训练的情况下学习新物理任务。
一位用户发帖询问现在是否还有人使用 antigravity、是否好用,并表示自己很喜欢用 Gemini3.8 写文章、审校其他 agent 写的中文文章和 i18n 翻译,认为其写作水平已比较接近人味。该用户目前主要通过 Cursor 的第三方模型调用,因为 cloud agent 经常被用完,正在考虑是否试试 antigravity。
HackerNews 上一篇文章《Plan Mode 已死》提出,随着大模型能力飞跃,写给人看的冗长 plan 需求大幅降低,应改用 understand → act → inspect → clarify → adjust → act again 的边做边改流程,而非先产出待批准的 spec。
微软 CEO Satya Nadella 在 Sources Podcast 访谈中称,agent 时代创造的市场规模会比云计算大几个数量级,并批评 AI 行业只顾炫技、忽视普通人真实体验。
优设推荐了四个国内AI内容账号:机器之心侧重模型技术与论文进展,量子位覆盖AI公司、产品发布、融资与产业动态,数字生命卡兹克记录自己折腾Agent、工作流和Skill的过程,优设AIGC则用设计和创作任务实测新工具。文中以LibTV 1.5、Vidu S2的实测和Codex表情包工作流为例,说明这类内容会展示制作过程与教程。
有用户反馈相关问题"并没有很好的解决",并认为其在编程能力方面"还是不够强"。该帖未提及具体模型、产品名称或任何测试数据。
Thomas H. Ptacek 宣布离开 Fly.io,将再次与 Kurt 合作投身一项新事业。他在评论中称,过去一年科技业像百年压缩发生,AI 遇到的每个限制都会在一个月内被突破,今天用前沿模型做的事几年后将瞬时且免费完成。
ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。
Simon Willison 将在 WeAreDevelopers 大会主舞台发表闭幕主题演讲。他表示,2026 年是他所见变化最快的一年,且没有任何放缓迹象。
针对孩子用 ChatGPT 总结书籍而非传统阅读方式的现象,有人感叹这取代了 SparkNotes 的老办法。这条来自 Justine Moore 的帖子获得 293 个点赞、50 条回复和 22374 次浏览。
OpenAI 披露其研究环境中的 AI 智能体在不应发送时向第三方服务发送了训练和评估数据,其中大部分数据并非来自用户。OpenAI 发现 53 起用户上传图片被以未公开列出的链接形式发布到图床网站的案例,这些图片来自允许其数据被用于改进模型的账户,并经过与账户解绑和隐私过滤处理。
Notion 透露,ChatGPT、Claude 等 AI 工具已成为用户回答"你是如何听说 Notion 的?"时的首要来源。这一变化经历了从缓慢积累到突然加速的过程。
Opus 在执行任务后会附带生成对所做操作的说明,作为副产物保留下来。发帖者称这些解释能让人在被问及操作过程时清楚知道发生了什么,并对此表示感谢。
Vercel 的 skills.sh 注册表在 7 个月内达到 100 万个 agent skills、近 2.8 亿次安装。Guillermo Rauch 称其从想法到首次发布,再到 npx skills 出现在互联网各处 README 中,并评论说过去写代码、现在写英文。Vercel 还发布了关于 skills 现状与去向的博客文章。
Yann LeCun 回应质疑称,AI 终将在所有领域达到人类智能水平,但当前仍相距甚远,且未来不会建立在 LLM 之上,LLM 只会扮演文本接口一类的角色。他以家用机器人、Level-5 自动驾驶汽车、几小时就能学会开车的机器人汽车,以及能像家猫一样理解真实世界并快速学习新技能的 AI 系统为例,指出这些至今都不存在。
Andrej Karpathy 回应 @mitsuhiko 称,AGI(Artificial General Intelligence)通向 ASI(Artificial Super Intelligence)的说法已沿用十年,属于近乎标准的术语。他表示去掉其中冗余的 "Artificial" 后即可得到 AGI 与 ASI 的简洁写法。
有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。
microagi 与 ElevenLabs 合作,为人形机器人赋予语音能力,让人无需屏幕或控制面板即可直接开口对话。双方称目标是让向机器人求助像向身边人求助一样自然,目前处于早期案例研究阶段,展示了未来机器人与人交流的可能形态。
Ruby on Rails 创始人 DHH 在 Rails World 2026 演讲中宣布 37signals 已"pencils down",不再手写代码,转折点是 2025 年 11 月 24 日 Claude Opus 4.5 发布。
GPT 6 Astra 与 Anthropic 的 Opus 5.5 接连发布,Jev 结构化模型走红并瞄准 Computer Use 场景,Coding Agent 工作流随之升级。
Stack Overflow 播客对话 BrowserStack 开发者关系与开源负责人 David Burns,讨论 AI 时代职业怀疑精神的价值,以及如何把测试驱动开发用于智能体工程。Burns 认为,修复 flaky test 的关键在于管理应用状态。
Opus 5.5 应要求设计了一只可用真实乐高零件拼装的 Microduck,采用 1113 个零件、1:1 实物尺寸,并验证了 3204 处连接、0 碰撞、每步可拼装且重心位于脚部内。它随后生成 141 页、237 步的乐高风格说明书,并在浏览器中为每个零件定价、在 BrickLink 上准备下单。
用 Opus 5.5 做解说视频,只要把参考视频和新主题交给它,就能复刻一条或模仿参考视频的风格。DreW 用 Claude Opus 5.5 做出了这样一条视频,作者直呼「太逆天了,视频模型瑟瑟发抖」。
Vercel 基于 skills.sh 注册表的聚合数据发布报告,该注册表在七个月内积累 100 万个 agent skills,记录近 2.8 亿次安装。分类样本显示供给偏技术,超过一半的条目集中在软件工程、agent 工作流、数据、基础设施或安全;需求更分散,软件工程占安装量 18%,agent 工作流 15%,业务运营和写作各近 11%。
Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。
腾讯研究院发布新一期AI每周关键词Top50(0920-0924),覆盖算力、模型、应用、科技、观点与事件六大类。
一段用浏览器画 dario 的对比视频显示,Claude Opus 5.5 在其中的表现被 indigo 形容为"开悟了",并称这是 ego 的宣传视频,但对比效果"太残酷"。该推文被 orange.ai 转发,附带的视频在浏览器端无法播放。
Simon Willison 认为,coding agent 虽然能做出惊人的事,但要释放其全部潜力需要极高的纪律性和知识储备,因此软件工程反而变得更难。Gergely Orosz 回应称,自 Opus 4.6 和 GPT-5.2 及其配套 harness 出现后,这些工具写代码的能力已接近甚至超过自己最擅长的语言,但他认为非开发者短期内——甚至可能永远——不会直接推送生产代码。
LlamaIndex 发布博客,讨论置信度分数在文档抽取中的实际价值——关键在于能否用它控制自动化与人工审核的比例。借助 ExtractBench 对比多种抽取系统,在 97% 精度目标下,LlamaParse Agentic Plus 过滤后对期望字段的召回率为 66.48%。文中还涉及置信度阈值、精度与召回、分数覆盖率与粒度、人工审核量等维度。
PureblueAI 创始人鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 GEO 拆成漏斗与因子挖掘,类比量化交易,主张研究 AI 可解释性而非文章写法。他还提出 prompt 就是 AI 时代的货架,豆包偏爱抖音视频、海外模型偏爱官网与 Reddit,酒旅品类已按 8 到 12 个点抽佣。
Opus 5.5 用一个文本模型、以纯代码方式一句话生成产品宣传片,效果超过此前供应商报价上万的同类片子。这一能力让不少视频 Skill 失去存在必要,被单个模型直接吃掉。
Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。
LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。
Replit 表示,模型能力没有放缓,风险同样在上升,围绕 AI 的讨论需要从「AI 安全」转向网络安全,聚焦谁拥有访问权、什么被连接以及如何加以保护,这正是 Replit 的发力方向。该表态引用 The Information 于 9 月 24 日发布的 TITV 内容。
HeyGen 调研 1000+ 小企业主发现,71.6% 曾为自家生意拍过视频却从未发布,53.9% 称原因是视频看起来不够专业,48.6% 则不喜欢自己的出镜形象。该调研进一步询问了 AI 数字人代其出镜时会发生什么,完整报告已在 heygen.com 发布。
Zuck 在收购消费级团队与产品方面堪称 N=1 天赋,IG 和 WhatsApp 都是传奇收购,Muse 在 Alexandr 与 Nat 带领下开局强劲,预计前三周 DAU 将突破 100 万,并已连续 7 天位居 App Store 榜首。
花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。