跳到正文

#编码

今日 27 条
5月20日周三
  1. Scott Wu(@ScottWu46)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 的 Scott Wu 谈与 Anthropic 的深度合作及构建于 Claude 的 Devin

    Cognition 的 Scott Wu 表示珍视与 Anthropic 团队的合作,并调侃自己中学数学视频的梗挥之不去。Cognition 是 AI 软件工程师 Devin 背后的团队,Devin 构建于 Claude。Scott Wu 希望让每个工程团队构建软件的速度提升 10 倍。

5月19日周二
  1. Sualeh Asif(@sualehasif996)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceXAI 合作从头训练更大模型,总算力提升 10 倍

    Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 发布 Composer 2.5 编码模型

    Cursor 发布其迄今最强模型 Composer 2.5,称其在智能程度、长时间连续任务的持续工作能力以及遵循复杂指令的可靠性上都有提升。作者 Sualeh Asif 表示团队在 RL 上取得明显进展,Composer 2.5 表现超出其体量,并期待与 SpaceXAI 一起扩大模型规模和 FLOPs 后的下一版本。发布后一周内该模型的包含使用额度翻倍。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。

    为什么值得看

    原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。

5月15日周五
  1. Sualeh Asif(@sualehasif996)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Simon Eskildsen:从扩展 Shopify 到打造 turbopuffer,数据库的未来走向

    这期访谈对话 Shopify 前基础设施负责人 Simon Eskildsen,聊了他扩展 Shopify 应对闪购与宕机的经历、打造 turbopuffer 的经过,以及数据库的未来。对话还涉及 Napkin Math 博客、新数据库公司为何持续胜出、AI 编程与智能体目前仍失败的地方,以及 AI 时代招聘 P99 工程师。

5月14日周四
  1. UX MagazineAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Spiral Climbs:当设计转向系统,AI 与智能体如何重构产品工作流

    随着 UI 被商品化,竞争优势上移至问题定义、押注排序与结果负责,产品设计正从界面绘制转向系统、token 与代码。作者把 Miro、Figma、VS Code 配合 Codex 和 GitHub、Jira 串成一条从想法到上线的链路,并嵌入设计思维、系统思维与会议纪要三类智能体。

5月13日周三
  1. 硬地骇客AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    硬地骇客 EP126:Agent Harness 为什么决定 AI 能否真正干活

    同一个模型放进 Claude Code、Codex、OpenCode 里就能读文件、改代码、跑测试,放进聊天框却只能给建议,差别在于 Agent Harness。这期播客把 Harness 定义为模型之外决定 AI 能否干活的工程系统,负责工具、权限、上下文、执行环境和结果验证,并讨论 AI Coding 作为大模型工程化练兵场,以及模型能力与 Harness 生态的未来演进。

5月12日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition AI 联合创始人 Scott Wu 澄清"打爆 Mango"传闻

    Cognition AI 联合创始人 Scott Wu 回应 Colossus 杂志文章中他与 Mango 的对战传闻,称当时在 Founders Fund 游戏之夜打了多局《任天堂明星大乱斗》,设备延迟严重,他只赢下一局,且 Mango 用的是 Falcon 并未尽全力,因此不认同"beat him to a pulp"的说法。

  2. 宝玉的分享AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程负责人谈 AI 时代怎么管工程团队

    Anthropic 旗下 Claude Code 和 Cowork 产品线的工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上用不到三十分钟分享了 AI 时代管理工程团队的实践。

  3. 宝玉的分享AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么资深开发者讲不清自己的专业能力

    资深开发者沟通失败,是因为用"复杂性管理"的逻辑表达苦衷,而业务端真正焦虑的是"不确定性"。作者用两个循环圈解释:业务团队追求快速试错消除不确定性,资深开发者负责控制复杂性以维持服务稳定,两者认知框架不同。开发者可用"我们能不能试个更快的办法?"把精简、复用代码的能力包装成业务要的速度。

5月7日周四
  1. Fellou(@FellouAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fellou:vibe coding 降低了原型门槛,却没人降低上线门槛

    Fellou 认为 vibe coding 浪潮没有造出更多构建者,只造出更多"离放弃只差一次部署"的人。Cursor 和 Claude 降低了原型开发的门槛,但没人降低上线的门槛,这才是 2025 年真正的缺口。

  2. Alex Albert(@alexalbert__)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 出席 Code with Claude 并将在主舞台演讲

    Alex Albert 今日全天出席 Code with Claude 活动,并将在太平洋时间下午 5:30 主舞台发表演讲,该演讲将在 livestream 播出。活动议程包括 9:00 主题演讲、10:30 的 Claude Code 新功能、11:15 的 GitHub 规模构建 Claude、12:00 的 Managed Agents 加速生产(均为 PT)。

5月6日周三
  1. Google DeepMind BlogAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 回顾 AlphaEvolve 一年进展:从数学发现走向 TPU 设计与商业落地

    Google DeepMind 发布 AlphaEvolve 一年进展汇总,展示这款 Gemini 驱动的编码智能体从数学与计算机科学开放问题扩展至多个领域。

5月5日周二
  1. Andrew Ng(@AndrewYNg)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:编码智能体对前端、后端、基础设施和研究的加速程度依次递减

    吴恩达指出,编码智能体对软件工作的加速按前端、后端、基础设施、研究依次递减。其中前端因智能体熟悉 TypeScript、JavaScript 及 React、Angular 等框架,且能借助浏览器验证结果自我迭代,提速最明显;后端因需人工引导处理边界情况、潜在 bug 和安全漏洞,加速幅度较小;基础设施任务中智能体效果最弱,其知识仍相对有限。

5月1日周五
  1. cat(@_catwu)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Security 进入公测,集成网页版 Claude Code

    Claude Security 现已进入公开测试,内置于网页版 Claude Code 中。用户将仓库指向该功能后,可获得经过验证的漏洞发现结果,并在同一处代码编写环境中完成修复。

4月30日周四
  1. Andrej Karpathy(@karpathy)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrej Karpathy 提出 "cozy coding" 说法

    Andrej Karpathy 回应网友时自称其编程风格为 "cozy coding",并给出示例用法"这个情人节,和你爱的人一起 cozy code"。该帖获 2332 个点赞、89 条回复、47 次转发和约 13 万次浏览。

4月29日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 更新 AI 编程指南,并发布 harness engineering 视频等内容

    Martin Fowler 更新了 AI 编程指南,发布了一期关于 harness engineering 的视频,并讨论了函数应该多长、Software Brain 的问题以及 AI 为何不受欢迎。相关链接收录在其 Fragments 合集中。

  2. 宝玉的分享AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering

    Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。

4月28日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thoughtworks 内部 IT 的智能体编程工作流 SPDD:结构化提示词驱动开发

    Thoughtworks 内部 IT 采用名为 Structured-Prompt-Driven Development(SPDD)的智能体编程工作流。Wei Zhang 和 Jessie Jie Xia 通过一个简单示例讲解其运作方式,并在 GitHub 项目中给出细节。

  2. Scott Wu(@ScottWu46)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 与 Mercedes-Benz 合作,加速其全球工程团队的软件工程

    Cognition 宣布与 Mercedes-Benz 合作,加速其全球工程团队的软件工程,这是迄今汽车行业规模最大的 AI 软件工程部署之一。Cognition 的 Scott Wu 与 Mercedes-Benz CIO Katrin Lehmann 就此进行了对话。

4月27日周一
  1. Andrew Ng(@AndrewYNg)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:AI 原生工程团队为何把工程师与 PM 比例压到 1:1

    Andrew Ng 指出,AI 原生软件团队用 coding agent 加速开发后,瓶颈从写代码转移到决定做什么,部分团队把工程师与 PM 比例从 8:1 压到 1:1,而沟通本身又成新瓶颈。他认为最快团队是懂产品决策的工程师和会写代码的 PM,并建议工程师学产品管理、PM 学写代码。他还提到设计、市场、法律合规等环节因编码提速 10x 或 100x 而显得更慢。

4月24日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro,称在智能体编码基准上取得开源 SOTA

    DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。

4月23日周四
  1. 42章经AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Slock.ai 创始人 RC 谈 Agent 动力学:如何用 40 个 Agents 与人一起做产品

    Slock.ai 创始人、Kimi CLI 作者 RC 离开 Kimi 后创业,把公司运行在 Slock 上,团队从 OPC 拓展成「40 个 Agents + 7 个人」,目标是为多 Agents 和人提供协作环境。

  2. 宝玉的分享AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cat Wu 面试几百个 AI 产品经理候选人,几乎没人答对:AI PM 到底该干什么?

    Anthropic Claude Code 产品负责人 Cat Wu 在 Lenny's Podcast 中称,面试几百名 PM 候选人后发现,大多数人仍在用 6-12 个月路线图思维找工作,而 Claude Code 团队已把功能交付周期从半年压缩到一周甚至一天。

4月22日周三
  1. Sualeh Asif(@sualehasif996)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 与 SpaceX 合作训练模型,Composer 3 及后续将用 10-100 倍算力

    Cursor 联合创始人 Sualeh Asif 宣布与 SpaceX 合作,在后者百万 H100 等效的 Colossus 训练超算上训练前沿模型,Composer 3 及后续模型的训练 flops 将是此前的 10-100 倍。

4月21日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 谈第 34 期 Thoughtworks 技术雷达:开发者不读 LLM 生成的代码会怎样

    Martin Fowler 发布 Fragments 更新,涉及第 34 期 Thoughtworks 技术雷达、开发者不阅读 LLM 生成代码的后果、DirectFile 以及大型组织中的技术等话题。

4月20日周一
  1. Hugging Face(@huggingface)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K2.6,主打开源编码与长时程 Agent

    月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。

    为什么值得看

    K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。

  2. 强少来了AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.167:我把 OpenAI Codex 官方案例全跑了一遍

    作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。

4月17日周五
  1. cat(@_catwu)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 提示技巧:把测试流程写进 claude.md 或加 /verify-app 技能,让模型自验改动

    让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。

4月16日周四
  1. Poe(@poe_platform)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 提示:Opus 4.7 在编码任务上较 Opus 4.6 明显提升

    Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。

  2. Andrew Ng(@AndrewYNg)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 联手 JetBrains 推出 Spec-Driven Development with Coding Agents 课程

    Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。

4月15日周三
  1. 宝玉的分享AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vibe Coding 是中年男人的钓鱼

    AI 对很多中年男人来说像钓鱼一样,是一种合法且体面的独处方式:深夜打开电脑,对 AI 说一句"帮我做个能查天气的小工具",看着代码滚动、项目跑起来,快感如同鱼竿猛地一沉。他们未必在乎最终产品,真正稀缺的是过程中"我说了算"的自我主宰感,凌晨在社交媒体晒 AI 小产品的人往往不是年轻程序员,而是三四十岁的中年人。

4月14日周二
  1. Andrew Ng(@AndrewYNg)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 智能体加速编程后,软件工程的未来在哪里?

    吴恩达(Andrew Ng)认为"AI 导致大规模失业"的判断被夸大,AI 对软件工程的加速最明显,但 Citadel Research 新报告显示软件工程岗位招聘正在快速上升。他将此视为 AI 影响其他职业的风向标,并以 4 月 28-29 日在旧金山举行的 AI Developer Conference 主题"软件工程的未来"展开讨论,同时提到"产品管理瓶颈"——决定做什么比实际构建更受限。

4月13日周一
  1. 宝玉的分享AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么你的"AI 优先"战略可能大错特错?

    CREAO 25 人团队(10 名工程师)实现 99% 生产代码由 AI 编写,新功能当天上线、A/B 测试后当天砍掉。其核心是用统一 Monorepo、六阶段 GitHub Actions 流水线和 Claude Opus 4.6 三轮 AI 代码审查重构工程流程,并以 Claude Sonnet 4.6 每日扫描 CloudWatch 构建自愈闭环。

4月10日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:MirrorCode 证据显示 AI 已能完成部分长达数周的编程任务

    METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。

  2. Andrej Karpathy(@karpathy)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:AI 能力认知存在鸿沟,免费旧模型与前沿 Agent 模型差距悬殊

    Andrej Karpathy 指出,公众对 AI 能力的理解存在日益扩大的鸿沟:许多人仍以去年免费版 ChatGPT 的幻觉和怪癖来判断 AI 水平,而这类旧模型并不反映今年最新一代智能体模型(尤其 OpenAI Codex 和 Claude Code)的能力。

4月9日周四
  1. Martin Fowler(@martinfowler)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 谈两档播客、一起精心设计的供应链攻击、技术文档框架与一次深思熟虑的 AI 编程体验

    Martin Fowler 最新 Fragments 汇集四则内容:两档播客、一起手法老练得令人担忧的供应链攻击、一套技术文档框架,以及一次格外深思熟虑的 AI 编程体验。详情见其博客原文。

4月8日周三
  1. Poe(@poe_platform)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线智谱 GLM-5.1,主打智能体工程与编码能力

    Poe 平台现已上线 Z.ai 的旗舰模型 GLM-5.1,主打智能体工程,在 SWE-Bench Pro 上取得 state-of-the-art 结果,并在仓库生成和真实终端任务中表现领先。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Prism 上线 Paper Review,用 AI 审阅科学论文

    OpenAI 的 Prism 新增 Paper Review 功能,用 AI 审阅技术与科学论文,目标是提升科学严谨性、正确性与可复现性。该功能由 @hemal 在数小时内以简单 skill 形式构建,因为 Prism 由 Codex 驱动。OpenAI 正为 Prism 招聘一名首席设计师。

4月7日周二
  1. 枫言枫语AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    做客声东击西:从工程师、创业者与普通人视角聊 OpenClaw「龙虾」与 vibe coding 如何改变思维

    《枫言枫语》主播 Justin 做客《声东击西》,与豌豆荚联合创始人 Junyu、声动活泼联合创始人徐涛从工程师、产品设计和写过代码的普通人三种视角,讨论 OpenClaw「龙虾」与 vibe coding 如何改变写代码和思维方式。