跳到正文

#编码

今日 26 条
今天10月10日周六
  1. AI炼金术AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯

    ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。

  2. 刘润AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    进化岛周报:刘润闭关写年度演讲首稿,Codex、Claude、Grok、CodeBuddy 四模型并行搭基建

    刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。

  3. 刘润AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    刘润:未来一两年上班方式将发生的8个变化

    刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。

  4. 向阳乔木(@vista8)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木开源 AI 设计工具:一句话生成 7 个模版,支持自然语言改元素

    向阳乔木用三天 AI Coding 做出并开源了一款 AI 设计工具,输入一句话即可生成适配不同平台的 7 个模版。选中任意元素后用自然语言描述即可修改,如选中标题说“改成红色”。工具支持 Codex Cli 生图、即梦、Gemini 等模型以及数千个 emoji 和 unsplash 图库,当晚将上线 Obsidian 官方插件库。

  5. THE DECODERAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5

    据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。

  6. 宝玉(@dotey)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 上下文为何定为 300K:OpenAI 称是更优默认值

    OpenAI 的 Tibo 回应 Codex 上下文长度选择问题,称团队测算后认为 300K 是更好的默认值。Codex 实际也能跑 1M 上下文,但那样只会消耗更多用量。

  7. 向阳乔木(@vista8)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 被指降智严重,用户反馈 GPT-61 Sol High 档位相对好用

    多位用户反馈 Codex 出现明显降智,体验下滑严重。该用户实测两天后认为,选择 GPT-61 Sol High 档位表现相对更好,并向其他用户征询当前使用的模型与档位。

  8. 创业邦AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋女婿火速晋升英伟达全球 AI 基础设施增长副总裁;豆包回应可缴水电燃气费;英伟达市值一夜蒸发超万亿元丨邦早报

    英伟达 CEO 黄仁勋的长女 Madison Huang 与 35 岁的 Nico Caprez 结婚,后者今年 1 月升任英伟达全球 AI 基础设施增长副总裁,负责数据中心运营和"Neocloud"服务,并参与推进目标超 5000 亿美元的 AI 计算融资平台。

  9. 宝玉(@dotey)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    并非所有修改都要写技术方案:用 Agent 浏览器标记工具从原型改 UI

    以修改 UI 为主的功能不必先写技术方案,可以直接从改原型开始;原型改好后用 Agent 内置浏览器的“标记”工具在要改的地方标注并写评论。原型完成后,可在同一会话里让它把原型修改同步到正式代码中。作者通常用 Fable 做设计、Opus 执行、再由 Fable 验收。

  10. 向阳乔木(@vista8)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eazo:以 App 为中心的 Personal Agent,支持自然语言开发应用与 Stripe 收款

    Eazo 是一款以 App 为中心的 Personal Agent,支持用自然语言开发 App 和小游戏,并带登录、调用 AI 以及接入 Stripe 全球收款。

  11. 宝玉(@dotey)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 内部测试新模型 Carbon,员工称编码能力“感觉像 Opus 5.5”

    Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。

  12. seangoedecke.comAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    软件工程的“半人马时代”或将持续数十年

    人类工程师与 AI 编程系统配合的效率已超过纯人类或纯 AI 单独作业,且这一“半人马时代”可能像国际象棋那样持续约二十年甚至更久。

  13. Z FinanceAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    原 TRAE 负责人石扬离职创业做 AI 办公,联手前字节数据安全负责人傅越,首轮估值 2 亿美元

    原字节 AI 编程产品 TRAE 负责人石扬于国庆前夕离职,与前字节 AI 数据与安全负责人傅越联手创办 AI 办公公司,已敲定首轮融资,投后估值约 2 亿美元。石扬此前在字节操盘豆包 MarsCode 与 TRAE,傅越曾组建字节 Global Data 团队;新公司目前仍处于 Stealth Mode。

  14. 宝玉(@dotey)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:用 Agent 开发让 loop 转得更快,瓶颈是设备和 Token

    宝玉描述自己的功能开发和 bug 修复都跑在一个 loop 循环里,Agent 和自己都能快速拿到反馈,loop 转得越快效率越高。Loop 跑通后可尝试多任务并行,因为大部分时间由 Agent 生成和验证,人可以专注定义问题和验证。当前主要瓶颈是电脑设备不够多和 Token 不够用,他计划多在云端开任务来缓解设备不足。

  15. 宝玉(@dotey)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:Claude Code 建议删除禁用 1M 配置,autocompact 设为 300-400K

    宝玉建议 Claude Code 用户删除 ~/.claude/settings.json 中的 CLAUDE_CODE_DISABLE_1M_CONTEXT 配置,该设置已无必要,保留会导致上下文最多只能到 200k。同时他建议将 autocompact 自动压缩上下文长度设为 300-400K,自己设置的是 300k,通过 /autocompact 400k 命令调整。

  16. OpenRouter(@OpenRouterAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Luna 和 Astra 带动 Codex 用量大幅增长

    OpenRouter 指出,Luna 和 Astra 正带动 Codex 用量大幅增长。该帖互动数据显示 11 条回复、1 次转发、123 次点赞、10861 次浏览,未披露具体增幅或使用数据。

  17. 宝玉(@dotey)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 baocut 开发方法论:技术方案、原型 UI、编码与验收全流程

    宝玉将文章中的开发方法论完整应用于开源项目 baocut,流程涵盖技术方案文档、原型与 UI 设计、编码实现和测试验收。他让 Agent 先做调研并撰写技术方案文档,反复沟通定稿后再产出接近正式 UI 的高保真原型,最后才实现代码。验收阶段 Agent 借助 Electron 的浏览器能力自行测试,多数活由 Agent 完成,人只负责定义问题和验收。

  18. 宝玉(@dotey)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 AI Agent 开发 baocut 的四步工作流:技术方案、原型 UI、编码、测试验收

    宝玉将其文章方法论完整应用于开源项目 baocut,流程分四步:先让 Agent 写技术方案文档并反复修改定稿,再做高保真原型与 UI 设计,然后实现代码,最后由 Agent 自行测试验收、人工复测收尾。他把技术栈改回 Electron,Agent 通过浏览器即可验证绝大部分功能,仅复杂场景才用 Computer Use 辅助。人主要负责定义问题和验收两端。

  19. OpenAI Developers(@OpenAIDevs)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 面向 Pro 用户推出 composer 预测功能(beta)

    OpenAI Codex 面向 Pro 用户上线 beta 版 composer 预测,可根据对话内容和你与它的交流方式预测你的下一条消息。OpenAI 称这是其内部测试中最受欢迎的新功能之一。

  20. OpenAI Developers(@OpenAIDevs)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 桌面应用面向 Pro 用户推出 beta 版编辑器预测功能

    OpenAI 在 Codex 桌面应用中面向 Pro 用户推出编辑器预测功能 beta 版,仅适用于本地任务。用户按“Tab”接受建议、按需编辑后发送,也可在 Settings 中关闭 composer predictions。

  21. ChatGPT(@ChatGPTapp)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 的 dot 现可在 Codex 中代你启动任务并跟进已有线程

    ChatGPT 的 dot 现在能在 Codex 中启动工作、跟进已有线程,并调用你的 ChatGPT 对话、Codex 线程和自动化任务,还能判断何时续用线程、何时新开。dot 也可在 ChatGPT Work 中查看和编辑 Scheduled Tasks,支持查询已排期任务或随计划变化更新重复任务。

  22. elvis(@omarsar0)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun Step 5 Preview 发布次日登顶 OpenRouter Trending

    阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。

  23. 向阳乔木(@vista8)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前端审美类工作只能切 Claude 和 Kimi K3,Kimi 新模型发布时间未知

    有用户表示,遇到对前端审美好一点的工作时只能切换到 Claude 和 Kimi K3 来完成,认为 Kimi 表现不错,但不清楚 Kimi 何时发布新模型。

  24. InfoQAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Android Bench 2.0,新增长周期任务、智能体评测与连续评分

    Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。

  25. Lenny Rachitsky(@lennysan)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Surge 发布 sudo L7 基准:衡量 AI 距离资深工程师还有多远

    Surge 推出新基准 sudo L7,用于衡量 AI 在资深(staff 级)软件工程上的能力。该基准包含 60 个任务,大多来自真实企业私有生产仓库,由实际负责过这些系统的工程师编写,评分涵盖功能正确性、工程技艺、架构判断、协作能力与不必要的复杂度。表现最好的智能体仅约 45% 任务通过,作者认为 coding agent 目前仍停留在 L3 水平。

  26. 宝玉(@dotey)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Design 做原型省 Token 的技巧:导出 HTML 后交给 Claude Code 维护

    一个节约 Token 的 Claude Design 原型流程:先在 Claude 网站把设计稿迭代到满意,导出为 HTML 下载到本地,之后让 Claude Code 把它当作本地网页更新维护,不再依赖 Claude Design 网站。有用户反馈深度使用后,一个产品设计基本会耗尽一周的 token 用量。示例原型见 github.com/JimLiu/baocut。

10月9日周五
  1. InfoQAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 用 AI 辅助重写将 Copilot 运行时从 TypeScript 迁移到 Rust

    GitHub 将 GitHub Copilot CLI、Copilot 应用和 Copilot SDK 背后的运行时从 TypeScript 和 Node.js 迁移到 Rust,通过 AI 辅助重写替换了超过 80 万行生产代码。

  2. Simon Willison's WeblogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 用 Codex 语音模式为博客新增 Newsletters 页面

    Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里边聊边让 GPT-6 Astra High 为博客搭出 Newsletters 页面,包括新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成。

  3. Geek(@geekbb)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 写代码生成 15 支 10 秒短片,每支一种风格

    15 支 10 秒短片全部由 Claude Opus 5.5 写代码产出,画面、动画、音乐和音效均由代码生成,每支短片对应一种风格。相关项目已在 GitHub 上发布。

  4. Simon Willison(@simonw)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 一边做晚饭一边用 Codex Desktop 纯语音给博客开发新功能

    Simon Willison 全程用语音、通过 Codex Desktop 给自己的博客开发了一个新功能,过程中他正在做晚饭。相关记录发布在其博客 simonwillison.net 上。

  5. 卡尔的AI沃茨AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用腾讯游点灵搭出超级英雄盖楼小游戏:AI游戏训练营体验记

    作者用腾讯游戏游点灵几句话搭出一个跳跃盖楼小游戏,玩家给不会飞的红衣超级英雄造楼当支点,第一关仅给9格泥土,游戏已公开可玩。作者还去了游点灵·湖南马栏山集团AI游戏训练营,试玩了在读大学生做的海鸥偷薯条、海岛求生等游戏,这些作品AI纯度100%、自带4万多个游戏资产,并支持可视化调参和二创。

  6. 向阳乔木推荐看AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TRAE 全面升级:TraeWork 与 TraeCode 合并,体验接近 Codex

    字节跳动的 TRAE 将 TraeWork 和 TraeCode 两条产品线合并,统一称 TRAE,作者称其体验是所用 Agent Harness 中最接近 Codex 的。

  7. 有机大橘子AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 之后:游戏、软件、硬件的门槛都在消失,一切终将开源?

    Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。

  8. 51CTO技术栈AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    诺奖经济学家阿西莫格鲁:编程最先被 AI 攻下是因为结果易检查,最危险的用法是帮企业裁人

    2024 年诺贝尔经济学奖得主、MIT 经济学家达龙·阿西莫格鲁在 Silicon Valley Girl 访谈中表示,编程成为 AI 最早取得明显进展的职业领域之一,原因是代码有明确反馈、结果容易检查,而客服、医疗、现场维修缺少这种"测试通过"信号。

  9. AI寒武纪AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不用剪辑软件,我用豆包工作加 Remotion 跑通代码驱动动效视频工作流

    豆包工作配合 GitHub 上的 Remotion 技能,可在云端自动编写 React 代码并渲染动效视频,全程不占本地内存。实测将《Attention Is All You Need》论文做成 2 分半成片,并把《OpenAI DevDay 2026 回顾》飞书文档转为 120 秒、1080P、30 帧视频,自动按配乐能量峰值对齐镜头。该流程还可沉淀为名为「SR动态视频」的自定义技能复用。

  10. 新智元AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 Gemini 4 Argon 现身 Google Cloud 与 Antigravity,最快今日发布

    谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。

  11. 跨国串门儿计划AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程师谈 Claude Code:提示词、运行框架与 Agent 安全边界

    Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。

  12. meng shao(@shao__meng)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Addy Osmani 拆解工程师对 AI Coding Agent 的两极感受:创造、知晓与重要三种喜悦

    Addy Osmani 认为「爱写代码 vs 爱交付」的划分过于简单,工程师面对 AI Coding Agent 的喜悦可分三种来源:创造的喜悦(心流,最安全)、知晓的喜悦(心智模型,最危险,可能让构想能力退化)、重要的喜悦(判断力权重不降反升)。他拒绝把对 AI Agent 的失落感病理化,认为悲伤是对工作有真实依恋的证明,建议主动守护构成职业认同的核心。

  13. 量子位AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    联想天禧自研代码智能体 TianxiCode 以 71% 解决率登顶 SWE-bench-Live

    联想天禧 AI 自研的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一,并通过官方 Verified 核验。TianxiCode 具备跨文件多跳检索、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大能力,未来将落地联想 AI 硬件产品。

  14. 量子位AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TRAE 将 Code 与 Work 双端合并,新增 Agent 模式与 IDE 模式

    TRAE 将 TraeCode 和 TraeWork 双端融合升级为新 TRAE,提供 Agent 模式和 IDE 模式两种工作方式,切换入口在右上角。Agent 模式作为全局工作台,可在同一窗口管理项目并把写代码、出文档、准备交付材料分给多个 Agent 并行推进;IDE 模式保留 SOLO 和 IDE 玩法,用于逐行细改代码。