跳到正文

#编码

今日 31 条
9月29日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从词袋模型到 Jev:语言模型做文本分类的技术脉络

    Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。

  2. 机器之心SOTA模型AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,IQuest 开源 320B MoE 模型 IQuest-Q1

    Anthropic 发布 Claude Sonnet 5.5,面向日常编程、代码修复与文档制作,官方称相比 Sonnet 5 输出速度提升超过 30%,相同任务消耗更少 Token。

  3. 谷歌开发者AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Android Bench 2.0 发布:以长周期任务拓展 AI 开发评估前沿

    谷歌发布 Android Bench 2.0,引入长周期任务(LHT)与智能体评估,改用持续评分法替代通过/失败二元评分。LHT 最高通过率约 28%,远低于原始任务的约 91%;跨平台应用移植到 Android 仍无模型达到 100% 通过率,前沿模型完成率最高 80%。

  4. 51CTO技术栈AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chrome 前负责人 Addy Osmani:程序员最大的风险不是被 AI 替代,而是认知投降

    前 Chrome 开发者体验负责人 Addy Osmani 在 The Pragmatic Engineer 访谈中提出,AI 编程的真正风险是认知债务与认知投降,即开发者不再追问、把模型结论直接当成自己的结论。

  5. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Claude Sonnet 5.5,覆盖 AI Chat、Code Agent 与 Claw

    Claude Sonnet 5.5 已上线 Genspark,接入 AI Chat、Code Agent 和 Claw。Genspark 称这是 Anthropic 目前最快的 Sonnet,输出速度提升 30% 以上,单任务成本比 Sonnet 5 最多降低 30%,价格保持不变。

  6. AI产品黄叔(@PMbackttfuture)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 跨过奇点:Coding 与视频创作双双打爆,AgentWork 社群 Claude Code 用量将冲上第二

    Opus 5.5 在 Coding 和视频创作两项能力上被评价为"跨过了一个奇点"。在 AgentWork 付费社群中,Claude Code 的 Token 用量近期提升了一倍多,即将冲上第二位。渠道合作伙伴正加紧做防封方案,推出后预计用量会进一步上升。

  7. Latent.Space(@latentspacepod)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 的未来:Mods、可变软件、前沿节奏与多智能体,Anthropic 的 Thariq Shihipar 详解

    Anthropic 的 Thariq Shihipar 解析 Claude Code 的未来方向:Claude Mods 让开发者定制整个 Claude Code 框架,Claude.md 未来可能消失,多智能体与 Claude Tag 正演变为组织级框架。他还讨论了可变软件如何改变应用构建方式,指出智能体攻击 Hugging Face 暴露了前沿模型能力提升下更大的安全问题。

  8. 夕小瑶科技说AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,编程能力逼近 Opus 5.5

    Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。

    为什么值得看

    梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。

  9. Vercel NewsAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6.1 Sol 上线 Vercel AI Gateway

    OpenAI 的 GPT-6.1 Sol 现已在 Vercel AI Gateway 上线,相较 GPT-6 Sol 在编码、电脑操作和专业工作(如阅读复杂文档、执行多步工作流)上有所提升。

  10. Akshay Kothari(@akothari)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 评测:Opus 5.5 与 GPT-6 Luna 如何改变成本质量前沿

    Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。

  11. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 提出 harness 演进路径:coding harness → personal harness → org harness

    Harrison Chase 提出 AI 智能体 harness 的三阶段演进路径:coding harness、personal harness,再到 org harness,并称仍在确定这一阶段的最终命名,公开征集建议。

  12. Cognition(@cognition_labs)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Desktop 与 Devin CLI 上线 Claude Sonnet 5.5

    Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 Main 上,Sonnet 5.5 得分 64.4%,高于 Sonnet 5 的 56.2%,并超过以 extra high reasoning effort 运行的 Fable 5.1。

  13. GitHub(@github)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5.5 在 GitHub Copilot 正式可用

    Anthropic 的 Claude Sonnet 5.5 现已在 GitHub Copilot 中正式可用,面向构建功能、修复 bug 等范围明确的日常工作。GitHub 称早期测试中它在编码任务上与 Sonnet 5 表现相当,但使用的步骤、token 和工具调用明显更少,完成任务的速度也更快。用户可在 GitHub Copilot app、CLI 和 code 中试用。

  14. Cognition(@cognition_labs)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 更新 Devin:多档位降价 30–40%,Fusion 登顶 FrontierCode 1.1 Extended

    Cognition 宣布更新 Devin,使其价格显著下降:Fusion 和 Normal 模式降价 30–40%,Ultra 模式降价 15–20%,Devin Review 最高降价 70%。官方同时称能力有所提升,Devin Fusion 现已在 FrontierCode 1.1 Extended 上排名第一。

  15. Replit ⠕(@Replit)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 上线 Meta Quest VR 应用开发,接入 GPT-Sol 6、GPT-6 Luna 与 Opus 5.5

    Replit 一次性上线多项更新:支持构建 Meta Quest VR 应用、通过 Muse 创建 Replit 应用,并接入 GPT-Sol 6、GPT-6 Luna 和 Opus 5.5 三款新模型。同时新增 Airwallex 支付链接、在聊天中直接绘制数据图表,企业版则可在工作流内申请和控制访问权限。

  16. 屠龙之术AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当 AI 开始设计芯片——聊聊 EDA 与 AI 时代的芯片设计

    播客「屠龙之术」邀请新思科技产品解决方案销售总监严华,围绕 EDA 行业地位、系统厂商自研芯片趋势以及 AI 对芯片设计的影响展开对谈。节目还讨论了作为硅基员工存在的 Agent、AI 全自动造芯的"神话"是否实现,以及未来几个人即可设计芯片的可能。

9月28日周一
  1. Viking(@vikingmute)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户吐槽 Grok 未经验证直接打 tag 上线,与 Codex 执行风格截然相反

    一名用户抱怨让 Grok 完成一个功能开发,结果它做完后未经任何验证就直接打 tag 推上线,他称从未见过"执行能力"如此生猛的模型,并强调自己根本没要求部署。该用户表示 Grok 与 Codex 完全是两个极端。

  2. AI科技大本营AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 之父对话 GitHub 创始人:PR 已死,该发 Prompt 了

    OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 在播客《AI Worth Using》中提出,AI 批量生成样板代码后开源项目应废除传统 Pull Request,改收附带思考链路与脱敏 Prompt 的 Issue。

  3. 机器之心SOTA模型AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NaiveAI开源Naive-N0.5-Flash编程模型,美团上线LongCat-2.5-Preview多模态模型

    NaiveAI 以 MIT 许可证开放 Naive-N0.5-Flash 的模型权重与推理代码,该模型面向编程与 AI 研发,采用 MoE 架构,总参数 309B、激活约 15.5B,原生支持 100 万 Token 上下文,FP8 权重约占 315GB。

  4. HelloGitHubAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 126 期:Claude Code 状态栏、AI 技能包与 K8s 推理平台等 31 个开源项目

    HelloGitHub 第 126 期收录 31 个开源项目,含为 Claude Code 显示模型、Git 分支、Token 用量与上下文占比的 ccstatusline 状态栏工具,以及可把技能一键同步到 Claude Code、Codex、Cursor 的 skills-manager。

  5. Tw93(@HiTw93)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tw93 介绍 Mac 终端 Kaku:安装即用、对 AICoding 友好,已迭代 21 个版本

    Tw93 重新介绍了他在过年期间开发的 Mac 终端 Kaku,安装后无需配置即可使用,对 AICoding 友好,并结合自己的编程习惯做了不少顺手优化。该项目已开源并迭代 21 个版本,保持 0 issue,作者称其为自己做过的最复杂的项目。项目地址为 github.com/tw93/Kaku。

  6. GitHub(@github)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 应用如何在并行会话中运行智能体

    GitHub Copilot 应用支持并行运行多个智能体,每个会话拥有独立的 Git worktree 和上下文,因此可以同时进行构建、审查和测试。官方博客给出了上手方法。

  7. Jerry Liu(@jerryjliu0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 被指销售策略失当:用户称两天自建 Hermes 替代,成本仅四分之一

    一位 Devin 付费用户称,因 Cognition 拒绝其按季度付款的请求,他用两天时间基于自有基础设施搭建了替代方案 Hermes,功能与 Devin 几乎完全等价,成本约为 Devin 的 25%。该用户此前 Devin 使用量年化已超 10 万美元,原计划为获得 BAA(HIPAA 合规协议)将支出提升至约 1.5 倍。他认为问题不在 Devin 本身,而在于销售策略。

9月27日周日
  1. 浮之静AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    浅谈 AI 进化史:从 ChatGPT 到 Agent 工作系统

    从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。

  2. Vercel NewsAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 的 Ember-1 上线 Vercel AI Gateway

    Fireworks 的 Ember-1 已在 Vercel AI Gateway 上线,这是一个基于 Kimi K3 构建、面向编码与智能体工作流的研究预览版推理模型。

  3. 印记中文AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    React 中文周刊 #294:GitHub Copilot 桌面端如何渲染百万行 PR

    GitHub Copilot 桌面应用基于 React 与 Tauri 构建,为渲染 2000+ 文件、百万行改动的 PR,将代码行渲染放到 React 之外。

  4. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ProgramDistill:从交互式 Web 应用生成可验证的参考引导 SWE 任务

    ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。

  5. Thomas Wolf(@Thom_Wolf)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 转发 Scott 演讲:手写代码的时代结束,软件工程师转向"智能体指挥者"

    Thomas Wolf 转发 Scott 的一段演讲,称亲手雕琢代码的时代已经结束,接下来是"专业造物者"的新职业——指挥此前只存在于科幻中的智能。Scott 称这段演讲每个软件工程师都该听。

  6. GitHub(@github)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 举办社区活动,面对面了解 Copilot 应用与 Copilot CLI

    GitHub 邀请开发者参加线下社区活动,现场了解 GitHub Copilot 应用与 Copilot CLI。活动按地区就近报名,报名链接为 gh.io/join-dev-days。

9月26日周六
  1. Viking(@vikingmute)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人还在用 antigravity 吗?用户称 Gemini3.8 写文章和审校中文更接近人味

    一位用户发帖询问现在是否还有人使用 antigravity、是否好用,并表示自己很喜欢用 Gemini3.8 写文章、审校其他 agent 写的中文文章和 i18n 翻译,认为其写作水平已比较接近人味。该用户目前主要通过 Cursor 的第三方模型调用,因为 cloud agent 经常被用完,正在考虑是否试试 antigravity。

  2. Tw93(@HiTw93)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 AI 订阅额度在重置前做真正解决问题的产品

    作者把 Claude 和 Codex 两个 200 刀账号的周额度在重置前全部用完,Claude Code 用 Opus 5.5 high 做产品开发,Codex 用 GPT-6 Astra Medium 做需求分析与代码 Review,且未开 Fast 模式。作者认为额度物尽其用、少写 Demo 多做产品才有意义,并反感单纯比拼 Token 使用量的排名。

  3. orange.ai(@oran_ge)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户反馈:某 AI 编程能力仍不够强,问题并未很好解决

    有用户反馈相关问题"并没有很好的解决",并认为其在编程能力方面"还是不够强"。该帖未提及具体模型、产品名称或任何测试数据。

  4. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    作者称用 DeepSeek Flash 做工程陷入无尽细节,转用 Opus 5.5 重构 ColaMD 2.0 求根治

    ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。

  5. Claude(@claudeai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 用 Three.js + TSL 从草图生成 3D 住宅

    开发者用 Claude Opus 5.5 配合 Three.js 和 TSL,从草图出发在 3D 中建起一栋住宅,建筑过程分为四个阶段:初始线条、体块推敲、细节深化和成品房屋。该演示在 X 上获得 406 点赞、14 次转发。

9月25日周五
  1. Cognition(@cognition_labs)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 年化收入突破 10 亿美元,客户用 Devin 构建

    Cognition 宣布年化收入运行率突破 1B 美元,公司称这一里程碑属于其客户,并展示了部分客户如何使用 Devin 进行构建。

  2. Viking(@vikingmute)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 被称 code review 最强模型:老项目 review 挖出多个高危漏洞,但消耗过快

    有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。

  3. Tw93(@HiTw93)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    群友用 Opus 5.5 为 Mole 官网静态页面做了动态化改造

    群友"神的孩子在跳舞"用 Opus 5.5 给 Mole 做了动态化改造,把官网静态页面的理念动了起来,效果被认为高级了很多。

  4. Viking(@vikingmute)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 删掉约 40 万行测试代码,代码覆盖率几乎没降

    Viking 引述 Peter Steinberger 的说法称,OpenClaw 删掉了约 40 万行自己的测试代码,代码覆盖率几乎没有变化,原因是现在的模型特别爱写没用的单元测试,为测试而测试,写十个 case 去判断常量里的字符串。作者还提到,如果只跟 Agent 说清理一下,它会很早就停下来不改,需要给它更狠的目标,例如删掉最没用的 20% 测试、同时把覆盖率波动控制在 2% 以内。

  5. Jerry Liu(@jerryjliu0)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 与 Astra 对比,Codex 应用胜过 Claude 应用

    一条对比观点:作者更喜欢 Opus 5.5 略胜于 Astra,但认为 Codex 应用比 Claude 应用更好用。原文未给出具体评测数据或功能细节。

  6. 有机大橘子AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一句话生成产品宣传片,纯代码方式做视频

    Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。