跳到正文

#编码

今日 31 条
7月21日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sarah Guo 押注 AI 前沿实验室无法包揽一切:专访 Conviction 创始人

    2018年,28岁的 Sarah Guo 成为 Greylock 60年历史上最年轻的普通合伙人,四年后离职创办全押 AI 的 Conviction。她早期投资了 Baseten 和 Harvey(各估值超 110 亿美元),首年又投中 Sierra、Cognition 和 Mistral(三家合计估值 540 亿美元)。

7月18日周六
  1. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Inkling 和 Grok 4.5 已在 Devin Desktop 和 CLI 上线

    Inkling 和 Grok 4.5 现已在 Devin Desktop 和 CLI 中可用。Cognition 同步上线 FrontierCode 排行榜,专门追踪哪些模型能写出真正可合并的代码,Grok 4.5 与 Inkling 等所有模型的分数均已公布,并附完整评测方法和示例任务。

  2. 屠龙之术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    屠龙之术:2026H1 AI行业观察——重估一切,文艺复兴

    播客「屠龙之术」在约50分钟节目中梳理2026年上半年AI行业变化,从资本与硬件、模型竞争、Agent元年、世界模型与治理四条线索重估产业方向。节目提出2026年可能成为Agent从聊天走向任务执行的关键年份,Coding Agent、办公智能体与Agent基础设施将重构软件生态,并讨论OpenAI、Anthropic、Google及中国模型厂商的格局变化与中美开源闭源路线分野。

7月17日周五
  1. AI SDK(@aisdk)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Moonshot 发布 Kimi K3 模型,2.8 万亿参数、100 万上下文,将开放权重

    Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。

    为什么值得看

    Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。

7月16日周四
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan:开源模型与配套框架正迎来高光时刻

    Sriram Krishnan 认为开源模型与配套框架正迎来高光时刻:如今可以凭借清晰的训练谱系追上接近 SOTA 的性能,如 thinkymachines 的 Inkling 今日发布。

  2. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

  3. xAI(@xai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 回应隐私质疑:Grok Build 已删除留存编码数据,默认关闭数据保留

    xAI 就用户关于 Grok Build 隐私的疑问作出回应,称自发布以来一直完全遵守零数据留存(ZDR),所有用户始终可在 CLI 中禁用数据上传,禁用后该选择会被遵守。

7月15日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy3 获开发者实测好评:小模型在 OpenRouter 用量最高,3 条提示词生成应用

    腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。

  2. Scott Wu(@ScottWu46)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 收购 Windsurf 一周年:Devin 品牌统一,营收从 7300 万美元增至超 5 亿美元

    Cognition 收购 Windsurf 满一年,期间推出自研模型(上周发布 SWE1.7)、Devin Review、Devin CLI,并将产品统一为 Devin Desktop 品牌。团队一年写下超 2000 万行代码,营收运行率从 7300 万美元增至超 5 亿美元。

7月14日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler:用抽象与 DSL 为 LLM 生成代码套上缰绳

    Unmesh Joshi 在 Martin Fowler 站点分享经验:LLM 生成代码速度极快,但要确保产出符合预期,需要清晰的边界,他用抽象和领域特定语言(DSL)构建了强约束。文章已在 martinfowler.com 发布。

  2. AI炼金术AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    王建硕与徐文浩激辩:AI写代码到底该不该看代码

    播客「AI炼金术」中,百姓网创始人王建硕与徐文浩就AI写代码是否该看代码展开辩论。王建硕12天在TestFlight发了148个版本,每天让Claude Code跑12小时。

7月12日周日
  1. 宝玉的分享AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Caveman 电报体 Skill 实测:号称省 65% Token,JetBrains 测出仅 8.5%

    JetBrains 用 Claude Code 在 SkillsBench 的 86 个编程任务上实测 Caveman 电报体 Skill,发现输出 Token 实际只降 8.5%(从约 59.2 万降到 54.2 万),远低于其宣称的 65%。

7月11日周六
  1. Google AI Developers(@googleaidevs)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google AI Studio 支持直接导入 GitHub 仓库

    Google AI Studio 现已支持直接导入 GitHub 仓库,可将整个 repo 带入上下文窗口进行开发。此举让开发者无需手动复制代码,即可在 AI Studio 中基于完整仓库上下文构建。

7月10日周五
  1. Taranjeet(@taranjeetio)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    openmemory v2 发布:开源 CLI 支持跨 Codex、Claude Code 和 OpenCode 迁移编码会话

    Taranjeet 发布 openmemory v2,一个开源 CLI,用于在 Codex、Claude Code 和 OpenCode 之间迁移编码会话,让上下文随模型走。作者提到 GPT-5.6 正在 Codex 中逐步上线,并引用 OpenAI 消息称 GPT-5.6 家族模型 Sol、Terra、Luna 开始在 ChatGPT、Codex 和 API 中推出。

  2. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 5.6 现已上线 Devin Desktop

    GPT 5.6 现已登陆 Devin 与 Devin Desktop。在 FontierCode 1.1 Extended 上,GPT-5.6 系列以强劲分数与出色成本效率见长,其中 GPT 5.6 Sol 以近乎次优模型一半的成本达到顶级性能。

7月9日周四
  1. AI at Meta BlogAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测

    Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。

    为什么值得看

    Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sualeh Asif 称单智能体迭代中更偏好 Grok 4.5 而非 Opus

    Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。

  3. Scott Wu(@ScottWu46)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-1.7,推理速度达 1000 tok/s

    Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。

  4. Windsurf(@windsurf_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-1.7,上线 Devin Desktop 与 Devin CLI

    Cognition 发布其迄今最强的模型 SWE-1.7,已在 Devin Desktop 和 Devin CLI 上线。官方称其成绩与最强前沿模型仅差几分,成本仅为后者一小部分,并以 1000 tok/s 的闪电模式提供服务,团队表示在扩展规模时仍持续看到 RL 带来收益。

7月7日周二
  1. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象

    Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。

  2. cat(@_catwu)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 早期团队回顾:它是如何诞生的

    Anthropic 发布了一份由 Claude Code 早期团队成员和首批用户共同讲述的简短历史,回顾这款产品从无到有的过程。完整内容可在 Anthropic 官网的 "making of" 专题页面查看。

7月6日周一
  1. Import AI — Jack ClarkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 464:Fable 编写 GPU kernel、AI 自动化与模拟计算

    Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。

7月3日周五
  1. Augment Code(@augmentcode)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code:IDE 已死,然后呢?

    Augment Code 提出"IDE 已死"的判断,并抛出"然后呢"的追问。该帖仅附一段视频,未展开具体论据或替代方案。

  2. cat(@_catwu)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Tag 如何在全公司落地:内部版本已产出 65% 产品 PR

    Claude Tag 正在 Anthropic 的工程、产品、数据、销售、市场等部门铺开,其内部版本已能产出 65% 的产品 PR。Boris Cherny 与 Cat Wu 在对话中讲述了从 Claude Code 到 Claude Tag 的路径,以及它如何从工程团队扩散到整个 Anthropic,并介绍了安全设计的思路与 CEO/CTO 的推广方法。

  3. Windsurf(@windsurf_ai)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 上线 Devin Desktop 和 Devin CLI

    Claude Fable 5 现已在 Devin Desktop 和 Devin CLI 中可用。该模型同时接入 Devin Cloud 的 Ultra agent,官方称其擅长长周期任务与调试。

7月2日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Cloud 推出 Security Swarm,基于 Agentic MapReduce 架构

    Cognition 发布 Devin Security Swarm,用 Agentic MapReduce 新架构在复杂代码库中更低成本、更准确地查找安全漏洞。发现的漏洞可交给 Devin 修复,并可在 Desktop app 中管理多台修复智能体。

7月1日周三
  1. Windsurf(@windsurf_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonnet 5 在 Devin Desktop/CLI 中配额消耗较 Sonnet 4.6 低约 30%

    截止 8 月 31 日,Sonnet 5 在 Devin Desktop/CLI 中消耗的配额比 Sonnet 4.6 少约 30%,此后两者配额消耗相同。

  2. Windsurf(@windsurf_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5 上线 Devin Desktop 和 Devin CLI

    Claude Sonnet 5 现已在 Devin Desktop 和 Devin CLI 上线。该模型在提供前沿级编程性能的同时价格更实惠,并在 FrontierCode Extended 上超过 Opus 4.8。

  3. Andrew Ng(@AndrewYNg)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达分享构建 0 到 1 产品的 3 个关键循环:智能体编码、开发者反馈与产品决策

    吴恩达提出构建 0 到 1 产品的 3 个关键循环:智能体编码循环、开发者反馈循环和产品决策循环。智能体编码循环让 AI 智能体根据产品规格和 evals 自主写代码、测试并迭代,直至无 bug,能连续工作约一小时无需人工干预。开发者反馈循环中,由于智能体自测能力增强,开发者手动找 bug 的时间大幅减少,得以专注更高层的产品决策。

6月30日周二
  1. Smashing MagazineAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么无障碍是一项运营能力,而非一个功能

    Level Access 赞助的文章指出,WebAIM Million 2026 年扫描发现 95.9% 的页面存在可检测的 WCAG 失败,平均每页 56.1 个错误,页面元素一年内增长超过 20%。

  2. 人民公园说AIAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 + Codex 实现 Token 自由?CLI 成智能体母语后 GUI 会被消灭吗

    播客讨论 GLM 5.2 是否带来又一个 DeepSeek R1 时刻,并与 Codex 对比:Codex 像按时收费的律师,GLM 是不花钱的大侄子。节目指出 GLM 5.2 最大缺点是"瞎",同时认为 CLI 正成为智能体之间的母语,未来被消灭的不是 GUI,而是 90% 的输入操作本身。

6月29日周一
  1. HelloGitHubAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 123 期:llmfit、tolaria、text-to-cad 等 31 个开源项目

    HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。

6月27日周六
  1. cat(@_catwu)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 桌面版分屏功能获用户好评

    Claude Code 桌面版的分屏(split screen)功能被用户称为最喜欢的功能之一。该推文展示了这一桌面端特性的使用画面,互动数据为 381 次点赞、35 条回复、14 次转发和 55251 次浏览。

6月26日周五
  1. Next.js BlogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 16.3 的 AI 改进:内置文档、官方 Skills 与 Agent Browser

    Next.js 16.3 围绕 Agent 驱动开发推出多项 AI 改进:next dev 自动在 AGENTS.md 写入版本匹配的内置文档指针,新增 next-dev-loop。

  2. What's Next|科技早知道AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    1 人公司扛 5 人活、管 50 个 Agents?AI 时代一人公司的天花板在哪

    《科技早知道》在亚马逊云科技中国峰会现场举办「One Person Company | AI 时代的创业复兴」圆桌论坛,余一和归藏分享了各自的 AI 实验。余一用自己的数字分身做自媒体,一年从 2000 粉做到近 20 万;归藏设计背景出身,其 PPT Skill 在 GitHub 收获超 2 万 Star,他认为 agent 是工具而非员工。

  3. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

  4. v0(@v0)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 Design Systems 2.0 发布:支持从 GitHub、npm、Storybook、Figma 导入设计系统

    v0 Design Systems 2.0 发布,支持从 GitHub、npm、Storybook、Figma 等来源导入设计系统。用户可直接使用真实的组件、颜色、字体和模式进行构建。

6月25日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 与 Kimi K2.7 在 FrontierCode Extended 上分别得分 43.0% 和 39.5%

    GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。

  2. Windsurf(@windsurf_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K2.7 Code 与 GLM 5.2 上线 Devin Desktop 和 CLI

    Kimi K2.7 Code 与 GLM 5.2 已在 Devin Desktop 和 CLI 上线。两者在真实工程任务基准 FrontierCode Extended 上表现强劲:GLM 5.2 得分 43.0%,Kimi K2.7 Code 得分 39.5%。Pro/Max/Teams 用户可在 7 月 5 日前免费试用这两款模型。

  3. Eric Jing(@ericjing_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark Design 发布,被 PM 用户称为自己的 ClaudeCode 时刻

    Genspark 推出 Genspark Design,官方称这是由 Claude Opus 4.7 驱动的下一代设计与创作 AI,无需设计背景即可从粗略想法做出专业设计。