跳到正文

#编码

今日 29 条
8月3日周一
  1. Andrej Karpathy(@karpathy)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 把 simonw 的"骑自行车鹈鹕"测试源码上传,可在浏览器中试玩

    Andrej Karpathy 将 Simon Willison "骑自行车鹈鹕"测试的源码上传到 karpathy.ai/lotr-movie/,该测试如今可在浏览器中直接运行并支持 fork。他还调侃说 GTA Hobbiton 会在 GTA VI 之前推出。

8月2日周日
  1. Binyuan Hui(@huybery)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编码智能体驱动 AI 两年进展,下一个同样令人兴奋的方向在哪?

    过去两年 AI 的进展很大程度上由编码智能体推动。Binyuan Hui 就此发问:是否还有哪个新方向让人感到同样兴奋。该帖获得 29 条回复、125 次点赞、约 4.25 万次浏览。

  2. 屠龙之术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你真的信 WorkBuddy 有 2000 万月活?——屠龙之术谈 work agent 与 Agent 时代

    播客「屠龙之术」主播庄明浩质疑外界流传的 WorkBuddy 2000 万月活说法,认为这是对数据源的过度演绎。节目从 Chat 进入真 Agent 时代切入,梳理 CodeX 的千万活跃用户、Harness 崛起与开源 Agent Infra 生态,并指出评估空前重要、work agent 共识在国内形成很快。他还讨论了用户量与 token 量是否仍重要、是否只能回到 ARR 衡量。

8月1日周六
  1. 乱翻书AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大厂押注 AI 办公,飞书和钉钉为何先成了配角

    乱翻书播客这期请来飞书前产品 Eric、AI 观察者庄明浩和雅楠,讨论大厂押注 AI 办公后飞书、钉钉反而沦为配角。节目认为狭义企业 IM 的历史使命已基本完成,豆包与飞书之间是豆包吃掉飞书,个人生产力与企业办公的边界正在模糊。嘉宾还提到 Codex 定义了这轮 Work Agent 的产品形态,并追问豆包 2 亿日活究竟是资产还是负债。

  2. idoubi(@idoubicc)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    idoubi 开源为 DeepSeek 优化的 Coding Agent DSCode

    idoubi 开源了为 DeepSeek 深度优化的 Coding Agent DSCode,主打快、省、稳、开放、安全。

7月31日周五
  1. 奇舞精选AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奇舞周刊第593期:当理解成为瓶颈——AI 编程时代的认知债与意图债

    奇舞周刊第593期聚焦 AI 编程时代瓶颈从"生产代码"转向"理解代码",作者提出技术债、认知债、意图债的"三元债模型",认为 AI 在降低技术债的同时正加速累积后两者,开发者不能外包"理解"。

  2. 人民公园说AIAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    梁文锋闭门讲话解读:硬件10个月回本、API按成本6倍定价,DeepSeek 的成本壁垒怎么算

    DeepSeek 梁文锋一场闭门讲话被解读出理想主义背后的成本账:硬件约 10 个月回本、API 按成本 6 倍定价,融资的钱继续买卡,“反正开了你也做不了”被视为真正的成本壁垒。讲话还涉及用 TileLang 重构底层算子绕开英伟达生态,以及 Claude 加一两个工程师就完成 AMD 硬件适配原型。开源被形容为试吃,护城河藏在工程化与上下文里。

  3. Scott Wu(@ScottWu46)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 系列在 FrontierCode 上的性价比表现,Devin 用户将自动享受成本下降

    Cognition 更新 FrontierCode 1.1,以反映 GPT-5.6 Terra 和 GPT-5.6 Luna 的新折扣,GPT-5.6 系列由此落在性价比效率的帕累托曲线上。Scott Wu 表示所有 Devin 用户都会自动看到成本下降。

7月30日周四
  1. Martin Fowler(@martinfowler)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Giles Edwards-Alexander 实验:拆分大函数能否降低 token 成本

    Giles Edwards-Alexander 做了一项实验,验证把大函数拆解为小函数是否能降低 token 成本,结果表明如今或许已经可以衡量重构带来的经济收益。该文发表于 martinfowler.com。

  2. 晚点聊 LateTalkAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Liblib 陈冕:关于活下来,以及所有接近死亡的时刻

    演语科技 Evoken 创始人陈冕在《晚点聊》中回应外界对公司的争议,包括原创度质疑、投流与补贴误解,以及收购传闻。Evoken 旗下有 Liblib、Lovart、LibTV 三个产品,ARR 超过 3 亿美元,并以 20 亿美元估值一笔融了 3 亿美元。陈冕称公司不是负毛利,LibTV 3.9 折会员仍在探索高 Token 消耗的生产力产品商业模式。

  3. Satya Nadella(@satyanadella)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    纳德拉详解用 Copilot 构建 ROIC Intelligence App:单条提示词生成完整应用

    微软 CEO Satya Nadella 披露其用即将登陆新 superapp 的 Copilot code,以单条提示词加 /drill-me 技能生成计划,再用 autopilot 生成含历史、查询、场景与 what-if 分析的完整应用,并以 /rubber-duck 完成测试。

  4. 强少来了AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex Subagents 入门:172 个 AI 角色分工干活

    作者以 Codex Subagents 为例,讲如何用大白话把任务拆给多个子智能体:只需说清叫谁、干啥、并行还是排队、结果给谁,文中给出了代码排查和 reviewer、security-auditor、qa-expert 并行审核两类可照抄范例。

7月29日周三
  1. 宝玉的分享AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 TL 到 EM:我如何不再盯着 AI 写代码

    作者在使用 Coding Agent 时从 TL 转向 EM 角色,转折点在 Fable 5 前后——发现 AI 写的代码质量已相当可以,只需稍加验证。他现在只与 Agent 一起定技术方案,再用 /goal 加上方案让 Agent 执行写代码和自动化测试,最后验收功能。

7月28日周二
  1. Aman Sanger(@amanrsanger)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 在印度推出 Cursor Start,₹649/月可使用 Grok 4.5 与 Composer

    Cursor 面向印度开发者推出 Cursor Start 订阅,价格为 ₹649/月,包含对 Grok 4.5 和 Composer 的慷慨额度,可用于日常规划、构建、测试和交付。Aman Sanger 表示,Cursor 在印度的用户基数过去一年增长到原来的三倍,人均 agent 请求量高于其他任何国家,并称这两款模型能力强且 token 使用高效、成本低。

  2. Poe(@poe_platform)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Claude Opus 5,Anthropic 称其为最强 Opus 模型

    Poe 宣布可在其平台试用 Anthropic 最新模型 Claude Opus 5,并称这是迄今能力最强的 Opus 模型,以一半价格接近 Claude Fable 5 级别的智能。该模型在智能体编码、知识工作、视觉理解和长时任务上有明显提升,试用入口为 poe.com/Claude-Opus-5。

7月27日周一
  1. Windsurf(@windsurf_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Windsurf 推广 Devin Desktop 下载

    Windsurf 发布推文推广 Devin Desktop,并附上 devin.ai/download 下载链接。该推文互动量为 2 条回复、4 个点赞、2808 次浏览。

  2. Windsurf(@windsurf_ai)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 上线 Devin Desktop 与 Devin CLI

    Kimi K3 现已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 上,Kimi K3 是 Cognition 测试过的首个接近前沿水平的开源模型。

  3. 强少来了AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 PRD 到可验证代码:AI 需求开发闭环实践|有意思小周刊vol.170

    有意思小周刊 vol.170 提出面向 React Native 项目的 AI 需求开发闭环实践:把 PRD、接口文档、Figma 输入转化为可审阅的「需求规格」,并设人工门禁做需求审阅与架构确认,再依次执行代码生成、编译验证和视觉审计,形成从需求到可验证代码的人机协作流水线。

7月25日周六
  1. v0(@v0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 现已支持 Claude Opus 5

    v0 现已上线 Claude Opus 5,用户可在 v0.app/?opus5 直接试用。该消息由 v0 官方账号发布,未披露价格、上下文长度等具体参数。

  2. Alex Albert(@alexalbert__)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5 发布:跨领域 token 效率与智能水平同步提升

    Anthropic 发布 Opus 5,团队称在提升智能水平的同时大幅优化了该模型在各领域的 token 效率。Alex Albert 表示其使用体验非常顺滑,在许多编码任务上他更偏好 Opus 5 而非 Fable 5。

  3. Mike Krieger(@mikeyk)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5 一夜之间实现童年梦想:Transport Tycoon 世界可自由漫步

    Opus 5 帮 Mike Krieger 实现了 6 岁时的想法——在 Transport Tycoon 世界中自由漫步。Opus 用一整夜时间构建了渲染器、存档解析器以及船、飞机、卡车和巴士模拟器。

7月24日周五
  1. 前端早读课AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    opencodex:面向 Codex 和 Claude Code 的通用 LLM 代理中间件开源

    开源项目 opencodex 发布,作为通用 LLM 代理中间件,让 Codex(CLI、App、SDK)和 Claude Code 用户自由使用 Anthropic Claude、Google Gemini、xAI Grok、DeepSeek、Ollama 等任意大语言模型。

  2. 前端早读课AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Slack 设计团队如何用学习社群帮设计师上手 AI

    Slack 设计团队没有采用自上而下的 AI 培训,而是搭建了一个允许困惑、鼓励探索的学习社群。团队开设周五活动「会 Vibe 的设计师 & AI」,并在 2026 年推出为期三天的 Builder Days,让设计师、工程师和产品经理放下路线图,用 AI 一起动手造东西。其经验是:不要从工具赋能开始,而是先给设计师一个可以安心当新手的地方。

7月22日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy3 登 Agent Arena 开源模型第 5、前端代码赛道第 2

    腾讯混元 Hy3 在 Agent Arena 开源权重模型中排名第 5(总榜第 25),在前端代码赛道(Frontend Code Arena)位列开源模型第 2(总榜第 16)。

  2. 牛油果烤面包AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛油果烤面包 #153:AI 编程的历史、Claude Code 与 Agentic Coding

    播客「牛油果烤面包」第 153 期邀请 laike9m 和 Rice,聊 AI 编程的历史与技术核心,从「古法编程」、编译系统、测试与代码审核讲到 AI 编程工具的演进,重点剖析 Claude Code 与 Agentic Coding。

  3. Google AI Developers(@googleaidevs)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 3.6 Flash 在 GitHub Copilot 中全面可用

    Google 的 Gemini 3.6 Flash 现已全面可用,并正在 GitHub Copilot 中逐步推送。该模型面向网页与应用开发、编码及智能体任务;在测试中,它在编码和智能体工作流上的任务完成率高于 Gemini 3.5 Flash,token 效率也更好。用户可在 GitHub Copilot 应用或 @code 中试用。

  4. Google AI(@GoogleAI)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash Cyber,专攻网络安全漏洞

    Google 推出 Gemini 3.5 Flash Cyber,基于 3.5 Flash 构建,在 CyberGym 等基准上达到前沿竞争力,面向规模化发现与修复网络安全漏洞场景优化,成本更低。该模型将在 AI 代码安全智能体 CodeMender 中独家提供给政府和可信伙伴,作为限时访问试点项目的一部分。鉴于技术的双用途性质,Google 对部署采取了审慎方式。

7月21日周二
  1. Last Week in AIAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #251:Mythos 回归、Claude Sonnet 5、Etched、LongCat

    Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。

  2. Last Week in AIAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #249:Anthropic 封禁 Fable 5、SpaceX 收购 Cursor、开源模型扎堆发布

    Anthropic 在美国政府指令下切断了 Fable 5 和 Mythos 5 的访问,理由是涉嫌越狱。SpaceX 以约 1.75 万亿美元估值完成 IPO,随后以 600 亿美元收购 AI 编程公司 Cursor。

  3. Scott Wu(@ScottWu46)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TierZero 团队加入 Cognition,推进软件自动驾驶

    TierZero 团队加入 Cognition,继续推进"让软件自动驾驶"的目标,即让智能体编写代码并保持其运行。Anhang Zhu 表示两年前开始这一方向,Cognition 的 Scott Wu 称期待自动驾驶软件的下一步进展。

  4. Scott Wu(@ScottWu46)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sarah Guo 押注 AI 前沿实验室无法包揽一切:专访 Conviction 创始人

    2018年,28岁的 Sarah Guo 成为 Greylock 60年历史上最年轻的普通合伙人,四年后离职创办全押 AI 的 Conviction。她早期投资了 Baseten 和 Harvey(各估值超 110 亿美元),首年又投中 Sierra、Cognition 和 Mistral(三家合计估值 540 亿美元)。

7月18日周六
  1. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Inkling 和 Grok 4.5 已在 Devin Desktop 和 CLI 上线

    Inkling 和 Grok 4.5 现已在 Devin Desktop 和 CLI 中可用。Cognition 同步上线 FrontierCode 排行榜,专门追踪哪些模型能写出真正可合并的代码,Grok 4.5 与 Inkling 等所有模型的分数均已公布,并附完整评测方法和示例任务。

  2. 屠龙之术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    屠龙之术:2026H1 AI行业观察——重估一切,文艺复兴

    播客「屠龙之术」在约50分钟节目中梳理2026年上半年AI行业变化,从资本与硬件、模型竞争、Agent元年、世界模型与治理四条线索重估产业方向。节目提出2026年可能成为Agent从聊天走向任务执行的关键年份,Coding Agent、办公智能体与Agent基础设施将重构软件生态,并讨论OpenAI、Anthropic、Google及中国模型厂商的格局变化与中美开源闭源路线分野。

7月17日周五
  1. AI SDK(@aisdk)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Moonshot 发布 Kimi K3 模型,2.8 万亿参数、100 万上下文,将开放权重

    Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。

    为什么值得看

    Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。

7月16日周四
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan:开源模型与配套框架正迎来高光时刻

    Sriram Krishnan 认为开源模型与配套框架正迎来高光时刻:如今可以凭借清晰的训练谱系追上接近 SOTA 的性能,如 thinkymachines 的 Inkling 今日发布。

  2. xAI(@xai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 在 Proximal FrontierSWE 基准排名第 2,研究能力居首

    Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。

  3. xAI(@xai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 回应隐私质疑:Grok Build 已删除留存编码数据,默认关闭数据保留

    xAI 就用户关于 Grok Build 隐私的疑问作出回应,称自发布以来一直完全遵守零数据留存(ZDR),所有用户始终可在 CLI 中禁用数据上传,禁用后该选择会被遵守。

7月15日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy3 获开发者实测好评:小模型在 OpenRouter 用量最高,3 条提示词生成应用

    腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。

  2. Scott Wu(@ScottWu46)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 收购 Windsurf 一周年:Devin 品牌统一,营收从 7300 万美元增至超 5 亿美元

    Cognition 收购 Windsurf 满一年,期间推出自研模型(上周发布 SWE1.7)、Devin Review、Devin CLI,并将产品统一为 Devin Desktop 品牌。团队一年写下超 2000 万行代码,营收运行率从 7300 万美元增至超 5 亿美元。

7月14日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler:用抽象与 DSL 为 LLM 生成代码套上缰绳

    Unmesh Joshi 在 Martin Fowler 站点分享经验:LLM 生成代码速度极快,但要确保产出符合预期,需要清晰的边界,他用抽象和领域特定语言(DSL)构建了强约束。文章已在 martinfowler.com 发布。