跳到正文

#编码

今日 31 条
6月24日周三
  1. AI Breakfast(@AiBreakfast)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动

    Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动,主打无设计背景也能从想法做出专业设计。该工具集 UI 原型、视频、HTML 动画、海报于一处,可上传 Figma 文件或保存设计稿建立品牌设计系统并在团队内复用,还能依托 Genspark Code 一键把应用或网页设计转成可运行代码。

  2. Andrej Karpathy(@karpathy)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrej Karpathy:这不是 LLM 问答或 RAG,而是一种全新的团队工作方式

    Andrej Karpathy 表示,这款产品并非简单的 LLM 问答或 Slack 上的 RAG,而是企业级部署下真正可用的全新工作方式:它编写大部分代码、深度集成、支持多人协作,让人感觉每个人都成了管理者。他本人在 Slack 中完成工作,并称 v0 只是黑客松项目、基本思路很简单,但该产品经过大量内部实验与迭代后已接近真正落地。

6月23日周二
  1. 字节跳动SeedAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布 Seed2.1 系列模型,Agent 与 Coding 能力全面提升

    字节跳动 Seed 团队正式发布 Seed2.1 系列模型,定位面向真实生产力场景的智能体,Agent 与 Coding 能力全面提升。官方称其通用 Agent 可完成项目规划、文件处理、工具调用等多步骤任务,Coding 端到端交付覆盖需求理解、功能实现、bug 修复、运行环境搭建和结果验证,多模态理解、知识、推理等基础能力也有提升。

6月22日周一
  1. Interconnects AI — Nathan LambertAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.2 是开放智能体的跃变节点

    Nathan Lambert 认为智谱 GLM-5.2 是首个在编码 harness 中作为通用智能体真正好用的开放权重模型,其热度在社区中只有 DeepSeek R1 发布时有类似规模。

    为什么值得看

    作者亲自用 GLM-5.2 在 Claude Code 中跑通工作流,并给出与 DeepSeek R1 时刻的对照,可看开源模型替代前沿闭源的具体进度。

6月20日周六
  1. Junyang Lin(@JustinLin610)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex 近几日为何这么笨

    6 月 20 日,Junyang Lin(@JustinLin610)发帖吐槽 Codex 这几天表现很笨,该帖获 102 个点赞、2 次转发、23 条回复,浏览量 93359。帖中未给出具体版本号、参数或 benchmark 数据,也未说明问题原因。

6月19日周五
  1. Augment Code(@augmentcode)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code:人工先审设计、Code Review 专家再比对全量 diff,一个智能体可独立完成从设计到合并

    Augment Code 提出把代码审查前移到设计阶段:人工先审设计,Code Review 专家随后在数分钟内读完完整 diff 并核对是否偏离已批准的设计。由于不再由人逐行阅读,实现规模不再是限制,工作单元也从 PR 变成整个项目,一个智能体即可独立把项目从已批准设计推进到合并代码。

  2. Augment Code(@augmentcode)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Augment Code 谈在 Cosmos 上让单个 worker agent 一次性完成整个设计

    Augment Code 在 Cosmos 项目上采用不同做法:设计文档经人工评审通过后,整个设计交给单个 worker agent,由它实现、修复自身 CI 失败并处理评审意见,最终以一个大 PR 提交,不做 ticket 拆分。该 PR 常达数千行,团队认为单个 agent 掌握完整设计比多个 agent 各持部分上下文写出的改动更连贯。

  3. Windsurf(@windsurf_ai)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Review 在 PR 审查流程中扫描安全漏洞,现已上线 Devin Cloud 和 Devin 桌面端

    Devin Review 现可在 PR 审查流程中扫描安全漏洞,功能已在 Devin Cloud 和 Devin 桌面端上线。

6月18日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 谈 DeLM:无需中心编排器的智能体协作,SWE-bench Verified 提升约 10%

    Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。

6月17日周三
  1. 智谱AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.2上线并开源:专注Coding与长程任务

    智谱上线并开源 GLM-5.2,主打 1M 上下文与长程任务能力,模型权重采用 MIT 协议,已在 Hugging Face 与 ModelScope 开放下载。

    为什么值得看

    原文给出 GLM-5.2 在长程编码任务上的基准位置与 1M 上下文设计,读者可据此判断开源编码模型与 Claude Opus 的差距。

  2. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

6月15日周一
  1. Import AI — Jack ClarkAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 461:Sequent 称"对齐尚未步入正轨",发布 FrontierCode 与合成研究实习生

    英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。

  2. 人民公园说AIAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    毕业季|Vibe Coding 时代,选专业不如这 3 个人生开挂 Skill

    几个错过时代红利的“老登”复盘人生 0.1 版本的 Bug,讨论 Vibe Coding 时代该怎么选专业。他们提出被家长强按头改志愿、交女朋友、翘课才像大学该装的底层 Skill,并追问当 AI 接管 80% 编码工作后计算机专业的活路在哪,主张别去传统企业当廉价实习生,直接 Vibe Code 搓产品挂闲鱼卖。

6月13日周六
  1. 智谱AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.2 全量开放,下周开源并采用 MIT 协议

    智谱宣布 GLM-5.2 面向 GLM Coding Plan 全量用户开放,覆盖 Lite、Pro、Max 和团队版;该模型支持 1M 上下文,官方称其在长程任务中保持领先,并称其为此前最强的国产 Coding 模型。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

    为什么值得看

    智谱披露 GLM-5.2 的 1M 上下文、下周开源与 MIT 协议,读者可据此判断开放程度与部署节奏。

  2. Poe(@poe_platform)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Kimi K2.7 Code 与 MiniMax M3 两款开源权重模型

    Poe 宣布 Kimi K2.7 Code 和 MiniMax M3 两款开源权重前沿模型已上线,面向编码与智能体任务。Kimi K2.7 Code 是 Moonshot AI 迄今最强的编码模型,具备更强的多步工具调用能力,推理开销降低 30%。

6月11日周四
  1. Scott Wu(@ScottWu46)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Scott Wu:提升 agent 编排的同时也要提升人类编排

    Cognition 的 Scott Wu 在 Fable 5 发布 24 小时后表示,组织很可能跟不上 AI 的指数曲线,工程团队应立刻搭建云端软件工厂:AI 做 bug 与反馈的一线防御,AI 审完 PR 后人类再看,agent 大多时候自己提示自己。他用 Devin 举例称 Fable 实际只贵约 40%(而非人们以为的 2 倍),并称用 Devin 已能优化编排、ROI 可能比想象更高。

6月10日周三
  1. Scott Wu(@ScottWu46)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 登陆 Devin,登顶 FrontierCode 基准

    Claude Fable 5 已在 Cognition 的 Devin 中上线,并在 FrontierCode 基准上拿下第一,该基准针对真实工程任务评估代码可合并性与质量。在最难任务上,其 FrontierCode Diamond 得分从 Opus 4.8 的 13.4% 提升至 29.3%。该基准发布仅一天后便迎来这一新登顶者。

  2. Augment Code(@augmentcode)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5 为复杂软件工程任务带来新能力

    Fable 5 为复杂软件工程工作带来新一级能力,在捕捉细微问题的代码审查、PR 撰写与实现支持、大型项目规划与架构推理、长时多步技术任务,以及质量优先于成本的高风险工程场景中表现最佳。

6月9日周二
  1. 硬地骇客AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Skills 到自动化工作流:Agent 如何接管真实生产力

    硬地骇客 EP127 讨论了从 Claude Code、Codex 到 OpenClaw,哪些 Skills 真正改变了工作流,并分析 GrillMe、TDD、Playwright、Computer Use 等热门 Skills 解决的具体问题。节目还覆盖知识管理、投资研究、邮件处理等 Coding 之外的场景,以及自定义 Skill 的开发与自动化沉淀,探讨如何让 Agent 成为个人数字分身。

  2. Scott Wu(@ScottWu46)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%

    Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。

6月4日周四
  1. Scott Wu(@ScottWu46)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 与 Carahsoft 合作,将 AI 编程平台 Devin 引入公共部门

    Cognition 与 Carahsoft 达成合作,将 AI 编程平台 Devin 推向公共部门,帮助相关机构加速安全采用 AI 并推进软件开发现代化。Carahsoft 表示,此举旨在让更多公共部门机构用上私营部门正大规模采用的同类工具与技术。

6月3日周三
  1. Scott Wu(@ScottWu46)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 将 Windsurf 整合为 Devin Desktop,支持统一管理本地与云端智能体

    Cognition 宣布 Windsurf 更名为 Devin Desktop,定位为在单一界面管理成批本地与云端智能体,并支持任何兼容 ACP 的智能体,同时保留完整 IDE 以便直接进入代码修改。

6月1日周一
  1. Adam D'Angelo(@adamdangelo)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Adam D'Angelo:AI 编程让「现地现物」在软件业变得可行

    Adam D'Angelo 借用丰田精益制造的「genchi genbutsu」概念指出,AI 编程让管理者得以直接查看真实代码,而非听二手汇报。他引用 Guillermo Rauch 的说法称,CEO 和 CTO 正因 coding agents 重新开始写代码,有人靠 Claude Code 和 Vercel 重新爱上交付软件。

  2. 强少来了AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.169(2026.06.01):Codex国内也能畅快用,亲测有效

    有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。

5月31日周日
  1. 42章经AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个 AI 创始人的虚荣心、装,和愚昧之巅

    AI 创业者梦琪复盘一年历程:从字节背景的梦幻团队、讲 RL 故事融资,到做垂直 Sourcing Agent 后发现垂类 Agent 有结构性困局——被迫变成 agency,且 toB 在中国和海外华人都很难做。她认为大部分纯应用创业公司不该招算法,创业初期的高光都是"愚昧之巅"。转型 toC 后做出浏览器插件 tryclico,已迭代到第 49 版,认为这代产品 70% 精力要花在交互上。

5月29日周五
  1. cat(@_catwu)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 动态工作流并行清查数百个 A/B 测试 flag

    有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。

  2. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 4.8,已在 Claude Code 上线

    Anthropic 发布 Opus 4.8,官方称其在诚实度上有明显提升,会承认自己不知道的内容,并在自己的代码中主动标出问题而不是掩饰。该模型被推荐用于 Claude Code 的日常使用,并已当天在 Claude Code 中上线,更多细节见所引推文。

  3. Mike Krieger(@mikeyk)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8 今日发布:更诚实、能自查代码缺陷

    Claude Opus 4.8 于今日发布,Mike Krieger 试用数周后称其已成为首选模型。该模型对自己的工作更诚实、会标注不确定之处,并在交付前发现代码中的缺陷。

  4. Mike Krieger(@mikeyk)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出 Dynamic Workflows,可组建子智能体团队

    Anthropic 的 Mike Krieger 宣布 Claude Code 上线 Dynamic Workflows,可让 Claude 拉起一组子智能体协同工作、验证并回传结果。他本人用它做过整个代码库的语言迁移,以及完成复杂项目,并建议在 auto 模式下使用效果最佳。

5月28日周四
  1. HelloGitHubAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 122 期:DeepSeek 专用推理引擎 ds4 等 30 个开源项目

    Redis 作者用 C 语言为 DeepSeek-V4-Flash 打造了本地推理引擎 ds4,支持 Metal、CUDA 加速、2-bit 量化和 HTTP API,并非简单的 GGUF 运行工具。

5月27日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Birgitta Böckeler 谈测试套件作为编码智能体的回归传感器

    Birgitta Böckeler 在 martinfowler.com 发文,探讨传感器在编码智能体中的作用,重点分析测试套件如何充当回归传感器,以及变异测试(mutation testing)能在其中扮演的角色。

  2. Martin Fowler(@martinfowler)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 团队分享 vibe coding 安全实践:四位同事的经验

    Martin Fowler 的四位同事在 martinfowler.com 发文,分享将良好安全实践应用到 vibe coding 中的亲身经验。文章以多人经验合集的形式呈现。

  3. Eugene YanAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 保障源代码安全:从威胁建模到漏洞修复

    用 LLM 保障源代码安全需要走完一条完整流程:建立威胁模型、发现漏洞、验证、分类定级,最后完成补丁修复。

  4. 张小珺Jùn|商业访谈录AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    雨森的创投观察第2集:Harness、下一个字节、2026大机会和 Stanley Druckenmiller

    真格基金管理合伙人戴雨森在《雨森的创投观察》第2集回应第1集"被打脸"往事,提出"AGI是在缩水的"和"字节系创始人要把在字节学的东西自己颠覆自己"两个暴论。他认为Harness更像OS、模型更像处理器,Manus、Claude Code、OpenClaw、Codex、Hermes是用户喜欢的Coding Agent Harness。

5月26日周二
  1. Last Week in AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #246:Gemini 3.5 与 Omni、Musk 败诉、OpenAI 对阵 Erdős 问题

    Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。

  2. Varun Mohan(@_mohansolo)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    因延迟问题,所有模型配额已重置

    因延迟问题,所有模型的使用配额已被重置。

5月25日周一
  1. Varun Mohan(@_mohansolo)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Antigravity 新增 Gemini 3.5 Flash (Low) 应对简单任务 token 消耗

    Antigravity 新增 Gemini 3.5 Flash (Low) 模式,用于优化简单任务的 token 消耗。内部测试中,该模式比 Gemini 3.5 Flash (Medium) 少生成约 45% 的 token,在 SWE 任务上总体优于 Gemini 3 Flash (High)。所有付费套餐的 Gemini 配额也已被重置。

5月23日周六
  1. 42章经AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    invoko.ai 创始人梦琪复盘 AI 创业:从垂直 Agent 到 C 端的几次 pivot

    invoko.ai 创始人梦琪在复盘中表示,做垂直 Agent、过度服务专业用户、选错场景是自己 pivot 路上的三个错误决策,并认为 to B 对自己来说不是一个值得创业的方向,转而做 C 端后重新找回对软件的信心。她还自我批评称,创业初期容易被虚荣心和性感叙事牵着走,刚拿到融资时也是创始人最接近"愚昧之巅"的时刻。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor SDK 开放 Composer 2.5 前沿智能,支持 Python 与 TypeScript 构建智能体

    Cursor 通过 Cursor SDK 开放 Composer 2.5 的前沿智能,开发者可用它构建自己的智能体,现已支持 Python 和 TypeScript。该长周末期间,SDK 中的 Composer 使用享 90% 折扣。

  3. Varun Mohan(@_mohansolo)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Antigravity 2.0 在项目会话中新增“Install IDE”按钮

    Antigravity 2.0 在项目关联的对话界面右上角新增“Install IDE”按钮,方便未安装 IDE 的用户(包括新用户或更新到 2.0 时未勾选该选项的用户)完成安装。