Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动
Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动,主打无设计背景也能从想法做出专业设计。该工具集 UI 原型、视频、HTML 动画、海报于一处,可上传 Figma 文件或保存设计稿建立品牌设计系统并在团队内复用,还能依托 Genspark Code 一键把应用或网页设计转成可运行代码。
Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动,主打无设计背景也能从想法做出专业设计。该工具集 UI 原型、视频、HTML 动画、海报于一处,可上传 Figma 文件或保存设计稿建立品牌设计系统并在团队内复用,还能依托 Genspark Code 一键把应用或网页设计转成可运行代码。
Andrej Karpathy 表示,这款产品并非简单的 LLM 问答或 Slack 上的 RAG,而是企业级部署下真正可用的全新工作方式:它编写大部分代码、深度集成、支持多人协作,让人感觉每个人都成了管理者。他本人在 Slack 中完成工作,并称 v0 只是黑客松项目、基本思路很简单,但该产品经过大量内部实验与迭代后已接近真正落地。
字节跳动 Seed 团队正式发布 Seed2.1 系列模型,定位面向真实生产力场景的智能体,Agent 与 Coding 能力全面提升。官方称其通用 Agent 可完成项目规划、文件处理、工具调用等多步骤任务,Coding 端到端交付覆盖需求理解、功能实现、bug 修复、运行环境搭建和结果验证,多模态理解、知识、推理等基础能力也有提升。
Nathan Lambert 认为智谱 GLM-5.2 是首个在编码 harness 中作为通用智能体真正好用的开放权重模型,其热度在社区中只有 DeepSeek R1 发布时有类似规模。
作者亲自用 GLM-5.2 在 Claude Code 中跑通工作流,并给出与 DeepSeek R1 时刻的对照,可看开源模型替代前沿闭源的具体进度。
6 月 20 日,Junyang Lin(@JustinLin610)发帖吐槽 Codex 这几天表现很笨,该帖获 102 个点赞、2 次转发、23 条回复,浏览量 93359。帖中未给出具体版本号、参数或 benchmark 数据,也未说明问题原因。
Augment Code 提出把代码审查前移到设计阶段:人工先审设计,Code Review 专家随后在数分钟内读完完整 diff 并核对是否偏离已批准的设计。由于不再由人逐行阅读,实现规模不再是限制,工作单元也从 PR 变成整个项目,一个智能体即可独立把项目从已批准设计推进到合并代码。
Augment Code 在 Cosmos 项目上采用不同做法:设计文档经人工评审通过后,整个设计交给单个 worker agent,由它实现、修复自身 CI 失败并处理评审意见,最终以一个大 PR 提交,不做 ticket 拆分。该 PR 常达数千行,团队认为单个 agent 掌握完整设计比多个 agent 各持部分上下文写出的改动更连贯。
Devin Review 现可在 PR 审查流程中扫描安全漏洞,功能已在 Devin Cloud 和 Devin 桌面端上线。
Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。
智谱上线并开源 GLM-5.2,主打 1M 上下文与长程任务能力,模型权重采用 MIT 协议,已在 Hugging Face 与 ModelScope 开放下载。
原文给出 GLM-5.2 在长程编码任务上的基准位置与 1M 上下文设计,读者可据此判断开源编码模型与 Claude Opus 的差距。
Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。
几个错过时代红利的“老登”复盘人生 0.1 版本的 Bug,讨论 Vibe Coding 时代该怎么选专业。他们提出被家长强按头改志愿、交女朋友、翘课才像大学该装的底层 Skill,并追问当 AI 接管 80% 编码工作后计算机专业的活路在哪,主张别去传统企业当廉价实习生,直接 Vibe Code 搓产品挂闲鱼卖。
智谱宣布 GLM-5.2 面向 GLM Coding Plan 全量用户开放,覆盖 Lite、Pro、Max 和团队版;该模型支持 1M 上下文,官方称其在长程任务中保持领先,并称其为此前最强的国产 Coding 模型。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。
智谱披露 GLM-5.2 的 1M 上下文、下周开源与 MIT 协议,读者可据此判断开放程度与部署节奏。
Poe 宣布 Kimi K2.7 Code 和 MiniMax M3 两款开源权重前沿模型已上线,面向编码与智能体任务。Kimi K2.7 Code 是 Moonshot AI 迄今最强的编码模型,具备更强的多步工具调用能力,推理开销降低 30%。
Cognition 的 Scott Wu 在 Fable 5 发布 24 小时后表示,组织很可能跟不上 AI 的指数曲线,工程团队应立刻搭建云端软件工厂:AI 做 bug 与反馈的一线防御,AI 审完 PR 后人类再看,agent 大多时候自己提示自己。他用 Devin 举例称 Fable 实际只贵约 40%(而非人们以为的 2 倍),并称用 Devin 已能优化编排、ROI 可能比想象更高。
Claude Fable 5 已在 Cognition 的 Devin 中上线,并在 FrontierCode 基准上拿下第一,该基准针对真实工程任务评估代码可合并性与质量。在最难任务上,其 FrontierCode Diamond 得分从 Opus 4.8 的 13.4% 提升至 29.3%。该基准发布仅一天后便迎来这一新登顶者。
Fable 5 为复杂软件工程工作带来新一级能力,在捕捉细微问题的代码审查、PR 撰写与实现支持、大型项目规划与架构推理、长时多步技术任务,以及质量优先于成本的高风险工程场景中表现最佳。
硬地骇客 EP127 讨论了从 Claude Code、Codex 到 OpenClaw,哪些 Skills 真正改变了工作流,并分析 GrillMe、TDD、Playwright、Computer Use 等热门 Skills 解决的具体问题。节目还覆盖知识管理、投资研究、邮件处理等 Coding 之外的场景,以及自定义 Skill 的开发与自动化沉淀,探讨如何让 Agent 成为个人数字分身。
Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。
Cognition 与 Carahsoft 达成合作,将 AI 编程平台 Devin 推向公共部门,帮助相关机构加速安全采用 AI 并推进软件开发现代化。Carahsoft 表示,此举旨在让更多公共部门机构用上私营部门正大规模采用的同类工具与技术。
Cognition 宣布 Windsurf 更名为 Devin Desktop,定位为在单一界面管理成批本地与云端智能体,并支持任何兼容 ACP 的智能体,同时保留完整 IDE 以便直接进入代码修改。
Adam D'Angelo 借用丰田精益制造的「genchi genbutsu」概念指出,AI 编程让管理者得以直接查看真实代码,而非听二手汇报。他引用 Guillermo Rauch 的说法称,CEO 和 CTO 正因 coding agents 重新开始写代码,有人靠 Claude Code 和 Vercel 重新爱上交付软件。
有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。
AI 创业者梦琪复盘一年历程:从字节背景的梦幻团队、讲 RL 故事融资,到做垂直 Sourcing Agent 后发现垂类 Agent 有结构性困局——被迫变成 agency,且 toB 在中国和海外华人都很难做。她认为大部分纯应用创业公司不该招算法,创业初期的高光都是"愚昧之巅"。转型 toC 后做出浏览器插件 tryclico,已迭代到第 49 版,认为这代产品 70% 精力要花在交互上。
有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。
Anthropic 发布 Opus 4.8,官方称其在诚实度上有明显提升,会承认自己不知道的内容,并在自己的代码中主动标出问题而不是掩饰。该模型被推荐用于 Claude Code 的日常使用,并已当天在 Claude Code 中上线,更多细节见所引推文。
Claude Opus 4.8 于今日发布,Mike Krieger 试用数周后称其已成为首选模型。该模型对自己的工作更诚实、会标注不确定之处,并在交付前发现代码中的缺陷。
Anthropic 的 Mike Krieger 宣布 Claude Code 上线 Dynamic Workflows,可让 Claude 拉起一组子智能体协同工作、验证并回传结果。他本人用它做过整个代码库的语言迁移,以及完成复杂项目,并建议在 auto 模式下使用效果最佳。
Redis 作者用 C 语言为 DeepSeek-V4-Flash 打造了本地推理引擎 ds4,支持 Metal、CUDA 加速、2-bit 量化和 HTTP API,并非简单的 GGUF 运行工具。
Birgitta Böckeler 在 martinfowler.com 发文,探讨传感器在编码智能体中的作用,重点分析测试套件如何充当回归传感器,以及变异测试(mutation testing)能在其中扮演的角色。
Martin Fowler 的四位同事在 martinfowler.com 发文,分享将良好安全实践应用到 vibe coding 中的亲身经验。文章以多人经验合集的形式呈现。
用 LLM 保障源代码安全需要走完一条完整流程:建立威胁模型、发现漏洞、验证、分类定级,最后完成补丁修复。
真格基金管理合伙人戴雨森在《雨森的创投观察》第2集回应第1集"被打脸"往事,提出"AGI是在缩水的"和"字节系创始人要把在字节学的东西自己颠覆自己"两个暴论。他认为Harness更像OS、模型更像处理器,Manus、Claude Code、OpenClaw、Codex、Hermes是用户喜欢的Coding Agent Harness。
Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。
因延迟问题,所有模型的使用配额已被重置。
Antigravity 新增 Gemini 3.5 Flash (Low) 模式,用于优化简单任务的 token 消耗。内部测试中,该模式比 Gemini 3.5 Flash (Medium) 少生成约 45% 的 token,在 SWE 任务上总体优于 Gemini 3 Flash (High)。所有付费套餐的 Gemini 配额也已被重置。
invoko.ai 创始人梦琪在复盘中表示,做垂直 Agent、过度服务专业用户、选错场景是自己 pivot 路上的三个错误决策,并认为 to B 对自己来说不是一个值得创业的方向,转而做 C 端后重新找回对软件的信心。她还自我批评称,创业初期容易被虚荣心和性感叙事牵着走,刚拿到融资时也是创始人最接近"愚昧之巅"的时刻。
Cursor 通过 Cursor SDK 开放 Composer 2.5 的前沿智能,开发者可用它构建自己的智能体,现已支持 Python 和 TypeScript。该长周末期间,SDK 中的 Composer 使用享 90% 折扣。
Antigravity 2.0 在项目关联的对话界面右上角新增“Install IDE”按钮,方便未安装 IDE 的用户(包括新用户或更新到 2.0 时未勾选该选项的用户)完成安装。