Claude Code 上线 mods:有人做了个匹配等待中玩家的 MW2 多人对战 Mod
Claude Code 上线 mods 功能后,开发者 Alex Christou 制作了一个 Mod,把等待 Claude 完成任务的用户匹配进同一个 MW2 Quick scoping 多人对战房间,对手全是同样在等 Claude 的人。
Claude Code 上线 mods 功能后,开发者 Alex Christou 制作了一个 Mod,把等待 Claude 完成任务的用户匹配进同一个 MW2 Quick scoping 多人对战房间,对手全是同样在等 Claude 的人。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
OpenAI Developers 预告新版 dot 功能:可学习用户的工作方式、跨应用保留上下文、协调 Codex 任务,并标记需要用户关注的事项。该帖未披露发布时间、可用范围或具体版本信息。
Vercel 将 Jev 加入 AI SDK for Python,并做了两个实验:在用户输入时区分 Python 代码与英语文本,以及一次一个决策地生成 Python 代码。官方博客称 Jev 现已可在 Python 版 AI SDK 中使用。
Claude Code 展示了用诗歌配插画的能力。该演示由 xgo.ing 提供技术支持,相关推文获得 362 个点赞、8 次转发和 35181 次浏览。
Claude Code 与一台摄像机在 Old Street 被整夜开着运行。来源为 Claude 官方账号发布的推文,附带视频内容,原文未披露具体模型版本、任务细节或运行结果。
有用户称 Notion 中的 Opus 5.5 表现强悍,让它撰写案例研究时,它会自动翻阅相关 Notion 文档、会议记录和 Slack 消息。随后它还会参照用户的写作规范与品牌风格,直接生成一份精炼草稿。
Code Arena 上线 WebDev 排行榜,可在 arena.ai/leaderboard/co… 查看。该榜单由 xgo.ing 提供支持。
Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。
这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。
LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。
Vercel 发布 AI SDK for Python,新增实验性 evaluate() API,可直接调用 Jev 模型。Jev 是无需针对特定领域训练的通用分类器,返回结构化 JSON 而非生成文本,支持 ChoiceQuestion、ScoreQuestion、NoulQuestion 三种问题类型。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。
Cursor 宣布 GLM 5.3 和 GLM 5.3 Flash 已在其平台上线,GLM 5.3 Max 在 CursorBench 4.0 上取得开源权重模型中的最高分。
OpenAI Developers 在 DevDay 支线任务中添加了一台 @modretro Chromatic,参与时间还剩 48 小时。该活动包含 10 项开发者挑战,完成任意 5 项即可为每项获得 1 张抽奖券,奖品为 5 台 Codex Micro,全球均可参与。
Anthropic 的 Thariq 谈到 Claude Mods 解锁的能力,包括对话上下文、子智能体、结构化输出和 UI 控制。他表示 Mods 可以获取对话的轮数和已用 token 数,因为都在进程内运行,可以派生 subagents、解析结果并用结构化输出返回,还可以修改 UI,这是在 hooks 中无法做到的。
Bolt.new 官方演示了如何构建一个根据 UTM 参数自动调整内容的自适应落地页站点,让不同来源和行为的访客看到匹配的页面,而非统一投放到同一落地页。该方案通过识别 URL 中的 UTM 参数来动态改变站点呈现。
LangChain 在两个自研智能体上测试 OpenSWE Review,其精度从 62.9% 提升至 81.5%,每次审查的工具调用减少 29%。基于 Kimi K3 微调的 Engine 在问题检出基准上超过了基座模型与 GPT-5.6 Sol。相关细节见 LangChain 博客。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。
Varun Mohan 表示,Gemini 4 Argon 搭配 Antigravity harness 在 AA Coding Agent Index 上表现不错,并强调真实世界使用更重要,后续还有更多进展。他同时回复网友称竞争相当激烈。
Sahil Lavingia 用"做菜不放盐"比喻不用 AI 写代码,该帖获 625 点赞、134 条回复、31 次转发和 34955 次浏览。
Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。
谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。
谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件任务上提供前沿性能,数千名 Google 员工已在 Antigravity 内部使用。该模型先向 Fairwind 计划中一批受信任的网络防御者开放,更广泛的可用性将尽快推出。Sundar Pichai 表示它在复杂工作流、网络防御和软件工程中展现前沿性能,团队在 Google 内部从编码到量子计算广泛使用。
GLM 5.3 Flash 现已在 Fireworks AI 的 Serverless Training API 上开放训练,所有人可用,同时支持视觉与文本。该模型在智能体编程、文档分析和工具调用等基准测试中表现优异,且服务成本较低。
Cognition CEO Scott Wu 公开回应 Factory CEO Matan Grinberg 的指控,否认 Cognition 通过虚假面试窃取 Factory 产品信息,并称 Chris Degnan 从未向团队分享过 Factory 的任何信息。
开发者 ericzakariasson 分享了自己用来配合新模型构建游戏的技能,可通过 `npx skills add ericzakariasson/skills --skill game-builder` 安装使用。该推文获得 530 次点赞、42 条回复,浏览量超过 4.5 万。
Cognition 宣布 Chris Degnan 出任首席营收官,负责全球扩张。Chris 是 Snowflake 首位销售员工,后升任其 CRO,任内推动 ARR 超过 $3B;Cognition 同时与 Chad Peets 及 RPT 团队合作搭建其 GTM 团队。Chris 表示,听到客户讲述 Devin 如何改变其业务后决定加入。
Cognition 在推文中分享了一个 Devin 客户案例,指向 devin.ai/customers/cros 页面,邀请读者了解该客户的具体做法。原文未透露客户名称与具体成效数据。
Crosby Legal 让 Devin 负责一线响应,每天调查 20–40 个 bug 和告警,将 Sentry 噪音降低 50%。在法律团队规模扩大 5 倍的情况下,其 on-call 仍只需一名工程师,由 12 名工程师支撑 50+ 律师。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,预计到 2026 年底 Claude Code 覆盖其 50% 开发者,2027 年覆盖多数软件工程师。
Bolt 被交给一个任务:当用户点击"Complete order"按钮时触发彩纸特效,让结账环节也像成交一样有庆祝感。这条演示通过视频展示效果,并引导用户前往 Twitter 查看。
Stack Overflow 回顾 2024 与 2025 开发者调查数据:AI 工具使用率从 2023 年的 44% 升至 2024 年 62%、2025 年 79%,近半数受访者每天使用。
Viking(@vikingmute)把用 AI 写 SEO 文章的流程做成了名为 content-gate 的 skill,基于 Google Search Central 官方文档与内容质量合规指南。
fx 发布 v0.0.12,会话列表速度最高提升 560×,大型会话存储可即时恢复。该版本还改进了 GitHub 风格 Markdown 渲染、scrollback、steering 与会话恢复,并提升 MCP 的可靠性与安全性,另含多项 bug 修复和体验优化。
阿里云栖大会分论坛上,Qoder 技术负责人谢吉宝披露 Qoder 上线一年超过 80% 的用户已不再亲自写代码,非编程任务占比超 50%。9 月 23 日发布的 Qoder v0.4.0 新增项目、讨论、自定义 Agent 与 Agent Team 四项能力,把项目目标、任务状态和讨论结论统一留存,Agent 协作可跑在当前设备或 Qoder Cloud Agents 上,目前面向企业订阅开放。
美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。
MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。