千问 Qwen3.8-Max 升级 0902 版本,主打编程与专业办公
千问 Qwen3.8-Max 升级到 0902 版本,围绕编程(Coding)和专业办公(Cowork)进行后训练,更适合企业真实复杂任务、科研和长周期任务。在 CodeArena 前端编程总榜中,该版本提升 22 分至 1691 分夺得冠军,在多步推理、工具调用、端到端 app 生成方面刷新成绩。
千问 Qwen3.8-Max 升级到 0902 版本,围绕编程(Coding)和专业办公(Cowork)进行后训练,更适合企业真实复杂任务、科研和长周期任务。在 CodeArena 前端编程总榜中,该版本提升 22 分至 1691 分夺得冠军,在多步推理、工具调用、端到端 app 生成方面刷新成绩。
Claude Fable 5.1 已在 Genspark Code Agent 和 Claw 上线,发布首日即可使用。Anthropic 同时推出 Claude Fable 5.1 与 Claude Mythos 5.1,称其为面向编程和知识工作的全球最先进模型。
Qwen3.8-Max-0902 在 CodeArena WebDev 排行榜升至第一,得分从 1669 提升到 1691,创下智能体编码(WebDev)工作流的新纪录,在多步推理、工具调用和完整应用生成方面表现突出。
Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为面向编码和知识工作的最先进模型。一位用户转述称,团队借助 Fable 5.1 承接了此前需数月才能完成的更大项目,并可在 Claude Code、Claude Cowork、Claude Tag 中调用该模型。
DeepLearning.AI 公布 AI 工程技能图谱第二支柱"软件工程基础",提示编码智能体虽能写出可运行代码,但仅靠"氛围编程"而缺乏软件工程基础会损害系统的长期可靠性、安全性与可扩展性。该支柱涵盖全栈应用构建、数据管理、系统架构设计、系统安全与可靠、生产环境扩展与运维五项技能,相关解读由 Andrew Ng 提供。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,宣称是面向编码与知识工作最先进的模型。Fable 系列面向可自主运行的复杂多步任务,Fable 5.1 在编码、知识工作和长时程问题求解上设定了新标准。
AI SDK 现已支持通过其调用 Claude Fable 5.1。Anthropic 新推出的 Claude Fable 5.1 与 Claude Mythos 5.1 号称是全球最强的编码与知识工作模型,此次集成让开发者可直接在 AI SDK 中接入这一模型。
Claude Fable 5.1 现已登陆 Cursor,在 CursorBench 3.2 上以 max effort 取得 73.4%,是 Cursor 运行过的最强模型。该模型尤其擅长自我验证,可端到端承担高难度编码任务。
Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为全球最先进的编程与知识工作模型。Fable 5.1 能根据几句含糊描述补全需求细节,被评价为真正好用的模型。
Claude Fable 5.1 现已在 Devin Desktop 和 Devin CLI 中可用。得益于缓存机制调整,Fable 级智能的成本降低了 54%,比 Opus 更便宜;Devin 的 Fusion harness 在 FrontierCode 上以低 47% 的成本达到与 Fable 5.1 相当的水平。
编码智能体正迎来爆发,原因很朴素:它们终于能在无人逐行盯守的情况下交付可运行的代码。这已不是自动补全,而是任务委派,前提是被委派的人或系统不必每次都听完整背景。
作者转述 Lingxi Li 分享的做法:把 grok bot 当作带自有电脑、可管理编码智能体的实习生,按 iOS、桌面、基础设施、Android、harness 等领域分工,专项 bot 表现更稳定。
Visual Studio 支持在 IDE 内直接查看和审查 GitHub PR:通过 Git → GitHub → View Pull Requests 打开列表,PR 按分配给我、仓库全部以及 Copilot 代为创建三类分组。
Philipp Schmid 指出,编程智能体正越来越多地放弃专用工具转而使用 bash,并已在 Bash 上达到超人水平。前沿模型如今能在数秒内写出复杂的一次性脚本,完成原子化 Python 多文件编辑、git worktree 操作和日志聚合。
演员、AI 创业者吴汉坤在播客中表示,AI 难以模拟喜剧等毫秒级节奏的表演,真人演员的微表情、情绪停顿和设计性「破绽」是 AI 无法精准调控的。他用 Kling 2.0 等工具独立完成《粉丝悖论》《人口异常》两部 AI 短片的全流程制作,并开发了智能体 Verdict AI,认为亲身实践是消解「被取代」焦虑的最好方式。
Z.ai 通过微调前代 GLM-5.2 推出旗舰模型 GLM-5.3,总参数 7530 亿、每 token 激活 400 亿,输入最多 100 万 token、输出最多 128,000 token,速度每秒 90 token。
以独立测试数据对比 GLM-5.3 与 Kimi K3、Claude Opus 5 等模型,并呈现开源权重网络安全争议中双方的实际依据。
Bolt 官方给出了一段重构提示词,让 Bolt 及其他编码智能体在不改变 App 行为的前提下逐步清理代码,同样的按钮、同样的行为,底层更整洁。提示词按一次一步的方式执行,以降低重构风险。
Google 在前次发布仅三周后推出 Gemini 3.7 Flash;SpaceXAI 发布 500K 上下文的 Grok 4.6,面向长时运行的智能体与编码场景。
得物技术两位司龄5年的校招生海狸(Hayley)和骅征(huazheng)分享了各自的成长经历。海狸在交易平台做后端开发,参与AI导购项目,经历了方案多次调整与反复试错;骅征在国际技术做后端开发,参与香港仓寄售、日本开仓、美国自建站等项目,并在国际火山云多云迁移中将RT涨幅控制在10-13毫秒,实现用户无感知的平稳迁移。
AI 博主宝玉在腾讯内部用自己做三年的字幕翻译 App 串起 AI 产品全流程:找需求看模型能力边界,同一提示词在模型具备检索能力后从无人问津到 Google CEO 致谢。他把成本优化做到调用从 33 次降至 12 次、单集处理从 31 分钟降至 18 分钟,并提出以终为始重设计、把 App 做成 Agent 插件的三条准则。
一则关于 2026 年编程现状的讨论指出,AI 让副业项目的产出量达到 100 倍,实际交付上线的却仍是 0 倍。该帖获得 602 个点赞、23 次转发,浏览量达 74187。
徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。
腾讯混元 Hy 4 preview 已在 OpenCode Go 上线,规格为 770B/49B、1M 上下文,面向编程智能体场景打造。
Andrew Ng 发布面向软件工程基础的 AI Engineering Skills 技能图谱,回应智能体编码(agentic coding)对这一领域的改变。该图谱以软件工程基础知识为切入点,配合其 X 平台长文一并发布。
吴恩达指出,缺乏扎实软件工程基本功的编程智能体常默认做出损害系统延迟、可靠性与成本的错误取舍。本期 The Batch 还覆盖 GLM-5.3 以开放权重带来高级网络安全能力、OpenAI、Google 与 Nvidia 提升实时交互吞吐,以及 DeepSeek-V4-Pro 随附开源 harness。
腾讯混元发布新一代模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,属 MoE 架构,相比上一代强化了多步骤 Agent、代码开发和生产力任务能力。
Qwen3.8-Flash 已在 OpenCode Go 上线,采用 125B/6B 参数配置,支持 1M 上下文窗口和多模态输入。该模型由 OpenCode 提供接入,面向编码场景使用。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。
腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
Claude 博文《How Warp builds self-improving agents on Claude》介绍了终端工具 Warp 的内部实践:让 Agent 做代码审查时,问题不在于能力而在于缺少项目规范和历史经验的记忆,手动改系统提示词、完善 AGENTS.md 效果都不理想。
Cursor 支持创建新的 Web 应用,代码可存储到 Origin,并部署到 Vercel。这条来自 Cursor 官方账号的消息显示三者已打通为一条从编写、托管到上线的流程,但未披露具体版本号或开放范围。
Qwen3.8-Flash 已在 OpenRouter 上线,一次 API 调用即可支持编程助手、智能体工作流和长视频理解。该模型为多模态推理模型,面向代码库与文档分析、桌面交互、图表和长视频等场景。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
Lex Fridman 发布与 DHH 的第二轮对谈,全长 5 小时,覆盖 AI 智能体编程、软件的未来形态、AI 对开源的影响、Omarchy Linux 发行版、vibe coding 与智能体工程之争、手动编程的终结、最适合 AI 编程的模型与工具链、AI 视频生成与电影制作,以及 Linux 将赢得桌面等话题。节目在 X 上完整放出,其他平台同步上线。
Anthropic 透露两项关于 Claude 的研究仍在进行:HIP Lab 正在研究 Claude 的行为与人们使用 AI 时感受之间的关系,METR 则在估算编程智能体带来的真实生产力增益。Anthropic 表示很快会分享这两项研究的更多内容。
Google AI Developers 发布 Gemini 3.5 Transcribe,一款号称能理解代码库的语音转文字模型。官方演示中,该模型可过滤口语中的犹豫停顿,并针对当前上下文精确还原技术术语、文件名和代码变量;它通过视觉偏置为复杂开发者工作流引入屏幕感知上下文,演示场景为在 Antigravity 中构建。
Visual Studio Debugger Agent 新增 Test-Driven Investigation 工作流,可自动创建或识别聚焦测试,并通过该测试调试、定位根因,最后重跑测试验证修复。该流程适用于异常、堆栈跟踪或“有时失败”等难以手动复现的 bug,需要已有的测试基础设施支持。用户仍可审阅或修改测试、引导调查并批准修复。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
vivo 互联网前端团队推出基于 Web 的 AI 游戏开发平台 vGame,用结构化场景描述加 AI Agent 取代手工编码,将广告小游戏开发效率提升一个数量级。平台技术选型为 Vue 3 + Vite、Koa + OpenCode SDK + Claude Agent,游戏运行时基于 Galacean Engine,并把游戏开发知识封装为 17 个 Agent Skill。