JetBrains 发布 Mellum2.1:面向编码智能体的快速开源模型
JetBrains 发布开源模型 Mellum2.1,这是 6 月开源的 12B MoE 模型的新版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可,改进集中在预训练之后的强化学习阶段。
JetBrains 发布开源模型 Mellum2.1,这是 6 月开源的 12B MoE 模型的新版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可,改进集中在预训练之后的强化学习阶段。
AI 编码工具能让代码交付效率提升 25%-35%,但代价会在 1-3 个月后集中爆发:Faros AI 数据显示规模化使用 AI 编码的团队代码审核时长平均增加 91%,安全漏洞数量达传统开发的 3 倍,开发者 42% 的工作时间用于修复漏洞和清理技术债务。文章提出 AI 代码审查作为补齐验证环节的核心抓手,并给出以 50 人团队每月节省 800 工时为例的 ROI 测算方法。
张佳宣布《AI产品经理转型特训营-2026版》课纲开始更新,共14大模块、76章节、330+知识点、24小时课程时长,计划每周更新一轮、争取2个月内更完全部内容。新版融合2025版技能特训课、项目实训课、线下课、AI编程课与智能体课程内容,增加Agent、Skill的篇幅和颗粒度,并重构教学方式以适应零散时间学习。更新期间报名按2025版早鸟价2999元,更新完成后涨价至3999元。
阿里开源了内部使用两年的 AI 代码审查工具 Open Code Review,可识别逻辑错误、安全漏洞和性能问题并定位到具体代码位置,官方安装命令为 npm install -g @alibaba-group/open-code-review。
Kent Beck 在 Prodacity 大会演讲中称,自己写的三本编程手艺书如今"基本可以扔进垃圾桶"。他批评大模型是"神灯里的精灵":几秒吐出成千上万行语法正确、看似合情合理的代码,却往往无法真正跑通,只会以极低资本开销制造出不可维护的"屎山"。他主张工程师在 AI 交差后踩死刹车,于特性间隙重构,并以"未来期权"视角权衡特性产出与系统可修改性。
作者整理了一套面向 Codex 的提问模板卡,覆盖修 Bug、加改功能、优化代码、改已有功能、还原设计稿、修启动构建问题和对接接口 7 个场景。每个模板给出可直接复制替换的提示词,明确任务边界、处理要求与完成即停止等约束,并说明同一需求涉及多项工作时可使用通用组合模板。
开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。
Claude Code 团队公开向用户征集改进意见,邀请用户提出希望 Claude Code 改进的方向。该帖获得 39 条回复、57 次点赞和 7612 次浏览。
文章《You're Already a Meat Proxy》引发讨论,作者认为人类工程师的真正价值在于高阶品味与判断力,而非亲自敲代码。文中给出两条路径:想要薪水与生活平衡的人可用 AI 高效完成本职工作,想获得职业主导权的人则应放下亲自编码的执念,把 AI 当作杠杆去解决真正重要的现实问题,该观点让不少对着一堆 agent 打回车的开发者感到释然。
Eazo 是一个把一句模糊需求生成完整可用应用的 Coding Agent,支持一句话生成前端、后端、数据库、登录系统和全球收款,底层由 OpenAI、Claude 加自研模型混合编排。
Epoch AI 用 11 项自身真实工作任务测试六款模型,Claude Fable 5.1 与 GPT-6 Astra 总得分最高并领先多数任务类别,但仍无法实现工作全自动化。开源权重模型落后更多,连定义明确的任务也难以稳定完成。模型难以掌握 Epoch 的隐式规范,能提出研究方向却缺乏判断力,且常把有缺陷的结果当作关键发现。
阶跃星辰旗舰模型 Step 5 Preview 已在 Vercel AI Gateway 上线,模型名为 stepfun/step-5-preview,面向智能体编码、专业知识和金融分析场景。
Claude Haiku 5.5 已在 Devin 上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,且每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,搭配 Opus 5.5 作为 Lead 在 Devin Desktop 和 CLI 中使用。
Cognition 上线 Devin 桌面客户端,提供下载入口 devin.ai/download。该推文未披露桌面版的具体功能、支持平台或价格信息。
Claude Haiku 5.5 已在 Devin 中上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,而每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,并可与 Opus 5.5 搭配,在 Devin Desktop 和 CLI 中以 Lead 角色使用。
Anthropic 的 Claude Haiku 5.5 现已在 GitHub Copilot 中正式可用,这是一款面向子智能体、快速编辑和终端任务等高频工作的轻量模型。GitHub 早期测试显示,它在多项编码任务上追平 Claude Sonnet 5,同时消耗的 token 和步骤显著更少。用户可在 GitHub Copilot app、CLI 或 code 中试用。
Claude Haiku 5.5 在编码、computer use 和知识工作方面相比 Haiku 4.5 有显著提升,同时速度更快、价格便宜 75%。作者提到 Haiku 4.5 发布于 2025 年 10 月 15 日,两代间隔不到一年。
独立研究机构 Coleman Parkes 受 Undo 委托调研 300 位负责关键任务软件的资深工程负责人,多数使用 C/C++,发现 AI 编码智能体虽加快了代码生成,却把主要瓶颈转移到调试、代码理解和维护。
GitHub 披露,如今每 3 个 PR 就有 1 个涉及 AI 智能体,一年前这一比例不足 1/10。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
IntelliJ IDEA 2026.3 EAP 升级命令补全功能,在编辑器中输入 `..` 即可按当前代码与光标位置调出可用操作。新版支持直接为表达式或代码块添加 Logpoints、用同一入口触发 AI 解释代码、生成文档和重构,并会将上下文(文件、语言、行号、选中表达式)传给 AI 智能体。
LMArena 推出 Code Arena WebDev 排行榜,可通过 arena.ai/leaderboard/co… 查看。原文未披露上榜模型、分数及评测方法等细节。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 对谈,主张 AI 批量生成样板代码的时代应废掉传统 Pull Request,转向附带思考链路与脱敏 Prompt 的「Prompt Request」。
OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。
MIT 公开课 6.S950「Agency with AI」第 4 讲已更新,主题为 The Abstraction Ladder (of Programming),分梯子本身、何时以及为何向下一层看、AI agent 改变了什么、守住命令行四部分。
OpenAI 疯狂 28 天计划进入 Day 2,Codex 只发了些小更新,但额度大概率会迎来重置。
Linear 工程负责人 tommoor 将在 AI Engineer New York 分享"Your Coding Agent Has a Context Problem",探讨编程智能体有了代码之后是否具备足够上下文。活动时间为 Oct 14,需购票参加。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
Cursor 发布 iOS App,用户下载后可将其与自己的电脑配对使用。企业版用户需请管理员开启该功能,更多信息见官方更新日志。
OpenAI 为 Codex 加入语音输入,用户可直接与 Codex 对话,不必全程使用键盘。一位用户表示自己过去整天守在桌前,如今在阳光房里用语音就能发送演示文稿。
Lauren Tan(Poteto,pstack 创作者)在 SpaceX AI 的工作中,把 Agent 提交代码做成了日常流程,实现每月数千个 PR 上到生产环境。
GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。
Grok 能把截图直接写成 Tailwind 组件,再将渲染结果截图并与原图轮廓叠加后回传给 Grok,让它修正对不齐的地方。这一流程在本次运行中把还原度从 60% 提升到 77%,代码已开源于 github.com/xai-org/xai-co。
有人向 cookbook 新增了五款应用,全部基于新的 SpaceXAI TypeScript SDK 构建。这五款应用分别实现:premise 转短片、图片转视频广告、截图转 React 组件、𝕏 帖子转情绪看板、链接转播客,demo 与代码均已放出。
GPT-6 Astra 在 Lilypond Bach Benchmark 上取得迄今最佳结果,其四声部众赞歌没有声部进行错误,和声语汇复杂到包含那不勒斯六和弦,并且是首个在该 benchmark 上写出经过音的模型。测试使用 Extra High effort,提示词要求在 LilyPond 2.24 中按巴赫风格写 G 小调 3/4 拍四声部众赞歌并只返回代码块。
Stack Overflow 2026 年度开发者调查显示,AI 编程助手每日使用率呈压倒性态势,但开发者对其信任问题仍存。结构良好的文档被视为提供可验证上下文、缓解模型幻觉的关键,同时开发者正从主动社区发帖转向被动知识消费。
向阳乔木开发了一款 Obsidian 插件 qiaomu-ui-learn,用于学习网页和手机组件以提升 Vibe Coding 审美,让描述更精准,并支持一键复制 Prompt 生成类似网站,还准备了测试题。插件即将提交官方审核,明天可在 Obsidian 官方插件库搜索 qiaomu 找到。
JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。
IntelliJ IDEA 基于 LSP 的 Java and Kotlin 扩展已进入 Release Candidate 阶段,稳定 1.0 版即将发布。