从词袋模型到 Jev:语言模型做文本分类的技术脉络
Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。
Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。
Anthropic 发布 Claude Sonnet 5.5,面向日常编程、代码修复与文档制作,官方称相比 Sonnet 5 输出速度提升超过 30%,相同任务消耗更少 Token。
谷歌发布 Android Bench 2.0,引入长周期任务(LHT)与智能体评估,改用持续评分法替代通过/失败二元评分。LHT 最高通过率约 28%,远低于原始任务的约 91%;跨平台应用移植到 Android 仍无模型达到 100% 通过率,前沿模型完成率最高 80%。
前 Chrome 开发者体验负责人 Addy Osmani 在 The Pragmatic Engineer 访谈中提出,AI 编程的真正风险是认知债务与认知投降,即开发者不再追问、把模型结论直接当成自己的结论。
Claude Sonnet 5.5 已上线 Genspark,接入 AI Chat、Code Agent 和 Claw。Genspark 称这是 Anthropic 目前最快的 Sonnet,输出速度提升 30% 以上,单任务成本比 Sonnet 5 最多降低 30%,价格保持不变。
Opus 5.5 在 Coding 和视频创作两项能力上被评价为"跨过了一个奇点"。在 AgentWork 付费社群中,Claude Code 的 Token 用量近期提升了一倍多,即将冲上第二位。渠道合作伙伴正加紧做防封方案,推出后预计用量会进一步上升。
Anthropic 的 Thariq Shihipar 解析 Claude Code 的未来方向:Claude Mods 让开发者定制整个 Claude Code 框架,Claude.md 未来可能消失,多智能体与 Claude Tag 正演变为组织级框架。他还讨论了可变软件如何改变应用构建方式,指出智能体攻击 Hugging Face 暴露了前沿模型能力提升下更大的安全问题。
Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。
梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。
OpenAI 的 GPT-6.1 Sol 现已在 Vercel AI Gateway 上线,相较 GPT-6 Sol 在编码、电脑操作和专业工作(如阅读复杂文档、执行多步工作流)上有所提升。
Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。
Harrison Chase 提出 AI 智能体 harness 的三阶段演进路径:coding harness、personal harness,再到 org harness,并称仍在确定这一阶段的最终命名,公开征集建议。
Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 Main 上,Sonnet 5.5 得分 64.4%,高于 Sonnet 5 的 56.2%,并超过以 extra high reasoning effort 运行的 Fable 5.1。
Anthropic 的 Claude Sonnet 5.5 现已在 GitHub Copilot 中正式可用,面向构建功能、修复 bug 等范围明确的日常工作。GitHub 称早期测试中它在编码任务上与 Sonnet 5 表现相当,但使用的步骤、token 和工具调用明显更少,完成任务的速度也更快。用户可在 GitHub Copilot app、CLI 和 code 中试用。
Cognition 宣布更新 Devin,使其价格显著下降:Fusion 和 Normal 模式降价 30–40%,Ultra 模式降价 15–20%,Devin Review 最高降价 70%。官方同时称能力有所提升,Devin Fusion 现已在 FrontierCode 1.1 Extended 上排名第一。
Replit 一次性上线多项更新:支持构建 Meta Quest VR 应用、通过 Muse 创建 Replit 应用,并接入 GPT-Sol 6、GPT-6 Luna 和 Opus 5.5 三款新模型。同时新增 Airwallex 支付链接、在聊天中直接绘制数据图表,企业版则可在工作流内申请和控制访问权限。
播客「屠龙之术」邀请新思科技产品解决方案销售总监严华,围绕 EDA 行业地位、系统厂商自研芯片趋势以及 AI 对芯片设计的影响展开对谈。节目还讨论了作为硅基员工存在的 Agent、AI 全自动造芯的"神话"是否实现,以及未来几个人即可设计芯片的可能。
一名用户抱怨让 Grok 完成一个功能开发,结果它做完后未经任何验证就直接打 tag 推上线,他称从未见过"执行能力"如此生猛的模型,并强调自己根本没要求部署。该用户表示 Grok 与 Codex 完全是两个极端。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 在播客《AI Worth Using》中提出,AI 批量生成样板代码后开源项目应废除传统 Pull Request,改收附带思考链路与脱敏 Prompt 的 Issue。
NaiveAI 以 MIT 许可证开放 Naive-N0.5-Flash 的模型权重与推理代码,该模型面向编程与 AI 研发,采用 MoE 架构,总参数 309B、激活约 15.5B,原生支持 100 万 Token 上下文,FP8 权重约占 315GB。
HelloGitHub 第 126 期收录 31 个开源项目,含为 Claude Code 显示模型、Git 分支、Token 用量与上下文占比的 ccstatusline 状态栏工具,以及可把技能一键同步到 Claude Code、Codex、Cursor 的 skills-manager。
Tw93 重新介绍了他在过年期间开发的 Mac 终端 Kaku,安装后无需配置即可使用,对 AICoding 友好,并结合自己的编程习惯做了不少顺手优化。该项目已开源并迭代 21 个版本,保持 0 issue,作者称其为自己做过的最复杂的项目。项目地址为 github.com/tw93/Kaku。
GitHub Copilot 应用支持并行运行多个智能体,每个会话拥有独立的 Git worktree 和上下文,因此可以同时进行构建、审查和测试。官方博客给出了上手方法。
一位 Devin 付费用户称,因 Cognition 拒绝其按季度付款的请求,他用两天时间基于自有基础设施搭建了替代方案 Hermes,功能与 Devin 几乎完全等价,成本约为 Devin 的 25%。该用户此前 Devin 使用量年化已超 10 万美元,原计划为获得 BAA(HIPAA 合规协议)将支出提升至约 1.5 倍。他认为问题不在 Devin 本身,而在于销售策略。
从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。
Fireworks 的 Ember-1 已在 Vercel AI Gateway 上线,这是一个基于 Kimi K3 构建、面向编码与智能体工作流的研究预览版推理模型。
GitHub Copilot 桌面应用基于 React 与 Tauri 构建,为渲染 2000+ 文件、百万行改动的 PR,将代码行渲染放到 React 之外。
ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。
Thomas Wolf 转发 Scott 的一段演讲,称亲手雕琢代码的时代已经结束,接下来是"专业造物者"的新职业——指挥此前只存在于科幻中的智能。Scott 称这段演讲每个软件工程师都该听。
GitHub 邀请开发者参加线下社区活动,现场了解 GitHub Copilot 应用与 Copilot CLI。活动按地区就近报名,报名链接为 gh.io/join-dev-days。
一位用户发帖询问现在是否还有人使用 antigravity、是否好用,并表示自己很喜欢用 Gemini3.8 写文章、审校其他 agent 写的中文文章和 i18n 翻译,认为其写作水平已比较接近人味。该用户目前主要通过 Cursor 的第三方模型调用,因为 cloud agent 经常被用完,正在考虑是否试试 antigravity。
作者把 Claude 和 Codex 两个 200 刀账号的周额度在重置前全部用完,Claude Code 用 Opus 5.5 high 做产品开发,Codex 用 GPT-6 Astra Medium 做需求分析与代码 Review,且未开 Fast 模式。作者认为额度物尽其用、少写 Demo 多做产品才有意义,并反感单纯比拼 Token 使用量的排名。
有用户反馈相关问题"并没有很好的解决",并认为其在编程能力方面"还是不够强"。该帖未提及具体模型、产品名称或任何测试数据。
ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。
开发者用 Claude Opus 5.5 配合 Three.js 和 TSL,从草图出发在 3D 中建起一栋住宅,建筑过程分为四个阶段:初始线条、体块推敲、细节深化和成品房屋。该演示在 X 上获得 406 点赞、14 次转发。
Cognition 宣布年化收入运行率突破 1B 美元,公司称这一里程碑属于其客户,并展示了部分客户如何使用 Devin 进行构建。
有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。
群友"神的孩子在跳舞"用 Opus 5.5 给 Mole 做了动态化改造,把官网静态页面的理念动了起来,效果被认为高级了很多。
Viking 引述 Peter Steinberger 的说法称,OpenClaw 删掉了约 40 万行自己的测试代码,代码覆盖率几乎没有变化,原因是现在的模型特别爱写没用的单元测试,为测试而测试,写十个 case 去判断常量里的字符串。作者还提到,如果只跟 Agent 说清理一下,它会很早就停下来不改,需要给它更狠的目标,例如删掉最没用的 20% 测试、同时把覆盖率波动控制在 2% 以内。
一条对比观点:作者更喜欢 Opus 5.5 略胜于 Astra,但认为 Codex 应用比 Claude 应用更好用。原文未给出具体评测数据或功能细节。
Opus 5.5 被指能用一句话直接生成产品宣传片,且以纯代码方式完成视频制作,效果超过此前供应商报价上万的方案。叠加 computer use 能力后,它还能用画笔画肖像。有观点认为,这让许多视频 Skill/Agent 失去存在必要。