跳到正文

#编码

今日 28 条
10月3日周六
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 上线 mods:有人做了个匹配等待中玩家的 MW2 多人对战 Mod

    Claude Code 上线 mods 功能后,开发者 Alex Christou 制作了一个 Mod,把等待 Claude 完成任务的用户匹配进同一个 MW2 Quick scoping 多人对战房间,对手全是同样在等 Claude 的人。

  2. meng shao(@shao__meng)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ling-3.1-Flash 实测:蚂蚁百灵 1M 上下文模型一把过 TE 风格信息卡

    蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。

  3. OpenAI Developers(@OpenAIDevs)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 预告新版 dot:学习工作习惯、跨应用保留上下文并协调 Codex 任务

    OpenAI Developers 预告新版 dot 功能:可学习用户的工作方式、跨应用保留上下文、协调 Codex 任务,并标记需要用户关注的事项。该帖未披露发布时间、可用范围或具体版本信息。

  4. Guillermo Rauch(@rauchg)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 将 Jev 引入 AI SDK for Python,实测边打字边区分 Python 与英语

    Vercel 将 Jev 加入 AI SDK for Python,并做了两个实验:在用户输入时区分 Python 代码与英语文本,以及一次一个决策地生成 Python 代码。官方博客称 Jev 现已可在 Python 版 AI SDK 中使用。

  5. Claude(@claudeai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 用诗歌配插画展示能力

    Claude Code 展示了用诗歌配插画的能力。该演示由 xgo.ing 提供技术支持,相关推文获得 362 个点赞、8 次转发和 35181 次浏览。

  6. Claude(@claudeai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 与一台摄像机在 Old Street 通宵运行

    Claude Code 与一台摄像机在 Old Street 被整夜开着运行。来源为 Claude 官方账号发布的推文,附带视频内容,原文未披露具体模型版本、任务细节或运行结果。

  7. Notion(@NotionHQ)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 接入 Opus 5.5:自动检索文档、会议记录与 Slack 消息生成案例研究

    有用户称 Notion 中的 Opus 5.5 表现强悍,让它撰写案例研究时,它会自动翻阅相关 Notion 文档、会议记录和 Slack 消息。随后它还会参照用户的写作规范与品牌风格,直接生成一份精炼草稿。

  8. lmarena.ai(@lmarena_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Code Arena 推出 WebDev 排行榜

    Code Arena 上线 WebDev 排行榜,可在 arena.ai/leaderboard/co… 查看。该榜单由 xgo.ing 提供支持。

  9. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 发布 SWE-chat v2:23 万条真实开发者与 AI 编程智能体交互数据集上线 HuggingFace

    Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。

10月2日周五
  1. 掘金本周最热AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前端转全栈笔记:讲 NestJS 框架前,先把 TypeScript 这一关过了

    这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。

  2. meng shao(@shao__meng)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 分享在 Agent Harness 内构建模型路由的四步方法

    LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。

  3. Vercel NewsAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI SDK for Python 发布,支持用 evaluate() 调用 Jev 分类模型

    Vercel 发布 AI SDK for Python,新增实验性 evaluate() API,可直接调用 Jev 模型。Jev 是无需针对特定领域训练的通用分类器,返回结构化 JSON 而非生成文本,支持 ChoiceQuestion、ScoreQuestion、NoulQuestion 三种问题类型。

  4. 爱范儿AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

    作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。

  5. Guillermo Rauch(@rauchg)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch 用 quine 让模型"反向讲解"自己写的 Svelte 代码

    Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。

  6. Cursor(@cursor_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 与 GLM 5.3 Flash 上线 Cursor

    Cursor 宣布 GLM 5.3 和 GLM 5.3 Flash 已在其平台上线,GLM 5.3 Max 在 CursorBench 4.0 上取得开源权重模型中的最高分。

  7. OpenAI Developers(@OpenAIDevs)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 支线任务加入 @modretro Chromatic,还剩 48 小时

    OpenAI Developers 在 DevDay 支线任务中添加了一台 @modretro Chromatic,参与时间还剩 48 小时。该活动包含 10 项开发者挑战,完成任意 5 项即可为每项获得 1 张抽奖券,奖品为 5 台 Codex Micro,全球均可参与。

  8. Latent.Space(@latentspacepod)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Thariq 谈 Claude Mods 解锁的能力

    Anthropic 的 Thariq 谈到 Claude Mods 解锁的能力,包括对话上下文、子智能体、结构化输出和 UI 控制。他表示 Mods 可以获取对话的轮数和已用 token 数,因为都在进程内运行,可以派生 subagents、解析结果并用结构化输出返回,还可以修改 UI,这是在 hooks 中无法做到的。

  9. bolt.new(@boltdotnew)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt.new 如何用 UTM 参数构建自适应落地页

    Bolt.new 官方演示了如何构建一个根据 UTM 参数自动调整内容的自适应落地页站点,让不同来源和行为的访客看到匹配的页面,而非统一投放到同一落地页。该方案通过识别 URL 中的 UTM 参数来动态改变站点呈现。

10月1日周四
  1. LangChain(@LangChainAI)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 OpenSWE Review 评测自有智能体:精度升至 81.5%、工具调用减少 29%

    LangChain 在两个自研智能体上测试 OpenSWE Review,其精度从 62.9% 提升至 81.5%,每次审查的工具调用减少 29%。基于 Kimi K3 微调的 Engine 在问题检出基准上超过了基座模型与 GPT-5.6 Sol。相关细节见 LangChain 博客。

  2. 谷歌开发者AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。

    为什么值得看

    官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。

  3. 逛逛GitHubAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Opus 5.5 写代码做视频的十支案例与开源项目

    用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。

  4. Varun Mohan(@_mohansolo)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Varun Mohan:Gemini 4 Argon 在 AA Coding Agent Index 上表现不错

    Varun Mohan 表示,Gemini 4 Argon 搭配 Antigravity harness 在 AA Coding Agent Index 上表现不错,并强调真实世界使用更重要,后续还有更多进展。他同时回复网友称竞争相当激烈。

  5. Sahil Lavingia(@shl)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Coding without AI is like cooking without salt

    Sahil Lavingia 用"做菜不放盐"比喻不用 AI 写代码,该帖获 625 点赞、134 条回复、31 次转发和 34955 次浏览。

  6. Varun Mohan(@_mohansolo)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 4 Argon 在 AA Coding Agent Index 表现亮眼

    Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。

  7. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

  8. Varun Mohan(@_mohansolo)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件任务上提供前沿性能,数千名 Google 员工已在 Antigravity 内部使用。该模型先向 Fairwind 计划中一批受信任的网络防御者开放,更广泛的可用性将尽快推出。Sundar Pichai 表示它在复杂工作流、网络防御和软件工程中展现前沿性能,团队在 Google 内部从编码到量子计算广泛使用。

  9. Fireworks AI(@FireworksAI_HQ)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 Flash 上线 Fireworks Serverless Training API,支持视觉与文本

    GLM 5.3 Flash 现已在 Fireworks AI 的 Serverless Training API 上开放训练,所有人可用,同时支持视觉与文本。该模型在智能体编程、文档分析和工具调用等基准测试中表现优异,且服务成本较低。

  10. Scott Wu(@ScottWu46)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition CEO 回应 Factory 指控:否认获取竞争对手机密信息

    Cognition CEO Scott Wu 公开回应 Factory CEO Matan Grinberg 的指控,否认 Cognition 通过虚假面试窃取 Factory 产品信息,并称 Chris Degnan 从未向团队分享过 Factory 的任何信息。

  11. eric zakariasson(@ericzakariasson)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ericzakariasson 发布 game-builder 技能:用新模型构建游戏

    开发者 ericzakariasson 分享了自己用来配合新模型构建游戏的技能,可通过 `npx skills add ericzakariasson/skills --skill game-builder` 安装使用。该推文获得 530 次点赞、42 条回复,浏览量超过 4.5 万。

  12. Cognition(@cognition_labs)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 任命 Chris Degnan 为首席营收官,携手 RPT 搭建 GTM 团队

    Cognition 宣布 Chris Degnan 出任首席营收官,负责全球扩张。Chris 是 Snowflake 首位销售员工,后升任其 CRO,任内推动 ARR 超过 $3B;Cognition 同时与 Chad Peets 及 RPT 团队合作搭建其 GTM 团队。Chris 表示,听到客户讲述 Devin 如何改变其业务后决定加入。

  13. Cognition(@cognition_labs)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 分享 Devin 客户案例:看他们如何落地

    Cognition 在推文中分享了一个 Devin 客户案例,指向 devin.ai/customers/cros 页面,邀请读者了解该客户的具体做法。原文未透露客户名称与具体成效数据。

  14. Cognition(@cognition_labs)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Crosby Legal 用 Devin 接手一线响应:12 名工程师支撑 50+ 律师

    Crosby Legal 让 Devin 负责一线响应,每天调查 20–40 个 bug 和告警,将 Sentry 噪音降低 50%。在法律团队规模扩大 5 倍的情况下,其 on-call 仍只需一名工程师,由 12 名工程师支撑 50+ 律师。

  15. Anthropic NewsAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Barclays 扩大与 Anthropic 合作,将 Claude 推广至全行

    Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,预计到 2026 年底 Claude Code 覆盖其 50% 开发者,2027 年覆盖多数软件工程师。

9月30日周三
  1. bolt.new(@boltdotnew)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 收到一个任务:用户点击"Complete order"时触发彩纸特效

    Bolt 被交给一个任务:当用户点击"Complete order"按钮时触发彩纸特效,让结账环节也像成交一样有庆祝感。这条演示通过视频展示效果,并引导用户前往 Twitter 查看。

  2. Stack Overflow BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow 开发者调查:AI 工具使用率从 2023 年 44% 升至 2025 年 79%

    Stack Overflow 回顾 2024 与 2025 开发者调查数据:AI 工具使用率从 2023 年的 44% 升至 2024 年 62%、2025 年 79%,近半数受访者每天使用。

  3. Viking(@vikingmute)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Viking 开源 content-gate:Codex + Gemini 的 AI 写 SEO 文章流程 skill

    Viking(@vikingmute)把用 AI 写 SEO 文章的流程做成了名为 content-gate 的 skill,基于 Google Search Central 官方文档与内容质量合规指南。

  4. Guillermo Rauch(@rauchg)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    fx v0.0.12 发布:会话列表提速最高 560×

    fx 发布 v0.0.12,会话列表速度最高提升 560×,大型会话存储可即时恢复。该版本还改进了 GitHub 风格 Markdown 渲染、scrollback、steering 与会话恢复,并提升 MCP 的可靠性与安全性,另含多项 bug 修复和体验优化。

  5. 沃垠AIAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qoder v0.4.0 把上下文从个人电脑搬进团队

    阿里云栖大会分论坛上,Qoder 技术负责人谢吉宝披露 Qoder 上线一年超过 80% 的用户已不再亲自写代码,非编程任务占比超 50%。9 月 23 日发布的 Qoder v0.4.0 新增项目、讨论、自定义 Agent 与 Agent Team 四项能力,把项目目标、任务状态和讨论结论统一留存,Agent 协作可跑在当前设备或 Qoder Cloud Agents 上,目前面向企业订阅开放。

  6. 智东西AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat-2.5-Preview 上线,万亿参数模型实测复刻 Muse 前端

    美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。

  7. 夕小瑶科技说AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash-Preview:四个真实任务与 DeepSeek、GLM 对比

    MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。