跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

28条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1–20 条 · 共 28 条
10月9日周五
  1. Satya Nadella(@satyanadella)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Windows 引入本地智能体与 MAI-Code-1.1 Flash 编码模型

    微软宣布为 Windows 带来不计量使用的智能能力,让每台 PC 成为智能体可安全代劳的场所。亮点包括 137B 参数、256K 上下文窗口的编码模型 MAI-Code-1.1 Flash。

    为什么值得看

    微软把编码模型放到 PC 本地运行,并让 Copilot 在设备上接管工作,读者可据此判断端侧智能体的落地方式。

10月7日周三
  1. 新智元AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1 万亿参数 Mistral Large 4,权重月底开源

    Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。

    为什么值得看

    通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。

10月1日周四
  1. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

9月30日周三
  1. 有新NewinAI 评估 · 91/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 2026 开发者大会:个人 Agent Dots、GPT-6.1 Sol 等 20 多项更新登场

    OpenAI 在旧金山举行 DevDay 2026,一次性更新 20 多项产品和能力,核心是长期在线、拥有独立云端电脑的个人 Agent Dots,由 GPT-6 Astra 驱动,可连接超过 4000 款应用并进入 Slack、Teams 等工作流。

    为什么值得看

    这场发布会把长期在线 Agent、共享工作区与云端 Codex 串成一套工作流,可据此判断开发与协作方式的变化。

  2. AI寒武纪AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI DevDay 2026发布dots智能体、GPT-6.1 Sol与500美元Pro订阅

    OpenAI在DevDay 2026上发布20多项更新,推出可全天候自主接管工作的智能体dots,由旗舰模型GPT-6 Astra驱动,每个dot拥有独立云端计算机并连接用户授权应用,目前仅面向Pro、Business Premium和Enterprise用户开放。

    为什么值得看

    梳理了DevDay 2026二十多项更新,从主动智能体到订阅与市场,呈现OpenAI从模型到办公生态的完整布局。

  3. 赛博禅心AI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 年度 DevDay 实录:25 项发布逐一详解

    OpenAI 在旧金山举办第四届 DevDay,发布 Dots 与 ChatGPT Space 两款新产品:Dots 是一直在线的个人 agent,今天起向 Pro、Business Premium 开放,Specialist dots 面向企业预览并可接入微软 Agent 365。

    为什么值得看

    按主题逐条梳理了OpenAI DevDay的25项发布,读者可据此判断其产品矩阵与开发者平台的整体走向。

  4. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

9月29日周二
  1. 夕小瑶科技说AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,编程能力逼近 Opus 5.5

    Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。

    为什么值得看

    梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。

9月23日周三
  1. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  2. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。

  3. Mike Krieger(@mikeyk)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称其在编码和知识工作方面领先,写作表现也不错。该模型在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Anthropic 联合创始人 Mike Krieger 在 X 上邀请用户试用。

    为什么值得看

    Anthropic 联合创始人给出新模型的定位与成本比较,读者可据此判断编码与知识工作的性价比变化。

9月3日周四
  1. Google DeepMind BlogAI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,称前者在软件工程、智能体任务和多步推理上有明显提升,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    为什么值得看

    官方披露了两款新模型的基准表现、定价与访问渠道,可用于对比 Flash 系列在编码与网络安全能力上的迭代节奏。

9月1日周二
  1. DeeplearningAIAI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3,网络安全能力提升并推迟开源权重

    Z.ai 通过微调前代 GLM-5.2 推出旗舰模型 GLM-5.3,总参数 7530 亿、每 token 激活 400 亿,输入最多 100 万 token、输出最多 128,000 token,速度每秒 90 token。

    为什么值得看

    以独立测试数据对比 GLM-5.3 与 Kimi K3、Claude Opus 5 等模型,并呈现开源权重网络安全争议中双方的实际依据。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  2. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

8月15日周六
  1. Interconnects AI — Nathan LambertAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 发布:中国实验室如何跟上前沿

    Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。

    为什么值得看

    以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。

8月14日周五
  1. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

  2. Google AI(@GoogleAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,面向编码与智能体并推出半价优惠

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。

    为什么值得看

    Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。

7月31日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash 官方 API 开启公测,升级 Agent 能力并适配 Codex

    DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 进入公开测试,称其 Agent 能力大幅升级,基准分数已远超 V4-Pro-Preview。官方 V4-Flash 原生支持 Responses API 格式,并已完成与 Codex 的适配,配置细节见官方 API 文档 api-docs.deepseek.com。

    为什么值得看

    DeepSeek 官方公布 V4-Flash 公测 API 的 Agent 能力升级与 Codex 适配,可据此判断接入成本。

7月17日周五
  1. AI SDK(@aisdk)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Moonshot 发布 Kimi K3 模型,2.8 万亿参数、100 万上下文,将开放权重

    Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。

    为什么值得看

    Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。