DSCode 桌面版发布,基于 DeepSeek 的桌面 Agent 以 MIT 协议开源
作者发布 DSCode 桌面版,这是基于 DeepSeek 的桌面 Agent,用 Pi 实现的极简 Harness,适配 DeepSeek V4 Pro / Flash 模型,主打便宜、极速、稳定且完全免费,MIT 协议开源,可通过 dscode.ai 体验。
作者发布 DSCode 桌面版,这是基于 DeepSeek 的桌面 Agent,用 Pi 实现的极简 Harness,适配 DeepSeek V4 Pro / Flash 模型,主打便宜、极速、稳定且完全免费,MIT 协议开源,可通过 dscode.ai 体验。
美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。
播客节目讨论 DeepSeek V4 Flash 把价格打下十倍,在硅谷划出一道“斩杀线”,并称 Google DeepMind 爆发高层大地震,哈萨比斯退居二线、Jeff Dean 离职。节目还谈到中间层模型面临的淘汰压力、Google 的路线之争,以及谁会成为下一个“美国版 DeepSeek”。
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。
新发布的 DeepSeek 被评价为史上最重要的 AI 发布之一:模型能力足以构建几乎任何东西,而成本几乎可以忽略。此前预算一直是许多人和项目的最大障碍,如今这一障碍已消失。
Thinking Machines 发布首个模型 Inkling,975B-A41B 多模态 MoE,可输入文本、图像和音频,并同步推出 276B-A12B 小版本。
idoubi 开源了为 DeepSeek 深度优化的 Coding Agent DSCode,主打快、省、稳、开放、安全。
DeepSeek 发布 DeepSeek-V4-Flash-0731,其模型架构和规模与预览版完全相同。本次升级仅适用于 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 以及 App 和 Web 端模型暂未变动。官方称 DeepSeek-V4-Pro 的正式发布即将到来。
DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 进入公开测试,称其 Agent 能力大幅升级,基准分数已远超 V4-Pro-Preview。官方 V4-Flash 原生支持 Responses API 格式,并已完成与 Codex 的适配,配置细节见官方 API 文档 api-docs.deepseek.com。
DeepSeek 官方公布 V4-Flash 公测 API 的 Agent 能力升级与 Codex 适配,可据此判断接入成本。
DeepSeek 梁文锋一场闭门讲话被解读出理想主义背后的成本账:硬件约 10 个月回本、API 按成本 6 倍定价,融资的钱继续买卡,“反正开了你也做不了”被视为真正的成本壁垒。讲话还涉及用 TileLang 重构底层算子绕开英伟达生态,以及 Claude 加一两个工程师就完成 AMD 硬件适配原型。开源被形容为试吃,护城河藏在工程化与上下文里。
Malte Ubl 在私密网络安全基准上测试 Kimi K3,认为它是网络安全任务的性价比之选,召回率、精度与价格平衡最好,GPT 5.6 召回率与精度最高但单次运行成本高出 7 倍多。
黄仁勋在专访中称 AI 是一场长达十年的范式转移,未来十年半导体产业规模需扩大到目前的 5 到 10 倍,并强调开源模型是科学进步与网络安全的基石。他表示英伟达中国销售额约为零,已告知投资者不要期待任何来自中国市场的收入,同时认为 DeepSeek、Kimi 引发的市场震荡是对开源模型影响力的误读。
播客对谈百度智能云 AI 计算首席科学家王雁鹏,讨论从模型时代到 Agent 时代的底层技术演变。他认为这一代 AI Infra 与上一代不同,是以 GPU 为核心构建,需要以 CPU 消耗窥见 Agent 诞生的真实价值,并梳理 Anthropic、OpenAI、Google 的路线差异以及国内多芯适配与开源生态的两大差异。
针对"通用 Agent 会吃掉垂直 Agent"等三个判断,作者补充了自己的六点看法:通用 Agent 赛道也会少数赢家通吃,小通用 Agent 同样没有生存空间。
Airwallex 空中云汇首席营收官吴恺在播客中回顾公司 11 年从 0 到 110 亿美金估值的关键抉择,并称 ARR 约 13 亿美金、年增速约 74%,下一步目标是 100 万客户与 1000 亿美金估值。
Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。
Last Week in AI 播客第 248 期讨论上周 AI 大新闻,涵盖 Anthropic 发布 Claude Fable 5、Apple 在 WWDC 宣布 Siri AI、OpenAI 秘密提交 IPO 申请,以及 Google 向 SpaceX 每月支付约 9.2 亿美元购买 GPU。
腾讯混元发布 Hunyuan Research Agent 的首个版本 Hyra-1.0,面向性能驱动的研究与工程任务,通过递归方式改进解决方案。官方展示了 AI4AI、AI4Science 和 AI4Fu 方向的 demo,并给出 hy.tencent.com/research/hyra 链接。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
英国 AI 安全研究院(AISI)分析显示,开放权重模型与闭源前沿模型的网络安全能力差距正在收窄:GLM-5.2 与 DeepSeek V4-Pro 大致相当于此前 4 到 7 个月发布的闭源模型,窄于 2025 年多数时间测得的 6 到 10 个月。
GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。
Dify Marketplace 新增 Qubrid AI 插件,用一个 API Key 即可访问 DeepSeek、Kimi、Qwen、MiniMax、GLM 等模型,无需再为每个模型分别管理密钥。用户可在工作流内直接切换模型,不必重新集成,减少了此前在 Dify 上构建应用时频繁切换模型和 API Key 的麻烦。
爆料者 leo 称 GPT-5.6 将是 5.x 系列最后一个模型,OpenAI 决定直接推 GPT-6,并在一个月内(甚至 7 月底)发布。
GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。
Epoch AI 抓取 DeepSeek、MiniMax、Moonshot、Z.ai、字节跳动和阿里六家中国 AI 公司的 1600 多份招聘信息,发现其推理仍依赖 Nvidia CUDA 与 TensorRT-LLM,同时探索昇腾、寒武纪等国产芯片,Z.ai 称今年初已用国产芯片端到端训练出 160 亿参数的 GLM-Image。
Nathan Lambert 认为智谱 GLM-5.2 是首个在编码 harness 中作为通用智能体真正好用的开放权重模型,其热度在社区中只有 DeepSeek R1 发布时有类似规模。
作者亲自用 GLM-5.2 在 Claude Code 中跑通工作流,并给出与 DeepSeek R1 时刻的对照,可看开源模型替代前沿闭源的具体进度。
Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。
DeepSeek 正以极致压缩 KV 缓存换取硬件自主:据测算,1.6T 参数的 DeepSeek V4 在 100 万上下文、8-bit KV 精度下只需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
DeepSeek 官方宣布将 DeepSeek-V4-Pro 的折扣永久化。此前该优惠原定延长至 2026 年 5 月 31 日 15:59 UTC,现改为长期有效,官方同时鼓励开发者继续基于该模型构建应用。
Sebastian Raschka 梳理近期开源权重模型的架构改动,指出长上下文效率成为设计重心。文章拆解 Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的 mHC 与 CSA/HCA 压缩注意力。
Last Week in AI 第 340 期聚焦 OpenAI 与 Musk 诉讼首周进展,以及 OpenAI 化解 Microsoft 因 500 亿美元 Amazon 交易面临的法律风险。DeepSeek 预览新模型 v4,称其"缩小了与前沿模型的差距",本期还提及 Vision Banana。
DeepSeek 宣布 DeepSeek-V4-Pro API 折扣延长至 2026 年 5 月 31 日 15:59(UTC),原定截止时间为 2026 年 5 月 5 日 15:59(UTC),折扣为 75% OFF。
DeepSeek 宣布全线 DeepSeek API 的输入缓存命中价格即刻降至原价的 1/10。官方同时提醒,DeepSeek-V4-Pro 的 75% OFF 促销仍在进行,将持续到 2026 年 5 月 5 日 15:59(UTC)。
DeepSeek 宣布 DeepSeek-V4-Pro API 在 2026 年 5 月 5 日 15:59(UTC)前享受 75% 折扣。
DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。
DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。
DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。
DeepSeek 提醒,涉及 DeepSeek 的消息请仅以其官方账号为准,其他渠道的言论不代表其观点。DeepSeek 表示将继续秉持长期主义,稳步迈向 AGI 的最终目标。
DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。
DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。
DeepSeek 公布其模型的结构创新与超高上下文效率,其中包括新的注意力机制,采用 Token 级压缩与 DSA(DeepSeek Sparse Attention),官方称在长上下文下大幅降低计算与内存开销。同时 1M 上下文已成为所有 DeepSeek 官方服务的默认配置。
DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。
官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。