字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。
苹果发布会正逐渐失去“科技春晚”的光环:供应链爆料让新品提前曝光,2020 年后转为提前录制,智能手机进入成熟期后创新更多体现为性能与体验优化。与此同时注意力转向 AI 发布会,2024 年 5 月 OpenAI 发布 GPT-4o、DeepSeek R1 发布都引发大范围讨论。
据媒体报道,DeepSeek正进行最新一轮融资,规模至少800亿元,宁德时代和腾讯是领投方之一,具体出资额未披露;今年6月DeepSeek曾官宣约510亿元首轮融资,宁德时代体系出资约50亿元。
LangChain 的 Open SWE 把模型选择移入 harness,每个任务交给仍能完成工作的最便宜模型,并按质量进行测试,单任务中位成本下降 64%。开发者反馈 DeepSeek v4.1 Flash 作为编排器表现突出,可协调编码、测试、研究和子智能体,并在验证环节低成本复查代码改动,仅在更难的长尾场景才动用 Opus 或 Sol。
elvis 对后训练变得更易获取这一趋势表示乐观,认为新的后训练时代已经到来。他指出在智能体 RL 中,长上下文任务成本高、效率低且难以扩展,rollout 消耗了大部分 token,每一轮都要重新读取不断增长的上下文,包括工具输出、文件和此前的轮次。
10月9日,扩散智能DiffuSpace宣布已连续完成两轮融资,由经纬创投、顺为资本、君联资本联合领投,中科创星、华为哈勃、地平线等跟投,总金额达数亿元。DiffuSpace于2026年5月在深圳成立,团队研发的Dream 7B扩散语言模型部分能力可比肩DeepSeek V3(671B),目前正在训练新一代更大参数规模的模型并计划近期开源。
9月28日起,新韩银行等七家韩国金融机构遭渗透,6万多人信息外泄,韩国总统下令彻查。研究人员发现疑似攻击服务器运行开源工具 ARTEX(自主渗透测试控制台),主要接入 DeepSeek,其他会话还使用 GLM、Grok 和 Claude Code,服务器目录浏览未关,配置文件、CLAUDE.md 与 AI 聊天记录可被直接读取。
DeepSeek Harness 官方桌面端已上线,提供 Windows 和 macOS 两个版本,安装包分别接近 300 MB 和 370 MB,内置 Node.js、pnpm 和 Python 运行环境。
谷歌联合 20 多家研究机构、32 位作者发布 154 页综述,系统梳理大模型的分词(Token)机制,指出模型数不清 strawberry 里有几个 r、多位数算术出错,病根在文本进入模型前的分词环节。
腾讯正考虑发行最高50亿美元(约335亿元)离岸债券,最快本月启动,此前6月已发债筹资近47亿美元。其二季度资本开支达528亿元、同比增长176%,自由现金流为负138亿元,AI预付款主要用于混元、WorkBuddy、CodeBuddy、微信AI及腾讯云的算力采购。
据外媒报道,Anthropic 瞄准 11 月中旬上市,路演最快可能从 11 月 9 日当周启动;9 月曝光的招股书显示去年收入 45.9 亿美元、净亏损 420 亿美元,已承诺的算力和基础设施支出累计达 5180 亿美元。
联想天禧 AI 自研的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一,并通过官方 Verified 核验。TianxiCode 具备跨文件多跳检索、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大能力,未来将落地联想 AI 硬件产品。
9 月最后一周,DeepSeek 在 OpenRouter 上处理的 Token 数量超过 OpenAI、Google、Anthropic 和 xAI 四家之和。
9 月最后一周,DeepSeek 模型在 OpenRouter 上处理的 token 量超过了 OpenAI、Google、Anthropic 和 xAI 四家模型的总和。该数据由 Social Capital 披露。
字节Seed团队发现,DeepSeek-V4系列在长上下文检索中的表现会随信息位置按固定周期波动,波动周期与模型采用的KV Cache压缩步长一致。
Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
Anthropic 发布 Haiku 5.5,作者对比其与几款中国竞品的价格和测试评分:价格上比 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash 都便宜。在 Terminal Bench 4.0 上,作者称其分数比 GLM 5.3 flash 高一分,与另一竞品相同,比其他两个更高。
Anthropic 的 Haiku 5.5 定价专门针对中国竞品,价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash;在 Terminal Bench 4.0 上,AA 测试比 GLM 5.3 flash 高一分,也与其他两个竞品持平或更高。歸藏批评此举“恶心”,并质疑外界因降价而淡忘 Anthropic 过往行为。
一种"邪修"用法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,并把其他 Code plan 用不完的额度配置进去。之后让 Grok Bot 调用这些 token 来写代码、渲染视频,从而避免闲置额度被浪费。
歸藏(guizang.ai)分享了一种「邪修」用法:在 Agent 的云电脑里装上 Pi 或 DeepSeek Harness 这类编程 Agent,把其他 Code plan 用不完的额度配置进去,再让 Grok Bot 调用这些 token 写代码、渲染视频,从而不浪费闲置额度。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
Jev Router 最常用的 5 个模型中 4 个位于帕累托前沿,可操控性表现突出,但整体权衡不及直接调用 DeepSeek V4.1 Flash——后者以更低成本和延迟取得相近表现。该评测显示,同时平衡任务成功率、可操控性、成本与延迟仍是模型路由的未解难题。
Jev Router 的端到端请求延迟高于同类 Pareto 最优模型,中位数为 6.18 秒,DeepSeek V4.1 Flash(Max)为 3.64 秒。在 P90(最慢 10% 请求)上差距扩大,Jev Router 耗时 30.59 秒,DeepSeek 为 14.26 秒。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
CrowdStrike 报告称,2026 年 9 月下旬至 10 月初韩国多家金融机构遭针对性网络攻击,新韩银行约 2.5 万名客户信息受影响,KB 国民银行、韩亚银行等也有不同程度泄露。
CrowdStrike 报告披露的攻击链细节,可供安全从业者观察 AI Agent 被用于真实金融渗透的方式。
谢扬团队的 Eazo 将 Personal Agent 做成"图形界面 App 驱动"形态:用户描述需求,它直接生成带界面和数据的完整 App,背后由 Qoni 提供 Agent 身份、行动和长期记忆。Eazo 已在国内手机端和 PC 端可用且数据互通,内置多款 SOTA 模型可按任务切换,官方称测试中约 30 分钟即可生成一个较完整的 App。
中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。
开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
OpenAI宣布搭载智能界面(Intelligent UI)的GPT-6面向全球ChatGPT用户推出,Plus、Pro、Business和Enterprise用户先行,Free和Go用户次日起可用;其作答改为边想边答,联网搜索问题平均比上一代提前44%开始作答。
微软在时隔两年的首场线下活动中发布 Surface Laptop Ultra 与 5999 美元的 Surface RTX Spark Dev Box,并公布 Windows 11 的多项更新。
山行 AI 基于开源项目 Bibo 分析个人 AI 工作空间的架构取舍:日常对话与个人空间由 Cloudflare Workers、Durable Objects 承接,需要系统工具时再获取 Linux 沙箱,文件独立放在 R2 不随临时执行环境消失。
DeepLearning.AI 在 The Batch 本周刊中介绍了 DeepSeek 面向智能体记忆的技术拆解:智能体读取量大于写入量,因此 DeepSeek 压缩了它们所记住的内容。
Datawhale 十月组队学习开放报名,共 11 门课程,首次开设围绕 JEV Cookbook 的共学课程,讲解 Choice / Score / Noul 三种核心问题原语。课程覆盖 LLM 专题、Agent 专题、具身智能专题和 AI Infra 专题,其中 LLM 算法与系统教程按推理优化、性能优化、后训练优化三个方向分设。各学习时间重叠,每人限报 1 门,报名后需本周内扫码进群。
The Rundown AI 分享了一篇关于 DeepSeek 的报道链接,指向其 newsletter 页面 therundownai.beehiiv.com/p/the-deepseek。原文未提供更多具体内容。
Epoch AI 发布研究,梳理中国六家头部 AI 公司(阿里、字节、Z.ai、月之暗面、DeepSeek、MiniMax)的五类收入来源:面向消费者的 AI 应用、售卖模型访问、面向企业和政府的定制部署、授权费,以及用 AI 带动既有产品线。
Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。
一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。