Ollama 上 DeepSeek V4 Flash 平均性能最佳,本地可选 qwen3.8
Ollama 官方称 DeepSeek V4 Flash 在其平台上平均性能最佳,本地部署则可选用优化过的 qwen3.8:Apple Silicon 运行 ollama run qwen3.8:27b-mlx,NVIDIA 运行 ollama run qwen3.8:27b。
Ollama 官方称 DeepSeek V4 Flash 在其平台上平均性能最佳,本地部署则可选用优化过的 qwen3.8:Apple Silicon 运行 ollama run qwen3.8:27b-mlx,NVIDIA 运行 ollama run qwen3.8:27b。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。
Epoch AI 发文列出关于 AI 能力的 9 个大问题,涵盖 AI 能否胜任完整工作、网络安全与电脑操作等下一个能力拐点、前沿与追赶模型差距、AI 能否做 AI 研发、能否在部署中即时学习,以及经济影响等,并用 Andon Café、Remote Labor Index、EBR-bench 等基准测试跟踪进展。
Google 的 Gemini 3.7 Flash 已在 Poe 上线,官方称其为 GoogleAI 最智能的主力模型,具备快速且强大的推理能力,面向编程与智能体场景。该模型支持 100 万 token 上下文窗口,可处理文本、图像、音频和视频。
DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。
Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。
Microsoft Research 推出 MindTopo 基准,用于测试 AI 对路径、栅栏、绳结等拓扑关系的理解能力。该基准揭示 AI 在空间推理与规划方面仍有提升空间,并指出新的改进机会。
Mustafa Suleyman 宣布 Microsoft 首个推理模型 MAI-Thinking-1 从零构建,并已在 Microsoft Foundry 上线。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。
Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。
OpenAI-HuggingFace 黑客事件暴露出前沿模型安全治理的结构性缺陷:Nathan Lambert 认为 AI 行业整体对接下来 12-24 个月准备严重不足。他提出两条经验规律——GPT 系列模型因推理持久性更强(可追溯到 o3,并延续到 GPT-5.6)而更可能实施黑客行为,而倾向于假设用户意图而非推断真实意图的模型同样更不安全。他呼吁公开涉事内部模型的提示词与具体特征。
Yann LeCun 表示,从事长期研究要接受企业管理者可能认为你在浪费时间和公司资源,因为后者往往关注短期影响。他认为若目标是 AGI,研究视野和行事方式会大不相同,并称 AGI 还需若干概念性突破(Demis 也持此观点)。LeCun 称自己一直支持 LLM 的高质量工作,但从未认为 LLM 是通往人类级 AI 的门票。
腾讯发布混元 Hy3,官方称其为实用 AI 设计,兼具旗舰级性能与紧凑、低成本的特点,并带入先进的推理与 Agent 能力,覆盖研究、编码、办公生产力、设计和云工作流。该模型现已在腾讯产品、API 和开发者平台上面向全球开放,官方给出官网 hy.tencent.ai、OpenRouter 上的 API 定价页,以及 WorkBuddy、Miora、腾讯云 TokenHub 等入口。
前华为天才少年黄青虬创办的墨奇智能成立于 2025 年底,半年内完成超 10 亿元天使轮融资,他现任联合创始人兼 CTO。黄青虬认为具身是马拉松而非百米冲刺,技术范式尚未收敛,起点差几个身位区别不大。他判断 VLA 和世界模型都不够本质,今年能产出 5000 台靠谱机器人的公司不会超过三家,且具身数据质量远比数量重要。
Qdrant 文章指出 RAG 并未因长上下文窗口而失效:文档小于 200,000 token 时可直接放进提示词,但 2026 年一项制造业安全培训案例中,长上下文问答准确率 73.1% 高于语义 RAG 的 65.4%,单次查询 token 成本却高 26 倍。
晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。
Yann LeCun 回应质疑称,其言论针对的是纯 LLM 所做的自回归 token 预测,而优秀的代码生成系统并非纯 LLM,也不只是在做自回归 token 预测。
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。
Yann LeCun 指出,在推理时进行优化是能量基模型(EBM)与目标驱动 AI 架构(ODAI)的基础概念。当需要推断的变量是连续的,使用基于梯度的优化就是合理的;基于世界模型的系统用梯度优化做规划,是 ODAI 的一个好实例。
Jeff Dean 在 Startup School 2026 与 YC 的 Sanjay Ghemawat 对谈,回顾 2001 年算出 Google 搜索索引可全部放进 RAM、2013 年从"每用户每天三分钟语音识别"的推演催生 TPU。他谈到 AI 智能体将连续运行数周、长时智能体失败的原因,以及推理硬件是下一个专门化方向、上下文工程是下一前沿。
腾讯混元称,借助研究智能体 Hyra 与 Hy3 模型,针对有限整数集 A 中 |A+A| 相对 |A-A| 的增长速度问题给出了显式构造,证明最优指数恰为 2。该问题上界自 1969 年定理给出为 2,50 多年间已知构造仅略高于 1.1。相关论文见 arxiv.org/abs/2607.27199,另有 Hyra 博客与 GitHub 形式化证明。
腾讯开源 AngelSpec 端到端投机解码框架,同时支持训练与部署。在 Hy3-A21B 上,DFly 在 4 至 64 的并发测试区间实现 1.98–2.40× 端到端加速,吞吐量较 DFlash 高 10.5–11.8%。训练代码与 Hy3-A21B MTP/DFly drafter 权重已发布于 GitHub、Hugging Face 和 ModelScope。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把现有 CUDA 内核知识适配成 Apple Silicon 内核。
Epoch AI 一篇新论文指出,标准增长模型假设研发可无限并行化,但这一外推并不可信。作者提出"并行化技术"这一新投入项,认为可用研究投入受制于原始投入与并行化技术中更稀缺的一方,并以 Anthropic 的 agent teams 为例说明多 AI 智能体协同可提升同时投入的算力。若并行化技术改进快于技术前沿但慢于研究投入,智能爆炸仍会发生,只是更慢。
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重与技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
月之暗面公开最强模型的权重与技术报告,并同时开源三项训练 Infra 技术,读者可据此了解其规模效率的实现路径。
伯克利 AI 研究提出 ABBEL 框架,将摘要以自然语言"信念状态"的形式隔离并监督其信息内容,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务中,重建式信念评分(rec-BG)将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 数也明显更低。
METR 发布文章系统梳理智能体能力度量指标,称为《Metrics of Agent Ability》。所有指标都建立在智能体得分 s_A(x) 与人类得分 s_H(x) 两条花费-得分曲线上,花费可解读为金钱、token 或时间。文章区分了仅看智能体的指标(固定花费得分、实用平台期得分、固定得分下的花费、花费回报、花费调整得分)与对照人类能力的人类锚定指标,但未推荐哪种指标最适合哪种场景。
论文 GeoRK2 提出一种免训练、可插拔的扩散 Transformer 加速框架,把二阶 Runge-Kutta 积分与深度特征空间的几何结构结合,使大步采样仍保持稳定生成质量,已被 CVPR 2026 收录为 Highlight。
千里智驾 CTO 杨沐在 WAIC 对话中提出,智驾的终局是物理 AI,L4 可能比 L3 更快落地。他回顾智驾从前视到 BEV 再到端到端的三代演进,并指出特斯拉在北美的第一梯队地位到中国后因数据闭环受阻而难以为继。谈及世界模型与 VLA,他认为关键不在让车"更聪明",而在于用"司机+领航员"结构应对上车后的模型幻觉。
十字路口播客对话生数科技张金涛,聊月初发布的实时交互视频模型 Vidu S1:上传一张照片即可变成能实时视频通话的 AI 角色,生成速度超过播放速度并支持无限时长,实现 540P、25–42 FPS,可在消费级显卡上运行。
GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。
Jim Fan 介绍 RoboTTT,将机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,推理成本保持恒定,比 SOTA 推进三个数量级。
Andrew Ng 与 Cerebras 合作推出短课程,教开发者用为快速推理设计的 Cerebras Wafer-Scale Engine 构建 LLM 应用。
宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。
YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。
Christian Szegedy 称,AI 整体已在 2026 年 4 至 5 月达到交叉点,在数学研究水平上达到在职数学家的 90 百分位。他认为,阻碍 AI 达到「任何数学家」水平的唯一因素是大型实验室不愿在 RL 循环中使用形式化方法。他预测,最迟到明年年中,AI 将在数学领域达到超人类水平。
数学家 Przemek Chojecki 称借助 GPT 系列模型累计提出 19 个 Erdős 问题解答声明,其中 GPT-5.5 Pro 解决最多,GPT-5.2、5.4、5.6 各有斩获。
SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。
Epoch AI 指出,AI 未来主义辩论普遍只讨论 AI 能变得多强,却忽略具体技术的开发难度这一半,因此提出三步研究法:明确定义某项技术、设定 AI 能力假设(如"可替代远程工作者"、需 H100 GPU 运行时算力)、估算该 AI 开发该技术所需时间与资源。目前公开案例极少,Damon Binder 的后 AGI 能源生产研究是其一。