Anthropic 发布 Claude Opus 4.6
Anthropic 发布 Claude Opus 4.6,标题为 Introducing Claude Opus 4.6,原始内容为 YouTube 视频,正文信息抓取失败,暂无更多细节。
Anthropic 发布 Claude Opus 4.6,标题为 Introducing Claude Opus 4.6,原始内容为 YouTube 视频,正文信息抓取失败,暂无更多细节。
NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。
阿里 Qwen 团队发布 Qwen3-Coder-Next,一款面向编码智能体与本地开发的开源权重模型。其训练使用 80 万可验证任务与可执行环境,在 80B 总参数、3B 激活的规模下于 SWE-Bench Pro 取得较强结果,并支持 OpenClaw、Qwen Code、Claude Code、Cline、浏览器使用等场景。
OpenAI 发布 GPT-5.2,Sam Altman 称这是一款非常聪明的模型,相比 GPT-5.1 已取得长足进步。该推文获得 1171 次点赞、136437 次浏览。
有人正在思考如何用 Qwen 构建下一代基础模型。该消息未披露具体模型版本、参数规模或发布时间等细节。
Mistral AI 发布 Devstral 2 编码模型家族,提供两个尺寸版本,均为开源。同时推出原生 CLI 工具 Mistral Vibe,用于端到端自动化。作者称其支持在家进行 SOTA 开源 vibe coding。
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。
Jina AI 发布 jina-VLM,一款 2B 规模的视觉语言模型,在开源 2B 级 VLM 中的多语言视觉问答和文档理解任务上达到 SOTA。
DeepSeek 开源发布 DeepSeek-V3.2 模型与 DeepSeek-V3.2-Speciale 模型,两者均已上传 Hugging Face,同时提供技术仓库链接。
DeepSeek 发布 DeepSeek-V3.2 与 DeepSeek-V3.2-Speciale 两款推理优先的模型,面向智能体场景。DeepSeek-V3.2 是 V3.2-Exp 的正式后继版本,已在 App、Web 和 API 上线;DeepSeek-V3.2-Speciale 进一步推高推理能力,目前仅提供 API。
DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。
官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。
Gemini 3 Pro 相比 Gemini 2.5 Pro 实现输出保真度跃升,得益于更强的多模态理解与 3D 推理能力。该对比通过两款模型的最佳输出示例直观呈现了这一差距。
DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。
Cursor 构建的 Composer-1 是一款通过 RL 训练的大型 MoE 模型,主打真实场景编程能力且速度极快。该模型由一支小而精的 RL 团队完成,背后涉及大量科学、基础设施、ML 性能及数据/奖励工作。团队目前正在扩招,以继续塑造编程的未来。
Anthropic 发布 Claude Haiku 4.5,官方称其达到 5 个月前 Sonnet 4 的水平,成本为三分之一、速度为其两倍,在 computer use 上甚至超过 Sonnet 4,发布当日即可在 Claude 各处使用。
DeepSeek 宣布开源发布新模型,模型权重已上传至 Hugging Face,并同步公开技术报告。官方还放出了用 TileLang 与 CUDA 实现的关键 GPU kernel,并建议用 TileLang 做快速研究原型开发。
DeepSeek 发布最新实验模型 DeepSeek-V3.2-Exp,基于 V3.1-Terminus 构建,首次引入 DeepSeek Sparse Attention(DSA),用于在长上下文场景下实现更快、更高效的训练和推理。该模型已在 App、Web 和 API 上线,API 价格下调 50% 以上。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。
官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。
DeepSeek 在 V3.1 基础上发布 DeepSeek-V3.1-Terminus,针对用户反馈做出改进。此次更新提升语言一致性,减少中英文混杂与随机字符;同时增强 Code Agent 和 Search Agent 表现。
DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。
Mistral AI 宣布 Mistral Medium 3.1 登上 LMArena 榜单:在无 Style Control 的英文榜排名第一,总榜第二,编码与长查询进入前三,综合排名第八。该模型现已在 Le Chat 和 API 上线。
DeepSeek 发布 DeepSeek-V3.1,官方称这是其迈向智能体时代的第一步。该模型支持 Think 与 Non-Think 混合推理,一个模型两种模式;DeepSeek-V3.1-Think 相比 DeepSeek-R1-0528 用时更短即可给出答案,后训练增强了工具调用与多步智能体任务能力。
DeepSeek 发布 DeepSeek-R1-0528,称在基准性能、前端能力上有提升,并减少了模型幻觉。该版本支持 JSON 输出与函数调用,API 用法不变,模型已在 Hugging Face 开源,可通过 chat.deepseek.com 试用。
Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
DeepSeek R1 已在 Monica AI 上线,官方称其在数学与编程任务上表现出色,Codeforces 得分 96.3%,支持 128K 上下文窗口,并展现出涌现推理能力。该模型被描述为可与 OpenAI 最新模型匹敌,现已通过 Monica AI 开放使用。
DeepSeek 发布完全开源的推理模型 DeepSeek-R1,性能对标 OpenAI-o1,采用 MIT 许可,可自由蒸馏和商业化。官网与 API 已上线,可在 chat.deepseek.com 体验 DeepThink。
DeepSeek 发布 DeepSeek-V3,生成速度达 60 tokens/秒,比 V2 快 3 倍。官方称该版本能力增强,API 保持兼容,并开源模型与论文。
原文给出 DeepSeek-V3 相对 V2 的生成速度提升与开源范围,可用于判断该版本的迭代幅度。
OpenAI 展示 o1 推理模型如何在编程、战略和研究等领域协助解决复杂问题。
Mistral 推出号称全球最强的边缘模型 MiniStral,官方发布页为 mistral.ai/news/ministrau。该模型主打边缘设备部署场景,具体参数与可用性信息尚未在公布内容中披露。