Jina AI 发布 jina-vlm 视觉语言模型,论文与权重同步开源
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。
Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。
Jina AI 发布 jina-VLM,一款 2B 规模的视觉语言模型,在开源 2B 级 VLM 中的多语言视觉问答和文档理解任务上达到 SOTA。
Modal 宣布对 Mistral 3 提供 Day 0 支持,开发者可直接在其无服务器基础设施上部署和扩缩这批开源模型。Mistral 3 是 Mistral 最新的前沿开源多模态模型家族,本文重点介绍其中适合 Modal 无服务器架构的 Ministral 3,提供 3B、8B、14B 三种规模,在基准上与 Qwen 3-VL 系列竞争。
DeepSeek 开源发布 DeepSeek-V3.2 模型与 DeepSeek-V3.2-Speciale 模型,两者均已上传 Hugging Face,同时提供技术仓库链接。
DeepSeek 发布 DeepSeek-V3.2 与 DeepSeek-V3.2-Speciale 两款推理优先的模型,面向智能体场景。DeepSeek-V3.2 是 V3.2-Exp 的正式后继版本,已在 App、Web 和 API 上线;DeepSeek-V3.2-Speciale 进一步推高推理能力,目前仅提供 API。
DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。
官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。
Gemini 3 Pro 相比 Gemini 2.5 Pro 实现输出保真度跃升,得益于更强的多模态理解与 3D 推理能力。该对比通过两款模型的最佳输出示例直观呈现了这一差距。
Gemini 3 多模态推理能力实测显示,仅以一张图片作为输入,即可让模型编写出 inspired by 该图片的 threejs 体素艺术场景代码,输出为单页形式。该测试由 Ian Goodfellow 分享,相关推文获 2923 点赞、435561 次浏览。
DeepSeek-V3.2-Exp 推理 demo 的早期版本存在 RoPE 实现不匹配问题:indexer 模块的 RoPE 期望非交错输入,MLA RoPE 期望交错输入,可能导致性能下降。该问题已在 deepseek-ai 的 GitHub 仓库修复。
Cursor 构建的 Composer-1 是一款通过 RL 训练的大型 MoE 模型,主打真实场景编程能力且速度极快。该模型由一支小而精的 RL 团队完成,背后涉及大量科学、基础设施、ML 性能及数据/奖励工作。团队目前正在扩招,以继续塑造编程的未来。
Anthropic 发布 Claude Haiku 4.5,官方称其达到 5 个月前 Sonnet 4 的水平,成本为三分之一、速度为其两倍,在 computer use 上甚至超过 Sonnet 4,发布当日即可在 Claude 各处使用。
DeepSeek 宣布开源发布新模型,模型权重已上传至 Hugging Face,并同步公开技术报告。官方还放出了用 TileLang 与 CUDA 实现的关键 GPU kernel,并建议用 TileLang 做快速研究原型开发。
DeepSeek 发布最新实验模型 DeepSeek-V3.2-Exp,基于 V3.1-Terminus 构建,首次引入 DeepSeek Sparse Attention(DSA),用于在长上下文场景下实现更快、更高效的训练和推理。该模型已在 App、Web 和 API 上线,API 价格下调 50% 以上。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。
官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。
DeepSeek 在 V3.1 基础上发布 DeepSeek-V3.1-Terminus,针对用户反馈做出改进。此次更新提升语言一致性,减少中英文混杂与随机字符;同时增强 Code Agent 和 Search Agent 表现。
DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。
Mistral AI 宣布 Mistral Medium 3.1 登上 LMArena 榜单:在无 Style Control 的英文榜排名第一,总榜第二,编码与长查询进入前三,综合排名第八。该模型现已在 Le Chat 和 API 上线。
DeepSeek 发布 DeepSeek-V3.1,官方称这是其迈向智能体时代的第一步。该模型支持 Think 与 Non-Think 混合推理,一个模型两种模式;DeepSeek-V3.1-Think 相比 DeepSeek-R1-0528 用时更短即可给出答案,后训练增强了工具调用与多步智能体任务能力。
OpenAI 发布一段 GPT-5 工作场景演示,展示该模型分析用户反馈、制定产品计划并制作原型,以及总结后续步骤。演示面向办公与业务流程,具体能力细节以官方视频内容为准。
OpenAI 官方展示 GPT-5 在真实工作流中的多步任务处理,可据此判断其在业务流程中的落地位置。
DeepSeek 发布 DeepSeek-R1-0528,称在基准性能、前端能力上有提升,并减少了模型幻觉。该版本支持 JSON 输出与函数调用,API 用法不变,模型已在 Hugging Face 开源,可通过 chat.deepseek.com 试用。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
DeepSeek 开源周第 6 天发布 DeepSeek-V3/R1 推理系统概览,通过跨节点 EP 批扩展、计算通信重叠和负载均衡优化吞吐与延迟。其在线服务统计显示,单个 H800 节点每秒输入 73.7k、输出 14.8k token,成本利润率 545%。
DeepSeek 在开源周第二天发布 DeepEP,这是首个面向 MoE 模型训练与推理的开源 EP 通信库。它提供优化的 all-to-all 通信,支持 NVLink 与 RDMA 的节点内和节点间通信,并包含面向训练与推理预填充的高吞吐 kernel、面向推理解码的低延迟 kernel、原生 FP8 dispatch 支持,以及用于计算通信重叠的灵活 GPU 资源控制。
DeepSeek 发布完全开源的推理模型 DeepSeek-R1,性能对标 OpenAI-o1,采用 MIT 许可,可自由蒸馏和商业化。官网与 API 已上线,可在 chat.deepseek.com 体验 DeepThink。
DeepSeek 发布 DeepSeek-V3,生成速度达 60 tokens/秒,比 V2 快 3 倍。官方称该版本能力增强,API 保持兼容,并开源模型与论文。
原文给出 DeepSeek-V3 相对 V2 的生成速度提升与开源范围,可用于判断该版本的迭代幅度。
OpenAI 展示 o1 推理模型如何在编程、战略和研究等领域协助解决复杂问题。
Mistral 推出号称全球最强的边缘模型 MiniStral,官方发布页为 mistral.ai/news/ministrau。该模型主打边缘设备部署场景,具体参数与可用性信息尚未在公布内容中披露。