Qwen-Image-2.1-Multiple-Angles-LoRA 模型发布
Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。
Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。
LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。
Perplexity 将两款模型发布到 Hugging Face,并给出了对应的模型集合链接。原文未披露模型名称、参数规模或具体能力信息。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Perplexity 在 Hugging Face Decision Index(决策模型基准)上排名第一。该模型采用开放权重,所有人均可访问。
Hugging Face 上出现了 Mistral 的新模型页面 "Le fat chaton"。该推文附带 huggingface.co/mistralai 的模型链接,发布后获得 50 条回复、69 次转发和 1091 个点赞。
Aleph Alpha 发布 Kolibri,参数规模 78B、激活参数 3.46B,上下文最高支持 1M tokens,权重以 Apache 2.0 许可开放,可在自有硬件上运行。Cohere 转发该消息并称其表现不错,同时预告双方将合作推出新成果。
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型支持最多 8 位说话人的语音分离,可在声音重叠时追踪谁在何时说话,参数量为 100M。团队在评论区回应了用户提问。
Cloudflare 开源了首批自研决策模型 clef 和 clef-flash,两者已在 Cloudflare Workers AI 上线。Harrison Chase 评论称,此前就有人预言决策模型领域会迎来更多入局者,如今连开放权重也出现了,并称 harness 应该能像替换主模型一样轻松替换决策模型。
Cloudflare 的 workers ai 团队发布首个自研模型系列 clef,包含两个快速、准确的决策模型,在质量与延迟基准上登顶。模型已开源,权重可在 Hugging Face 获取(Cloudflare/clef),也可直接使用 workers ai 的托管版本。
Runway 机器人业务负责人 Andy Chen 阐述了 Runway 在机器人领域的独特路线,并首次发布开放权重的世界动作模型 Praxis-1。Praxis-1 已在 runway.com/praxis-1 开放提前访问申请。
Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。
Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。官方表示其他领先模型每次编辑都会累积伪影、像素偏移和色彩变化,而 Ideogram 4.5 消除了伪影累积,使多轮编辑成为可能。该模型已在 Ideogram、API 及发布合作伙伴处上线,开放权重即将推出。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。
LlamaIndex 发布 Jev 模型,并联合其他 OSS 模型(含通用分类器与文档专用模型)在方向检测、语言检测、分类、拆分等需快速决策的文档任务上做了基准测试,从准确率、成本、延迟三个维度评估,Jev 在多数基准中领先。模型代码与视频已通过 GitHub 仓库和 YouTube 公开。
NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。
Qdrant 发布 Constella 研究预览,这是一组围绕 400M 参数英文嵌入模型 Stella 构建的模型家族,文档向量由 Stella 编码,查询可由 Zero、Nano 或 Stella 本身编码,均搜索同一个 Qdrant 集合,因此查询编码器可按请求热插拔,无需重新嵌入。
TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。
小米 MiMo 基础模型权重已在 Hugging Face 上线,同时发布了量化 GGUF 版本,分别托管于 XiaomiMiMo/MiMo 与 bartowski/MiMo 仓库。两个链接均指向 Hugging Face 的模型发布页,方便开发者下载部署。
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。
NVIDIA 推出 Nemotron 3 Diarization 模型,可追踪谁在何时说话,即使多人同时开口、声音重叠也能处理。该模型支持最多 8 位说话人,参数量为 100M,现已上线 Hugging Face。
Jina AI 开源端到端文档解析模型 jina-ocr-v1,总参数 3.4B、每 Token 仅激活 570M,在 OmniDocBench v1.6 得 91.14 分、olmOCR-Bench 得 83.4 分,均刷新同级别最佳成绩。
Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。
小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。
Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。
ConvAI Innovations 已在 Hugging Face 发布模型权重,并在 GitHub 提供配套代码仓库。原文未披露模型名称、参数量与具体可用范围,仅给出两个平台链接。
小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。
OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
Google Research 推出 TimesFM-3,这是一个时间序列基础模型,可在单次前向传播中完成多变量时间序列预测,在主要基准上显著优于其他预测模型。该模型已在 GitHub 和 Hugging Face 上线。
腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。
Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。
腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。
腾讯发布 Hy4 preview,总参数 770B、激活参数 49B、上下文窗口 1M,定位生产力场景并采取开源路线,主打一致且可负担的价格。官方同时给出博客、Hugging Face 与 GitHub 链接,并邀请用户反馈使用中遇到的问题。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。
腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。