OpenBMB 发布 MiniCPM 小模型及 Meshy 强化学习训练框架
OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。
OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。
vivo BlueImage Lab 提出 SmartPhotoCrafter,一个统一理解—生成—优化框架,实现"先分析、再决策、后优化"的自动图像优化流程。
小红书 AI 通信库团队开源 CommInsight,一个面向大规模分布式训练与推理的系统级诊断平台,从 NCCL 底层事件流恢复通信组角色与 Step、Forward/Backward、梯度同步等训练语义,并定位 Hang、Failure 和 Straggler。
Browser Use 在 GitHub 上发布了 browser-use 项目相关内容,并附上仓库链接,推文获得 1 次转发、1 次点赞和 770 次浏览。原文未披露具体版本号、功能变更或性能数据。
2026 年 9 月 8 日,OpenAI 发布 ChatGPT Images 2.5,并公布一项关于纳维–斯托克斯千禧年问题的解法。
小红书 AllSpark 团队提出 D³-MOPD,直接复用多教师在线蒸馏训练中本就在计算的 reverse-KL 信号,实时评估各领域学习进度并动态调整数据配比。
开发者 Andrew Blumson 正在用 ThreeJS 为 Replit 用户构建一个海洋场景,目前已完成 30 分钟的循环效果,并表示完工后将开源。该消息经 Amjad Masad 转发,面向 Replit 社区发布。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
Qdrant 发布 1.19.1 补丁版本,量化 HNSW 搜索速度提升约 1.5–2.5 倍,payload 密集的 shard 迁移提速 1.5 倍。该版本还改进了 TurboQuant SIMD 打分、批量 HNSW 搜索与删除检查等。
论文提出 Repo-To-Skill,将 GitHub 仓库蒸馏为 AI4AI 技能,论文已发布在 Hugging Face Papers 上。该工作探索把代码仓库转化为可供 AI 使用的能力形式,展示了从仓库到技能的蒸馏路径。
歸藏开源了 Skill「Yingzao·营造」(github.com/op7418/guizang-yingzao-skill),可将旅行照片重排为带字体设计和文化信息的海报。
Firecrawl 开源 DevDex,一个用于评估搜索工具能否可靠找到编码智能体所需信息的 benchmark。该基准针对编码智能体高度依赖搜索工具获取答案的场景,衡量各工具找到正确来源的可靠性。
作者发布开源的 SBX AI Evaluation Kit,一个基于 Docker Sandboxes 的 Mixin Kit,用于让 AI 评测工作流更容易重跑、检查和对比。
浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。
微软研究院的 Garnet 获最佳论文奖,这是一个面向现代应用与云服务的新一代缓存存储层,可在无需修改任何应用的前提下带来数量级更高的性能与效率。Garnet 已作为开源软件开放使用。
Google Research 推出 TimesFM-3,这是一个时间序列基础模型,可在单次前向传播中完成多变量时间序列预测,在主要基准上显著优于其他预测模型。该模型已在 GitHub 和 Hugging Face 上线。
CommerceAgentBench 已开源,这是一个面向真实商业运营的智能体基准,最佳整体完成率约 62%。在评测的开放权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强综合表现。
腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。
Qdrant 与 Vultr 合作发布开源向量检索基准 Qdrant-FineWeb-10B,含 24.47 TB 向量和 28.66 TB 源文本元数据,用 gte-multilingual-base 在 FineWeb 语料上生成 10.07B 稠密与稀疏向量,并为 10 万条查询算出精确 top-1000 真实近邻。
Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。
腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。
腾讯发布 Hy4 preview,总参数 770B、激活参数 49B、上下文窗口 1M,定位生产力场景并采取开源路线,主打一致且可负担的价格。官方同时给出博客、Hugging Face 与 GitHub 链接,并邀请用户反馈使用中遇到的问题。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。
腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
LangChain 为开源代码库文档智能体 OpenWiki 构建了 WikiBench 基准,通过"读者智能体"回答基于代码仓库的问题来评估生成的 wiki 质量及其对编码智能体的实际帮助。
LangChain 发布开源项目 data-driven-characters,可从任意语料库生成角色定义并与之对话,支持导出到 character.ai、命令行或 Streamlit 界面本地调试,以及部署自包含的 Streamlit 应用。
Kimi K3 是一个有效扩展到 2.8T 总参数并全量开源的 MoE 模型,本期播客由清华大学计算机系博士候选人孙宇涛领读其技术报告。
Milvus 开源了 DeepSeek Harness(DSH)插件,DSH 已获 192K+ GitHub stars。安装插件并连接 Milvus 或 Zilliz Cloud 后,DSH 智能体可列出 collection、查看 schema,并执行标量查询、语义搜索、BM25 搜索和混合搜索。
Weaviate 发布三份 Notebooks,分别演示 Audio RAG、Video RAG 和多模态 PDF RAG,代码托管在 weaviate/recipes 仓库。三条链接均指向 GitHub 对应示例,覆盖音频、视频与多模态 PDF 三类检索增强生成场景。
Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。
Firecrawl 将其 benchmark 开源在 github.com/firecrawl/bench,用户可自行运行,并欢迎申请加入评测名单。该 benchmark 只发布一半查询,另一半留作留出集,以防有人在测试集上训练。
歸藏的 PPT Skill 新增演讲者视图,按 P 即可打开,同时弹出观众窗口,无需安装 PowerPoint 插件、不用联网。该视图由 AI 自动填写每页演讲备注与本页目的,并显示当前页和下一页、整场与逐页用时、剩余或超时时间,还带本地保留最近 5 次的排练模式。右上角实时显示观众屏同步状态,另支持激光笔、圈选、自动翻页和开讲前检查。
开发者歸藏开源了 Pilot Harness,一个为 DeepSeek Harness 打造的桌面客户端及配套插件,支持 macOS、Windows 和 Linux,提供 DMG、ZIP、AppImage、DEB、RPM 等安装包。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
Vercel AI SDK 调整社区贡献流程,鼓励开发者提交带上下文的 issue,仍欢迎 PR 但不再鼓励完整的实现类 PR。当 issue 报告促成修复时,Vercel 会将该 issue 作者列为共同作者。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
开发者 idoubi 在推文中公布了 thinkany-ai 项目的代码仓库地址 github.com/thinkany-ai/ds…,未附更多功能或版本说明。
李继刚发布 skill /ljg-classic,用于把古文做成逐字解读加章节释义的卡片,灵感来自小红书上逐字讲解历史典籍的卡片形式。用法为输入书名与章节,如 /ljg-classic 《道德经》第七章、/ljg-classic 《金刚经》第三品,相关代码在 github.com/lijigang/ljg-skills。
Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。