跳到正文

#开源/仓库

今日 7 条
9月10日周四
  1. Paul Couvert(@itsPaulAi)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenBMB 发布 MiniCPM 小模型及 Meshy 强化学习训练框架

    OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。

9月9日周三
  1. vivo互联网技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SmartPhotoCrafter:先思考后修图的统一理解-生成图像优化新范式

    vivo BlueImage Lab 提出 SmartPhotoCrafter,一个统一理解—生成—优化框架,实现"先分析、再决策、后优化"的自动图像优化流程。

  2. 小红书技术REDtechAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书开源 CommInsight,从通信库底层事件重建大规模训推全栈因果链

    小红书 AI 通信库团队开源 CommInsight,一个面向大规模分布式训练与推理的系统级诊断平台,从 NCCL 底层事件流恢复通信组角色与 Step、Forward/Backward、梯度同步等训练语义,并定位 Hang、Failure 和 Straggler。

  3. Browser Use(@browser_use)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 在 GitHub 发布 browser-use 项目更新

    Browser Use 在 GitHub 上发布了 browser-use 项目相关内容,并附上仓库链接,推文获得 1 次转发、1 次点赞和 770 次浏览。原文未披露具体版本号、功能变更或性能数据。

  4. 浮之静AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 ChatGPT Images 2.5 并公布纳维–斯托克斯问题解法

    2026 年 9 月 8 日,OpenAI 发布 ChatGPT Images 2.5,并公布一项关于纳维–斯托克斯千禧年问题的解法。

9月7日周一
  1. 小红书技术REDtechAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书 AllSpark 提出 D³-MOPD:用 reverse-KL 动态调度多教师蒸馏配比

    小红书 AllSpark 团队提出 D³-MOPD,直接复用多教师在线蒸馏训练中本就在计算的 reverse-KL 信号,实时评估各领域学习进度并动态调整数据配比。

  2. Amjad Masad(@amasad)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者用 ThreeJS 为 Replit 用户打造海洋场景,完成后将开源

    开发者 Andrew Blumson 正在用 ThreeJS 为 Replit 用户构建一个海洋场景,目前已完成 30 分钟的循环效果,并表示完工后将开源。该消息经 Amjad Masad 转发,面向 Replit 社区发布。

9月5日周六
  1. 小米技术AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布表格数据大模型 Xiaomi-TabLDM 并开源权重

    小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。

  2. Qdrant(@qdrant_engine)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 1.19.1 发布:量化 HNSW 搜索提速 1.5–2.5 倍

    Qdrant 发布 1.19.1 补丁版本,量化 HNSW 搜索速度提升约 1.5–2.5 倍,payload 密集的 shard 迁移提速 1.5 倍。该版本还改进了 TurboQuant SIMD 打分、批量 HNSW 搜索与删除检查等。

9月4日周五
  1. AK(@_akhaliq)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Repo-To-Skill:将 GitHub 仓库蒸馏为 AI4AI 技能

    论文提出 Repo-To-Skill,将 GitHub 仓库蒸馏为 AI4AI 技能,论文已发布在 Hugging Face Papers 上。该工作探索把代码仓库转化为可供 AI 使用的能力形式,展示了从仓库到技能的蒸馏路径。

9月3日周四
  1. 歸藏的AI工具箱AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    歸藏开源 Yingzao·营造 Skill,把旅行废片做成建筑海报

    歸藏开源了 Skill「Yingzao·营造」(github.com/op7418/guizang-yingzao-skill),可将旅行照片重排为带字体设计和文化信息的海报。

  2. Firecrawl(@firecrawl_dev)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 开源 DevDex:衡量编码智能体搜索工具可靠性的 benchmark

    Firecrawl 开源 DevDex,一个用于评估搜索工具能否可靠找到编码智能体所需信息的 benchmark。该基准针对编码智能体高度依赖搜索工具获取答案的场景,衡量各工具找到正确来源的可靠性。

9月2日周三
  1. DockerAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Docker Sandboxes 构建可复现的 AI 评测工作流

    作者发布开源的 SBX AI Evaluation Kit,一个基于 Docker Sandboxes 的 Mixin Kit,用于让 AI 评测工作流更容易重跑、检查和对比。

  2. vivo互联网技术AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TinySR:面向真实世界图像超分辨率的轻量级扩散模型

    浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Garnet 获最佳论文奖:新一代缓存存储加速应用与服务

    微软研究院的 Garnet 获最佳论文奖,这是一个面向现代应用与云服务的新一代缓存存储层,可在无需修改任何应用的前提下带来数量级更高的性能与效率。Garnet 已作为开源软件开放使用。

9月1日周二
  1. Patrick Loeber(@patloeber)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 发布 TimesFM-3 时间序列基础模型,已在 GitHub 和 Hugging Face 上线

    Google Research 推出 TimesFM-3,这是一个时间序列基础模型,可在单次前向传播中完成多变量时间序列预测,在主要基准上显著优于其他预测模型。该模型已在 GitHub 和 Hugging Face 上线。

  2. Qwen(@Alibaba_Qwen)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CommerceAgentBench 开源:Qwen3.8-Max 在开放权重模型中综合表现最强

    CommerceAgentBench 已开源,这是一个面向真实商业运营的智能体基准,最佳整体完成率约 62%。在评测的开放权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强综合表现。

  3. 腾讯混元AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 轻量量化版,权重从 1.5 TB 压到 214 GB

    腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。

  4. QdrantAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 发布 Qdrant-FineWeb-10B 等开源向量检索基准数据集与 Supernova 引擎

    Qdrant 与 Vultr 合作发布开源向量检索基准 Qdrant-FineWeb-10B,含 24.47 TB 向量和 28.66 TB 源文本元数据,用 gte-multilingual-base 在 FineWeb 语料上生成 10.07B 稠密与稀疏向量,并为 10 万条查询算出精确 top-1000 真实近邻。

  5. Microsoft Research BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 推出 GigaPath-Flash 与 GigaTIME-Flash 病理基础模型

    Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。

8月29日周六
  1. Hunyuan(@TXhunyuan)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4-preview 以 MIX-STQ1_0 混合量化从 1.5TB 压缩至约 200GiB GGUF

    腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。

8月28日周五
  1. Hunyuan(@TXhunyuan)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布 Hy4 preview:770B 参数、49B 激活、1M 上下文并开源

    腾讯发布 Hy4 preview,总参数 770B、激活参数 49B、上下文窗口 1M,定位生产力场景并采取开源路线,主打一致且可负担的价格。官方同时给出博客、Hugging Face 与 GitHub 链接,并邀请用户反馈使用中遇到的问题。

  2. 腾讯混元AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 旗舰模型并开源

    腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。

    为什么值得看

    腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。

  3. HelloGitHubAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 125 期:airllm 4GB 显存跑 70B 大模型、DeepSeek 开源智能体框架

    HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。

8月27日周四
  1. 阿里研究院AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Flash 多模态 MoE 模型并开源 Next 权重

    阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

    为什么值得看

    官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。

  2. LangChain BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 WikiBench 评估开源文档智能体 OpenWiki

    LangChain 为开源代码库文档智能体 OpenWiki 构建了 WikiBench 基准,通过"读者智能体"回答基于代码仓库的问题来评估生成的 wiki 质量及其对编码智能体的实际帮助。

8月26日周三
  1. LangChain BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 开源 data-driven-characters:用语料库打造角色聊天机器人

    LangChain 发布开源项目 data-driven-characters,可从任意语料库生成角色定义并与之对话,支持导出到 character.ai、命令行或 Streamlit 界面本地调试,以及部署自包含的 Streamlit 应用。

  2. 张小珺Jùn|商业访谈录AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    领读 Kimi K3 技术报告:注意力美学、多教师蒸馏与开源 MoE 架构

    Kimi K3 是一个有效扩展到 2.8T 总参数并全量开源的 MoE 模型,本期播客由清华大学计算机系博士候选人孙宇涛领读其技术报告。

8月25日周二
  1. Milvus(@milvusio)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 开源 DeepSeek Harness 插件,DSH 智能体可直连 Milvus 查询

    Milvus 开源了 DeepSeek Harness(DSH)插件,DSH 已获 192K+ GitHub stars。安装插件并连接 Milvus 或 Zilliz Cloud 后,DSH 智能体可列出 collection、查看 schema,并执行标量查询、语义搜索、BM25 搜索和混合搜索。

  2. Weaviate • vector database(@weaviate_io)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 发布 Audio RAG、Video RAG 与多模态 PDF RAG Notebooks

    Weaviate 发布三份 Notebooks,分别演示 Audio RAG、Video RAG 和多模态 PDF RAG,代码托管在 weaviate/recipes 仓库。三条链接均指向 GitHub 对应示例,覆盖音频、视频与多模态 PDF 三类检索增强生成场景。

8月22日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 T-Rex 触觉方法并发布 50 小时触觉数据集

    Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。

  2. Firecrawl(@firecrawl_dev)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 开源 benchmark:可自行运行,半数查询用于公开

    Firecrawl 将其 benchmark 开源在 github.com/firecrawl/bench,用户可自行运行,并欢迎申请加入评测名单。该 benchmark 只发布一半查询,另一半留作留出集,以防有人在测试集上训练。

8月21日周五
  1. 歸藏的AI工具箱AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    歸藏的 PPT Skill 更新演讲者视图:按 P 打开备注与计时

    歸藏的 PPT Skill 新增演讲者视图,按 P 即可打开,同时弹出观众窗口,无需安装 PowerPoint 插件、不用联网。该视图由 AI 自动填写每页演讲备注与本页目的,并显示当前页和下一页、整场与逐页用时、剩余或超时时间,还带本地保留最近 5 次的排练模式。右上角实时显示观众屏同步状态,另支持激光笔、圈选、自动翻页和开讲前检查。

8月18日周二
  1. 歸藏的AI工具箱AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源 DeepSeek Harness 客户端 Pilot Harness,配桌面外壳与易用插件

    开发者歸藏开源了 Pilot Harness,一个为 DeepSeek Harness 打造的桌面客户端及配套插件,支持 macOS、Windows 和 Linux,提供 DMG、ZIP、AppImage、DEB、RPM 等安装包。

8月17日周一
  1. Import AI — Jack ClarkAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。

8月14日周五
  1. AI SDK(@aisdk)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI SDK 调整贡献流程:鼓励提 issue,不再欢迎完整实现 PR

    Vercel AI SDK 调整社区贡献流程,鼓励开发者提交带上下文的 issue,仍欢迎 PR 但不再鼓励完整的实现类 PR。当 issue 报告促成修复时,Vercel 会将该 issue 作者列为共同作者。

  2. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

8月13日周四
  1. idoubi(@idoubicc)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    thinkany-ai 开源 ds… 代码仓库地址公布

    开发者 idoubi 在推文中公布了 thinkany-ai 项目的代码仓库地址 github.com/thinkany-ai/ds…,未附更多功能或版本说明。

8月12日周三
  1. 李继刚AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚发布 /ljg-classic skill,逐字解读古文并生成卡片

    李继刚发布 skill /ljg-classic,用于把古文做成逐字解读加章节释义的卡片,灵感来自小红书上逐字讲解历史典籍的卡片形式。用法为输入书名与章节,如 /ljg-classic 《道德经》第七章、/ljg-classic 《金刚经》第三品,相关代码在 github.com/lijigang/ljg-skills。

  2. Modal BlogAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-2.4T-A95B 开放权重发布并上线 Modal

    Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。