跳到正文

#Hugging Face

今日 5 条
2月17日周二
  1. MongoDB BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Hugging Face 和 Voyage AI 构建电影推荐引擎

    教程演示如何用 voyage-4-nano 嵌入模型、Hugging Face 与 MongoDB Atlas Vector Search 搭建基于情绪的语义电影推荐引擎,实现「下班后想看点什么治愈的」这类按心情检索。系统通过理解语义而非关键词,将用户情绪与电影剧情描述匹配,绕开类型、演员等传统筛选的粗略标签。

2月13日周五
  1. Hugging Face(@huggingface)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA AI Developer 在 Hugging Face 粉丝突破 5 万

    NVIDIA AI Developer(@NVIDIAAIDev)在 Hugging Face 的粉丝数突破 50,000,并向开发者与研究社区致谢。其 Hugging Face 主页为 huggingface.co/nvidia,官方号召开发者继续与其共同构建。

2月6日周五
  1. Hugging Face(@huggingface)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 更新 changelog

    Hugging Face 发布 changelog 更新,指向 huggingface.co/changelog 页面查看详情。该条推文未披露具体变更内容,仅引导用户前往更新日志获取更多信息。

  2. Hugging Face(@huggingface)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 上线 Community Evals 与 Benchmark Datasets 等多项功能更新

    Hugging Face 推出 Community Evals,用户可向模型仓库提交 PR 贡献评测结果,所有 PR 会汇入 Benchmark Datasets 并展示在基准排行榜上。Data Studio 新增智能体对话与类表格的分区选择交互,模型仓库可查看 MLX 兼容硬件与量化版本、SGLang 代码片段,数据集开始支持 LanceDB 格式,博客草稿也可保存后在编辑器访问。

2月4日周三
  1. Binyuan Hui(@huybery)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3-Coder-Next 编码智能体模型

    阿里 Qwen 团队发布 Qwen3-Coder-Next,一款面向编码智能体与本地开发的开源权重模型。其训练使用 80 万可验证任务与可执行环境,在 80B 总参数、3B 激活的规模下于 SWE-Bench Pro 取得较强结果,并支持 OpenClaw、Qwen Code、Claude Code、Cline、浏览器使用等场景。

1月24日周六
  1. Jina AI(@JinaAI_)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 可视化 jina-embeddings-v4 向量:指数与尾数集中带来 1.5x 压缩

    Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。

12月8日周一
  1. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-vlm 视觉语言模型,论文与权重同步开源

    Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。

12月1日周一
  1. DeepSeek(@deepseek_ai)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V3.2 与 V3.2-Speciale,主打面向智能体的推理能力

    DeepSeek 发布 DeepSeek-V3.2 与 DeepSeek-V3.2-Speciale 两款推理优先的模型,面向智能体场景。DeepSeek-V3.2 是 V3.2-Exp 的正式后继版本,已在 App、Web 和 API 上线;DeepSeek-V3.2-Speciale 进一步推高推理能力,目前仅提供 API。

10月14日周二
  1. METRAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 MALT 数据集:用于检测威胁评估完整性的自然与诱导行为

    METR 发布 MALT 数据集,包含 10,919 条智能体转录记录,覆盖 403 个任务、86 个任务家族和 21 个模型,聚焦 reward hacking 与 sandbagging 等威胁评估完整性的行为。

9月29日周一
  1. DeepSeekAI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价

    DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。

    为什么值得看

    官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。

9月22日周一
  1. DeepSeekAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V3.1-Terminus 版本更新

    DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。

5月29日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-R1-0528 版本更新

    DeepSeek 发布 DeepSeek-R1-0528,称在基准性能、前端能力上有提升,并减少了模型幻觉。该版本支持 JSON 输出与函数调用,API 用法不变,模型已在 Hugging Face 开源,可通过 chat.deepseek.com 试用。

3月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3-0324 发布:推理能力提升,改用 MIT 许可开源

    DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。

    为什么值得看

    官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。

3月3日周一
  1. OnBoard!AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OnBoard! 解析 DeepSeek R1:强化学习、Long CoT 与开源生态影响

    DeepSeek 春节前夕发布的开源推理模型 DeepSeek R1,在数学、代码和推理能力上比肩 OpenAI o1 正式版,同时以极低训练推理成本和完全开源引发全球关注。OnBoard! 邀请 TinyZero 一作、CMU 研究 Long CoT 的研究员及 HuggingFace 资深工程师,从强化学习、Long CoT、infra 和开源角度解析其技术创新与生态影响。

12月25日周三
  1. OnBoard!AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Comfy 核心中国力量:多模态生成全球狂奔之年,开源与商业化发生了什么

    Comfy 中国社区创始团队发起的 Comfy Community Summit 第二站在东京举办,主理人 AJ、前 Stability AI 工程师 Yizhou、HuggingFace 工程师 Tiezhen 与 TheSEA AI 创始人 Yanjin 共同回顾多模态生成与 ComfyUI 开源社区的兴起。

6月7日周五
  1. OnBoard!AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度对谈顶尖 AI 开源项目:通义千问 Qwen、vLLM、OpenDevin 与中国开源力量

    阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。