跳到正文

#开源/仓库

今日 1 条
今天10月10日周六
  1. InfoQ 中文AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?

    研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。

10月9日周五
  1. 机器之心AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 OpenWAM:世界动作模型开源框架让动作翻译器可迁移

    斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人发布论文,提出开放的世界动作建模框架 OpenWAM,相关代码、评测与预训练视频模型权重已开源。框架从阿里开源的 Wan2.2-5B 出发,在约 334 万条人机交互视频上继续预训练,用 MoT 架构把 5B 视频专家与 2B 动作专家拼在一起,并定义 VTA、ATV、Joint、Decoupled 四种交互程序。

  2. 美团技术团队AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    KDD'26 美团学术论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

    美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。

  3. 量子位AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元VPP2登顶RoboDojo仿真榜单并开源

    星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。

10月8日周四
  1. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 Pento 推出 miniCOIL EN-ES 双语稀疏神经检索模型

    Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。

10月7日周三
  1. GitHub(@github)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 发布 ReviewBench:基于 1.039 亿 PR 分析的开源代码审查评测基准

    GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。

10月5日周一
  1. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

10月4日周日
  1. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    把 Depth Anything 砍到 6M,DepthART 让深度估计跑进 Jetson

    DepthART 将单目深度基础模型压缩到 6.0M 参数:用抗偏置数据采样从约 4400 万张候选图像筛出约 170 万张均衡数据,再以 Depth Anything V2-L 伪深度蒸馏到 TinyViM+DPT。

10月2日周五
  1. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    世界—动作模型综述:从预测未来到机器人闭环控制

    MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。

10月1日周四
  1. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LongLive-Plug:面向视频生成的一次性通用蒸馏

    LongLive-Plug 提出一种面向视频生成的“plug once-for-all”蒸馏方法,论文已发布在 Hugging Face Papers。该方法主打一次蒸馏即可通用适配,具体加速倍数与评测结果原文未披露。

9月30日周三
  1. Berkeley AI Research(@berkeley_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley AI 开源 DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。

9月29日周二
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NanoGPT 训练记录降至 39.9 秒,提出「按 flop 价值取舍」新范式

    NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。

  2. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FuseReg:正则化层融合缓解表征自编码器的重建-生成差距

    论文提出 FuseReg,通过正则化层融合缓解表征自编码器中的重建-生成差距。论文已在 HuggingFace 上线(huggingface.co/papers/2609.31…)。

9月27日周日
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 如何实现并评估面向安全评测的逐动作实时监控器

    METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。

9月26日周六
  1. clem 🤗(@ClementDelangue)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace 开源 SmolDataEnvs:5,000 个可验证 RL 环境任务

    HuggingFace 开源 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,面向代码和数据科学领域的小模型能力爬坡,环境、评测与训练全部开源。该数据集由 @adithya_s_k 贡献,已在 HuggingFace 上发布。

9月24日周四
  1. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Contrastive Language Models 上线 Hugging Face

    Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。

  2. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 MentalHealthBench:前沿模型心理健康对话能力持续提升

    OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。

9月23日周三
  1. mem0(@mem0ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 发布 DolphinBench 基准测试

    mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。

9月21日周一
  1. Microsoft Research BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软在 Nature 发布逆合成模型 RetroChimera,开源实现与权重

    微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成排序结合,预测结果优于任一子模型。

9月19日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 CSBP:面向扩散 LLM 的上下文分片块并行策略

    Stanford AI Lab 提出 Context-Sharded Block Parallelism(CSBP),一种面向扩散 LLM 的分布式并行策略,训练加速随上下文长度增长而提升。

9月18日周五
  1. Anthropic(@AnthropicAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 公开代码与完整结果,附 GitHub 仓库和技术报告

    Anthropic 公开了一批代码和完整结果,代码托管在 GitHub 的 anthropics/upl 仓库,完整结果收录在其技术报告中,报告可通过 Anthropic CDN 链接下载。

9月9日周三
  1. vivo互联网技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SmartPhotoCrafter:先思考后修图的统一理解-生成图像优化新范式

    vivo BlueImage Lab 提出 SmartPhotoCrafter,一个统一理解—生成—优化框架,实现"先分析、再决策、后优化"的自动图像优化流程。

9月7日周一
  1. 小红书技术REDtechAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书 AllSpark 提出 D³-MOPD:用 reverse-KL 动态调度多教师蒸馏配比

    小红书 AllSpark 团队提出 D³-MOPD,直接复用多教师在线蒸馏训练中本就在计算的 reverse-KL 信号,实时评估各领域学习进度并动态调整数据配比。

9月4日周五
  1. AK(@_akhaliq)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Repo-To-Skill:将 GitHub 仓库蒸馏为 AI4AI 技能

    论文提出 Repo-To-Skill,将 GitHub 仓库蒸馏为 AI4AI 技能,论文已发布在 Hugging Face Papers 上。该工作探索把代码仓库转化为可供 AI 使用的能力形式,展示了从仓库到技能的蒸馏路径。

9月3日周四
  1. Firecrawl(@firecrawl_dev)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 开源 DevDex:衡量编码智能体搜索工具可靠性的 benchmark

    Firecrawl 开源 DevDex,一个用于评估搜索工具能否可靠找到编码智能体所需信息的 benchmark。该基准针对编码智能体高度依赖搜索工具获取答案的场景,衡量各工具找到正确来源的可靠性。

9月2日周三
  1. vivo互联网技术AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TinySR:面向真实世界图像超分辨率的轻量级扩散模型

    浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Garnet 获最佳论文奖:新一代缓存存储加速应用与服务

    微软研究院的 Garnet 获最佳论文奖,这是一个面向现代应用与云服务的新一代缓存存储层,可在无需修改任何应用的前提下带来数量级更高的性能与效率。Garnet 已作为开源软件开放使用。

9月1日周二
  1. Qwen(@Alibaba_Qwen)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CommerceAgentBench 开源:Qwen3.8-Max 在开放权重模型中综合表现最强

    CommerceAgentBench 已开源,这是一个面向真实商业运营的智能体基准,最佳整体完成率约 62%。在评测的开放权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强综合表现。

  2. QdrantAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 发布 Qdrant-FineWeb-10B 等开源向量检索基准数据集与 Supernova 引擎

    Qdrant 与 Vultr 合作发布开源向量检索基准 Qdrant-FineWeb-10B,含 24.47 TB 向量和 28.66 TB 源文本元数据,用 gte-multilingual-base 在 FineWeb 语料上生成 10.07B 稠密与稀疏向量,并为 10 万条查询算出精确 top-1000 真实近邻。

8月27日周四
  1. LangChain BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 用 WikiBench 评估开源文档智能体 OpenWiki

    LangChain 为开源代码库文档智能体 OpenWiki 构建了 WikiBench 基准,通过"读者智能体"回答基于代码仓库的问题来评估生成的 wiki 质量及其对编码智能体的实际帮助。

8月22日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 T-Rex 触觉方法并发布 50 小时触觉数据集

    Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。

8月17日周一
  1. Import AI — Jack ClarkAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。

7月29日周三
  1. Fei-Fei Li(@drfeifei)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 R2S2R 的 Real-to-Sim 环节:将物理机器人、传感器与环境转化为仿真

    李飞飞介绍的 R2S2R 中 Real-to-Sim 环节,可把物理机器人、传感器、环境、物体及交互转化为仿真,同时保留与任务相关的观测和动力学——不只是世界的外观,还有机器人交互时它的行为方式。该结果在机器人操作领域的 sim-real 对齐上树立了新标准。

7月1日周三
  1. 哔哩哔哩技术AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站技术团队携 FATE 系列 SABER、CASTER 亮相 ACL 2026

    B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。

  2. Modal BlogAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 与 NYU Shanghai 提出 MRP:为扩散语言模型做多 token 残差预测

    Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。

5月18日周一
  1. Import AI — Jack ClarkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 457:AI 版 Stuxnet、Muon 优化器的神经元死亡问题与「正向对齐」

    SentinelOne 拆解出一个约 20 年前、比 Stuxnet 更早的病毒 fast16.sys,它专门篡改 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件的计算结果。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合 Berkeley、Stanford、CMU 开源 CaP-X,采用 MIT 许可证

    NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。

3月12日周四
  1. Jina AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 从多模态大模型中拆出 1.1B 音频向量模型

    Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。

2月12日周四
  1. Jina AI(@JinaAI_)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布嵌入向量反演(embedding inversion)在线演示

    Jina AI 上线嵌入向量反演演示 embedding-inversion-demo.jina.ai,可实时展示从嵌入向量还原内容的效果,训练与解码的技术细节在其开源仓库和论文中公布。

  2. Jina AI(@JinaAI_)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    78M 参数文本扩散模型可将 Qwen3-Embedding 与 EmbeddingGemma 向量还原为文本

    一个 78M 参数的文本扩散模型能从 Qwen3-Embedding 和 EmbeddingGemma 的嵌入向量中还原出 80% 的 token,并支持多语言输入,配套 demo 可在线体验。该模型展示了嵌入向量逆向还原为句子的难度之低,而这正是文本扩散模型的理想任务。