跳到正文

#多模态

今日 10 条
6月23日周二
  1. Replicate(@replicate)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里巴巴 Happyhorse 1.1 上线 Replicate,支持文本、图像与参考视频生成

    阿里巴巴 Happyhorse 1.1 已在 Replicate 上线,提供文本、图像和参考视频三种生成模式,支持多语言唇形同步与原生音频。该模型支持 720p 和 1080p 分辨率,参考视频生成(r2v)最多可使用 9 张参考图像。

  2. Replicate(@replicate)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里巴巴 happyhorse 模型上线 Replicate

    阿里巴巴的 happyhorse 模型现已上线 Replicate,可通过 replicate.com/alibaba/happyhorse 试用。该模型由 Replicate 平台发布,具体参数与功能细节尚未公布。

6月19日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 M*:统一运行时服务复合多模态模型,omni TTS 最高提速 2.7×、world-model rollout 提速 12.5×

    斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞回应 World Labs 与 Marble:空间智能和世界模型或是 AI 下一个大转变

    李飞飞转发并回应 Hugues Bruyère 关于 World Labs 与 Marble 的分享,称 World Labs 创立的初衷是赋能人类创造力与生产力。相关 Fast Company 文章讨论了空间智能与世界模型或是 AI 下一个大转变。Bruyère 介绍了自己以体积捕捉、光场重建和 Marble 等工具混合物理现实与生成式操控的实践。

6月18日周四
  1. Nick St. Pierre(@nickfloats)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 宣布成立新部门 Midjourney Medical

    Midjourney 宣布成立新部门 Midjourney Medical。此前 Midjourney 的软件业务从文本生成图像,硬件业务则用声波生成人的图像。新部门的具体产品和方向尚未披露。

  2. Nick St. Pierre(@nickfloats)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney Medical 推出全身超声计算断层扫描,目标部署 5 万台扫描仪

    Midjourney Medical 宣布推出全身超声计算断层扫描(full body ultrasonic computational tomography)。其目标是建成一支 5 万台扫描仪组成的机队,合计每月完成 10 亿次扫描,让全身成像惠及地球上每个人。

6月16日周二
  1. 通义大模型AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Robot 发布:通义实验室推出导航、操作与世界模型三款具身基础模型

    通义实验室发布 Qwen-Robot 系列,用三个专业基础模型弥合从认知到行动的鸿沟:Qwen-RobotNav 统一指令跟随、点/目标导航、目标追踪和自动驾驶四类任务,Qwen-RobotManip 基于超过 38,100 小时数据实现跨本体训练,Qwen-RobotWorld 以自然语言动作接口跨场景预测物理未来。

    为什么值得看

    通义实验室一次发布三款具身基础模型,给出统一语言接口与跨本体数据方案,可观察大模型接入物理行动的路径。

6月15日周一
  1. Import AI — Jack ClarkAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 461:Sequent 称"对齐尚未步入正轨",发布 FrontierCode 与合成研究实习生

    英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。

6月12日周五
  1. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

6月11日周四
  1. 通义大模型AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何让 Qwen3-VL 在手机起飞:MNN 开启 SME2 端侧提速 80%

    阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。

  2. 开始连接LinkStartAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WWDC26 库克谢幕之作:苹果给 Siri 换上谷歌 Gemini 大脑

    苹果在 WWDC26 上宣布 Siri 的 AI 升级将接入谷歌 Gemini 而非 OpenAI,同时 iPhone 17 Pro 塞进了史无前例的 20B 端侧模型,并采用苹果自研 MoE 架构、未让谷歌插手。Siri 还新增摄像头入口与全局上下文能力,Xcode 模拟器已支持双倍宽度,被指为折叠屏硬件铺路。这很可能是库克以 CEO 身份主持的最后一场 WWDC,九月后由硬件负责人特努斯接任。

6月10日周三
  1. Fei-Fei Li(@drfeifei)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fei-Fei Li 祝贺 World Labs 与 Lore 合作打造浏览器内交互世界

    Fei-Fei Li 发推祝贺 World Labs 与 Lore 合作,将创意转化为用户可在浏览器直接运行的交互式世界体验,而非视频。World Labs 称其把梦想变成世界,并填入历史伟人,内容直接在浏览器中运行。

6月9日周二
  1. Google DeepMind BlogAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言实时语音互译

    Google 发布 Gemini 3.5 Live Translate 音频模型,可自动识别 70+ 语言并输出接近实时的语音到语音翻译,保留说话人的语调、节奏和音高。

  2. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。

    为什么值得看

    Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。

6月8日周一
  1. Jina AI(@JinaAI_)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-v5-omni:Mac 本地多模态文件搜索,支持离线与 Apache2

    Jina AI 推出基于 jina-v5-omni 嵌入向量的本地多模态文件搜索工具,完全离线运行,可索引文本、PDF、图片、音频和视频。

6月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文清单:2026 年 1 月至 5 月

    Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。

  2. Jim Fan(@DrJimFan)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 CVPR 2026 展示三篇物理 AI 论文

    NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。

6月4日周四
  1. Jeff Dean(@JeffDean)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemma 4 12B 开源多模态模型,可在笔记本本地运行

    Google 发布 Gemma 4 12B,这是一个统一的无编码器多模态模型,采用 Apache 2.0 许可,可直接在笔记本电脑上运行。该模型定位在端侧效率与高级推理之间,Jeff Dean 称其为能力很强的开放权重模型。

  2. 开始连接LinkStartAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌还在追赶 OpenAI 和 Anthropic?这是 Google I/O 2026 最大的误读

    谷歌在 Google I/O 2026 上缺席 Gemini 3.5 Pro、未更新 Veo,被外界视为遗憾,但极客公园播客邀请亲赴现场的 Bryan Liu 与作者 Alan 解读这场发布会背后的野心。节目指出谷歌把模型分成「干活的」和「思考的」,并借 Gemini Spark、Gemini 重写操作系统及谷歌眼镜,展现将讲故事权利还给所有人、成为用户「外置大脑」的方向。

  3. MongoDB BlogAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    基于 MongoDB Atlas、Voyage AI 与多模态搜索的智能体供应商管理

    MongoDB 提出用 MongoDB Atlas、Voyage AI 与多模态搜索构建智能体供应商管理方案,把分散在遗留系统、PDF、表格和邮件里的供应商数据统一起来,并叠加 AI copilot 提升供应链可见性与韧性。方案针对的是 ERP 系统批处理延迟造成的实时响应瓶颈,原文未给出具体模型版本、参数或 benchmark 数据。

5月30日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 GPIC:面向大规模视觉生成的 1 亿图文对数据集与基准

    李飞飞等人推出 GPIC(Giant Permissive Image Corpus),一个面向大规模生成模型时代的视觉生成数据集与基准,含 1 亿条 VLM 标注图文对用于训练、100 万条图文对用于评测,总计约 28 万亿像素。该数据集完全允许研究及商业用途,采用集中托管,并同时提供数据集、基准与模型。

5月26日周二
  1. Last Week in AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #246:Gemini 3.5 与 Omni、Musk 败诉、OpenAI 对阵 Erdős 问题

    Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。

5月21日周四
  1. Andrew Ng(@AndrewYNg)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:构建能生成图像和视频的 AI 智能体

    吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。

5月20日周三
  1. Monica_IM(@hey_im_monica)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Flash 正式上线 Monica AI

    Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。

  2. Demis Hassabis(@demishassabis)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 分享 Gemini 3.5 Flash 模型更多信息

    Demis Hassabis 在 X 上分享了 Gemini 3.5 Flash 模型的更多信息,并附上 blog.google 的链接。该帖获得 131 个点赞、13 次转发和 33890 次浏览。

  3. Demis Hassabis(@demishassabis)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Omni Flash 上线 Gemini App 与 Flow,可玩性获 Demis Hassabis 点赞

    Gemini Omni Flash 已在 Gemini App 和 Flow 中开放体验,Demis Hassabis 称其"玩起来非常有趣",并表示期待看到用户的创作。更多细节见 Google 官方博客。

  4. Demis Hassabis(@demishassabis)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 宣布 Gemini Omni:支持照片、视频与音频构建新场景

    Demis Hassabis 宣布 Gemini Omni 在世界理解与多模态编辑上实现重大跨越,可接收照片、视频和音频并构建全新场景。他表示该模型将逐步支持任意输入与任意输出,先从视频开始,用户还可输入自己的视频来迭代想法。

5月18日周一
  1. Google DeepMind BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Omni Flash,支持对话式视频编辑

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。

    为什么值得看

    Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。

5月17日周日
  1. Google DeepMind BlogAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 将 SynthID 与 C2PA 内容核查扩展到 Search、Gemini 和 Chrome

    Google 宣布扩展内容透明与验证工具,把 SynthID 的水印核查能力从 Gemini app 扩展到 Search 和 Chrome,此前该功能已被全球使用 5000 万次。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 与新加坡达成国家 AI 合作,推动医疗、教育与科研

    Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研和气候领域落地新项目。合作探索 AI 辅助临床的“三元照护”、用 AlphaFold 与 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的视障跑者助手。Google 还向新加坡中小学至初级学院全体教师提供 Gemini for Education 及配套培训。

  2. Google DeepMind BlogAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。

    为什么值得看

    原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。

5月13日周三
  1. Jina AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量小模型

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,在 v5-text 文本能力基础上扩展到图像、音频、视频和 PDF,文本向量与 v5-text 逐字节一致,现有索引无需重建。

  2. 罗永浩的十字路口AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李想×罗永浩:理想转型 AI 与具身智能,发布旗舰 SUV L9 Livis

    理想汽车创始人李想做客罗永浩播客《十字路口》,介绍已完成从汽车公司向 AI 和具身智能公司的阶段性转型,并发布新一代旗舰 SUV L9 Livis。L9 Livis 搭载理想自研马赫 M100 芯片,算力达 2560 TOPS,配备全球首个完全体全线控底盘与 800V 主动式悬架系统,定位五十万元左右档位。

5月12日周二
  1. Jina AI(@JinaAI_)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v5-omni:冻结 v5-text 主干,接入视觉与音频编码器

    Jina AI 发布 v5-omni,完全冻结 v5-text 主干,仅通过小型可训练投影层接入预训练视觉与音频编码器。视觉端采用 Qwen3.5 vision encoder 并做 2x2 空间合并,除最终投影层 fc_vision_2 外全部冻结,该层随机初始化并映射至文本主干隐藏维度。

  2. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina v5-omni 上线 Elastic Inference Service、HuggingFace 与 Jina API

    Jina v5-omni 已在 Elastic Inference Service、HuggingFace 和 Jina API 上线。相关模型可在 HuggingFace 集合页获取,技术细节见 arXiv 论文 2605.08384 与 Jina 官方博客。

  3. Jina AI(@JinaAI_)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-omni:首个支持文本、图像、音频和视频的通用嵌入模型

    Jina AI 推出 jina-embeddings-v5-omni,这是其首个通用嵌入模型,支持文本、图像、音频和视频。模型提供 small(1.57B,1024 维,32K 上下文)和 nano(0.95B,768 维,8K 上下文)两种规格,均支持 Matryoshka 截断至 32 维。

  4. Lilian Weng(@lilianweng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布实时人机协作 AI 模型

    Thinking Machines 公布了一款可与人实时协作的 AI 模型,能像人一样同时听说、观看、思考与协作。团队称过去几个月产出 12 个版本(含多个子版本)和 137 页训练运行日志,并表示人与人的协作对提升人机协作很重要。该博客分享了其方法、早期结果及模型实际运行演示。

5月11日周一
  1. Thinking Machines — ConnectionismAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布交互模型 TML-Interaction-Small 研究预览

    Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。

5月4日周一
  1. Modal BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 用单个 Python 字典将 SGLang 多模态推理性能提升超 10%

    Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。

5月2日周六
  1. Demis Hassabis(@demishassabis)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 谈 AGI 缺失环节、记忆难题与 AlphaFold 之后的下一个突破

    Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。