跳到正文

#多模态

今日 7 条
4月30日周四
  1. Midjourney(@midjourney)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 办公时间直播房间链接

    Midjourney 在 X 上分享了一个办公时间(office hours)直播房间链接 midjourneyofficehours.onrender.com。该条内容互动数据为 3 个点赞、3350 次浏览。

4月23日周四
  1. 字节跳动SeedAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动 Seed 发布 3D 生成大模型 Seed3D 2.0

    字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。

4月17日周五
  1. 宝玉的分享AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Design,由 Opus 4.7 驱动可从想法直接产出可运行原型

    Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。

    为什么值得看

    作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。

4月16日周四
  1. Poe(@poe_platform)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 在 Yoruba、Igbo、Chichewa 等低资源语言上显示提升

    Opus 4.7 在 Yoruba、Igbo 和 Chichewa 等训练数据较少的语言上显示出提升。Poe 表示,对这些语言及其他语言的使用者来说,该模型将有明显改善。

  2. Alex Albert(@alexalbert__)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.7 发布:强化异步任务执行与 token 控制

    Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。

4月10日周五
  1. Ian Goodfellow(@goodfellow_ian)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ian Goodfellow 前 Brain 同事 Andrew Dai 创立多模态推理实验室 ElorianAI

    在 Brain/DeepMind 工作近 12 年后,Andrew M. Dai 宣布与前 LLM 预训练、数据和多模态负责人共同创立 ElorianAI,定位为首个由这些方向前负责人创立并领导的多模态推理实验室。Ian Goodfellow 称其为自己的前 Brain 同事。

4月8日周三
  1. Fei-Fei Li(@drfeifei)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 推出 Marble 1.1 与 Marble 1.1-Plus 模型更新

    World Labs 为 Marble 推出两项模型更新:Marble 1.1 改善光照与对比度,大幅减少视觉伪影;Marble 1.1-Plus 是面向规模的新模型,可生成更大、更复杂的环境。

4月4日周六
  1. Poe(@poe_platform)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Wan 2.7 上线 Poe,单模型集成四种视频生成模式

    Wan 2.7 已在 Poe 全平台应用和 Poe API 上线,单模型集成 Text-to-Video、Image-to-Video、Video Edit、Reference-to-Video 四种视频生成模式,支持多镜头生成、音频驱动输出、首尾帧控制与视频无缝续写。

4月3日周五
  1. Poe(@poe_platform)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.6 Plus 上线 Poe,强化智能体与前端编码

    Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。

4月2日周四
  1. Poe(@poe_platform)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里巴巴 Wan 2.7-Image 上线 Poe,支持单提示词生成一致系列图像

    阿里巴巴 Wan 2.7-Image 已在 Poe 上线,可从单条提示词生成角色、风格与上下文一致的系列图像,并支持 bounding box 编辑,只重绘指定区域而无需重新生成整张图。用户可在全平台的 Poe app 及 Poe API(poe.com/Wan2.7-Image)中试用。

4月1日周三
  1. Poe(@poe_platform)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Veo 3.1 Lite 上线 Poe:Veo 3.1 家族的低成本视频生成模型

    Veo 3.1 Lite 已在 Poe 上线,是 Veo 3.1 家族中成本更低的视频生成模型,支持原生音频,包括同步对白、音效与环境音。该模型同时支持文生视频和图生视频,延续 Veo 3.1 的提示词遵循与场景理解能力,适用于社交短片、产品演示、分镜、短片及快速创意迭代,可在 Poe 全平台应用及 Poe API(poe.com/Veo-3.1-Lite)试用。

  2. Poe(@poe_platform)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.5-Omni Plus 与 Qwen3.5-Omni Flash 上线 Poe

    Qwen3.5-Omni Plus 和 Qwen3.5-Omni Flash 已在 Poe 上线,两款模型均可理解文本、图像、音频和视频。Plus 单次会话支持最长 3 小时音频和 1 小时视频,音频输入覆盖 90 多种语言,语音输出覆盖 30 多种语言、共 55 种音色;Flash 提供同样的跨模态理解能力但成本更低,面向高并发处理和多语言语音工作流。

3月27日周五
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul 用 ChatGPT + AlphaFold 为患癌爱犬设计个性化 mRNA 疫苗方案

    Paul 用 ChatGPT 结合 AlphaFold 为患癌的爱犬设计出一套个性化 mRNA 疫苗方案,被视为 AI 加速个性化医疗的一个缩影。Kevin Weil 借此呼吁,应让这套流程更容易被用于人类,而不只是狗。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:AI 能生成 1 亿个 splats,但让这个世界独特而美丽的是一位创作者的想象力

    World Labs 展示了一个完全由单人创作者构建的赛博朋克世界,使用 1 亿个 Gaussian splats,其中几乎所有表面和结构都由 Marble 生成。李飞飞称这标志着个人能够构建完整世界的时代正在到来。

3月26日周四
  1. Poe(@poe_platform)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 Lyria 3 上线 Poe,可由文本或图片生成三分钟音乐

    Google DeepMind 的 Lyria 3 已在 Poe 上线,可依据文本或图片提示词生成最长三分钟的高保真音乐,并能控制人声、流派、情绪和配器。该功能可用于为视频配乐、歌曲创意原型,或把情绪板变成完整成品曲;Poe 全平台应用及 Poe API(poe.com/Lyria-3)均可试用。

3月25日周三
  1. 43 TalksAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    站在艺术的十字路口,AI时代我们如何做不服从的像素|43 Talks

    央美与"43 Talks"于3月21日联合举办沙龙《不服从的像素:一项关于碳基身份的声像测定》,展出央美学子三天内创作的AIGC作品,并邀请孔德飞、韦万里、卢齐炜三位创作者展播与剖析各自AIGC作品。圆桌环节由杨樾、孔德飞、张凯寓、何梁、韦万里围绕技术与人文、算法与创意、教育与实践展开讨论,何梁以"回到生活之中"总结AI时代美育内核。

3月21日周六
  1. Poe(@poe_platform)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2 系列模型上线 Poe,含 Flash、Omni、Pro 三款

    小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 Dream2Flow:用 3D 物体流连接视频生成与机器人控制

    斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。

3月19日周四
  1. Poe(@poe_platform)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Small 4 上线 Poe:一个模型兼顾推理、视觉与智能体编程

    Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。

3月15日周日
  1. QdrantAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 联合 Twelve Labs 与 NVIDIA 打造边缘到云端视频异常检测方案

    Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。

3月12日周四
  1. Fei-Fei Li(@drfeifei)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:World Labs 的 Marble 用单张图像生成由数百万 splats 组成的可探索世界

    World Labs 的 Marble 可将一张图像转化为由数百万 splats 组成的庞大世界,生成从古代遗迹到飞船内部的可大规模探索环境。李飞飞表示,既然想象力没有边界,我们创造的世界也不该有边界。

3月10日周二
  1. QdrantAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 全面支持 Google Gemini Embedding 2 多模态嵌入模型

    Google 发布 Gemini Embedding 2 公开预览版,这是 Gemini 家族首个全多模态嵌入模型,可将文本、图像、视频、音频与 PDF 映射到统一向量空间,Qdrant 在发布首日即提供支持。

3月4日周三
  1. Lex Fridman(@lexfridman)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 与 Peter Steinberger 的对话由 ElevenLabs 译制并配音成德语

    Lex Fridman 与 Peter Steinberger 的对话现已由 ElevenLabs 完成翻译并配音成德语,可在 YouTube 上通过齿轮图标 > Audio Tracks 切换德语音轨收听。Fridman 称对 AI 打破语言障碍的这一应用充满期待,并称赞 ElevenLabs 在这方面做得最好。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:3D 正成为机器与人类的通用接口,就像代码一样

    李飞飞转发 World Labs 团队文章并评价称,正如代码一样,3D 正在成为机器与人类的通用接口。World Labs 在文中提出,文本曾是软件的通用接口,而 3D 正成为空间的通用接口,让人和 AI 能够共同生成、编辑、模拟和分享世界。

3月1日周日
  1. Lex Fridman(@lexfridman)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 对话 Rick Beato:AI 在音乐中的角色与吉他独奏

    Lex Fridman 发布与音乐人、制作人 Rick Beato 的对谈,话题涵盖吉他独奏、Django Reinhardt、Miles Davis、贝多芬与巴赫,并在 1:45:27 处讨论 AI 在音乐中的应用,此外还谈及 YouTube 版权投诉与 Spotify。

2月25日周三
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026 年 1-2 月开源权重 LLM 十大架构盘点:Trinity Large、Kimi K2.5、GLM-5、Qwen 3.5 等

    Sebastian Raschka 按时间顺序盘点了 2026 年 1-2 月发布的 10 个开源权重模型架构,包括 Arcee AI Trinity Large(400B MoE。

2月18日周三
  1. Barsee 🐶(@heyBarsee)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI、Apple、Anthropic、OpenClaw、Kimi 等 AI 领域的 11 项最新进展盘点

    AI 领域近几天出现 11 项重要进展,涉及 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等。其中 SeeDance 2.0 热度持续攀升,用户能在一天内生成好莱坞级别的 AI 电影。

2月16日周一
  1. Binyuan Hui(@huybery)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.5-397B-A17B 发布:Qwen3.5 系列首个开源权重模型

    Qwen3.5 系列的首个开源权重模型 Qwen3.5-397B-A17B 正式发布,采用混合线性注意力与稀疏 MoE,并进行了大规模 RL 环境扩展训练,官方称解码吞吐量相比 Qwen3-Max 提升 8.6 倍至 19.0 倍。

2月14日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 向 Marble 全体用户开放 Advance 模型与高级编辑

    World Labs 的 Marble 现已向所有用户开放 Advance 模型,支持全景图到可编辑 3D 世界的创建流程。用户可添加窗外场景、改变整个房间的氛围、添加任意植物,或为同一场景生成多个变体。

2月5日周四
  1. Jim Fan(@DrJimFan)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DreamZero:14B 世界动作模型,单次扩散前向同时预测视频与动作

    NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。

  2. Jim Fan(@DrJimFan)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队提出 DreamZero 世界动作模型,实现零样本开放世界提示

    Jim Fan 团队训练出名为 DreamZero 的机器人基础模型,以世界模型为骨干,具备对新动词、名词和环境的零样本开放世界提示能力,被称为首个 World Action Model(WAM)。

1月24日周六
  1. Jina AI(@JinaAI_)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI:嵌入向量压缩前先转球坐标,存储从 240 GB 降至 160 GB

    Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。

1月22日周四
  1. Fei-Fei Li(@drfeifei)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 推出 World API,Marble 可接入产品与工作流

    World Labs 发布 World API,让用户能在自己的产品和工作流中直接调用 Marble。此前已有不少人提出这一需求,官方在博客中公布了详情。

1月16日周五
  1. MongoDB BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local San Francisco 2026:Voyage 4 系列与多模态模型发布

    MongoDB 在 MongoDB.local San Francisco 2026 上发布 Voyage 4 系列嵌入模型,全部正式可用,共享同一嵌入空间以兼容跨模型调用。

1月13日周二
  1. MongoDB BlogAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vision RAG:让任意文档可被搜索的检索方案

    MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。

12月29日周一
  1. Jina AI(@JinaAI_)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 综述 VLM 视觉编码器:400M 模型可超越 6B

    Jina AI 发布 VLM 视觉编码器综述,调研 70+ 模型后发现训练方法比规模更关键——训练得当的 400M 编码器性能可超过 6B 模型。原生分辨率对文档类任务尤为重要,多编码器融合也被证实有效。综述还包含分类体系与实践指南,指出编码器侧研究明显不足,业界多沿用 2021 年的 400M CLIP。

12月8日周一
  1. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-vlm 视觉语言模型,论文与权重同步开源

    Jina AI 发布视觉语言模型 jina-vlm,相关论文(arXiv 2512.04032)与 HuggingFace 模型权重已同步公开,并在官方博客介绍了该模型。目前仅公布了 arXiv、HuggingFace 和博客三条发布链接,模型参数规模、benchmark 分数与价格等细节尚未披露。

  2. Jina AI(@JinaAI_)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina-VLM 在开源 2B 级 VLM 中达到 SOTA,八项 VQA 基准平均分 72.3 居首

    Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。

  3. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-VLM:2B 多语言视觉语言模型开源,视觉问答与文档理解达 SOTA

    Jina AI 发布 jina-VLM,一款 2B 规模的视觉语言模型,在开源 2B 级 VLM 中的多语言视觉问答和文档理解任务上达到 SOTA。

11月19日周三
  1. FlowiseAI(@FlowiseAI)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    FlowiseAI 获多位贡献者提交 PR:新增图像上传、结构化 JSON 输出与 OCR 图像加载

    FlowiseAI 近期收到贡献者 @aibysid 提交的一系列 PR,为其 AI 智能体可视化构建器加入多项功能。更新包括 ChatOpenRouter 节点支持图像上传、Agent 节点可输出结构化 JSON、新增支持多提供商 OCR 的图像加载器,并改进 Hugging Face 推理 API 集成及删除 AgentFlow 后列表自动刷新等体验。