跳到正文

#多模态

今日 7 条
10月9日周五
  1. 爱范儿AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全球最大独立 AI 原生影视公司 Utopai Studios,要打造「AI 版 Disney」

    全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。

  2. lmarena.ai(@lmarena_ai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 进入 Agent Arena 榜单前 15 实验室

    Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。

  3. Jerry Liu(@jerryjliu0)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LightOn OCR-3 上线 OpenDocRouter,定价 $0.28 / 1m input、$1.40 / 1m output

    LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。

  4. AK(@_akhaliq)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PAMI:面向文本到人-物交互生成的部分锚定运动方法

    论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。

  5. elvis(@omarsar0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voyager 发布面向视频、图形与游戏的开放 harness

    Anvisha 发布 Voyager,一个面向视频、图形和游戏创作的开放 harness,被形容为创意工作的 Codex。它自带免费的图形、音乐和视频编辑工具,也能在桌面端驱动 Blender、DaVinci Resolve、After Effects、Ableton 等 100 多个应用,并支持 Opus、Astra、DeepSeek 等模型。

  6. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Odyssey-3 Pro 在 Physics-IQ Verified 刷新最高分

    Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。

  7. 十字路口CrossingAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对谈 KK、山音:一线 AI 创作者如何用 AI 拍电影

    上戏毕业的山音与广告公司职员 KK 用两年时间成为 AI 导演,作品登上国内外电影节。他们最常使用的 AI 视频产品是 CapCut Video Studio,同一部片子会混用 Seedance、MiniMax 等多个模型。两人在播客中讨论了 AI 视频产品在底层模型趋同后的壁垒,以及"AI 无限,人生有限"的创作者困境。

  8. 歸藏(guizang.ai)(@op7418)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 读取 Memory 后用 Blender 建模生成海报

    GPT-6 Astra 读取用户 Memory 后,按用户喜好用 Blender 建模的几个模型做了一张海报,模型的细节、材质、光影都做得很好。

10月8日周四
  1. Philipp Schmid(@_philschmid)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SynthID Detector 公开上线,支持 Nano Banana 2.1、OpenAI、NVIDIA、Kakao 水印检测

    SynthID Detector(synthid.com)现已公开可用,支持 Nano Banana 2.1、OpenAI、NVIDIA、Kakao,并即将支持 Apple。用户可上传或粘贴图片、视频、音频文件,扫描 Google 及其合作方的水印,文件在扫描后即被删除。

  2. 特工宇宙AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vidu Q4 Preview 发布:最高支持 4K 直出,0.09 元/秒起

    Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。

  3. InfoQ 中文AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10 秒视频很惊艳,为什么 AI 做一部短剧还是这么难?

    在 InfoQ《极客有约》X QCon 直播中,快手鲜嘉麒与爱奇艺路香菊、阿里巴巴邹娟、生数科技郑重讨论 AIGC 内容生产为何难落地:竞争单位已从一个 clip 变成完整生产链路,用户追问人物一致性、商品变形、按时交付与成本可控。真实成本是生成、重试、审核、人工编辑等之和除以合格成片数。

  4. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 上线 MiniMax Design:用代码把文本变成视频

    Opus 5.5 接入 MiniMax Design,可通过编写代码将文本转为视频,覆盖 JavaScript 动画、动态图形、解说视频与视觉叙事、Web 与产品演示等场景。该模型不止于语言模型,还能理解视觉内容并持续打磨用户的创作。

  5. AI科技评论AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    墨尔本的屏幕、芝加哥的数据、杭州的大模型:医疗 AI 的万亿价值从何而来

    医疗 AI 的万亿价值可能落在三类资产上:Pro Medicus 的影像工作流软件、Tempus AI 的诊断与患者数据、德适科技的医疗影像大模型。三家公司 2026 年 10 月 6 日市值分别约为人民币 780 亿元、875 亿元和 220 亿元。

  6. NVIDIA AI(@NVIDIAAI)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    H-Company 如何用 NVIDIA Dynamo 优化面向 Computer Use Agents 的 VLM 服务

    H-Company 借助 NVIDIA Dynamo 优化面向 Computer Use Agents 的 VLM 服务。该内容以直播形式发布,未披露具体的性能数据、模型版本或部署规模。

  7. Z FinanceAI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度|对话框不是 Personal Agent 的终局:Eazo 让图形界面属于每个人

    Eazo 提出对话框并非 Personal Agent 终局:复杂意图先用自然语言表达,需求稳定后沉淀为可点击、可保存、可分享的 Personal Software。

  8. 深思圈AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 陪伴的下一步,会从恋爱游戏里走出来吗?

    Yoroll 旗下 LinearGame 正在内测 AI 陪伴产品 Yyo,其角色来自《华君传》《VOW》《心动相簿》等互动影游,玩家通关后可与角色继续文字、实时语音或视频通话,并一起玩三消、闯关、像素街机等双人小游戏和共享屏幕陪玩。

  9. 机器之心SOTA模型AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,Mistral 开放 Mistral Large 4 公开预览 API

    Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。

  10. 爱范儿AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Vidu Q4 Preview 实测 AI 视频的人物表演与运镜能力

    爱范儿作者提前拿到生数科技 Vidu Q4 Preview 预览版权限,用《沙丘》《喜剧之王》《黑神话:悟空》等片段实测其人物反应、动作运镜和特效表现,认为运镜方向感与主体稳定性是强项,画面风格控制和幻觉问题仍需优化。该预览版定位高表现力旗舰模型,参考生视频支持最多 15 张参考图、3 段参考音频和可选 2K、4K 输出,试拍成本 0.09 元/秒起。

  11. 国际大厂AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌开源 EmbeddingGemma 2:740M 参数支持本地多模态检索

    谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。

  12. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 Pento 推出 miniCOIL EN-ES 双语稀疏神经检索模型

    Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。

  13. 国际大厂AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 开启 API 公开预览,1 万亿参数权重计划月底发布

    Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。

  14. 极客公园AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    极客早知道:ChatGPT 推出 Intelligent UI,谷歌上线 AI 游戏平台 Playground

    OpenAI 在 10 月 7 日将 GPT-6 推向更广泛的 ChatGPT 用户,并同步推出 Intelligent UI,可按问题自动组合文字、图表、按钮和表单,生成可直接操作的界面,功能先从 Plus、Pro、Business 和 Enterprise 用户开放。

  15. 多知AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三家语音优先教育AI公司接连融资,AI开始"开口教学"?

    荷兰Eevi、美国Aristotle与印度YoLearn.ai接连完成Pre-seed至种子轮融资,均把"语音优先"放于产品核心。波士顿大学一项随机实验显示,语音模式下学生对话密度约为文字模式的1.8倍、提问次数约2.4倍,但五周内两种模式的学习掌握程度无显著差异,且语音成本约为文字的2.8倍。

  16. Vercel NewsAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 的 Grok Imagine Video 1.5 Lite 上线 AI Gateway

    xAI 的 Grok Imagine Video 1.5 Lite 已在 AI Gateway 上线,可将文本提示词和图像生成带原生音频的视频。该轻量模型支持 1 至 15 秒时长、480p/720p/1080p 分辨率与七种画幅比例,模型名在 AI SDK 或 AI CLI 中设为 spacexai/grok-imagine-video-1.5-lite。

  17. Runway(@runwayml)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 直接接入 ChatGPT Astra,可在同一聊天窗口完成简报与反馈

    Runway 已直接集成进 ChatGPT Astra,用户可在同一个聊天窗口内给它下简报、让它执行任务并反馈意见。官方未披露模型版本、定价或可用范围,仅给出一个开始使用的链接。

  18. OpenAI(@OpenAI)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用可视化插图帮助深入理解主题

    OpenAI 发布了一则演示,展示用可视化插图把抽象概念具象化,从而加深对某个主题的理解。该内容以视频形式呈现,在 X 上获得 1028 个点赞、26 次转发和约 15.2 万次浏览。

  19. NVIDIA AI(@NVIDIAAI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 SynthID Detector 向所有人开放,NVIDIA Cosmos 生成内容已加入水印

    Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可检测在线内容是否由 GoogleAI 或其行业伙伴的工具生成,伙伴包括 OpenAI、NVIDIA、Kakao,Apple 即将加入。NVIDIA 表示其 build.nvidia.com 上由 Cosmos 生成的内容已使用 SynthID 加水印,任何人都可将内容上传至检测器,确认是否来自其模型。

  20. Perplexity(@perplexity_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 发布 pplx-embed-v2-late 多模态嵌入模型,已上 Hugging Face

    Perplexity 发布 pplx-embed-v2-late,包含两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,支持跨模态查询。两个模型均达到前沿性能,并已在 Hugging Face 公开提供。

10月7日周三
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 3.8 Live 语音到语音模型发布

    Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。

  2. Google AI(@GoogleAI)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 教你识别 AI 生成内容

    Google 发布博文,介绍如何识别 AI 生成内容,引导用户前往 blog.google 查看相关方法。该内容由 Google AI 官方账号分享。

  3. Google AI(@GoogleAI)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 开放 SynthID 独立验证网站,支持 OpenAI、NVIDIA 等合作方水印

    Google 在 synthid.com 开放 SynthID 水印验证入口,任何人可上传图像、视频或音频文件检查是否由 AI 生成,覆盖 Google 自身及 OpenAI、NVIDIA、Kakao 等合作方内容,Apple 也将支持。

  4. Google DeepMind(@GoogleDeepMind)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 SynthID Detector,可在编辑后识别视频音频图像水印

    Google DeepMind 推出 SynthID Detector,可快速识别视频、音频和图像中的 SynthID 水印,即使经过添加滤镜等编辑仍能识别。用户也可使用 Google Chrome、Google Search 和 Gemini App 中已有的 AI 识别功能。

  5. Google DeepMind(@GoogleDeepMind)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 向所有人开放 SynthID Detector

    Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可用于检测在线内容是否由 Google AI 或行业伙伴的工具生成。可检测范围包括 OpenAI、NVIDIA、Kakao 的工具,Apple 即将加入,试用入口为 synthid.com。

  6. TechcrunchAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 上线 SynthID 网站,可识别 AI 生成媒体

    Google 周二上线新网站,任何人都可以借此验证一张图片、一段视频或一段音频是否由 AI 生成。该网站围绕 Google 的 SynthID 水印技术,面向图像、视频和音频三类媒体提供检测入口。

  7. 核心模型与趋势AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta VR Glasses 与 Xreal Aura 上手对比:面戴电脑终于好用了

    Xreal 公布 Android XR 平台混合现实眼镜 Aura 起售价 1,279 美元,比 Meta VR Glasses 的 1,299 美元便宜 20 美元,且今年内出货,Meta 的要到明年年初。

  8. meng shao(@shao__meng)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI Cookbook 新增 5 个示例 App 覆盖 Grok API 四条主线

    xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。

  9. meng shao(@shao__meng)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 EmbeddingGemma 2 端侧多模态嵌入模型

    Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。

  10. Jerry Liu(@jerryjliu0)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈 agentic OCR:传统 OCR 已死,智能体式解析登场

    LlamaIndex 开源负责人 Logan Markewich 发文提出"agentic OCR",把文档解析改成循环流程:布局感知阅读顺序、将难处理元素智能路由到合适模型、多轮校验与自我纠正、对图表和复杂表格做多模态解析。传统 OCR 只做一次处理就直接返回文本,表格被压平、图表丢失、多栏布局错乱且无人校验。该方案认为前沿模型在处理成本与延迟上过度设计,却仍在长尾复杂边缘案例上吃力。

  11. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 开源 EmbeddingGemma 2 多模态嵌入模型,可在手机本地运行

    Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。

  12. ollama(@ollama)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 EmbeddingGemma 2 上线 Ollama,首个原生多模态端侧嵌入模型

    Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。