跳到正文

#多模态

今日 12 条
9月21日周一
  1. 谷歌开发者AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Omni 创意实践:五位开发者如何用视频生成与编辑做演示

    Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。

  2. 字节跳动技术团队AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从“看见文字”到“读懂画面”:火山引擎 AI MediaKit 如何实现视频字幕无痕擦除

    火山引擎推出 AI MediaKit 理解式视频编辑引擎,以自研 ReFM(残差式流匹配)为视频生成修复主干,通过多模态语义理解区分后期叠加文字与场景固有文字,再以 4 步采样完成无痕擦除。该方案支持 50 多种语种的文字擦除,并已构建覆盖文字检测、多模态判断、视频修复与结果校验的完整流水线,支持长视频连续处理与原规格交付。

  3. 沃垠AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:五项任务表现如何

    作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。

  4. Vercel NewsAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2.6 Pro、Flash 与 Pro UltraSpeed 上线 Vercel AI Gateway

    小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。

9月20日周日
  1. Yann LeCun(@ylecun)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:自回归 LLM 本身不会通向人类级 AI

    Yann LeCun 重申"自回归 LLM 本身不会通向人类级 AI"依然成立,理由包括当前推理依赖非自回归搜索、自我改进仅在数学和代码等可自动评分的领域有效、多模态助手多用独立训练的编码器。

  2. Qwen(@Alibaba_Qwen)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    vLLM-Omni 为 Qwen-Image-2.1 提供 day-0 支持

    阿里 Qwen 的 Qwen-Image-2.1 在 vLLM-Omni 获得 day-0 支持,可在同一模型内生成、编辑并输出透明背景图像。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,安装方式与支持的组合已发布在 vLLM recipes 页面。

  3. Qwen(@Alibaba_Qwen)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 支持多种图像编辑任务并兼顾性能平衡

    Qwen-Image-2.1 支持多种图像编辑任务,并在各项任务间平衡性能表现。给定三视图角色参考图后,该模型可生成完整故事板。

  4. 夕小瑶科技说AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    完整教程:用 GPT-6 Astra+Blender 从零开始搭建一个3D 手势交互机器人

    作者分享用 GPT-6 Astra、Meshy 和 Blender 把个人 IP 夕小瑶做成 3D 手势交互网页的完整流程,网页已上线可体验。

  5. MiniMax 稀宇科技AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 公布全球六大合作案例:从新加坡 AI 课程到沙特 Humain-M3

    MiniMax 发布六个全球合作案例,涵盖新加坡 Singtel AI Pass 上线 MiniMax Agent、海螺 AI 和 MiniMax Audio,东京发布 MiniMax H3 IP 版,以及 Genspark 基于 MiniMax M3 后训练出 PPT 模型 Gen-1 Slides。

9月19日周六
  1. Qwen(@Alibaba_Qwen)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布实时同传模型 Qwen3.8-LiveTranslate

    阿里发布新一代实时同传模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在 60 种语言上把平均滞后 LAAL 从 2.8 秒降至 2.3 秒,并提升忠实度、流畅度与简洁度。新能力包括多人语音的实时说话人分离并可稳定克隆保留各说话人音色、原文与译文同屏对照的双语显示,以及利用对话历史消歧名称和术语的长上下文能力。

  2. Pika(@pika_labs)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pika 推出 Camera Director 应用:上传单个镜头即可生成多种机位角度

    Pika 发布 Camera Director 应用,上传一个镜头即可获得多种其他机位角度的画面,现已在新的 Pika 平台上线。Pika 将自身定位为面向创作者打造、由创作者共建的 AI 创意平台,强调简洁、全面,并以满足严苛标准的内容输出为目标。

  3. Pika(@pika_labs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pika 推出 Camera Director 应用:上传片段即可多角度重拍同一场景

    Pika 发布 Camera Director 应用,可对任意场景进行多角度重拍——上传一段片段,即生成一整套替代视角选项,同时保持原场景的运动与表演。该功能属于 Pika 新推出的 AI 创意平台,Pika 称其面向创意工作者、追求满足严苛标准的输出。

  4. 宝玉的分享AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT 6 Astra 和 Codex 做 3D 版《桃花源记》:含完整提示词

    作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。

  5. Google AI(@GoogleAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 周报:Gemini 3.8 Live 音频模型、Dreambeans、Google Pics 等更新

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为目前最先进的实时对话音频模型。Google Labs 的个性化故事集 Dreambeans 与 Google Workspace 图像工具 Google Pics 均转为正式可用,同属 Google Labs 的 CC 则从个人效率工具扩展为面向家庭协作的共享智能体。

  6. Fish Audio(@FishAudio)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出基于流式 TTS 的实时语音到语音翻译,支持 80+ 语言

    Fish Audio 发布实时语音到语音翻译演示,基于其流式 TTS 构建,支持 80+ 语言的单向翻译与双向对话。官方已开放体验入口与实现代码,开发者可直接上手构建自己的应用。

9月18日周五
  1. 机器之心SOTA模型AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包2.1 Pro 0915版支持多模态编程,Anthropic开源生物模型推理工具集,ChatGPT for Word上线

    豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。

  2. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hailuo AI 展示分镜快速生成:3x3 分镜图一键转 AI 动画

    Hailuo AI 演示了用 MiniMax H3 Max 的 r2v 功能将一张 3x3 分镜图直接转成 AI 动画,输出为 480p、15 秒。演示提示词要求画面按左上到右下逐格切换的 2D 动画,并禁止多面板和 BGM,Prompt 调整为 Quality、参照强度为标准。

  3. Founder ParkAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实时交互模型:一个还没形成共识的赛道,怎么就成了热门?

    交互模型正成为一个尚未收敛的热门赛道,Loopit、Reverie AI、SigmaZ AI 等团队各以「交互世界模型」「交互模型」「下一代 AI Interface」等不同称呼切入,Runway 也推出实时角色 Characters、可交互世界 GWM Worlds 和生成交互界面的 Solaris。

  4. 沃垠AIAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    视频模型开始性能过剩,巨日禄「本入剧出」用模型路由拼生产调度

    巨日禄推出「本入剧出」,不再让创作者先选模型,而是按高、中、低三档产出标准由系统自动决策,低档1500块可跑60集。其模型路由会按镜头难度自动调度不同模型,并保留剧本解析、分镜管理、剪辑等全流程人工干预,已服务7万+影视制作团队。

  5. 阿里研究院AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布全模态模型 Qwen3.8-Omni-Flash

    新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。

    为什么值得看

    原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Omni-Flash 全模态模型,主打智能体能力

    阿里发布 Qwen3.8-Omni-Flash,称其为 Qwen 首个围绕智能体能力构建的全模态模型,将原生音视频理解、推理与工具调用整合在同一模型中,实现理解内容、规划任务、用工具执行并交付结果。

  7. Vercel NewsAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 上线 AI Gateway,约 200 tokens/s 高速推理

    Z.ai 的多模态编码模型 GLM 5.3 FlashX 现已上线 AI Gateway,提供约 200 tokens/s 的高速推理服务,适合编码智能体、工具循环和交互式应用。模型 ID 为 zai/glm-5.3-flashx,可在各 API 格式和编码智能体中调用。AI Gateway 按供应商价格原价计费,不收取推理平台费,BYOK 请求同样适用。

  8. Character.AI(@character_ai)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 详解 CAI-MM-Studio:245 种机位与漫画专用模型

    Character.AI 公布其全栈多模态基础设施 CAI-MM-Studio,支持多种画风、245 种相机机位,以及多角色场景在同一画风下保持一致。平台还上线了漫画专用模型,可在整部漫画中保持角色与对话一致,部分创作者已完成逾 100 页。Character.AI 称自研每一环节让新能力数周内上线,推理在消费级规模下保持快速且低成本。

  9. Character.AI(@character_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 分享 CAI-Image 图像模型家族如何工作

    Character.AI 对开源图像模型进行后训练,做出自己的 CAI-Image 模型家族,目标是让同一个 Character 在故事所需的每种风格、场景和页面中都保持可识别。该模型家族支撑 Character.ai 上的 Comics 与图像生成功能。

  10. NVIDIA AI(@NVIDIAAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 用 32 张图测试 Atlas 世界模型,可在 NVIDIA Voyager 实时漫游

    World Labs 用 NVIDIA Voyager 总部的 32 张图像测试其世界模型 Atlas:Atlas 把文本、图像、视频和 3D 纳入统一空间上下文,可用这些图像作为 3D 空间上下文生成新视角,实现像素级精确的实时相机漫游。Atlas 在 NVIDIA Blackwell GPU 上从零预训练。

  11. NotebookLM(@NotebookLM)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Notebook 移动应用相机功能可将照片转为详细研究文档

    Gemini Notebook 移动应用的相机功能支持拍摄照片后生成详细报告,Steven Johnson 在 Sierras 实地研究时用其拍摄博物馆展板,得到的文本转录经本人核查准确率约 99%。他计划为所有拍摄照片批量生成此类文档,再让 Notebook 标出对已有资料库有新增价值或与当前写作大纲相关的内容。

  12. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1,现已可在 Hugging Face 使用

    Jina AI 推出 OCR 模型 jina-ocr-v1,已在 Hugging Face 上线可直接使用,并同步放出技术报告与模型博客。官方同时向用户征集使用反馈。

  13. Jina AI(@JinaAI_)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1:基于 DeepSeek-OCR 后训练,支持 25 种语言

    Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。

9月17日周四
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Broad Institute、埃克塞特大学等机构研究者用 AlphaGenome Atlas 识别致病 DNA 变异

    Broad Institute、埃克塞特大学等机构的研究者已在使用 AlphaGenome Atlas,以更好地识别潜在的致病 DNA 变异并解读其作用。该工具由 Google DeepMind 推出,用于变异识别与功能解读。

  2. 机器之心SOTA模型AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    太初开源 ZDTaichu5.0-9B 空间理解模型,Anthropic 合并 Claude Cowork 与聊天并推出 Docs、Slides

    太初团队开源 ZDTaichu5.0-9B 空间理解模型,结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器,支持文本、图片、视频输入,覆盖文档、图表、OCR 与视觉问答,并已提供权重、本地推理示例和适配的 vLLM 服务镜像。

  3. AI产品黄叔AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我让9岁女儿用豆包爱学在错题和旅行中做了一场 AI 教育实验

    AI产品黄叔和媳妇用刚全面升级的豆包爱学给9岁女儿做学习实验:拍下四年级数学错题后进入 AI老师1v1,讲解现场生成、孩子可随时打断提问,还能追问"举一反三"再出三道同类题。豆包爱学还能引导孩子自己复盘错题、约10秒生成知识闪卡,并在豆包课堂提供数学同步课、古诗文课和定制课程。黄叔把飞书文档资料喂进去,约3分钟就生成了天津《俗世奇人》图文课程。

  4. 字节跳动技术团队AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    火山引擎日志服务 TLS AgentLoop 支持多模态调用观测

    火山引擎日志服务 TLS AgentLoop 新增多模态内容展示能力,开发者可在 Session、Trace 和 Span 中直接查看图片,并与提示词、模型输出、工具结果对照排查。

  5. 向阳乔木推荐看AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三个月后豆包 Seed-2.1-pro-0915 实测:7个案例看进化多少

    向阳乔木用豆包 Seed-2.1-pro-0915 实测 7 个案例,覆盖深度调研、多模态 Agent 开发、Blender 3D 建模、视频生成、钓点地图、视频剪辑与代码仓库分析。

  6. 阿真IreneAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-pro 0915 版本多模态 Coding 与长任务实测

    豆包 Doubao-Seed-2.1-pro 升级到 0915 版本,官方称重点提升 Coding、Agent 与多模态能力。作者实测了用平面图和作品资料生成三维电子展馆网页、从零策划含 Office 三件套的完整游戏项目、以及借助 Blender MCP 生成白模运镜参考视频再交给 Seedance 出片等案例。

  7. Kling AI(@Kling_ai)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fountain 0 新片 ODYSSEUS: The Fall 全片由 Kling 3.0 生成

    Fountain 0 的新片《ODYSSEUS: The Fall》已完整上线,全部镜头由 Kling 3.0 独家生成,导演为 Ash Koosha。该团队此前的《Dreams of Violets》曾作为首部被主流电影节接受的 AI 长片在 2026 Tribeca 首映。

  8. 袋鼠帝AI客栈AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-Pro 升级实测:5个多模态 Agent 案例

    字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。

  9. 暗涌WavesAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    科理新序张载熙:做AI4S多模态基座模型,以Science Token计费

    普林斯顿博后张载熙创立AI4S公司科理新序(Scinetics),近日完成近5000万元人民币融资,英诺科创基金领投,沂景资本、小苗朗程、麟阁创投跟投。公司核心是开发多模态长程推理基座模型,提出Science Token概念,将小分子、核酸、蛋白质结构等科学数据转为统一表征单元,不经过人类语言转译,短期聚焦生命科学。

  10. NVIDIA AI(@NVIDIAAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 ECCV 2026 发布 Axolotl3D:多模态遮挡感知 3D 生成模型

    NVIDIA 研究团队在 ECCV 2026 发布 Axolotl3D,一个多模态、遮挡感知的 3D 生成模型,结合图像、相机数据和部分几何信息重建缺失区域并保留已观测区域,在单视图与多视图设置下均取得 SOTA 结果。

9月16日周三
  1. QdrantAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 测试 SHIFT:无需训练缓解多语言 RAG 的语言偏置

    Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。

  2. Sundar Pichai(@sundarpichai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 公布 AI 加速科学与改善生活的四大重点方向

    Google 公布了以 AI 加速科学、改善生活的进展,聚焦健康、自然灾害与天气韧性、学习、经济机会四个领域。上周进展包括用 AlphaGenome Atlas 绘制人类基因组全部 9B 种单字母遗传变异并开放给研究者,推出迄今最准的全球天气 AI 模型 WeatherNext 3,还发布了开放获取的 AI & Economy ATLAS。目前其服务覆盖近 300 种语言、70 亿使用者。