跳到正文

#多模态

今日 10 条
8月19日周三
  1. Google AI Developers(@googleaidevs)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 联手 Nano Banana 与 Omni,一句话生成视差动画落地页

    Gemini 3.7 Flash 结合 Nano Banana 和 Omni,可从单条提示词一次性构建交互动画网站。3.7 Flash 会自动调用相应工具生成文案、图像素材,并渲染适配视差效果的 Omni 视频。

  2. Fish Audio(@FishAudio)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出 Fish Creative:从语音延伸至多模态创作平台

    Fish Audio 推出多模态创作平台 Fish Creative(@FishCreativeHQ),创作者可在同一空间把想法转成角色、场景和可直接发布的视频。语音由 S2.1 Pro 生成并支持内联情感标签,也可克隆自己的声音;口型同步、图像与视频、音效均在同一画布内完成。

  3. Fish Audio(@FishAudio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出多模态创作平台 Fish Creative,从语音层构建完整故事

    Fish Audio 发布多模态创作平台 Fish Creative,从音频层起步,支持用 S2.1 Pro 生成语音并内嵌情绪标签,也可克隆自己的声音。平台还能将任意人脸与选定声音做唇形同步,并在同一画布上用主流模型生成图像与视频、按需添加音效。

8月18日周二
  1. Milvus(@milvusio)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 Storage V3 引入 Manifest,为数据集提供带版本的唯一事实来源

    Milvus 3.0 Storage V3 引入 Manifest,用一个统一位置描述数据集状态:某个版本包含哪些文件、遵循什么 schema、适用哪些删除操作,以及关联的统计与索引。

  2. Web3天空之城AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞对话安德鲁·休伯曼:智能的基石与未来

    李飞飞在 Huberman Lab 播客中与斯坦福神经科学教授 Andrew Huberman 对话,将智能追溯至5.4亿年前视觉的进化起源,并指出大数据、GPU 算力与神经网络算法三者于 2012 年汇合,成就了 ImageNet 引发的现代 AI 飞跃。

  3. Google AI Developers(@googleaidevs)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Nano Banana 和 Gemini Omni 把网页变成交互式视觉百科全书

    Google 用 Nano Banana 和 Gemini Omni 做了一个 Chrome 扩展,在 Antigravity 中借助 Gemini 3.7 Flash 构建,可高亮网页任意文本即时生成丰富的可视化定义,帮助浏览时深度学习。

  4. Google AI Developers(@googleaidevs)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 用 APG IV 分类系统识别维多利亚植物插图

    Google 将维多利亚时代植物插画书籍的数百份 PDF 输入 Gemini 3.7 Flash,让它按现代 APG IV 分类系统提取并分类这些历史植物。模型的理解结果被做成一个在 Antigravity 中构建的交互式可视化。

8月17日周一
  1. Rowan Cheung(@rowancheung)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    庆应大学与 MIT Media Lab 研发无脸漂浮机器人,用动作与人交流

    庆应大学与 MIT Media Lab 的研究者造出一台氦气填充的漂浮机器人,没有脸、没有旋翼和夹伤点,靠轻柔拍动的鳍片在房间中漂移并用动作与人交流。演示中它充当闹钟、学习伙伴、起身活动提醒,甚至舞伴。团队避开类人脸孔带来的恐怖谷效应,押注这种像宠物般可触摸的软体硬件能被人接受进入个人空间。

8月15日周六
  1. Google AI(@GoogleAI)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Pixel 11 系列并上线 Gemini 3.7 Flash

    Google 发布今年 Pixel 11 系列、Pixel Watch 5 和 Pixel Tag,带来多项 AI 集成,包括同时拍摄视频与照片的 Magic Capture、AI 语音输入与文本转换的 Rambler、以及用 Pixel 摄像头做实时光学手语转文字翻译的 Live Transcribe,并由具备主动性的智能体层 Gemini Intelligence 串联。

8月14日周五
  1. Paul Couvert(@itsPaulAi)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源 Qwen3.8-27B 多模态模型,27B 参数对标 Opus 4.6 Max

    阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。

    为什么值得看

    原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。

  2. Google Gemini App(@GeminiApp)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 支持询问「这是 AI 生成的吗」来验证图片视频音乐

    如果你不确定某张图片、视频或音乐是否由 AI 生成,可以直接问 Gemini「Is this AI-generated?」来验证。Gemini 还提供了水印设置选项,用户可查看相关可用范围与管理方式。

  3. Poe(@poe_platform)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 上线 Poe,支持 100 万 token 上下文

    Google 的 Gemini 3.7 Flash 已在 Poe 上线,官方称其为 GoogleAI 最智能的主力模型,具备快速且强大的推理能力,面向编程与智能体场景。该模型支持 100 万 token 上下文窗口,可处理文本、图像、音频和视频。

8月13日周四
  1. Demis Hassabis(@demishassabis)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布手语转文本模型 SL2T,Pixel 11 上支持 ASL 直接输入

    Google DeepMind 发布手语转文本模型 SL2T,与聋人社区密切合作开发,让用户首次可以直接用手语对着手机表达。该模型为 Android 上聋人和听障用户带来新功能,在 Pixel 11 上从美国手语转英语起步,用户可以在 Gboard 和 Live Transcribe 中直接打手语而无需打字。

  2. bolt.new(@boltdotnew)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用自拍生成的 3D 形象:Aparna Soneja 的互动作品集在 Bolt 上线

    开发者 @AparnaSoneja 用自拍在 Ready Player Me 生成 3D 化身,经 Mixamo 绑定骨骼后,在 Bolt 上发布了一个会挥手回应的作品集。

  3. Microsoft Research BlogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MindTopo 揭示多模态大模型的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。

8月12日周三
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 与听障社区共建 SL2T,将 ASL 输入带到手机

    Google DeepMind 与听障社区合作构建了 SL2T,在 Deaf Googlers 及 AI 手语咨询委员会的指导下,把 ASL(美国手语)输入带到手机上。团队表示这只是开始,正致力于将该技术扩展到更多手语和应用场景。

  2. Google DeepMind(@GoogleDeepMind)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind SL2T 在学术基准上达到 SOTA,并针对单手手语等真实场景优化

    Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。

  3. Google DeepMind(@GoogleDeepMind)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。

  4. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。

  5. Mistral AI(@MistralAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI 称正在构建开源平台,持续创新前沿高效开源模型

    Mistral AI 表示世界需要一个开源平台,其正在构建该平台,让客户能按任务选择合适模型,并拥有更多选择与灵活性。作为其中一环,Mistral AI 将继续跨模态创新前沿、高效的开源模型。

  6. Replicate(@replicate)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LTX-2.5 上线 Replicate,新增 Diffusion Fidelity Rendering

    LTX-2.5 已在 Replicate 上线,新增 Diffusion Fidelity Rendering,可针对更复杂场景动态增加算力。该模型支持原生 4k HDR、运动与音频。

  7. Microsoft Research(@MSFTResearch)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 的 CARE-X 探索胸部 X 光统一解读方法

    Microsoft Research 提出 CARE-X,探索将灵活推理、校准预测与基于测量的工具统一用于胸部 X 光解读,让放射学 AI 不再局限于生成报告。

  8. Microsoft Research BlogAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量

    微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。

8月11日周二
  1. Hunyuan(@TXhunyuan)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy3D WorldClaw:从文本提示词生成大规模 3D 开放世界

    腾讯混元推出 Hy3D WorldClaw,一个从文本提示词生成大规模 3D 开放世界的智能体工作流。它不是视频,也不是 Gaussian Splatting,每个场景都完全由可编辑、可直接用于游戏的 3D 资产构建,具备高质量几何与纹理,并可自由探索。

8月7日周五
  1. Replicate(@replicate)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Seedance 2.5 上线 Replicate:支持最多 50 个参考素材

    Seedance 2.5 已上线 Replicate,单次可上传最多 50 个参考素材(30 张参考图 + 10 段视频 + 10 段音频),仅凭一条提示词即可生成 30 秒连续或多镜头视频。

8月6日周四
  1. Microsoft Research(@MSFTResearch)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vibhasha:构建兼具语言准确性与文化相关性的多语言多文化 AI 系统实用指南

    微软研究院发布 Vibhasha 实用指南,面向多语言、多文化 AI 系统的构建,目标是让系统同时做到语言准确与文化相关。该指南为实用性质,具体方法、模型与数据细节未在原文中披露。

8月5日周三
  1. 字节跳动SeedAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线

    字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。

    为什么值得看

    字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。

  2. Replicate(@replicate)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黑森林实验室 FLUX 3 Video 上线 Replicate

    黑森林实验室的 FLUX 3 Video 已在 Replicate 上线,该多模态模型覆盖视频、音频、图像和动作预测,本次先放出视频能力。它支持生成最长 20 秒、最高 1080p 的视频,具备原生音频、文生视频、多帧图生视频、视频续写和多语言对话,并提供 Draft 模式以更低成本快速试想法,可通过 API 或常用工具使用;2K、4K 和开放权重版本即将推出。

  3. Mistral AI(@MistralAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 内容审核模型:以自然语言政策输出校准评分,统一处理文本与图像

    Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。

  4. Mistral AI(@MistralAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Shieldstral:单张 16GB GPU 上的多模态内容审核模型

    Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。

8月4日周二
  1. Microsoft Research(@MSFTResearch)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软推出 PRISM2:基于真实病理报告训练的病理多模态基础模型

    微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。

  2. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 开源 24 小时,超百家企业 Day 0 上线

    MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。

    为什么值得看

    可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。

8月3日周一
  1. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 正式开源通用视频模型 MiniMax H3

    MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。

    为什么值得看

    H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。

  2. Binyuan Hui(@huybery)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Binyuan Hui 转述 Karpathy:用 LLM 造游戏或成综合能力测试方向

    Binyuan Hui 转发 Andrej Karpathy 的观点并评论,认为做游戏能同时检验 LLM 的推理、规划、编码、工具库使用和多模态理解等能力,但社区仍缺少做游戏的标准化基准。

8月2日周日
  1. Andrej Karpathy(@karpathy)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:让 Opus 5 用 5500 行代码渲染《魔戒》第一段

    Andrej Karpathy 用《魔戒》第一段文字和 1M token 预算(约 10 美元)让 Opus 5 做 Three.js 渲染,模型运行约 2 小时后写出 5500 行代码,以程序化方式呈现这段故事。

8月1日周六
  1. Google AI(@GoogleAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 汇总 Gemini 近期更新:Gemini Robotics 2、3.5 Flash-Lite、3.6 Flash 等

    Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。

7月31日周五
  1. 字节跳动SeedAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布视频创作模型 Seedance 2.5

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒,并支持多轮延长。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,强化了白模参考、运动参考、创意参考能力;编辑方面支持时间戳精准控制与定向修改,并升级绿幕、视角、参考编辑。

  2. MiniMax 稀宇科技AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 发布全模态生成模型 H3,计划开放模型权重

    MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。

    为什么值得看

    MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。

7月30日周四
  1. Google AI Developers(@googleaidevs)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini Robotics ER 2 具身推理模型

    Google 发布 Gemini Robotics ER 2,称其为面向物理 AI 能力最强的具身推理模型,定位为机器人的高层大脑,可直接连接 Gemini Live API。该模型处理连续视频流以跟踪进度、调用工具、搜索网页并实时指挥动作模型,面向开发者新增进度跟踪增强、执行中途故障实时检测、多机器人协作和安全指令遵循等升级。

  2. Google AI(@GoogleAI)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2 与具身推理模型 Gemini Robotics ER 2

    Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。

    为什么值得看

    Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。