Gemini 3.7 Flash 联手 Nano Banana 与 Omni,一句话生成视差动画落地页
Gemini 3.7 Flash 结合 Nano Banana 和 Omni,可从单条提示词一次性构建交互动画网站。3.7 Flash 会自动调用相应工具生成文案、图像素材,并渲染适配视差效果的 Omni 视频。
Gemini 3.7 Flash 结合 Nano Banana 和 Omni,可从单条提示词一次性构建交互动画网站。3.7 Flash 会自动调用相应工具生成文案、图像素材,并渲染适配视差效果的 Omni 视频。
Fish Audio 推出多模态创作平台 Fish Creative(@FishCreativeHQ),创作者可在同一空间把想法转成角色、场景和可直接发布的视频。语音由 S2.1 Pro 生成并支持内联情感标签,也可克隆自己的声音;口型同步、图像与视频、音效均在同一画布内完成。
Fish Audio 发布多模态创作平台 Fish Creative,从音频层起步,支持用 S2.1 Pro 生成语音并内嵌情绪标签,也可克隆自己的声音。平台还能将任意人脸与选定声音做唇形同步,并在同一画布上用主流模型生成图像与视频、按需添加音效。
Milvus 3.0 Storage V3 引入 Manifest,用一个统一位置描述数据集状态:某个版本包含哪些文件、遵循什么 schema、适用哪些删除操作,以及关联的统计与索引。
李飞飞在 Huberman Lab 播客中与斯坦福神经科学教授 Andrew Huberman 对话,将智能追溯至5.4亿年前视觉的进化起源,并指出大数据、GPU 算力与神经网络算法三者于 2012 年汇合,成就了 ImageNet 引发的现代 AI 飞跃。
Google 用 Nano Banana 和 Gemini Omni 做了一个 Chrome 扩展,在 Antigravity 中借助 Gemini 3.7 Flash 构建,可高亮网页任意文本即时生成丰富的可视化定义,帮助浏览时深度学习。
Google 将维多利亚时代植物插画书籍的数百份 PDF 输入 Gemini 3.7 Flash,让它按现代 APG IV 分类系统提取并分类这些历史植物。模型的理解结果被做成一个在 Antigravity 中构建的交互式可视化。
庆应大学与 MIT Media Lab 的研究者造出一台氦气填充的漂浮机器人,没有脸、没有旋翼和夹伤点,靠轻柔拍动的鳍片在房间中漂移并用动作与人交流。演示中它充当闹钟、学习伙伴、起身活动提醒,甚至舞伴。团队避开类人脸孔带来的恐怖谷效应,押注这种像宠物般可触摸的软体硬件能被人接受进入个人空间。
Google 发布今年 Pixel 11 系列、Pixel Watch 5 和 Pixel Tag,带来多项 AI 集成,包括同时拍摄视频与照片的 Magic Capture、AI 语音输入与文本转换的 Rambler、以及用 Pixel 摄像头做实时光学手语转文字翻译的 Live Transcribe,并由具备主动性的智能体层 Gemini Intelligence 串联。
阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。
原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。
如果你不确定某张图片、视频或音乐是否由 AI 生成,可以直接问 Gemini「Is this AI-generated?」来验证。Gemini 还提供了水印设置选项,用户可查看相关可用范围与管理方式。
Google 的 Gemini 3.7 Flash 已在 Poe 上线,官方称其为 GoogleAI 最智能的主力模型,具备快速且强大的推理能力,面向编程与智能体场景。该模型支持 100 万 token 上下文窗口,可处理文本、图像、音频和视频。
Google DeepMind 发布手语转文本模型 SL2T,与聋人社区密切合作开发,让用户首次可以直接用手语对着手机表达。该模型为 Android 上聋人和听障用户带来新功能,在 Pixel 11 上从美国手语转英语起步,用户可以在 Gboard 和 Live Transcribe 中直接打手语而无需打字。
开发者 @AparnaSoneja 用自拍在 Ready Player Me 生成 3D 化身,经 Mixamo 绑定骨骼后,在 Bolt 上发布了一个会挥手回应的作品集。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。
Google DeepMind 与听障社区合作构建了 SL2T,在 Deaf Googlers 及 AI 手语咨询委员会的指导下,把 ASL(美国手语)输入带到手机上。团队表示这只是开始,正致力于将该技术扩展到更多手语和应用场景。
Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。
Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。
Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。
Mistral AI 表示世界需要一个开源平台,其正在构建该平台,让客户能按任务选择合适模型,并拥有更多选择与灵活性。作为其中一环,Mistral AI 将继续跨模态创新前沿、高效的开源模型。
LTX-2.5 已在 Replicate 上线,新增 Diffusion Fidelity Rendering,可针对更复杂场景动态增加算力。该模型支持原生 4k HDR、运动与音频。
Microsoft Research 提出 CARE-X,探索将灵活推理、校准预测与基于测量的工具统一用于胸部 X 光解读,让放射学 AI 不再局限于生成报告。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。
腾讯混元推出 Hy3D WorldClaw,一个从文本提示词生成大规模 3D 开放世界的智能体工作流。它不是视频,也不是 Gaussian Splatting,每个场景都完全由可编辑、可直接用于游戏的 3D 资产构建,具备高质量几何与纹理,并可自由探索。
Seedance 2.5 已上线 Replicate,单次可上传最多 50 个参考素材(30 张参考图 + 10 段视频 + 10 段音频),仅凭一条提示词即可生成 30 秒连续或多镜头视频。
微软研究院发布 Vibhasha 实用指南,面向多语言、多文化 AI 系统的构建,目标是让系统同时做到语言准确与文化相关。该指南为实用性质,具体方法、模型与数据细节未在原文中披露。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。
字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。
黑森林实验室的 FLUX 3 Video 已在 Replicate 上线,该多模态模型覆盖视频、音频、图像和动作预测,本次先放出视频能力。它支持生成最长 20 秒、最高 1080p 的视频,具备原生音频、文生视频、多帧图生视频、视频续写和多语言对话,并提供 Draft 模式以更低成本快速试想法,可通过 API 或常用工具使用;2K、4K 和开放权重版本即将推出。
Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。
Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。
微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。
MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。
可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。
MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。
H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。
Binyuan Hui 转发 Andrej Karpathy 的观点并评论,认为做游戏能同时检验 LLM 的推理、规划、编码、工具库使用和多模态理解等能力,但社区仍缺少做游戏的标准化基准。
Andrej Karpathy 用《魔戒》第一段文字和 1M token 预算(约 10 美元)让 Opus 5 做 Three.js 渲染,模型运行约 2 小时后写出 5500 行代码,以程序化方式呈现这段故事。
Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。
字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒,并支持多轮延长。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,强化了白模参考、运动参考、创意参考能力;编辑方面支持时间戳精准控制与定向修改,并升级绿幕、视角、参考编辑。
MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。
MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。
Google 发布 Gemini Robotics ER 2,称其为面向物理 AI 能力最强的具身推理模型,定位为机器人的高层大脑,可直接连接 Gemini Live API。该模型处理连续视频流以跟踪进度、调用工具、搜索网页并实时指挥动作模型,面向开发者新增进度跟踪增强、执行中途故障实时检测、多机器人协作和安全指令遵循等升级。
Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。
Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。