阿里巴巴 Happyhorse 1.1 上线 Replicate,支持文本、图像与参考视频生成
阿里巴巴 Happyhorse 1.1 已在 Replicate 上线,提供文本、图像和参考视频三种生成模式,支持多语言唇形同步与原生音频。该模型支持 720p 和 1080p 分辨率,参考视频生成(r2v)最多可使用 9 张参考图像。
阿里巴巴 Happyhorse 1.1 已在 Replicate 上线,提供文本、图像和参考视频三种生成模式,支持多语言唇形同步与原生音频。该模型支持 720p 和 1080p 分辨率,参考视频生成(r2v)最多可使用 9 张参考图像。
阿里巴巴的 happyhorse 模型现已上线 Replicate,可通过 replicate.com/alibaba/happyhorse 试用。该模型由 Replicate 平台发布,具体参数与功能细节尚未公布。
斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。
李飞飞转发并回应 Hugues Bruyère 关于 World Labs 与 Marble 的分享,称 World Labs 创立的初衷是赋能人类创造力与生产力。相关 Fast Company 文章讨论了空间智能与世界模型或是 AI 下一个大转变。Bruyère 介绍了自己以体积捕捉、光场重建和 Marble 等工具混合物理现实与生成式操控的实践。
Midjourney 宣布成立新部门 Midjourney Medical。此前 Midjourney 的软件业务从文本生成图像,硬件业务则用声波生成人的图像。新部门的具体产品和方向尚未披露。
Midjourney Medical 宣布推出全身超声计算断层扫描(full body ultrasonic computational tomography)。其目标是建成一支 5 万台扫描仪组成的机队,合计每月完成 10 亿次扫描,让全身成像惠及地球上每个人。
通义实验室发布 Qwen-Robot 系列,用三个专业基础模型弥合从认知到行动的鸿沟:Qwen-RobotNav 统一指令跟随、点/目标导航、目标追踪和自动驾驶四类任务,Qwen-RobotManip 基于超过 38,100 小时数据实现跨本体训练,Qwen-RobotWorld 以自然语言动作接口跨场景预测物理未来。
通义实验室一次发布三款具身基础模型,给出统一语言接口与跨本体数据方案,可观察大模型接入物理行动的路径。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。
哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。
阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。
苹果在 WWDC26 上宣布 Siri 的 AI 升级将接入谷歌 Gemini 而非 OpenAI,同时 iPhone 17 Pro 塞进了史无前例的 20B 端侧模型,并采用苹果自研 MoE 架构、未让谷歌插手。Siri 还新增摄像头入口与全局上下文能力,Xcode 模拟器已支持双倍宽度,被指为折叠屏硬件铺路。这很可能是库克以 CEO 身份主持的最后一场 WWDC,九月后由硬件负责人特努斯接任。
Fei-Fei Li 发推祝贺 World Labs 与 Lore 合作,将创意转化为用户可在浏览器直接运行的交互式世界体验,而非视频。World Labs 称其把梦想变成世界,并填入历史伟人,内容直接在浏览器中运行。
Google 发布 Gemini 3.5 Live Translate 音频模型,可自动识别 70+ 语言并输出接近实时的语音到语音翻译,保留说话人的语调、节奏和音高。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。
Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。
Jina AI 推出基于 jina-v5-omni 嵌入向量的本地多模态文件搜索工具,完全离线运行,可索引文本、PDF、图片、音频和视频。
Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。
NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。
Google 发布 Gemma 4 12B,这是一个统一的无编码器多模态模型,采用 Apache 2.0 许可,可直接在笔记本电脑上运行。该模型定位在端侧效率与高级推理之间,Jeff Dean 称其为能力很强的开放权重模型。
谷歌在 Google I/O 2026 上缺席 Gemini 3.5 Pro、未更新 Veo,被外界视为遗憾,但极客公园播客邀请亲赴现场的 Bryan Liu 与作者 Alan 解读这场发布会背后的野心。节目指出谷歌把模型分成「干活的」和「思考的」,并借 Gemini Spark、Gemini 重写操作系统及谷歌眼镜,展现将讲故事权利还给所有人、成为用户「外置大脑」的方向。
MongoDB 提出用 MongoDB Atlas、Voyage AI 与多模态搜索构建智能体供应商管理方案,把分散在遗留系统、PDF、表格和邮件里的供应商数据统一起来,并叠加 AI copilot 提升供应链可见性与韧性。方案针对的是 ERP 系统批处理延迟造成的实时响应瓶颈,原文未给出具体模型版本、参数或 benchmark 数据。
李飞飞等人推出 GPIC(Giant Permissive Image Corpus),一个面向大规模生成模型时代的视觉生成数据集与基准,含 1 亿条 VLM 标注图文对用于训练、100 万条图文对用于评测,总计约 28 万亿像素。该数据集完全允许研究及商业用途,采用集中托管,并同时提供数据集、基准与模型。
Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。
吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。
Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。
Demis Hassabis 在 X 上分享了 Gemini 3.5 Flash 模型的更多信息,并附上 blog.google 的链接。该帖获得 131 个点赞、13 次转发和 33890 次浏览。
Gemini Omni Flash 已在 Gemini App 和 Flow 中开放体验,Demis Hassabis 称其"玩起来非常有趣",并表示期待看到用户的创作。更多细节见 Google 官方博客。
Demis Hassabis 宣布 Gemini Omni 在世界理解与多模态编辑上实现重大跨越,可接收照片、视频和音频并构建全新场景。他表示该模型将逐步支持任意输入与任意输出,先从视频开始,用户还可输入自己的视频来迭代想法。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。
Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。
Google 宣布扩展内容透明与验证工具,把 SynthID 的水印核查能力从 Gemini app 扩展到 Search 和 Chrome,此前该功能已被全球使用 5000 万次。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研和气候领域落地新项目。合作探索 AI 辅助临床的“三元照护”、用 AlphaFold 与 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的视障跑者助手。Google 还向新加坡中小学至初级学院全体教师提供 Gemini for Education 及配套培训。
Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。
原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。
Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,在 v5-text 文本能力基础上扩展到图像、音频、视频和 PDF,文本向量与 v5-text 逐字节一致,现有索引无需重建。
理想汽车创始人李想做客罗永浩播客《十字路口》,介绍已完成从汽车公司向 AI 和具身智能公司的阶段性转型,并发布新一代旗舰 SUV L9 Livis。L9 Livis 搭载理想自研马赫 M100 芯片,算力达 2560 TOPS,配备全球首个完全体全线控底盘与 800V 主动式悬架系统,定位五十万元左右档位。
Jina AI 发布 v5-omni,完全冻结 v5-text 主干,仅通过小型可训练投影层接入预训练视觉与音频编码器。视觉端采用 Qwen3.5 vision encoder 并做 2x2 空间合并,除最终投影层 fc_vision_2 外全部冻结,该层随机初始化并映射至文本主干隐藏维度。
Jina v5-omni 已在 Elastic Inference Service、HuggingFace 和 Jina API 上线。相关模型可在 HuggingFace 集合页获取,技术细节见 arXiv 论文 2605.08384 与 Jina 官方博客。
Jina AI 推出 jina-embeddings-v5-omni,这是其首个通用嵌入模型,支持文本、图像、音频和视频。模型提供 small(1.57B,1024 维,32K 上下文)和 nano(0.95B,768 维,8K 上下文)两种规格,均支持 Matryoshka 截断至 32 维。
Thinking Machines 公布了一款可与人实时协作的 AI 模型,能像人一样同时听说、观看、思考与协作。团队称过去几个月产出 12 个版本(含多个子版本)和 137 页训练运行日志,并表示人与人的协作对提升人机协作很重要。该博客分享了其方法、早期结果及模型实际运行演示。
Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。