全球最大独立 AI 原生影视公司 Utopai Studios,要打造「AI 版 Disney」
全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。
全球最大独立 AI 原生影视公司 Utopai Studios 正以自研视频模型 Utopai X 与制片平台 PAI 推进多部院线长片,定制视频模型 Utopai X 曾在 Artificial Analysis 文生视频盲评榜排到全球第二、全美第一。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。
论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。
Anvisha 发布 Voyager,一个面向视频、图形和游戏创作的开放 harness,被形容为创意工作的 Codex。它自带免费的图形、音乐和视频编辑工具,也能在桌面端驱动 Blender、DaVinci Resolve、After Effects、Ableton 等 100 多个应用,并支持 Opus、Astra、DeepSeek 等模型。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
上戏毕业的山音与广告公司职员 KK 用两年时间成为 AI 导演,作品登上国内外电影节。他们最常使用的 AI 视频产品是 CapCut Video Studio,同一部片子会混用 Seedance、MiniMax 等多个模型。两人在播客中讨论了 AI 视频产品在底层模型趋同后的壁垒,以及"AI 无限,人生有限"的创作者困境。
GPT-6 Astra 读取用户 Memory 后,按用户喜好用 Blender 建模的几个模型做了一张海报,模型的细节、材质、光影都做得很好。
SynthID Detector(synthid.com)现已公开可用,支持 Nano Banana 2.1、OpenAI、NVIDIA、Kakao,并即将支持 Apple。用户可上传或粘贴图片、视频、音频文件,扫描 Google 及其合作方的水印,文件在扫描后即被删除。
Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。
在 InfoQ《极客有约》X QCon 直播中,快手鲜嘉麒与爱奇艺路香菊、阿里巴巴邹娟、生数科技郑重讨论 AIGC 内容生产为何难落地:竞争单位已从一个 clip 变成完整生产链路,用户追问人物一致性、商品变形、按时交付与成本可控。真实成本是生成、重试、审核、人工编辑等之和除以合格成片数。
Opus 5.5 接入 MiniMax Design,可通过编写代码将文本转为视频,覆盖 JavaScript 动画、动态图形、解说视频与视觉叙事、Web 与产品演示等场景。该模型不止于语言模型,还能理解视觉内容并持续打磨用户的创作。
医疗 AI 的万亿价值可能落在三类资产上:Pro Medicus 的影像工作流软件、Tempus AI 的诊断与患者数据、德适科技的医疗影像大模型。三家公司 2026 年 10 月 6 日市值分别约为人民币 780 亿元、875 亿元和 220 亿元。
H-Company 借助 NVIDIA Dynamo 优化面向 Computer Use Agents 的 VLM 服务。该内容以直播形式发布,未披露具体的性能数据、模型版本或部署规模。
Eazo 提出对话框并非 Personal Agent 终局:复杂意图先用自然语言表达,需求稳定后沉淀为可点击、可保存、可分享的 Personal Software。
Yoroll 旗下 LinearGame 正在内测 AI 陪伴产品 Yyo,其角色来自《华君传》《VOW》《心动相簿》等互动影游,玩家通关后可与角色继续文字、实时语音或视频通话,并一起玩三消、闯关、像素街机等双人小游戏和共享屏幕陪玩。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
爱范儿作者提前拿到生数科技 Vidu Q4 Preview 预览版权限,用《沙丘》《喜剧之王》《黑神话:悟空》等片段实测其人物反应、动作运镜和特效表现,认为运镜方向感与主体稳定性是强项,画面风格控制和幻觉问题仍需优化。该预览版定位高表现力旗舰模型,参考生视频支持最多 15 张参考图、3 段参考音频和可选 2K、4K 输出,试拍成本 0.09 元/秒起。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
OpenAI 在 10 月 7 日将 GPT-6 推向更广泛的 ChatGPT 用户,并同步推出 Intelligent UI,可按问题自动组合文字、图表、按钮和表单,生成可直接操作的界面,功能先从 Plus、Pro、Business 和 Enterprise 用户开放。
荷兰Eevi、美国Aristotle与印度YoLearn.ai接连完成Pre-seed至种子轮融资,均把"语音优先"放于产品核心。波士顿大学一项随机实验显示,语音模式下学生对话密度约为文字模式的1.8倍、提问次数约2.4倍,但五周内两种模式的学习掌握程度无显著差异,且语音成本约为文字的2.8倍。
xAI 的 Grok Imagine Video 1.5 Lite 已在 AI Gateway 上线,可将文本提示词和图像生成带原生音频的视频。该轻量模型支持 1 至 15 秒时长、480p/720p/1080p 分辨率与七种画幅比例,模型名在 AI SDK 或 AI CLI 中设为 spacexai/grok-imagine-video-1.5-lite。
Runway 已直接集成进 ChatGPT Astra,用户可在同一个聊天窗口内给它下简报、让它执行任务并反馈意见。官方未披露模型版本、定价或可用范围,仅给出一个开始使用的链接。
OpenAI 发布了一则演示,展示用可视化插图把抽象概念具象化,从而加深对某个主题的理解。该内容以视频形式呈现,在 X 上获得 1028 个点赞、26 次转发和约 15.2 万次浏览。
Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可检测在线内容是否由 GoogleAI 或其行业伙伴的工具生成,伙伴包括 OpenAI、NVIDIA、Kakao,Apple 即将加入。NVIDIA 表示其 build.nvidia.com 上由 Cosmos 生成的内容已使用 SynthID 加水印,任何人都可将内容上传至检测器,确认是否来自其模型。
Perplexity 发布 pplx-embed-v2-late,包含两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,支持跨模态查询。两个模型均达到前沿性能,并已在 Hugging Face 公开提供。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。
Google 发布博文,介绍如何识别 AI 生成内容,引导用户前往 blog.google 查看相关方法。该内容由 Google AI 官方账号分享。
Google 在 synthid.com 开放 SynthID 水印验证入口,任何人可上传图像、视频或音频文件检查是否由 AI 生成,覆盖 Google 自身及 OpenAI、NVIDIA、Kakao 等合作方内容,Apple 也将支持。
Google DeepMind 推出 SynthID Detector,可快速识别视频、音频和图像中的 SynthID 水印,即使经过添加滤镜等编辑仍能识别。用户也可使用 Google Chrome、Google Search 和 Gemini App 中已有的 AI 识别功能。
Google DeepMind 宣布 SynthID Detector 现已向所有人开放,可用于检测在线内容是否由 Google AI 或行业伙伴的工具生成。可检测范围包括 OpenAI、NVIDIA、Kakao 的工具,Apple 即将加入,试用入口为 synthid.com。
Google 周二上线新网站,任何人都可以借此验证一张图片、一段视频或一段音频是否由 AI 生成。该网站围绕 Google 的 SynthID 水印技术,面向图像、视频和音频三类媒体提供检测入口。
Xreal 公布 Android XR 平台混合现实眼镜 Aura 起售价 1,279 美元,比 Meta VR Glasses 的 1,299 美元便宜 20 美元,且今年内出货,Meta 的要到明年年初。
xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
LlamaIndex 开源负责人 Logan Markewich 发文提出"agentic OCR",把文档解析改成循环流程:布局感知阅读顺序、将难处理元素智能路由到合适模型、多轮校验与自我纠正、对图表和复杂表格做多模态解析。传统 OCR 只做一次处理就直接返回文本,表格被压平、图表丢失、多栏布局错乱且无人校验。该方案认为前沿模型在处理成本与延迟上过度设计,却仍在长尾复杂边缘案例上吃力。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。