Google 发布 Gemini Omni 1.1 Flash 视频生成与编辑模型
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供生成式视频的创作控制能力,通过 Gemini API 和 Google AI Studio 使用。
Milvus 3.0 推出 StructArray,可在单个实体内完成多向量搜索,视频、文档、商品各自的片段嵌入无需拆成独立数据库行,元素与父实体保持关联并携带自身向量和标量元数据。
智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。
文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。
Qwen3.8-Flash 已在 OpenRouter 上线,一次 API 调用即可支持编程助手、智能体工作流和长视频理解。该模型为多模态推理模型,面向代码库与文档分析、桌面交互、图表和长视频等场景。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
Replicate 上线阿里 Wan 3.0 的加速版本 Wan 3.0 Prime,支持文生视频、图生视频和参考驱动工作流。该版本可一次性生成最长 30 秒的片段,并集成音视频一体化生成。
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,支持智能转写、函数调用和实时流式传输,转写更精确(WER 更低)。该模型还支持自定义词表、多说话人识别,并覆盖超过 85 种语言。
Google 发布转录模型 Gemini 3.5 Transcribe,支持 85+ 种语言的语境感知语音转文字,可自动过滤填充词并格式化非结构化语音。该模型还能结合屏幕上下文执行语音指令,把杂乱的语音输入和本地文件转成邮件草稿。
Google 发布 Gemini 3.5 Transcribe,可让应用理解用户语音与意图,并支持多说话人场景。该模型开箱即可自动检测 85 种以上语言,并提供针对专业术语的自定义词表适配。API 现已在 Google AI Studio 和 Gemini Enterprise 上线,也可在 macOS 的 Gemini 应用或 Android 的 Rambler 中试用。
Google DeepMind 更新语音识别能力,可自动检测并转写 85+ 种语言的语音,在嘈杂环境下也能更准确理解复杂电话号码、邮编和订单 ID。新版本还能去除填充词、自动格式化文本,并通过自定义词表识别特定人名和产品名。该功能已在 macOS 版 Gemini App 和 Android 版 Gboard 上线,开发者可在 Google AI Studio 和 Antigravity 中构建。
Fish Audio 发布 iOS 版,将桌面端完整语音工作室搬到移动端。用户可浏览 200 万+ 声音、用 80+ 语言制作多说话人对话、通过开放式标签直接控制情绪,还能克隆自己的声音或凭单条提示词设计音色。
哈佛商学院在其面向创业者和早期初创公司的 HBS Foundry 项目中,用 HeyGen 的 LiveAvatar 为教授构建交互式 AI 分身,创始人可随时与它们练习路演、销售通话和董事会会议。据《纽约时报》报道,这门 699 美元的课程已在 100+ 所大学上线。HeyGen 表示这正体现其定位:放大人类专业知识,而非取代它。
Qwen 发布 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重,API 上线 QwenCloud。
Qwen3.8-Flash 以 1/9 训练成本超越前代,并作为 Qwen4 架构的早期预览开放权重,可据此观察下一代架构取向。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
Z.ai 发布 GLM-5.3-Flash,原生多模态、支持 100 万 token 上下文窗口,模型规模为 320B-A18B,以 MIT 许可证开放权重,此前以 Ox Alpha 为名预览并完全运行在中国 AI 芯片上。
从公开定价、上下文窗口和 MIT 开源许可三个维度,可以判断这款模型对日常任务的成本影响。
智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。
vLLM 宣布在发布首日即支持阿里 Qwen3.8-Flash-Next,并已在 NVIDIA 和 AMD GPU 上验证。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
阿里 Qwen 团队发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。模型总参数 125B,另有 51B N-gram 嵌入,每个 token 仅激活 6B;生产版本将很快通过 QwenCloud API 提供,价格为每 1M 输入 token 0.16 美元、每 1M 输出 token 0.47 美元。
Qwen3.8-Flash 以 6B 激活参数和低价 API 给出成本效率数据,并开源权重预览 Qwen4 新架构。
Fish Creative 现已上线 Seedance 2.5,可将创意直接生成为 30 秒带音频的视频。该功能在 Fish Creative 平台 Live now,官方以"创意的兔子洞更深了"宣传此次更新。
Sundar Pichai 在访谈中预测,3 年后任何内容都能从任意模态转换到任意模态,消费者自选形式,创作者只提供想法、品牌与个性。他认为今天的技术回头看会像翻盖手机一样原始,并称当人人都能生产内容时,数量不再构成优势,专注质量才是创作者胜出的关键。YouTube 新政策针对的是低质内容(slop)而非 AI 本身。
Weaviate 联合 Google DeepMind 的 Gemini Embedding 2 推出原生多模态 RAG,文本、图像、音频、视频可嵌入同一共享向量空间,一次查询即可检索 PDF 页面、音频片段或视频中的对应片段,跳过了转录、OCR、字幕等文本转换步骤。
Weaviate 发布三份 Notebooks,分别演示 Audio RAG、Video RAG 和多模态 PDF RAG,代码托管在 weaviate/recipes 仓库。三条链接均指向 GitHub 对应示例,覆盖音频、视频与多模态 PDF 三类检索增强生成场景。
京东科技蔡欣彤独立开发了端到端智能播客平台 Smart Podcast Platform,用户上传视频或音频后,由 AI 自动完成内容理解、音色设计、语音合成与专业混音,全程无需人工干预。
Rahul Sharma 展示了 Qdrant Edge 结合 MobileCLIP2 实现离线视觉搜索,让仓库机器人无需联网即可检索商品目录,多向量(multivectors)帮助识别不同视角下的商品。
阿里 Wan 3.0 已在 Replicate 上线,可生成原生 30 秒一镜到底、带同步音频的视频,目前限时 30% off(7 折)。模型页面为 replicate.com/alibaba/wan-3。
Replicate 上线阿里 Wan 团队的 Wan 3.0,称其可原生生成 30 秒单镜头视频并带同步音频。该内容为转载的模型上线信息,未给出更多参数、定价或开放范围细节。
阿里视频生成模型Wan3.0于8月24日正式上线,单次可生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,在生成时长、参考一致性和真实世界还原等维度升级。
原文给出Wan3.0的时长、文档输入与API定价,读者可据此判断它在短剧、广告等生产流程中的落地成本。
SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。
腾讯混元推出 HyCreator,一个面向长视频生成的 agent harness,支持端到端 Auto 模式,可在零人工干预下生成 10 分钟量级的影片,并可随时切换到实时交互编辑。目前已开放 early access 申请,入口为 hycreator.tencent.com。
Google DeepMind 发文回顾 15 年游戏 AI 研究历程,并宣布与 EVE Online 开发商 Fenris Creations 等游戏工作室合作,为现有游戏原型化新玩法体验。
DeepSeek 推出多模态 API,设置 model='deepseek-v4-flash-vision-exp' 即可调用。图像输入按 token 计费,每张最多 384 tokens,价格与 V4-Flash 一致,支持 base64、外部 URL 和 Files API 三种传入方式,并兼容 Chat Completions、Messages 与 Responses 三种接口。
DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。
DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,这是一款实验性多模态模型,文本能力与 DeepSeek-V4-Flash 持平,涵盖智能体、推理和世界知识。
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,用户可通过设置 model='deepseek-v4-flash-vision-exp' 调用。
腾讯混元翻译模型 Hy-MT2-1.8B 与 Hy-MT2-30B-A3B 现已上线 OpenRouter。两款模型面向真实场景翻译,覆盖 33 种语言,并具备较强的多语言指令遵循能力,可处理结构化、上下文相关及风格引导的翻译任务。
MiniMax 发布 MiniMax Design,一款把多模态模型能力变成生产力的 Harness,可理解创作目标、拆解任务并调用模型与 Skills,完成素材处理、生成编辑到交付的全流程。
Naval 预测,最终所有 UI 都会变成"聊天和手势输入、聊天和视频输出"。该帖获 6975 次点赞、320 次转发和 55.18 万次浏览。
字节豆包客户端更新工作模式,工作任务增强操作电脑、技能(Skill)、连接器和「工作伙伴」等功能,内置 Office 与飞书办公套件,支持本地和云端电脑,合上笔记本后任务仍可继续运行。