Cloudflare 发布多模态决策模型 Clef-omni,Clef 提速、Clef-flash 降价
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个晚期交互多向量嵌入模型,用于检索文本、图像和页面,二者共享同一嵌入空间以支持跨模型查询。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
LightOn OCR-3 已在 OpenDocRouter 上线,定价 $0.28 / 1m input、$1.40 / 1m output,在 ParseBench 上约 $3.19 / 1k 页。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
GPT-6 Astra 读取用户 Memory 后,按用户喜好用 Blender 建模的几个模型做了一张海报,模型的细节、材质、光影都做得很好。
Vidu 发布旗舰视频模型 Q4 的首个预览版本 Q4 Preview,最高支持 4K 直出,最多可输入 15 张参考图,并支持 3 段参考音频统一音色。SaaS 侧 Preview 阶段提供两个月限时优惠,最低 0.09 元/秒起,官方称一个 10s 视频的创作成本首次可以低至不到一块钱。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
Perplexity 发布 pplx-embed-v2-late,包含两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,支持跨模态查询。两个模型均达到前沿性能,并已在 Hugging Face 公开提供。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
Mistral 发布 Mistral Large 4(Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是欧美聚合基准上最好的开放权重模型,在视觉 grounding 上超过闭源前沿模型。
Google 发布新一代图像生成和编辑模型 Nano Banana 2.1,从今天起陆续上线 Gemini App、Google 搜索 AI 模式、AI Studio、Flow、Stitch、Google Ads 和 Gemini 企业平台。
Nano Banana 2.1(gemini-nano-banana-2.1)已上线,价格从上一代 Pro 模型的每张 0.134 美元降至 0.034 美元。
Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频,把它们映射到同一个共享空间。
Google DeepMind 发布 EmbeddingGemma 2,一个将文本、代码、图像、视频和音频映射到统一嵌入空间的轻量多模态嵌入模型,基于 Gemma 4 架构、Apache 2.0 许可,参数量 7.4 亿。
Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是美国或欧洲聚合基准上最好的开源权重模型。
Kling AI 展示创作者使用 Kling 4.0 和 Kling 4.0 Flash 制作的作品,主打新想象、新故事与新创作方式。官方同步放出演示视频,并附上 X(Twitter)原帖链接。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活。官方称其在美国或欧洲开源权重模型中聚合基准表现最佳,在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型由欧洲端到端打造,可通过 Mistral Cloud 部署,即日起开放 API,开放权重版本将于 10 月底发布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。
Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,视觉接地表现超过闭源前沿模型。
Mistral Large 4 的参数规模、多模态能力与开放权重时间表一并给出,可据此判断欧洲开源模型的竞争位置。
Mistral Large 4 已在 OpenRouter 上线公开预览,参数量 1T、激活 49B,原生多模态,支持 1M 上下文与最高 256K 输出。前两周价格五折,每 1M tokens 输入 $0.68、输出 $2.09,缓存 $0.07。
Mistral AI 的 Mistral Large 4(代号 Le Chonk)已上线 Arena,可在 Agent Arena 中实测,投票将影响其评估,分数稍后公布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,激活参数 49B。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在视觉定位上超过闭源前沿模型,并在网络防御、制造和金融等关键负载上达到 SOTA。该模型已在 Mistral Cloud 上端到端于欧洲构建并可部署,即日起通过 API 向所有用户开放,开放权重计划于 10 月底发布。
Mistral Large 4 已在 OpenRouter 开启公测,采用 1T 参数(激活 49B),原生多模态,支持 512K 上下文与最高 256K 输出。前两周五折,价格为每 1M tokens 输入 $0.68、输出 $2.09,缓存输入 $0.07。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活,官方称其在美国或欧洲的开放权重模型中聚合基准表现最好,并在网络防御、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,在自有算力上训练和推理。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络安全、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型;由欧洲端到端打造,可通过自有 Mistral Cloud 从欧洲部署。
Mistral 联合创始人披露 Large 4 的参数量、多模态与自有算力训练细节,可据此判断欧洲开源模型的量级位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,称其是美欧范围内聚合基准上最好的开源权重模型。该模型在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉定位上超过闭源前沿模型;今日起通过 API 提供,开源权重将于 10 月底发布,并可通过其自有 Mistral Cloud 基础设施在欧洲部署。
Mistral 官方给出新模型的参数规模、能力定位与开放节奏,可据此判断欧洲开源权重模型当前的位置。
Black Forest Labs 发布 FLUX 3 Image,主打精准局部编辑:框选区域后用文字描述修改需求,画面其余部分几乎不变。官方说明称该模型还支持用 JSON 坐标指定各元素位置的布局控制,适合排版、海报等场景,并最多可合成 10 张参考图。在线体验地址为 flux-tools.bfl.ai/precise-editing。