Mistral Large 4 在 Harvey 法律智能体基准 LAB 上位列开源模型第一
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
Mistral Large 4 在 AutomationBench 上跑了 657 条业务流程,覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用,成绩超过 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。该基准围绕周一典型工作流设计,四个应用全部纳入测试。
Mistral AI 发布 Mistral Large 4,官方称其可运行通用智能体,在复杂工作流中收集信息并产出成品交付物。目前公开信息仅为官方一句话描述,未给出具体能力指标或开放方式。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
Nano Banana 2.1 展示了一组图像生成效果:一只完全倒满的红酒杯,以及一个指针停在 3:30 的时钟。该内容由 Philipp Schmid 发布,互动数据显示 231 次点赞、16 条评论和 9109 次浏览。
Mistral Large 4 进入 Code Arena WebDev 榜单位列第 45 名,得分 1534 分,比第 130 名的 Mistral Large 3 提升 304 分,比第 122 名的 Mistral Medium 3.5 高出 271 分。
OpenAI 在 28 天挑战中为 GPT-6 Astra 和 Sol 提速 50% 至 50 tokens/s,并上线免费 auto-review 与 ChatGPT Meetings 插件;Gemini 4 Argon 发布,主打长时间多步骤编码与网络防御,输出上限 100 万 token。
美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。
Google 发布图像模型 Nano Banana 2.1,官方称其画面生成更自然,改图衔接更连贯。原文未披露参数规模、benchmark 分数与开放方式等具体细节。
OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
小米发现只以通过测试为目标的模型会添加未被要求的代码并让错误静默通过,于是将每项测试结果乘以质量清单评分来修正。结果 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
Nano Banana 2.1 已发布,面向图像生成与编辑用户,带来更高质量的图像和对前代模型的诸多 bug 修复,并采用更低的价格。该模型已在 API、AI Studio 和 Gemini app 中提供使用。
Mistral AI 表示 Mistral Large 4 是全球最强的网络安全 AI 模型之一。该说法由 Mistral AI 官方账号发布,未披露具体评测分数或技术细节。
Mistral AI 发布 Mistral Large 4,并以其在 CTF 挑战中的表现展示推理能力。官方称在包含工具调用、解题时间均来自真实运行记录的 CTF speedrun 中,该模型解出 19 道题中的 18 道。
Google 发布新一代图像生成和编辑模型 Nano Banana 2.1,从今天起陆续上线 Gemini App、Google 搜索 AI 模式、AI Studio、Flow、Stitch、Google Ads 和 Gemini 企业平台。
Replicate 上线 Google DeepMind 图像模型 Nano Banana 2.1,该模型在价格与性能之间寻求平衡。它在视觉设计、基于 mask 的编辑和主体一致性上有所提升,以生成更自然的图像。
Perplexity 在 Hugging Face Decision Index(决策模型基准)上排名第一。该模型采用开放权重,所有人均可访问。
图像生成定价公布:输出 2K 分辨率每张 0.050 美元,输出 4K 分辨率每张 0.076 美元。原文未说明具体模型或服务名称。
谷歌发布图像生成模型 Nano Banana 2.1,官方称其在视觉设计、基于蒙版的编辑、主体一致性和画面自然度上全面超越前代模型,并已在 Google AI Studio 上线。歸藏实测表示,该模型中文文字清晰度和错字问题大幅改善,中文字体设计与排版美学良好、画面干净,且支持生成 4K 图片,但价格偏贵。
Nano Banana 2.1(gemini-nano-banana-2.1)已上线,价格从上一代 Pro 模型的每张 0.134 美元降至 0.034 美元。
Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频,把它们映射到同一个共享空间。
Google DeepMind 发布 EmbeddingGemma 2,一个将文本、代码、图像、视频和音频映射到统一嵌入空间的轻量多模态嵌入模型,基于 Gemma 4 架构、Apache 2.0 许可,参数量 7.4 亿。
OpenRouter 建议用 Compare 页面比较 Clef、Jev 及另外 10 个决策模型的功能与用量。该条提示未披露各模型的具体参数、价格或可用性信息。
Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是美国或欧洲聚合基准上最好的开源权重模型。
Kling AI 展示创作者使用 Kling 4.0 和 Kling 4.0 Flash 制作的作品,主打新想象、新故事与新创作方式。官方同步放出演示视频,并附上 X(Twitter)原帖链接。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活。官方称其在美国或欧洲开源权重模型中聚合基准表现最佳,在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型由欧洲端到端打造,可通过 Mistral Cloud 部署,即日起开放 API,开放权重版本将于 10 月底发布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。
Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,视觉接地表现超过闭源前沿模型。
Mistral Large 4 的参数规模、多模态能力与开放权重时间表一并给出,可据此判断欧洲开源模型的竞争位置。
OpenRouter 在平台上架模型 mistralai/mistral-large-4-0,用户可通过 OpenRouter 的统一接口调用该模型,具体能力参数原文未给出。
Mistral Large 4 已在 OpenRouter 上线公开预览,参数量 1T、激活 49B,原生多模态,支持 1M 上下文与最高 256K 输出。前两周价格五折,每 1M tokens 输入 $0.68、输出 $2.09,缓存 $0.07。