Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
Sam Altman 表示 6.1 Sol 是其增长最快的模型,此前在高负载下速度偏慢,目前应已明显改善。该条内容获 12244 次点赞、831367 次浏览。
Google DeepMind 发布 SynthID Bio 水印方法家族,专为 AI 生成的生物设计打造。该方法首次实现将不可察觉的签名直接嵌入蛋白质序列,且不影响其生物功能。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。
TypeSafe AI 发布 System One 模型 Jev,它不生成文本,而是接收状态和问题后返回带概率的类型化答案,公司称在分类任务上推理速度最高快 200 倍、成本低 400 倍。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,当天起通过 Fairwind Program 向一批可信测试者开放。有使用者形容初次体验时被吓到眩晕瘫坐在椅子上,彷佛看到原子弹爆炸。发帖者表示自己一个月前花 20 元买了两个 Pro,正在等待开放,并抱怨首批只开放给 Fairwind 计划的可信人员。
Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。
Google 发布 Gemini 4,内部代号为 Argon,目前没有完全开放,仅通过 Fairwind Program 面向首批网络防御人员推出,供其使用其前沿级别的网络安全防御能力。Google 表示会在把 Argon 开放给开发者、企业和消费者之前,继续从早期测试者收集反馈并迭代护栏。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。
谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。
Runway 机器人业务负责人 Andy Chen 阐述了 Runway 在机器人领域的独特路线,并首次发布开放权重的世界动作模型 Praxis-1。Praxis-1 已在 runway.com/praxis-1 开放提前访问申请。
谷歌宣布推出新一代模型 Gemini 4 Argon,重点面向长流程软件工程、法律与金融等企业知识工作以及网络安全防御;输出 Token 上限从此前 64K 提升至 100 万。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在多项关键能力上有大幅提升。该模型先通过 Fairwind Program 面向政府和可信网络安全防御方开放,随后再扩大可用范围。
Google 推出 Gemini 4 Argon,称其在真实软件工程、知识工作和网络安全防御等复杂工作流中达到前沿水平,并具备业界领先的 1M token 输出上限。官方表示将尽快且尽可能安全地开放该模型,正式发布前仍会持续迭代。
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件任务上提供前沿性能,数千名 Google 员工已在 Antigravity 内部使用。该模型先向 Fairwind 计划中一批受信任的网络防御者开放,更广泛的可用性将尽快推出。Sundar Pichai 表示它在复杂工作流、网络防御和软件工程中展现前沿性能,团队在 Google 内部从编码到量子计算广泛使用。
Google 放出 Gemini 4 Argon 的早期预览,Sundar Pichai 称其在复杂工作流、网络防御和软件工程上展现出前沿性能。他表示 Google 内部团队已在编码到量子计算等场景中广泛使用,反馈良好,并附上了基准测试结果。该消息由 Patrick Loeber 引用 Sundar Pichai 的推文转述。
Google 发布 Gemini 4 Argon,在 Google 公布的 19 项基准中拿下 13 项第一,对比对象为 GPT-6 Astra 和 Claude Opus 5.5。
Google 员工 Logan Kilpatrick 宣布 Gemini 4 Argon 发布,并称这是 Google 内部大量同事共同完成的成果。他表示这只是开始,期待更多人使用该模型,并附上了 blog.google 的官方链接。
Gemini 4 Argon 作为新的前沿模型发布。输出 token 上限从 64K 提升至最高 1M,发布时定价为输入 $2、输出 $10。目前正与可信合作伙伴测试,并称会尽快开放开发者访问。
Google 宣布推出新一代前沿模型 Gemini 4 Argon,主打在复杂长程工作流中维持深度推理,并在软件工程、法律与金融等企业知识工作以及网络安全防御等真实场景中提供前沿性能。该模型的输出 token 上限扩展至 1M,目前正通过 Fairwind Program 向一批受信任的网络防御人员开放,后续将尽快扩大可用范围。
Google DeepMind 的 Argon 支持 1M token 输出上限,可一次性处理长链路、多步骤问题,并增强了推理深度。该模型目前处于早期测试阶段,官方称将依据测试者反馈完善系统,随后逐步面向开发者、企业和消费者推出。
Google DeepMind 发布 Gemini 4 Argon,定位为面向编码、企业知识工作和网络安全防御等复杂工作流的前沿模型。该模型今天起通过 Fairwind Program 向一组受信任的测试者开放。
Google 发布新前沿模型 Gemini 4 Argon,今日起先向网络安全防御者开放,随后将尽快扩大范围。该模型处于介绍性定价阶段,输入 $2、输出 $10。
Google CEO Sundar Pichai 提前预告下一代模型 Gemini 4 Argon,称其在复杂工作流、网络防御和软件工程方面表现出前沿性能。他表示 Google 内部团队已从编码到量子计算广泛使用该模型,反馈良好,并放出了基准测试信息。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。
Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。
Ideogram 4.5 已上线 Replicate,面向高精度、多轮图像编辑场景,适用于编辑类样稿、品牌素材和无伪影图像。发布方称该版本能消除多轮编辑中的伪影累积、像素偏移和色彩变化,从而让多轮编辑成为可能,目前已上线 Ideogram、API 及发布合作伙伴,并计划后续开放权重。
Perplexity 在 Hugging Face 上线 pplx-embed-v2-context-9b-preview 嵌入模型,型号中的 9b 指向 90 亿参数规模,v2-context 命名表明其面向长上下文场景。该模型以 preview 预览版形式开放查看,具体能力与可用方式尚未披露。
在 ConTEB 基准上,该预览版模型取得所测模型中最高的平均 nDCG@10,但并非每个任务都领先。它在 chunk retrieval 上超过 voyage-context-4,且每个向量仅占 1 KB(1024 维、int8),相比后者的 8 KB(2048 维、float32)存储占用降低 8 倍。
Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。
Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。官方表示其他领先模型每次编辑都会累积伪影、像素偏移和色彩变化,而 Ideogram 4.5 消除了伪影累积,使多轮编辑成为可能。该模型已在 Ideogram、API 及发布合作伙伴处上线,开放权重即将推出。
Recraft V4.1 Flash 已在 Runware 平台上线,可通过 Playground 试用或经 API 接入工作流。该闪速级模型支持 14 种宽高比预设、最高 1536×768 分辨率,可用目标色板或固定背景色引导输出,定价为每张图 $0.007。Recraft 表示其提示词遵循度优于同类快速模型,并在人像、复杂场景和 logo 概念上表现较强。
Runway 发布 Praxis-1,一个开放权重的世界动作模型(World Action Model),把其在视频预训练上的积累用于机器人真实世界控制。该模型基于大规模视频预训练和实时基础设施构建,定位为可跨任意具身形态与环境的策略模型,面向机器人开发者和研究者。
Fireworks 的 Ember-1 已可在 Fireworks Serverless 上调用,Vals AI 的独立测试显示其在金融和法律基准上表现接近 Kimi K3,同时每轮推理 token 用量更少。每轮 token 更少意味着单次调用成本更低、智能体循环更快。
Ideogram 4.5 在 Image Editing 榜单以 1250 的 Elo 排名第 15,与微软 MAI-Image-2.6 和 Google DeepMind 的 Gemini 3 Pro Image Preview 处于同一性能区间。该模型虽专为精准定向编辑打造,但在通用编辑任务上表现同样出色,尤其在排版类编辑(如修改信息图中的文字)上优势明显。
Ideogram 发布 Ideogram 4.5,官方称其是目前最精确的图像编辑模型,能消除多轮编辑中其他模型常见的伪影累积、像素偏移和色彩变化,已在 Ideogram、API 和发布合作伙伴处上线,开放权重即将推出。Justine Moore 用一张 Olipop 广告图做了多轮精确编辑测试,认为它在多轮改动中不会出现画面扭曲和伪影。
Ideogram 发布 4.5 版本,主打只对用户指定的内容进行编辑,从而在持续编辑中不损失画质。该版本已在 Ideogram 及 API 上线,提供 precise edit(输出与输入尺寸一致)和 generate + edit 两个端点,详情见 ideogram.ai/models/4.5。
Ideogram 发布 Ideogram 4.5,提供四档质量模式,单图价格从 0.8¢ 到 22¢,均为原生 2K 分辨率。该模型现已上线 superscale_ai、Picsart、runware、krea_ai、LeonardoAi、runwayml、pika_labs、fal、ComfyUI、LumaLabsAI 等多家合作平台。
Ideogram 4.5 与 GPT Image 2.5 Sunburst、Nano Banana Pro、Nano Banana 2 进行了同一组编辑的逐轮对比。Ideogram 4.5 在多次编辑后仍保持画面干净,而 GPT Image 与 Nano Banana 的输出在几轮编辑后就变得不可用。