NVIDIA Nemotron 3 Diarization 上线 HuggingFace 并登上热门
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型用于说话人分离,即使多人声音重叠也能追踪谁在何时说话,最多支持 8 位说话人,参数量 100M。官方感谢下载者,并回应了部分提问。
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型用于说话人分离,即使多人声音重叠也能追踪谁在何时说话,最多支持 8 位说话人,参数量 100M。官方感谢下载者,并回应了部分提问。
有人用 Opus 5.5 做出了一个可交互的 3D 喷气发动机,支持剖切和拆解查看内部结构。该内容在浏览器中运行,原帖为视频展示形式,已获得 1563 个点赞和 25 万余次浏览。
Claude Sonnet 5.5 展示了一项生成能力:在平面画布上绘制出每栋建筑都由纸张折叠而成的立体城市。演示由 Sonnet 5.5 完成,相关视频发布在 Twitter 上。
Claude Opus 5.5 被用于制作浮雕卡片,相关演示以视频形式发布。该内容在社交平台获得 1256 个点赞、42 次转发和 22 条回复,浏览量约 10.2 万次。
一个 3D 网站用 Opus 5.5 实现了从银河系外飞掠到木星卫星的连续镜头。该站点可在浏览器中播放这段太空飞行视频内容。
OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。
Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。
OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。
Recraft V4.1 可生成兼具气场、氛围与个性的角色图像,涵盖不同面孔、视角、环境与情绪,从电影感特写到全身场景,每条提示词都能形成独立的视觉故事。
Ideogram 新模型已在 Ideogram 平台、API 和首发合作伙伴上线。开放权重仍处于即将推出的预告阶段,尚未给出具体日期。更多案例与详细介绍见 best.xiaohu.ai。
Fable 5.5 即将发布,演示显示其能在连续动画中保持不同艺术风格,被形容为"超人"。相关推文由 Chetaslua 发布,并称这标志着"超级智能时代"的到来。
GPT-6.1 Sol 在 Browser Use Bench 2.1 上跑出该基准实测最高分,得分超过 Astra,估算成本低 7.8 倍。其 95% 的 prompt token 命中缓存,缓存 token 价格比 Astra 便宜 10 倍。Opus 5.5 与 Grok 4.7 得分更低且成本更高。
Perplexity 开源多模态决策模型 pplx-decider-27b,并推出由 pplx-decider-v1-27b 驱动的 Decisions API。该模型被训练为输出固定答案集合上的概率分布而非文本,定价为每百万输入 token 4 美分、输出 token 免费,跨基准测试得分 85.71%,官方称未来几天还会进一步降价。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线。该模型支持文生图和多重参考编辑,可原生渲染至 4K。
Black Forest Labs 发布 FLUX 3 Image,可生成最高 4K 分辨率图像,支持用包围框精确定位布局、一次进行多处定向编辑并在编辑间保持一致,还可使用最多 10 张参考图合成图像。该模型面向大规模图像生成的企业提供商用权重,开放权重版本将在未来几周推出,上线首周半价。Replicate 已提供该模型。
Perplexity 开源其多模态 Decision 模型,并通过 Decisions API 对外提供。该 API 由 pplx-decider-v1-27b 驱动,模型被训练为对固定答案集输出概率分布而非文本,输入价格为每百万 token 0.04 美元,跨基准得分 85.71%。
Cloudflare 开源了首批自研决策模型 clef 和 clef-flash,两者已在 Cloudflare Workers AI 上线。Harrison Chase 评论称,此前就有人预言决策模型领域会迎来更多入局者,如今连开放权重也出现了,并称 harness 应该能像替换主模型一样轻松替换决策模型。
Cloudflare 的 workers ai 团队发布首个自研模型系列 clef,包含两个快速、准确的决策模型,在质量与延迟基准上登顶。模型已开源,权重可在 Hugging Face 获取(Cloudflare/clef),也可直接使用 workers ai 的托管版本。
Vercel CEO Guillermo Rauch 表示,MicrosoftAI 团队正在训练出色的模型,Vercel 将把这些模型在发布首日(day zero)引入平台。推文未披露具体模型名称与上线时间。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
微软的 MAI-Voice-2.1 已在 OpenRouter 上线,被描述为 MAI 目前保真度和表现力最高的文生语音模型。该模型提供录音室级自然语音,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频等场景。
Sam Altman 表示,6.1 Sol 是迄今增长最快的模型,此前在负载下略显缓慢,现已大幅改善。原文未披露该模型的具体参数、性能数据或可用性信息。
Google DeepMind 发布 SynthID Bio 水印方法家族,专为 AI 生成的生物设计打造。该方法首次实现将不可察觉的签名直接嵌入蛋白质序列,且不影响其生物功能。
Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。
官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。
MiniMax 上线首个 Flash 模型 M3.1-Flash-Preview,目前为预览版,未正式发布也未公布 benchmark,规格为 100 万 token 上下文、原生多模态,深度思考分 low 到 max 五档,默认 max。
TypeSafe AI 发布 System One 模型 Jev,它不生成文本,而是接收状态和问题后返回带概率的类型化答案,公司称在分类任务上推理速度最高快 200 倍、成本低 400 倍。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,当天起通过 Fairwind Program 向一批可信测试者开放。有使用者形容初次体验时被吓到眩晕瘫坐在椅子上,彷佛看到原子弹爆炸。发帖者表示自己一个月前花 20 元买了两个 Pro,正在等待开放,并抱怨首批只开放给 Fairwind 计划的可信人员。
Google 发布 Gemini 4,内部代号为 Argon,目前没有完全开放,仅通过 Fairwind Program 面向首批网络防御人员推出,供其使用其前沿级别的网络安全防御能力。Google 表示会在把 Argon 开放给开发者、企业和消费者之前,继续从早期测试者收集反馈并迭代护栏。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。
谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。
Runway 机器人业务负责人 Andy Chen 阐述了 Runway 在机器人领域的独特路线,并首次发布开放权重的世界动作模型 Praxis-1。Praxis-1 已在 runway.com/praxis-1 开放提前访问申请。
谷歌宣布推出新一代模型 Gemini 4 Argon,重点面向长流程软件工程、法律与金融等企业知识工作以及网络安全防御;输出 Token 上限从此前 64K 提升至 100 万。
Demis Hassabis 宣布发布新的前沿 AI 模型 Gemini 4 Argon,称其在多项关键能力上有大幅提升。该模型今天起通过 Fairwind Program 率先向政府和受信任的网络防御方开放,随后将扩大可用范围。
Google 推出 Gemini 4 Argon,称其在真实软件工程、知识工作和网络安全防御等复杂工作流中达到前沿水平,并具备业界领先的 1M token 输出上限。官方表示将尽快且尽可能安全地开放该模型,正式发布前仍会持续迭代。
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件任务上提供前沿性能,数千名 Google 员工已在 Antigravity 内部使用。该模型先向 Fairwind 计划中一批受信任的网络防御者开放,更广泛的可用性将尽快推出。Sundar Pichai 表示它在复杂工作流、网络防御和软件工程中展现前沿性能,团队在 Google 内部从编码到量子计算广泛使用。
Sundar Pichai 在推文中放出 Gemini 4 Argon 的早期预览,称其在复杂工作流、网络防御和软件工程上展现出前沿性能。他提到 Google 内部团队已将该模型广泛用于从编码到量子计算的工作,并附上了基准数据入口。
Google 发布 Gemini 4 Argon,在 Google 公布的 19 项基准中拿下 13 项第一,对比对象为 GPT-6 Astra 和 Claude Opus 5.5。
Google 的 Logan Kilpatrick 表示,Gemini 4 Argon 由 Google 众多同事共同打造,他对这一进展感到惊喜,并称这只是开始,期待更多人使用该模型,同时附上了 Google 官方博客链接。
Google 发布新前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至最高 1M,发布时定价为输入每百万 token 2 美元、输出每百万 token 10 美元。该模型目前正在与可信合作伙伴测试,开发者访问将尽快开放。
Google 宣布推出新前沿模型 Gemini 4 Argon,定位于在复杂长程工作流中维持深度推理,并在真实软件工程、法律与金融等企业知识工作以及网络安全防御中提供前沿性能。该模型输出 token 上限提升至业界领先的 1M tokens,目前正通过 Fairwind Program 向一批受信任的网络防御者开放,并将尽快扩大可用范围。