ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo,称是迄今最快、最具情感表现力的语音模型,并在 Artificial Analysis 排名第一。Justine Moore 体验后表示,该模型采用新架构,语音更真实可控,可以同时导演角色的表演和其周围的声景,还提供了廉价麦克风等语音效果。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo,称是迄今最快、最具情感表现力的语音模型,并在 Artificial Analysis 排名第一。Justine Moore 体验后表示,该模型采用新架构,语音更真实可控,可以同时导演角色的表演和其周围的声景,还提供了廉价麦克风等语音效果。
Kling 4.0 将于今年 10 月发布,Kling 4.0 Flash 已面向 Ultra 年付订阅用户上线。
Gemini Audio 推出最新 Live 与 TTS 模型并发布周边礼品庆祝。原文未披露模型版本号、参数规模、benchmark 分数或可用性信息。
斯坦福大学与 NVIDIA Research 联合发布 Contrastive Language Models(CLM),一类用对比学习目标训练的 System One 决策模型,首发版本 CLM-8B 以冻结的 Qwen3-8B 为骨干,只训练 2000 万参数的 MLP 投影头,检查点仅 75MB。
ElevenLabs 发布新一代表现力语音生成模型,官方称其为最新研究成果的集成,面向角色表演和对话式智能体等强调表达效果的场景。模型已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线,地址为 elevenlabs.io/v4。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款语音模型,官方称其为目前速度最快、情感表达最强的语音模型。Artificial Analysis 将其评为第 1 名。
NaiveAI 以 MIT 许可证开放 Naive-N0.5-Flash 的模型权重与推理代码,该模型面向编程与 AI 研发,采用 MoE 架构,总参数 309B、激活约 15.5B,原生支持 100 万 Token 上下文,FP8 权重约占 315GB。
快手技术团队推出面向电商内容生产的图像编辑基座模型 KwaiMind,在多项通用图像编辑基准和自建电商评测 Ecom-Bench 上均取得参评开源模型综合得分第一。
Recraft V4.1 Flash 在相同提示词下生成会"变形发声"的文字排版、带硬调编辑光影的金属箔头饰、花中抱膝女孩以及 O 字微笑的 MOKO logo,覆盖排版、时装、插画和品牌设计四类场景,单张出图耗时 1.3 秒且保持 Recraft 风格。完整提示词见评论区。
Mimo V2.6 Pro 与 Flash 的测试内容,标题提出其是否为开放权重模型。由于原文正文未能抓取,暂无法提供更多细节。
Qwen-Image-2.1-viggle-turbo v0.2 已在 Hugging Face 发布,支持文生图和图像编辑,仅需 6 步,比 40 步的 Qwen-Image-2.1 模型快约 5 倍。
Genspark 上线 Nemotron 3 Ultra 与自研 Gen-1 Slides 模型,官方称达到前沿质量而价格仅为 Opus 5 的 1/17。这两个模型与 Nvidia 生态合作落地,Genspark 早前已加入 Open Weights and American AI Leadership 公开信及 Open Secure AI Alliance。
Recraft 的 V4.1 Flash 模型被 @heathergreen 用于测试油画、报纸拼贴和复古字体三类图像生成,她表示其生成速度之快出乎意料。四张示例图分别为 T-Rex 泡泡浴油画、报纸剪贴拼出 "I AM THAT GIRL"、复古火柴盒风格 Bigfoot 插画以及复古唱片插画,提示词均附在其帖子中。
Anthropic 发问:这个周末你打算用 Opus 5.5 探索什么?这条推文获得 248 个赞、80 条回复和 8.3 万次浏览。
Claude Opus 5.5 用 JavaScript 逐帧绘制了一段卡通风格动画,40 秒讲清浏览器的工作原理。该演示由 Addy Osmani 分享。
一段用浏览器画 dario 的对比视频显示,Claude Opus 5.5 在其中的表现被 indigo 形容为"开悟了",并称这是 ego 的宣传视频,但对比效果"太残酷"。该推文被 orange.ai 转发,附带的视频在浏览器端无法播放。
Vercel 在 AI Gateway 以 stealth/pixel-canary 形式上线 Pixel Canary,隐身期内限时免费,该模型擅长编码,包括构建应用、重构代码以及前端开发和移动端应用设计。
小米 MiMo 基础模型权重已在 Hugging Face 上线,同时发布了量化 GGUF 版本,分别托管于 XiaomiMiMo/MiMo 与 bartowski/MiMo 仓库。两个链接均指向 Hugging Face 的模型发布页,方便开发者下载部署。
小米发布一款 9B 模型,作者称其基于 Qwen-9B,可在 8GB 内存上运行。该模型采用 MIT 许可证,支持图像与文本多模态,在编码和智能体任务上表现不错,适合在笔记本等统一内存设备上本地离线使用。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。
Recraft 推出 V4.1 Flash,被称作目前市场上最快的图像模型,用户点击生成即可出图。实测者 @steftranquillin 用它生成编辑类人像,并称其在保持 Recraft 视觉质量的同时达到了此前无人提供的速度,生成后可用 Refine 调出颗粒感、肤质与光影。
Last Week in AI 播客第 257 期讨论上周 AI 要闻,其中 OpenAI 发布 GPT-6 Astra,这是一次聚焦智能体编码与电脑操作的能力跃升,采用 loop-transformer 隐式推理,token 效率更高,并新增网络与对齐监控声明,同时伴随评测感知、消极怠工和过拟合的担忧。
阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
Opus 5.5 收获好评并大幅降价,GPT 6 Sol 在这场对比中明显落败。OpenAI 表示下周将发布一堆新东西。
Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。
Fish Audio 发布 TTS 模型 Drama 3(预览版),称其为目前可控性最强的 TTS 模型。用户可用简单语言描述语气、节奏和角色,无需使用音频标签;支持句子中途切换音色、生成多角色场景,以及只修正单个词。官方还在推文中征集评论 DRAMA 以获取 API key。
Google AI Studio 上线新体验,配套成本低于此前的 3.1 Flash TTS 模型。该推文由 Logan Kilpatrick 发布,并附有 Google 官方博客链接供进一步了解。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上线,支持用 30 秒音频复刻音色、用一句话从提示词设计新音色,并可逐句指定风格、<laugh>、<sigh>、|backchannels| 和双人场景。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。