Fish Audio Drama 3 Preview 开放 API 与网页访问
Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。
Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。
ElevenLabs 的 Eleven v4 和 Eleven v4 Turbo 占据 Artificial Analysis 文本转语音榜单前两名。
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型支持最多 8 位说话人的语音分离,可在声音重叠时追踪谁在何时说话,参数量为 100M。团队在评论区回应了用户提问。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。
ElevenLabs 推出 Eleven v4 和 Eleven v4 Turbo 两款语音模型,官方称是迄今速度最快、情感表现最强的语音模型,并在 Artificial Analysis 排名第一。作者 Orange AI 认为 TTS 模型竞争已接近尾声,视频游戏领域的价值更高,算法资源顾不上 TTS。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo,称是迄今最快、最具情感表现力的语音模型,并在 Artificial Analysis 排名第一。Justine Moore 体验后表示,该模型采用新架构,语音更真实可控,可以同时导演角色的表演和其周围的声景,还提供了廉价麦克风等语音效果。
ElevenLabs 发布新一代表现力语音生成模型,官方称其为最新研究成果的集成,面向角色表演和对话式智能体等强调表达效果的场景。模型已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线,地址为 elevenlabs.io/v4。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款语音模型,称是其迄今速度最快、情感表现最强的语音模型。官方表示两者在 Artificial Analysis 排名中位列第一。
作者提醒,现在有了音频版的 Nano Banana,模型和 demo 均已开源在 GitHub 与 Hugging Face 上,可实现秒级克隆声音、像编辑文本一样编辑音频、改变音色音调与情绪、去除口音、增强或分离人声,甚至加入咳嗽和笑声等效果。腾讯还发布了更快更小的 flash 变体。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。
Fish Audio 发布 Drama 3 预览版 TTS 模型,称其为可控性最强的 TTS 模型。该模型支持用自然语言描述语调、节奏和角色,无需使用音频标签,并可在句子中途切换声音、生成多角色场景,或只修正单个词。评论 DRAMA 可获取 API key。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 语音模型,官方称其为新的 SOTA 文本转语音模型。该模型提供新的音色设计体验、2000+ 生产可用音色、声音复刻与 100 种语言支持,声音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Google AI 宣布即日起推送两款 TTS 模型,开发者可在 Google AI Studio 和 Gemini API 中使用,消费者端 Gemini 3.8 Flash TTS 进入 Gemini Notebook、Gemini 3.8 Flash-Lite TTS 进入 Google Vids。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 种语言的自定义语音,另有 2,000+ 个现成音色可选。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 用于设计带不同口音和特征的独特音色,Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可选用用户创建的风格或官方生产级音色库。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。
NVIDIA 推出 Nemotron 3 Diarization 模型,可追踪谁在何时说话,即使多人同时开口、声音重叠也能处理。该模型支持最多 8 位说话人,参数量为 100M,现已上线 Hugging Face。
Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款覆盖理解、生成、交互与创作。
Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。
ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。
阿里 Qwen 发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在忠实度、流畅度和简洁度上有所提升,并将 60 种语言的平均延迟(LAAL)从 2.8s 降至 2.3s。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称这是其目前最先进的实时对话音频模型。Google Labs 的实验项目 Dreambeans 转为正式可用,可为用户每日精选个性化故事集;同属 Labs 的 CC 从个人生产力工具扩展为共享智能体,用于帮助家庭协调事务、日程和日常任务。
新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。
原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。
Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新的 SOTA 实时音频模型,提供前沿的价格与性能。3.8 Live 支持 97 种语言并可在其间无缝切换,同时支持异步工具调用。
Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。
Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。
Google 发布两款 Gemini 音频模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。前者面向规模、速度和成本效率,支持句子中途打断、97 种语言实时切换并理解视觉上下文;后者在复杂任务上进一步强化推理能力,边推理边说话,可在执行多步项目时同步播报进度。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为旗下最好的对话式 AI。官方表示这两个模型可以对话、思考并在后台处理任务,而不打断当前流程。
阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。