Eleven v4 Turbo 上线 ElevenAgents,实时对话推理延迟约 100 ms
Eleven v4 Turbo 已在 ElevenAgents 上线,把 Eleven v4 排名第一的音质带入实时对话,推理延迟中位数约 100 ms。ElevenAgents 借此可在各行业支撑更个性化、更有共情力的客户体验。
Eleven v4 Turbo 已在 ElevenAgents 上线,把 Eleven v4 排名第一的音质带入实时对话,推理延迟中位数约 100 ms。ElevenAgents 借此可在各行业支撑更个性化、更有共情力的客户体验。
Opus5.5 完成了一条视频的全部制作,其中语音克隆环节使用的是 @oran_ge 的 listenhub,作者称这条视频发到群里后基本都炸了。
截至 2026 年 9 月 24 日,audio.cpp 最新正式版本为 v0.8.2,约 3000 Star,README 在 v0.8.0 时称已覆盖 80+ 个模型家族、120+ 个模型变体。
ElevenLabs 推出 Eleven v4 和 Eleven v4 Turbo 两款语音模型,官方称是迄今速度最快、情感表现最强的语音模型,并在 Artificial Analysis 排名第一。作者 Orange AI 认为 TTS 模型竞争已接近尾声,视频游戏领域的价值更高,算法资源顾不上 TTS。
ElevenLabs v4 已在 Runway 上线,该模型在旁白与角色对话上表现突出,表达力和语调自然度均超过以往版本。即日起可在 Runway 上与该平台的图像和视频模型一同使用。
Manus 与 CueAgents 宣布,智能体可拥有自己的电话号码,用于拨打电话、接听电话和收发短信,用户还能把来电转接给智能体。该功能目前仅在部分国家上线,部分地区只支持语音,官方表示正在努力将其扩展到更多国家,并邀请用户试用并反馈使用场景。
Fish Audio 的 ASR 模型现可区分不同说话人、识别说话人情绪,并在转录文本中标注 [laughter]、[surprised] 等情绪线索。该模型支持 83 种语言,官方称其为目前最准确的 STT 模型。
Fish Audio 上线语音功能文档,页面地址为 docs.fish.audio/features/speech。该推文仅给出文档链接,未披露模型版本、参数规模或可用性等具体信息。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo,称是迄今最快、最具情感表现力的语音模型,并在 Artificial Analysis 排名第一。Justine Moore 体验后表示,该模型采用新架构,语音更真实可控,可以同时导演角色的表演和其周围的声景,还提供了廉价麦克风等语音效果。
Google 为庆祝最新的 Gemini Audio Live 与 TTS 模型发布,推出了相关周边。原帖未披露模型版本号、参数量或可用性等具体信息。
ElevenLabs 未来两周下调 Eleven v4 与 Eleven v4 Turbo API 价格,分别为每 100 万字符 $22 和 $11。同时 ElevenCreative 的 Creator+ 套餐可免费使用 Eleven v4,额度最高为月度额度的 2 倍。
ElevenLabs 发布新一代表现力语音生成模型,官方称其为最新研究成果的集成,面向角色表演和对话式智能体等强调表达效果的场景。模型已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线,地址为 elevenlabs.io/v4。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款语音模型,称是其迄今速度最快、情感表现最强的语音模型。官方表示两者在 Artificial Analysis 排名中位列第一。
NVIDIA 与 Meta 团队合作提升了 Muse Realtime Avatar 的模型效率,让虚拟形象在实时对话时能够跟上节奏。Meta 在 Connect 大会上发布 Muse Realtime Avatar,这项实时化身技术将 Muse Realtime Voice 转化为可表达、可交互的虚拟形象,并为 Muse 带来实时对话等全新交互方式。
Fish Audio 推出 Startup Program,Hydrilla AI 作为首批成员加入,将把生产级 3D 角色与富有表现力的语音 AI 结合。Hydrilla AI 表示其 3D 角色即将拥有声音,并感谢 Fish Audio 团队的支持。
作者提醒,现在有了音频版的 Nano Banana,模型和 demo 均已开源在 GitHub 与 Hugging Face 上,可实现秒级克隆声音、像编辑文本一样编辑音频、改变音色音调与情绪、去除口音、增强或分离人声,甚至加入咳嗽和笑声等效果。腾讯还发布了更快更小的 flash 变体。
Gemini Notebook 的 AI 主播声音已更换,由 Gemini 3.8 TTS 驱动。官方账号 @Gemini_Notebook 回应听众反馈,确认音色出现变化,并表示 AI 主播会亲自说明此次调整及后续可期待的内容。
NotebookLM 的 AI 主持人声音发生变化,官方确认听众察觉到的音色调整属实。推文称 AI 主持人将亲自解释这次改动的内容以及后续可期待的变化,并附有视频说明。
Google AI 汇总本周更新,包括 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频生成模型,以及为 Gemini 对话式 AI 加入近实时视觉呈现的 Gemini 3.8 Live with Live Avatar。
Vapi 是构建和部署语音 AI 智能体的平台,目前每年为 Amazon、Uber、Intuit 等公司处理约 10 亿通电话,用 AI 自动完成电话沟通。两位联合创始人 Jordan Dearsley 和 Nikhil 在 Founder Firesides 中回顾了十余次转型的历程:从日历应用、AI 笔记工具,到一款最终成为 Vapi 基础的 AI 心理治疗师。
ElevenLabs for Students 今日面向美国、加拿大、EU27、英国和澳大利亚的大学生开放,后续将覆盖更多国家。该学生计划包含 ElevenCreative 内容创作平台、ElevenAgents 智能体设计部署、ElevenAPI 语音/音效/音乐模型编程接口,以及 ElevenReader Ultra 听书功能。
ElevenLabs 推出 ElevenLabs for Students,为学生提供 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI 的使用权限,外加一年 ElevenReader Ultra。官方称,让学生用上专业工具,是为他们毕业后工作做准备的最简单方式。
microagi 与 ElevenLabs 合作,为人形机器人赋予语音能力,让人无需屏幕或控制面板即可直接开口对话。双方称目标是让向机器人求助像向身边人求助一样自然,目前处于早期案例研究阶段,展示了未来机器人与人交流的可能形态。
ElevenLabs 公布端侧部署(on-device deployment)方案,并附上详情链接 elevenlabs.io/on-device-depl…,具体支持模型与设备信息尚未在该帖中披露。
Fish Audio 开放 Drama 3(预览版)供开发者构建应用,使用方式是在 API 请求中把模型路由到“drama-3-preview”。API 参考文档位于 docs.fish.audio/api-reference/。
Pika 宣布 Grok Bots 可接入 Pika API,通过一个 API key 调用 120+ 模型生成图像、视频和音频,其中包括 Seedance 2.5、Wan 3.0、GPT-image-2 等。接入后 Grok Bots 相当于一个制作工作室。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Gemini 3.8 TTS 支持复刻用户自己的声音,或通过提示词设计完全自定义的音色。流程分三步:录制 20 秒说话音频并附上同意语句,通过 API 调用创建声音,然后在任意请求中使用,风格参数放在 speech_metadata 中。
Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。
腾讯 Hy Translation 正式上线,由 Hy-MT2 驱动,支持 33 种语言以及 5 种中国少数民族语言和方言,提供语音、拍照翻译,并可完全离线在设备端运行、无需联网。该应用已在 12 个国家和地区上线,面向出境旅行、驾车、工作与阅读等场景。
Simon Willison 借助 datasette-mcp,用 ChatGPT iPhone app 的语音功能与博客的 Datasette 备份进行了对话。
Gemini 3.8 TTS 模型发布,作者称其价格非常低,并支持多语音之间的对话生成,可选 2000 多种声音或克隆自己的声音。作者为此搭了一个小界面,并让 Claude 写了一段脚本,让两只鹈鹕辩论搬到 Pacifica Pier 的事。
ElevenLabs 宣布接入 Meta 的个人 AI 智能体 Muse,用户在该智能体内发一条消息就能生成配音、配乐和视频。该消息由 ElevenLabs 官方账号发布,未披露具体上线时间与功能细节。
OpenAI 宣布 ChatGPT Voice 迎来升级,现可调用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 提供支持。该功能还可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或处理浏览器内的复杂任务。即日起随最新版应用在全球范围推送。
ChatGPT Voice 接入插件与 GPT-6 Astra 等模型,并进入 Work,读者可了解语音入口能接哪些工具。
OpenAI 宣布 ChatGPT Voice 现在可以使用邮箱、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 驱动。该功能可在 Web 和移动端的 ChatGPT Work 中使用,用户通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务,即日起随最新版应用全球推送。
ChatGPT Voice 接入邮箱、日历和 Slack 等插件,并进入 ChatGPT Work,可据此判断语音交互的适用边界。
Fish Audio 发布 Drama 3 预览版 TTS 模型,称其为可控性最强的 TTS 模型。该模型支持用自然语言描述语调、节奏和角色,无需使用音频标签,并可在句子中途切换声音、生成多角色场景,或只修正单个词。评论 DRAMA 可获取 API key。
Gemini 现已支持配合 WisprFlow 总结会议、记录语音笔记并提取行动项,用户可直接让 Gemini「查看最近与 Wispr 会议得出的决定」。该功能由 @GeminiApp 公布,演示中使用了 Wispr 这一具体名称。
Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。
Google AI Studio 推出新的 TTS 使用体验,成本低于此前的 3.1 Flash TTS 模型,更多细节见官方博客。原文未披露具体模型版本与定价数字。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 语音模型,官方称其为新的 SOTA 文本转语音模型。该模型提供新的音色设计体验、2000+ 生产可用音色、声音复刻与 100 种语言支持,声音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。