xAI 发布 Grok Voice Transcribe 2.0:客服通话等场景准确率翻倍
xAI 推出 Grok Voice Transcribe 2.0,在客服通话、口述凭证和短语音指令场景下,转录准确率是上一代的两倍。该消息由 xAI 官方账号发布,推文互动数据显示获得 123 次点赞、6 次转发。
xAI 推出 Grok Voice Transcribe 2.0,在客服通话、口述凭证和短语音指令场景下,转录准确率是上一代的两倍。该消息由 xAI 官方账号发布,推文互动数据显示获得 123 次点赞、6 次转发。
xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转录模型。该消息由 SpaceXAI 在 X 上公布,未提及具体参数、评测数据或开放方式。
Fish Audio 发布实时语音到语音翻译演示,基于其流式 TTS 构建,支持 80+ 语言的单向翻译与双向对话。官方已开放体验入口与实现代码,开发者可直接上手构建自己的应用。
Fish Audio 上线 translate.demo.fish 翻译演示,由 @cshape_ 发布。该推文获得 1 条回复、1 次点赞和 1009 次浏览。
Fish Audio 发布实时翻译工作原理说明页(translate.demo.fish/how-it-works),由 xgo.ing 提供技术支持。原文未披露所用模型、延迟数据或可用方式等细节。
新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。
原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。
Grok Bot 现在支持语音模式,可以开口说话了。该消息由 Grok Bot 官方账号发布,并附带了演示视频。
Fish Audio 与 @covaldev 在旧金山重启 Voice AI Builder Dinner,活动定于 9 月 22 日,面向创始人及产品负责人。参与者将围绕医疗、客户支持等对可靠性要求极高的场景,交流构建语音 AI 过程中最难的部分。
ElevenLabs 发布 Cadence,相关详情见其官方博客 elevenlabs.io/blog/cadence。
Cadence 基于 ElevenAgents 打造的预警筛查智能体,将原本需要人工拨号、中位耗时 1 小时 48 分钟的告警触达缩短至 3.5 分钟。该流程覆盖全美 20+ 医疗系统,每月处理 40,000+ 条告警,会主动致电患者筛查症状,必要时接入其 24/7 护理团队中的护士。
Grok Voice 已在 fal 上线,这款来自 SpaceXAI 的最新语音模型可在 0.70 秒内作答,并在句子说完前完成工具调用。它支持词级时间戳转写、25+ 种语言的 30+ 种音色文本转语音,以及用两分钟音频完成音色克隆。
ElevenLabs 公布了新产品的可用性、定价与上手方式,详情见其官方博客 elevenlabs.io/blog/reception。原文未透露该产品的具体功能、版本号或价格数字。
ElevenLabs 上线 Reception,企业可用来搭建自己的接待服务,配套地址为 reception.ai。该推文附带官网链接,阅读量约 134 万,转推 12、点赞 143。
ElevenLabs 发布 Reception,一个面向小企业、基于 ElevenAgents 构建的 AI 前台接待平台。Reception 可接听每一通来电、回答客户问题、预约服务并发送短信确认,用户只需添加网址即可在几分钟内完成设置。
阶跃星辰发布 StepAudio 3 Realtime 技术报告,论文已在 Hugging Face 上线。
语音识别领域的竞争正在升温,Google、Meta 和 Microsoft 正通过发布新的强力模型争夺头名位置。DeepLearning.AI 在 The Batch 中解读了这一趋势对 AI 开发者的意义,指出在生成式文本模型占据话题中心的当下,语音识别正迎来属于自己的时刻。
Gemini Live API 迎来更新,新增音频模型。Patrick Loeber 分享了由 @thorwebdev 讲解这些新音频模型的视频,介绍其具体能力。
ElevenLabs 用 ElevenAgents 构建 AI SDR「Dom」,已在自家 inbound 销售中承担越来越多的线索资格审核。该智能体筛出一条线索只需 4 分钟,而人工中位数为两天,单月产出超 100 万美元合格商机管道。ElevenLabs 认为,语音智能体要让人愿意开口,既要听起来像人,也要足够清晰地让对话值得持续。
Gemini Audio 下周将在旧金山举办首次线下体验活动,Logan Kilpatrick 将到场,报名入口为 rsvp.withgoogle.com 的活动页面。同时官方博客上线了新 Live 音频模型的介绍内容。
Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新的 SOTA 实时音频模型,提供前沿的价格与性能。3.8 Live 支持 97 种语言并可在其间无缝切换,同时支持异步工具调用。
Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。
Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。
Google 发布两款 Gemini 音频模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。前者面向规模、速度和成本效率,支持句子中途打断、97 种语言实时切换并理解视觉上下文;后者在复杂任务上进一步强化推理能力,边推理边说话,可在执行多步项目时同步播报进度。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。
Google DeepMind 展示用 Gemini 3.8 Live Extended Thinking 充当编程辅导老师。两款模型均支持升级版推理、近实时视觉理解、97 种语言自动检测,以及不打断对话的后台工具调用。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为旗下最好的对话式 AI。官方表示这两个模型可以对话、思考并在后台处理任务,而不打断当前流程。
ElevenLabs 基于 ElevenAgents 构建的 AI SDR「Dom」正在承接其自身越来越多的入站销售线索资格审核,单条线索审核仅需 4 分钟,而人类中位数为两天。该智能体单月产出超过 100 万美元的合格销售管道,目前已在 ElevenLabs 内部投用。
阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。
Resemble AI 发布 DETECT-World,称其为首个为深伪检测构建的世界模型,从光照、几何、运动、音视频同步等物理合理性判断内容是否可信,而非比对已见过的伪造样本。一次计算同时输出判定结果、异常发生时间线和异常位置热图。在外部运行的 Podonos 基准上,其音频准确率为 99.5%,在商业 API 中排名第一。
OpenAI Developers 宣布 GPT-Live-1 已在 API 中可用,可把 ChatGPT 的自然双向对话能力接入应用,构建边听边说的语音智能体。该能力支持开发者自选模型与 harness。Greg Brockman 转发了这一消息,称其用于帮助开发者创造新类型的应用。
Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。
Fish Audio 放出体验链接 fish.audio/app/,邀请用户自行试用。该条内容未披露具体模型版本、功能细节或参数信息。
Fish Audio CEO @rissa_cao 拆解了团队如何标注与评估情感语音数据中的细微差别,让模型在对话推进过程中保留语气和表达方式的变化。其核心观点是,有表现力的语音不只是情绪本身,更是在恰当的时刻给出恰当的情绪。
三个新 skills 可给任意应用加上语音能力:/add-dictation 说话即输入文字,/add-voice 与 Grok 实时对话,/add-read-aloud 把任意回复朗读出来。这些 skills 可从 marketplace 安装。
腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。
超级小爱基于 Xiaomi MiMo 模型引入 RAG-Planning 并将推理从 think 模式切换为 no-think 模式,模型耗时平均下降约 35%,端到端最快快出 3 到 6 秒。全双工升级把拒识、判停和打断统一决策,配合三级 Session 压缩体系使上下文 Token 量下降 60%—86%,支持边听边说与随时插话。小米澎程 SkyNomad 已搭载专家版超级小爱。
AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。
HeyGen 上线 Professional Voice Clone,用某位说话人 20 分钟录音训练专属语音模型,为数字人补上"声音不像本人"这块短板。该功能现已在 HeyGen API 开放预览,官方演示中两段语音为真人 Josh、两段为克隆声音,供听感对比。
Fish Audio 本月在东京品川、惠比寿和虎之门 Hills 上线通勤场景广告,乘客可能在通勤途中看到。该消息由 Fish Audio 官方账号发布,并附带视频。
Bolt 新增语音输入功能,用户按住麦克风说出应用的名称、配色和布局,Bolt 即可完成规划、构建并发布。该功能由 bolt.new 在社交平台公布。