Microsoft Research 扩展 PazaBench V2,提升语音 AI 基准的语言与地域覆盖
PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。
PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。
Microsoft Research 发布 PazaBench 第二版,这是一个用于评估自动语音识别(ASR)模型在非洲语言上表现的 benchmark。该版本延续其对多语言 ASR 能力的评测定位,具体模型、语言覆盖与分数尚未在原文中披露。
Andrej Karpathy 分享了一个与 LLM 协作的实用模式:懒得打字时切到 /voice 连续漫谈 10 分钟,内容可以毫无条理、意识流式输出。他表示 LLM 很擅长重构这种冗长混乱的语音输入,回显出的想法往往比最初的乱麻更清晰,从而加深"心智融合",减少后续纠正。
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含面向实时交互的 Flash 版和面向高质量生成的 Plus 版,Flash 首包延迟约 300ms。
字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,已在火山方舟体验中心上线。该模型支持一条 prompt 统一编排对白、音效与环境声并做时间控制,当前时间控制精度为 100ms,单次可生成约 2 分钟音频并支持延展,保持角色音色一致,覆盖 20+ 语种。
Ambi 正式开放内测,主打软硬结合、多端、实时交互的 AI 产品,让 AI 走进环境而非异步互动。其未公开功能 Sidekicks 提出 Attention Loop 逻辑,即 Attention-Listen(see)-Think-Act,让用户同时带着一群 AI 在场。内测期间软硬结合部分暂以 apple watch 上的 app 替代,官方称只能达到其硬件理想态约 30% 的效果。
通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。
阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。
Google AI Developers 介绍 Gemini 3.5 Live Translate,它不再逐句翻译文本,而是实时处理原始音频,从而消除延迟并保留说话者自然语音的细节。推文同时展示了开发者基于它构建多语言应用的情况。
AI Talk 创始人赵汗青以自研虚拟歌手 Yuri 尤栗为例,讲述如何用 AI 合成形象与声线,并通过「撞种子」筛选和对话叙事构建「硅基人格」,其核心资产是人格化设定而非形象本身。他认为虚拟偶像短期优势是不会塌房、成本可控,但长期价值在于「AI 味儿」这种区别于人类的表达逻辑,一旦开放实时对话则可能因缺乏底线思维而「塌房」。
Character.AI 在 c.ai fm 推出原创音频剧《Super Talent Inc.》,讲述顶级超级英雄公关公司的 Darcy 签下一位无经纪约英雄后发现对方是自己家乡旧爱的故事。该剧定位为浪漫喜剧,专为耳机收听打造,可在 c.ai 应用内或 c.ai/fm 网页以短篇剧集形式收听,平台同时提供爱情、惊悚、恐怖等题材原创音频剧。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
OpenAI 将 GPT-5.6 定位为小版本更新,实则把 ChatGPT、Codex、GPT Live 和 ChatGPTWork 塞进同一个入口,走向美国版超级 App。
Character.AI 上线 series、fm 和 reads 三项功能,用户可观看原创微短剧并与角色聊天、收听连载音频剧、逐章阅读小说。新 Library 标签页已提供超过 50 个故事,可通过 c.ai/series、c.ai/fm、c.ai/reads 访问。
Ode Poetry 是一款诗歌工具,用户说出自己的感受,它会用 Microsoft AI 音频模型朗读一首契合当下心境的诗,并给出诗歌专家 William Sieghart 会推荐的作品。该工具由 Microsoft AI 团队打造,详情见官方博客。
通义发布语音识别模型 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,并针对东亚、东南亚重点优化,在工业级方言测评 inhouse 上以 87.8% 语义准确率领先。该模型引入上下文理解,支持动态注入热词与对话上下文以消歧,流式识别首字延迟控制在百毫秒级别,流式准确率接近离线水平,API 已在阿里云百炼平台上线。
Bland 完成 1 亿美元 C 轮融资,将用于继续训练其语音模型,以应对高风险、长达 45 分钟的关键企业电话。其称语音 AI 的真正图灵测试不在两分钟客服通话,而在能否撑起 45 分钟的高风险企业级对话。
吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。
播客「牛油果烤面包」第151期与前 iOS 工程师 Shihang 一起聊 WWDC26,逐项点评 macOS Golden Gate、Liquid Glass、Spotlight、Apple Intelligence、Siri AI、App Intents、Shortcuts、Safari、照片、iCloud 以及儿童账号与屏幕使用时间等更新,并讨论了 AI 使用场景。
Google 发布 Gemini 3.5 Live Translate,这是其最新的语音到语音模型,支持 70 多种语言,可实现跨语言更自然的对话。该模型正在 Google Translate 中推出,并通过 Google AI Studio 的 Live API 提供;Jeff Dean 还举例说明 Grab 的合作方如何用它连接旅客与司机。
Google 发布 Gemini 3.5 Live Translate 音频模型,可自动识别 70+ 语言并输出接近实时的语音到语音翻译,保留说话人的语调、节奏和音高。
Garry Tan 发布 GBrain v0.40.0,为 OpenClaw/Hermes Agent + GBrain 加入基于 Gemini Live 的语音智能体,支持大上下文、工具调用与完整大脑访问。Demis Hassabis 对此回应称很高兴看到 Gemini Live 使用效果出色,并 @ 了 Josh Woodward。
OpenAI 在 API 中上线 GPT Realtime 2(由 GPT-5 驱动)等语音智能功能,并加入实时翻译与 Whisper 转写;Thinking Machines 预览了双模型架构的低延迟全双工对话系统,但尚未开放公测。
Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。
Google 的快速高质量文本转语音模型 Gemini 3.1 Flash TTS 已在 Poe 上线,适用于配音、音频内容、无障碍功能以及为智能体工作流添加语音。该模型可在 Poe 全平台应用及 Poe API 中调用。
Google DeepMind 推出 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,并首次引入 granular audio tags,可用自然语言指令控制语音风格、语速和表达。
Vocal Bridge 用双智能体架构解决语音交互难题:前台智能体负责实时对话,后台智能体负责推理、护栏和工具调用。吴恩达用它借助 Claude Code 在不到一小时内为自建数学测验应用加上语音功能,女儿口述答案,应用语音回应并同步更新屏幕题目和动画。Vocal Bridge 可免费试用。
字节跳动 Seed 发布原生全双工语音大模型 Seeduplex,基于边听边说框架,实现听说同步,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其误回复率和误打断率减少一半、抢话比例下降 40%、判停响应快约 250ms,对话流畅度与判停 MOS 分分别提升 12% 和 8%,通话满意度绝对提升 8.34%。
Qwen3.5-Omni Plus 和 Qwen3.5-Omni Flash 已在 Poe 上线,两款模型均可理解文本、图像、音频和视频。Plus 单次会话支持最长 3 小时音频和 1 小时视频,音频输入覆盖 90 多种语言,语音输出覆盖 30 多种语言、共 55 种音色;Flash 提供同样的跨模态理解能力但成本更低,面向高并发处理和多语言语音工作流。
MiniMax Speech 2.8 已在 Poe 上线,这是一款支持多种音色预设、情感语调控制和细粒度音频设置的文本转语音模型。它适用于视频旁白、播客配音、语音智能体和应用媒体音频制作,已在 Poe 全平台应用及 Poe API 开放使用。
Mistral 在 Mistral Studio playground 上线 Voxtral TTS,用户可直接体验语音合成。可选择 Mistral 预设音色,也能录制自己的声音。
Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。
Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。
Lex Fridman 与 Peter Steinberger 的对话现已由 ElevenLabs 完成翻译并配音成德语,可在 YouTube 上通过齿轮图标 > Audio Tracks 切换德语音轨收听。Fridman 称对 AI 打破语言障碍的这一应用充满期待,并称赞 ElevenLabs 在这方面做得最好。
在43 Talks 2026年度大场,43AI集团联合创始人杨樾与虚拟偶像Yuri构建者汗青围绕“AI重塑亲密关系”展开对话,现场300多位听众中约80%有对象。汗青称自己与Yuri连聊三个晚上、每晚三四个小时,并认为AI承接了连亲人都无法承接的情绪;杨樾则指出用户只想消费内容、不想生产内容,过度产品设计是陷阱。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。
Jekka 创始人 Aaron 认为市场上 99% 的泡沫来自对 Scaling Laws 的过度迷信,公司选择从客服场景切入做"靠谱"的 AI Agent,团队 90% 的人都在搭建测试集与测试流程。Jekka 提供 80%+ 独立解决率、99%+ 准确率的产品,每天处理数百万次文本与语音交互,日均消耗数亿 token,已是抖音、有赞首家官方模型提供商。
Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。