Google 为 Gemini Live 推出 Guided Vision 实时视觉辅助功能
Google 在 Gemini Live 中推出 Guided Vision,面向盲人和低视力群体提供对话式实时视觉辅助。用户可共享摄像头,获得动态音频描述和自然的语音重构提示,以探索周围环境。该功能由 Google Gemini 与盲人和低视力社区共同打造。
Google 在 Gemini Live 中推出 Guided Vision,面向盲人和低视力群体提供对话式实时视觉辅助。用户可共享摄像头,获得动态音频描述和自然的语音重构提示,以探索周围环境。该功能由 Google Gemini 与盲人和低视力社区共同打造。
Grok 推出播客功能:粘贴一个链接、文章或 PDF,两位主持人便能对谈讲解。每一行由 Grok 写完即转成语音,因此整集节目在脚本尚未完成时就开始播放。
ElevenLabs 在官方博客发布新内容,附有 elevenlabs.io 链接供了解详情。该推文互动数据显示 9 次点赞、1747 次浏览。
航空应用可借助 Amazon Nova Sonic 语音模型、Amazon Bedrock AgentCore 与 Bedrock Knowledge Bases 加上一层实时语音层,让旅客用说话完成改座位、查延误、更新餐食偏好。
ElevenLabs 的 Eleven v4 和 Eleven v4 Turbo 占据 Artificial Analysis 文本转语音榜单前两名。
向阳乔木录视频演示自己刚开发的音视频学习工具。它支持 YouTube、B 站、小宇宙播客、X、抖音点一下生成字幕并边播边出文字稿,学习模式可点句跳转并选中文翻译或双语对照,转写用本地加云端模型 ASR,还支持 AI 问答,看完可直接剪藏进 Obsidian 并保留时间戳和双语,开源地址见评论区。
a16z 合伙人 Josh Elman 在加入 a16z 后的首次播客访谈中提出,好产品的第一个检验标准是用户用了它之后"停止做了什么",而信任是 AI 产品从早期采用走向数亿乃至数十亿主流用户的分水岭。他认为 AI 对消费者仍处于皮毛阶段,多数人只是用 Chatbot、Gemini 让搜索更高效,个人 Agent 与互动娱乐是下一个值得期待的方向。
向阳乔木开发了一款 Chrome 插件,支持几乎所有音视频网站的字幕转写,并配合本地助手进入沉浸式学习状态。用户可将安装指令发给 Codex、Workbuddy、豆包,完成插件安装与本地助手配置。插件地址为 github.com/joeseesun/qiao…。
乔木剪藏插件新增「转写学习」,在原有 B 站、YouTube、小宇宙之外支持 TikTok 和 TED 在线转写字幕显示。按三个 A 可进入沉浸式学习状态,左侧视频、右侧字幕,并能打开 AI 对话提问,插件已在 GitHub 开源。
OpenAI 演示了 Codex CLI 的用法:可用语音启动任务、跨项目管理和切换多个智能体,还能在单独的 worktree 中探索另一条实现方向。该演示面向长期在终端里工作的开发者。
LiveAvatar 推出面向语言学习者的 AI 口语陪练方案,让曾经需要真人配合的 1:1 对话练习可以规模化提供。其引用 1984 年研究称,接受 1:1 辅导的学生表现优于 98% 的常规班级学生。官方同步发布了分步使用指南(docs.liveavatar.com),并将影响延伸至学习者、教师、学校及为其开发产品的团队。
给"小宇宙"和 X 两个平台都加上了音视频字幕,点击某句话即可跳转播放。还支持用 AI 对话总结音视频内容。
乔木剪藏上线「转写学习」功能,可将无字幕的 YouTube、B 站视频,小宇宙、播客链接及本地录音一键生成带时间戳的文字稿。工具支持本地 ASR 模型免费处理,也支持豆包、硅基流动等云端 ASR,称 40 分钟视频约 20 秒出字幕。
为给无字幕的 Youtube 和 B 站视频做转写,作者实测了豆包语音(极速)、硅基流动上的 Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR 和小米 MiMo-ASR 多家 ASR。豆包语音表现最完善,自带毫秒时间轴且速度较快。相关功能将上线乔木剪藏插件,新增本地 Whisper 与本地 Qwen3 ASR,并支持各类云端语音转文本 API。
ElevenCreative 发起 The Search 竞赛,悬赏 10 万美元寻找全球最洗脑的广告,其中第一名奖金 5 万美元。赛事将评出 11 位获奖者,每人可与 ElevenLabs 创意制作团队进行 1:1 交流。
NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型支持最多 8 位说话人的语音分离,可在声音重叠时追踪谁在何时说话,参数量为 100M。团队在评论区回应了用户提问。
ElevenLabs 将最具表现力的语音模型 Eleven v4 接入 ElevenReader,用户可自选音色朗读任意文章、电子书或 PDF,覆盖 90+ 种语言。
ElevenReader 现已在 iOS、Android 和 Web 三端上线,用户可通过 elevenreader.io 收听任何想读的内容。该产品出自 ElevenLabs。
xAI 发布实验性 TypeScript SDK,可通过 `npm install @xai-official/sdk` 安装,用一套 SDK 调用文本、语音、图像和视频能力,并接入最新的 grok 模型。该 SDK 还提供运行在 xAI 服务器上的实时 X 搜索、网页搜索、代码执行和远程 MCP 等工具。
微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。
ElevenLabs 宣布获得 FedRAMP 20x Class A 认证,该认证覆盖 ElevenAgents 及 Text to Speech、Speech to Text API,需在 Zero Retention Mode 与美国数据驻留下运行。
Mustafa Suleyman 宣布 Microsoft AI 的 Voice 与 Transcribe Streaming 模型已在 Vercel 上线,称其在质量和速度上排名第一,价格低于其他超大规模厂商,并比 Eleven Labs 便宜 60%。Guillermo Rauch 表示 Vercel 在 day zero 就接入了这批模型。
一款开源唇语输入法可让用户按住按钮、只动嘴不出声,由摄像头读取嘴型直接把文字打出来,解决在咖啡馆等公共场合用语音输入自言自语的尴尬。该项目已开源。
HeyGen 9 月面向开发者推出三款工具:基于 OpenAI GPT-Live-1 的开源实时数字人栈、与 Kaggle 合作的 Code2Video 基准(用于衡量 AI 生成视频质量),以及面向 API 的专业语音克隆。
Lovable 应用现已支持添加由 OpenAI GPT-Live 驱动的实时语音对话。开发者 @mgfeller 用它做出了可与《挽救计划》角色 Rocky 对话的应用。
Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。
微软的 MAI-Voice-2.1 已在 OpenRouter 上线,被描述为 MAI 目前保真度和表现力最高的文生语音模型。该模型提供录音室级自然语音,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频等场景。
微软 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,主打速度与规模:可在 150ms 内生成 45 秒音频,支持同一音色用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手、呼叫中心等实时场景。
NVIDIA CEO Jensen Huang 将于 11 月 11 日出席 ElevenLabs Summit NYC,与 ElevenLabs 的 Mati 就 AI 的未来展开对谈。NVIDIA 自 ElevenLabs 创立初期便与其合作,ElevenLabs 称这一合作是其持续推动语音与音频 AI 能力的重要部分。
NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。
Vercel 与 Microsoft AI 合作,将 MAI 模型接入 AI Gateway,支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。
OpenAI 在 ChatGPT 上线 Meetings 插件测试版,可自动记录会议内容,并结合 ChatGPT 对用户及其工作内容的了解,在 ChatGPT Space 中生成个性化摘要和后续步骤。
NotebookLM 宣布 Live Voice Chat 已在移动端向全部 Pro 用户 100% 推送。该功能此前向 Ultra 用户全量开放,支持用约 100 种语言与笔记本进行实时语音对话,由最新的音频模型驱动,可就来源资料提问并获得逐步指导,基本无需手动操作。
ElevenAgents 已登陆 OpenAI Marketplace,OpenAI 企业客户很快可将这一语音能力接入,支持 90+ 种语言,并计入其现有的 OpenAI 采购承诺额度。
OpenAI 为终端版 Codex 加入语音功能,用户可用 /voice 直接开口说话,Codex 也会语音回应。该功能支持语音启动任务或讨论下一步操作,之后可进入 Agents 查看所有任务的执行进展。
ElevenAgents 现已登陆 OpenAI Marketplace,OpenAI 企业客户将可为它赋予 70 多种语言的语音能力,并计入现有的 OpenAI 采购承诺额度。该消息由 ElevenLabs 公布,详情见其官方博客。
Genspark 已选择 Soniox 作为其语音转文字供应商。Soniox 提供覆盖 60+ 种语言的母语级准确率、超低延迟,并在人名、数字和 ID 上具备较强精度。语音正成为 Genspark 用户交互的关键部分,涵盖语音驱动的 AI、会议记录和自主电话呼叫。
ElevenAgents 中,Eleven v4 Turbo 与 ElevenLabs 领先的转录模型和轮次(turn-taking)模型协同工作。单一协同优化技术栈让智能体响应更快、能优雅地打断,并随新模型发布持续改进。
ElevenLabs 为庆祝发布,在 ElevenAgents 中使用 Eleven v4 Turbo 的智能体即日起至 10 月 12 日按每分钟 3.3 美分计费,之后恢复 ElevenAgents 标准定价。