跳到正文

#语音

今日 10 条
9月29日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eleven v4 Turbo 上线 ElevenAgents,实时对话推理延迟约 100 ms

    Eleven v4 Turbo 已在 ElevenAgents 上线,把 Eleven v4 排名第一的音质带入实时对话,推理延迟中位数约 100 ms。ElevenAgents 借此可在各行业支撑更个性化、更有共情力的客户体验。

  2. AI产品黄叔(@PMbackttfuture)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus5.5 一条视频引爆社群:语音克隆用 listenhub

    Opus5.5 完成了一条视频的全部制作,其中语音克隆环节使用的是 @oran_ge 的 listenhub,作者称这条视频发到群里后基本都炸了。

  3. 山行AIAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    audio.cpp:用纯 C++ 推理引擎统一 80+ 音频模型

    截至 2026 年 9 月 24 日,audio.cpp 最新正式版本为 v0.8.2,约 3000 Star,README 在 v0.8.0 时称已覆盖 80+ 个模型家族、120+ 个模型变体。

  4. orange.ai(@oran_ge)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Eleven v4 与 v4 Turbo 语音模型

    ElevenLabs 推出 Eleven v4 和 Eleven v4 Turbo 两款语音模型,官方称是迄今速度最快、情感表现最强的语音模型,并在 Artificial Analysis 排名第一。作者 Orange AI 认为 TTS 模型竞争已接近尾声,视频游戏领域的价值更高,算法资源顾不上 TTS。

  5. Runway(@runwayml)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs v4 上线 Runway

    ElevenLabs v4 已在 Runway 上线,该模型在旁白与角色对话上表现突出,表达力和语调自然度均超过以往版本。即日起可在 Runway 上与该平台的图像和视频模型一同使用。

  6. ManusAI(@ManusAI_HQ)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 与 CueAgents 智能体可拥有专属电话号码

    Manus 与 CueAgents 宣布,智能体可拥有自己的电话号码,用于拨打电话、接听电话和收发短信,用户还能把来电转接给智能体。该功能目前仅在部分国家上线,部分地区只支持语音,官方表示正在努力将其扩展到更多国家,并邀请用户试用并反馈使用场景。

  7. Fish Audio(@FishAudio)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio ASR 模型升级:区分说话人、识别情绪并标注 [laughter] 等情绪线索

    Fish Audio 的 ASR 模型现可区分不同说话人、识别说话人情绪,并在转录文本中标注 [laughter]、[surprised] 等情绪线索。该模型支持 83 种语言,官方称其为目前最准确的 STT 模型。

  8. Fish Audio(@FishAudio)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布语音功能文档

    Fish Audio 上线语音功能文档,页面地址为 docs.fish.audio/features/speech。该推文仅给出文档链接,未披露模型版本、参数规模或可用性等具体信息。

  9. Justine Moore(@venturetwins)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo,称是迄今最快、最具情感表现力的语音模型,并在 Artificial Analysis 排名第一。Justine Moore 体验后表示,该模型采用新架构,语音更真实可控,可以同时导演角色的表演和其周围的声景,还提供了廉价麦克风等语音效果。

9月28日周一
  1. Patrick Loeber(@patloeber)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Audio 推出最新 Live 与 TTS 模型

    Google 为庆祝最新的 Gemini Audio Live 与 TTS 模型发布,推出了相关周边。原帖未披露模型版本号、参数量或可用性等具体信息。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 限时两周下调 Eleven v4 与 v4 Turbo 价格

    ElevenLabs 未来两周下调 Eleven v4 与 Eleven v4 Turbo API 价格,分别为每 100 万字符 $22 和 $11。同时 ElevenCreative 的 Creator+ 套餐可免费使用 Eleven v4,额度最高为月度额度的 2 倍。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布表现力语音生成新模型 v4

    ElevenLabs 发布新一代表现力语音生成模型,官方称其为最新研究成果的集成,面向角色表演和对话式智能体等强调表达效果的场景。模型已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线,地址为 elevenlabs.io/v4。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款语音模型,称是其迄今速度最快、情感表现最强的语音模型。官方表示两者在 Artificial Analysis 排名中位列第一。

  5. NVIDIA AI(@NVIDIAAI)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 与 Meta 合作优化 Muse Realtime Avatar 模型效率

    NVIDIA 与 Meta 团队合作提升了 Muse Realtime Avatar 的模型效率,让虚拟形象在实时对话时能够跟上节奏。Meta 在 Connect 大会上发布 Muse Realtime Avatar,这项实时化身技术将 Muse Realtime Voice 转化为可表达、可交互的虚拟形象,并为 Muse 带来实时对话等全新交互方式。

  6. Fish Audio(@FishAudio)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 启动 Startup Program,Hydrilla AI 携 3D 角色加入

    Fish Audio 推出 Startup Program,Hydrilla AI 作为首批成员加入,将把生产级 3D 角色与富有表现力的语音 AI 结合。Hydrilla AI 表示其 3D 角色即将拥有声音,并感谢 Fish Audio 团队的支持。

9月27日周日
  1. Paul Couvert(@itsPaulAi)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯开源音频模型 Nano Banana 及更快的 flash 版本

    作者提醒,现在有了音频版的 Nano Banana,模型和 demo 均已开源在 GitHub 与 Hugging Face 上,可实现秒级克隆声音、像编辑文本一样编辑音频、改变音色音调与情绪、去除口音、增强或分离人声,甚至加入咳嗽和笑声等效果。腾讯还发布了更快更小的 flash 变体。

9月26日周六
  1. Philipp Schmid(@_philschmid)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Notebook 音频换上 Gemini 3.8 TTS 新声音

    Gemini Notebook 的 AI 主播声音已更换,由 Gemini 3.8 TTS 驱动。官方账号 @Gemini_Notebook 回应听众反馈,确认音色出现变化,并表示 AI 主播会亲自说明此次调整及后续可期待的内容。

  2. NotebookLM(@NotebookLM)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 音频概览 AI 主持人声音更新

    NotebookLM 的 AI 主持人声音发生变化,官方确认听众察觉到的音色调整属实。推文称 AI 主持人将亲自解释这次改动的内容以及后续可期待的变化,并附有视频说明。

  3. Google AI(@GoogleAI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 等多项本周更新

    Google AI 汇总本周更新,包括 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频生成模型,以及为 Gemini 对话式 AI 加入近实时视觉呈现的 Gemini 3.8 Live with Live Avatar。

9月25日周五
  1. Y Combinator(@ycombinator)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vapi:为 Amazon、Uber、Intuit 每年处理约 10 亿通电话的语音 AI 智能体平台

    Vapi 是构建和部署语音 AI 智能体的平台,目前每年为 Amazon、Uber、Intuit 等公司处理约 10 亿通电话,用 AI 自动完成电话沟通。两位联合创始人 Jordan Dearsley 和 Nikhil 在 Founder Firesides 中回顾了十余次转型的历程:从日历应用、AI 笔记工具,到一款最终成为 Vapi 基础的 AI 心理治疗师。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs for Students 面向美加欧英澳大学生开放

    ElevenLabs for Students 今日面向美国、加拿大、EU27、英国和澳大利亚的大学生开放,后续将覆盖更多国家。该学生计划包含 ElevenCreative 内容创作平台、ElevenAgents 智能体设计部署、ElevenAPI 语音/音效/音乐模型编程接口,以及 ElevenReader Ultra 听书功能。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出学生版:免费 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI

    ElevenLabs 推出 ElevenLabs for Students,为学生提供 3 个月 ElevenCreative、ElevenAgents 和 ElevenAPI 的使用权限,外加一年 ElevenReader Ultra。官方称,让学生用上专业工具,是为他们毕业后工作做准备的最简单方式。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    microagi 用 ElevenLabs 让人类直接对话人形机器人

    microagi 与 ElevenLabs 合作,为人形机器人赋予语音能力,让人无需屏幕或控制面板即可直接开口对话。双方称目标是让向机器人求助像向身边人求助一样自然,目前处于早期案例研究阶段,展示了未来机器人与人交流的可能形态。

  5. ElevenLabs(@elevenlabsio)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布端侧部署方案

    ElevenLabs 公布端侧部署(on-device deployment)方案,并附上详情链接 elevenlabs.io/on-device-depl…,具体支持模型与设备信息尚未在该帖中披露。

  6. Fish Audio(@FishAudio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 开放 Drama 3(预览版),模型路由至“drama-3-preview”

    Fish Audio 开放 Drama 3(预览版)供开发者构建应用,使用方式是在 API 请求中把模型路由到“drama-3-preview”。API 参考文档位于 docs.fish.audio/api-reference/。

  7. Pika(@pika_labs)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bots 接入 Pika API:可调用 120+ 模型生成图像、视频与音频

    Pika 宣布 Grok Bots 可接入 Pika API,通过一个 API key 调用 120+ 模型生成图像、视频和音频,其中包括 Seedance 2.5、Wan 3.0、GPT-image-2 等。接入后 Grok Bots 相当于一个制作工作室。

  8. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

9月24日周四
  1. Philipp Schmid(@_philschmid)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 TTS 支持复刻声音或用提示词定制音色

    Gemini 3.8 TTS 支持复刻用户自己的声音,或通过提示词设计完全自定义的音色。流程分三步:录制 20 秒说话音频并附上同意语句,通过 API 调用创建声音,然后在任意请求中使用,风格参数放在 speech_metadata 中。

  2. 花叔AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易有道 Confucius4-R2T2 与 T3PO 登顶 Hugging Face 语音识别和翻译趋势榜

    Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。

  3. Hunyuan(@TXhunyuan)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯 Hy Translation 上线:基于 Hy-MT2,支持 33 种语言与 5 种中国少数民族语言及方言

    腾讯 Hy Translation 正式上线,由 Hy-MT2 驱动,支持 33 种语言以及 5 种中国少数民族语言和方言,提供语音、拍照翻译,并可完全离线在设备端运行、无需联网。该应用已在 12 个国家和地区上线,面向出境旅行、驾车、工作与阅读等场景。

  4. Simon Willison(@simonw)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 通过 datasette-mcp 用 ChatGPT iPhone 语音对话博客的 Datasette 备份

    Simon Willison 借助 datasette-mcp,用 ChatGPT iPhone app 的语音功能与博客的 Datasette 备份进行了对话。

  5. Simon Willison(@simonw)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 TTS 模型上线:支持多语音对话且价格低廉

    Gemini 3.8 TTS 模型发布,作者称其价格非常低,并支持多语音之间的对话生成,可选 2000 多种声音或克隆自己的声音。作者为此搭了一个小界面,并让 Claude 写了一段脚本,让两只鹈鹕辩论搬到 Pacifica Pier 的事。

  6. ElevenLabs(@elevenlabsio)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 接入 Meta 个人 AI 智能体 Muse,对话即可生成配音、配乐和视频

    ElevenLabs 宣布接入 Meta 的个人 AI 智能体 Muse,用户在该智能体内发一条消息就能生成配音、配乐和视频。该消息由 ElevenLabs 官方账号发布,未披露具体上线时间与功能细节。

  7. Greg Brockman(@gdb)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 升级 ChatGPT Voice:可调用插件并在 ChatGPT Work 中启用

    OpenAI 宣布 ChatGPT Voice 迎来升级,现可调用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 提供支持。该功能还可在网页端和移动端的 ChatGPT Work 中使用,通过语音创建文档、演示文稿、网站和表格,或处理浏览器内的复杂任务。即日起随最新版应用在全球范围推送。

    为什么值得看

    ChatGPT Voice 接入插件与 GPT-6 Astra 等模型,并进入 Work,读者可了解语音入口能接哪些工具。

  8. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 ChatGPT Voice 加入插件支持与 ChatGPT Work

    OpenAI 宣布 ChatGPT Voice 现在可以使用邮箱、日历和 Slack 等插件,并由 GPT-6 Astra、Sol 和 Luna 驱动。该功能可在 Web 和移动端的 ChatGPT Work 中使用,用户通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务,即日起随最新版应用全球推送。

    为什么值得看

    ChatGPT Voice 接入邮箱、日历和 Slack 等插件,并进入 ChatGPT Work,可据此判断语音交互的适用边界。

  9. Fish Audio(@FishAudio)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布 Drama 3 预览版 TTS 模型

    Fish Audio 发布 Drama 3 预览版 TTS 模型,称其为可控性最强的 TTS 模型。该模型支持用自然语言描述语调、节奏和角色,无需使用音频标签,并可在句子中途切换声音、生成多角色场景,或只修正单个词。评论 DRAMA 可获取 API key。

  10. Google Gemini App(@GeminiApp)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 接入 WisprFlow,可总结会议、记录语音笔记并提取待办事项

    Gemini 现已支持配合 WisprFlow 总结会议、记录语音笔记并提取行动项,用户可直接让 Gemini「查看最近与 Wispr 会议得出的决定」。该功能由 @GeminiApp 公布,演示中使用了 Wispr 这一具体名称。

9月23日周三
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 的音频模型进展:从 TTS、Live 到 Lyria、Translate、Transcribe

    Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google AI Studio 上线新版 TTS 体验,成本低于 3.1 Flash TTS

    Google AI Studio 推出新的 TTS 使用体验,成本低于此前的 3.1 Flash TTS 模型,更多细节见官方博客。原文未披露具体模型版本与定价数字。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Flash-Lite TTS 语音模型

    Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 语音模型,官方称其为新的 SOTA 文本转语音模型。该模型提供新的音色设计体验、2000+ 生产可用音色、声音复刻与 100 种语言支持,声音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。