跳到正文

#语音

今日 13 条
9月19日周六
  1. xAI(@xai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok Voice Transcribe 2.0:客服通话等场景准确率翻倍

    xAI 推出 Grok Voice Transcribe 2.0,在客服通话、口述凭证和短语音指令场景下,转录准确率是上一代的两倍。该消息由 xAI 官方账号发布,推文互动数据显示获得 123 次点赞、6 次转发。

  2. xAI(@xai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok Voice Transcribe 2.0 语音转录模型

    xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转录模型。该消息由 SpaceXAI 在 X 上公布,未提及具体参数、评测数据或开放方式。

  3. Fish Audio(@FishAudio)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出基于流式 TTS 的实时语音到语音翻译,支持 80+ 语言

    Fish Audio 发布实时语音到语音翻译演示,基于其流式 TTS 构建,支持 80+ 语言的单向翻译与双向对话。官方已开放体验入口与实现代码,开发者可直接上手构建自己的应用。

  4. Fish Audio(@FishAudio)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出 translate.demo.fish 翻译演示

    Fish Audio 上线 translate.demo.fish 翻译演示,由 @cshape_ 发布。该推文获得 1 条回复、1 次点赞和 1009 次浏览。

  5. Fish Audio(@FishAudio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 实时翻译如何工作

    Fish Audio 发布实时翻译工作原理说明页(translate.demo.fish/how-it-works),由 xgo.ing 提供技术支持。原文未披露所用模型、延迟数据或可用方式等细节。

9月18日周五
  1. 阿里研究院AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布全模态模型 Qwen3.8-Omni-Flash

    新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。

    为什么值得看

    原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。

  2. eric zakariasson(@ericzakariasson)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 上线语音模式

    Grok Bot 现在支持语音模式,可以开口说话了。该消息由 Grok Bot 官方账号发布,并附带了演示视频。

  3. Fish Audio(@FishAudio)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 与 Coval 在旧金山重启 Voice AI Builder Dinner,9 月 22 日举办

    Fish Audio 与 @covaldev 在旧金山重启 Voice AI Builder Dinner,活动定于 9 月 22 日,面向创始人及产品负责人。参与者将围绕医疗、客户支持等对可靠性要求极高的场景,交流构建语音 AI 过程中最难的部分。

9月17日周四
  1. ElevenLabs(@elevenlabsio)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Cadence

    ElevenLabs 发布 Cadence,相关详情见其官方博客 elevenlabs.io/blog/cadence。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cadence 用 ElevenAgents 支撑全美 20+ 医疗系统的慢病护理流程

    Cadence 基于 ElevenAgents 打造的预警筛查智能体,将原本需要人工拨号、中位耗时 1 小时 48 分钟的告警触达缩短至 3.5 分钟。该流程覆盖全美 20+ 医疗系统,每月处理 40,000+ 条告警,会主动致电患者筛查症状,必要时接入其 24/7 护理团队中的护士。

  3. xAI(@xai)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Voice 上线 fal:0.70 秒响应,支持 30+ 音色与语音克隆

    Grok Voice 已在 fal 上线,这款来自 SpaceXAI 的最新语音模型可在 0.70 秒内作答,并在句子说完前完成工具调用。它支持词级时间戳转写、25+ 种语言的 30+ 种音色文本转语音,以及用两分钟音频完成音色克隆。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Reception 相关更新:可用性、定价与上手方式

    ElevenLabs 公布了新产品的可用性、定价与上手方式,详情见其官方博客 elevenlabs.io/blog/reception。原文未透露该产品的具体功能、版本号或价格数字。

  5. ElevenLabs(@elevenlabsio)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出 Reception:为企业搭建 AI 接待

    ElevenLabs 上线 Reception,企业可用来搭建自己的接待服务,配套地址为 reception.ai。该推文附带官网链接,阅读量约 134 万,转推 12、点赞 143。

  6. ElevenLabs(@elevenlabsio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出 Reception:面向小企业的 AI 前台接待平台,基于 ElevenAgents

    ElevenLabs 发布 Reception,一个面向小企业、基于 ElevenAgents 构建的 AI 前台接待平台。Reception 可接听每一通来电、回答客户问题、预约服务并发送短信确认,用户只需添加网址即可在几分钟内完成设置。

  7. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepAudio 3 Realtime 技术报告发布

    阶跃星辰发布 StepAudio 3 Realtime 技术报告,论文已在 Hugging Face 上线。

9月16日周三
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google、Meta、Microsoft 竞逐语音识别头名,The Batch 解读对 AI 开发的影响

    语音识别领域的竞争正在升温,Google、Meta 和 Microsoft 正通过发布新的强力模型争夺头名位置。DeepLearning.AI 在 The Batch 中解读了这一趋势对 AI 开发者的意义,指出在生成式文本模型占据话题中心的当下,语音识别正迎来属于自己的时刻。

  2. Patrick Loeber(@patloeber)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Live API 更新:全新音频模型解读

    Gemini Live API 迎来更新,新增音频模型。Patrick Loeber 分享了由 @thorwebdev 讲解这些新音频模型的视频,介绍其具体能力。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 用 ElevenAgents 打造 AI SDR:4 分钟筛出销售线索,单月转化超百万美元商机

    ElevenLabs 用 ElevenAgents 构建 AI SDR「Dom」,已在自家 inbound 销售中承担越来越多的线索资格审核。该智能体筛出一条线索只需 4 分钟,而人工中位数为两天,单月产出超 100 万美元合格商机管道。ElevenLabs 认为,语音智能体要让人愿意开口,既要听起来像人,也要足够清晰地让对话值得持续。

  4. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Audio 下周将在旧金山举办首次线下体验活动

    Gemini Audio 下周将在旧金山举办首次线下体验活动,Logan Kilpatrick 将到场,报名入口为 rsvp.withgoogle.com 的活动页面。同时官方博客上线了新 Live 音频模型的介绍内容。

  5. Patrick Loeber(@patloeber)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。

  6. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时音频模型

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新的 SOTA 实时音频模型,提供前沿的价格与性能。3.8 Live 支持 97 种语言并可在其间无缝切换,同时支持异步工具调用。

  7. Philipp Schmid(@_philschmid)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。

    为什么值得看

    Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。

  8. Google AI(@GoogleAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google 发布两款 Gemini 音频模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。前者面向规模、速度和成本效率,支持句子中途打断、97 种语言实时切换并理解视觉上下文;后者在复杂任务上进一步强化推理能力,边推理边说话,可在执行多步项目时同步播报进度。

  9. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。

  10. Google DeepMind(@GoogleDeepMind)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Live Extended Thinking 演示:充当编程辅导老师

    Google DeepMind 展示用 Gemini 3.8 Live Extended Thinking 充当编程辅导老师。两款模型均支持升级版推理、近实时视觉理解、97 种语言自动检测,以及不打断对话的后台工具调用。

  11. Google DeepMind(@GoogleDeepMind)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为旗下最好的对话式 AI。官方表示这两个模型可以对话、思考并在后台处理任务,而不打断当前流程。

9月15日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 用 ElevenAgents 打造 AI SDR「Dom」,单月跑出超 100 万美元合格商机

    ElevenLabs 基于 ElevenAgents 构建的 AI SDR「Dom」正在承接其自身越来越多的入站销售线索资格审核,单条线索审核仅需 4 分钟,而人类中位数为两天。该智能体单月产出超过 100 万美元的合格销售管道,目前已在 ElevenLabs 内部投用。

  2. 阶跃星辰AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布 StepAudio 3 系列语音大模型,五款模型上线开放平台

    阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。

  3. AI Breakfast(@AiBreakfast)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Resemble AI 推出首个面向深伪检测的世界模型 DETECT-World

    Resemble AI 发布 DETECT-World,称其为首个为深伪检测构建的世界模型,从光照、几何、运动、音视频同步等物理合理性判断内容是否可信,而非比对已见过的伪造样本。一次计算同时输出判定结果、异常发生时间线和异常位置热图。在外部运行的 Podonos 基准上,其音频准确率为 99.5%,在商业 API 中排名第一。

9月11日周五
  1. Greg Brockman(@gdb)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 API 中上线 GPT-Live-1 语音能力

    OpenAI Developers 宣布 GPT-Live-1 已在 API 中可用,可把 ChatGPT 的自然双向对话能力接入应用,构建边听边说的语音智能体。该能力支持开发者自选模型与 harness。Greg Brockman 转发了这一消息,称其用于帮助开发者创造新类型的应用。

  2. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 实测 GPT-Live:任务完成率翻倍、理解率 92%,并接入 Call for Me 等产品

    Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。

  3. Fish Audio(@FishAudio)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 上线 fish.audio/app/ 在线体验入口

    Fish Audio 放出体验链接 fish.audio/app/,邀请用户自行试用。该条内容未披露具体模型版本、功能细节或参数信息。

  4. Fish Audio(@FishAudio)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio CEO 拆解情感语音模型的数据标注与评估方法

    Fish Audio CEO @rissa_cao 拆解了团队如何标注与评估情感语音数据中的细微差别,让模型在对话推进过程中保留语气和表达方式的变化。其核心观点是,有表现力的语音不只是情绪本身,更是在恰当的时刻给出恰当的情绪。

  5. eric zakariasson(@ericzakariasson)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为任意应用添加语音:三个 skills 支持听写、Grok 实时对话与朗读

    三个新 skills 可给任意应用加上语音能力:/add-dictation 说话即输入文字,/add-voice 与 Grok 实时对话,/add-read-aloud 把任意回复朗读出来。这些 skills 可从 marketplace 安装。

9月10日周四
  1. Hunyuan(@TXhunyuan)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元开源统一语音生成与编辑模型 AuK,并推出 4 步推理的 AuK-Flash

    腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。

  2. 小米技术AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米超级小爱技术解读:快慢系统与全双工对话如何让车载交互更流畅

    超级小爱基于 Xiaomi MiMo 模型引入 RAG-Planning 并将推理从 think 模式切换为 no-think 模式,模型耗时平均下降约 35%,端到端最快快出 3 到 6 秒。全双工升级把拒识、判停和打断统一决策,配合三级 Session 压缩体系使上下文 Token 量下降 60%—86%,支持边听边说与随时插话。小米澎程 SkyNomad 已搭载专家版超级小爱。

  3. AK(@_akhaliq)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AuK 技术报告:开源语音生成与编辑基础模型

    AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。

  4. HeyGen(@HeyGen_Official)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 推出 Professional Voice Clone:20 分钟录音定制专属语音模型,现已上线 API 预览

    HeyGen 上线 Professional Voice Clone,用某位说话人 20 分钟录音训练专属语音模型,为数字人补上"声音不像本人"这块短板。该功能现已在 HeyGen API 开放预览,官方演示中两段语音为真人 Josh、两段为克隆声音,供听感对比。

  5. Fish Audio(@FishAudio)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 广告本月登陆东京品川、惠比寿与虎之门 Hills

    Fish Audio 本月在东京品川、惠比寿和虎之门 Hills 上线通勤场景广告,乘客可能在通勤途中看到。该消息由 Fish Audio 官方账号发布,并附带视频。

9月9日周三
  1. bolt.new(@boltdotnew)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 上线语音功能:按住麦克风说出应用需求即可生成并发布

    Bolt 新增语音输入功能,用户按住麦克风说出应用的名称、配色和布局,Bolt 即可完成规划、构建并发布。该功能由 bolt.new 在社交平台公布。