跳到正文

#语音

今日 10 条
10月7日周三
  1. Google Gemini App(@GeminiApp)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 为 Gemini Live 推出 Guided Vision 实时视觉辅助功能

    Google 在 Gemini Live 中推出 Guided Vision,面向盲人和低视力群体提供对话式实时视觉辅助。用户可共享摄像头,获得动态音频描述和自然的语音重构提示,以探索周围环境。该功能由 Google Gemini 与盲人和低视力社区共同打造。

  2. eric zakariasson(@ericzakariasson)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 实时生成双人播客:粘贴链接或 PDF,脚本边写边播

    Grok 推出播客功能:粘贴一个链接、文章或 PDF,两位主持人便能对谈讲解。每一行由 Grok 写完即转成语音,因此整集节目在脚本尚未完成时就开始播放。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布新博客内容

    ElevenLabs 在官方博客发布新内容,附有 elevenlabs.io 链接供了解详情。该推文互动数据显示 9 次点赞、1747 次浏览。

10月6日周二
  1. AWS Machine Learning BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行助手

    航空应用可借助 Amazon Nova Sonic 语音模型、Amazon Bedrock AgentCore 与 Bedrock Knowledge Bases 加上一层实时语音层,让旅客用说话完成改座位、查延误、更新餐食偏好。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 的 Eleven v4 与 v4 Turbo 登顶 Artificial Analysis TTS 榜单前两名

    ElevenLabs 的 Eleven v4 和 Eleven v4 Turbo 占据 Artificial Analysis 文本转语音榜单前两名。

  3. 向阳乔木(@vista8)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木发布音视频学习工具:支持多平台字幕生成与双语学习

    向阳乔木录视频演示自己刚开发的音视频学习工具。它支持 YouTube、B 站、小宇宙播客、X、抖音点一下生成字幕并边播边出文字稿,学习模式可点句跳转并选中文翻译或双语对照,转写用本地加云端模型 ASR,还支持 AI 问答,看完可直接剪藏进 Obsidian 并保留时间戳和双语,开源地址见评论区。

  4. Z PotentialsAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 合伙人 Josh Elman 谈 AI 与消费:好产品要让用户"停止做某件事",信任是进入主流的分水岭

    a16z 合伙人 Josh Elman 在加入 a16z 后的首次播客访谈中提出,好产品的第一个检验标准是用户用了它之后"停止做了什么",而信任是 AI 产品从早期采用走向数亿乃至数十亿主流用户的分水岭。他认为 AI 对消费者仍处于皮毛阶段,多数人只是用 Chatbot、Gemini 让搜索更高效,个人 Agent 与互动娱乐是下一个值得期待的方向。

  5. 向阳乔木(@vista8)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木发布支持几乎所有音视频网站字幕转写的 Chrome 插件,可发指令给 Codex、Workbuddy、豆包安装

    向阳乔木开发了一款 Chrome 插件,支持几乎所有音视频网站的字幕转写,并配合本地助手进入沉浸式学习状态。用户可将安装指令发给 Codex、Workbuddy、豆包,完成插件安装与本地助手配置。插件地址为 github.com/joeseesun/qiao…。

  6. 向阳乔木(@vista8)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    乔木剪藏新增转写学习,支持 TikTok 和 TED 字幕

    乔木剪藏插件新增「转写学习」,在原有 B 站、YouTube、小宇宙之外支持 TikTok 和 TED 在线转写字幕显示。按三个 A 可进入沉浸式学习状态,左侧视频、右侧字幕,并能打开 AI 对话提问,插件已在 GitHub 开源。

  7. OpenAI Developers(@OpenAIDevs)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 演示 Codex CLI:语音启动任务、跨项目管理智能体、独立 worktree 探索

    OpenAI 演示了 Codex CLI 的用法:可用语音启动任务、跨项目管理和切换多个智能体,还能在单独的 worktree 中探索另一条实现方向。该演示面向长期在终端里工作的开发者。

  8. HeyGen(@HeyGen_Official)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LiveAvatar 用 AI 数字人让语言学习者获得 1:1 口语陪练

    LiveAvatar 推出面向语言学习者的 AI 口语陪练方案,让曾经需要真人配合的 1:1 对话练习可以规模化提供。其引用 1984 年研究称,接受 1:1 辅导的学生表现优于 98% 的常规班级学生。官方同步发布了分步使用指南(docs.liveavatar.com),并将影响延伸至学习者、教师、学校及为其开发产品的团队。

  9. 向阳乔木(@vista8)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    给小宇宙和 X 加上音视频字幕:点句跳转播放,还能用 AI 对话总结

    给"小宇宙"和 X 两个平台都加上了音视频字幕,点击某句话即可跳转播放。还支持用 AI 对话总结音视频内容。

  10. 向阳乔木(@vista8)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    乔木剪藏新增「转写学习」:无字幕视频与播客一键转文字稿

    乔木剪藏上线「转写学习」功能,可将无字幕的 YouTube、B 站视频,小宇宙、播客链接及本地录音一键生成带时间戳的文字稿。工具支持本地 ASR 模型免费处理,也支持豆包、硅基流动等云端 ASR,称 40 分钟视频约 20 秒出字幕。

10月5日周一
  1. 向阳乔木(@vista8)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多款 ASR 实测:豆包语音(极速)、Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR、小米 MiMo-ASR 对比

    为给无字幕的 Youtube 和 B 站视频做转写,作者实测了豆包语音(极速)、硅基流动上的 Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR 和小米 MiMo-ASR 多家 ASR。豆包语音表现最完善,自带毫秒时间轴且速度较快。相关功能将上线乔木剪藏插件,新增本地 Whisper 与本地 Qwen3 ASR,并支持各类云端语音转文本 API。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 旗下 ElevenCreative 推出 The Search 广告赛:10 万美元寻找全球最洗脑广告

    ElevenCreative 发起 The Search 竞赛,悬赏 10 万美元寻找全球最洗脑的广告,其中第一名奖金 5 万美元。赛事将评出 11 位获奖者,每人可与 ElevenLabs 创意制作团队进行 1:1 交流。

10月3日周六
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron 3 Diarization 上线 HuggingFace 并登上热门榜

    NVIDIA 的 Nemotron 3 Diarization 模型在 HuggingFace 上线后登上热门榜。该模型支持最多 8 位说话人的语音分离,可在声音重叠时追踪谁在何时说话,参数量为 100M。团队在评论区回应了用户提问。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eleven v4 语音模型上线 ElevenReader,支持 90+ 语言朗读

    ElevenLabs 将最具表现力的语音模型 Eleven v4 接入 ElevenReader,用户可自选音色朗读任意文章、电子书或 PDF,覆盖 90+ 种语言。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 的 ElevenReader 上线 iOS、Android 和 Web

    ElevenReader 现已在 iOS、Android 和 Web 三端上线,用户可通过 elevenreader.io 收听任何想读的内容。该产品出自 ElevenLabs。

  4. eric zakariasson(@ericzakariasson)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布实验性 TypeScript SDK,一个包接入文本、语音、图像与视频

    xAI 发布实验性 TypeScript SDK,可通过 `npm install @xai-official/sdk` 安装,用一套 SDK 调用文本、语音、图像和视频能力,并接入最新的 grok 模型。该 SDK 还提供运行在 xAI 服务器上的实时 X 搜索、网页搜索、代码执行和远程 MCP 等工具。

  5. NVIDIA AI(@NVIDIAAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微调 NVIDIA Nemotron 3.5 ASR,沙特阿拉伯语词错误率从 55% 降至 30%

    微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。

  6. ElevenLabs(@elevenlabsio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 获 FedRAMP 20x Class A 认证,语音 AI 可进入美国政府机构

    ElevenLabs 宣布获得 FedRAMP 20x Class A 认证,该认证覆盖 ElevenAgents 及 Text to Speech、Speech to Text API,需在 Zero Retention Mode 与美国数据驻留下运行。

10月2日周五
  1. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI 的语音与转写流式模型上线 Vercel,比 ElevenLabs 便宜 60%

    Mustafa Suleyman 宣布 Microsoft AI 的 Voice 与 Transcribe Streaming 模型已在 Vercel 上线,称其在质量和速度上排名第一,价格低于其他超大规模厂商,并比 Eleven Labs 便宜 60%。Guillermo Rauch 表示 Vercel 在 day zero 就接入了这批模型。

  2. 小互(@imxiaohu)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源唇语输入法:只需张嘴不发声,摄像头读嘴型直接打字

    一款开源唇语输入法可让用户按住按钮、只动嘴不出声,由摄像头读取嘴型直接把文字打出来,解决在咖啡馆等公共场合用语音输入自言自语的尴尬。该项目已开源。

  3. HeyGen(@HeyGen_Official)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 9 月发布三款开发者工具:开源实时数字人栈、Code2Video 基准与 API 专业语音克隆

    HeyGen 9 月面向开发者推出三款工具:基于 OpenAI GPT-Live-1 的开源实时数字人栈、与 Kaggle 合作的 Code2Video 基准(用于衡量 AI 生成视频质量),以及面向 API 的专业语音克隆。

  4. Lovable(@lovable_dev)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 应用可接入 OpenAI GPT-Live 实时语音对话

    Lovable 应用现已支持添加由 OpenAI GPT-Live 驱动的实时语音对话。开发者 @mgfeller 用它做出了可与《挽救计划》角色 Rocky 对话的应用。

  5. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型

    Microsoft AI 发布流式语音转文字模型 MAI-Transcribe-2-Streaming,据 Artificial Analysis 的 AA-WER Streaming 评测,其最终转写准确率与首个部分转写准确率均列第一,最终转写词错率 2.5%、语音结束后 0.13 秒返回结果。

  6. OpenRouter(@OpenRouterAI)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Voice-2.1 上线 OpenRouter

    微软的 MAI-Voice-2.1 已在 OpenRouter 上线,被描述为 MAI 目前保真度和表现力最高的文生语音模型。该模型提供录音室级自然语音,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频等场景。

  7. OpenRouter(@OpenRouterAI)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Voice-2.1-Flash 上线 OpenRouter,150ms 生成 45 秒音频

    微软 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,主打速度与规模:可在 150ms 内生成 45 秒音频,支持同一音色用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手、呼叫中心等实时场景。

10月1日周四
  1. ElevenLabs(@elevenlabsio)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jensen Huang 将出席 ElevenLabs Summit NYC,与 Mati 对谈 AI 未来

    NVIDIA CEO Jensen Huang 将于 11 月 11 日出席 ElevenLabs Summit NYC,与 ElevenLabs 的 Mati 就 AI 的未来展开对谈。NVIDIA 自 ElevenLabs 创立初期便与其合作,ElevenLabs 称这一合作是其持续推动语音与音频 AI 能力的重要部分。

  2. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron 微调适配沙特阿拉伯语方言,并可扩展至其他语言

    NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。

  3. Vercel NewsAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI 模型上线 Vercel AI Gateway

    Vercel 与 Microsoft AI 合作,将 MAI 模型接入 AI Gateway,支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming。

9月30日周三
  1. AK(@_akhaliq)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Audio8 ASR Infinite 流式语音识别模型:原生流式架构每秒解码 12.5 次

    Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。

  2. ChatGPT(@ChatGPTapp)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 推出 Meetings 插件:自动记笔记并生成摘要与后续步骤

    OpenAI 在 ChatGPT 上线 Meetings 插件测试版,可自动记录会议内容,并结合 ChatGPT 对用户及其工作内容的了解,在 ChatGPT Space 中生成个性化摘要和后续步骤。

  3. NotebookLM(@NotebookLM)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 实时语音对话向移动端全部 Pro 用户开放

    NotebookLM 宣布 Live Voice Chat 已在移动端向全部 Pro 用户 100% 推送。该功能此前向 Ultra 用户全量开放,支持用约 100 种语言与笔记本进行实时语音对话,由最新的音频模型驱动,可就来源资料提问并获得逐步指导,基本无需手动操作。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenAgents 上线 OpenAI Marketplace,支持 90+ 语言

    ElevenAgents 已登陆 OpenAI Marketplace,OpenAI 企业客户很快可将这一语音能力接入,支持 90+ 种语言,并计入其现有的 OpenAI 采购承诺额度。

  5. OpenAI Developers(@OpenAIDevs)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 终端上线语音功能,用 /voice 对话启动任务

    OpenAI 为终端版 Codex 加入语音功能,用户可用 /voice 直接开口说话,Codex 也会语音回应。该功能支持语音启动任务或讨论下一步操作,之后可进入 Agents 查看所有任务的执行进展。

  6. ElevenLabs(@elevenlabsio)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenAgents 上线 OpenAI Marketplace,支持 70+ 种语言

    ElevenAgents 现已登陆 OpenAI Marketplace,OpenAI 企业客户将可为它赋予 70 多种语言的语音能力,并计入现有的 OpenAI 采购承诺额度。该消息由 ElevenLabs 公布,详情见其官方博客。

  7. Genspark(@genspark_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 选择 Soniox 作为其语音转文字供应商

    Genspark 已选择 Soniox 作为其语音转文字供应商。Soniox 提供覆盖 60+ 种语言的母语级准确率、超低延迟,并在人名、数字和 ID 上具备较强精度。语音正成为 Genspark 用户交互的关键部分,涵盖语音驱动的 AI、会议记录和自主电话呼叫。

9月29日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenAgents 中 Eleven v4 Turbo 与转录、轮次模型协同工作

    ElevenAgents 中,Eleven v4 Turbo 与 ElevenLabs 领先的转录模型和轮次(turn-taking)模型协同工作。单一协同优化技术栈让智能体响应更快、能优雅地打断,并随新模型发布持续改进。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eleven v4 Turbo 在 ElevenAgents 中限时 3.3 美分/分钟

    ElevenLabs 为庆祝发布,在 ElevenAgents 中使用 Eleven v4 Turbo 的智能体即日起至 10 月 12 日按每分钟 3.3 美分计费,之后恢复 ElevenAgents 标准定价。