跳到正文

#语音

今日 10 条
今天10月10日周六
  1. 刘润AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    刘润:未来一两年上班方式将发生的8个变化

    刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。

  2. 哔哩哔哩技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HOMURA:面向时间受限场景的 LLM 翻译强化学习优化,入选 EMNLP 2026 Oral

    哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 在 ElevenAgents 推出合成语音检测

    ElevenLabs 在 ElevenAgents 中推出合成语音检测,用于识别代个人、其他公司乃至恶意行为者拨入企业的 AI 智能体来电。ElevenLabs 同时加入新成立的 Personal Agent Protocol 工作组,参与制定智能体之间的交互规范。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 推出合成语音检测,可在通话开头数秒识别真人或 AI

    ElevenLabs 推出合成语音检测功能,可在通话开始数秒内分析来电者语音,判断其为真人还是 AI 生成,并据此路由。该功能意在让真人获得为真人设计的体验,智能体进入直接、有边界的交互,同时拦截恶意行为者。

  5. ElevenLabs(@elevenlabsio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 面向企业客户开放合成语音检测功能

    ElevenLabs 的合成语音检测功能现已通过其前向部署团队向企业客户开放,本月晚些时候将扩大访问范围。该公司表示将随着工作推进分享 PAP 方面的进展。

  6. 国际大厂AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    iOS 27.2 将为 iPhone 带来五项新功能

    iOS 27.2 测试版带来五项更新,最大变化是 Health app 全面改版,新增 Longevity 标签页和 Health Age 评估,并可用 iPhone 摄像头为灵活性、平衡、VO2max 和力量打分。

  7. Fish Audio(@FishAudio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio Drama 3 支持为角色语音增添更多情绪,并可定点修复单行甚至单个词

    Fish Audio 的 Drama 3 现支持为角色语音增添更多情绪,还能在重新生成时只修复一行甚至单个词,其余部分保持不变。该功能由 Fish Audio 发布。

  8. Fish Audio(@FishAudio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio Drama 3 Preview 开放 API 与网页访问

    Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。

  9. HeyGen(@HeyGen_Official)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen Voice 登顶 Artificial Analysis TTS 排行榜,API 限时五折

    HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。

  10. AING硬迹AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Natura 发布 99 美元 AI agent 语音戒指 Interface,可直连 Claude、ChatGPT

    AI 硬件初创公司 Natura 于 10 月 8 日发布智能戒指 Interface,早期入手价 99 美元,按住戒圈按钮说话即可把任务交给指定 AI 代理执行,支持 Meta Muse、Instinct、Grok Bot、Claude、ChatGPT 等,无需掏出手机。

10月9日周五
  1. ElevenLabs(@elevenlabsio)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 与 Banner Health 合作,用 AI 语音智能体接听患者来电

    ElevenLabs 与 Banner Health 达成合作,用 AI 语音智能体接听患者来电,首批覆盖初级保健预约场景。患者可全天候致电,ElevenAgents 直接在 Banner 的电子病历中完成预约、改期或取消;需要人工时,通话会连同必要上下文转接给 Banner 团队成员。

  2. 向阳乔木(@vista8)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Grok 与豆包播客 API 打造 AI 播客,双主播聊 Hacker News 与 GitHub Trending

    开发者受 Producthunt 产品 DeTV 启发,借助 Grok bot 协作和豆包播客 API 开发了一款 AI 播客,由双人主播播报 Hacker News、GitHub Trending、卡兹克 AI Hot 热门新闻及 Producthunt 热门产品。在线电台为 aitv.qiaomu.ai,开源地址在 github.com/joeseesun/aitv。

  3. 多知AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    卡西欧推出 AI 智能听说学习机 LT-C1,电子辞典业务停摆后转向口袋学习机

    卡西欧中国官网智能教育板块上架便携口袋机 "AI智能听说学习机 LT-C1",整机 145g、2.83 英寸屏幕、128G 内存,官方定价 1098 元,电商优惠价在 800-1000 元之间。

  4. 国际大厂AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Apple 10 月 13 日“Welcome home”发布会前瞻:首款智能屏 HomePad 领衔

    Apple 将于 10 月 13 日举办以智能家居为主题的“Welcome home”发布会,据报道首款智能屏“HomePad”将登场,配备 6 英寸方形屏幕,可接 HomePod mini 式音箱或壁挂使用,主要靠 Siri AI 交互。

  5. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    墨尔本大学与新南威尔士大学提出多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

    墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。

  6. 新智元AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 Gemini 4 Argon 现身 Google Cloud 与 Antigravity,最快今日发布

    谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。

  7. 爱范儿AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果 10 月 13 日「果家」发布会定档:HomePad、HomePod mini 2、Apple TV 4K 等新品曝光

    苹果宣布将于 10 月 13 日在纽约举办「Apple Experience」家庭产品活动,最受关注的硬件是代号 J490 的带屏设备 HomePad,配备约 6 英寸方形触控屏和金属支臂,搭载内部代号 Charismatic、可能名为 homeOS 的系统,可通过人脸与声音识别家庭成员。

  8. OpenRouter(@OpenRouterAI)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 正式上线 OpenRouter,9 款 TTS 模型与 2 款 STT 模型全部 5 折

    ElevenLabs 正式上线 OpenRouter,可调用 9 款 Text to Speech 模型,支持 90+ 种语言,以及 2 款 Speech to Text 模型,支持说话人标签和词级时间戳。所有 ElevenLabs 模型在 OpenRouter 独家 5 折,优惠持续至 10 月 19 日上午 8 点(PT)。

  9. elvis(@omarsar0)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Smallest AI 的 Pulse 在 Voice Arena 说话人分离基准登顶,DER 24.4%

    Smallest AI 的 Pulse 在 Voice Arena Diarization Bench 的 Diarization + ASR 赛道以 24.4% DER 排名第一,在 0 ms collar 的严格设置下,误差比第二名 ElevenLabs Scribe v2 的 40.7% 低 1.7 倍。

  10. elvis(@omarsar0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布 Drama 3:可在同一句话里切换语气的语音模型

    Fish Audio 推出语音模型 Drama 3,号称在语言表达方向上展现出模型迄今最强的控制力,能在同一句话中改变语气,语音控制接近真人说话。用户可用自然语言直接指定音色、情绪、节奏和角色,模型甚至能在句子中途切换情绪,无需重录。该模型已以 'drama-3-preview' 在 API 中提供预览。

  11. elvis(@omarsar0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voice Arena 的 Monsoon 语料:孟加拉语微调让 Whisper Medium 的 WER 从 85.27% 降至 7.65%

    Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。

  12. 向阳乔木(@vista8)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向阳乔木分享音视频学习软件:支持字幕转写、翻译、AI 对话与 X/B站/抖音/Tiktok/小宇宙下载

    向阳乔木展示了一款自制音视频学习软件,支持字幕转写、翻译、AI 对话,以及从 X、B 站、抖音、Tiktok、小宇宙下载音视频,并附操作演示,安装 Prompt 放在评论区。

  13. 美团技术团队AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团智播:面向本地生活场景的数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  14. Fish Audio(@FishAudio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 上线 Drama 3 预览版 API,模型设为 drama-3-preview

    Fish Audio 为 Drama 3 预览版开放 API,调用时需将 model 设为 drama-3-preview,API key 可在 fish.audio/app/api-keys 获取。网页端可在文本转语音入口选择 Fish Audio Drama 3(Preview)模型。

  15. Fish Audio(@FishAudio)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio Drama 3 驱动 AI 语音语言练习应用,可练真实对话

    开发者 @whosamberella 用 Fish Audio 的 Drama 3 打造了一款语言应用,让用户与 AI 语音角色练习真实对话。每个角色都有独立性格,还配有面向初学者的发音卡片,答不上来时角色甚至会表现得不耐烦。

  16. AI Breakfast(@AiBreakfast)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Voice Arena 发布覆盖 50 种语言的 Monsoon ASR 语料库

    Voice Arena 发布 Monsoon ASR 语料库,目前已覆盖 50 种语言、100,000 小时数据,其中多为长尾语言,计划 2027 年底扩展到 1,000 种语言。

  17. DeepLearning.AI(@DeepLearningAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 4 Argon 追平 GPT-6 Astra,Mistral Large 4 成美国与中国之外最强模型

    Google Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以 53 分追平 GPT-6 Astra,每任务成本约为后者 60%。

10月8日周四
  1. 白鲸出海AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    元巅科技(寂核)GENiEX:不做订阅的"异世界对讲机"众筹18万美元

    元巅科技(寂核)创始人周百祥打造的 GENiEX 在 Kickstarter 结束众筹,单价 188 美元起,共筹得约 18 万美元。这台复古对讲机造型的掌机内置原创末世科幻 IP,设三个角色各四章剧情,支持语音交互与角色记忆,并加入类似"暴龙机"的双机对碰多人玩法。团队明确不做订阅制,改用一次性硬件买断加角色资产与内容的持续消费。

  2. TechcrunchAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 AI Edge Foresight 应用,以端侧 AI 离线记会议笔记

    Google 发布 AI Edge Foresight 应用,对标 Granola,主打离线会议记录。它能在设备端完成对话转写、生成笔记并回答问题,全程依赖端侧 AI。

  3. 向阳乔木(@vista8)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米蓝牙遥控器 2 Pro 搭配开源 App 无线麦实现 AI 语音输入

    作者用小米蓝牙遥控器 2 Pro 搭配开源 App 无线麦(github.com/HD838A/remote-…),让 Codex 完成安装并简单设置后即可使用。该方案可配合豆包输入法、TypeLess,作者实测 Raycast 内置语音输入同样可行。

  4. 深思圈AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 陪伴的下一步,会从恋爱游戏里走出来吗?

    Yoroll 旗下 LinearGame 正在内测 AI 陪伴产品 Yyo,其角色来自《华君传》《VOW》《心动相簿》等互动影游,玩家通关后可与角色继续文字、实时语音或视频通话,并一起玩三消、闯关、像素街机等双人小游戏和共享屏幕陪玩。

  5. 机器之心SOTA模型AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,Mistral 开放 Mistral Large 4 公开预览 API

    Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。

  6. Fun AI EverydayAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dreambuds:一副带"睡眠系统"的耳机

    波士顿创业公司 SOND 推出睡眠耳机 Dreambuds,每只仅 2.1 克,整晚持续读取心率、HRV、呼吸、睡姿、打鼾、体温等 12 项信号,据此动态调整耳内播放的助眠内容。

  7. 多知AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三家语音优先教育AI公司接连融资,AI开始"开口教学"?

    荷兰Eevi、美国Aristotle与印度YoLearn.ai接连完成Pre-seed至种子轮融资,均把"语音优先"放于产品核心。波士顿大学一项随机实验显示,语音模式下学生对话密度约为文字模式的1.8倍、提问次数约2.4倍,但五周内两种模式的学习掌握程度无显著差异,且语音成本约为文字的2.8倍。

  8. Fish Audio(@FishAudio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 开放 drama-3-preview 模型 API 与网页版文本转语音入口

    Fish Audio 上线 drama-3-preview 模型,开发者可通过 API 文档将 model 设为 drama-3-preview 并申请 API key 调用,网页用户则可在文本转语音页面选择 Fish Audio Drama 3(Preview)使用。该模型目前处于预览阶段。

  9. Fish Audio(@FishAudio)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布 Drama 3:用自然语言导演语音表演

    Fish Audio 推出语音模型 Drama 3,可用自然语言直接指挥语气、情绪、节奏和角色,甚至能在同一句台词中途切换情绪,无需重录。该模型以 'drama-3-preview' 名称在 API 中开放预览。

10月7日周三
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 语音到语音模型

    Google 推出 Gemini 3.8 Live 语音到语音模型,跳过语音转文字再转语音的传统串行流程,在同一系统内完成聆听、推理与回应。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 上排名第一,标准版在人工盲测的实时对话中排名第二,输入音频成本为每小时 0.84 美元,为榜单中最低。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 与印度一邦政府签署首份 MOU,试点语音 AI

    ElevenLabs 在班加罗尔峰会上与印度一个邦政府签署首份 MOU,试点语音 AI。过去一年印度的 1 亿多次 ElevenAgents 对话中,超 70% 使用 Hindi、Kannada、Tamil 和 Telugu 四种语言。本次峰会聚集 500 多位企业领导者、开发者和合作伙伴。

  3. meng shao(@shao__meng)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI Cookbook 新增 5 个示例 App 覆盖 Grok API 四条主线

    xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。

  4. OpenAI Developers(@OpenAIDevs)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为 Codex 加入语音对话功能

    OpenAI 为 Codex 加入语音输入,用户可直接与 Codex 对话,不必全程使用键盘。一位用户表示自己过去整天守在桌前,如今在阳光房里用语音就能发送演示文稿。