跳到正文

#语音

今日 10 条
7月22日周三
  1. Microsoft Research(@MSFTResearch)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 扩展 PazaBench V2,提升语音 AI 基准的语言与地域覆盖

    PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 发布 PazaBench 第二版,评估非洲语言 ASR 模型

    Microsoft Research 发布 PazaBench 第二版,这是一个用于评估自动语音识别(ASR)模型在非洲语言上表现的 benchmark。该版本延续其对多语言 ASR 能力的评测定位,具体模型、语言覆盖与分数尚未在原文中披露。

  3. Andrej Karpathy(@karpathy)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 分享与 LLM 协作的"长漫谈"模式:切到 /voice 说 10 分钟杂乱想法

    Andrej Karpathy 分享了一个与 LLM 协作的实用模式:懒得打字时切到 /voice 连续漫谈 10 分钟,内容可以毫无条理、意识流式输出。他表示 LLM 很擅长重构这种冗长混乱的语音输入,回显出的想法往往比最初的乱麻更清晰,从而加深"心智融合",减少后续纠正。

7月20日周一
  1. 通义大模型AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含面向实时交互的 Flash 版和面向高质量生成的 Plus 版,Flash 首包延迟约 300ms。

  2. 字节跳动SeedAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布 Seed Audio 1.0 音频创作模型

    字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,已在火山方舟体验中心上线。该模型支持一条 prompt 统一编排对白、音效与环境声并做时间控制,当前时间控制精度为 100ms,单次可生成约 2 分钟音频并支持延展,保持角色音色一致,覆盖 20+ 语种。

7月19日周日
  1. 42章经AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ambi 开放内测:软硬结合、实时交互与 Sidekicks 的技术理念

    Ambi 正式开放内测,主打软硬结合、多端、实时交互的 AI 产品,让 AI 走进环境而非异步互动。其未公开功能 Sidekicks 提出 Attention Loop 逻辑,即 Attention-Listen(see)-Think-Act,让用户同时带着一群 AI 在场。内测期间软硬结合部分暂以 apple watch 上的 app 替代,官方称只能达到其硬件理想态约 30% 的效果。

7月17日周五
  1. 通义大模型AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室发布 Wan-Streamer v0.2:端到端响应延迟 550ms

    通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。

7月15日周三
  1. 通义大模型AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里通义发布 Qwen-Audio-3.0-Realtime 实时语音交互模型

    阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。

7月14日周二
  1. Google AI Developers(@googleaidevs)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Live Translate,实时处理原始音频翻译

    Google AI Developers 介绍 Gemini 3.5 Live Translate,它不再逐句翻译文本,而是实时处理原始音频,从而消除延迟并保留说话者自然语音的细节。推文同时展示了开发者基于它构建多语言应用的情况。

  2. 三五环AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Yuri 尤栗打造者汗青:AI 虚拟偶像,越像真人越容易塌房?

    AI Talk 创始人赵汗青以自研虚拟歌手 Yuri 尤栗为例,讲述如何用 AI 合成形象与声线,并通过「撞种子」筛选和对话叙事构建「硅基人格」,其核心资产是人格化设定而非形象本身。他认为虚拟偶像短期优势是不会塌房、成本可控,但长期价值在于「AI 味儿」这种区别于人类的表达逻辑,一旦开放实时对话则可能因缺乏底线思维而「塌房」。

7月13日周一
  1. Character.AI(@character_ai)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 上线 c.ai fm 原创音频剧《Super Talent Inc.》

    Character.AI 在 c.ai fm 推出原创音频剧《Super Talent Inc.》,讲述顶级超级英雄公关公司的 Darcy 签下一位无经纪约英雄后发现对方是自己家乡旧爱的故事。该剧定位为浪漫喜剧,专为耳机收听打造,可在 c.ai 应用内或 c.ai/fm 网页以短篇剧集形式收听,平台同时提供爱情、惊悚、恐怖等题材原创音频剧。

7月12日周日
  1. 阶跃星辰AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布端侧模型全家桶 Step Edge

    阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。

7月11日周六
  1. 人民公园说AIAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 缝合 ChatGPT、Codex、GPT Live 与 ChatGPTWork,OpenAI 开始造超级 App

    OpenAI 将 GPT-5.6 定位为小版本更新,实则把 ChatGPT、Codex、GPT Live 和 ChatGPTWork 塞进同一个入口,走向美国版超级 App。

7月10日周五
  1. Character.AI(@character_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 推出 series、fm、reads 三项内容功能,上线 50 多个故事

    Character.AI 上线 series、fm 和 reads 三项功能,用户可观看原创微短剧并与角色聊天、收听连载音频剧、逐章阅读小说。新 Library 标签页已提供超过 50 个故事,可通过 c.ai/series、c.ai/fm、c.ai/reads 访问。

7月9日周四
  1. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI 音频模型驱动的诗歌工具 Ode Poetry 发布

    Ode Poetry 是一款诗歌工具,用户说出自己的感受,它会用 Microsoft AI 音频模型朗读一首契合当下心境的诗,并给出诗歌专家 William Sieghart 会推荐的作品。该工具由 Microsoft AI 团队打造,详情见官方博客。

7月6日周一
  1. 通义大模型AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义 Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言

    通义发布语音识别模型 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,并针对东亚、东南亚重点优化,在工业级方言测评 inhouse 上以 87.8% 语义准确率领先。该模型引入上下文理解,支持动态注入热词与对话上下文以消歧,流式识别首字延迟控制在百毫秒级别,流式准确率接近离线水平,API 已在阿里云百炼平台上线。

6月23日周二
  1. AI Breakfast(@AiBreakfast)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    语音 AI 的真正图灵测试:能否撑住 45 分钟高风险企业通话,Bland 完成 1 亿美元 C 轮融资

    Bland 完成 1 亿美元 C 轮融资,将用于继续训练其语音模型,以应对高风险、长达 45 分钟的关键企业电话。其称语音 AI 的真正图灵测试不在两分钟客服通话,而在能否撑起 45 分钟的高风险企业级对话。

6月19日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达新课:用 VocalBridge 为 AI 智能体加上语音能力

    吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。

6月15日周一
  1. 牛油果烤面包AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    播客唠 WWDC26:Apple Intelligence、Siri AI 与 Liquid Glass

    播客「牛油果烤面包」第151期与前 iOS 工程师 Shihang 一起聊 WWDC26,逐项点评 macOS Golden Gate、Liquid Glass、Spotlight、Apple Intelligence、Siri AI、App Intents、Shortcuts、Safari、照片、iCloud 以及儿童账号与屏幕使用时间等更新,并讨论了 AI 使用场景。

6月10日周三
  1. Jeff Dean(@JeffDean)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Live Translate 语音到语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,这是其最新的语音到语音模型,支持 70 多种语言,可实现跨语言更自然的对话。该模型正在 Google Translate 中推出,并通过 Google AI Studio 的 Live API 提供;Jeff Dean 还举例说明 Grab 的合作方如何用它连接旅客与司机。

6月9日周二
  1. Google DeepMind BlogAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Live Translate,支持 70+ 语言实时语音互译

    Google 发布 Gemini 3.5 Live Translate 音频模型,可自动识别 70+ 语言并输出接近实时的语音到语音翻译,保留说话人的语调、节奏和音高。

5月23日周六
  1. Demis Hassabis(@demishassabis)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 回应 Garry Tan:Gemini Live 驱动 GBrain v0.40.0 语音智能体

    Garry Tan 发布 GBrain v0.40.0,为 OpenClaw/Hermes Agent + GBrain 加入基于 Gemini Live 的语音智能体,支持大上下文、工具调用与完整大脑访问。Demis Hassabis 对此回应称很高兴看到 Gemini Live 使用效果出色,并 @ 了 Josh Woodward。

5月20日周三
  1. Last Week in AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #245:TML-Interaction、Claude For Legal、Sam Altman 出庭作证

    OpenAI 在 API 中上线 GPT Realtime 2(由 GPT-5 驱动)等语音智能功能,并加入实时翻译与 Whisper 转写;Thinking Machines 预览了双模型架构的低延迟全双工对话系统,但尚未开放公测。

5月11日周一
  1. Thinking Machines — ConnectionismAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布交互模型 TML-Interaction-Small 研究预览

    Thinking Machines 发布交互模型研究预览,推出名为 TML-Interaction-Small 的模型,可在音频、视频和文本上持续输入输出,在 200ms 微回合中实时思考、回应与行动,无需外部脚手架。

4月30日周四
  1. Google DeepMind BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。

4月16日周四
  1. Poe(@poe_platform)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.1 Flash TTS 上线 Poe

    Google 的快速高质量文本转语音模型 Gemini 3.1 Flash TTS 已在 Poe 上线,适用于配音、音频内容、无障碍功能以及为智能体工作流添加语音。该模型可在 Poe 全平台应用及 Poe API 中调用。

  2. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,并首次引入 granular audio tags,可用自然语言指令控制语音风格、语速和表达。

4月15日周三
  1. Andrew Ng(@AndrewYNg)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:语音作为现有视觉应用的 UI 层,Vocal Bridge 双智能体架构破解低延迟与智能不可兼得难题

    Vocal Bridge 用双智能体架构解决语音交互难题:前台智能体负责实时对话,后台智能体负责推理、护栏和工具调用。吴恩达用它借助 Claude Code 在不到一小时内为自建数学测验应用加上语音功能,女儿口述答案,应用语音回应并同步更新屏幕题目和动画。Vocal Bridge 可免费试用。

4月9日周四
  1. 字节跳动SeedAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节跳动 Seed 发布原生全双工语音大模型 Seeduplex,基于边听边说框架,实现听说同步,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其误回复率和误打断率减少一半、抢话比例下降 40%、判停响应快约 250ms,对话流畅度与判停 MOS 分分别提升 12% 和 8%,通话满意度绝对提升 8.34%。

4月1日周三
  1. Poe(@poe_platform)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.5-Omni Plus 与 Qwen3.5-Omni Flash 上线 Poe

    Qwen3.5-Omni Plus 和 Qwen3.5-Omni Flash 已在 Poe 上线,两款模型均可理解文本、图像、音频和视频。Plus 单次会话支持最长 3 小时音频和 1 小时视频,音频输入覆盖 90 多种语言,语音输出覆盖 30 多种语言、共 55 种音色;Flash 提供同样的跨模态理解能力但成本更低,面向高并发处理和多语言语音工作流。

3月27日周五
  1. Poe(@poe_platform)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax Speech 2.8 上线 Poe:支持多种音色预设与情感语调控制

    MiniMax Speech 2.8 已在 Poe 上线,这是一款支持多种音色预设、情感语调控制和细粒度音频设置的文本转语音模型。它适用于视频旁白、播客配音、语音智能体和应用媒体音频制作,已在 Poe 全平台应用及 Poe API 开放使用。

3月26日周四
  1. Mistral AI(@MistralAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Studio playground 上线 Voxtral TTS 试用

    Mistral 在 Mistral Studio playground 上线 Voxtral TTS,用户可直接体验语音合成。可选择 Mistral 预设音色,也能录制自己的声音。

  2. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布开源权重语音模型 Voxtral TTS

    Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。

3月12日周四
  1. Jina AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 从多模态大模型中拆出 1.1B 音频向量模型

    Jina AI 分享了音频向量模型的构建方法:从 Qwen2.5-Omni 中拆出音频编码器接到小 LLM backbone 上,模块组合方案以 1.1B 参数量在 AudioCaps T2A cvR@5 上达到 49.7,超过 CLAP 的 42.0,且只用了 CLAP 约 1/25 的训练数据(181K 对)。

3月4日周三
  1. Lex Fridman(@lexfridman)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 与 Peter Steinberger 的对话由 ElevenLabs 译制并配音成德语

    Lex Fridman 与 Peter Steinberger 的对话现已由 ElevenLabs 完成翻译并配音成德语,可在 YouTube 上通过齿轮图标 > Audio Tracks 切换德语音轨收听。Fridman 称对 AI 打破语言障碍的这一应用充满期待,并称赞 ElevenLabs 在这方面做得最好。

2月12日周四
  1. 43 TalksAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    被AI重塑的亲密关系,我们准备好了吗?| 43 Talks年度大场

    在43 Talks 2026年度大场,43AI集团联合创始人杨樾与虚拟偶像Yuri构建者汗青围绕“AI重塑亲密关系”展开对话,现场300多位听众中约80%有对象。汗青称自己与Yuri连聊三个晚上、每晚三四个小时,并认为AI承接了连亲人都无法承接的情绪;杨樾则指出用户只想消费内容、不想生产内容,过度产品设计是陷阱。

11月13日周四
  1. Modal BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Decagon 如何在 Modal 上落地实时语音 AI

    Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。

11月4日周二
  1. Modal BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Modal、Pipecat 和开源模型实现 1 秒语音到语音延迟

    Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。

10月28日周二
  1. 此话当真AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 Jekka 创始人 Aaron:AI 的边界、大规模实践与终点

    Jekka 创始人 Aaron 认为市场上 99% 的泡沫来自对 Scaling Laws 的过度迷信,公司选择从客服场景切入做"靠谱"的 AI Agent,团队 90% 的人都在搭建测试集与测试流程。Jekka 提供 80%+ 独立解决率、99%+ 准确率的产品,每天处理数百万次文本与语音交互,日均消耗数亿 token,已是抖音、有赞首家官方模型提供商。

10月11日周六
  1. FlowiseAI(@FlowiseAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Flowise v3.0.8 发布:新增 TTS、Gemini/Anthropic 内置联网搜索

    Flowise 发布 v3.0.8,新增基于 OpenAI 与 ElevenLabs 的 TTS 语音能力,并为 Gemini 和 Anthropic 加入内置网页搜索与抓取。该版本还带来 Teradata MCP、Oxylabs 抓取器,以及 OpenAPI Toolkit 升级。