跳到正文

#语音

今日 13 条
9月23日周三
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 的音频模型进展:从 TTS、Live 到 Lyria、Translate、Transcribe

    Google 的音频模型套件在 TTS、Live、Lyria、Translate 和 Transcribe 等方向持续改进。如果身处旧金山,可报名参加明天举办的一场音频体验活动,报名链接为 rsvp.withgoogle.com/events/gemini-。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google AI Studio 上线新版 TTS 体验,成本低于 3.1 Flash TTS

    Google AI Studio 推出新的 TTS 使用体验,成本低于此前的 3.1 Flash TTS 模型,更多细节见官方博客。原文未披露具体模型版本与定价数字。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Flash-Lite TTS 语音模型

    Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 语音模型,官方称其为新的 SOTA 文本转语音模型。该模型提供新的音色设计体验、2000+ 生产可用音色、声音复刻与 100 种语言支持,声音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。

  4. Patrick Loeber(@patloeber)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 与 3.8 Flash-Lite TTS 语音生成模型

    Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。

  5. Philipp Schmid(@_philschmid)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash TTS 与 Flash-Lite TTS 发布

    Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上线,支持用 30 秒音频复刻音色、用一句话从提示词设计新音色,并可逐句指定风格、<laugh>、<sigh>、|backchannels| 和双人场景。

  6. Google AI(@GoogleAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 上线 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google AI 宣布即日起推送两款 TTS 模型,开发者可在 Google AI Studio 和 Gemini API 中使用,消费者端 Gemini 3.8 Flash TTS 进入 Gemini Notebook、Gemini 3.8 Flash-Lite TTS 进入 Google Vids。

  7. Google AI(@GoogleAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 种语言的自定义语音,另有 2,000+ 个现成音色可选。

  8. Google DeepMind(@GoogleDeepMind)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 用于设计带不同口音和特征的独特音色,Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可选用用户创建的风格或官方生产级音色库。

  9. Google DeepMind(@GoogleDeepMind)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 语音生成支持逐句微调语气与节奏,音频带 SynthID 水印

    Google DeepMind 宣布 Gemini 语音生成可逐句微调,控制节奏、情绪以及笑声、停顿等提示。所有生成音频均嵌入 SynthID 水印,可被可靠识别为 AI 生成。开发者可通过 Google AI Studio 使用 Gemini API 开始构建。

  10. Google DeepMind BlogAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。

  11. NVIDIA AI(@NVIDIAAI)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 开源 Nemotron 3 Diarization 说话人分离模型

    NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。

  12. NVIDIA AI(@NVIDIAAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 Nemotron 3 Diarization 说话人分离模型,支持 8 人重叠语音

    NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。

  13. NVIDIA AI(@NVIDIAAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 上排名第一

    Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。

  14. ElevenLabs(@elevenlabsio)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs Scribe v2 Medical 上线 ElevenAPI,每小时 0.22 美元起

    ElevenLabs 的 Scribe v2 Medical 已通过 ElevenAPI 开放使用,价格为每小时 0.22 美元起,并随用量规模增加而降低。该模型定位医疗场景的语音转写。

  15. ElevenLabs(@elevenlabsio)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs Scribe v2 Medical 面向企业客户支持 HIPAA 合规

    ElevenLabs 的 Scribe v2 Medical 现已面向签署 BAA 并启用 Zero Retention Mode 的企业客户满足 HIPAA 合规要求。该模式确保音频与转写文本在每次请求完成的瞬间即被删除。

  16. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical 临床语音转写模型

    ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。

  17. 沃垠AIAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    千问办公发布Agent硬件QwenNote A2,实测语音直连智能体

    千问办公发布Agent硬件品牌QwenNote,首款产品QwenNote A2售价1199元,自带4G网卡和GPS,无需连手机即可使用。作者实测长按AI键发语音即可调用Agent做总结、写PPT和网页,背后接入云栖大会发布的Qwen-Audio-3.1-Realtime,并已与钉钉打通。

  18. Qwen(@Alibaba_Qwen)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen-Audio-3.1 音频模型栈,新增 TTS-Next 与 ASR-Next

    阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款覆盖理解、生成、交互与创作。

  19. 阿里研究院AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026云栖大会首日:Qwen4训练中,平头哥发布真武V900芯片,阿里云推出AgentCore

    2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。

  20. Vercel NewsAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 文本转语音模型上线 AI Gateway

    Google 的 Gemini 3.8 Flash-Lite TTS 与 Gemini 3.8 Flash TTS 已在 AI Gateway 上线,均支持 100 多种语言的语音生成、长篇旁白、语调控制和双人对话。

  21. Sam Altman(@sama)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 澄清此前所指为语音而非视频

    Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。

9月22日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs Scribe v2 Medical 上线 ElevenAPI,起价 $0.22/小时

    ElevenLabs 的 Scribe v2 Medical 现已通过 ElevenAPI 开放使用,定价从每小时 $0.22 起,并随用量规模增加而降低。

  2. ElevenLabs(@elevenlabsio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical,临床音频转录 WER 降低 18%

    ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。

  3. 袋鼠帝AI客栈AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里千问办公发布 QwenNote Eva 桌面机器人和 A2 随身助理

    阿里千问办公发布 QwenNote 硬件产品线,包含带三轴云台、以手机为头的桌面机器人 Eva 和随身助理 A2,前者靠人脸与声纹识别用户,无需唤醒词即可直接对话并打断。

  4. 网易科技AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易有道用 AI 重做语音输入:叭哥说、Hi Echo 与子曰模型矩阵

    网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。

  5. 深思圈AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z合伙人Josh Elman:10亿美元消费级AI App背后的产品逻辑

    a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。

  6. ElevenLabs(@elevenlabsio)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 在 ElevenCreative 推出 Studio 4.0

    ElevenLabs 在 ElevenCreative 中上线 Studio 4.0,用户可通过 elevenlabs.io/studio 试用。该消息由 ElevenLabs 官方账号发布,未披露模型参数、价格或可用性等更多细节。

  7. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs Studio 4.0 支持团队协作评论

    ElevenLabs 发布 Studio 4.0,支持团队协作编辑:用户可对单个片段或素材直接发表评论,反馈集中留存而不再散落在多个独立讨论线程中。

  8. ElevenLabs(@elevenlabsio)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 在 ElevenCreative 中推出 Studio 4.0 视频编辑器

    ElevenLabs 在 ElevenCreative 中推出 Studio 4.0,其 AI 原生视频编辑器迎来一次重要升级。用户可以在项目内生成视频、图像、语音、音乐和音效,并在同一处完成剪辑、加字幕和导出。

9月21日周一
  1. NotebookLM(@NotebookLM)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 的 Live Chat 面向移动端 Ultra 用户全量开放

    NotebookLM 的 Live Chat 已在移动端向全部 Ultra 用户 100% 开放,可与笔记本进行实时语音对话,覆盖约 100 种语言。该功能由最新音频模型驱动,用户可就自己的资料提问并获取分步指导,几乎全程无需动手。

  2. Fish Audio(@FishAudio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio S2.1 Pro 上线 Runway,为 Fall'26 系列提供表现力语音

    Fish Audio S2.1 Pro 现已上线 Runway。Runway 称这是其迄今最大规模的一次模型更新,同期引入的还有 MiniMax H3 Max、Cartesia Sonic 3.6 以及 Flux Video upscaler 和 edit,与 Runway 自有及其他前沿实验室的模型一同提供。

  3. 小米技术AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从开源出发,让 AI 走进日常生活:小米 AI 硬创团队的四个探索

    小米 AI 硬创团队开源了四件 AI 硬件探索作品:AI 记忆配饰 DayoTag 采用无服务端本地记录并支持扩展 Skill;哈基米 PetAgent 把 Agent 运行状态同步到桌面摆件。

  4. 甲子光年AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    客服智能体走到“上岗”前夜,企业还要跨过几道门槛?|iRTE2026 企业级客服智能体专场

    iRTE2026 实时智能大会将于 10 月 23 日至 24 日在北京悠唐皇冠假日酒店举行,并设置“企业级客服智能体专场”,邀请声网、冠客科技、美团、阿里、MiniMax 等企业探讨客服智能体从“能对话”迈向“能办事、能转化、能增长”。

  5. AI产品黄叔(@PMbackttfuture)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 GPT live 讨论:好环境下模糊想法更快收敛的小技巧

    在心情愉悦、环境舒适时打开 GPT live 讨论,模糊的想法能更快收敛成型。这条来自 AI 产品黄叔的个人技巧帖认为,好的外部环境配合 GPT 的实时语音对话,有助于把还没想清楚的点子快速聚焦。帖文未披露所用模型版本或具体产品形态。

9月20日周日
  1. 快手技术AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手电商直播如何落地业界首个大规模实时字幕系统 Live Captioning Engineering

    快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。

9月19日周六
  1. Qwen(@Alibaba_Qwen)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布新一代实时同传模型 Qwen3.8-LiveTranslate

    阿里 Qwen 发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在忠实度、流畅度和简洁度上有所提升,并将 60 种语言的平均延迟(LAAL)从 2.8s 降至 2.3s。

  2. AI产品黄叔(@PMbackttfuture)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用夸克网盘 Skill 在线提取视频逐字稿:30 分钟音视频不到 1 分钟转完

    夸克网盘 Skill 可在线提取视频逐字稿,88VIP 用户可无限使用,支持多路同时转写,平均不到 1 分钟完成 30 分钟音视频转写,后续可用 DeepSeek API 润色。此前作者用本地 FunASR 转写太吃电脑资源,也曾改用 GrokBot 云端处理。

  3. Google AI(@GoogleAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 一周回顾:Gemini 3.8 Live 语音模型与多款工具更新

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称这是其目前最先进的实时对话音频模型。Google Labs 的实验项目 Dreambeans 转为正式可用,可为用户每日精选个性化故事集;同属 Labs 的 CC 从个人生产力工具扩展为共享智能体,用于帮助家庭协调事务、日程和日常任务。

  4. xAI(@xai)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Voice API 上线 Transcribe 2.0,批处理 $0.10/小时、流式 $0.20/小时

    Grok Voice API 现已上线 Transcribe 2.0,批处理定价 $0.10/小时,流式定价 $0.20/小时。详细内容见 xAI 官方博客。

  5. xAI(@xai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Atlassian 在 Loom 中采用 Transcribe 2.0,可听写需求并导出到 Cursor

    Atlassian 在 Loom 中使用 Transcribe 2.0,发现它捕捉用户指令时更准确。用户可以用 Loom 口述变更需求,再直接导出到 Cursor 编写代码。