Fish Audio S2.1 Pro 成为 OpenRouter 上请求量第一的语音模型,免费期延长至 11 月
Fish Audio 的 S2.1 Pro 在 OpenRouter 上成为请求量第一的语音模型,超过 Google、Grok、MiniMax 和 Deepgram。该模型免费开放 3 周内吸引 200 万+ 开发者,免费策略将延续至 11 月。
Fish Audio 的 S2.1 Pro 在 OpenRouter 上成为请求量第一的语音模型,超过 Google、Grok、MiniMax 和 Deepgram。该模型免费开放 3 周内吸引 200 万+ 开发者,免费策略将延续至 11 月。
Fish Audio 的全部语音合成与转写能力已上线 Vercel AI Gateway,9 月 18 日前免费开放,可通过模型标识 fish-audio/s2.1-pro 调用。
Google Gemini 宣布 Gemini Live 现在可以用语音发起多步 Deep Research 报告:向 Gemini Live 提出研究复杂主题的请求后,可以锁屏或切换任务,让研究在后台进行,完成后收到通知,再免手操作地语音讨论研究结果。
Fish Audio 宣布 S2.1 Pro 限时免费试用,开发者可通过 fish.audio/app/developers/ 体验。该消息由 Fish Audio 官方账号发布,未披露模型参数规模、benchmark 分数或定价细节。
Fish Audio 的 S2.1 Pro Free 成为 OpenRouter 上排名第一的语音模型,上周请求量达 1.04M,一周增长 413%,超过 Google、x-AI、Microsoft、MiniMax 和 Deepgram 的同类模型。该模型免费提供,背后依赖自研 FP8 CUDA kernel、连续批处理等重建的推理栈,GPU 利用率超过 90%。
Fish Audio 推出多模态创作平台 Fish Creative(@FishCreativeHQ),创作者可在同一空间把想法转成角色、场景和可直接发布的视频。语音由 S2.1 Pro 生成并支持内联情感标签,也可克隆自己的声音;口型同步、图像与视频、音效均在同一画布内完成。
Fish Audio 发布多模态创作平台 Fish Creative,从音频层起步,支持用 S2.1 Pro 生成语音并内嵌情绪标签,也可克隆自己的声音。平台还能将任意人脸与选定声音做唇形同步,并在同一画布上用主流模型生成图像与视频、按需添加音效。
Fish Audio 推出 Fish Audio MCP,一个端点即可让语音能力接入 Claude、Codex CLI、Cursor 和 Windsurf 等已有智能体。它支持搜索最佳音色、生成语音、转录音频和查看用量,直接在用户现有工作流中使用。
Fish Audio 成立一年即达到 $21M ARR、8M 用户,并完成 $52M 种子轮融资。团队称当初被普遍认为入局语音 AI 太晚,但结果证明并非如此,目前正招募 GTM 与企业销售岗位。
哔哩哔哩 Index 语音团队发布 IndexTTS 2.5,支持中、英、日、西、阿五语种零样本配音,开放语速控制,并补齐上代的速度短板。
Fish Audio 已在日本上线,其语音模型 S2.1 Pro 主打日语合成,需应对音高重音、韵律、敬语以及日英句中切换等难点。该模型面向客服、销售、排期语音智能体(延迟低于 150ms)、AI 伴侣和游戏角色等场景,支持 80+ 语言,可通过云端 API 或本地部署。Fish Audio 称用户已达 8M+,S2.1 Pro 限时免费开放构建。
ThinkVoice 将 Grok Voice 与脑感知技术结合,让用户无需动嘴即可说话:它能理解对话内容、提示你可能想说的下一句,并允许通过细微的肢体动作选择回复。该项目在 xAI 相关评选中获得第三名。
Bolt 推出语音听写功能,用户点击麦克风后可用任意语言直接说话,将对话转化为应用。官方在推文中将其与 Siri 对比,称这是"真正能用"的语音听写。
bolt.new 推出语音输入功能,用户可把未完成的想法直接口述出来,无需整理。分享的上下文越多效果越好,系统会自动剔除"um...""uh..."、错误开头和重复内容。
Bolt 现已上线语音听写(Voice dictation)功能,用户可以直接用说话的方式完成构建,官方称"能说出口就能做出来"。该功能目前已在 Bolt 中可用。
Google 在 Made by Google 活动上发布 Gboard 和 Live Transcribe 的新手语转文字功能,可与 Deaf 社区合作开发。该功能帮助使用 ASL 手语的人更顺畅地与手机交流,或与不会手语的人沟通。
Google 发布 Pixel 11 系列,Sundar Pichai 表示新机围绕 Gemini Intelligence 设计并带来多项新功能,包括为真实说话方式打造的语音输入 Rambler、拍照功能 Magic Capture,以及手机倒扣时用微光提示重要来电的 HiLight。
MiniMax 官方发文称 H3 开源一周内已在 Hugging Face 衍生出接近 300 个模型,ComfyUI 版本下载量近 700 万。社区把约 60B 参数、BF16 下需约 120GB 内存的 H3 压缩到 42.5GB 以在消费级显卡本地推理,Redis 作者 antirez 还为其编写了面向 Apple Silicon 的原生引擎 h3.c。
Lex Fridman 发布与 Khabib Nurmagomedov 的对话,全程用俄语进行,经 AI 与人工协作翻译配音成英语,两个语种音轨和字幕均上线 YouTube,翻译配音由 ElevenLabs 团队协助。访谈涵盖达吉斯坦格斗文化、Khabib 的统治力来源、与 Conor McGregor 之战及教练生涯等话题。
赛车手在弯道中无法看屏幕,该应用改用 Text-to-Speech(TTS)提供即时语音反馈。视觉仪表盘则用 Jetpack Compose 构建,在高负载下流畅渲染空间指标而不掉帧。
Andrej Karpathy 回应 @jack_w_rae 时表示,历史上人们无法像和普通人交谈一样与电脑对话,这一状况日后回看会让人觉得很奇怪。该帖获 919 次点赞、48 次转发和 27 条回复,浏览量 75271。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。
字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。
滴滴网约车平台安全部负责人曲晓楠在播客中拆解了滴滴五层全链路安全防护体系,其中行程环节每日约 4000 万订单经双层 AI 过滤,用大模型识别争执、求救、呕吐、肢体接触等风险语音,并结合轨迹偏航与「桔视」车载录像研判。安全算法优先保召回率而非准确率,宁可深夜致电确认安全也不漏判,近年安全事件降幅约 30%。
腾讯 Hy ASR 3.0 preview 今日发布,由 Hy3 的语言能力驱动,主打精准语音识别加深度语义理解。官方称其在通用识别、上下文感知、多场景鲁棒性和方言覆盖上表现领先,多语言 WER 约为 3%,可将嘈杂的真实音频转成连贯转录并准确理解意图。
腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。
微软研究院介绍多项成果:小语言模型通过 SocialRL 学习谈判,PazaBench V2 将语音 AI 评测扩展到多种非洲语言,EvoLib 则帮助智能体把经验转化为知识。此外还包括更可靠的 A/B 测试方法以及 AI 驱动精准肿瘤学的进展。
ShipAny 上线新模板 ShipAny Voice Agent,通过对话加多步骤工具调用的方式生成和处理音频,可用于有声书、朗读、播客等场景。后台配置 OpenAI、11labs 等音频厂商的 apikey 即可开箱即用,快速上线自己的 Voice Agent。
Alex Smirnov 做出一款语音健康追踪器,用户只需对 Siri 说话就能记录情绪、精力、用药和活动,醒来即可看到整理好的健康仪表盘。该项目完全基于免费额度搭建。
Rowan Cheung 介绍了一套约 1 美分/场的会议助手方案,来源署名 Steve Farmer。做法是用手机录制会议,把音频发送到 Telegram,再由本地托管的 AI 智能体完成转写、说话人识别、提取行动项并归档任务。
Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。
MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。
MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。
Grok Voice Think Fast 2.0 已在 API 和 Voice Agent Builder 中开放使用,定价为每分钟 $0.08。
xAI 发布下一代语音模型 Grok Voice Think Fast 2.0,官方称其在智能水平、转写准确率和对话能力上均有提升。相关介绍见 x.ai/news/grok-voic…。
xAI 发布 Grok Voice Think Fast 2.0,专为真实世界语音智能体打造,可在嘈杂环境中清晰收音,能对复杂工作流进行推理,对话听起来也更自然。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称该模型在音乐性、歌词和人声质量上均有提升,包括更丰富复杂的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表现力和发音更准的人声,同时可更便捷地控制输出的节奏与时长。
Granola 已在 Apple Watch 上线 AI 会议记录应用,发布者称这是全球首个登陆 Apple Watch 的 AI 会议记录器,最早于去年 8 月推出。TechCrunch 于 7 月 28 日报道了该应用。
xAI 的 Grok STT 已在 OpenRouter 上线,支持 25 种语言的语音转文字,并提供词级时间戳和说话人分离功能,定价为每音频小时 $0.10。
硅谷101 播客对话两位从新闻业转型的内容工程师(Content Engineer)——前媒体人东尼与 NBCUniversal AI战略总监 Bianca,拆解AI回复背后的工作。嘉宾介绍了系统提示词、少样本示例、意图理解、来源归属等术语,讨论好对话如何拆解成可量化、可训练的工程标准,以及 AI谄媚为何是产品设计问题。
MAI-Voice-2-Flash 正式发布,速度比 MAI-Voice-2 快 2 倍,价格便宜 32%,为每 100 万字符 $15。该模型已进入公开预览,并已驱动企业呼叫中心平台 Dynamics 365 Contact Center,可将 GPU 成本最高降低 89%。
微软正在推进 MAI 系列模型的落地,覆盖 PowerPoint、OneDrive、Bing、Dragon Copilot 等产品。PowerPoint 图像模型成本较 GPT-Image-2 下降 84%,OneDrive 保存率提升 26%、延迟降低约 25%,Bing 已将其作为默认模型。Dragon Copilot 转写模型支持 58 种语言,多语言临床转写错误率减半。