跳到正文

#语音

今日 13 条
8月22日周六
  1. Fish Audio(@FishAudio)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio S2.1 Pro 成为 OpenRouter 上请求量第一的语音模型,免费期延长至 11 月

    Fish Audio 的 S2.1 Pro 在 OpenRouter 上成为请求量第一的语音模型,超过 Google、Grok、MiniMax 和 Deepgram。该模型免费开放 3 周内吸引 200 万+ 开发者,免费策略将延续至 11 月。

8月20日周四
  1. Fish Audio(@FishAudio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 上线 Vercel AI Gateway,语音合成与转写 9 月 18 日前免费

    Fish Audio 的全部语音合成与转写能力已上线 Vercel AI Gateway,9 月 18 日前免费开放,可通过模型标识 fish-audio/s2.1-pro 调用。

  2. Google Gemini App(@GeminiApp)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Live 支持语音发起 Deep Research 多步研究报告

    Google Gemini 宣布 Gemini Live 现在可以用语音发起多步 Deep Research 报告:向 Gemini Live 提出研究复杂主题的请求后,可以锁屏或切换任务,让研究在后台进行,完成后收到通知,再免手操作地语音讨论研究结果。

  3. Fish Audio(@FishAudio)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio S2.1 Pro 限时免费试用

    Fish Audio 宣布 S2.1 Pro 限时免费试用,开发者可通过 fish.audio/app/developers/ 体验。该消息由 Fish Audio 官方账号发布,未披露模型参数规模、benchmark 分数或定价细节。

  4. Fish Audio(@FishAudio)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio S2.1 Pro Free 登顶 OpenRouter 语音模型榜,周请求量 1.04M 增长 413%

    Fish Audio 的 S2.1 Pro Free 成为 OpenRouter 上排名第一的语音模型,上周请求量达 1.04M,一周增长 413%,超过 Google、x-AI、Microsoft、MiniMax 和 Deepgram 的同类模型。该模型免费提供,背后依赖自研 FP8 CUDA kernel、连续批处理等重建的推理栈,GPU 利用率超过 90%。

8月19日周三
  1. Fish Audio(@FishAudio)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出 Fish Creative:从语音延伸至多模态创作平台

    Fish Audio 推出多模态创作平台 Fish Creative(@FishCreativeHQ),创作者可在同一空间把想法转成角色、场景和可直接发布的视频。语音由 S2.1 Pro 生成并支持内联情感标签,也可克隆自己的声音;口型同步、图像与视频、音效均在同一画布内完成。

  2. Fish Audio(@FishAudio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 推出多模态创作平台 Fish Creative,从语音层构建完整故事

    Fish Audio 发布多模态创作平台 Fish Creative,从音频层起步,支持用 S2.1 Pro 生成语音并内嵌情绪标签,也可克隆自己的声音。平台还能将任意人脸与选定声音做唇形同步,并在同一画布上用主流模型生成图像与视频、按需添加音效。

8月18日周二
  1. Fish Audio(@FishAudio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 发布 MCP:让语音接入 Claude、Codex CLI、Cursor 和 Windsurf

    Fish Audio 推出 Fish Audio MCP,一个端点即可让语音能力接入 Claude、Codex CLI、Cursor 和 Windsurf 等已有智能体。它支持搜索最佳音色、生成语音、转录音频和查看用量,直接在用户现有工作流中使用。

  2. Fish Audio(@FishAudio)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 一周年:ARR 达 $21M、8M 用户,并完成 $52M 种子轮

    Fish Audio 成立一年即达到 $21M ARR、8M 用户,并完成 $52M 种子轮融资。团队称当初被普遍认为入局语音 AI 太晚,但结果证明并非如此,目前正招募 GTM 与企业销售岗位。

8月17日周一
  1. 哔哩哔哩技术AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩发布 IndexTTS 2.5,支持五语种零样本配音并提速约 2.28 倍

    哔哩哔哩 Index 语音团队发布 IndexTTS 2.5,支持中、英、日、西、阿五语种零样本配音,开放语速控制,并补齐上代的速度短板。

8月14日周五
  1. Fish Audio(@FishAudio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio 在日本上线,语音模型 S2.1 Pro 支持日语与中英混说

    Fish Audio 已在日本上线,其语音模型 S2.1 Pro 主打日语合成,需应对音高重音、韵律、敬语以及日英句中切换等难点。该模型面向客服、销售、排期语音智能体(延迟低于 150ms)、AI 伴侣和游戏角色等场景,支持 80+ 语言,可通过云端 API 或本地部署。Fish Audio 称用户已达 8M+,S2.1 Pro 限时免费开放构建。

  2. xAI(@xai)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ThinkVoice 结合 Grok Voice 与脑感知技术,实现不动嘴说话

    ThinkVoice 将 Grok Voice 与脑感知技术结合,让用户无需动嘴即可说话:它能理解对话内容、提示你可能想说的下一句,并允许通过细微的肢体动作选择回复。该项目在 xAI 相关评选中获得第三名。

  3. bolt.new(@boltdotnew)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 上线语音听写功能:支持任意语言,直接对着麦克风说话生成应用

    Bolt 推出语音听写功能,用户点击麦克风后可用任意语言直接说话,将对话转化为应用。官方在推文中将其与 Siri 对比,称这是"真正能用"的语音听写。

  4. bolt.new(@boltdotnew)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    bolt.new 语音输入:口述想法自动去除口头语

    bolt.new 推出语音输入功能,用户可把未完成的想法直接口述出来,无需整理。分享的上下文越多效果越好,系统会自动剔除"um...""uh..."、错误开头和重复内容。

  5. bolt.new(@boltdotnew)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 上线语音听写功能:说出来即可构建

    Bolt 现已上线语音听写(Voice dictation)功能,用户可以直接用说话的方式完成构建,官方称"能说出口就能做出来"。该功能目前已在 Bolt 中可用。

8月13日周四
  1. Sundar Pichai(@sundarpichai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Gboard 与 Live Transcribe 推出 ASL 手语转文字功能

    Google 在 Made by Google 活动上发布 Gboard 和 Live Transcribe 的新手语转文字功能,可与 Deaf 社区合作开发。该功能帮助使用 ASL 手语的人更顺畅地与手机交流,或与不会手语的人沟通。

8月12日周三
  1. Sundar Pichai(@sundarpichai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Pixel 11 系列,主打 Gemini Intelligence

    Google 发布 Pixel 11 系列,Sundar Pichai 表示新机围绕 Gemini Intelligence 设计并带来多项新功能,包括为真实说话方式打造的语音输入 Rambler、拍照功能 Magic Capture,以及手机倒扣时用微光提示重要来电的 HiLight。

  2. MiniMax 稀宇科技AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 开源一周衍生近 300 个模型

    MiniMax 官方发文称 H3 开源一周内已在 Hugging Face 衍生出接近 300 个模型,ComfyUI 版本下载量近 700 万。社区把约 60B 参数、BF16 下需约 120GB 内存的 H3 压缩到 42.5GB 以在消费级显卡本地推理,Redis 作者 antirez 还为其编写了面向 Apple Silicon 的原生引擎 h3.c。

  3. Lex Fridman(@lexfridman)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 对话 Khabib Nurmagomedov:从达吉斯坦到 UFC 的深度访谈

    Lex Fridman 发布与 Khabib Nurmagomedov 的对话,全程用俄语进行,经 AI 与人工协作翻译配音成英语,两个语种音轨和字幕均上线 YouTube,翻译配音由 ElevenLabs 团队协助。访谈涵盖达吉斯坦格斗文化、Khabib 的统治力来源、与 Conor McGregor 之战及教练生涯等话题。

8月11日周二
  1. Google AI Developers(@googleaidevs)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 应用如何用 TTS 向赛车手实时播报数据

    赛车手在弯道中无法看屏幕,该应用改用 Text-to-Speech(TTS)提供即时语音反馈。视觉仪表盘则用 Jetpack Compose 构建,在高负载下流畅渲染空间指标而不掉帧。

  2. Andrej Karpathy(@karpathy)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrej Karpathy:未来回看"无法像对人一样和电脑对话"会很奇怪

    Andrej Karpathy 回应 @jack_w_rae 时表示,历史上人们无法像和普通人交谈一样与电脑对话,这一状况日后回看会让人觉得很奇怪。该帖获 919 次点赞、48 次转发和 27 条回复,浏览量 75271。

8月5日周三
  1. 字节跳动SeedAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线

    字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。

    为什么值得看

    字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。

8月4日周二
  1. 三五环AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话滴滴曲晓楠:AI 如何识别车内风险,以及安全算法为何宁可误判

    滴滴网约车平台安全部负责人曲晓楠在播客中拆解了滴滴五层全链路安全防护体系,其中行程环节每日约 4000 万订单经双层 AI 过滤,用大模型识别争执、求救、呕吐、肢体接触等风险语音,并结合轨迹偏航与「桔视」车载录像研判。安全算法优先保召回率而非准确率,宁可深夜致电确认安全也不漏判,近年安全事件降幅约 30%。

  2. Hunyuan(@TXhunyuan)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布 Hy ASR 3.0 preview,由 Hy3 语言大脑驱动

    腾讯 Hy ASR 3.0 preview 今日发布,由 Hy3 的语言能力驱动,主打精准语音识别加深度语义理解。官方称其在通用识别、上下文感知、多场景鲁棒性和方言覆盖上表现领先,多语言 WER 约为 3%,可将嘈杂的真实音频转成连贯转录并准确理解意图。

  3. 腾讯混元AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy ASR 3.0 preview 语音识别模型

    腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。

  4. Microsoft Research(@MSFTResearch)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小语言模型用 SocialRL 学习谈判,PazaBench V2 扩展非洲语言语音 AI 评测

    微软研究院介绍多项成果:小语言模型通过 SocialRL 学习谈判,PazaBench V2 将语音 AI 评测扩展到多种非洲语言,EvoLib 则帮助智能体把经验转化为知识。此外还包括更可靠的 A/B 测试方法以及 AI 驱动精准肿瘤学的进展。

8月3日周一
  1. idoubi(@idoubicc)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ShipAny 上线 Voice Agent 模板:对话加多步骤工具调用生成处理音频

    ShipAny 上线新模板 ShipAny Voice Agent,通过对话加多步骤工具调用的方式生成和处理音频,可用于有声书、朗读、播客等场景。后台配置 OpenAI、11labs 等音频厂商的 apikey 即可开箱即用,快速上线自己的 Voice Agent。

  2. Rowan Cheung(@rowancheung)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    语音健康追踪器:对 Siri 说话即可记录情绪、精力、用药与活动

    Alex Smirnov 做出一款语音健康追踪器,用户只需对 Siri 说话就能记录情绪、精力、用药和活动,醒来即可看到整理好的健康仪表盘。该项目完全基于免费额度搭建。

  3. Rowan Cheung(@rowancheung)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    约 1 美分的会议助手:手机录音经 Telegram 转本地 AI 智能体

    Rowan Cheung 介绍了一套约 1 美分/场的会议助手方案,来源署名 Steve Farmer。做法是用手机录制会议,把音频发送到 Telegram,再由本地托管的 AI 智能体完成转写、说话人识别、提取行动项并归档任务。

8月1日周六
  1. Google AI(@GoogleAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 汇总 Gemini 近期更新:Gemini Robotics 2、3.5 Flash-Lite、3.6 Flash 等

    Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。

7月31日周五
  1. MiniMax 稀宇科技AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 发布全模态生成模型 H3,计划开放模型权重

    MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。

    为什么值得看

    MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。

7月30日周四
  1. xAI(@xai)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Voice Think Fast 2.0 上线 API 与 Voice Agent Builder,每分钟 $0.08

    Grok Voice Think Fast 2.0 已在 API 和 Voice Agent Builder 中开放使用,定价为每分钟 $0.08。

  2. xAI(@xai)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0,官方称其在智能水平、转写准确率和对话能力上均有提升。相关介绍见 x.ai/news/grok-voic…。

  3. xAI(@xai)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 推出 Grok Voice Think Fast 2.0,面向真实场景语音智能体

    xAI 发布 Grok Voice Think Fast 2.0,专为真实世界语音智能体打造,可在嘈杂环境中清晰收音,能对复杂工作流进行推理,对话听起来也更自然。

  4. Google DeepMind BlogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 在 Google Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称该模型在音乐性、歌词和人声质量上均有提升,包括更丰富复杂的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表现力和发音更准的人声,同时可更便捷地控制输出的节奏与时长。

7月29日周三
  1. Eric Jing(@ericjing_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Granola 推出 Apple Watch AI 会议记录应用

    Granola 已在 Apple Watch 上线 AI 会议记录应用,发布者称这是全球首个登陆 Apple Watch 的 AI 会议记录器,最早于去年 8 月推出。TechCrunch 于 7 月 28 日报道了该应用。

7月25日周六
  1. xAI(@xai)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok STT 上线 OpenRouter,支持 25 种语言

    xAI 的 Grok STT 已在 OpenRouter 上线,支持 25 种语言的语音转文字,并提供词级时间戳和说话人分离功能,定价为每音频小时 $0.10。

7月24日周五
  1. 硅谷101AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    藏在大模型背后的新闻人:GPT们的回复是怎么写出来的

    硅谷101 播客对话两位从新闻业转型的内容工程师(Content Engineer)——前媒体人东尼与 NBCUniversal AI战略总监 Bianca,拆解AI回复背后的工作。嘉宾介绍了系统提示词、少样本示例、意图理解、来源归属等术语,讨论好对话如何拆解成可量化、可训练的工程标准,以及 AI谄媚为何是产品设计问题。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MAI-Voice-2-Flash 发布:比 MAI-Voice-2 快 2 倍、便宜 32%

    MAI-Voice-2-Flash 正式发布,速度比 MAI-Voice-2 快 2 倍,价格便宜 32%,为每 100 万字符 $15。该模型已进入公开预览,并已驱动企业呼叫中心平台 Dynamics 365 Contact Center,可将 GPU 成本最高降低 89%。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI 模型进展:PowerPoint 图像模型成本较 GPT-Image-2 降 84%

    微软正在推进 MAI 系列模型的落地,覆盖 PowerPoint、OneDrive、Bing、Dragon Copilot 等产品。PowerPoint 图像模型成本较 GPT-Image-2 下降 84%,OneDrive 保存率提升 26%、延迟降低约 25%,Bing 已将其作为默认模型。Dragon Copilot 转写模型支持 58 种语言,多语言临床转写错误率减半。