刘润:未来一两年上班方式将发生的8个变化
刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。
刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。
哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。
ElevenLabs 在 ElevenAgents 中推出合成语音检测,用于识别代个人、其他公司乃至恶意行为者拨入企业的 AI 智能体来电。ElevenLabs 同时加入新成立的 Personal Agent Protocol 工作组,参与制定智能体之间的交互规范。
ElevenLabs 推出合成语音检测功能,可在通话开始数秒内分析来电者语音,判断其为真人还是 AI 生成,并据此路由。该功能意在让真人获得为真人设计的体验,智能体进入直接、有边界的交互,同时拦截恶意行为者。
ElevenLabs 的合成语音检测功能现已通过其前向部署团队向企业客户开放,本月晚些时候将扩大访问范围。该公司表示将随着工作推进分享 PAP 方面的进展。
iOS 27.2 测试版带来五项更新,最大变化是 Health app 全面改版,新增 Longevity 标签页和 Health Age 评估,并可用 iPhone 摄像头为灵活性、平衡、VO2max 和力量打分。
Fish Audio 的 Drama 3 现支持为角色语音增添更多情绪,还能在重新生成时只修复一行甚至单个词,其余部分保持不变。该功能由 Fish Audio 发布。
Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
AI 硬件初创公司 Natura 于 10 月 8 日发布智能戒指 Interface,早期入手价 99 美元,按住戒圈按钮说话即可把任务交给指定 AI 代理执行,支持 Meta Muse、Instinct、Grok Bot、Claude、ChatGPT 等,无需掏出手机。
ElevenLabs 与 Banner Health 达成合作,用 AI 语音智能体接听患者来电,首批覆盖初级保健预约场景。患者可全天候致电,ElevenAgents 直接在 Banner 的电子病历中完成预约、改期或取消;需要人工时,通话会连同必要上下文转接给 Banner 团队成员。
开发者受 Producthunt 产品 DeTV 启发,借助 Grok bot 协作和豆包播客 API 开发了一款 AI 播客,由双人主播播报 Hacker News、GitHub Trending、卡兹克 AI Hot 热门新闻及 Producthunt 热门产品。在线电台为 aitv.qiaomu.ai,开源地址在 github.com/joeseesun/aitv。
卡西欧中国官网智能教育板块上架便携口袋机 "AI智能听说学习机 LT-C1",整机 145g、2.83 英寸屏幕、128G 内存,官方定价 1098 元,电商优惠价在 800-1000 元之间。
Apple 将于 10 月 13 日举办以智能家居为主题的“Welcome home”发布会,据报道首款智能屏“HomePad”将登场,配备 6 英寸方形屏幕,可接 HomePod mini 式音箱或壁挂使用,主要靠 Siri AI 交互。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。
苹果宣布将于 10 月 13 日在纽约举办「Apple Experience」家庭产品活动,最受关注的硬件是代号 J490 的带屏设备 HomePad,配备约 6 英寸方形触控屏和金属支臂,搭载内部代号 Charismatic、可能名为 homeOS 的系统,可通过人脸与声音识别家庭成员。
ElevenLabs 正式上线 OpenRouter,可调用 9 款 Text to Speech 模型,支持 90+ 种语言,以及 2 款 Speech to Text 模型,支持说话人标签和词级时间戳。所有 ElevenLabs 模型在 OpenRouter 独家 5 折,优惠持续至 10 月 19 日上午 8 点(PT)。
Smallest AI 的 Pulse 在 Voice Arena Diarization Bench 的 Diarization + ASR 赛道以 24.4% DER 排名第一,在 0 ms collar 的严格设置下,误差比第二名 ElevenLabs Scribe v2 的 40.7% 低 1.7 倍。
Fish Audio 推出语音模型 Drama 3,号称在语言表达方向上展现出模型迄今最强的控制力,能在同一句话中改变语气,语音控制接近真人说话。用户可用自然语言直接指定音色、情绪、节奏和角色,模型甚至能在句子中途切换情绪,无需重录。该模型已以 'drama-3-preview' 在 API 中提供预览。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
向阳乔木展示了一款自制音视频学习软件,支持字幕转写、翻译、AI 对话,以及从 X、B 站、抖音、Tiktok、小宇宙下载音视频,并附操作演示,安装 Prompt 放在评论区。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
Fish Audio 为 Drama 3 预览版开放 API,调用时需将 model 设为 drama-3-preview,API key 可在 fish.audio/app/api-keys 获取。网页端可在文本转语音入口选择 Fish Audio Drama 3(Preview)模型。
开发者 @whosamberella 用 Fish Audio 的 Drama 3 打造了一款语言应用,让用户与 AI 语音角色练习真实对话。每个角色都有独立性格,还配有面向初学者的发音卡片,答不上来时角色甚至会表现得不耐烦。
Voice Arena 发布 Monsoon ASR 语料库,目前已覆盖 50 种语言、100,000 小时数据,其中多为长尾语言,计划 2027 年底扩展到 1,000 种语言。
Google Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以 53 分追平 GPT-6 Astra,每任务成本约为后者 60%。
元巅科技(寂核)创始人周百祥打造的 GENiEX 在 Kickstarter 结束众筹,单价 188 美元起,共筹得约 18 万美元。这台复古对讲机造型的掌机内置原创末世科幻 IP,设三个角色各四章剧情,支持语音交互与角色记忆,并加入类似"暴龙机"的双机对碰多人玩法。团队明确不做订阅制,改用一次性硬件买断加角色资产与内容的持续消费。
Google 发布 AI Edge Foresight 应用,对标 Granola,主打离线会议记录。它能在设备端完成对话转写、生成笔记并回答问题,全程依赖端侧 AI。
作者用小米蓝牙遥控器 2 Pro 搭配开源 App 无线麦(github.com/HD838A/remote-…),让 Codex 完成安装并简单设置后即可使用。该方案可配合豆包输入法、TypeLess,作者实测 Raycast 内置语音输入同样可行。
Yoroll 旗下 LinearGame 正在内测 AI 陪伴产品 Yyo,其角色来自《华君传》《VOW》《心动相簿》等互动影游,玩家通关后可与角色继续文字、实时语音或视频通话,并一起玩三消、闯关、像素街机等双人小游戏和共享屏幕陪玩。
Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向摘要、上下文压缩、数据库查询和分类等高频任务,是首款支持可调推理强度的 Haiku 模型,提示词不超过 10 万 Token 时每百万输入、输出 Token 分别为 0.10 美元和 0.50 美元,当前未开放模型权重。
波士顿创业公司 SOND 推出睡眠耳机 Dreambuds,每只仅 2.1 克,整晚持续读取心率、HRV、呼吸、睡姿、打鼾、体温等 12 项信号,据此动态调整耳内播放的助眠内容。
荷兰Eevi、美国Aristotle与印度YoLearn.ai接连完成Pre-seed至种子轮融资,均把"语音优先"放于产品核心。波士顿大学一项随机实验显示,语音模式下学生对话密度约为文字模式的1.8倍、提问次数约2.4倍,但五周内两种模式的学习掌握程度无显著差异,且语音成本约为文字的2.8倍。
Fish Audio 上线 drama-3-preview 模型,开发者可通过 API 文档将 model 设为 drama-3-preview 并申请 API key 调用,网页用户则可在文本转语音页面选择 Fish Audio Drama 3(Preview)使用。该模型目前处于预览阶段。
Fish Audio 推出语音模型 Drama 3,可用自然语言直接指挥语气、情绪、节奏和角色,甚至能在同一句台词中途切换情绪,无需重录。该模型以 'drama-3-preview' 名称在 API 中开放预览。
Google 推出 Gemini 3.8 Live 语音到语音模型,跳过语音转文字再转语音的传统串行流程,在同一系统内完成聆听、推理与回应。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 上排名第一,标准版在人工盲测的实时对话中排名第二,输入音频成本为每小时 0.84 美元,为榜单中最低。
ElevenLabs 在班加罗尔峰会上与印度一个邦政府签署首份 MOU,试点语音 AI。过去一年印度的 1 亿多次 ElevenAgents 对话中,超 70% 使用 Hindi、Kannada、Tamil 和 Telugu 四种语言。本次峰会聚集 500 多位企业领导者、开发者和合作伙伴。
xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。
OpenAI 为 Codex 加入语音输入,用户可直接与 Codex 对话,不必全程使用键盘。一位用户表示自己过去整天守在桌前,如今在阳光房里用语音就能发送演示文稿。