Grok Voice 上线 fal:0.70 秒响应,可构建低延迟智能体
Grok Voice 已在 fal 上线,这款来自 SpaceXAI 的语音模型能在 0.70 秒内作答,并在句子说完前完成工具调用。它支持词级时间戳转写、25+ 种语言的 30+ 种音色文本转语音,以及用两分钟音频完成声音克隆。
Grok Voice 已在 fal 上线,这款来自 SpaceXAI 的语音模型能在 0.70 秒内作答,并在句子说完前完成工具调用。它支持词级时间戳转写、25+ 种语言的 30+ 种音色文本转语音,以及用两分钟音频完成声音克隆。
Figma 在社交平台发布了一条指向 bit.ly/4y1xu4Y 的链接,未附任何文字说明。该帖获得 4 条评论、40 次点赞和 7238 次浏览。
Augment Code 推出 Cosmos,并提供试用入口 cosmos.augmentcode.com。原文未披露该产品的具体功能、模型版本或参数规模等信息。
Augment Code 展示了一套多智能体 PR 审查流程:多个 agent 进行多轮审查,修复 CI 失败、评论意见和代码冲突,再向人类审查者提交深度审查简报和端到端证据。人类仍然保留批准与合并的最终决定权。
Midjourney 公布 9/16 的每周办公时间(Weekly Office Hours)活动,附有 X Spaces 链接,该条内容获得 14 条回复、17 个点赞、21305 次浏览。
Claude 将聊天与 Cowork 合并为统一的 Claude 产品,用户提出简短问题或交出一份报告后,Claude 会接着推进任务,即使合上笔记本也继续运行;遇到不清楚的地方 Claude 会主动询问,最终决定权仍在用户手中。
Mem0 现已上线 Vercel Marketplace,安装后可为 AI 智能体提供跨会话持久记忆。该集成会自动配置 Mem0 项目与 API key,费用计入 Vercel 账单,并提供免费套餐。开发者可通过 `vc i mem0` 命令安装。
Mishig 在 MuJoCo 中复现实验,让 gpt6 astra 控制 so101 机械臂与画笔,在仿真里画出埃菲尔铁塔,完整实验已发布在 Hugging Face。
Gemini 的 Canvas 功能可以让用户编写自定义应用来设计花瓶,通过调整数学参数在 3D 中查看效果,再导出为 .STL 文件用于 3D 打印。该流程把想法直接变成实物。
Jonathan Roomer 已把 Codex 语音接入 CarPlay,可在公路旅行途中边带 5 个孩子边用语音开发。该功能通过其 Nightblood iOS 应用运行,让 ChatGPT Voice 具备形象与个性,并完整调用 Codex、他的 Mac 及全部原生工具。
HeyGen 发布 MCP 接入能力,用户可将智能体连接到现有工作环境,一个提示词即可生成整套视频库,覆盖各类就诊类型、手术流程和患者常见问题,并保持同一张脸和同一个声音。该能力面向医疗场景,接入文档见 developers.heygen.com/mcp/overview。
Stack Overflow for Agents 上线三个月后新增 ChatGPT 插件,将其现有技能打包为一个可安装的 OpenAI 能力,免去手动运行或安装技能、缩短启动时间。
Termany.sh 推出 Model Gateway 面板,为本地 AI 智能体提供统一的模型路由层,可在数秒内切换模型与提供商,无需手动修改智能体配置文件。
Bolt 推出可直接使用的网站模板,覆盖作品集、落地页、仪表盘和店铺等场景,均可在 Bolt 中自定义。用户打开模板、改成自己的内容后即可发布上线。
ElevenLabs 公布了新产品的可用性、定价与上手方式,详情见其官方博客 elevenlabs.io/blog/reception。原文未透露该产品的具体功能、版本号或价格数字。
ElevenLabs 上线 Reception,企业可用来搭建自己的接待服务,配套地址为 reception.ai。该推文附带官网链接,阅读量约 134 万,转推 12、点赞 143。
ElevenLabs 发布 Reception,一个面向小企业、基于 ElevenAgents 构建的 AI 前台接待平台。Reception 可接听每一通来电、回答客户问题、预约服务并发送短信确认,用户只需添加网址即可在几分钟内完成设置。
Dia 的 Windows Wednesday 系列回归,本期 Jan 介绍标签页的新归宿——侧边栏,接续第 3 期对标签管理功能的讲解。该系列每周更新,本期同步开放报名通道。
Anthropic 宣布将 Claude Cowork 与聊天合并为一个 Claude,并接入 Claude Design,用户无需切换标签页或应用即可让 Claude 生成幻灯片、设计或文档。Claude 会根据提示词自行判断给出快速回答还是执行更深入的智能体工作,以及最适合的输出形式,用户仍可随时停止、调整方向或控制投入程度。该功能将在未来几周内向 Pro 和 Max 用户逐步推出。
Anthropic 的 Mike Krieger 表示,Claude Docs、Claude Slides 和 Claude Design 即日起在所有对话中可用,由改版后的 Artifacts 平台驱动。用户可以直接提出设计、演示文稿或文档需求,得到可编辑、可下载、可带走的结果。他邀请用户试用并反馈。
Anthropic 从今天起把 Claude Cowork 和 Chat 合并为一个统一的 Claude,先向 Pro 和 Max 用户在未来几周内逐步推送。官方称合并的原因是用户常不确定该从哪个产品入手,统一后由 Claude 自行决定实现路径,用户保留最终决定权,任务在关闭笔记本后仍可继续推进。
Cohere 的 Model Vault 现已支持 NVIDIA 机密计算,并面向有限数量的 beta 客户开放早期访问,beta 名额有限。官方未披露具体模型、价格或性能数据,仅给出 cohere.com/solutions/mode… 的了解更多链接。
Cohere 的机密计算通过三种方式防止数据被追踪或使用:端到端加密推理、借助 NVIDIA 机密计算将硬件强制隔离延伸至 GPU,以及可随时申请签名认证令牌并对照硬件厂商公钥独立验证。数据控制权归用户所有。
Cohere 在 Model Vault 中引入机密计算(Confidential Computing),让数据在使用过程中也保持加密,任何人和任何方都无法访问你的工作负载,包括 Cohere 自己。此前数据仅在静态存储和传输时加密。
Devin 新增 /scan 功能,在扫描开始前帮助用户界定要检查什么、跳过什么,以及什么算作一个发现。用户可在 Devin 中输入 /scan 试用。
Cognition 分享 Devin Code Scans 的工作原理,并给出 devin.ai 博客文章的阅读链接。该帖未披露更多技术细节。
Bolt 宣布 Forge 已面向所有 Pro 计划开放,并放出 Bolt Lite 每月 9 美元的含 Forge 权限等待名单。Forge 在 10 月 14 日前免费,提供最高 50 倍用量,并新增 GLM、DeepSeek、Kimi 模型选择,且不收取用量费用,已上线 bolt.new 的模型选择器。
mem0 发布 Gateway,聚焦 AI 智能体获得更多访问权限之后的长期管理问题。原文未披露具体功能参数、价格或可用性细节。
一家覆盖 100+ 国家、服务数亿听众的音乐流媒体平台用自托管 Milvus 搭建了音频与歌词的统一检索层,将 1 亿+曲目编码为数十亿向量,实现每秒数百次查询下约 10ms 的 P99 数据库检索延迟。该基础设施同时支撑歌曲识别、歌词搜索、推荐和版权匹配,支持播放短片段、哼唱旋律或输入模糊歌词等检索方式,并通过地域与版权过滤结合语义与全文搜索。
Figma 在社交平台推荐了几款当前最喜欢的 Weave 工具,并附上 figma.bot/5WeaveTools 链接查看详情。推文未披露具体工具名称或功能细节。
Figma 在画布上直接推出 Weave 工具,支持将图片重绘为不同材质、把文本提示词转成概念草图,以及把图片扩展到任意画幅比例。用户还能把自制工具发布到 Community。
Dify Marketplace 上线 AIsa Go-to-Market 插件,可为 Dify Agent 一键接入 GTM 调研能力。该插件整合 Similarweb 与 Ahrefs 追踪竞品、Semrush 与 DataForSEO 挖掘搜索缺口、X 与 Reddit 捕捉舆情、Apollo 寻找潜在客户,由 AiSaOneHQ 集成。
Gemini Live API 迎来更新,新增音频模型。Patrick Loeber 分享了由 @thorwebdev 讲解这些新音频模型的视频,介绍其具体能力。
字节跳动技术团队开源上下文数据库 OpenViking,新增面向执行过程的经验记忆:任务结束后归档 Session 并生成 Trajectory 与 Experience,新任务开始前检索相关经验并核对适用条件再应用。
OpenViking 是字节跳动 Viking AI 搜索推出的 Agent 记忆中枢,可接入 Trae、Codex 等不同 Agent,把创作资料、写作偏好和复盘经验统一组织成 Resource、Memory、Skill 三类,并存入 viking:// 地址实现分层召回,减少重复读取的 Token 开销。
termany.sh 支持查看每日 agent 使用情况,用户认为这一功能非常方便。
有用户分享了一个 GPT Image 2.5 提示词,能把任意图片变成"一整天 iPhone 相机胶卷照片"的效果,用在 Lovart logo 上呈现出的结果被评价"太可爱了"。该提示词已放在原推的 thread 中,原帖展示了实际生成效果并附有视频。
Manus 推出 Learn AI,基于与培训机构、学校和 AI 学习社区的合作,帮助人们从了解 AI 转向实际应用。该项目计划与全球合作伙伴共建更多实践性学习路径。
Manus 推出 Learn AI with Manus 全球计划,面向培养实用 AI 能力的学习合作伙伴。详情见 learnai.manus.im 及官方博客 manus.im/blog/learn-ai。
Varun Mohan 表示 Antigravity 上的 Gemini 3.8 Flash 因高负载出现请求报错,已着手修复并在问题解决后重置速率限制。他随后更新称修复已完成,配额重置已向所有用户推送。