Fish Audio MCP 迎来重大升级:新增图像与视频生成
Fish Audio MCP 新增图像与视频生成能力,用户可在 agent 内把一句 brief 做成广告:先生成画面、再编辑、最后生成视频,创作前还能看到成本。该功能支持 Claude、Codex、Cursor、Windsurf。
Fish Audio MCP 新增图像与视频生成能力,用户可在 agent 内把一句 brief 做成广告:先生成画面、再编辑、最后生成视频,创作前还能看到成本。该功能支持 Claude、Codex、Cursor、Windsurf。
Lovable 阐述了其模型哲学:每周都有新 AI 模型发布,团队会逐一测试、调优并决定其路由方式,以保证用户的构建获得最佳结果。Lovable 目前已支持使用 Fable 5.1 进行构建。
Lovable 宣布即日起其构建流程改用 Opus 5.5,质量与 Opus 5 持平。官方称在 0 到 1 构建与迭代修码上质量不变,在已有代码库上步骤最多减少 48%;自检测试得分高出 4-6%,达成同样结果所需步骤最多减少 57%。
HeyGen 的 Muse 上线两周已能代用户跑腿办事,接入 HeyGen 的 MCP 后还能一并处理内容:早上 7 点生成简报、以用户自己的声音写脚本并合成视频,在用户醒来前完成日语、德语和法语本地化。
Claude Opus 5.5 现已在 Perplexity Computer 中作为 Standard effort 级别提供。在 WANDR benchmark 上,它以每任务 4.13 美元得分 0.610,略优于 Claude Fable 5.1,且每任务成本低 67.6%。
v0 宣布用户现可在 v0 中使用 Claude Opus 5.5,并给出试用入口 v0.app/?opus55。所引用的 Anthropic 内容称,Claude Opus 5.5 是 Claude 5.5 系列的首个模型,多数任务上表现与 Claude Fable 5.1 持平,运行成本比 Opus 5 低 40%。
Dify 发布新版 Agent,用户可从一句想法出发、通过对话完成构建,并在 Preview 中测试,一次构建即可在团队常用的多个场景中复用。官方同步放出一段两分钟演示视频,展示完整流程。
ElevenLabs 的 Scribe v2 Medical 现已通过 ElevenAPI 开放使用,定价从每小时 $0.22 起,并随用量规模增加而降低。
ElevenLabs 发布 Scribe v2 Medical,专为受保护健康信息设计,该模型符合 HIPAA 要求。其 Zero Retention Mode 会在每次请求完成时立即删除音频和转写文本。
Transformers 与 ggml 合作,通过在 `kernels` 库中调用 GGML kernels,让 GGUF 模型加载从反量化改为直接运行,性能追平 llama.cpp。此前 Transformers 已支持加载 GGUF 文件多年,这次改动由 @_marcsun 完成。
Runway 推出 DIFFUSE 平台,供代理商、品牌和工作室搜索、对接并雇佣 AI 原生人才。官方称 AI 并未取代创意从业者,反而催生出一支全新的创意劳动力,且需求正在加速增长,DIFFUSE 正是为连接这批人才与新机会而生。
腾讯混元 Hy Image3.5 preview 已在 Miora 上线,支持文生图与图生图,最高 2K 分辨率,可用于营销视觉、产品场景、分镜和游戏概念图,并沿用原有画布与品牌规则。该预览版免费开放至 10 月 7 日。
NVIDIA DLSS 5 引入 DLSS 3D-Guided Neural Rendering 与更细粒度的控制项,让游戏开发者在保持艺术意图的同时加入更逼真的光照与材质细节。此次同步更新 NVIDIA ACE、RTX Mega Geometry 2.0 与 RTX Kit,覆盖角色 AI、高密度几何与渲染工作流。
阶跃星辰 Step 5 Preview 已在豆包旗下 AI 开发产品 TRAE 上线,可直接在 TRAE 中调用,覆盖 9 类任务、33 种编程语言,从复杂代码库理解、跨文件修改到 Bug 修复、重构、性能调优及数小时长程任务。官方公布 DeepSWE 67.7 分、ProgramBench 通过率 80.5%。
Today 中国版将于 9 月 24 日正式上线,主打会逐渐记住用户相关事项、在需要时主动帮忙的专属 AI 助理,覆盖 iOS、Android、Windows、Mac、Linux 平台,内测阶段已带来惊喜。
阿里千问办公发布 QwenNote 硬件产品线,包含带三轴云台、以手机为头的桌面机器人 Eva 和随身助理 A2,前者靠人脸与声纹识别用户,无需唤醒词即可直接对话并打断。
火山引擎存储分享 ADrive 跨产品协作实践,基于 ve-adrive-cli v1.0.2,展示如何选择一个正在进行的内容项目、跑通第一个文件协作闭环。ADrive CLI 已在 GitHub 发布并提供下载,开通 ADrive 需联系 ADrive 团队申请试用。
火山引擎推出 ADrive 智能网盘,让 Agent 直接读取项目资料并把成果保存回同一项目空间,团队成员再从熟悉的文件夹接手审阅。项目空间可挂载为本地盘符,人和 Agent 共用同一文件夹;未授权的写入尝试在演示中三次均被拒绝,操作留有审计记录。该产品已开放企业版试用申请。
网易有道推出语音产品"叭哥说",把语音从"转文字"推进到"转意图",用户先说完整段内容再由系统整理成可用文本,PC 端已上线并承诺语音输入场景终身免费。同期升级的 Hi Echo 转向个性化口语学习系统,并已与启元机器人合作进入机器人场景。
JetBrains 发布 JetBrains Air,将智能体开发相关产品整合为覆盖开发者、团队与组织的开放产品体系。
MVLAND 上线「深度创作模式」,可先分析歌曲的节奏、情绪与结构,再生成剧情分镜,并支持一首 MV 同时选用最多 5 个角色。实测制作两分钟古风 MV 共拆出 38 个镜头,默认生图模型为 MV image 2.5 Sunburst,导出 720P 视频,全程约 1 小时、花费约 2500 积分,音乐分析、故事与分镜提示词环节免费。
douchat.ai 开始内测,定位为"Agent 版微信",由 xgo.ing 提供支持。原文未披露模型版本、参数规模或开放范围等细节。
阿里在云栖大会集中发布 ROLL、RTP-LLM、Atrex Kernel Agent、OpenSandbox、Open Agent Auth、OpenCodeReview 六个开源项目,分别面向大规模强化学习、生产级推理、异构算子生成优化、Agent 沙箱运行、企业级授权和智能代码评审。
Vercel AI Gateway 新增 HTTP API,除原有的 TypeSafe 兼容 API 外,现在支持任意语言或框架调用 Jev。TypeSafe 兼容 API 保持相同的 eval 调用方式,HTTP API 则面向非 JavaScript 生态开放。
Pika 推出 Relight Media,用户可在 create.pika.art 上对图片或视频进行重新打光。该功能以独立应用形式提供,入口为 create.pika.art/apps/relight-media。
Pika 上线 Relight Media 应用,可对任意照片或视频重建光照与阴影,支持预设或手动调整,主体、构图与运动保持不变。该功能现已登陆新版 Pika,官方称新 Pika 是面向创作者的 AI 创作平台。
Fireworks 在 DeepSWE 上让 18 个模型跑 113 个真实编码任务,再假设每个任务都交给处理最好的模型,得到 97.6% 解决率、每任务 1.88 美元,而最佳单模型为 74.1%、每任务 6.52 美元。其结论是下一步方向在于路由器。完整分析见 fireworks.ai/blog/the-front…
Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。
LlamaIndex 为 LlamaParse Extract 加入 grounded confidence scores,把校准置信度从离散决策扩展到通用 schema 引导的文档抽取,覆盖 bool、int、float 等基础类型和自由文本,且数值不必有界。
Jev 在 Vercel AI Gateway 上限时免费开放至 9 月 25 日。用户可通过 form router 模板试用,由 Jev 代为路由表单提交。
Browser Use 与 Jev 联合推出开源浏览器智能体 Ultrafast。据推文数据,Ultrafast 4 天内获得 15k 星标,查询航班耗时 7 秒、花费 0.0039 美元。其设计包含每一步都有新的 action space、DOM 状态空间,以及回退到小 LLM 执行输入,演示视频为 1 倍速。
White Circle 发布开源模型后训练框架 Halo,吞吐量最高达原生 TRL 的 2.8 倍,峰值内存更低,且模型保持 HuggingFace 原生格式。HuggingFace CEO Clement Delangue 转发称,借助智能体,训练模型正变得越来越容易。
用户让 Grok 4.7 参考此前的视频,制作了一段 SpaceX Starship 发射的定格动画,并用 Starship 真实发射视频作为参考以提升素材准确度。作者称视频中的所有内容均由 Grok 生成。
NVIDIA TensorRT 推出多设备推理能力,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,并已集成进 NVIDIA Dynamo-Triton,用于简化多 GPU 模型服务。
Grok 4.7 已在 Devin Desktop 和 Devin CLI 上线,Cognition 同步确认该模型接入 Devin。在 FrontierCode 1.1 的 Extended 测试中,Grok 4.7 得分 59.4%,官方评估称其在高难度后端工程任务上表现优异。
Devin CLI 和 Devin Desktop 现已开放试用,用户可通过 devin.ai/download 下载体验。该消息由 Cognition 发布。
Grok 4.7 现已在 Devin 中可用,在 FrontierCode 1.1 的 Extended 测试中得分 59.4%。Cognition 的评测显示,该模型在困难的后端工程任务上表现优异。
Anton Osika 表示其团队的 harness 已针对构建 Web 应用做微调,会依据用户请求内容在 OAI 与 Anthropic 之间路由,并自动拉取全部调试数据。他邀请开发者试用该工具。
Lovable 本周推出活动,用它构建 AI 智能体或 web 应用即可免费获得 Jev API。同时上线的还有 Jev completions API 和 Jev Playground(jevplayground.lovable.app),并已接入其 AI gateway。
Google Gemini App 将于 9 月 22 日 11am PT 举办直播演示,展示如何用 Gemini 购物,包括辅助决策购买、对比选项,以及通过拍照浏览商品。直播在 Discord 观看,地址为 discord.gg/gemini。