Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型
Google DeepMind 推出 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,并首次引入 granular audio tags,可用自然语言指令控制语音风格、语速和表达。
Google DeepMind 推出 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,并首次引入 granular audio tags,可用自然语言指令控制语音风格、语速和表达。
Midjourney V8.1 正式上线,回归标志性美学风格并支持原生 2K HD 渲染,相比 V8 快 3 倍、便宜 3 倍。其 1K 模式的完整画质已快于 V7 的草稿模式,同时恢复了图像提示(image prompts),并新增 Describe、moodboards 与 srefs 功能。
字节跳动 Seed 发布原生全双工语音大模型 Seeduplex,基于边听边说框架,实现听说同步,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其误回复率和误打断率减少一半、抢话比例下降 40%、判停响应快约 250ms,对话流畅度与判停 MOS 分分别提升 12% 和 8%,通话满意度绝对提升 8.34%。
Poe 平台现已上线 Z.ai 的旗舰模型 GLM-5.1,主打智能体工程,在 SWE-Bench Pro 上取得 state-of-the-art 结果,并在仓库生成和真实终端任务中表现领先。
Happy Horse 首次输出结果,在 Artificial Analysis 上超过了 Seedance 2。相关细节可查看引用推文。
Mythos Preview 目前已向 Project Glasswing 的发布伙伴开放,Anthropic 同步公布了该模型与项目的介绍页面 anthropic.com/glasswing。推文未披露模型参数、benchmark 分数或公开可用时间。
Anthropic 在发布 Claude Opus 4.6 两个月后,公布新模型 Claude Mythos Preview。该帖由 Alex Albert 发出,获得 17565 次点赞和 301 万次浏览。
Poe 宣布 Gemma 4 已在其平台上线,该模型被描述为 Google 目前能力最强的开放模型,拥有 31B 稠密参数、256K 上下文窗口、支持 140 多种语言。它支持多模态输入、内置思维链推理和函数调用,采用 Apache 2.0 许可,可在各平台的 Poe 应用及 Poe API 中使用。
Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。
Chroma 推出 Chroma Context-1,一个 20B 参数的搜索智能体,模型权重已在 Hugging Face 发布。官方称其推进了智能体搜索的 pareto 前沿,速度提升一个数量级、成本降低一个数量级,并以 Apache 2.0 协议开源。
Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。
Cursor 发布技术报告,说明 Composer 2 的训练方式。该模型被评价为一款好模型,报告通过引用推文对外公布。
针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。
小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。
Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。
MiniMax-M2.7 已在 Poe 平台上线,官方称其为面向自主软件工程和智能体工作流的下一代自进化模型,可迭代改进自身的智能体脚手架并在重复运行中优化任务表现。该模型在 SWE-Pro 等真实编码基准上取得较大提升,适用于多文件代码库修改、长周期规划、工具调用、文档自动化和复杂多智能体任务,已在 Poe 全平台应用及 Poe API 开放使用。
Cursor 发布 Composer 2,作者称这是其首个智能真正达到前沿水平的模型,现已可在 Cursor 中使用。作者表示随着算力和预训练加 RL 栈的扩展,后续还会继续推出 Composer 系列模型。
Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。
Midjourney v8 早期预览已在 alpha 站点开放测试。据该推文,新版本原生 HD 模式速度提升 5 倍,文本渲染更好,提示词遵循度更高,并建议搭配个人化和 SREF 使用以获得最佳体验。
OpenAI 的 GPT-5.4-Nano 和 GPT-5.4-Mini 已在 Poe 上线。GPT-5.4-Nano 适合摘要转录、工单标注、内容改写、快速 RAG 问答和运行 @openclaw 流程等对延迟与成本敏感的高频任务;GPT-5.4-Mini 更擅长把杂乱邮件或笔记转成规范 JSON、修复函数、处理异常支持工单,以及需要规划、检查结果并推进下一步的智能体任务。
吴恩达转发并称赞 Inception Labs 的扩散 LLM 推理速度,认为扩散 LLM 是自回归 LLM 之外一条值得关注的替代路线。被引推文中 Stefano Ermon 宣布 Mercury 2 上线,称其为全球首个推理扩散 LLM,性能比主打速度优化的领先 LLM 快 5 倍。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
一段演示显示,速度参照眨眼约 0.4 秒,一本完整小说约 7 秒、Harry Potter and the Goblet of Fire 约 16 秒、一部电影长片剧本约 2 秒、10 万行代码约 38 秒。该演示由 xgo.ing 提供支持。
Midjourney --v 8 即将发布。作者用同一提示词对比 Midjourney(左)与 Nano banana(右)的生成效果,认为 Midjourney 在美学和情感细腻度上明显胜出,能准确还原提示词中"quiet distress""cold, intense stare"等情绪描述。
NVIDIA 发布世界模型 DreamDojo,项目网站 dreamdojo-world.github.io 与论文 arXiv 2602.06949 已上线,代码仓库和模型 ckpts 已在 GitHub 的 NVIDIA/DreamDojo 开放。该项目由 NVIDIA 内部大团队协作完成。
Jim Fan 宣布开源交互式世界模型 DreamDojo,它接收机器人电机控制信号并直接生成像素层面的未来画面,不依赖引擎、网格或人工编写的动力学。模型在 44K 小时人类第一视角视频上预训练,通过从视频中推断的 latent actions 统一动作表示,从而零样本泛化到机器人训练集未见过的物体与环境,之后再针对具体机器人硬件做后训练。
Gemini 3.1 Pro 发布,在多个领域带来阶跃式提升。该模型正在 Antigravity 中推送,作者反馈其在长时间运行的智能体编码任务上表现更好。
Jina AI 推出 Small & Nano 两款小尺寸嵌入模型,针对端侧检索、浏览器内搜索和边缘部署等受限内存场景。模型权重已在 HuggingFace 开放,包含 GGUF 和 MLX 格式,技术细节见配套博客与 arXiv 论文。
Jina AI 的 v5-text 改用 decoder-only 骨干网络与 last-token pooling,取代此前的 mean pooling。每一层 Transformer 注入四个轻量 LoRA adapter,分别独立处理检索、文本匹配、分类和聚类,用户在推理时按需选择;检索场景下 query 加 "Query:" 前缀、文档加 "Document:" 前缀。
Jina AI 发布第五代嵌入模型 jina-embeddings-v5-text,面向 sub-1B 多语言嵌入推进质量与效率边界,提供 small 和 nano 两个版本。该模型已在 Elastic Inference Service、vLLM、GGUF 和 MLX 上线。
Anthropic 发布 Claude Sonnet 4.6,称其是目前最强的 Sonnet 模型,价格与 Sonnet 4.5 相同,智能水平接近 Opus。该版本在编码、计算机操作、长上下文推理、智能体规划、知识工作和设计方面均为全面升级,并在 beta 阶段提供 1M token 上下文窗口。
Qwen3.5 系列的首个开源权重模型 Qwen3.5-397B-A17B 正式发布,采用混合线性注意力与稀疏 MoE,并进行了大规模 RL 环境扩展训练,官方称解码吞吐量相比 Qwen3-Max 提升 8.6 倍至 19.0 倍。
Seedance 2.0 引发关注,有用户称其效果"让人大脑短路"。流传的一段演示显示,用近乎胡言乱语的提示词就能生成大船与爆炸场面。该推文获 260 个点赞、42873 次浏览。
Modal 升级其免费端点为 GLM-5.1,并说明 GLM-5 可经 OpenAI 兼容接口接入 OpenCode、OpenClaw、Claude Code 和 Vercel AI SDK。
Anthropic 联合创始人 Mike Krieger 在 X 上分享最新 Opus 模型的博客链接,并称这是他使用过的体验最好的 Claude 版本。原文未披露该模型的具体能力、版本号或开放范围。
Claude Opus 4.6 发布,官方称它能在数小时内完成开发项目从架构到部署的流程。在 Rakuten,它自主完成了一个 50 人规模组织内 issue 的关闭与分配;在 Harvey,它取得 90.2%,是 Claude 系列模型中 BigLaw Bench 的最高分。
Anthropic 发布 Claude Opus 4.6,标题为 Introducing Claude Opus 4.6,原始内容为 YouTube 视频,正文信息抓取失败,暂无更多细节。
NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。
阿里 Qwen 团队发布 Qwen3-Coder-Next,一款面向编码智能体与本地开发的开源权重模型。其训练使用 80 万可验证任务与可执行环境,在 80B 总参数、3B 激活的规模下于 SWE-Bench Pro 取得较强结果,并支持 OpenClaw、Qwen Code、Claude Code、Cline、浏览器使用等场景。
OpenAI 发布 GPT-5.2,Sam Altman 称这是一款非常聪明的模型,相比 GPT-5.1 已取得长足进步。该推文获得 1171 次点赞、136437 次浏览。