Fireworks 发布基于 Kimi K3 的专用模型 Ember-1
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,该酶基因旁有一段类似 CRISPR 的长重复 DNA 序列。团队目前尚不清楚该系统的功能,已知具备类似特征的系统都能剪切、复制和粘贴 DNA;CRISPR 正是这类可编程系统走向基因药物的先例,但弄清该系统的作用并判断能否有类似用途还需更多研究。
Fish Audio 发布 TTS 模型 Drama 3(预览版),称其为目前可控性最强的 TTS 模型。用户可用简单语言描述语气、节奏和角色,无需使用音频标签;支持句子中途切换音色、生成多角色场景,以及只修正单个词。官方还在推文中征集评论 DRAMA 以获取 API key。
Google AI Studio 上线新体验,配套成本低于此前的 3.1 Flash TTS 模型。该推文由 Logan Kilpatrick 发布,并附有 Google 官方博客链接供进一步了解。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google AI Studio 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,称是目前表现力最强的音频生成模型。模型面向创作者、开发者和企业,用于生成更丰富的音频体验,可通过 Gemini API 和 AI Studio 试用。
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 发布,支持语音复刻与用提示词设计新音色,并可逐行指定风格。官方称其在 Hume Voice Design Benchmark 排名第一,并在 6 种语言的 Voice Arena 登顶;复刻只需 30 秒音频,语音库可按语言、口音、性别、音高和角色筛选。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。
NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。
Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。
Recraft 推出 V4.1 Flash,称其为市面上最快的图像模型,生成一张图仅需 1.3 秒。该模型可在模型选择器中选用,生成后点击 Refine 即可清理细节、优化画面。
Claude Opus 5.5 在写作能力上迎来大幅升级,表达更自然,并回应了 Opus 5 收到的最常见反馈。它会将最重要的信息前置,并遵循用户给出的写作规则,让长会话更易跟进。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。
Qwen 发布 Benchmark suite,来源为 Qwen 官方账号 @Alibaba_Qwen。该帖互动数据为 2 条回复、0 次转发、46 次点赞、15491 次浏览,数据由 xgo.ing 提供。
Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。
Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。
小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。
作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。
小米发布 MiMo V2.6 系列,包含 Pro、Flash 和 Pro-UltraSpeed 三个版本,其中 UltraSpeed 输出速度最高可达 Pro 的 20 倍。
Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。
同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较
Jina AI 开源端到端文档解析模型 jina-ocr-v1,总参数 3.4B、每 Token 仅激活 570M,在 OmniDocBench v1.6 得 91.14 分、olmOCR-Bench 得 83.4 分,均刷新同级别最佳成绩。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款覆盖理解、生成、交互与创作。
腾讯混元 Hy Image3.5 preview 已在 OnSolo 上线并免费开放两周,会员可免费使用。该预览版面向短剧角色设定图、全动态游戏素材和关键帧,支持 5 张参考图与 2K 画质,角色可在各集间保持一致,编辑时只需局部精修而无需重做。
Claude Opus 5.5 在默认 effort 设置下即可取得前沿结果,每任务成本仅为其他模型的一小部分,常常击败以最高设置运行的模型,输出速度比 Opus 5 快 30% 以上。有观察者据此认为它把 fable 和 astra 都比了下去。
Genspark 宣布 GPT-6 Sol 和 GPT-6 Luna 已在其 AI Chat、Code Agent 和 Claw 中上线。OpenAI 表示这两款模型基于 GPT-6 Astra 的技术,定位更快、更便宜,面向规模化工作场景;同时提升了缓存和推理效率,Sol 与 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。
Genspark 同步接入 GPT-6 Sol 与 Luna,可看到新模型接入第三方平台的速度和降价幅度。
腾讯混元 Hy Image3.5 preview 已在 ComfyUI 上线,单模型同时支持文生图与图生图,最高可输出 2K 分辨率。官方称其人类评估胜率较 Hy Image3.0 提升 30%,支持多语言文字、符号与小字号渲染,覆盖电影、漫画、商业摄影和插画风格,并能在场景、服装和风格变化中保持人物身份与产品特征。
Hy Image3.5 preview 已在 ComfyUI 开放使用,单模型同时支持文生图与图生图,最高 2K 分辨率,人类评测胜率较 Hy Image3.0 提升 30%。该版本可正确渲染多语言文字、符号与小字,覆盖电影、漫画、商业摄影和插画风格,并在场景、服装与风格变化中保持人物身份与产品特征一致。
Qwen-Image-2.1 成为 Image Edit Arena 和 Text-to-Image Arena 的双料第一开源模型。其在 Image Edit Arena 拿下 1367 分,位列开源模型榜首,总榜排名第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 仅差 3 分。该模型由阿里 Qwen 团队推出,现已开放试用。
Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。
Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。
Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。
作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。
OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。
GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 采用了与 Astra 类似的训练方法,能力更强、对齐更好、价格更低。
梳理了 GPT 6 全系列更新与同日 Opus 5.5 降价的对比,可看两家同日的价格与能力变化。
Opus 5.5 在 PDF 表格解析基准 ParseBench 上得分 93.9%,比 Opus 5 提升 7% 以上,超过 Fable、Gemini 和 Astra。其表格质量与 LlamaParse Agentic Plus 相当,但在图表、格式和版面处理上仍有不足,每页成本 5.8 美分,作为生产级 OCR 方案偏贵。完整结果见 parsebench.ai。
Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。
同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。
最新一轮 Next.js 评测结果出炉,Opus 5.5、GPT 6 Sol 和 Fable 5.1 均以 97% 并列第一,Grok 4.7 以 94% 位列其后。值得注意的是,Grok 4.7 的价格比其他模型便宜 2 到 7 倍。
Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。