Recraft V4.1 Flash 实测:同一提示词下 1.3 秒出图的排版、时装、插画与品牌设计
Recraft V4.1 Flash 在相同提示词下生成会"变形发声"的文字排版、带硬调编辑光影的金属箔头饰、花中抱膝女孩以及 O 字微笑的 MOKO logo,覆盖排版、时装、插画和品牌设计四类场景,单张出图耗时 1.3 秒且保持 Recraft 风格。完整提示词见评论区。
Recraft V4.1 Flash 在相同提示词下生成会"变形发声"的文字排版、带硬调编辑光影的金属箔头饰、花中抱膝女孩以及 O 字微笑的 MOKO logo,覆盖排版、时装、插画和品牌设计四类场景,单张出图耗时 1.3 秒且保持 Recraft 风格。完整提示词见评论区。
Mimo V2.6 Pro 与 Flash 的测试内容,标题提出其是否为开放权重模型。由于原文正文未能抓取,暂无法提供更多细节。
TypeSafe AI 推出决策模型 Jev 后,开源项目 Laya 作为其开源版非自回归决策模型上线一周左右获得近 2 万个 Star,它不做文本生成,只根据输入文本和问题在几十毫秒内返回结构化答案和概率。
Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。
Qwen-Image-2.1-viggle-turbo v0.2 已在 Hugging Face 发布,支持文生图和图像编辑,仅需 6 步,比 40 步的 Qwen-Image-2.1 模型快约 5 倍。
Recraft 的 V4.1 Flash 模型被 @heathergreen 用于测试油画、报纸拼贴和复古字体三类图像生成,她表示其生成速度之快出乎意料。四张示例图分别为 T-Rex 泡泡浴油画、报纸剪贴拼出 "I AM THAT GIRL"、复古火柴盒风格 Bigfoot 插画以及复古唱片插画,提示词均附在其帖子中。
Anthropic 发问:这个周末你打算用 Opus 5.5 探索什么?这条推文获得 248 个赞、80 条回复和 8.3 万次浏览。
OpenAI 的 luna 模型被严重低估,其智能与成本之比"高得离谱"。该观点来自 Akshay Kothari 的推文,未给出具体参数、benchmark 分数或定价数据。
Claude Opus 5.5 用 JavaScript 逐帧绘制了一段卡通风格动画,40 秒讲清浏览器的工作原理。该演示由 Addy Osmani 分享。
Vercel 在 AI Gateway 以 stealth/pixel-canary 形式上线 Pixel Canary,隐身期内限时免费,该模型擅长编码,包括构建应用、重构代码以及前端开发和移动端应用设计。
小米 MiMo 基础模型权重已在 Hugging Face 上线,同时发布了量化 GGUF 版本,分别托管于 XiaomiMiMo/MiMo 与 bartowski/MiMo 仓库。两个链接均指向 Hugging Face 的模型发布页,方便开发者下载部署。
小米发布一款 9B 模型,作者称其基于 Qwen-9B,可在 8GB 内存上运行。该模型采用 MIT 许可证,支持图像与文本多模态,在编码和智能体任务上表现不错,适合在笔记本等统一内存设备上本地离线使用。
Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,可让 Qwen-Image-2.1 的图像生成与编辑最高提速 6.3 倍,生成或编辑一张图只需 5 步或 8 步,而非原来的 40 步。5 步用于追求最高速度,8 步用于速度与质量的最佳平衡,Hugging Face 上有对应工作流可试用。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Recraft V4.1 Flash 现可通过 OpenRouter 调用,官方称其为市面上最快的图像模型,每张图生成耗时 1.3 秒,价格 $0.007/image。该模型延续 Recraft 在摄影、人像、复杂场景、logo 和早期概念上的表现,面向高并发生成与快速迭代场景。
Recraft 推出 V4.1 Flash,被称作目前市场上最快的图像模型,用户点击生成即可出图。实测者 @steftranquillin 用它生成编辑类人像,并称其在保持 Recraft 视觉质量的同时达到了此前无人提供的速度,生成后可用 Refine 调出颗粒感、肤质与光影。
作者对商汤上线不久的 SenseNova U1 Pro 进行了五大场景实测,覆盖审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合。该模型在 8 月 SuperCLUE-Image 中文文生图榜单总分 93.81 排名第一,复杂信息布局 95.80 分,支持最高 8K 与特殊长宽比输出。
Hugging Face 语音识别和翻译两个分类趋势榜第一分别是网易有道的 Confucius4-R2T2 和 Confucius4-T3PO,前者是 2B 真流式语音识别模型,出了字不再回改,后者是 140 亿参数级实时翻译模型。
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
Opus 5.5 被评价为近期令人惊喜的模型,作者建议从 fabel 5.1 切换过来,称两者能力接近,但 Opus 5.5 便宜很多、速度也快不少。它被认为非常适合长任务 Coding,能像老练工程师一样有条不紊地完成跨仓库迁移、大仓库审计等复杂工作。此外作者称其终于"开始讲人话",上一个让他有此感受的模型是 GPT-6 Astra。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
Anthropic 称 Claude 在噬菌体 DNA 中发现了一个此前未知的酶系统,该酶基因旁有一段类似 CRISPR 的长重复 DNA 序列。团队目前尚不清楚该系统的功能,已知具备类似特征的系统都能剪切、复制和粘贴 DNA;CRISPR 正是这类可编程系统走向基因药物的先例,但弄清该系统的作用并判断能否有类似用途还需更多研究。
Fish Audio 发布 TTS 模型 Drama 3(预览版),称其为目前可控性最强的 TTS 模型。用户可用简单语言描述语气、节奏和角色,无需使用音频标签;支持句子中途切换音色、生成多角色场景,以及只修正单个词。官方还在推文中征集评论 DRAMA 以获取 API key。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布两款新的语音生成模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,号称是目前表达力最强的音频生成模型。这两款模型面向创作者、开发者和企业,可通过 Gemini API 和 AI Studio 试用。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 支持设计带有不同口音和特征的自定义音色;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从用户创建的风格或官方生产级音色库中选择。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,即日起在 Gemini API 和 Google AI Studio 上线,前者随后进入 Gemini Notebook,后者进入 Google Vids,企业版将通过 Gemini Enterprise API 提供。
NVIDIA 开源 Nemotron 3 Diarization 模型,可在实时对话中稳定追踪说话人,并采用商业友好许可。该模型与 Transformers 实现 day-zero 集成,Hugging Face 工程师在测试中配合 Reachy Mini 与运行在 DGX Spark 上的 speech-to-speech 验证了效果,机器人能识别新声音并记住名字。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。
NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。
Nemotron 3 Diarization 在 VoiceArena 首届 Diarization-Bench 结果中位列 12 个系统之首,错误率 14.72%,比第二名低约 24%。榜单同时给出了一段四人对话的对比示例。
Recraft 发布图像模型 Recraft V4.1 Flash,官方称生成一张图耗时 1.3 秒。用户可在模型选择器中选中 Flash 生成图像,再用 Refine 清理细节。
Claude Opus 5.5 在写作能力上迎来大幅升级,表达更自然,并回应了 Opus 5 收到的最常见反馈。它会将最重要的信息前置,并遵循用户给出的写作规则,让长会话更易跟进。
ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。
作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。
Qwen 发布 Benchmark suite,来源为 Qwen 官方账号 @Alibaba_Qwen。该帖互动数据为 2 条回复、0 次转发、46 次点赞、15491 次浏览,数据由 xgo.ing 提供。
Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。
Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。
小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。
作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。