Microsoft 推出 GigaPath-Flash 与 GigaTIME-Flash 病理基础模型
Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。
Microsoft 发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型,采用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S 主干,并以 Apache 2.0 许可开源。
GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60,在开源权重模型中并列第一。其整体智能提升完全来自对 GLM-5.2 的微调,而非训练新的基础架构,通过在长时间运行的软件工程环境中训练,模型涌现出网络安全能力,在 CyberGym 上得分 84.5%。
腾讯混元 Hy4 preview 支持生成 SPIDER-MAN 图像,人人都能上手。该预览版由 xgo.ing 提供支持,官方推文未披露模型参数、上下文长度或开放方式等细节。
腾讯混元开源 Hy4 preview,采用 Apache 2.0 许可,总参数 770B、每 token 激活 49B,支持 1M 上下文,并自带用于投机解码的原生 MTP 层。
腾讯 Hy4-preview 发布预览权重,并已在 vLLM 的 day 0 支持,在 NVIDIA GPU 上完成验证。
腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。
腾讯混元发布 Hy4 preview,该模型采用 770B 总参数、49B 激活参数,支持 1M 上下文,并在 SWE-bench Pro 上领先。官方称这是其迄今测得的最大代际提升,并给出在 Cline 中通过 npm i -g cline、/model 选择 Hy4 preview 的试用步骤。
腾讯混元 Hy 4 preview 已在 OpenCode Go 上线,规格为 770B/49B、1M 上下文,面向编程智能体场景打造。
Midjourney 更新 V8.2 编辑模型以提升图像质量。若用户在过去 24 小时内遇到问题,可重新尝试并继续反馈。官方表示后续还有更多更新。
Gemini Omni 1.1 Flash 现可让你从视频结束的位置继续延展,把在 Gemini 中创作的视频无缝接续,构建连贯、动态的故事线。该功能由 Gemini App 官方账号公布。
Google 发布两款面向转写和语音识别的新模型 Gemini 3.5 Transcribe 与 Gemini 3.5 Transcribe Live。前者用于转写已录制音频,支持说话人归属和词级时间戳;后者用于构建实时语音应用。
Ollama 上线 glm-5.3-flash 模型页面,用户可通过 ollama.com/library 查看该模型信息。该模型页链接已在社交平台发布,帖文获得 34 个点赞和 2 次转发。
Google DeepMind 正在推出 Gemini Omni 1.1 Flash,目标是让生成视频具备更高的可控性、更快的迭代速度,并更精细地适配生产级使用。官方表示可在 Flow by Google 等入口试用,并附有详情链接 goo.gle/4zHEzJ2。
腾讯混元 Hy4 preview 已在 WorkBuddy 上线,并在研究、Office 任务、前端开发和游戏开发等真实智能体工作流中完成测试,可跨文件分析 Excel 与 PPT 排版,并根据自然语言指令构建可玩原型。Hy4 preview 在 WorkBuddy 上免费开放两周,Hy3 则免费至 9 月底。
腾讯混元发布新一代模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,属 MoE 架构,相比上一代强化了多步骤 Agent、代码开发和生产力任务能力。
Midjourney 宣布当天开始测试其首个 V8.2 编辑模型。该模型支持按指令编辑、用其他图片生成图像(最多 4 张参考图)、基于笔刷的 inpainting 和 outpainting,并可与 personalization、moodboards 和 srefs 配合使用。
Arena.ai 公布,腾讯混元 Hy4 preview 在 Code Arena WebDev 榜单以 1633 分(AutoEval)位列约第 5,较 Hy3 整体第 31 名提升 115 分;在开源模型中排约第 3,Hy3 当时为第 7。
腾讯发布 Hy4 preview,总参数 770B、激活参数 49B、上下文窗口 1M,定位生产力场景并采取开源路线,主打一致且可负担的价格。官方同时给出博客、Hugging Face 与 GitHub 链接,并邀请用户反馈使用中遇到的问题。
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,已开源并在腾讯云 TokenHub、OpenRouter 上线,可在 WorkBuddy/CodeBuddy、元宝、ima 等产品体验。
腾讯混元发布 Hy4 preview 并开源,770B 总参数配 1M 上下文,可与 GLM-5.3、Kimi K3 的盲测结果横向比较。
Google DeepMind 推出 Gemini Omni 1.1 Flash,面向视频生成与编辑的多模态模型,已在 Replicate 上线。该版本支持首尾帧插值、延长场景、添加视频输入参考、最高 4K 放大,并可用 360p 快速验证创意。
Google Omni 从首次发布到将用户喜爱的 Veo 功能融入 Omni 模型,经历了大量工作。团队表示未来 Omni 版本还有更多内容正在打磨,并继续征求反馈。
Google 发布 Gemini Omni Flash 1.1,这是对其 anything in, anything out 世界模型的更新。新版本支持 360p 草稿与 4K 上采样、延长时最多 10 秒视频上下文、以 10 秒为单位递增的视频延展,以及视频参考功能。
Google AI Studio 推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧和末帧、以 360p 更高效地草稿视频,并可放大到 4K 分辨率,还支持在多模态输入中加入视频参考。该模型现可通过 Gemini API 和 AI Studio 使用。
Google 发布多模态模型 Gemini Omni 1.1 Flash,用于视频生成与编辑。该模型加入来自 Veo 的创作控制能力,支持 4K 超分、首尾帧控制和 360p 快速草稿。官方称最大升级是场景延展:可基于原视频 10 秒上下文延展场景,而 Veo 为 1 秒,从而提升一致性与长片叙事的连贯性。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供生成式视频的创作控制能力,通过 Gemini API 和 Google AI Studio 使用。
智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。
文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。
Qwen3.8-Flash 的 API 已在 QwenCloud 上线,原生上下文 262K,可扩展至 1M。定价为输入 $0.15/1M tokens、输出 $0.47/1M tokens、缓存命中 $0.016/1M tokens,官方称该价格面向规模化使用。
Qwen3.8-Flash 已在 OpenRouter 上线,一次 API 调用即可支持编程助手、智能体工作流和长视频理解。该模型为多模态推理模型,面向代码库与文档分析、桌面交互、图表和长视频等场景。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
LightSeek Foundation 的 TokenSpeed 已对 Qwen 3.8 Flash Next 实现 Day 0 支持,覆盖 GDN + Qwen Sparse Attention 混合架构、门控残差连接和 N-gram embedding。其中 N-gram embedding 还支持 FP8 精度。LightSeek 表示将持续优化,作为 Qwen 4 的预览。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
Google 发布一款新模型,该模型已在 Google 多项产品体验中投入使用,并成为其 Gemini Audio 产品组合的又一关键组成。相关内容发布在 Google 官方博客。
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,支持智能转写、函数调用和实时流式传输,转写更精确(WER 更低)。该模型还支持自定义词表、多说话人识别,并覆盖超过 85 种语言。
Google 推出两款 Gemini 转录模型:Gemini 3.5 Transcribe 用于转录录音,支持说话人归属和词级时间戳;Gemini 3.5 Transcribe Live 用于构建实时语音应用。
Google 发布转录模型 Gemini 3.5 Transcribe,支持 85+ 种语言的语境感知语音转文字,可自动过滤填充词并格式化非结构化语音。该模型还能结合屏幕上下文执行语音指令,把杂乱的语音输入和本地文件转成邮件草稿。
Google AI Developers 发布 Gemini 3.5 Transcribe,一款号称能理解代码库的语音转文字模型。官方演示中,该模型可过滤口语中的犹豫停顿,并针对当前上下文精确还原技术术语、文件名和代码变量;它通过视觉偏置为复杂开发者工作流引入屏幕感知上下文,演示场景为在 Antigravity 中构建。
Google 发布 Gemini 3.5 Transcribe,可让应用理解用户语音与意图,并支持多说话人场景。该模型开箱即可自动检测 85 种以上语言,并提供针对专业术语的自定义词表适配。API 现已在 Google AI Studio 和 Gemini Enterprise 上线,也可在 macOS 的 Gemini 应用或 Android 的 Rambler 中试用。
Google DeepMind 发布 Gemini 3.5 Transcribe,定位为面向精准、智能转写的最新语音转文本模型。官方称其可实现精确且智能的转录,具体参数、支持的语种与上线方式尚未在公告中披露。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为迄今最精确的语音转文本模型,可将原始音频直接转为准确、格式化的文本。
Unsloth AI 宣布 Qwen3.8-Flash 可本地运行,这个 125B MoE 模型通过 Unsloth GGUF 只需 75GB RAM,并称其性能超过 Claude-Opus-4.6(Max)。Qwen3.8-Flash-Next 面向 CPU RAM 与统一内存配置,可提供接近 VRAM 的速度,官方同时给出了使用指南和 GGUF 权重链接。