实测小米 MiMo V2.6:Pro、Flash、Pro-UltraSpeed 三个版本发布
小米发布 MiMo V2.6 系列,包含 Pro、Flash 和 Pro-UltraSpeed 三个版本,其中 UltraSpeed 输出速度最高可达 Pro 的 20 倍。
小米发布 MiMo V2.6 系列,包含 Pro、Flash 和 Pro-UltraSpeed 三个版本,其中 UltraSpeed 输出速度最高可达 Pro 的 20 倍。
Jina AI 开源端到端文档解析模型 jina-ocr-v1,总参数 3.4B、每 Token 仅激活 570M,在 OmniDocBench v1.6 得 91.14 分、olmOCR-Bench 得 83.4 分,均刷新同级别最佳成绩。
小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。
Slack 推出 Code Channels 功能,把“多人协作 AI”带入团队聊天,让开发者和编码智能体在同一频道内协同工作。Slack GM Rob Seaman 在 Stack Overflow 播客中表示,与编码智能体的多数交互会变成孤立的上下文,而开发者与智能体共处的群聊能把写代码和代码审查压缩成一个步骤。他还认为 Slack 频道可能比终端更适合作为开发环境。
腾讯混元 Hy Image3.5 preview 已在 ComfyUI 上线,单模型同时支持文生图与图生图,最高可输出 2K 分辨率。官方称其人类评估胜率较 Hy Image3.0 提升 30%,支持多语言文字、符号与小字号渲染,覆盖电影、漫画、商业摄影和插画风格,并能在场景、服装和风格变化中保持人物身份与产品特征。
Hy Image3.5 preview 已在 ComfyUI 开放使用,单模型同时支持文生图与图生图,最高 2K 分辨率,人类评测胜率较 Hy Image3.0 提升 30%。该版本可正确渲染多语言文字、符号与小字,覆盖电影、漫画、商业摄影和插画风格,并在场景、服装与风格变化中保持人物身份与产品特征一致。
2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。
OpenAI 称要让 OpenAI API 在每个价位点都提供最佳模型,并在文本、代码、图像、视频等每种模态上做到最好,希望用户基于此提出好想法并构建产品。该表述未给出具体的模型名称、版本号或发布时间。
一条 Claude 提示词要求用 Blender 重建 1906 年 4 月 17 日下午的旧金山市场街,从 Ferry Building 到 Fifth Street,涵盖 Palace Hotel、Call Building、Chronicle Building、Lotta's Fountain 和 Emporium。
Opus 5.5 的 3D 建模与视觉能力增强后,可从单条提示词(prompt)直接构建完整场景。演示中用它在 Blender 还原出 1906 年地震前、符合历史细节的旧金山 Market 街。
Opus 5.5 现在能在 claude.ai 中用单条提示词调用 Blender 制作黏土动画。该演示由 Alex Albert 在 X 上发布,视频展示了从提示词到动画成品的完整流程。
小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。
原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
第七届小米黑客马拉松于 9 月 22 日在北京小米科技园颁奖,284 支队伍报名、近千名选手参与,现场 149 支队伍进行 48 小时极限开发。本届首次开设高校赛区,覆盖北京大学、武汉大学、香港中文大学等 94 所高校,并新增"最佳 MiMo 应用奖",3 个项目获奖,分别探索智能家居服务、独居老人主动关怀和 AI 陪伴硬件。
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。
小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。
MVLAND 上线「深度创作模式」,可先分析歌曲的节奏、情绪与结构,再生成剧情分镜,并支持一首 MV 同时选用最多 5 个角色。实测制作两分钟古风 MV 共拆出 38 个镜头,默认生图模型为 MV image 2.5 Sunburst,导出 720P 视频,全程约 1 小时、花费约 2500 积分,音乐分析、故事与分镜提示词环节免费。
WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。
阿里巴巴在云栖大会推出 Logics-Parsing-V3 开源文档解析模型,通过循环滑动窗口与结构状态传递处理跨页内容,解决表格截断、文本割裂和标题层级错位问题。
阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态,权重已上传 Hugging Face。Artificial Analysis 数据显示其在 Intelligence Index 上得分 46,超过前代 MiMo-V2.5-Pro 的 26,位列开源权重模型首位。
小米开源 MoE 多模态模型,公开权重、定价与第三方指数对比,可据此判断开源与闭源的成本差距。
ElevenLabs 发布 Studio 4.0,支持团队协作编辑:用户可对单个片段或素材直接发表评论,反馈集中留存而不再散落在多个独立讨论线程中。
ElevenLabs 在 ElevenCreative 中推出 Studio 4.0,其 AI 原生视频编辑器迎来一次重要升级。用户可以在项目内生成视频、图像、语音、音乐和音效,并在同一处完成剪辑、加字幕和导出。
Fish Audio S2.1 Pro 现已上线 Runway。Runway 称这是其迄今最大规模的一次模型更新,同期引入的还有 MiniMax H3 Max、Cartesia Sonic 3.6 以及 Flux Video upscaler 和 edit,与 Runway 自有及其他前沿实验室的模型一同提供。
Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。
Science 刊发阿里巴巴达摩院通用医疗影像模型 DAMO RADAR 论文,针对腹部增强 CT,同一模型可识别 18 个腹部器官上的 146 种病症,突破一病一模限制。
Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。
火山引擎推出 AI MediaKit 理解式视频编辑引擎,以自研 ReFM(残差式流匹配)为视频生成修复主干,通过多模态语义理解区分后期叠加文字与场景固有文字,再以 4 步采样完成无痕擦除。该方案支持 50 多种语种的文字擦除,并已构建覆盖文字检测、多模态判断、视频修复与结果校验的完整流水线,支持长视频连续处理与原规格交付。
作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。
小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。
Yann LeCun 重申"自回归 LLM 本身不会通向人类级 AI"依然成立,理由包括当前推理依赖非自回归搜索、自我改进仅在数学和代码等可自动评分的领域有效、多模态助手多用独立训练的编码器。
阿里 Qwen 的 Qwen-Image-2.1 在 vLLM-Omni 获得 day-0 支持,可在同一模型内生成、编辑并输出透明背景图像。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,安装方式与支持的组合已发布在 vLLM recipes 页面。
Qwen-Image-2.1 支持多种图像编辑任务,并在各项任务间平衡性能表现。给定三视图角色参考图后,该模型可生成完整故事板。
作者分享用 GPT-6 Astra、Meshy 和 Blender 把个人 IP 夕小瑶做成 3D 手势交互网页的完整流程,网页已上线可体验。
MiniMax 发布六个全球合作案例,涵盖新加坡 Singtel AI Pass 上线 MiniMax Agent、海螺 AI 和 MiniMax Audio,东京发布 MiniMax H3 IP 版,以及 Genspark 基于 MiniMax M3 后训练出 PPT 模型 Gen-1 Slides。
阿里 Qwen 发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在忠实度、流畅度和简洁度上有所提升,并将 60 种语言的平均延迟(LAAL)从 2.8s 降至 2.3s。
Pika 发布 Camera Director 应用,上传一个镜头即可获得多种其他机位角度的画面,现已在新的 Pika 平台上线。Pika 将自身定位为面向创作者打造、由创作者共建的 AI 创意平台,强调简洁、全面,并以满足严苛标准的内容输出为目标。
Pika 发布 Camera Director 应用,可对任意场景进行多角度重拍——上传一段片段,即生成一整套替代视角选项,同时保持原场景的运动与表演。该功能属于 Pika 新推出的 AI 创意平台,Pika 称其面向创意工作者、追求满足严苛标准的输出。
作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。