从产品在线到数据产线:阿里云谈制造业如何让经验持续获得复利
阿里云在云栖大会先进制造AI论坛上提出,制造业正从"产品售出"走向"产品在线",把设备运行数据回流研发与生产,形成数据网络效应。其数据产线覆盖数据接入、知识组织、模型训练、业务执行与反馈回流,并以Qwen、真武AI芯片和阿里云基础设施支撑自主可信、本地化、专业化、生态化"四化"。宁德时代已积累超600TB研发测试数据,覆盖3000万辆新能源汽车和3000个储能电站真实运行数据。
阿里云在云栖大会先进制造AI论坛上提出,制造业正从"产品售出"走向"产品在线",把设备运行数据回流研发与生产,形成数据网络效应。其数据产线覆盖数据接入、知识组织、模型训练、业务执行与反馈回流,并以Qwen、真武AI芯片和阿里云基础设施支撑自主可信、本地化、专业化、生态化"四化"。宁德时代已积累超600TB研发测试数据,覆盖3000万辆新能源汽车和3000个储能电站真实运行数据。
NaiveAI 以 MIT 许可证开放 Naive-N0.5-Flash 的模型权重与推理代码,该模型面向编程与 AI 研发,采用 MoE 架构,总参数 309B、激活约 15.5B,原生支持 100 万 Token 上下文,FP8 权重约占 315GB。
即梦AI网页版上线「样片模式」,先用480P生成草稿,再用原生模型升清为1080P成片,480P成本约为1080P的1/8。作者实测一支15s视频,480P抽卡2次加升清合计99元,直接1080P抽卡则需156元,省约38%。
用户让 Opus 5.5 制作一段数据中心主题视频,结果超出其想象。该模型在获得参考视频以及自行调用或生成任意素材的权限后,展现出很强的视频生成能力。
Perplexity 的 @AskPerplexity Computer 能以单条提示词(High Effort 模式)将一条房产房源转化为可交互探索的 3D 网站,效果对标 Matterport。
NVIDIA 与 Meta 团队合作提升了 Muse Realtime Avatar 的模型效率,让虚拟形象在实时对话时能够跟上节奏。Meta 在 Connect 大会上发布 Muse Realtime Avatar,这项实时化身技术将 Muse Realtime Voice 转化为可表达、可交互的虚拟形象,并为 Muse 带来实时对话等全新交互方式。
Cohere 推出 Parse 5,主打对常见格式企业文档的最优价格解析,可消化并返回表格、图片、边界框和流程图等内容。该模型由 Cohere 官方账号发布,具体定价与可用方式未在原文披露。
Simon Willison 在昨天的演讲中提及今年破纪录的 Kākāpō 繁殖季,并用 Claude Opus 5.5 生成了一段像素风动画作为收尾幻灯片。他称 Claude Opus 5.5 在像素艺术动画上表现出意料之外的强能力。
给 Astra 几段参考视频、几张 Finn 的照片和一段性格描述,它便自行生成图像,再经 Seedance 2.5 转成视频,全程不到 1 小时,其中通过 fal 的 API key 调用。作者展示了这次生成的镜头板。
Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。
Google 本周发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频生成模型,并推出为 Gemini 对话 AI 带来近实时视觉形象的 Gemini 3.8 Live with Live Avatar。
fal 的 3D 转视频模型上线 H3 Max,可将最长 15 秒的 Blender 预演转成写实视频,同时保留镜头运动与镜头时序,并支持添加参考图把特定角色和环境带入成片;该模型被称为市面上最快的视频模型,在视频编辑方面排名第一。Justine Moore 让 Astra 制作了人们站在田野中观看 UFO 的场景,反复调整时序与机位后交由 H3 Max 生成写实片段。
Thomas Wolf 把自己的 Open Alignment 脑暴 Google Doc 交给 Opus 5.5,要求生成一段视频,结果令他意外,直言"这份文档刚才还是一份干巴巴的 Google Doc"。他随后表示希望自己写过的每一份文档都能这样生成视频。
一位用户让 Claude Opus 5.5 帮妻子看看新床放进女儿 Mila 房间的效果,模型直接给出了可视化结果。该帖附带的视频在浏览器中无法播放,帖子获得 410 次点赞、127737 次浏览。
Opus 5.5 应要求设计了一只可用真实乐高零件拼装的 Microduck,采用 1113 个零件、1:1 实物尺寸,并验证了 3204 处连接、0 碰撞、每步可拼装且重心位于脚部内。它随后生成 141 页、237 步的乐高风格说明书,并在浏览器中为每个零件定价、在 BrickLink 上准备下单。
用 Opus 5.5 做解说视频,只要把参考视频和新主题交给它,就能复刻一条或模仿参考视频的风格。DreW 用 Claude Opus 5.5 做出了这样一条视频,作者直呼「太逆天了,视频模型瑟瑟发抖」。
Gregor Zunic 用一句提示词"照着这个做一条 Browser Use 的发布视频"一次性生成成片,他称自己"被震撼到了",并直言"视频剪辑师要凉了"。该推文获 94 个赞、18327 次浏览。
Claude Opus 5.5 用 JavaScript 逐帧绘制了一段卡通风格动画,40 秒讲清浏览器的工作原理。该演示由 Addy Osmani 分享。
海辛使用 Opus 5.5 制作了一条中秋节拼贴风动画短片:脚本和音乐由他提供,动画由 Opus 5.5 用 JavaScript 逐帧绘制,手绘纹理采用 p5.js + p5.brush,背景底稿与纸张材质由 Nano Banana Pro 生成,音效则由其用 Node.js 程序合成。他此前对 GPT 6 制作 3D 游戏已感到惊讶,认为 LLM 具备做视频和 3D 的潜力。
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
Opus 5.5 用一个文本模型、以纯代码方式一句话生成产品宣传片,效果超过此前供应商报价上万的同类片子。这一能力让不少视频 Skill 失去存在必要,被单个模型直接吃掉。
小米发布一款 9B 模型,作者称其基于 Qwen-9B,可在 8GB 内存上运行。该模型采用 MIT 许可证,支持图像与文本多模态,在编码和智能体任务上表现不错,适合在笔记本等统一内存设备上本地离线使用。
fal 主办的 GenMedia Conference 2026 开幕,500 名构建者、创作者与领导者到场,讨论 AI 在媒体领域的真实用例。CEO 兼联合创始人 Burkay Gur 开场致辞,现场还设有生成式照相亭等动手演示。
Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。
有人推荐多模态理解直接用 Gemini 3.8 Flash,未给出具体参数、基准分数或价格信息。该内容来自一条社交平台帖子,获得 204 个点赞和约 2 万次浏览。
小米在秋季新品发布会上正式推出小米18 Pro 系列,全系全球首发搭载第六代骁龙 8 至尊版与超级至尊版两款 2nm 旗舰处理器,起售价 5999 元,发布即开售。新机搭载超级像素 2.0 屏幕,支持硬件级防窥与全焦段徕卡三摄,Pro 与 Pro Max 分别配备 7000mAh 和 8500mAh 电池。同场还发布了小米平板9 系列、小米手环11、小米手表S5 41mm 及多款科技家电新品。
腾讯 Hy Translation 正式上线,由 Hy-MT2 驱动,支持 33 种语言以及 5 种中国少数民族语言和方言,提供语音、拍照翻译,并可完全离线在设备端运行、无需联网。该应用已在 12 个国家和地区上线,面向出境旅行、驾车、工作与阅读等场景。
现在的 AI 视频克隆技术已能完整复刻爆款视频,一条 3 分钟的 "Jev 宣发视频" 被 oneshot 复刻,人物、声音、动作等每个细节都能直接修改。作者认为做爆款视频很难,但改一个要容易很多。
中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。
NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。
前沿模型所学习的网页抓取数据中,印度语言内容占比远低于 1%;Sarvam 的文档模型在见到第一张图像前已读取 13 万亿 token 文本,上线四个月即数字化 3500 万页。Perceptron AI 用模型自主决定读取哪些 token,以应对一小时视频约百万视觉 token 中仅约 2% 有真值标注的问题。Meta 则在其三智能体审核流程中过滤大部分视频,压缩相似帧并对热门视频缓存判定结果。
AI Engineer World's Fair 2026 的 Vision & OCR Track 正在直播,核心观点是"模型能看见了,但仍在学习如何观察"。
HeyGen 发布 Muse 的完整操作教程,包含两分钟的 HeyGen 设置流程和一条固定在早上 7 点使用的提示词,只需一次回复即可生成多语言 Avatar 视频。该流程主打让内容在你醒来前就已完成。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。
两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。
TypeSafe AI 公开 System One Model 与 Jev,用 RLCD 训练,单查询 70–500ms 直接输出结构化类型值与校准概率,输入 $0.042/MTok、输出免费。
中国移动在2026中国国际信息通信展览会(PT展)上正式展示6G光场全息通信原型系统,无需佩戴任何辅助设备即可重现远端光场。该系统通过采集6个视角实现超百视角光场还原,单视角分辨率接近2K,并将通信时延控制在200ms左右。未来将面向AI+AR眼镜、3D手机平板等终端开展互通研究,推进沉浸式直播、通话及远程医疗等场景落地。
小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。
作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。