跳到正文

#多模态

今日 10 条
9月28日周一
  1. 甲子光年AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从产品在线到数据产线:阿里云谈制造业如何让经验持续获得复利

    阿里云在云栖大会先进制造AI论坛上提出,制造业正从"产品售出"走向"产品在线",把设备运行数据回流研发与生产,形成数据网络效应。其数据产线覆盖数据接入、知识组织、模型训练、业务执行与反馈回流,并以Qwen、真武AI芯片和阿里云基础设施支撑自主可信、本地化、专业化、生态化"四化"。宁德时代已积累超600TB研发测试数据,覆盖3000万辆新能源汽车和3000个储能电站真实运行数据。

  2. 机器之心SOTA模型AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NaiveAI开源Naive-N0.5-Flash编程模型,美团上线LongCat-2.5-Preview多模态模型

    NaiveAI 以 MIT 许可证开放 Naive-N0.5-Flash 的模型权重与推理代码,该模型面向编程与 AI 研发,采用 MoE 架构,总参数 309B、激活约 15.5B,原生支持 100 万 Token 上下文,FP8 权重约占 315GB。

  3. 沃垠AIAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    即梦上线样片模式:480P草稿升清1080P,实测省38%成本

    即梦AI网页版上线「样片模式」,先用480P生成草稿,再用原生模型升清为1080P成片,480P成本约为1080P的1/8。作者实测一支15s视频,480P抽卡2次加升清合计99元,直接1080P抽卡则需156元,省约38%。

  4. Justine Moore(@venturetwins)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 生成数据中心视频,效果超出预期

    用户让 Opus 5.5 制作一段数据中心主题视频,结果超出其想象。该模型在获得参考视频以及自行调用或生成任意素材的权限后,展现出很强的视频生成能力。

  5. Aravind Srinivas(@AravSrinivas)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Computer 以 High Effort 模式一句话生成 Matterport 级 3D 看房网站

    Perplexity 的 @AskPerplexity Computer 能以单条提示词(High Effort 模式)将一条房产房源转化为可交互探索的 3D 网站,效果对标 Matterport。

  6. NVIDIA AI(@NVIDIAAI)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 与 Meta 合作优化 Muse Realtime Avatar 模型效率

    NVIDIA 与 Meta 团队合作提升了 Muse Realtime Avatar 的模型效率,让虚拟形象在实时对话时能够跟上节奏。Meta 在 Connect 大会上发布 Muse Realtime Avatar,这项实时化身技术将 Muse Realtime Voice 转化为可表达、可交互的虚拟形象,并为 Muse 带来实时对话等全新交互方式。

9月27日周日
  1. cohere(@cohere)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Parse 5 发布:面向常见格式企业文档的最优价格解析方案

    Cohere 推出 Parse 5,主打对常见格式企业文档的最优价格解析,可消化并返回表格、图片、边界框和流程图等内容。该模型由 Cohere 官方账号发布,具体定价与可用方式未在原文披露。

  2. Simon Willison(@simonw)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 用 Claude Opus 5.5 为 Kākāpō 繁殖季演讲制作像素动画

    Simon Willison 在昨天的演讲中提及今年破纪录的 Kākāpō 繁殖季,并用 Claude Opus 5.5 生成了一段像素风动画作为收尾幻灯片。他称 Claude Opus 5.5 在像素艺术动画上表现出意料之外的强能力。

  3. Justine Moore(@venturetwins)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Astra 加 Seedance 2.5,不到 1 小时生成 Finn 的参考视频

    给 Astra 几段参考视频、几张 Finn 的照片和一段性格描述,它便自行生成图像,再经 Seedance 2.5 转成视频,全程不到 1 小时,其中通过 fal 的 API key 调用。作者展示了这次生成的镜头板。

9月26日周六
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 MiMo-V2.6-Pro 按需部署

    Fireworks AI 宣布 MiMo-V2.6-Pro 即日起以按需部署形式提供。该模型在 AA Intelligence Index 上得分为 46,为开源权重模型中最高分,采用 1.02T 总参数、42B 激活参数的 MoE 架构,支持 1M 上下文与多模态,并以 MIT 许可发布,用户可在 fireworks.ai/models 开通端点。

  2. Google AI(@GoogleAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS、Gemini 3.8 Live with Live Avatar 等更新

    Google 本周发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频生成模型,并推出为 Gemini 对话 AI 带来近实时视觉形象的 Gemini 3.8 Live with Live Avatar。

  3. Justine Moore(@venturetwins)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Blender 的智能体将深刻影响媒体制作:Astra 生成场景,经 fal H3 Max 转为 15 秒内写实视频

    fal 的 3D 转视频模型上线 H3 Max,可将最长 15 秒的 Blender 预演转成写实视频,同时保留镜头运动与镜头时序,并支持添加参考图把特定角色和环境带入成片;该模型被称为市面上最快的视频模型,在视频编辑方面排名第一。Justine Moore 让 Astra 制作了人们站在田野中观看 UFO 的场景,反复调整时序与机位后交由 H3 Max 生成写实片段。

  4. Thomas Wolf(@Thom_Wolf)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 让 Opus 5.5 把 Open Alignment 脑暴文档生成视频

    Thomas Wolf 把自己的 Open Alignment 脑暴 Google Doc 交给 Opus 5.5,要求生成一段视频,结果令他意外,直言"这份文档刚才还是一份干巴巴的 Google Doc"。他随后表示希望自己写过的每一份文档都能这样生成视频。

  5. Claude(@claudeai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 帮用户把新床可视化放进孩子房间

    一位用户让 Claude Opus 5.5 帮妻子看看新床放进女儿 Mila 房间的效果,模型直接给出了可视化结果。该帖附带的视频在浏览器中无法播放,帖子获得 410 次点赞、127737 次浏览。

9月25日周五
  1. orange.ai(@oran_ge)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 用 1113 个真实乐高零件设计出可拼装 Microduck

    Opus 5.5 应要求设计了一只可用真实乐高零件拼装的 Microduck,采用 1113 个零件、1:1 实物尺寸,并验证了 3204 处连接、0 碰撞、每步可拼装且重心位于脚部内。它随后生成 141 页、237 步的乐高风格说明书,并在浏览器中为每个零件定价、在 BrickLink 上准备下单。

  2. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    给 Opus 5.5 一个参考视频和新主题,就能复刻解说视频

    用 Opus 5.5 做解说视频,只要把参考视频和新主题交给它,就能复刻一条或模仿参考视频的风格。DreW 用 Claude Opus 5.5 做出了这样一条视频,作者直呼「太逆天了,视频模型瑟瑟发抖」。

  3. Browser Use(@browser_use)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 一条提示词生成产品发布视频,Gregor Zunic 称"视频剪辑师要凉了"

    Gregor Zunic 用一句提示词"照着这个做一条 Browser Use 的发布视频"一次性生成成片,他称自己"被震撼到了",并直言"视频剪辑师要凉了"。该推文获 94 个赞、18327 次浏览。

  4. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 用 JavaScript 逐帧绘制浏览器工作原理动画

    Claude Opus 5.5 用 JavaScript 逐帧绘制了一段卡通风格动画,40 秒讲清浏览器的工作原理。该演示由 Addy Osmani 分享。

  5. orange.ai(@oran_ge)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    海辛用 Opus 5.5 制作中秋拼贴风动画视频

    海辛使用 Opus 5.5 制作了一条中秋节拼贴风动画短片:脚本和音乐由他提供,动画由 Opus 5.5 用 JavaScript 逐帧绘制,手绘纹理采用 p5.js + p5.brush,背景底稿与纸张材质由 Nano Banana Pro 生成,音效则由其用 Node.js 程序合成。他此前对 GPT 6 制作 3D 游戏已感到惊讶,认为 LLM 具备做视频和 3D 的潜力。

  6. Elastic BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic DevRel 9 月通讯:jina-ocr-v1 上线、Elastic CLI 技术预览

    jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。

  7. orange.ai(@oran_ge)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一句话生成产品宣传片:文本模型纯代码做视频,视频 Skill 或被直接吃掉

    Opus 5.5 用一个文本模型、以纯代码方式一句话生成产品宣传片,效果超过此前供应商报价上万的同类片子。这一能力让不少视频 Skill 失去存在必要,被单个模型直接吃掉。

  8. Paul Couvert(@itsPaulAi)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布基于 Qwen-9B 的 9B 多模态模型

    小米发布一款 9B 模型,作者称其基于 Qwen-9B,可在 8GB 内存上运行。该模型采用 MIT 许可证,支持图像与文本多模态,在编码和智能体任务上表现不错,适合在笔记本等统一内存设备上本地离线使用。

  9. Justine Moore(@venturetwins)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    fal GenMedia Conference 2026 开幕,500 位生成式媒体构建者到场

    fal 主办的 GenMedia Conference 2026 开幕,500 名构建者、创作者与领导者到场,讨论 AI 在媒体领域的真实用例。CEO 兼联合创始人 Burkay Gur 开场致辞,现场还设有生成式照相亭等动手演示。

  10. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 在 Gemini 3.8 Live 基础上推出 Live Avatar,把近实时视频生成与语音结合,让对话模型具备带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

  11. 花叔AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    花叔独立做模型后训练,计划开源多模态模型

    花叔正在独立进行模型后训练,目标是训出一个具备多模态能力、且在基本文本分类能力上超越 Jev 的开源模型,算是对小米 Mimo-V2.6 公开训练过程的模仿。他预计次日完成全部训练和开源,届时会在 Hugging Face 和 GitHub 上开源模型,并称无论成败都是有趣的尝试。

9月24日周四
  1. Philipp Schmid(@_philschmid)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash:多模态理解就用 Gemini

    有人推荐多模态理解直接用 Gemini 3.8 Flash,未给出具体参数、基准分数或价格信息。该内容来自一条社交平台帖子,获得 204 个点赞和约 2 万次浏览。

  2. 小米技术AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    雷军:小米18 Pro 系列正式发布,同场推出小米平板9 系列等多款新品

    小米在秋季新品发布会上正式推出小米18 Pro 系列,全系全球首发搭载第六代骁龙 8 至尊版与超级至尊版两款 2nm 旗舰处理器,起售价 5999 元,发布即开售。新机搭载超级像素 2.0 屏幕,支持硬件级防窥与全焦段徕卡三摄,Pro 与 Pro Max 分别配备 7000mAh 和 8500mAh 电池。同场还发布了小米平板9 系列、小米手环11、小米手表S5 41mm 及多款科技家电新品。

  3. Hunyuan(@TXhunyuan)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯 Hy Translation 上线:基于 Hy-MT2,支持 33 种语言与 5 种中国少数民族语言及方言

    腾讯 Hy Translation 正式上线,由 Hy-MT2 驱动,支持 33 种语言以及 5 种中国少数民族语言和方言,提供语音、拍照翻译,并可完全离线在设备端运行、无需联网。该应用已在 12 个国家和地区上线,面向出境旅行、驾车、工作与阅读等场景。

  4. orange.ai(@oran_ge)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 视频克隆技术已能完整复刻爆款视频,人物声音动作均可改

    现在的 AI 视频克隆技术已能完整复刻爆款视频,一条 3 分钟的 "Jev 宣发视频" 被 oneshot 复刻,人物、声音、动作等每个细节都能直接修改。作者认为做爆款视频很难,但改一个要容易很多。

  5. 魔搭ModelScope社区AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国电信开源 TeleOCR:1.2B 参数文档解析模型,登顶 OmniDocBench v1.6 榜单

    中国电信星辰通用人工智能实验室开源 1.2B 参数文档解析模型 TeleOCR,在 OmniDocBench v1.6 取得 96.87 总分登顶榜单,并拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军。

  6. NVIDIA Technical BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 NV-Reason-CT,面向放射科医生链式推理的开放 3D CT VLM

    NVIDIA 发布 NV-Reason-CT,一款面向放射科医生链式推理的开源 3D CT 视觉语言模型。当前通用前沿模型在 3D CT 这类体成像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力。

  7. AI Engineer(@aiDotEngineer)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sarvam 文档模型处理 13 万亿 token 文本,上线四个月数字化 3500 万页

    前沿模型所学习的网页抓取数据中,印度语言内容占比远低于 1%;Sarvam 的文档模型在见到第一张图像前已读取 13 万亿 token 文本,上线四个月即数字化 3500 万页。Perceptron AI 用模型自主决定读取哪些 token,以应对一小时视频约百万视觉 token 中仅约 2% 有真值标注的问题。Meta 则在其三智能体审核流程中过滤大部分视频,压缩相似帧并对热门视频缓存判定结果。

  8. AI Engineer(@aiDotEngineer)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer World's Fair 2026 视觉与 OCR 专场:模型能看见,但还在学习如何观察

    AI Engineer World's Fair 2026 的 Vision & OCR Track 正在直播,核心观点是"模型能看见了,但仍在学习如何观察"。

  9. HeyGen(@HeyGen_Official)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen Muse 完整教程:两分钟设置、7am 提示词,一条回复生成多语言数字人视频

    HeyGen 发布 Muse 的完整操作教程,包含两分钟的 HeyGen 设置流程和一条固定在早上 7 点使用的提示词,只需一次回复即可生成多语言 Avatar 视频。该流程主打让内容在你醒来前就已完成。

9月23日周三
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash 与 Flash-Lite TTS 语音模型

    Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS,称其为新的 SOTA 文本转语音模型。该模型支持全新语音设计体验、2000+ 生产可用音色、语音复制、100 种语言,语音混音功能即将推出,并称在 Hume AI 语音基准上排名第一。

  2. Google AI(@GoogleAI)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款音频模型,支持 100 多种语言的自定义声音以及 2000 多种现成音色。

    为什么值得看

    两款 TTS 模型分别面向高保真创作和实时语音智能体,读者可据此判断配音与语音交互场景的选型方向。

  3. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。

  4. 印记中文AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI周刊 #101:TypeSafe AI 发布 Jev,Qwen-Image-2.1 与 Qwen3.8 Omni Flash 亮相

    TypeSafe AI 公开 System One Model 与 Jev,用 RLCD 训练,单查询 70–500ms 直接输出结构化类型值与校准概率,输入 $0.042/MTok、输出免费。

  5. 网易科技AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国移动展示6G光场全息通信原型系统,无需佩戴设备实现多人面对面交流

    中国移动在2026中国国际信息通信展览会(PT展)上正式展示6G光场全息通信原型系统,无需佩戴任何辅助设备即可重现远端光场。该系统通过采集6个视角实现超百视角光场还原,单视角分辨率接近2K,并将通信时延控制在200ms左右。未来将面向AI+AR眼镜、3D手机平板等终端开展互通研究,推进沉浸式直播、通话及远程医疗等场景落地。

  6. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。