跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精选

第 1–8 条 · 共 8 条
10月9日周五
  1. 爱范儿AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Surface Laptop Ultra 与 Windows 混合智能更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。

    为什么值得看

    梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。

  2. Satya Nadella(@satyanadella)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软为 Windows 引入本地智能体与 MAI-Code-1.1 Flash 编码模型

    微软宣布为 Windows 带来不计量使用的智能能力,让每台 PC 成为智能体可安全代劳的场所。亮点包括 137B 参数、256K 上下文窗口的编码模型 MAI-Code-1.1 Flash。

    为什么值得看

    微软把编码模型放到 PC 本地运行,并让 Copilot 在设备上接管工作,读者可据此判断端侧智能体的落地方式。

8月27日周四
  1. 阿里研究院AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Flash 多模态 MoE 模型并开源 Next 权重

    阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

    为什么值得看

    官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。

8月14日周五
  1. Paul Couvert(@itsPaulAi)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源 Qwen3.8-27B 多模态模型,27B 参数对标 Opus 4.6 Max

    阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。

    为什么值得看

    原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。

8月5日周三
  1. 字节跳动SeedAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线

    字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。

    为什么值得看

    字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。

8月3日周一
  1. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 正式开源通用视频模型 MiniMax H3

    MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。

    为什么值得看

    H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。

6月9日周二
  1. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。

    为什么值得看

    Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。

2月25日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 团队训练 42M 模型 SONIC 控制人形机器人全身动作并开源

    NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。

    为什么值得看

    42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。