TinySR:面向真实世界图像超分辨率的轻量级扩散模型
浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。
浙江大学 AiXM 课题组、vivo BlueImage Lab 与之江实验室提出轻量级扩散模型 TinySR,用于真实世界图像超分辨率。它通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE 轻量化、移除时间与提示模块及 pre-caching 优化推理,相比教师模型 TSD-SR 最高提速 5.68 倍、参数量减少 83%、MACs 降低 84%。
腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。
暗涌Waves独家获悉,国产GPU公司曦望Sunrise再获新一轮20亿元融资,投后估值约200亿元;今年4月其完成杭州资本领投的超10亿元融资、估值破百亿,不到半年接近翻倍。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
Unsloth AI 宣布 Qwen3.8-Flash 可本地运行,这个 125B MoE 模型通过 Unsloth GGUF 只需 75GB RAM,并称其性能超过 Claude-Opus-4.6(Max)。Qwen3.8-Flash-Next 面向 CPU RAM 与统一内存配置,可提供接近 VRAM 的速度,官方同时给出了使用指南和 GGUF 权重链接。
腾讯混元把主打端侧的翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 两套极低比特量化方案压缩到几百 MB,翻译质量接近无损。
Qwen 3.8 27B 在 Artificial Analysis 上取得 52 分。作者指出,这是首次有能在笔记本本地运行的模型基本与最强的模型持平,本地且开放权重的模型已足以完成多数日常任务。
阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。
原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。
Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。
Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。
Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。
Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。
少数派创始人老麦在播客《三五环》中回顾从 Palm、WebOS 时代的 BBS「煮机网」,到创立少数派并跑通「内容+产品」商业闭环的二十年历程。他提到 WebOS 被惠普放弃后曾组织用户为开发者捐款,后因与罗永浩「不打不相识」的转折关闭煮机网。面向 AI 时代,他认为 AI 眼镜、录音戒指等专用设备将分担手机功能,语音交互与第一人称视角记录会成为个人助手的新入口。
工程师使用 Antigravity 完成赛道上的快速代码迭代与实时遥测流水线,多智能体任务由 Agent Development Kit(ADK)管理。Gemma 4 在 Pixel 10 TPU 上本地运行,提供零延迟的即时语音指导提醒并支持离线推理。
赛车手在弯道中无法看屏幕,该应用改用 Text-to-Speech(TTS)提供即时语音反馈。视觉仪表盘则用 Jetpack Compose 构建,在高负载下流畅渲染空间指标而不掉帧。
Google 开发者专家社区将整套技术栈迁移到边缘端,构建了一个离线 AI 赛车教练,可即时处理实时赛车遥测数据,无需依赖云端。该方案面向 100 mph 时速下的实时 AI 场景,相关技术细节已公开。
Google 团队将 Pixel 10 通过定制 USB 装置直接接入赛车车载网络,绕开赛道上不可靠的蜂窝信号。Python 脚本把数百个物理传感器的 10 Hz 遥测数据流直接拉到手机上,作为数据获取的第一步。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。
字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。
Mistral 发布 Shieldstral,一个 3B 开源权重的内容安全模型,可在设备端部署。官方给出 mistral.ai/news/shieldstral 链接,未披露更多能力细节。
腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。
MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。
H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。
Granola 已在 Apple Watch 上线 AI 会议记录应用,发布者称这是全球首个登陆 Apple Watch 的 AI 会议记录器,最早于去年 8 月推出。TechCrunch 于 7 月 28 日报道了该应用。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把现有 CUDA 内核知识适配成 Apple Silicon 内核。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时感知。团队用 DINOv2 嵌入微调轻量检测模型 RF-DETR,并用 SAM 自动标注训练数据,从而获得实时 360 度环境感知与自适应物体检测。DINOv3 作为通用“视觉大脑”,支持自然语言加图像查询机器人环境,该功能已集成进首个原型并准备进入真实场景测试。
MagenticLite 的 4B 模型可在设备端以 57% 运行,搭配 MagenticBrain 与 MagenticLite 的 Quicksand 沙箱后,浏览器任务、文件和数据的处理全程不离开本机。
Google 宣布首批 Android Gemini Intelligence 功能开始向三星折叠屏设备推送。任务自动化能力扩展到 40+ 常用应用,覆盖购物、餐厅预订、旅行和购票等日常事务。
Genspark 推出首款硬件产品 SecondBrain Note,一款厚度 2.95 mm、重 26 g 的卡片式 AI 语音录音器,售价 $179(首发 9 折),可放入卡夹或贴在手机背面。它支持 5 米以上远距离拾音、最长 35 小时录音,按一次即可将会议自动转成笔记并存入 SecondBrain。Genspark 表示后续还有系列硬件产品在路上。
Hugging Face 进行了一场名为 Local AI 201 的直播,标题与链接均指向 x.com 的广播页面。原文未披露直播涉及的具体模型、参数或技术细节。
AI 数据中心争夺芯片与存储产能,成本压力正向手机、电脑等消费电子传导,换机周期被拉长。极客公园靖宇与怒喵科技李楠、《屠龙之术》庄明浩及作者 Alan 探讨,堆配置、打价格战的增长方式逐渐失效,中端品牌最先承压,而 AI 手机被迫加速成熟去催促换机。嘉宾认为黑胶、拍立得等小众硬件回潮,小团队反而更可能做出新硬件形态。
Hugging Face 将于本周二举办本地 AI 主题活动,邀请 Ahmad Osman、Mike Bradley 讲解硬件配置与本地推理,并做现场演示。Alex Ocheema 与 0xSero 将分享如何按硬件选模型、模型压缩及 REAPs。
Ambi 正式开放内测,主打软硬结合、多端、实时交互的 AI 产品,让 AI 走进环境而非异步互动。其未公开功能 Sidekicks 提出 Attention Loop 逻辑,即 Attention-Listen(see)-Think-Act,让用户同时带着一群 AI 在场。内测期间软硬结合部分暂以 apple watch 上的 app 替代,官方称只能达到其硬件理想态约 30% 的效果。
阶跃星辰在 WAIC 2026 展区(H1 馆 C107)展出大模型原生智能体手机 STEPX Neo,搭载全球首个智能体原生操作系统 Step AOS,内置智能体阶跃Amoo,为首批通过《人工智能终端智能化分级》L3 级别测试的智能体手机。
阶跃星辰将在 WAIC 2026 展出 Step 系列模型矩阵,覆盖云端与端侧、多模态理解与生成,并带来号称全球首个智能体原生操作系统的 Step AOS。获本届 WAIC“镇馆之宝”的智能体手机 STEPX Neo 首次线下公开亮相,同时联合吉利、千里科技升级汽车智能体并上线极氪 8X。展位为上海世博展览馆 H1 馆 C107。
腾讯混元发布旗舰级 295B 模型 Hy3 的 1-bit 与 4-bit 版本,可在单 GPU 上部署。该模型支持通过 llama.cpp 运行并开启 MTP,在更低硬件门槛下获得强大智能,相关 benchmark 与下载链接已放出。
37signals 创始人 David Heinemeier Hansson 称新款 Dell XPS 系列彻底改变了他对 Dell 个人电脑的看法,他已把 XPS 14 当作主力机使用数月,上周又入手了 XPS 13。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
英伟达 RTX Spark 以 1 Petaflop 算力和 128GB 统一内存,让消费级 PC 本地跑 120B 至 200B 参数大模型成为可能,端侧 AI 硬件就位。
Stanford EE 博士 JY 创办的 Vocci 推出了一枚钛金属、3 克重、防水的 AI 戒指,他主张不做"AI 硬件"而做"AGI 配件"。他在这期播客中分享了"配件"而非"硬件"的产品定位、月费心理门槛、融资经历,以及硬件研发量产与工程卓越的思考。Vocci 官网为 vocci.ai,并为听众提供 $30 折扣码 AVOCADOVOCCI,有效期至 2026 年 7 月 29 日。
Birgitta Böckeler 近期实测用本地 LLM 完成部分编程任务,并梳理出影响其可行性的多项因素。相关备忘已发布在 martinfowler.com。
Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。