对卷卷的3小时访谈:从抖音到AI 3D、成为制造业OS的野心,以及基础模型不会吞噬一切
数美万物创始人任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍公司最新发布的 Hi3D 3.0 2048³ 模型。他将数美万物的目标从 Maker OS 推向「制造业 OS」,认为基础模型不会吞噬一切——进入实体制造后仍需能产出「生产级」3D 资产的模型,以及拆件、加连接结构、适配材料设备等后续环节。
数美万物创始人任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍公司最新发布的 Hi3D 3.0 2048³ 模型。他将数美万物的目标从 Maker OS 推向「制造业 OS」,认为基础模型不会吞噬一切——进入实体制造后仍需能产出「生产级」3D 资产的模型,以及拆件、加连接结构、适配材料设备等后续环节。
SemiAnalysis 分析韩国主权 AI 布局:2025 年 6 月启动的“独立 AI 基础模型”项目以约 3.5 亿美元预算和每 6 个月淘汰一轮的竞赛方式选拔本土模型,首轮 5 支队伍中 Naver 因使用阿里 Qwen 的视觉与音频编码器被取消资格,Motif Technologies 补位。
GitHub 发明 pull request 已有 18 年,默认一直开放。如今部分头部 AI 原生开源项目开始关闭 PR,因为他们找到了更好的方式。
MCP 于 2026 年 7 月 28 日发布其发布以来最大的一次修订,协议核心改为无状态:initialize 握手和 Mcp-Session-Id 头被移除,每个请求自带协议版本与客户端上下文,首个消息即可直接发起工具调用,任一 server 实例都能响应。
Qdrant-FineWeb-10B 已在 Hugging Face 上线,号称最大的开源向量检索基准数据集。该数据集包含 10B 篇 FineWeb 文档、gte-multilingual-base 生成的稠密与稀疏向量,向量规模 24.47 TB,文本与元数据 28.66 TB,并为 120,000 条查询提供精确 top-1,000 真值。
腾讯混元介绍 Hy4 preview 在 AI 研究中自主发现推理瓶颈,通过算子融合与通信优化将端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型为 770B 参数、49B 激活、1M 上下文,已开源并登陆 HuggingFace 与 GitHub。
Z.ai 通过微调前代 GLM-5.2 推出旗舰模型 GLM-5.3,总参数 7530 亿、每 token 激活 400 亿,输入最多 100 万 token、输出最多 128,000 token,速度每秒 90 token。
以独立测试数据对比 GLM-5.3 与 Kimi K3、Claude Opus 5 等模型,并呈现开源权重网络安全争议中双方的实际依据。
Dify 正式推出全新 Agent 体验,Agent 不再只是 Workflow 或 Chatflow 中的执行节点,而是拥有独立模型、指令、技能与工具配置,可独立构建、调试、发布和管理,并通过 Web App、API 或 Workflow 接入业务场景。
2026 上海开源软件应用创新大赛启动,Dify 作为企业合作伙伴参与,赛事以「开源向实」为主题设置 AI+工业软件、智算云、开源 AI 工具三大赛道。报名及作品提交截止 2026 年 10 月 11 日,线下总决赛于 10 月 24 日在上海举行,总奖池累计 100 万元,含现金、算力与 Token、大模型 API 等资源。
关于 AI 时代后的游戏开发路径,a16z 的 Andrew Chen 认为只有两条路:three.JS 或世界模型。他引用数据称 three.js 每周 npm 下载量达 1500 万次。
混元 Hy4 preview 自 2026 年 8 月 28 日在 WorkBuddy 首发接入后调用激增,上线首日即出现任务队列排队,腾讯混元已对 Hy4 preview 推理集群紧急扩容并动态调配资源。
MiniMax 将 H3 Max 768P、H3 Max 480P 接入开放平台和 MiniMax Design,该模型生成 5 秒 768p 音视频不到 3 秒,15 秒视频约 15 秒完成,吞吐量约为 MiniMax H3 的 35 倍。
H3 Max 把 5 秒 768p 音视频生成压进 3 秒内,读者可据此理解实时直播这类新场景的门槛变化与并发限制。
在支付宝年度生态大会的闭门圆桌上,蚂蚁集团 CEO 韩歆毅、千问事业部总裁吴嘉、吉利首席工程技术科学家任向飞以及 OPPO 唐凯、vivo 周围五位高管,围绕 Agent 商业化关键元年讨论了流量漏斗向意图放大器的转变、终端从应用入口变为意图入口,以及跨端协同与开放生态的利益信任难题。
腾讯混元开源 Hy4 preview,采用 Apache 2.0 许可,总参数 770B、每 token 激活 49B,支持 1M 上下文,并自带用于投机解码的原生 MTP 层。
Mind Lab 研究员逯雨鑫以个人开发者身份,用 2 周和数百美元后训练出两个小模型,两次登顶 Hugging Face Model Trending 榜首。他没有 AI Lab 经历,也非 AI PhD,走的是蒸馏与 SFT 路线,认为最大卡点是数据和 Capacity Gap。他同时讨论了主权 AI、Personal Intelligence 与 Local AI 的普及门槛。
腾讯混元发布 Hy4 preview,该模型采用 770B 总参数、49B 激活参数,支持 1M 上下文,并在 SWE-bench Pro 上领先。官方称这是其迄今测得的最大代际提升,并给出在 Cline 中通过 npm i -g cline、/model 选择 Hy4 preview 的试用步骤。
NVIDIA TensorRT Model Connect 提供参考实现集合,用两条命令即可将开放模型从 checkpoint 部署到 NVIDIA TensorRT 推理,无需针对模型单独编写转换、预处理、后处理和运行时代码。该方案支持在原生 C++ 中运行受支持的模型。
Fish Audio 在 iOS 版之后上线 Android 版语音工作室,把桌面端完整功能搬到手机。该应用提供 200 万以上声音、80 多种语言的多说话人对话,支持用开放式标签直接控制情绪,以及克隆自己的声音或凭一句提示词设计声音。
Ollama 正在上线 GLM-5.3,提供私有、快速、美国和欧洲托管、不留存数据的服务,并推出云端版本 GLM-5.3-Flash 供试用。
GLM-5.3 在 Ollama 上线并提供云端 Flash 版本,读者可了解在 Claude Code 等工具中的接入方式与开源权重入口。
腾讯混元发布新一代模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,属 MoE 架构,相比上一代强化了多步骤 Agent、代码开发和生产力任务能力。
AI 能回答问题依靠三种机制:参数机制把人类知识拆成 token 并训练出权重(如 GLM 5.3 的 7440 亿个参数),推理机制补出参数里没记的知识,联网机制则通过 Agent 或应用框架搜索前两者都无法得到的知识。
Anthropic 表示,开源 MHS 之前还有更多需要学习的地方,原因是 LLM 从文本和图像中学习物理世界,仍缺乏物理直觉。该研究预览版将用于构建更多安全评估,并加强对 AI 在物理世界中应用的防护。
Weaviate 1.39 发布,Boost API 和 MMR 多样性选择两个搜索功能转为 GA,前者可在查询时上调或下调结果排序且不丢弃任何结果,后者用于混合搜索和向量搜索中避免首页结果重复。
智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。
文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。
LangChain 的 Managed Deep Agents 和 LLM Gateway 进入公开测试:前者可用一条命令把 Deep Agent 部署到托管 LangSmith 运行时,内置持久化执行、沙箱与追踪;后者为智能体提供成本控制、速率限制、模型回退和敏感数据处理。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
LightSeek Foundation 的 TokenSpeed 已对 Qwen 3.8 Flash Next 实现 Day 0 支持,覆盖 GDN + Qwen Sparse Attention 混合架构、门控残差连接和 N-gram embedding。其中 N-gram embedding 还支持 FP8 精度。LightSeek 表示将持续优化,作为 Qwen 4 的预览。
Lex Fridman 发布与 DHH 的第二轮对谈,全长 5 小时,覆盖 AI 智能体编程、软件的未来形态、AI 对开源的影响、Omarchy Linux 发行版、vibe coding 与智能体工程之争、手动编程的终结、最适合 AI 编程的模型与工具链、AI 视频生成与电影制作,以及 Linux 将赢得桌面等话题。节目在 X 上完整放出,其他平台同步上线。
Inkling-Small 被用于把论文摘要转成快速、有用的总结,该模型以开放权重方式提供,并与开放科学理念结合。相关帖子获得 86 条评论、63 次转发、407 次点赞和 166733 次浏览。
LangChain 发布 State of AI 2024 报告,基于 LangSmith 每月近 3 万新增用户的使用数据。OpenAI 仍是最常用的 LLM 提供商,使用量是第二名 Ollama 的 6 倍以上,Ollama、Groq 首次进入前五,开源模型提供商合计占前 20 名的 20%。
LangChain 迎来首版 Python 包发布两周年,从最初的 langchain 开源库发展为包含 LangGraph、LangSmith 三款产品的公司。
LangChain 创始人 Harrison Chase 发文回顾项目三年历程,并宣布完成 1.25 亿美元融资、估值 12.5 亿美元,用于扩展智能体工程平台 LangSmith 与开源贡献。
LangChain 宣布以 12.5 亿美元估值完成 1.25 亿美元融资,由 IVP 领投,红杉、Benchmark、Amplify 等老股东跟投,CapitalG 与 Sapphire Ventures 为新投资方。
Unsloth AI 宣布 Qwen3.8-Flash 可本地运行,这个 125B MoE 模型通过 Unsloth GGUF 只需 75GB RAM,并称其性能超过 Claude-Opus-4.6(Max)。Qwen3.8-Flash-Next 面向 CPU RAM 与统一内存配置,可提供接近 VRAM 的速度,官方同时给出了使用指南和 GGUF 权重链接。
Qwen 发布 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重,API 上线 QwenCloud。
Qwen3.8-Flash 以 1/9 训练成本超越前代,并作为 Qwen4 架构的早期预览开放权重,可据此观察下一代架构取向。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
Z.ai 发布 GLM-5.3-Flash,原生多模态、支持 100 万 token 上下文窗口,模型规模为 320B-A18B,以 MIT 许可证开放权重,此前以 Ox Alpha 为名预览并完全运行在中国 AI 芯片上。
从公开定价、上下文窗口和 MIT 开源许可三个维度,可以判断这款模型对日常任务的成本影响。
智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。
Qwen 宣布 Qwen3.8-Flash-Next 当天即可通过 SGLang 部署,并对 SGLang 的 day-0 支持表示感谢。
vLLM 宣布在发布首日即支持阿里 Qwen3.8-Flash-Next,并已在 NVIDIA 和 AMD GPU 上验证。