Thinking Machines 研究:LoRA 在何种条件下不逊于全量微调
Thinking Machines 发布研究《LoRA Without Regret》,用 Llama 3 与 Qwen3 系列模型在 Tulu3、OpenThoughts3 数据集的监督微调及数学推理强化学习实验,考察 LoRA 与全量微调(FullFT)的差距。
Thinking Machines 发布研究《LoRA Without Regret》,用 Llama 3 与 Qwen3 系列模型在 Tulu3、OpenThoughts3 数据集的监督微调及数学推理强化学习实验,考察 LoRA 与全量微调(FullFT)的差距。
Thinking Machines 在第二篇 Connectionism 博文中提出 Modular Manifolds,尝试通过对权重矩阵施加流形约束来协同设计神经网络优化器,以提升训练稳定性与性能。该方法从几何角度探索神经网络优化的基本原理,是其迈向更稳定高效训练的一步理论探索。
DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus,在保持原有能力的基础上缓解了中英文混杂与偶发异常字符问题,并进一步优化了 Code Agent 与 Search Agent 的表现。官方称新版本输出效果更稳定,目前官方 App、网页端、小程序与 DeepSeek API 模型均已同步更新,开源版本已在 Hugging Face 和 ModelScope 上线。
Thinking Machines Lab 上线研究博客 Connectionism,首篇文章题为《Defeating Nondeterminism in LLM Inference》。该博客将覆盖从内核数值到提示词工程等研究话题,名称致敬 1980 年代研究神经网络与生物大脑相似性的联结主义学派。
Thinking Machines 发布文章解释 LLM 推理不确定性的真正来源并非浮点并发累加,而是 kernel 缺乏 batch invariance,负载变化导致 batch size 变化进而改变归约顺序。
Sebastian Raschka 发布文章,用纯 PyTorch 从零讲解并实现 Qwen3 的稠密与 Mixture-of-Experts 架构。
FlowiseAI 向自第一天起就陪伴的用户致谢,称是他们塑造了今天的 Flowise。团队表示这段旅程至今精彩,而一切才刚刚开始。
Flowise 宣布已被 Workday 收购。Flowise 表示,加入 Workday 后其让每个人都能构建强大 AI 智能体的愿景将更加强大。
OpenAI 本周发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重模型,这是其自 2019 年 GPT-2 以来首次公开完整的开放权重模型。
Lilian Weng 转发 Mira Murati 声明,Thinking Machines Lab 已获 a16z 领投的 20 亿美元融资,NVIDIA、Accel、ServiceNow、CISCO、AMD、Jane Street 等参投。
单人开发者 Zaid Mukaddam 在没有团队、资金和授权的情况下,做出一款开源 Perplexity 竞品 Scira AI,该项目从周末项目起步,目前已支撑超过 100 万次搜索,月活用户超过 6 万。
DeepSeek 发布 DeepSeek-R1-0528,称在基准性能、前端能力上有提升,并减少了模型幻觉。该版本支持 JSON 输出与函数调用,API 用法不变,模型已在 Hugging Face 开源,可通过 chat.deepseek.com 试用。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
这期播客回顾了扎克伯格从10岁开始编程、高中写出价值100万美元音乐播放器,到创立Facebook的全过程,并梳理了股权稀释、肖恩·帕克与彼得·蒂尔入局、收购Instagram和WhatsApp等关键节点。节目还讨论了信息流广告、假新闻、美国大选中的信息操控,以及扎克伯格转向元宇宙和人工智能的新赛道。
DeepSeek 春节前夕发布的开源推理模型 DeepSeek R1,在数学、代码和推理能力上比肩 OpenAI o1 正式版,同时以极低训练推理成本和完全开源引发全球关注。OnBoard! 邀请 TinyZero 一作、CMU 研究 Long CoT 的研究员及 HuggingFace 资深工程师,从强化学习、Long CoT、infra 和开源角度解析其技术创新与生态影响。
DeepSeek 在开源周第 5 天发布 Fire-Flyer File System(3FS),一个利用现代 SSD 和 RDMA 网络全带宽的并行文件系统。
DeepSeek 开源周第 4 天发布优化并行策略,包括用于 V3/R1 训练中计算与通信重叠的双向流水线并行算法 DualPipe,以及面向 V3/R1 的专家并行负载均衡器 EPLB,并开源了分析 V3/R1 计算通信重叠的代码仓库。
DeepSeek 在 OpenSourceWeek 第 3 天发布 DeepGEMM,一个支持稠密和 MoE GEMM 的 FP8 GEMM 库,已用于 V3/R1 的训练与推理。
DeepSeek 在开源周第二天发布 DeepEP,这是首个面向 MoE 模型训练与推理的开源 EP 通信库。它提供优化的 all-to-all 通信,支持 NVLink 与 RDMA 的节点内和节点间通信,并包含面向训练与推理预填充的高吞吐 kernel、面向推理解码的低延迟 kernel、原生 FP8 dispatch 支持,以及用于计算通信重叠的灵活 GPU 资源控制。
DeepSeek 在开源周第一天发布 FlashMLA,这是面向 Hopper GPU 的高效 MLA 解码内核,针对可变长度序列优化并已投入生产使用。它支持 BF16 和 Paged KV cache(block size 64),在 H800 上达到内存受限 3000 GB/s、计算受限 580 TFLOPS,代码已在 GitHub 开源。
DeepSeek 宣布将于下周启动 OpenSourceWeek,陆续开源 5 个代码库。这些模块已在 DeepSeek 线上服务中完成文档化、部署并经过生产环境实战验证,将每日解锁发布。
DeepSeek 为部署 DeepSeek-R1 给出推荐设置:不使用 system prompt,Temperature 设为 0.6,并公布搜索与文件上传的官方提示词及缓解模型绕过思考的指南。官方部署与开源版本运行同一模型,可获得完整的 DeepSeek-R1 体验。
OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。
DeepSeek 发布 DeepSeek-V3,生成速度达 60 tokens/秒,比 V2 快 3 倍。官方称该版本能力增强,API 保持兼容,并开源模型与论文。
原文给出 DeepSeek-V3 相对 V2 的生成速度提升与开源范围,可用于判断该版本的迭代幅度。
Comfy 中国社区创始团队发起的 Comfy Community Summit 第二站在东京举办,主理人 AJ、前 Stability AI 工程师 Yizhou、HuggingFace 工程师 Tiezhen 与 TheSEA AI 创始人 Yanjin 共同回顾多模态生成与 ComfyUI 开源社区的兴起。
LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。
为比较 FastAPI、FastHTML、Next.js 和 SvelteKit,作者用每个框架各写了一个「Look at Your Data」应用,实现 CSV 上传建表、浏览、改字段、删行、下载的完整 CRUD。
硅谷连续创业者梁胜创办的3家公司累计被收购金额达10亿美金,其2014年创立的 Rancher Labs 融资超9000万美金、2020年以超6亿美金被 SUSE 收购,2022年他又创办 Acorn Labs。
Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。
阿里发布通义千问 Qwen2-72B,表现全面超过 SOTA 的 Llama 3。OnBoard! 播客请到 Huggingface 工程师 Tiezhen Wang、通义千问开源负责人林俊旸、vLLM 主导人李卓翰,畅聊大模型开源生态、Agent 框架与推理基础设施。
Eugene Yan 整理并发布了一份可商用许可的开放 LLM 清单,其中也包含面向代码微调的模型。清单上线两天内收到 8 个 PR,新增了更多模型,并经过讨论加入了上下文字段长度列,还修正了一个实际不具备商用许可的模型。该项目计划继续与社区协作补充数据集与评测。
扩散模型受非平衡热力学启发,通过马尔可夫链在 T 步中向数据逐步加入高斯噪声,再学习逆向过程从噪声重建样本,与 VAE、Flow 模型不同,其隐变量维度与原始数据相同。该框架涵盖 diffusion probabilistic models(2015)、NCSN(2019)与 DDPM(2020)。
自监督学习通过让模型从数据本身生成监督信号,避免昂贵的人工标注,学到的中间表示可迁移到下游任务。图像领域常用前置任务包括对图像块施加平移、旋转、缩放等随机变换构造代理类别,以及整图旋转预测,用 ImageNet 分类准确率衡量表示质量。文中还介绍了对比预测编码、MoCo、SimCLR、BYOL 等方法。