跳到正文

#开源生态

今日 26 条
5月6日周三
  1. Martin Fowler(@martinfowler)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 碎片:开源提示词模式框架、音乐人起诉 Google 诽谤、Apple 重新思考 AI 支出

    Martin Fowler 的 Fragments 合集提到一个面向提示词模式的开源框架,并收录了音乐人起诉 Google 诽谤、Apple 重新思考 AI 支出、本地运行 LLM,以及"Genie 是否会陷入焦油坑"等话题。以上内容以链接摘要形式汇集于 martinfowler.com/fragments。

5月4日周一
  1. Modal BlogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 用单个 Python 字典将 SGLang 多模态推理性能提升超 10%

    Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。

5月2日周六
  1. Demis Hassabis(@demishassabis)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 谈 AGI 缺失环节、记忆难题与 AlphaFold 之后的下一个突破

    Demis Hassabis 在 Y Combinator 的 How to Build the Future 节目中与 Garry Tan 对话,讨论通往 AGI 还缺什么,并指出记忆问题至今仍未解决。他还谈到 AlphaGo 如何影响 Gemini、小模型为何越来越强、持续学习与 AI 智能体的未来,以及从 AlphaFold 走向虚拟细胞。他建议创始人思考在 AGI 到来之前该构建什么。

4月29日周三
  1. 哔哩哔哩技术AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站基于NVIDIA开源驱动的GPU隔离方案:BGM内核模块如何做显存与算力隔离

    B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。

  2. Modal BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 Modal 上构建基于强化学习的定理证明工作流

    AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。

4月27日周一
  1. 43 TalksAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    组织的坍塌!AI 时代群体协作的进化 | 43 Talks

    43 Talks 沙龙邀请拾象科技 Cage、词元共振小七姐、ListenHub 创始人 Orange、AI 艺术家歸藏,探讨 AI 时代组织形态的进化。Cage 观察到硅谷出现 The Great Flattening,传统中层「翻译」职能被 LLM 挤压;小七姐的团队从 6 人进化为 12 个「人机对」,产品上线不到一周营收突破 1 万美金。

4月24日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,提供 1M 上下文

    DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。

    为什么值得看

    DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。

  2. Hugging Face(@huggingface)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。

  3. 语言即世界language is worldAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话罗福莉:OpenClaw触发AI范式巨变,Agent时代1T基座只是入场券

    小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。

  4. DeepSeek(@deepseek_ai)AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 正式发布并开源,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。

  5. DeepSeekAI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布并开源 DeepSeek-V4 预览版,标配 1M 上下文

    DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。

    为什么值得看

    官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。

  6. Node.js BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Node.js 2026 伦敦协作峰会回顾:v27 起版本号对齐年份、新 Streams API 落地 v25.9.0

    Node.js 2026 年首届协作峰会在伦敦由 Bloomberg 主办,40 余人到场。会上宣布新发布计划:从 Node.js v27 起版本号将对应首次 Current 发布年份,以减少并行发布线数量。新 Streams API 已进入 Node.js 核心,并作为实验特性随 v25.9.0 发布,采用 async iterables 与显式背压策略。

4月22日周三
  1. Jina AIAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 创始人肖涵:2026 年做搜索就是做 Agent Memory

    Elastic 全球副总裁、原 Jina AI 创始人兼 CEO 肖涵在 Elastic 中国 AI 搜索技术大会上演讲,认为 2026 年做 AI 搜索基本就是在做智能体记忆,并指出记忆表征、选择性遗忘和跨模型迁移是当前未解决的问题。

4月20日周一
  1. Hugging Face(@huggingface)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K2.6,主打开源编码与长时程 Agent

    月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。

    为什么值得看

    K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。

4月18日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sebastian Raschka 分享理解 LLM 架构的工作流

    Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。

4月17日周五
  1. 宝玉的分享AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?

    黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。

  2. Taranjeet(@taranjeetio)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 开源:token 高效智能体记忆现可生产级低成本运行

    mem0 现已支持在生产规模上低成本运行智能体记忆,且不牺牲质量,该方案主打 token 高效。mem0 为开源项目。

4月15日周三
  1. David Heinemeier HanssonAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有了 AI,Linux 让电脑真正变得可塑

    AI 正在让开源软件变得真正可改:用户即便不懂代码,也能给本地开源应用加功能、做成自用分支。David Heinemeier Hansson 认为,这股能力用在操作系统上更关键——只有 Linux 能改菜单栏、窗口管理器和通知系统,Windows 与 macOS 的核心归厂商所有。他已在 Omarchy 社区看到非技术用户用 AI 定制系统。

4月10日周五
  1. Andrew Ng(@AndrewYNg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 新课:用 SGLang 实现高效的文本与图像生成推理

    Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。

4月8日周三
  1. Qunar技术沙龙AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 Demo 到上线:去哪儿如何让数字人直播真正“跑起来”

    去哪儿酒店团队用 FFmpeg + RTMP 推流、开源流媒体服务器 SRS 搭建数字人直播底座,通过 GOP 设为 50、开启 min_latency 低延迟模式并配合前端预加载,把端到端延迟从 10 秒降到 3 秒、实现首屏秒开。SRS 单进程可扛数千路并发,Origin 节点用 forward 功能一路转推抖音、视频号、淘宝等多平台,并支持 SIGUSR2 热升级与推流端双活容灾。

4月5日周日
  1. Andrej Karpathy(@karpathy)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 点赞 Farzapedia:用个人 Wiki 文件让 AI 了解你

    Andrej Karpathy 称赞 Farzapedia 是个人 Wiki 式 AI 个性化的好例子:记忆以显式、可浏览的 wiki 文件形式存在,用户能清楚看到 AI 知道什么。数据存于本地、采用 markdown 与图片等通用格式,可自由接入 Claude、Codex、OpenCode 等任意 AI,甚至用于微调开源模型。

4月4日周六
  1. Hugging Face(@huggingface)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    llama-server 部署 gemma-4-26b-a4b-it-GGUF 并接入 openclaw

    用户可通过 llama-server -hf ggml-org/gemma-4-26b-a4b-it-GGUF:Q4_K_M 启动模型,再用 openclaw onboard --non-interactive 以 custom-api-key 方式完成接入。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等推出 CaP-X:面向机器人 coding agent 的开源框架与基准

    NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。

  2. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 CaP-X:让智能体在真实机器人上运行

    Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。

  3. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实验:少量微调即可提升推理模型 CoT 可控性

    METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。

  4. 宝玉的分享AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 源码泄漏,但先别急着写源码分析

    Claude Code 源码泄漏后,宝玉不打算写源码分析,而是分享学大型开源项目的四步法:先跑起来、从单个功能点切入、动手做二次开发、最后从零搭建。他指出泄漏的 50 多万行代码只是 source map 还原结果,缺脚手架和私有 package,无法直接运行。Anthropic 的 Boris 回应称问题出在本应自动化、却仍人工操作的部署环节,未归咎或开除任何人。

  5. Andrew Ng(@AndrewYNg)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:反 AI 联盟正用战争、环境、失业与儿童议题制造公众恐慌

    吴恩达警告反 AI 联盟正筛选更能煽动公众的叙事来拖慢 AI 进展。一项英国机构的大型研究发现,"AI 将导致人类灭绝"的说法基本失效,但 AI 战争与环境议题更能引发共鸣,失业和儿童受害则是驱动人们行动的信息。他同时指出,大型 AI 公司借"AI 危险"论阻挠开源项目自由分发,实质是监管俘获。

3月28日周六
  1. 宝玉的分享AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    飞书开源 lark-cli,AI Agent 时代为什么都做命令行工具

    飞书开源命令行工具 lark-cli,让 AI Agent 直接操作飞书完成发消息、查日历、写文档、建多维表格、发邮件和管理任务。作者认为 CLI 相比 API 和 GUI 更适合 Agent,因为它可自描述(--help 即可了解能力)且以文本交互;CLI、MCP 与技能三者分工不同,CLI 干活、MCP 在不支持终端的环境中是唯一选择、技能相当于给 Agent 的说明书。

3月27日周五
  1. Hugging Face(@huggingface)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chroma 开源 20B 参数搜索智能体 Context-1

    Chroma 推出 Chroma Context-1,一个 20B 参数的搜索智能体,模型权重已在 Hugging Face 发布。官方称其推进了智能体搜索的 pareto 前沿,速度提升一个数量级、成本降低一个数量级,并以 Apache 2.0 协议开源。

3月26日周四
  1. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布开源权重语音模型 Voxtral TTS

    Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。

  2. 宝玉的分享AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在中国 AI 生态圈摸底两周,投资人看到了什么

    Delphi Ventures 创始合伙人 José Maria Macedo 在走访中国 AI 创始人、VC 和上市公司 CEO 两周后,表示自己更看好中国硬件、更看衰软件。

3月25日周三
  1. Andrej Karpathy(@karpathy)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 汇总 litellm 供应链投毒事件:2112 个包依赖,PyPI 暴露窗口 46 分钟

    Andrej Karpathy 整理 litellm 供应链投毒事件的资料清单,指出共有 2112 个包依赖 litellm,其中 1403 个为直接依赖,包括 DSPy、Open Interpreter、PraisonAI、MLflow、langchain-litellm 等。

3月24日周二
  1. QdrantAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 推出多向量搜索课程,从 ColBERT 到 ColPali 实战

    Qdrant 上线免费进阶课程 Multi-Vector Search Course,由 Kacper Łukawski 设计,面向已掌握向量搜索基础的 ML、后端与搜索工程师。

  2. Junyang Lin(@JustinLin610)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    林俊旸点评 UNI-1:成绩不错,但更希望开源

    针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。

3月22日周日
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    现代 LLM 注意力变体视觉指南:MHA、GQA 与滑动窗口注意力

    Sebastian Raschka 发布 LLM 架构画廊,收录 45 个架构并配可视化模型卡,同时推出 Redbubble 海报版。文章借此梳理现代开源权重模型中的注意力变体,从标准多头注意力(MHA)讲起,示例架构包括 GPT-2、OLMo 2 7B 和 OLMo 3 7B,并延伸到分组查询注意力、滑动窗口注意力等概念。

3月21日周六
  1. Aman Sanger(@amanrsanger)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 的 Composer-2 以 Kimi k2.5 为基座并经 CPT 与 RL 训练

    Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。

3月20日周五
  1. Poe(@poe_platform)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax-M2.7 上线 Poe,面向自主软件工程与智能体工作流

    MiniMax-M2.7 已在 Poe 平台上线,官方称其为面向自主软件工程和智能体工作流的下一代自进化模型,可迭代改进自身的智能体脚手架并在重复运行中优化任务表现。该模型在 SWE-Pro 等真实编码基准上取得较大提升,适用于多文件代码库修改、长周期规划、工具调用、文档自动化和复杂多智能体任务,已在 Poe 全平台应用及 Poe API 开放使用。

3月19日周四
  1. Next.js BlogAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 16.2 发布:next dev 启动提速约 400%,新增 AI 与 Turbopack 改进

    Next.js 16.2 发布,next dev 启动速度提升约 400%,服务端组件渲染提速 25%–60%,并包含 200 多项 Turbopack 修复与改进。

3月16日周一
  1. 语言即世界language is worldAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话谢赛宁:逃出硅谷,杨立昆与他的 AMI Labs 要做"反向的 OpenAI"

    杨立昆与谢赛宁等人创立的世界模型公司 AMI Labs 仅 25 人、无产品,便完成 10.3 亿美元 Seed 轮融资,投前估值 35 亿美元,创欧洲历史最大 Seed 轮。总部设在巴黎,并在纽约、蒙特利尔、新加坡设研发中心,刻意避开硅谷。谢赛宁称"硅谷已深陷 LLM、被它催眠",公司要做"反向的 OpenAI",通过全球联盟共建世界模型。

3月13日周五
  1. Hugging Face(@huggingface)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face Builders 全球申请启动

    Hugging Face 面向全球开放 Hugging Face Builders 申请,面向热爱开源 AI、擅长组织社区活动的人,邀请其成为 Builder 并牵头本地社区。该计划此前已显现全球需求,官方同步放出项目介绍与申请入口。