跳到正文

#开源生态

今日 25 条
7月18日周六
  1. Yann LeCun(@ylecun)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:Linux 与互联网的"不可治理性"正是其成功原因,开放权重 AI 基础模型也将如此

    Yann LeCun 表示,Linux 和互联网的"不可治理性"与开放性正是它们成功的原因,开放权重 AI 基础模型也将如此。该帖获 3365 次点赞、410 次转发、18.1 万次浏览。

  2. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:各国要求 AI 主权,开放权重基础模型将不可避免成为 AI 主导形态

    Yann LeCun 澄清自己从未说过政府会把「自家模型作为数字公共基础设施」,只说过世界各国政府 REQUIRE AI 主权。他同时表示,开放权重基础模型将不可避免(INEVITABLY)成为 AI 的主导形态。

7月16日周四
  1. Dify(@dify_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 与 AMD 联手举办 AI DevMaster Hackathon,用可视化编排构建 Agentic AI 项目

    Dify 与 AMD 合作举办 AI DevMaster Hackathon,开发者可用 Dify 的可视化编排处理推理、规划、工具调用与记忆,通过插件节点接入外部能力,并用 Knowledge Pipeline 构建本地知识检索。本地推理部署与性能调优由 ROCm 在 AMD Radeon GPU 上完成,活动现已开放报名。

  2. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan:开源模型与配套框架正迎来高光时刻

    Sriram Krishnan 认为开源模型与配套框架正迎来高光时刻:如今可以凭借清晰的训练谱系追上接近 SOTA 的性能,如 thinkymachines 的 Inkling 今日发布。

  3. Junyang Lin(@JustinLin610)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布多模态模型 Inkling,全量权重开放但小模型未开源

    Thinking Machines 发布多模态模型 Inkling,可跨文本、图像和音频模态高效推理,全量权重已开放,并可在 Tinker 上微调。林俊旸(@JustinLin610)对此表示称赞,同时追问小模型为何没有开源。

  4. 张小珺Jùn|商业访谈录AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对Physical Intelligence柯丽一鸣4小时访谈:Pi的开源模型研究,机器人的江湖、族谱与主角

    硅谷机器人公司Physical Intelligence(Pi)研究员柯丽一鸣在访谈中详解了Pi在机器人大脑上的开源模型研究脉络,从π0到π0.5再到π*0.6。她主要负责强化学习方向研究,也是Pi核心论文作者之一,节目中聊到了机器人的江湖、谱系、门派与主角。访谈还涉及π0.7,其强调统一模型、无需后训练即可媲美以往后训练的通用能力。

  5. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    David Siegel 撰文谈开源 AI

    Richard Stallman 的 MIT 同办公室同事、金融与科技界传奇人物 David Siegel 发表了一篇关于开源 AI 的文章,原文链接指向 siegelendowment.org。该推文由 Marc Andreessen 转发推荐,获得 233 次点赞和 5 万余次浏览。

  6. Lilian Weng(@lilianweng)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 发布开放权重模型 Inkling

    Thinking Machines 推出开放权重模型 Inkling,定位为在广泛能力类别上表现扎实的基础模型,可用于实际使用与定制。Inkling 能跨文本、图像和音频模态高效推理,官方公开完整权重,并已在 Tinker 上开放微调,同时提供 Inkling Playground 供试用。

  7. Hugging Face(@huggingface)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 发布新的开源权重模型

    Hugging Face 宣布发布新的开放权重模型,未披露具体模型名称、参数规模与性能数据。

7月15日周三
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Marc Andreessen 称开放权重是 AI 智能体安全最大隐患

    Marc Andreessen 转发讨论并表态,认为开放权重是当前 AI 智能体安全与信任面临的最大问题,且没有明显的缓解方案。他提到 David Kaplan 几周前也写过开放权重相关问题。

  2. Modal BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 的 Inkling 上线 Modal

    Thinking Machines 发布通用多模态模型 Inkling,接受文本、图像和音频输入并输出文本,Modal 提供 Day 0 支持,以按 token 计费的 Managed Endpoint 形式上线。

7月14日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 的 Fragments:FOSD 讨论涉及 harness engineering、自托管模型与宏大叙事

    Martin Fowler 发布新一期 Fragments,汇总 FOSD 上关于 harness engineering、自托管模型、宏大叙事和"bringing rocks"的讨论。文中还涉及用 fable 省钱、开发者教育的黯淡前景、Electron 是否还有未来,以及交互性专长与贡献性专长等话题。

7月13日周一
  1. Next.js BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next.js 公布安全版本发布计划,首个定期安全版本将于 7 月 21 日发布

    Next.js 将安全修复转为正式的定期发布计划,每月提前在官方博客预告发布时间与最高漏洞严重等级,紧急或已被利用的漏洞仍走临时补丁。首个计划内安全版本定于 2026 年 7 月 21 日发布,包含 Next.js 16.2 和 15.5 的补丁版本,修复 4 个高危和 5 个中危漏洞。

  2. Interconnects AI — Nathan LambertAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开放模型只剩 6 个月:蒸馏与前沿能力两条监管线正在逼近

    Nathan Lambert 认为开放权重模型正面临迄今最严峻的监管考验,多项信源提到白宫正在讨论通过新行政令管理开放模型,但尚无官方信息,可能只影响中国来源模型与政府用途。

7月10日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 TRACE:让智能体自我训练补齐能力短板,Qwen3.6-27B 在 SWE-bench Verified 达 73.2%

    Stanford AI Lab 提出智能体自我改进方法 TRACE,让模型自己找出失败背后的缺失能力并针对性自我训练。TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,超过体量更大的 Codex 5.2 和 GLM 5,并以不到 1/4 的训练 rollout 击败 GRPO 和 GEPA。

  2. Taranjeet(@taranjeetio)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    openmemory v2 发布:开源 CLI 支持跨 Codex、Claude Code 和 OpenCode 迁移编码会话

    Taranjeet 发布 openmemory v2,一个开源 CLI,用于在 Codex、Claude Code 和 OpenCode 之间迁移编码会话,让上下文随模型走。作者提到 GPT-5.6 正在 Codex 中逐步上线,并引用 OpenAI 消息称 GPT-5.6 家族模型 Sol、Terra、Luna 开始在 ChatGPT、Codex 和 API 中推出。

  3. Andrew Ng(@AndrewYNg)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:保护开源 AI 是"无需许可创新"的关键

    Andrew Ng 引用 Adam Thierer 的《Permissionless Innovation》一书,主张创新不应事先向政府申请许可,保护开源 AI 是其中关键部分。Thierer 警告美国 AI 治理正走向非透明、零散的模型审查流程,若形成"限制至许可"的默认规则,开源模型将难以合规。

7月9日周四
  1. HelloGitHubAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MonkeyCode 开源云端 AI 开发平台,支持一条命令私有化部署

    国产团队 AI Coding 平台 MonkeyCode 将其线上运营的 AI 开发平台代码完整开源,GitHub 地址为 github.com/chaitin/MonkeyCode。

7月8日周三
  1. QdrantAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测反超 Elastic DiskBBQ:2 倍吞吐、一半延迟、约三分之一算力

    Qdrant 用相同数据集复现 Elastic 的 DiskBBQ 基准,在 recall@100 约 0.96 时,3 节点 2 vCPU/8 GB 配置下跑出 67.2 QPS、59.5 ms 平均延迟,吞吐约为 Elasticsearch(32.4 QPS、122.6 ms)的 2 倍,延迟减半。

7月6日周一
  1. Import AI — Jack ClarkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 464:Fable 编写 GPU kernel、AI 自动化与模拟计算

    Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。

7月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队发布 ASPIRE:机器人用技能库实现持续学习

    Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。

  2. Jim Fan(@DrJimFan)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 发布 ASPIRE:让机器人拥有自我进化的 /skills 技能库

    Jim Fan 发布 ASPIRE,为机器人提供可自我进化、持续累积的技能库,让智能体观察仿真与真实机器人的多模态感知轨迹,对控制程序做进化搜索,并把最佳经验蒸馏进不断扩张的库中。

6月30日周二
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 在 Playground 推出 WeCommerce 电商搜索演示,融合 BM25、向量与混合检索

    Weaviate 在 Playground 中搭建了电商搜索演示 WeCommerce,把关键词、语义与混合检索整合进同一套产品发现流程。用户输入关键词、情绪或氛围后,查询会分别走 BM25 关键词检索、向量语义检索和混合检索,并支持按品类、品牌、价格的实时分面筛选;商品页还用近邻向量检索自动推荐相似商品。

6月29日周一
  1. HelloGitHubAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 123 期:llmfit、tolaria、text-to-cad 等 31 个开源项目

    HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。

  2. AI at Meta BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Brain2Qwerty v2,非侵入式脑电实时解码词准确率达 61%

    Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。

  3. Interconnects AI — Nathan LambertAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    最新开放模型盘点:Zyphra、Cohere、Poolside 扩展生态广度

    最新一期开放模型盘点收录了 Zyphra 的 ZAYA1-74B-preview、Cohere 的 command-a-plus-05-2026-bf16 与 Poolside 的 Laguna-M.1。

6月27日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用开源工具和开放权重模型搭建本地编码智能体

    Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。

6月26日周五
  1. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月25日周四
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 1.38 发布:HFresh 与 MCP Server 正式 GA

    Weaviate 1.38 发布,磁盘向量索引 HFresh 与 MCP Server 两大能力正式 GA,前者面向十亿级频繁变动数据,低内存、延迟可预测且无需周期性全量重建,后者可让 LLM、IDE 和 AI 智能体直连 Weaviate;1.38 还支持运行时开关 MCP Server 及写权限,无需重启。

  2. Hugging Face(@huggingface)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    欢迎来到开源 AI:在本地运行你自己的模型

    Hugging Face 发布"Welcome to Open Source AI: Run Your Own Models Locally",主题是在本地运行开源 AI 模型,内容以 X 平台直播形式呈现。该帖获得 346 次点赞、55 次转发和约 5.1 万次浏览。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenThoughts-Agent-v2 在所有训练集规模上领先,跨七个 Agentic benchmark 泛化

    OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。

6月24日周三
  1. Modal BlogAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal Auto Endpoints 如何用投机解码实现 SOTA 推理延迟

    Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。

  2. Ian Goodfellow(@goodfellow_ian)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ian Goodfellow:Aisle 早于 Mythos 用 LLM 找漏洞,小而开源的模型加结构化搜索已具备竞争力

    Ian Goodfellow 指出,在 Mythos 带火用 LLM 挖掘漏洞之前,Aisle 就已开展同类工作。从工程角度看,一个小规模开源权重模型配合结构化搜索系统,在这项任务上已具备竞争力;Stanislav Fort 称其团队用广泛可得、开源衍生的模型在公开 CVE 零日漏洞上与 Mythos 打平,必要时可离线运行,并称伯克利研究在 8 个类别中的 3 个将其评为全球第一。

6月23日周二
  1. Modal BlogAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布 Auto Endpoints:一条命令部署自托管 LLM 推理

    Modal 推出 Auto Endpoints,一条命令即可部署兼容 OpenAI API 的生产级 LLM 推理服务,代码、指标和部署过程对用户可见可控。该服务支持 GLM 5.2 等开放模型,默认给出经调优的推理配置,并提供 TTFT、ITL、投机解码接受长度等引擎级指标及自动扩缩容。Modal 同时为超低延迟路由推出 Modal Servers,称 HTTP 请求开销可低至 5ms。

  2. Replicate(@replicate)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里巴巴 Happyhorse 1.1 上线 Replicate,支持文本、图像与参考视频生成

    阿里巴巴 Happyhorse 1.1 已在 Replicate 上线,提供文本、图像和参考视频三种生成模式,支持多语言唇形同步与原生音频。该模型支持 720p 和 1080p 分辨率,参考视频生成(r2v)最多可使用 9 张参考图像。

  3. Replicate(@replicate)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里巴巴 happyhorse 模型上线 Replicate

    阿里巴巴的 happyhorse 模型现已上线 Replicate,可通过 replicate.com/alibaba/happyhorse 试用。该模型由 Replicate 平台发布,具体参数与功能细节尚未公布。

6月22日周一
  1. Interconnects AI — Nathan LambertAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.2 是开放智能体的跃变节点

    Nathan Lambert 认为智谱 GLM-5.2 是首个在编码 harness 中作为通用智能体真正好用的开放权重模型,其热度在社区中只有 DeepSeek R1 发布时有类似规模。

    为什么值得看

    作者亲自用 GLM-5.2 在 Claude Code 中跑通工作流,并给出与 DeepSeek R1 时刻的对照,可看开源模型替代前沿闭源的具体进度。

6月20日周六
  1. Andrew Ng(@AndrewYNg)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达评美政府与 Anthropic 限制前沿模型访问

    吴恩达指出,过去两周美国政府与 Anthropic 先后采取行动,通过限制他人对前沿模型的使用来展示对 AI 访问权的控制力,这将加速企业和国家寻求不受他人终止的 AI 访问渠道。

6月19日周五
  1. Modal BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布 Qwen 系列 DFlash 推测解码模型,推理提速最高 20%

    Modal 与 Z Lab 合作训练并在 Hugging Face 发布 Qwen 3.5/3.6 系列 DFlash 推测解码模型,包括 4B、9B、27B、35B-A3B、122B-A10B 及 Qwen 3.6 35B-A3B 等版本。

6月18日周四
  1. 通义大模型AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室联合人大开源统一科学大模型 LOGOS

    通义实验室 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源多领域科学生成基础模型 LOGOS,基于统一科学语法在六大科学任务上匹配或超越领域专用方法。