跳到正文

#模型发布

今日 1 条
今天10月10日周六
  1. Simon Willison(@simonw)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 寻求 Qwen3.5-35B-A3B 之外更新的强力模型

    Simon Willison 表示自己在这类场景中喜欢用 Qwen3.5-35B-A3B,并询问社区还有哪些更新、性能更强的模型可选。该帖获得 49 次点赞、9199 次浏览和 17 条回复。

9月29日周二
  1. 有机大橘子AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5:从大语言模型,到世界模型?

    Anthropic 的 Opus 5.5 靠纯代码生成品牌宣传片、像素动画,还能操控电脑画图,与 GPT-6 的 Sol 和 Luna 同周发布后,热度持续一周不退。

9月25日周五
  1. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用浏览器画 dario:Claude Opus 5.5 对比视频引热议

    一段用浏览器画 dario 的对比视频显示,Claude Opus 5.5 在其中的表现被 indigo 形容为"开悟了",并称这是 ego 的宣传视频,但对比效果"太残酷"。该推文被 orange.ai 转发,附带的视频在浏览器端无法播放。

9月24日周四
  1. 袋鼠帝AI客栈AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    逛完云栖大会,看阿里的AI野心:从Qwen新模型到真武V900芯片

    阿里云栖大会透露,Qwen将训练5-10T参数新模型,平头哥发布真武V900芯片,性能是M890的3倍、单集群可扩至50万卡;阿里云计划到2032年达到20GW规模,吴泳铭在演讲中判断机器思考总量未来将是人类的1000倍以上。作者还测评了阿里AI硬件QwenNote Eva,并推荐了开源的《魔搭紫皮书》。

  2. orange.ai(@oran_ge)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 好评如潮并大幅降价,GPT 6 Sol 明显输了,OpenAI 称下周发一堆大的

    Opus 5.5 收获好评并大幅降价,GPT 6 Sol 在这场对比中明显落败。OpenAI 表示下周将发布一堆新东西。

  3. AI Breakfast(@AiBreakfast)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 一夜一次性生成完整冒险游戏 Epicurious

    Opus 5.5 被用户称为用过最有趣的模型,它一夜之间一次性生成了一款名为 Epicurious 的完整冒险游戏,体量庞大,通关预计需要 20 小时。该游戏为完整的电脑游戏形态。

9月22日周二
  1. 阿里研究院AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴泳铭云栖演讲:未来机器思考总量将达人类的1000倍以上

    阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上判断,未来机器供给的思考总量将达人类思考总量的1000倍以上,机器将承担99.9%的思考工作。他宣布平头哥发布新一代AI芯片真武V900,性能达M890的3倍,单一集群可扩展至50万卡;Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模的新模型。阿里云目标到2032年全球数据中心规模超20GW。

9月15日周二
  1. 硅谷科技评论AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越便宜,什么才开始值钱?——Imagination In Action 硅谷 AI 峰会观察

    2026 年 9 月 14 日 Imagination In Action 硅谷 AI 峰会上,嘉宾反复提到模型能力仍在变强但已不值钱,真正的门槛转向速度、路由架构、专有数据和物理供应链。

9月14日周一
  1. Yann LeCun(@ylecun)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:现代 AI 系统并非自回归,推理搜索应在抽象表示空间进行

    Yann LeCun 指出,现代 AI 系统底层的 LLM 是自回归的,但 AI 系统本身不是:所谓"reasoning"系统会生成大量 token 序列并挑选最优解,这属于非自回归搜索。他认为当前系统的错误在于把搜索放在离散 token 空间,主张 planning/reasoning 的 inference-by-search 应在抽象表示空间完成,因为人类的推理与规划大多与语言无关。

9月4日周五
  1. Latent.Space(@latentspacepod)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 发布反响首次超过 Claude,Latent.Space 称 AI 工程进入新阶段

    OpenAI 的 GPT-6 发布反响首次在一年内超过 Claude 发布,Latent.Space 称这是此前认为今年不可能出现的巨大反转。swyx 表示已跨入 AI 工程的新时代,并称这只是他与 Astra 所做工作的一部分,后续报告将陆续在 LS 发布。

8月29日周六
  1. Greg Brockman(@gdb)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Greg Brockman:GPT 5.6 Terra 和 Luna 在 OpenRouter 打折后 token 用量暴涨 13.8 倍,印证杰文斯悖论

    GPT 5.6 Terra 和 Luna 在 OpenRouter 大幅打折后,token 用量暴涨 13.8 倍。Greg Brockman 借此指出杰文斯悖论:技术让资源使用更高效时,该资源的总消耗量反而上升而非下降。

8月22日周六
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布挑战 OpenAI 与 Anthropic,Anthropic 为 Claude 加水印,阿里开源 Qwen3.8 Max

    SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。

8月15日周六
  1. Interconnects AI — Nathan LambertAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 发布:中国实验室如何跟上前沿

    Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。

    为什么值得看

    以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。

8月4日周二
  1. Paul Couvert(@itsPaulAi)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 新模型发布:几乎免费且足以构建任何应用

    新发布的 DeepSeek 被评价为史上最重要的 AI 发布之一:模型能力足以构建几乎任何东西,而成本几乎可以忽略。此前预算一直是许多人和项目的最大障碍,如今这一障碍已消失。

7月22日周三
  1. Interconnects AI — Nathan LambertAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 与 Qwen 3.8 之后:开源模型综述、蒸馏争论与中美差距

    Kimi K3 上周发布,Qwen 宣布下一代大模型将采用开放权重,中国厂商在开源模型上的加速成为焦点。播客讨论了 GLM 5.2 的作用、美国开源生态、前沿与近前沿模型差距,以及蒸馏话题引发的 Ben Thompson 争论。

7月21日周二
  1. Last Week in AIAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #251:Mythos 回归、Claude Sonnet 5、Etched、LongCat

    Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。

  2. Last Week in AIAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #247:Claude Opus 4.8、微软 MAI、Anthropic IPO 与 MiniMax-M3

    Anthropic 发布 Claude Opus 4.8,基准分数提升,并推出面向长时间多智能体任务的 Dynamic Workflows;微软发布基于 OpenClaw 的常驻助手 Microsoft Scout 及 MAI Thinking 1 等自研 MAI 模型。

7月8日周三
  1. 人民公园说AIAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用什么Fable 5?都给我去用国产模型!当顶级模型变奢侈品,普通人怎么用 AI?

    Coinbase 已把编码任务交给 GLM 和 Kimi,费用砍半;视频还讨论了如何用国产模型"白嫖" Claude Code 全生态。中国能把 TOKEN 成本压到海外的 1/5 并免费开放,豆包一宣布收费就被骂"忘记初心",WorkBuddy 和 Trae 也突然爆火。

4月17日周五
  1. Binyuan Hui(@huybery)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 发布,系统卡又加了 200+ 页

    Opus 4.7 发布,附带又一份 200+ 页的系统卡,让作者直言模型发布速度已超过自己的阅读速度。此前 Mythos 的系统卡他还没读完。

2月6日周五
  1. Lex Fridman(@lexfridman)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lex Fridman 透露 Claude Opus 4.6 与 GPT Codex 5.3 今日发布,OpenClaw 播客即将上线

    Claude Opus 4.6 与 GPT Codex 5.3 于当日发布,OpenClaw 也在近期推出,Lex Fridman 预计 xAI/Grok 与 Google/Gemini 很快会跟进新版本。他透露将围绕 OpenClaw 与创作者 steipete 录制一期深度播客,并征集听众问题。他还计划下周前往旧金山湾区待一段时间,聚焦编程并参与工程团队工作。

12月11日周四
  1. Binyuan Hui(@huybery)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用 Qwen 构建下一代基础模型

    有人正在思考如何用 Qwen 构建下一代基础模型。该消息未披露具体模型版本、参数规模或发布时间等细节。

5月23日周五
  1. Barsee 🐶(@heyBarsee)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一周 AI 大事:Google Veo 3、Anthropic Claude 4 等集中发布

    Barsee 总结了最近 AI 领域最密集的一周,Google 推出 Veo 3,Anthropic 发布 Claude 4,OpenAI 与 Jony 联合推出 IO。此外还有 Apple Glasses 与 Google Glasses、Tesla Optimus 的进展,以及 Anthropic CEO 对 2026 年 AI 的预测。