跳到正文

全部动态

今日 14 条
4月16日周四
  1. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,并首次引入 granular audio tags,可用自然语言指令控制语音风格、语速和表达。

4月15日周三
  1. Midjourney(@midjourney)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney V8.1 上线:原生 2K HD 渲染,速度与成本均为 V8 的三倍优势

    Midjourney V8.1 正式上线,回归标志性美学风格并支持原生 2K HD 渲染,相比 V8 快 3 倍、便宜 3 倍。其 1K 模式的完整画质已快于 V7 的草稿模式,同时恢复了图像提示(image prompts),并新增 Describe、moodboards 与 srefs 功能。

4月9日周四
  1. 字节跳动SeedAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节跳动 Seed 发布原生全双工语音大模型 Seeduplex,基于边听边说框架,实现听说同步,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其误回复率和误打断率减少一半、抢话比例下降 40%、判停响应快约 250ms,对话流畅度与判停 MOS 分分别提升 12% 和 8%,通话满意度绝对提升 8.34%。

4月8日周三
  1. Poe(@poe_platform)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线智谱 GLM-5.1,主打智能体工程与编码能力

    Poe 平台现已上线 Z.ai 的旗舰模型 GLM-5.1,主打智能体工程,在 SWE-Bench Pro 上取得 state-of-the-art 结果,并在仓库生成和真实终端任务中表现领先。

  2. Junyang Lin(@JustinLin610)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Happy Horse 首度输出,在 Artificial Analysis 上超越 Seedance 2

    Happy Horse 首次输出结果,在 Artificial Analysis 上超过了 Seedance 2。相关细节可查看引用推文。

  3. Alex Albert(@alexalbert__)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Mythos Preview 面向 Project Glasswing 发布伙伴开放

    Mythos Preview 目前已向 Project Glasswing 的发布伙伴开放,Anthropic 同步公布了该模型与项目的介绍页面 anthropic.com/glasswing。推文未披露模型参数、benchmark 分数或公开可用时间。

  4. Alex Albert(@alexalbert__)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Mythos Preview,距 Claude Opus 4.6 仅两个月

    Anthropic 在发布 Claude Opus 4.6 两个月后,公布新模型 Claude Mythos Preview。该帖由 Alex Albert 发出,获得 17565 次点赞和 301 万次浏览。

4月4日周六
  1. Poe(@poe_platform)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemma 4 上线 Poe:31B 稠密参数、256K 上下文,Apache 2.0 授权

    Poe 宣布 Gemma 4 已在其平台上线,该模型被描述为 Google 目前能力最强的开放模型,拥有 31B 稠密参数、256K 上下文窗口、支持 140 多种语言。它支持多模态输入、内置思维链推理和函数调用,采用 Apache 2.0 许可,可在各平台的 Poe 应用及 Poe API 中使用。

4月3日周五
  1. Poe(@poe_platform)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.6 Plus 上线 Poe,强化智能体与前端编码

    Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。

3月27日周五
  1. Hugging Face(@huggingface)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chroma 开源 20B 参数搜索智能体 Context-1

    Chroma 推出 Chroma Context-1,一个 20B 参数的搜索智能体,模型权重已在 Hugging Face 发布。官方称其推进了智能体搜索的 pareto 前沿,速度提升一个数量级、成本降低一个数量级,并以 Apache 2.0 协议开源。

3月26日周四
  1. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布开源权重语音模型 Voxtral TTS

    Mistral AI 发布 Voxtral TTS,一款开放权重的文本转语音模型,主打自然、富有表现力和超快速度。官方给出的特点包括真实且带情感表现的语音、支持 9 种语言并能准确捕捉不同方言、首帧音频延迟很低,以及可较容易地适配新音色。

3月25日周三
  1. Aman Sanger(@amanrsanger)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 发布 Composer 2 技术报告,披露训练方法

    Cursor 发布技术报告,说明 Composer 2 的训练方式。该模型被评价为一款好模型,报告通过引用推文对外公布。

3月24日周二
  1. Junyang Lin(@JustinLin610)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    林俊旸点评 UNI-1:成绩不错,但更希望开源

    针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。

3月21日周六
  1. Poe(@poe_platform)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2 系列模型上线 Poe,含 Flash、Omni、Pro 三款

    小米 MiMo V2 系列模型已在 Poe 上线,包括主打快速低成本的 MiMo‑V2‑Flash、面向图文音视频混合媒体的 MiMo‑V2‑Omni,以及上下文最高 1M tokens 的 MiMo‑V2‑Pro。Pro 可读取大型代码库与长报告、规划多步智能体任务并执行深度研究,Flash 适合文档摘要、代码重构与批量工单处理等高吞吐场景。

  2. Aman Sanger(@amanrsanger)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 的 Composer-2 以 Kimi k2.5 为基座并经 CPT 与 RL 训练

    Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。

3月20日周五
  1. Poe(@poe_platform)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax-M2.7 上线 Poe,面向自主软件工程与智能体工作流

    MiniMax-M2.7 已在 Poe 平台上线,官方称其为面向自主软件工程和智能体工作流的下一代自进化模型,可迭代改进自身的智能体脚手架并在重复运行中优化任务表现。该模型在 SWE-Pro 等真实编码基准上取得较大提升,适用于多文件代码库修改、长周期规划、工具调用、文档自动化和复杂多智能体任务,已在 Poe 全平台应用及 Poe API 开放使用。

  2. Sualeh Asif(@sualehasif996)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 发布 Composer 2 模型,称智能达到前沿水平

    Cursor 发布 Composer 2,作者称这是其首个智能真正达到前沿水平的模型,现已可在 Cursor 中使用。作者表示随着算力和预训练加 RL 栈的扩展,后续还会继续推出 Composer 系列模型。

3月19日周四
  1. Poe(@poe_platform)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Small 4 上线 Poe:一个模型兼顾推理、视觉与智能体编程

    Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。

3月18日周三
  1. Nick St. Pierre(@nickfloats)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney v8 早期预览在 alpha 站点开放测试

    Midjourney v8 早期预览已在 alpha 站点开放测试。据该推文,新版本原生 HD 模式速度提升 5 倍,文本渲染更好,提示词遵循度更高,并建议搭配个人化和 SREF 使用以获得最佳体验。

  2. Poe(@poe_platform)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 GPT-5.4-Nano 与 GPT-5.4-Mini 上线 Poe

    OpenAI 的 GPT-5.4-Nano 和 GPT-5.4-Mini 已在 Poe 上线。GPT-5.4-Nano 适合摘要转录、工单标注、内容改写、快速 RAG 问答和运行 @openclaw 流程等对延迟与成本敏感的高频任务;GPT-5.4-Mini 更擅长把杂乱邮件或笔记转成规范 JSON、修复函数、处理异常支持工单,以及需要规划、检查结果并推进下一步的智能体任务。

2月25日周三
  1. Andrew Ng(@AndrewYNg)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Inception Labs 发布 Mercury 2 推理扩散 LLM,称速度达同类 5 倍

    吴恩达转发并称赞 Inception Labs 的扩散 LLM 推理速度,认为扩散 LLM 是自回归 LLM 之外一条值得关注的替代路线。被引推文中 Stefano Ermon 宣布 Mercury 2 上线,称其为全球首个推理扩散 LLM,性能比主打速度优化的领先 LLM 快 5 倍。

  2. Jim Fan(@DrJimFan)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 团队训练 42M 模型 SONIC 控制人形机器人全身动作并开源

    NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。

    为什么值得看

    42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。

2月21日周六
  1. Nick St. Pierre(@nickfloats)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    眨眼约需 0.4 秒,整本小说约 7 秒读完:xgo.ing 展示极速文本处理

    一段演示显示,速度参照眨眼约 0.4 秒,一本完整小说约 7 秒、Harry Potter and the Goblet of Fire 约 16 秒、一部电影长片剧本约 2 秒、10 万行代码约 38 秒。该演示由 xgo.ing 提供支持。

  2. Nick St. Pierre(@nickfloats)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney --v 8 即将发布,示例对比展示情感表现力

    Midjourney --v 8 即将发布。作者用同一提示词对比 Midjourney(左)与 Nano banana(右)的生成效果,认为 Midjourney 在美学和情感细腻度上明显胜出,能准确还原提示词中"quiet distress""cold, intense stare"等情绪描述。

  3. Jim Fan(@DrJimFan)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DreamDojo 世界模型发布:项目网站、论文与代码模型权重同步开放

    NVIDIA 发布世界模型 DreamDojo,项目网站 dreamdojo-world.github.io 与论文 arXiv 2602.06949 已上线,代码仓库和模型 ckpts 已在 GitHub 的 NVIDIA/DreamDojo 开放。该项目由 NVIDIA 内部大团队协作完成。

  4. Jim Fan(@DrJimFan)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 宣布开源交互式世界模型 DreamDojo

    Jim Fan 宣布开源交互式世界模型 DreamDojo,它接收机器人电机控制信号并直接生成像素层面的未来画面,不依赖引擎、网格或人工编写的动力学。模型在 44K 小时人类第一视角视频上预训练,通过从视频中推断的 latent actions 统一动作表示,从而零样本泛化到机器人训练集未见过的物体与环境,之后再针对具体机器人硬件做后训练。

2月20日周五
  1. Varun Mohan(@_mohansolo)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.1 Pro 发布并在 Antigravity 上线

    Gemini 3.1 Pro 发布,在多个领域带来阶跃式提升。该模型正在 Antigravity 中推送,作者反馈其在长时间运行的智能体编码任务上表现更好。

2月19日周四
  1. Jina AI(@JinaAI_)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 Small & Nano 小尺寸嵌入模型,面向端侧检索与边缘部署

    Jina AI 推出 Small & Nano 两款小尺寸嵌入模型,针对端侧检索、浏览器内搜索和边缘部署等受限内存场景。模型权重已在 HuggingFace 开放,包含 GGUF 和 MLX 格式,技术细节见配套博客与 arXiv 论文。

  2. Jina AI(@JinaAI_)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v5-text 发布:改用最后一 token 池化,上下文扩至 32K

    Jina AI 的 v5-text 改用 decoder-only 骨干网络与 last-token pooling,取代此前的 mean pooling。每一层 Transformer 注入四个轻量 LoRA adapter,分别独立处理检索、文本匹配、分类和聚类,用户在推理时按需选择;检索场景下 query 加 "Query:" 前缀、文档加 "Document:" 前缀。

  3. Jina AI(@JinaAI_)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-text:sub-1B 多语言嵌入模型 small 与 nano

    Jina AI 发布第五代嵌入模型 jina-embeddings-v5-text,面向 sub-1B 多语言嵌入推进质量与效率边界,提供 small 和 nano 两个版本。该模型已在 Elastic Inference Service、vLLM、GGUF 和 MLX 上线。

2月18日周三
  1. Mike Krieger(@mikeyk)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 4.6,价格与 4.5 持平并接近 Opus 级智能

    Anthropic 发布 Claude Sonnet 4.6,称其是目前最强的 Sonnet 模型,价格与 Sonnet 4.5 相同,智能水平接近 Opus。该版本在编码、计算机操作、长上下文推理、智能体规划、知识工作和设计方面均为全面升级,并在 beta 阶段提供 1M token 上下文窗口。

2月16日周一
  1. Binyuan Hui(@huybery)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.5-397B-A17B 发布:Qwen3.5 系列首个开源权重模型

    Qwen3.5 系列的首个开源权重模型 Qwen3.5-397B-A17B 正式发布,采用混合线性注意力与稀疏 MoE,并进行了大规模 RL 环境扩展训练,官方称解码吞吐量相比 Qwen3-Max 提升 8.6 倍至 19.0 倍。

2月12日周四
  1. Nick St. Pierre(@nickfloats)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Seedance 2.0 让人大脑短路

    Seedance 2.0 引发关注,有用户称其效果"让人大脑短路"。流传的一段演示显示,用近乎胡言乱语的提示词就能生成大船与爆炸场面。该推文获 260 个点赞、42873 次浏览。

2月11日周三
  1. Modal BlogAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 上线 GLM-5.1 免费端点,并提供 GLM-5 自部署代码

    Modal 升级其免费端点为 GLM-5.1,并说明 GLM-5 可经 OpenAI 兼容接口接入 OpenCode、OpenClaw、Claude Code 和 Vercel AI SDK。

2月6日周五
  1. Mike Krieger(@mikeyk)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布最新 Opus 模型

    Anthropic 联合创始人 Mike Krieger 在 X 上分享最新 Opus 模型的博客链接,并称这是他使用过的体验最好的 Claude 版本。原文未披露该模型的具体能力、版本号或开放范围。

  2. Mike Krieger(@mikeyk)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.6

    Claude Opus 4.6 发布,官方称它能在数小时内完成开发项目从架构到部署的流程。在 Rakuten,它自主完成了一个 50 人规模组织内 issue 的关闭与分配;在 Harvey,它取得 90.2%,是 Claude 系列模型中 BigLaw Bench 的最高分。

  3. AnthropicAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.6

    Anthropic 发布 Claude Opus 4.6,标题为 Introducing Claude Opus 4.6,原始内容为 YouTube 视频,正文信息抓取失败,暂无更多细节。

2月5日周四
  1. Jim Fan(@DrJimFan)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DreamZero:14B 世界动作模型,单次扩散前向同时预测视频与动作

    NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。

2月4日周三
  1. Binyuan Hui(@huybery)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen3-Coder-Next 编码智能体模型

    阿里 Qwen 团队发布 Qwen3-Coder-Next,一款面向编码智能体与本地开发的开源权重模型。其训练使用 80 万可验证任务与可执行环境,在 80B 总参数、3B 激活的规模下于 SWE-Bench Pro 取得较强结果,并支持 OpenClaw、Qwen Code、Claude Code、Cline、浏览器使用等场景。

12月12日周五
  1. Binyuan Hui(@huybery)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-5.2,Sam Altman 称比 GPT-5.1 大幅进步

    OpenAI 发布 GPT-5.2,Sam Altman 称这是一款非常聪明的模型,相比 GPT-5.1 已取得长足进步。该推文获得 1171 次点赞、136437 次浏览。