跳到正文

全部动态

今日 0 条
9月19日周六
  1. eric zakariasson(@ericzakariasson)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    新模型正在带来变革,用户称其"jevolutionizing"

    有用户称一款新模型正在带来变革("jevolutionizing what new model can do"),相关内容获得 93 次点赞、7 条回复、3 次转发和 10064 次浏览,但未透露模型名称与具体能力。

  2. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 直播:Jev 如何加速 AI 智能体循环

    LangChain 将于下周二举办直播,由工程团队的 Sydney Runkle 讲解 TypeSafe AI 的新模型 Jev 如何用于 AI 智能体。该模型在分类任务上据称推理速度最高快 200 倍、成本低 400 倍,目标是解决智能体循环慢且昂贵的问题。直播内容涵盖 Jev 在智能体循环中的位置以及如何搭建 harness。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8 27B 以 5.9 GB 保留 98.2% 基准性能

    PrismML 宣布推出 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,体积比全精度版本小 9 倍,仍保留 98.2% 的综合基准性能,占用仍为 5.9 GB,今日以 Apache 2.0 许可开放。

  4. xAI(@xai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型

    xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转写模型。原文未给出具体准确率数据、语言支持范围或开放使用方式。

  5. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman:Muse Image、MAI-Image-2.6 与 GPT Images 2.5 刷新图像生成性价比前沿

    Muse Image、MAI-Image-2.6 和 GPT Images 2.5 在近几周大幅推进了文生图在价格与速度两个维度上的帕累托前沿,Artificial Analysis 的数据显示生成高质量图像比以往更便宜、更快。Mustafa Suleyman 称这是全球图像生成领域最佳的性价比表现。

9月18日周五
  1. 机器之心SOTA模型AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包2.1 Pro 0915版支持多模态编程,Anthropic开源生物模型推理工具集,ChatGPT for Word上线

    豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。

  2. 阿里研究院AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布全模态模型 Qwen3.8-Omni-Flash

    新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。

    为什么值得看

    原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。

  3. idoubi(@idoubicc)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 决策模型上线 OpenRouter:只做布尔判断、枚举选择与候选打分

    Jev 决策模型已在 OpenRouter 上线,定位为 System One,不做长文生成,只处理布尔判断、枚举选择、候选打分三类决策任务。它不兼容 OpenAI Chat Completions 格式,需用 Decisions API 自行拼 state 与 questions。典型场景包括搜索意图识别、本地模型网关路由和多 Agent 协作中的 Bot 分派。

  4. 智谱AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线 GLM-5.3-FlashX,最高 200 tokens/s

    智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。

  5. Qwen(@Alibaba_Qwen)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布更多案例与细节

    Qwen 公布了更多案例与细节,相关视频需在支持 video 标签的浏览器中查看。原文仅附链接与互动数据,未披露模型版本、参数或具体功能信息。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 谈性能与价格

    Qwen 发布内容聚焦"性能与价格"这一主题,未披露具体模型版本、参数规模或定价数字。该条内容互动数据为 4 条回复、5 次转发、182 个点赞、27766 次浏览。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Omni-Flash 全模态模型,主打智能体能力

    阿里发布 Qwen3.8-Omni-Flash,称其为 Qwen 首个围绕智能体能力构建的全模态模型,将原生音视频理解、推理与工具调用整合在同一模型中,实现理解内容、规划任务、用工具执行并交付结果。

  8. 数字生命卡兹克AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe AI 发布只做高频决策的模型 Jev

    TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。

  9. Character.AI(@character_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 分享 CAI-Image 图像模型家族如何工作

    Character.AI 对开源图像模型进行后训练,做出自己的 CAI-Image 模型家族,目标是让同一个 Character 在故事所需的每种风格、场景和页面中都保持可识别。该模型家族支撑 Character.ai 上的 Comics 与图像生成功能。

  10. NVIDIA AI(@NVIDIAAI)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 用 32 张图在 NVIDIA Voyager 实测 Atlas 世界模型

    NVIDIA AI 转发 World Labs 的测试:给世界模型 Atlas 输入 32 张 NVIDIA Voyager 总部图像,Atlas 以前述图像作为 3D 空间上下文生成新视角,并支持实时飞行浏览与像素级精确的相机控制。

  11. Runway(@runwayml)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 推出 Enhance Frame Rate 帧插值模型,可将任意视频转换为 25/30/48/60/120 fps

    Runway 发布帧插值模型 Enhance Frame Rate,可将任意素材转换为所需帧率规格,支持 25、30、48、60、120 fps 以及 NTSC 的 59.94 标准。用户可通过官方链接开始使用。

  12. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1,现已可在 Hugging Face 使用

    Jina AI 推出 OCR 模型 jina-ocr-v1,已在 Hugging Face 上线可直接使用,并同步放出技术报告与模型博客。官方同时向用户征集使用反馈。

  13. Jina AI(@JinaAI_)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1:基于 DeepSeek-OCR 后训练,支持 25 种语言

    Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。

9月17日周四
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo-V2.6 大规模 RL 训练进展公开,Fuli Luo 称将逐项开源细节

    小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。

  2. 向阳乔木推荐看AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三个月后豆包 Seed-2.1-pro-0915 实测:7个案例看进化多少

    向阳乔木用豆包 Seed-2.1-pro-0915 实测 7 个案例,覆盖深度调研、多模态 Agent 开发、Blender 3D 建模、视频生成、钓点地图、视频剪辑与代码仓库分析。

  3. 阿真IreneAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-pro 0915 版本多模态 Coding 与长任务实测

    豆包 Doubao-Seed-2.1-pro 升级到 0915 版本,官方称重点提升 Coding、Agent 与多模态能力。作者实测了用平面图和作品资料生成三维电子展馆网页、从零策划含 Office 三件套的完整游戏项目、以及借助 Blender MCP 生成白模运镜参考视频再交给 Seedance 出片等案例。

  4. 夕小瑶科技说AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米直播 MiMo-V2.6 强化学习训练,两天花费超113万美元

    小米 MiMo 大模型负责人罗福莉宣布,新一代模型 MiMo-V2.6 处于强化学习训练阶段,训练过程实时对外直播,页面同时跑 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两条线,数据直接来自训练器日志。

  5. 袋鼠帝AI客栈AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-Pro 升级实测:5个多模态 Agent 案例

    字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。

9月16日周三
  1. 夕小瑶科技说AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 疑似灰度现身,奥特曼预告本周大更新

    社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。

  2. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

  3. Jeff Dean(@JeffDean)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Periodic Labs 用 1300 张 H200 训出 Neon,称在分析基准上超过 GPT-6 Astra

    Periodic Labs 在 Menlo Park 建立高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。团队仅用 1300 张 H200,加上数月的实验数据,对一个开源模型做中期训练和 RL,得到 Neon,并称其在自己设定的分析基准上超过 GPT-6 Astra。团队表示先聚焦材料科学难题,包括超导体、磁体和半导体材料。

    为什么值得看

    材料给出了高通量材料实验室与模型闭环的训练路径和硬件规模,读者可据此了解实验数据驱动的模型迭代方式。

  4. ChatGPT(@ChatGPTapp)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将于 10 月 14 日从 ChatGPT 和 Codex 下线 GPT-5.5

    OpenAI 宣布将于 10 月 14 日在 ChatGPT、ChatGPT Work 和 Codex 的所有套餐中下线 GPT-5.5。在 Codex 中使用 GPT-5.5 的用户被建议切换到 GPT-5.6 Sol 或 GPT-6 Astra。

  5. Patrick Loeber(@patloeber)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。

  6. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时音频模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时音频模型,称其为新的 SOTA 实时音频模型,并提供前沿级别的价格与性能。Gemini 3.8 Live 支持 97 种语言且可无缝切换,并支持异步工具调用。

  7. Philipp Schmid(@_philschmid)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。

    为什么值得看

    Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。

  8. Google AI(@GoogleAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google 发布两款 Gemini Audio 模型。Gemini 3.8 Live 主打规模、速度与成本效率,支持句子中途打断、在 97 种语言间即时切换,并能理解视觉上下文;Gemini 3.8 Live Extended Thinking 面向更复杂任务,可边推理边说话,并在工作时同步播报进展,以处理活动策划这类多步骤后台项目而不打断对话。

  9. Google AI(@GoogleAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 推送 Gemini 3.8 Live 与 Extended Thinking 版本

    Google 宣布 Gemini 3.8 Live 正在推送,消费端进入 Search Live,开发者可在 Gemini API 通过 Google AI Studio 公开预览,企业端通过 Gemini Enterprise 定向预览。

  10. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景和高复杂度多步推理任务。

  11. Google DeepMind(@GoogleDeepMind)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,官方称其为最强对话式 AI。这两款模型可对话、思考,并在后台处理任务而不打断用户当前流程。

  12. NVIDIA AI(@NVIDIAAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 专家解读 Nemotron 后训练

    NVIDIA Nemotron Labs 推出「Ask the Experts」栏目,专门解读 Nemotron 的后训练流程。内容以直播形式发布,原帖附带 x.com 直播链接。

9月15日周二
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 在 Artificial Analysis Intelligence Index v4.2 中并列第一

    Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。

  2. 阶跃星辰AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布 StepAudio 3 系列语音大模型,五款模型上线开放平台

    阶跃星辰发布 StepAudio 3 系列语音大模型,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,均已上线阶跃星辰开放平台。

  3. Thomas Wolf(@Thom_Wolf)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reward AI 发布 OM-1 机器人基础模型,零样本泛化到任意机器人

    Reward AI 推出首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人等任意机器人本体。该模型直接从人类操作数据中学习,无需遥操作或机器人数据,据称在灵巧度与效率上接近人类水平,并支持多机器人协作。

  4. Google DeepMind(@GoogleDeepMind)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind WeatherNext 3 每小时更新一次天气预报

    Google DeepMind 的 WeatherNext 3 改为每小时更新一次,用于应对快速变化的天气条件。该模型可为风电场预测高达 100 米处涡轮机的风速与风向以推算发电量,并为太阳能电站预测云量与辐射以估算到达太阳能板的日照水平。

9月14日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 登顶 ARC-AGI-3 榜单并降低 token 成本

    DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。