跳到正文

#模型发布

今日 20 条
9月21日周一
  1. Qwen(@Alibaba_Qwen)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 上线 Hugging Face Spaces 演示

    Qwen 发布 Qwen-Image-2.1,在 Hugging Face Spaces 提供可直接在浏览器试用的演示,无需本地配置。该模型为 7B 参数的原生图像生成与编辑模型,单 checkpoint 同时支持生成和编辑,最多可输入 10 张参考图,并自带提示词增强 LLM,已集成 diffusers 与 ComfyUI。

  2. 夕小瑶科技说AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 被曝跳过 Claude Opus 5.2 直奔 Opus 5.5,API 价格或降 20%

    爆料称 Anthropic 正在测试代号 claude-wafer-eap 的 Claude Opus 5.5,跳过 5.2 版本,计划本周内发布,已有用户用它在 Claude Code 中生成 Waymo 自动驾驶汽车 3D 模型。

  3. Vercel NewsAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2.6 Pro、Flash 与 Pro UltraSpeed 上线 Vercel AI Gateway

    小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。

  4. Paul Couvert(@itsPaulAi)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ConvaiInnovati 模型权重上线 Hugging Face 并开源 GitHub 仓库

    ConvaiInnovati 的模型权重已发布在 Hugging Face,同时 GitHub 上开放了配套仓库。原文未披露模型名称、参数规模、benchmark 分数或具体功能。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Laya:类似 Jev 的开源分类系统,速度最高快 50 倍

    Laya 是一个开源分类系统,可在不到 1GB 内存下运行,已上线 Hugging Face,能在任何笔记本或手机上运行,演示中玩 Snake 达到 60 次决策/秒。目前上下文仅 1k,部分用例无法覆盖,泛化能力不如 Jev,但可按需轻松微调。

9月20日周日
  1. AK(@_akhaliq)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 上线 Hugging Face

    Qwen-Image-2.1 已在 Hugging Face 上线,可在 Hugging Face app 中访问对应 Space 页面。该消息由 AK(@_akhaliq) 发布,但原文未披露模型参数规模、benchmark 分数或开源许可等细节。

  2. Philipp Schmid(@_philschmid)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 演示与复现项目展示超快多模态模型的免费可用潜力

    Philipp Schmid 称赞 Jev 的一系列演示、复现和项目,认为它们展示了超快、多模态且足够便宜、可免费使用的模型能带来多少可能。他同时提醒,业界过于聚焦编码智能体,容易忽略 AI 还能做很多其他事情。

  3. Qwen(@Alibaba_Qwen)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 现已支持 ComfyUI

    Qwen-Image-2.1 现已支持 ComfyUI,采用开放权重,单个 7B checkpoint 同时支持图像生成与编辑。该模型可原生输出 2K 图像,单次最多基于 10 张参考图进行指令编辑,并支持带 alpha 通道的 RGBA 输出。

  4. Qwen(@Alibaba_Qwen)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    vLLM-Omni 为 Qwen-Image-2.1 提供 day-0 支持

    阿里 Qwen 的 Qwen-Image-2.1 在 vLLM-Omni 获得 day-0 支持,可在同一模型内生成、编辑并输出透明背景图像。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,安装方式与支持的组合已发布在 vLLM recipes 页面。

  5. Qwen(@Alibaba_Qwen)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 提升文字与肖像美学视觉质量

    Qwen-Image-2.1 相比前代提升了视觉质量,尤其在文字和肖像的美学表现上更为明显。官方同时展示了多组文字渲染示例。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 支持多种图像编辑任务并兼顾性能平衡

    Qwen-Image-2.1 支持多种图像编辑任务,并在各项任务间平衡性能表现。给定三视图角色参考图后,该模型可生成完整故事板。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 原生支持透明图像生成

    Qwen-Image-2.1 现已原生支持透明图像生成,并可直接对透明图像进行编辑。该版本主打透明图生成与透明图编辑两项能力,官方未公布更多参数与可用性细节。

  8. Qwen(@Alibaba_Qwen)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布并开源图像生成模型 Qwen-Image-2.1

    阿里 Qwen 发布 Qwen-Image-2.1,称其为 Qwen-Image 系列中平衡性与性价比最佳的图像生成模型,并已开放权重。该模型是生成与编辑统一模型,采用 7B 轻量架构,支持多图输入推理加速、原生 RGBA 透明图层生成与编辑、最多 10 张参考图的高保真编辑,并覆盖全景图、信息图和虚拟试穿等场景。权重已在 Hugging Face、ModelScope 和 GitHub 提供。

  9. 阶跃星辰AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃发布旗舰模型 Step 5 Preview:稀疏 MoE 架构,10 月 15 日开源

    阶跃发布面向真实世界 Agentic 任务的旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口并原生支持文本与视觉输入。

  10. Browser Use(@browser_use)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 表现提升但价格明显上涨,DeepSeek v4.1 Flash 更胜一筹

    GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。

9月19日周六
  1. Qwen(@Alibaba_Qwen)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布实时同传模型 Qwen3.8-LiveTranslate

    阿里发布新一代实时同传模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在 60 种语言上把平均滞后 LAAL 从 2.8 秒降至 2.3 秒,并提升忠实度、流畅度与简洁度。新能力包括多人语音的实时说话人分离并可稳定克隆保留各说话人音色、原文与译文同屏对照的双语显示,以及利用对话历史消歧名称和术语的长上下文能力。

  2. eric zakariasson(@ericzakariasson)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    新模型正在带来变革,用户称其"jevolutionizing"

    有用户称一款新模型正在带来变革("jevolutionizing what new model can do"),相关内容获得 93 次点赞、7 条回复、3 次转发和 10064 次浏览,但未透露模型名称与具体能力。

  3. Harrison Chase(@hwchase17)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 直播:Jev 如何加速 AI 智能体循环

    LangChain 将于下周二举办直播,由工程团队的 Sydney Runkle 讲解 TypeSafe AI 的新模型 Jev 如何用于 AI 智能体。该模型在分类任务上据称推理速度最高快 200 倍、成本低 400 倍,目标是解决智能体循环慢且昂贵的问题。直播内容涵盖 Jev 在智能体循环中的位置以及如何搭建 harness。

  4. Google AI(@GoogleAI)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 音频模型并公布多项产品进展

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为目前最先进的实时对话音频模型。

  5. xAI(@xai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型

    xAI 发布 Grok Voice Transcribe 2.0,称其为全球最准确的语音转写模型。原文未给出具体准确率数据、语言支持范围或开放使用方式。

  6. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muse Image、MAI-Image-2.6 与 GPT Images 2.5 刷新文生图性价比前沿

    Artificial Analysis 指出,近几周 Muse Image、MAI-Image-2.6 和 GPT Images 2.5 显著推动了文生图在价格与速度两条帕累托前沿的移动,生成高质量图像比以往更便宜、更快。Mustafa Suleyman 转发称这是全球图像生成领域最佳的性价比表现。

9月18日周五
  1. 机器之心SOTA模型AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包2.1 Pro 0915版支持多模态编程,Anthropic开源生物模型推理工具集,ChatGPT for Word上线

    豆包2.1 Pro 0915版进入火山方舟模型列表,支持百万 Token 上下文与多模态编程,并强化长程 Agent 协作与异步子任务验收。Anthropic 开源含 36 套工具的生物模型推理优化工具集,报告平均提速约 4 倍,其中 FlashPairformer 专用内核加速结构预测,仓库为研究参考发布、不计划持续维护。

  2. 阿里研究院AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布全模态模型 Qwen3.8-Omni-Flash

    新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线千问AI平台,支持文本、图像、音频和视频输入以及 1M 长上下文,目标是把全模态能力从理解内容推进到规划任务、调用工具并完成创作。

    为什么值得看

    原文给出全模态模型的评测提升、API 降价幅度与配套开源工具,读者可据此判断音视频智能体的落地成本变化。

  3. idoubi(@idoubicc)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 决策模型上线 OpenRouter:只做布尔判断、枚举选择与候选打分

    Jev 决策模型已在 OpenRouter 上线,定位为 System One,不做长文生成,只处理布尔判断、枚举选择、候选打分三类决策任务。它不兼容 OpenAI Chat Completions 格式,需用 Decisions API 自行拼 state 与 questions。典型场景包括搜索意图识别、本地模型网关路由和多 Agent 协作中的 Bot 分派。

  4. 智谱AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线 GLM-5.3-FlashX,最高 200 tokens/s

    智谱正式推出 GLM-5.3-FlashX,最高 200 tokens/s,API 已上线,Model Key 为 GLM-5.3-FlashX。官方称该版本前身以 Ox Alpha 之名与开发者见面,调用量持续攀升,此次在10万张国产芯片提供的推理算力基础上加大 Infra 投入与推理优化。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。

  5. Qwen(@Alibaba_Qwen)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布更多案例与细节

    Qwen 公布了更多案例与细节,相关视频需在支持 video 标签的浏览器中查看。原文仅附链接与互动数据,未披露模型版本、参数或具体功能信息。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 谈性能与价格

    Qwen 发布内容聚焦"性能与价格"这一主题,未披露具体模型版本、参数规模或定价数字。该条内容互动数据为 4 条回复、5 次转发、182 个点赞、27766 次浏览。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen3.8-Omni-Flash 全模态模型,主打智能体能力

    阿里发布 Qwen3.8-Omni-Flash,称其为 Qwen 首个围绕智能体能力构建的全模态模型,将原生音视频理解、推理与工具调用整合在同一模型中,实现理解内容、规划任务、用工具执行并交付结果。

  8. 数字生命卡兹克AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe AI 发布只做高频决策的模型 Jev

    TypeSafe AI 发布新模型 Jev,它不生成文字,只输出决策与置信度,定位为 System One Model 通用分类器,主打高频判断场景。官方称其速度比常规大模型快 20~200 倍、成本低 40~400 倍,价格为 0.042 美元/百万 Token,输出 Token 免费,并采用名为 RLCD 的面向校准决策的强化学习方法。

  9. Character.AI(@character_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Character.AI 分享 CAI-Image 图像模型家族如何工作

    Character.AI 对开源图像模型进行后训练,做出自己的 CAI-Image 模型家族,目标是让同一个 Character 在故事所需的每种风格、场景和页面中都保持可识别。该模型家族支撑 Character.ai 上的 Comics 与图像生成功能。

  10. bolt.new(@boltdotnew)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 开放模型使用量排行:GLM 5.3 Flash 以 54% 居首

    Bolt 平台已有 11M+ 用户,本周一上线了最高 50x 用量的开放模型,目前使用率第一的是最快、最便宜的 GLM 5.3 Flash,占 54%,其提示词规模可达 2 倍。DeepSeek V4 Pro 以 17% 排第二,GLM 5.3 以 15% 排第三,Kimi K3 为 1%。

  11. NVIDIA AI(@NVIDIAAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 用 32 张图测试 Atlas 世界模型,可在 NVIDIA Voyager 实时漫游

    World Labs 用 NVIDIA Voyager 总部的 32 张图像测试其世界模型 Atlas:Atlas 把文本、图像、视频和 3D 纳入统一空间上下文,可用这些图像作为 3D 空间上下文生成新视角,实现像素级精确的实时相机漫游。Atlas 在 NVIDIA Blackwell GPU 上从零预训练。

  12. Runway(@runwayml)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 推出 Enhance Frame Rate 帧插值模型,可将任意视频转换为 25/30/48/60/120 fps

    Runway 发布帧插值模型 Enhance Frame Rate,可将任意素材转换为所需帧率规格,支持 25、30、48、60、120 fps 以及 NTSC 的 59.94 标准。用户可通过官方链接开始使用。

  13. Jina AI(@JinaAI_)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1,现已可在 Hugging Face 使用

    Jina AI 推出 OCR 模型 jina-ocr-v1,已在 Hugging Face 上线可直接使用,并同步放出技术报告与模型博客。官方同时向用户征集使用反馈。

  14. Jina AI(@JinaAI_)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-ocr-v1:基于 DeepSeek-OCR 后训练,支持 25 种语言

    Jina AI 推出基于 DeepSeek-OCR 后训练的 jina-ocr-v1,多语言支持扩展至 25 种,并针对 NVIDIA L4 等低预算 GPU 优化。该模型在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4,页面吞吐量在所有竞品中最高。

9月17日周四
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo-V2.6 大规模 RL 训练进展公开,Fuli Luo 称将逐项开源细节

    小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。

  2. 袋鼠帝AI客栈AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    豆包 Seed-2.1-Pro 升级实测:5个多模态 Agent 案例

    字节豆包迎来 Seed-2.1-Pro 升级,作者在内测中用豆包工作、API 接入 Codex 和 Claude Code 三种环境完成5个案例。案例包括用豆包工作连接 Godot 做完整可玩游戏、制作3D T恤定制页面、用 Methy 加 Blender 跨软件做海洋动物3D管线并测试 Unity 场景、生成飞机地球航线 web、以及网络电台音乐播放器。

9月16日周三
  1. Jeff Dean(@JeffDean)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Periodic Labs 用 1300 张 H200 训出 Neon,称在分析基准上超过 GPT-6 Astra

    Periodic Labs 在 Menlo Park 建立高通量材料实验室,让实验与模型形成闭环:实验室产生新数据,模型从中学习并决定下一步实验方向。团队仅用 1300 张 H200,加上数月的实验数据,对一个开源模型做中期训练和 RL,得到 Neon,并称其在自己设定的分析基准上超过 GPT-6 Astra。团队表示先聚焦材料科学难题,包括超导体、磁体和半导体材料。

    为什么值得看

    材料给出了高通量材料实验室与模型闭环的训练路径和硬件规模,读者可据此了解实验数据驱动的模型迭代方式。

  2. Patrick Loeber(@patloeber)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 推出两款面向 Live API 的 Gemini 模型:Gemini 3.8 Live 和 3.8 Live Extended Thinking,官方称其为目前最好的对话式 AI。新模型在智能水平和并行推理上有较大升级,可在对话中思考并在后台处理任务而不打断用户流程,实时语音协作更顺畅自然,可在 ai.studio/live 测试。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时音频模型

    Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时音频模型,称其为新的 SOTA 实时音频模型,并提供前沿级别的价格与性能。Gemini 3.8 Live 支持 97 种语言且可无缝切换,并支持异步工具调用。