跳到正文

全部动态

今日 19 条
8月12日周三
  1. AI SDK(@aisdk)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Grok 4.6

    AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。

  2. xAI(@xai)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,上线 Grok Build、Cursor、Grok Bot 和 API

    xAI 发布 Grok 4.6,已在 Grok Build、Cursor、Grok Bot 和 API 中可用。首周在 Cursor 和 Grok Build 内提供 2 倍用量,详情见 x.ai/news/grok-4-6。

  3. xAI(@xai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,速度与复杂任务能力超 Grok 4.5

    xAI 发布 Grok 4.6,称其速度超过同类模型,且能处理比 Grok 4.5 更具挑战性的任务。定价为每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,为其他前沿模型价格的一半。

  4. xAI(@xai)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.6,称能力较 Grok 4.5 大幅提升且价格不变

    xAI 发布 Grok 4.6,称其具备前沿智能水平,相比 Grok 4.5 有显著提升,且保持相同价格。

  5. Google DeepMind(@GoogleDeepMind)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind SL2T 在学术基准上达到 SOTA,并针对单手手语等真实场景优化

    Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。

  6. Google DeepMind(@GoogleDeepMind)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。

  7. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。

  8. Hugging Face(@huggingface)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 3.8 27b 将于周三美国东部时间上午 11 点发布

    Qwen 3.8 27b 将于周三美国东部时间上午 11:00 发布。有用户称其热度甚至会超过 @UseCorgi cafe,并表示人们排起长队等待体验这款新模型的能力。

  9. Modal BlogAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-2.4T-A95B 开放权重发布并上线 Modal

    Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。

  10. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 发布新代码模型,效率提升 25%、成本降至四分之一并上线 GitHub Copilot

    Mustafa Suleyman 宣布最新代码模型上线 GitHub Copilot,相比 6 月发布的模型效率提升 25%、质量更高、成本仅为四分之一。他邀请用户在 GitHub Copilot 中试用该模型。

8月11日周二
  1. Rowan Cheung(@rowancheung)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布开放权重模型 Muse Glimmer,Muse Spark 1.2 即将推出

    Meta 发布新的开放权重模型 Muse Glimmer,扎克伯格同时披露 Muse Spark 1.2 即将推出,并阐述其个人超级智能愿景:一个 24/7 面向所有人可用的 AI 智能体,可覆盖工作、学习、人际关系与心理健康等场景。Meta 还宣布在相关人才与社区上投入,包括 America's Workforce Academy 以及与其数据中心扩张挂钩的 10 亿美元社区基金。

  2. Rowan Cheung(@rowancheung)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 开源 Muse Glimmer 权重,Muse Spark 1.2 即将发布

    Meta 宣布开放 Muse Glimmer 的模型权重,这是一个可在本地运行的 30B 参数稠密模型,Muse Spark 1.2 的权重也将在不久后发布。扎克伯格称 Meta 是开源的支持者,并向 @alexandr_wang 和 MSL 团队致意。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Image-2.6 登文生图竞技场第二

    微软的 MAI-Image-2.6 在 Text-to-Image Arena 以 1336 分位列第二,比第一名的 GPT Image 2(Medium)低 45 分,领先第三名 Grok Imagine Image 2.0(Low)20 分,超过 Nano Banana、Meta 等对手。

  4. Andrew Ng(@AndrewYNg)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达致谢 Meta 开源 Muse Glimmer 30B 等模型权重

    吴恩达公开致谢 Mark Zuckerberg、Alexandr Wang 及 Meta 团队对开放权重 AI 的贡献。所引 Mark Zuckerberg 表示 Meta 当天开放 Muse Glimmer 的权重,这是一个可本地运行的 30B 参数稠密模型,并称不久后还将发布其最新基础模型 Muse Spark 1.2 的权重。

8月10日周一
  1. Paul Couvert(@itsPaulAi)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 30B 开源模型 Muse Glimmer 并预告开放 Muse Spark 1.2 权重

    Meta 发布 30B 参数稠密模型 Muse Glimmer 并开放权重,该模型可本地运行。扎克伯格同时表示将很快开放其最新基础模型 Muse Spark 1.2 的权重,并称 Meta 是开源的支持者。

8月8日周六
  1. MiniMax 稀宇科技AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 技术团队在 Reddit 与 ComfyUI 直播回应开源与架构问题

    MiniMax H3 技术团队在周五晚的 Reddit AMA 和 ComfyUI Live 直播中,回应了模型架构、长视频续写、画质局限与后续开源计划等问题。

8月6日周四
  1. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其在预测气旋路径、强度和风场结构上达到 SOTA。

    为什么值得看

    Google DeepMind 公开气象模型权重与代码,并说明其预报精度提升大致相当于十年气象学进展。

  2. Hunyuan(@TXhunyuan)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布混元 Hy3,主打实用 AI 与旗舰级性能

    腾讯发布混元 Hy3,官方称其为实用 AI 设计,兼具旗舰级性能与紧凑、低成本的特点,并带入先进的推理与 Agent 能力,覆盖研究、编码、办公生产力、设计和云工作流。该模型现已在腾讯产品、API 和开发者平台上面向全球开放,官方给出官网 hy.tencent.ai、OpenRouter 上的 API 定价页,以及 WorkBuddy、Miora、腾讯云 TokenHub 等入口。

8月5日周三
  1. 字节跳动SeedAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线

    字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。

    为什么值得看

    字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。

  2. Mistral AI(@MistralAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 的 Shieldstral 以 Apache 2.0 许可开放

    Mistral 的 Shieldstral 现以 Apache 2.0 许可开放,可在 Hugging Face 上获取并使用。该模型由 Mistral AI 发布,官方同时给出了试用链接。

  3. Replicate(@replicate)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黑森林实验室 FLUX 3 Video 上线 Replicate

    黑森林实验室的 FLUX 3 Video 已在 Replicate 上线,该多模态模型覆盖视频、音频、图像和动作预测,本次先放出视频能力。它支持生成最长 20 秒、最高 1080p 的视频,具备原生音频、文生视频、多帧图生视频、视频续写和多语言对话,并提供 Draft 模式以更低成本快速试想法,可通过 API 或常用工具使用;2K、4K 和开放权重版本即将推出。

  4. Mistral AI(@MistralAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Shieldstral 3B 开源内容安全模型

    Mistral 发布 Shieldstral,一个 3B 开源权重的内容安全模型,可在设备端部署。官方给出 mistral.ai/news/shieldstral 链接,未披露更多能力细节。

  5. Mistral AI(@MistralAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Shieldstral:单张 16GB GPU 上的多模态内容审核模型

    Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。

8月4日周二
  1. Microsoft Research(@MSFTResearch)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软推出 PRISM2:基于真实病理报告训练的病理多模态基础模型

    微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。

  2. Hunyuan(@TXhunyuan)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯发布 Hy ASR 3.0 preview,由 Hy3 语言大脑驱动

    腾讯 Hy ASR 3.0 preview 今日发布,由 Hy3 的语言能力驱动,主打精准语音识别加深度语义理解。官方称其在通用识别、上下文感知、多场景鲁棒性和方言覆盖上表现领先,多语言 WER 约为 3%,可将嘈杂的真实音频转成连贯转录并准确理解意图。

  3. 腾讯混元AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy ASR 3.0 preview 语音识别模型

    腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。

  4. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 开源 24 小时,超百家企业 Day 0 上线

    MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。

    为什么值得看

    可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。

8月3日周一
  1. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    jina-reranker-v3.5 在四个基准上处于 Pareto 前沿

    jina-reranker-v3.5 在四个基准的质量-参数量对比中均处于 Pareto 前沿,评估范围内没有任何模型同时做到更小且更好。

  2. Jina AI(@JinaAI_)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v3.5 重排序模型发布

    Jina AI 发布 v3.5 重排序模型(reranker),同步公开博客、arXiv 论文(2607.18152)及 HuggingFace 模型页。

  3. Jina AI(@JinaAI_)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-reranker-v3.5:0.6B 列表式重排序模型,BEIR nDCG@10 达 63.20

    Jina AI 发布 jina-reranker-v3.5,这是一个 0.6B 的列表式重排序模型,改进了 v3 的交互方式,速度更快,并针对企业搜索数据做了优化。它在 BEIR 上取得 63.20 nDCG@10,以约 7 倍更少的参数超过 Qwen3-Reranker-4B。

  4. Last Week in AIAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #253:Claude Opus 5、Gemini 3.6、Kimi K3 与 Hugging Face 被黑事件

    Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。

  5. MiniMax 稀宇科技AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 正式开源通用视频模型 MiniMax H3

    MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。

    为什么值得看

    H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。

8月1日周六
  1. Google AI(@GoogleAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 汇总 Gemini 近期更新:Gemini Robotics 2、3.5 Flash-Lite、3.6 Flash 等

    Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。

7月31日周五
  1. Hunyuan(@TXhunyuan)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy-MT2-30B-A3B 推出 GGUF 格式,开源以来下载量超 70 万

    腾讯混元 Hy-MT2 自 5 月开源以来累计下载量超 70 万,其中 Hy-MT2-1.8B 登顶 Hugging Face trending,30B-A3B 位列第 4。

  2. DeepSeek(@deepseek_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-0731 升级,仅限 API

    DeepSeek-V4-Flash-0731 与预览版保持完全相同的模型架构和规模,本次升级只作用于 DeepSeek-V4-Flash API。DeepSeek-V4-Pro API 以及 App/Web 端模型暂未变动,官方称 V4-Pro 的正式发布将尽快到来。

  3. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash 官方 API 公测上线

    DeepSeek-V4-Flash 官方 API 现已进入公测。官方称其 Agent 能力大幅升级,基准测试分数已明显超过 V4-Pro-Preview。V4-Flash 官方版原生支持 Responses API 格式,并已完整适配 Codex,配置细节见官方 API 文档 api-docs.deepseek.com。

    为什么值得看

    DeepSeek-V4-Flash 官方 API 公测,Agent 能力大幅升级并原生支持 Responses API 格式,读者可据此判断接入方式与能力变化。

  4. 字节跳动SeedAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节跳动发布视频创作模型 Seedance 2.5

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒,并支持多轮延长。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,强化了白模参考、运动参考、创意参考能力;编辑方面支持时间戳精准控制与定向修改,并升级绿幕、视角、参考编辑。

  5. MiniMax 稀宇科技AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 发布全模态生成模型 H3,计划开放模型权重

    MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。

    为什么值得看

    MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。

  6. Scott Wu(@ScottWu46)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 系列在 FrontierCode 上的性价比表现,Devin 用户将自动享受成本下降

    Cognition 更新 FrontierCode 1.1,以反映 GPT-5.6 Terra 和 GPT-5.6 Luna 的新折扣,GPT-5.6 系列由此落在性价比效率的帕累托曲线上。Scott Wu 表示所有 Devin 用户都会自动看到成本下降。

  7. Demis Hassabis(@demishassabis)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2 机器人模型套件

    Google DeepMind 发布 Gemini Robotics 2,这是一套面向机器人的新一代物理 AI 模型。官方称机器人现在可以推理每一个动作,完成此前无法实现的任务,例如系精细的绳结,并支持多机器人协作解决复杂工作流。该系列还为人形机器人带来全身智能与更高级的灵巧操作能力。

    为什么值得看

    DeepMind 官方发布 Gemini Robotics 2,点出全身智能、精细操作与多机器人协作三项能力。