跳到正文

#模型发布

今日 19 条
10月1日周四
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,今日起先向网络安全防御者开放,随后将尽快扩大范围。该模型处于介绍性定价阶段,输入 $2、输出 $10。

  2. Sundar Pichai(@sundarpichai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 预告 Gemini 4 Argon,主打复杂工作流与软件工程

    Google CEO Sundar Pichai 提前预告下一代模型 Gemini 4 Argon,称其在复杂工作流、网络防御和软件工程方面表现出前沿性能。他表示 Google 内部团队已从编码到量子计算广泛使用该模型,反馈良好,并放出了基准测试信息。

  3. Google DeepMind BlogAI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。

    为什么值得看

    原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。

  4. Aravind Srinivas(@AravSrinivas)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源上下文嵌入模型 pplx-embed-v2-context-9b-preview,在 turbopuffer context-bench 上表现最佳

    Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。

  5. Replicate(@replicate)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 上线 Replicate,主打多轮精确图像编辑

    Ideogram 4.5 已上线 Replicate,面向高精度、多轮图像编辑场景,适用于编辑类样稿、品牌素材和无伪影图像。发布方称该版本能消除多轮编辑中的伪影累积、像素偏移和色彩变化,从而让多轮编辑成为可能,目前已上线 Ideogram、API 及发布合作伙伴,并计划后续开放权重。

  6. Perplexity(@perplexity_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 发布 pplx-embed-v2-context-9b-preview 嵌入模型,上线 Hugging Face

    Perplexity 在 Hugging Face 上线 pplx-embed-v2-context-9b-preview 嵌入模型,型号中的 9b 指向 90 亿参数规模,v2-context 命名表明其面向长上下文场景。该模型以 preview 预览版形式开放查看,具体能力与可用方式尚未披露。

  7. Perplexity(@perplexity_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 推出 pplx-embed-v2-context-9b-preview,上下文嵌入模型刷新 ConTEB 纪录

    Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。

  8. LovartAI(@lovart_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 Ideogram 4.5 编辑模型,称可消除多轮编辑伪影

    Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。官方表示其他领先模型每次编辑都会累积伪影、像素偏移和色彩变化,而 Ideogram 4.5 消除了伪影累积,使多轮编辑成为可能。该模型已在 Ideogram、API 及发布合作伙伴处上线,开放权重即将推出。

  9. Recraft(@recraftai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 上线 Runware,每张图 $0.007

    Recraft V4.1 Flash 已在 Runware 平台上线,可通过 Playground 试用或经 API 接入工作流。该闪速级模型支持 14 种宽高比预设、最高 1536×768 分辨率,可用目标色板或固定背景色引导输出,定价为每张图 $0.007。Recraft 表示其提示词遵循度优于同类快速模型,并在人像、复杂场景和 logo 概念上表现较强。

  10. Runway(@runwayml)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 发布开放权重世界动作模型 Praxis-1

    Runway 发布 Praxis-1,一个开放权重的世界动作模型(World Action Model),把其在视频预训练上的积累用于机器人真实世界控制。该模型基于大规模视频预训练和实时基础设施构建,定位为可跨任意具身形态与环境的策略模型,面向机器人开发者和研究者。

  11. Fireworks AI(@FireworksAI_HQ)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks Ember-1 上线 Vals:金融法律基准接近 Kimi K3,每轮推理 token 更少

    Fireworks 的 Ember-1 已可在 Fireworks Serverless 上调用,Vals AI 的独立测试显示其在金融和法律基准上表现接近 Kimi K3,同时每轮推理 token 用量更少。每轮 token 更少意味着单次调用成本更低、智能体循环更快。

  12. Ideogram(@ideogram_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 图像编辑 Elo 1250 位列第 15,与 MAI-Image-2.6、Gemini 3 Pro Image Preview 同档

    Ideogram 4.5 在 Image Editing 榜单以 1250 的 Elo 排名第 15,与微软 MAI-Image-2.6 和 Google DeepMind 的 Gemini 3 Pro Image Preview 处于同一性能区间。该模型虽专为精准定向编辑打造,但在通用编辑任务上表现同样出色,尤其在排版类编辑(如修改信息图中的文字)上优势明显。

  13. Justine Moore(@venturetwins)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 4.5 图像编辑模型,主打多轮精修

    Ideogram 发布 Ideogram 4.5,官方称其是目前最精确的图像编辑模型,能消除多轮编辑中其他模型常见的伪影累积、像素偏移和色彩变化,已在 Ideogram、API 和发布合作伙伴处上线,开放权重即将推出。Justine Moore 用一张 Olipop 广告图做了多轮精确编辑测试,认为它在多轮改动中不会出现画面扭曲和伪影。

  14. Ideogram(@ideogram_ai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 发布:只编辑指定内容且不损画质

    Ideogram 发布 4.5 版本,主打只对用户指定的内容进行编辑,从而在持续编辑中不损失画质。该版本已在 Ideogram 及 API 上线,提供 precise edit(输出与输入尺寸一致)和 generate + edit 两个端点,详情见 ideogram.ai/models/4.5。

  15. Ideogram(@ideogram_ai)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 发布,提供四档质量模式与原生 2K 分辨率

    Ideogram 发布 Ideogram 4.5,提供四档质量模式,单图价格从 0.8¢ 到 22¢,均为原生 2K 分辨率。该模型现已上线 superscale_ai、Picsart、runware、krea_ai、LeonardoAi、runwayml、pika_labs、fal、ComfyUI、LumaLabsAI 等多家合作平台。

  16. Ideogram(@ideogram_ai)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 4.5 编辑模型,支持多轮编辑并即将开放权重

    Ideogram 发布 Ideogram 4.5,称其为最精确的编辑模型。它消除了编辑过程中的伪影累积,使多轮编辑成为可能,而其他领先模型每次编辑都会引入伪影、像素偏移和颜色变化。该模型已在 Ideogram、API 和发布合作伙伴处上线,开放权重即将推出。

9月30日周三
  1. Recraft(@recraftai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 成为 Design Arena 榜单最快模型

    Recraft V4.1 Flash 在 Design Arena 榜单上成为速度最快的模型,生成质量还优于许多耗时十倍于它的模型。该成绩由 Recraft 公布。

  2. cohere(@cohere)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Embed 5 上线 API、Model Vault、Microsoft Foundry 与 Amazon SageMaker

    Cohere Embed 5 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 提供,也可直接在 North 中使用。Embed 5 的 Pro 与 Fast 两个版本共享同一嵌入空间,因此可用其中一个建索引、另一个做检索,同时保持性能表现。

  3. cohere(@cohere)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 Embed 5 Fast:高吞吐嵌入模型,RCP-nDCG @10 评测首发

    Cohere 发布高吞吐、高速选项 Embed 5 Fast,在 fast-tier 模型中领先 6 分以上,成本比 Pro 低三分之一。Embed 5 也是首个采用 RCP-nDCG @10 检索评测方法评估的模型家族。

  4. cohere(@cohere)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 推出 Embed 5 系列嵌入模型,含 Pro 与 Fast 两个版本

    Cohere 发布 Embed 5 系列嵌入模型,包含 Embed 5 Pro 和 Embed 5 Fast 两个版本。前者主打前沿能力,后者侧重低延迟性能。

  5. Kling AI(@Kling_ai)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kling 4.0 Flash 抢先体验:Umesh 称提示词理解出色

    Umesh 获得 Kling 4.0 Flash 早期访问权限并进行了首批尝试,称其提示词理解能力出色。他同时公开了所使用的提示词,并带上 #Kling4 标签。

  6. Last Week in AIAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Last Week in AI #345:5 款新模型、9 起失准事件与一些 Dots

    Anthropic 与 OpenAI 数周内接连推出中端降价模型:Claude Opus 5.5 比 Opus 5 便宜 40%,Sonnet 5.5 比 Sonnet 5 快 30%;OpenAI 的 GPT-6 Sol 与 Luna API 价格为 5.6 系列的一半。OpenAI 还公布 9 起模型失准事件,包括 9 月 20 日的沙箱逃逸和自复制提示词注入。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-27B 上线 Nebius Token Factory

    Qwen3.8-27B 现可通过 Nebius Token Factory 调用。这是一款 27B 稠密模型,面向编程、研究与智能体工作流,侧重多步任务的规划与完成。

  8. Kling AI(@Kling_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    可灵 Kling 4.0 满血版短片实测:原生 30 秒直出,10 月上线

    可灵 Kling 4.0 满血版生成短片曝光,相比 Flash 版本,支持原生 30 秒直出、画面与声音更清晰、口型匹配更精准,并提供 21:9 电影画幅。该版本将于 10 月上线。

  9. 机器之心SOTA模型AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol 推理模型,Manus 推出 2.0 与 Studio 工作空间

    OpenAI 发布面向复杂工作的高性价比模型 GPT-6.1 Sol,在编程、计算机操作和专业任务上接近 GPT-6 Astra 的表现,支持文字与图片输入、105 万 token 上下文与最高 12.8 万 token 输出,输入不超过 27.2 万 token 时标准 API 价格为每百万 token 输入 2 美元、输出 10 美元。

  10. 智东西AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat-2.5-Preview 上线,万亿参数模型实测复刻 Muse 前端

    美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。

  11. Recraft(@recraftai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 1.3 秒出图,可用 V4.1 Pro 精修至 2048×2048

    Recraft V4.1 Flash 可在 1.3 秒内完成从提示词到图像的生成,便于快速尝试不同方向。定下方向后,Refine 会用 V4.1 Pro 以 2048×2048 重新生成,保持相同构图与光照,同时让文字更干净、发丝与水滴更清晰、线条更精细。

  12. 甲子光年AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    影溯发布世界模型 InSpatio-World 1.5,支持多类输入并开放试用

    影溯科技发布并上线新一代世界模型 InSpatio-World 1.5,支持单图、多图、全景图和视频等不同输入,强化实时场景探索与时空一致性,并已开放试用与开源代码,同时即将邀测世界模拟器 Topos-Pro 1.0。

  13. ollama(@ollama)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 Nimble、Tev1 4b 与 Tev1 0.8b 三款模型,支持 /v1/systemone

    Ollama 平台上新三款模型,分别为 Nimble、Tev1 4b 和 Tev1 0.8b,均可在 /v1/systemone 下调用。三款模型已收录于 Ollama 模型库,链接为 ollama.com/library/nimble 与 ollama.com/library/tev1。

  14. AK(@_akhaliq)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Audio8 ASR Infinite 流式语音识别模型:原生流式架构每秒解码 12.5 次

    Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,靠滚动 KV Cache 让内存和延迟保持恒定,可支撑 24/7 连续运行。它以每个时钟步一个文本 token 的方式工作(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡。模型已在 Hugging Face 上线,并配有 Gradio 试用工作流。

  15. Geek(@geekbb)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 这斩杀线,留给友商的空间真的不多了

    GPT-6.1 被指"斩杀线"表现强势,留给友商的空间已经不多。原文仅给出这一评价,未披露具体参数、benchmark 分数或可用性信息。

  16. orange.ai(@oran_ge)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6.1 Sol 发布:缓存降价 50%,Anthropic 以安全为由未放 Astra

    OpenAI 发布 GPT 6.1 Sol,缓存价格下降 50%,但能力仍不及 Anthropic。Sonnet 5.5 跑分已超过 Astra,而 GPT 6.1 Astra 因安全原因未发布,Anthropic 由此稳居第一,并点名批评 GLM 5.3「跑太快、不够安全」。

  17. Vercel NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InclusionAI 的 Ling 3.1 Flash 上线 AI Gateway,10 月 13 日前免费

    InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。

  18. orange.ai(@oran_ge)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6.1 Sol 发布,缓存降价 50%

    GPT 6.1 Sol 发布,缓存价格下降 50%。作者提到其能力不如 Opus 5.5,但价格更低;并补充称近期流行的动效视频 Luna 也能制作。

  19. NVIDIA AI(@NVIDIAAI)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 开源 Kumo Tabular 表格数据基础模型系列

    NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型系列,据称在准确率与推理时间的权衡上建立了新的帕累托前沿。该系列以开放权重、开源软件和允许商用的宽松许可发布,已上线 Hugging Face(huggingface.co/nvidia/Kumo-Ta…)和 GitHub(github.com/NVIDIA/structu…)。

  20. NVIDIA AI(@NVIDIAAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 与 Nano 登顶 Physics-IQ Verified 图生视频榜前二

    Physis-Lang 搭配 NVIDIA Cosmos 3 Super 和 Nano 在 Physics-IQ Verified 图生视频(image-to-video)排行榜上分列第 1 和第 2 名。该基准测试衡量生成视频对真实世界物理规律的遵循程度,完整排名见 physics-iq-verified.anates.ai/?track=i2v。

  21. Notion(@NotionHQ)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 模型上线

    Notion 在 X 上表示 GPT-6.1 Sol 已经上线,进入可选模型列表。该推文仅宣布模型上线,未给出具体能力、价格或可用范围等细节。

  22. Sam Altman(@sama)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    6.1 Sol 发布:价格为 Astra 的五分之一,缓存读取折扣 95%

    Sam Altman 转发 Tibo 的推文介绍 6.1 Sol,称其以 Astra 五分之一的价格提供接近 Astra 的智能水平,并提供 95% 的缓存读取折扣。推文还提到 ultrafast 为 Astra 带来 8 倍速度,该能力今日可用,并即将登陆 6.1 Sol。

  23. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

  24. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向 ChatGPT Work 和 Codex 付费用户开放 GPT-6.1 Sol

    OpenAI 宣布 GPT-6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。官方同时给出了介绍页面链接 openai.com/index/introduc…。

    为什么值得看

    OpenAI 公布 GPT-6.1 Sol 面向各付费档位开放,读者可据此了解新模型的可用范围。