跳到正文

全部动态

今日 0 条
9月22日周二
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aikido 推出开源权重安全模型 Altar-1,基于 GLM 5.3 剪枝量化

    Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。

  2. eric zakariasson(@ericzakariasson)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,并在视频编辑上表现突出

    Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。

  3. eric zakariasson(@ericzakariasson)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 实战用例:飞行模拟器对比 GPT-6 Astra

    Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。

  4. v0(@v0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 在 v0 上线,9 月 27 日前 40% 折扣

    v0 宣布 Grok 4.7 已在其平台上线,9 月 27 日前提供 40% 折扣,可通过 v0.app 使用。引用内容显示 SpaceXAI 称 Grok 4.7 相比 Grok 4.6 有显著提升,价格与速度保持不变。

  5. Cognition(@cognition_labs)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 在 FrontierCode 1.1 上得分略低于 Grok 4.6

    Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。

  6. Paul Couvert(@itsPaulAi)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布开源多模态模型 MiMo-V2.6-Pro,权重已上线 Hugging Face

    小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态,权重已上传 Hugging Face。作者称其得分与 GPT-5.6-Sol Max 大致相当,输入 token 便宜 9 倍、输出 token 便宜 23 倍,也比 Opus 5 便宜约 20 倍。

  7. clem 🤗(@ClementDelangue)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布开源模型 MiMo-V2.6-Pro,登顶 Artificial Analysis 开源智能指数

    小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上得 46,成为该榜单最高分开源模型,前代 MiMo-V2.5-Pro 为 26。

  8. Browser Use(@browser_use)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,Long Horizon Browser Use Benchmark v2 得分 39.9 仍落后 DeepSeek

    Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。

  9. eric zakariasson(@ericzakariasson)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7 模型卡:Terminal-Bench 从 20.3% 升至 38.0%

    xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。

  10. AI SDK(@aisdk)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Grok 4.7

    Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。

  11. Harrison Chase(@hwchase17)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Gateway 免费托管 SemIf:JevBench 得分 75.4 逼近 jev 的 74.7

    Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。

  12. eric zakariasson(@ericzakariasson)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,称在相同价格与速度下较 4.6 有明显改进

    xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。

  13. xAI(@xai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 与 4.6 对比:构建开放世界城市游戏

    xAI 对比 Grok 4.7 与 4.6 构建开放世界城市游戏的效果,Grok 4.7 排在第一位、4.6 排在第二位。原帖附带两段演示视频,并给出 X 平台互动数据:150 条回复、299 次转发、3552 次点赞、654110 次浏览。

  14. xAI(@xai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,上线 Cursor、Grok Build 和 Grok API

    xAI 宣布 Grok 4.7 已在 Cursor、Grok Build 和 Grok API 中上线,并给出 x.ai/news/grok-4-7 的了解更多链接。

  15. xAI(@xai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,称在相同价格与速度下较 Grok 4.6 明显提升

    xAI 发布 Grok 4.7,官方称其在相同价格和速度下较 Grok 4.6 有明显提升。目前公开信息仅有这一句说明,未给出具体能力指标或开放方式。

  16. xAI(@xai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布 Grok 4.7,强化长任务处理、自检与安全防护

    xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。

  17. 向阳乔木推荐看AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok 4.7 上线,目前仅 Grok CLI 可用

    马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。

9月21日周一
  1. 魔搭ModelScope社区AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Convai Innovations 开源 421M 参数决策模型 Laya,33 毫秒完成 System 1 决策

    Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。

  2. 机器之心SOTA模型AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布 Step 5 Preview,千问开源 Qwen-Image-2.1,TypeSafe AI 开放 Jev

    阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。

  3. 谷歌开发者AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini Omni 创意实践:五位开发者如何用视频生成与编辑做演示

    Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。

  4. 卡尔的AI沃茨AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:网页复刻追平第一梯队,价格只要三分之一

    阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。

  5. Qwen(@Alibaba_Qwen)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 上线 Hugging Face Spaces 演示

    Qwen 发布 Qwen-Image-2.1,在 Hugging Face Spaces 提供可直接在浏览器试用的演示,无需本地配置。该模型为 7B 参数的原生图像生成与编辑模型,单 checkpoint 同时支持生成和编辑,最多可输入 10 张参考图,并自带提示词增强 LLM,已集成 diffusers 与 ComfyUI。

  6. 沃垠AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:五项任务表现如何

    作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。

  7. 腾讯技术工程AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聊聊最近爆火的 Jev 模型,到底是个啥?

    腾讯程序员实测 TypeSafe AI 于 9 月推出的决策模型 Jev,用 Codebuddy 做了一个网页小游戏 demo,一局游戏完成 6 次真实 API 调用,Jev 负责在预设动作中选择按键,地图、伤害和碰撞仍由游戏代码处理。

  8. Vercel NewsAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米 MiMo V2.6 Pro、Flash 与 Pro UltraSpeed 上线 Vercel AI Gateway

    小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。

  9. Vercel NewsAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 上线 SpaceXAI 的 Grok 4.7,9 月 27 日前调用享 40% 折扣

    Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。

  10. Paul Couvert(@itsPaulAi)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ConvaiInnovati 模型权重上线 Hugging Face 并开源 GitHub 仓库

    ConvaiInnovati 的模型权重已发布在 Hugging Face,同时 GitHub 上开放了配套仓库。原文未披露模型名称、参数规模、benchmark 分数或具体功能。

  11. Paul Couvert(@itsPaulAi)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Laya:类似 Jev 的开源分类系统,速度最高快 50 倍

    Laya 是一个开源分类系统,可在不到 1GB 内存下运行,已上线 Hugging Face,能在任何笔记本或手机上运行,演示中玩 Snake 达到 60 次决策/秒。目前上下文仅 1k,部分用例无法覆盖,泛化能力不如 Jev,但可按需轻松微调。

9月20日周日
  1. AK(@_akhaliq)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 上线 Hugging Face

    Qwen-Image-2.1 已在 Hugging Face 上线,可在 Hugging Face app 中访问对应 Space 页面。该消息由 AK(@_akhaliq) 发布,但原文未披露模型参数规模、benchmark 分数或开源许可等细节。

  2. Philipp Schmid(@_philschmid)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 演示与复现项目展示超快多模态模型的免费可用潜力

    Philipp Schmid 称赞 Jev 的一系列演示、复现和项目,认为它们展示了超快、多模态且足够便宜、可免费使用的模型能带来多少可能。他同时提醒,业界过于聚焦编码智能体,容易忽略 AI 还能做很多其他事情。

  3. Qwen(@Alibaba_Qwen)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 现已支持 ComfyUI

    Qwen-Image-2.1 现已支持 ComfyUI,采用开放权重,单个 7B checkpoint 同时支持图像生成与编辑。该模型可原生输出 2K 图像,单次最多基于 10 张参考图进行指令编辑,并支持带 alpha 通道的 RGBA 输出。

  4. Qwen(@Alibaba_Qwen)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    vLLM-Omni 首日支持 Qwen-Image-2.1,单模型搞定生成、编辑与透明图

    Qwen-Image-2.1 获得 vLLM-Omni 的 day-0 支持,可在一个模型内完成图像生成、编辑与透明图输出。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,配置方式与支持的组合已收录在 vLLM recipes 页面。

  5. Qwen(@Alibaba_Qwen)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 提升文字与肖像美学表现

    Qwen-Image-2.1 在视觉质量上超越前代,文字与肖像的美学表现提升尤为明显。官方同时展示了多组文字渲染示例。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 支持多种图像编辑任务并兼顾性能平衡

    Qwen-Image-2.1 支持多种图像编辑任务,并在这些任务间保持性能平衡。例如,给定一张角色三视图参考,该模型可生成完整的分镜故事板。

  7. Qwen(@Alibaba_Qwen)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 原生支持透明图像生成

    Qwen-Image-2.1 现已原生支持透明图像生成,并可直接对透明图像进行编辑。该版本主打透明图生成与透明图编辑两项能力,官方未公布更多参数与可用性细节。

  8. Qwen(@Alibaba_Qwen)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen-Image-2.1 图像生成模型并开放权重

    阿里 Qwen 团队发布 Qwen-Image-2.1,称其为 Qwen-Image 系列中兼顾均衡与成本效益的图像生成模型,并已开放权重。该模型统一支持生成与编辑,采用 7B 轻量架构,宣称推理速度大幅提升并优于多数闭源模型,原生支持 RGBA 透明图层的生成与编辑,编辑时最多可用 10 张参考图并做局部控制,覆盖全景图、信息图和虚拟试穿等场景。

  9. 袋鼠帝AI客栈AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃 Step 5 Preview 实测:接入 Claude Code 连跑三小时交付五个项目

    作者参与阶跃新一代旗舰模型 Step 5 Preview 内测,将其接入 Claude Code 完成五个项目:three.js 昆明 3D 网站跑了近 3 小时、把自研 Mac 截图工具 Ta 移植成 Windows 版、手机端 MD+HTML 阅读器墨读、广告小游戏复刻,以及网页虚拟机械臂接入 GLM-5.3-Flash 画画。

  10. 阶跃星辰AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃发布旗舰模型 Step 5 Preview:稀疏 MoE 架构,10 月 15 日开源

    阶跃发布面向真实世界 Agentic 任务的旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口并原生支持文本与视觉输入。

  11. Browser Use(@browser_use)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 表现提升但价格明显上涨,DeepSeek v4.1 Flash 更胜一筹

    GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。

9月19日周六
  1. Qwen(@Alibaba_Qwen)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布实时同传模型 Qwen3.8-LiveTranslate

    阿里发布新一代实时同传模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在 60 种语言上把平均滞后 LAAL 从 2.8 秒降至 2.3 秒,并提升忠实度、流畅度与简洁度。新能力包括多人语音的实时说话人分离并可稳定克隆保留各说话人音色、原文与译文同屏对照的双语显示,以及利用对话历史消歧名称和术语的长上下文能力。