Aikido 推出开源权重安全模型 Altar-1,基于 GLM 5.3 剪枝量化
Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。
Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。
Grok 4.7 已发布,据 @ryanvogel 称其在视频编辑方面表现出色,并附上演示视频链接。原帖未披露模型参数、基准分数或开放方式等细节。
Grok 4.7 在飞行模拟器生成任务中已能与 GPT-6 Astra 正面竞争。同一提示词下,GPT-6 Astra 综合质量仍排第一,Grok 4.7 紧随其后且差距出乎意料地小,Kimi K3 与 Fable 5.1 基本打平、输出更平滑。整体排序为 Astra > Grok ≈ Kimi ≈ Fable。
v0 宣布 Grok 4.7 已在其平台上线,9 月 27 日前提供 40% 折扣,可通过 v0.app 使用。引用内容显示 SpaceXAI 称 Grok 4.7 相比 Grok 4.6 有显著提升,价格与速度保持不变。
Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态,权重已上传 Hugging Face。作者称其得分与 GPT-5.6-Sol Max 大致相当,输入 token 便宜 9 倍、输出 token 便宜 23 倍,也比 Opus 5 便宜约 20 倍。
小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上得 46,成为该榜单最高分开源模型,前代 MiMo-V2.5-Pro 为 26。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。
xAI 公布 Grok 4.7 模型卡,多项基准较 4.6 明显提升:Terminal-Bench 从 20.3% 升至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,Legal Agent 从 15.8% 升至 19.6%,EEBench 从 60.0% 升至 66.0%。价格与 4.6 相同。
Grok 4.7 已发布,可在 AI SDK 中调用。相比 Grok 4.6,它在价格与速度不变的情况下有明显提升。
Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。
xAI 发布 Grok 4.7,称这是其目前最好的模型,已在 cursor、grok build、api 等渠道开放使用。官方表示 Grok 4.7 在相同价格和速度下相较 Grok 4.6 有明显改进,并给出了两者构建《帝国时代 II》的对比演示。
xAI 对比 Grok 4.7 与 4.6 构建开放世界城市游戏的效果,Grok 4.7 排在第一位、4.6 排在第二位。原帖附带两段演示视频,并给出 X 平台互动数据:150 条回复、299 次转发、3552 次点赞、654110 次浏览。
xAI 宣布 Grok 4.7 已在 Cursor、Grok Build 和 Grok API 中上线,并给出 x.ai/news/grok-4-7 的了解更多链接。
xAI 发布 Grok 4.7,官方称其在相同价格和速度下较 Grok 4.6 有明显提升。目前公开信息仅有这一句说明,未给出具体能力指标或开放方式。
xAI 发布 Grok 4.7,官方称其在困难任务上工作更持久、会更仔细检查自身结果,并配备迄今最强的安全防护措施。该推文未披露模型规格、开放范围或具体基准数据。
马斯克宣布 Grok 4.7 上线,他称其能力很强。该版本目前只在 Grok CLI 中可见,网页版和 Grok bot 都还没有。作者打算用开发植物大战僵尸的方式检验实际效果。
Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。
阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。
Gemini Omni 已向开发者开放,支持用文本、图像、视频或音频参考素材生成并编辑高质量视频,结合物理规律理解与 Gemini 现实世界知识。五位开发者展示了切换约 20 个拍摄视角、用语音指令改写昼夜与季节、借 Google Flow 涂鸦让柠檬变潜水艇等玩法。
阶跃星辰新模型 Step 5 Preview 实测显示前端 UI 复刻能力已追上第一梯队,排名较上个版本提升 13 名,与 K3 和 Grok 打平,价格仅为 K3 的三分之一。用一句话提示词即可复刻 Apple 官网首页,接入 Claude 框架后能从 72 页 PDF 中逐条提取数字、审计含 14 张工作表 1800 多条公式的 Excel 模型并揪出 22 个单元格错误。
Qwen 发布 Qwen-Image-2.1,在 Hugging Face Spaces 提供可直接在浏览器试用的演示,无需本地配置。该模型为 7B 参数的原生图像生成与编辑模型,单 checkpoint 同时支持生成和编辑,最多可输入 10 张参考图,并自带提示词增强 LLM,已集成 diffusers 与 ComfyUI。
作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。
腾讯程序员实测 TypeSafe AI 于 9 月推出的决策模型 Jev,用 Codebuddy 做了一个网页小游戏 demo,一局游戏完成 6 次真实 API 调用,Jev 负责在预设动作中选择按键,地图、伤害和碰撞仍由游戏代码处理。
小米 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 已上线 Vercel AI Gateway。
Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。
ConvaiInnovati 的模型权重已发布在 Hugging Face,同时 GitHub 上开放了配套仓库。原文未披露模型名称、参数规模、benchmark 分数或具体功能。
Laya 是一个开源分类系统,可在不到 1GB 内存下运行,已上线 Hugging Face,能在任何笔记本或手机上运行,演示中玩 Snake 达到 60 次决策/秒。目前上下文仅 1k,部分用例无法覆盖,泛化能力不如 Jev,但可按需轻松微调。
Qwen-Image-2.1 已在 Hugging Face 上线,可在 Hugging Face app 中访问对应 Space 页面。该消息由 AK(@_akhaliq) 发布,但原文未披露模型参数规模、benchmark 分数或开源许可等细节。
Philipp Schmid 称赞 Jev 的一系列演示、复现和项目,认为它们展示了超快、多模态且足够便宜、可免费使用的模型能带来多少可能。他同时提醒,业界过于聚焦编码智能体,容易忽略 AI 还能做很多其他事情。
Qwen-Image-2.1 现已支持 ComfyUI,采用开放权重,单个 7B checkpoint 同时支持图像生成与编辑。该模型可原生输出 2K 图像,单次最多基于 10 张参考图进行指令编辑,并支持带 alpha 通道的 RGBA 输出。
Qwen-Image-2.1 获得 vLLM-Omni 的 day-0 支持,可在一个模型内完成图像生成、编辑与透明图输出。该模型由 7.1B DiT 与 Qwen3-VL-8B 组合而成,配置方式与支持的组合已收录在 vLLM recipes 页面。
Qwen-Image-2.1 在视觉质量上超越前代,文字与肖像的美学表现提升尤为明显。官方同时展示了多组文字渲染示例。
Qwen-Image-2.1 支持多种图像编辑任务,并在这些任务间保持性能平衡。例如,给定一张角色三视图参考,该模型可生成完整的分镜故事板。
Qwen-Image-2.1 现已原生支持透明图像生成,并可直接对透明图像进行编辑。该版本主打透明图生成与透明图编辑两项能力,官方未公布更多参数与可用性细节。
阿里 Qwen 团队发布 Qwen-Image-2.1,称其为 Qwen-Image 系列中兼顾均衡与成本效益的图像生成模型,并已开放权重。该模型统一支持生成与编辑,采用 7B 轻量架构,宣称推理速度大幅提升并优于多数闭源模型,原生支持 RGBA 透明图层的生成与编辑,编辑时最多可用 10 张参考图并做局部控制,覆盖全景图、信息图和虚拟试穿等场景。
作者参与阶跃新一代旗舰模型 Step 5 Preview 内测,将其接入 Claude Code 完成五个项目:three.js 昆明 3D 网站跑了近 3 小时、把自研 Mac 截图工具 Ta 移植成 Windows 版、手机端 MD+HTML 阅读器墨读、广告小游戏复刻,以及网页虚拟机械臂接入 GLM-5.3-Flash 画画。
阶跃发布面向真实世界 Agentic 任务的旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口并原生支持文本与视觉输入。
GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。
阿里发布新一代实时同传模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在 60 种语言上把平均滞后 LAAL 从 2.8 秒降至 2.3 秒,并提升忠实度、流畅度与简洁度。新能力包括多人语音的实时说话人分离并可稳定克隆保留各说话人音色、原文与译文同屏对照的双语显示,以及利用对话历史消歧名称和术语的长上下文能力。