Astra 可从 mel 频谱图零样本识别声音
Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。
Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。
OpenBMB 开源 MiniCPM5-2B,这是一个 2B 参数语言模型,主打端侧高智能密度,可在手机上本地离线运行,面向智能体、编码与工具调用优化。
Genspark 宣布 Muse Spark 1.3 已在其平台上线,覆盖 AI Chat、Code Agent 和 Claw。该模型被描述为 Meta 面向智能体时代的最强模型,在内部对比中比 Muse Spark 1.2 减少约 20% 工具调用和约 25% token 消耗。
腾讯混元发布 Hy4 preview 升级,针对用户反馈的复杂任务中长思考与过度验证问题做了优化,现已向所有人开放。官方称任务质量不变,轮次更少、输入输出 token 更低,基准测试与人工评测均已确认,并邀请用户在 WorkBuddy(WorkBuddy.ai)上试用并反馈问题。
Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。
GPT 6 Astra 发布后,社交平台上出现了一条以"人类幼崽"为题的视频内容,该帖获 254 条回复、74 次转发、838 次点赞和 180337 次浏览。原文未披露 GPT 6 Astra 的具体功能、参数或可用性信息。
有用户发现 GPT 6 Astra 上线后,Codex 里的生图效果明显更加精致,一度以为 GPT image 2.5 已经推出。经搜索后其判断,这一变化估计仍是 Astra 本身能力更强所致。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。
GPT 6 Astra 已在 Poe 平台上线,用户可直接试用并与其他领先模型对比。Poe 称其推动 AI 前沿,未披露参数量、上下文长度或跑分数据。
OpenAI 的 GPT-6 Astra 已在 Work/Codex 中向全部 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,Plus 和 Business 用户将在之后开始逐步 rollout。
原文给出 GPT-6 Astra 已向哪些用户开放与后续节奏,读者可据此判断自己何时能用上。
Google 发布 Lyria 3.5,并集成进 Gemini。作者在预览阶段试用后表示其生成音乐的方式相当易用,提供 24 个可直接使用的模板、对歌词的完整控制以及 17 种风格。
World Labs 发布 Atlas,称其为首个多模态世界模型,可生成图像和视频帧,并具备像素级精确的相机控制,还能将这些帧重建成3D。官方描述称其可建模世界、移动相机并模拟空间与时间。李飞飞转发该消息并指向更多 Atlas 内容。
World Labs 发布面向空间智能的世界模型 Atlas,其核心是新视角预测,并称它是首个统一像素生成与像素重建的模型。团队表示这让数字化采集一个空间三维表示所需的数据量减少 50 到 100 倍,过去一个房间需要 100 到 300 张照片,Atlas 只需三张。
Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。
GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。
Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。
作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。
Stanford AI Lab 毕业生 Yann Dubois 表示 Astra 已发布,主要变化包括更聪明、更对齐可信赖以及更好的 CUA 能力,并展示了 Astra 用 Blender 搭建的房子。他同时指出仍存在代码冗余过多、请求确认过于频繁等问题,并提醒 Astra 比 5.6 更严格遵循指令,包括旧技能中隐藏的不必要指令,建议使用前先清理。
Greg Brockman 引用 ARC Prize 消息称 ARC-AGI-3 现在已被刷满。OpenAI 的 GPT-6 Astra 在该基准上取得 SOTA:Astra 在 ARC-AGI-3 上得分 63%,通过新的 provider adapter harness 达到 99%,在 96% 的 ARC-AGI-3 关卡上超过人类表现,并构建出目前所见最精确的新环境符号模型。
OpenAI 发布 GPT-6 Astra,Greg Brockman 称其在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上达到当前最优水平。
OpenAI 的 Greg Brockman 在 X 上发布 GPT-6 Astra,并附上官方页面链接 openai.com/index/gpt-6-as…。该推文未披露模型能力、版本细节或开放范围。
OpenAI 宣布 GPT-6 Astra 今日起向有限数量的组织推送,未来几天将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。官方建议在获得访问权限后下载 ChatGPT 桌面应用以获得最佳 Astra 体验。
OpenAI 的 ChatGPT 账号宣布推出 GPT-6 Astra,称其为进入 Chat 的新星,原帖附带一段视频但未给出具体能力说明。
ChatGPT 官方账号称 GPT-6 Astra 在六项能力上达到 state-of-the-art,分别是电脑操作、浏览、智能体编码、网络安全、科学和专业工作。该推文未给出具体的评测基准名称、分数或模型开放时间。
Google DeepMind 和 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,预测能力比 WeatherNext 2 精细最多 5 倍。
Google DeepMind 的 WeatherNext 3 在全球降水预报上实现重大突破,误差最高降低 50%,此前全球天气模型难以准确预测降雨,往往只能给出模糊估计或漏掉强风暴边界。改进幅度最大的区域正是历史上预报可靠性较低的地区。
Google DeepMind 联合 Google Research 推出 WeatherNext 3,该模型直接从真实世界实时观测数据中学习,能更快给出更本地化、更精准的预测。官方称这是全球天气预报方式的重大突破。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接使用实时地球静止卫星数据训练,可逐小时生成天气预报,温度和湿度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 的 25 公里网格清晰约五倍。
MAI-Transcribe-2 语音转录模型发布,速度比 GPT-Transcribe 快 10 倍、比 Gemini 3.5 快 5 倍。该模型在 Artificial Analysis 准确率-延迟帕累托前沿排名第一,定价为市场最低。
Gemini 3.8 Flash 正在公开征集早期使用反馈,询问用户希望在哪些方面改进。该帖获得 945 条回复、1233 次点赞和 188485 次浏览。
MiniMax 发布 H3 Max Turbo 预览版,这是 H3 Max 的更快、更省成本版本,运行速度为 H3 Max 的 2 倍、成本减半,同时在自家评测中达到原版 H3 Max 质量表现的第 97 百分位,并仍优于 H3 及其他视频模型。该版本保留 H3 Max 的提示词理解、美学和整体质量,生成时间减半;促销价下 768p 视频为每秒输出 0.01 美元,促销期持续两周。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。
Anthropic 的 Claude Fable 5.1 已在 Poe 平台上线,Poe 称其为 Anthropic 目前能力最强的模型,面向高难度推理和长时程智能体任务。该模型支持 1M token 上下文窗口、网页搜索,以及从低到最高的自适应思考档位。
Gemini 3.8 Flash 在 cursor bench 上达到 69.9%,单任务成本为 2.38 美元。该信息来自一条简短的 X 推文,未给出评测设置或对比数据。
Google 发布 Gemini 3.8 Flash Cyber,称相比 3.5 代有大幅提升,是迄今能力最强的防御模型之一。该模型专为安全团队设计,可用于大规模编写修复漏洞的新代码,即补丁生成;Google 已用它保护自身代码,帮助 Chrome 团队生成比顶级商业模型多 2.6 倍的正确答案补丁。
Google DeepMind 的模型在 CyberGym 等基准测试中领先,能自主发现软件弱点,同时保持快速高效。在 Google Chrome 代码库的真实测试中,它产出的有效修复数量是此前的 2.6 倍,帮助更快保护软件。
Google DeepMind 发布 Gemini 3.8 Flash Cyber,称其面向防御方提供专家级漏洞检测和自动修补能力,帮助团队应对新出现的威胁。材料仅给出该说法,未披露模型细节或可用入口。
Gemini 3.8 Flash 发布,这是 Gemini 在不到一个月内的又一次升级,也是 6 周内第 3 个更新的 Flash 模型,智能体与编程能力再度提升。同时推出的 Gemini 3.8 Flash Cyber 面向网络安全防御前沿。更多模型与网络安全工作细节见官方博客。