Thomson Reuters 发布法律金融领域专用模型 Thomson
Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。
Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。
OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。
面壁(ModelBest)发布 100% 开源的 MiniCPM5-2B,仅 2B 参数、2GB RAM 即可在任意笔记本甚至手机上完全离线运行智能体,支持编码、智能体和工具调用任务。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
Arena.ai 数据显示,OpenAI 的 GPT-Image-2.5-Sunburst 在 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单均排名第一,Flare 排名第二。
OpenAI 将于 9 月 16 日在旧金山举办 GPT-6 用户聚会,聊模型本身以及下一步该做什么,申请截止 9 月 10 日。此前 GPT-5.5 也曾办过同类活动。
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,主打精准、智能的实时转写。官方同时放出了详细介绍链接,未披露参数量、benchmark 分数或开放方式等细节。
DeepLearning.AI 称,近期走红的 Ox Alpha 模型已确认为智谱的 GLM-5.3-Flash。该模型为 320B 参数、每 token 激活 18B,采用线性注意力与稀疏注意力混合架构,在 GDPval AA v2 等真实任务上表现领先,单任务成本仅 0.09 美元。智谱此次大规模免费预览全部运行在中国产硬件上,用于验证内存优化可突破硬件限制。
Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。
OpenBMB 开源 MiniCPM5-2B,这是一个 2B 参数语言模型,主打端侧高智能密度,可在手机上本地离线运行,面向智能体、编码与工具调用优化。
腾讯混元发布 Hy4 preview 升级,针对用户反馈的复杂任务中长思考与过度验证问题做了优化,现已向所有人开放。官方称任务质量不变,轮次更少、输入输出 token 更低,基准测试与人工评测均已确认,并邀请用户在 WorkBuddy(WorkBuddy.ai)上试用并反馈问题。
GPT 6 Astra 发布后,社交平台上出现了一条以"人类幼崽"为题的视频内容,该帖获 254 条回复、74 次转发、838 次点赞和 180337 次浏览。原文未披露 GPT 6 Astra 的具体功能、参数或可用性信息。
有用户发现 GPT 6 Astra 上线后,Codex 里的生图效果明显更加精致,一度以为 GPT image 2.5 已经推出。经搜索后其判断,这一变化估计仍是 Astra 本身能力更强所致。
小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。
OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。
GPT 6 Astra 已在 Poe 平台上线,用户可直接试用并与其他领先模型对比。Poe 称其推动 AI 前沿,未披露参数量、上下文长度或跑分数据。
OpenAI 的 GPT-6 Astra 已在 Work/Codex 中向全部 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,Plus 和 Business 用户将在之后开始逐步 rollout。
原文给出 GPT-6 Astra 已向哪些用户开放与后续节奏,读者可据此判断自己何时能用上。
GPT-6 Astra 已在 Devin Desktop 和 Devin CLI 上线。在 FrontierCode 1.1 上,Astra 的成绩与 Fable 5 相差 0.4 分以内,成本却低 64%,并在内部测试基准上刷新 SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据。
DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。
Google 发布 Lyria 3.5,并集成进 Gemini。作者在预览阶段试用后表示其生成音乐的方式相当易用,提供 24 个可直接使用的模板、对歌词的完整控制以及 17 种风格。
World Labs 发布 Atlas,称其为首个多模态世界模型,可生成图像和视频帧,并具备像素级精确的相机控制,还能将这些帧重建成3D。官方描述称其可建模世界、移动相机并模拟空间与时间。李飞飞转发该消息并指向更多 Atlas 内容。
Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。
Google 在 Gemini 中上线 Lyria 3.5 音乐生成模型,官方称其为目前最先进的音乐生成模型,带来更丰富的编曲、更具表现力的人声和更高的保真度。用户可以选择音乐流派并选择人声或纯器乐,使用新模板,生成短曲或较长曲目。
GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。
Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。
OpenAI 的 GPT-6 发布反响首次在一年内超过 Claude 发布,Latent.Space 称这是此前认为今年不可能出现的巨大反转。swyx 表示已跨入 AI 工程的新时代,并称这只是他与 Astra 所做工作的一部分,后续报告将陆续在 LS 发布。
Cosmos 新增 GLM 5.3 Flash 和 Gemini 3.8 Flash 两款模型。智谱的 GLM 5.3 Flash 由 Fireworks AI 提供美国境内推理,价格比测试过的最强开源模型便宜一个数量级,智能水平与 Sonnet 5 相当;Google DeepMind 的 Gemini 3.8 Flash 在同一价格下智能较 Gemini 3.7 Flash 有明显提升。
Greg Brockman 引用 ARC Prize 消息称 ARC-AGI-3 现在已被刷满。OpenAI 的 GPT-6 Astra 在该基准上取得 SOTA:Astra 在 ARC-AGI-3 上得分 63%,通过新的 provider adapter harness 达到 99%,在 96% 的 ARC-AGI-3 关卡上超过人类表现,并构建出目前所见最精确的新环境符号模型。
OpenAI 发布 GPT-6 Astra,Greg Brockman 称其在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上达到当前最优水平。
OpenAI 的 Greg Brockman 在 X 上发布 GPT-6 Astra,并附上官方页面链接 openai.com/index/gpt-6-as…。该推文未披露模型能力、版本细节或开放范围。
OpenAI 宣布 GPT-6 Astra 今日起向有限数量的组织推送,未来几天将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。官方建议在获得访问权限后下载 ChatGPT 桌面应用以获得最佳 Astra 体验。
OpenAI 的 ChatGPT 账号宣布推出 GPT-6 Astra,称其为进入 Chat 的新星,原帖附带一段视频但未给出具体能力说明。
ChatGPT 官方账号称 GPT-6 Astra 在六项能力上达到 state-of-the-art,分别是电脑操作、浏览、智能体编码、网络安全、科学和专业工作。该推文未给出具体的评测基准名称、分数或模型开放时间。
Google DeepMind 和 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,预测能力比 WeatherNext 2 精细最多 5 倍。
Google DeepMind 的 WeatherNext 3 在全球降水预报上实现重大突破,误差最高降低 50%,此前全球天气模型难以准确预测降雨,往往只能给出模糊估计或漏掉强风暴边界。改进幅度最大的区域正是历史上预报可靠性较低的地区。
Google DeepMind 联合 Google Research 推出 WeatherNext 3,该模型直接从真实世界实时观测数据中学习,能更快给出更本地化、更精准的预测。官方称这是全球天气预报方式的重大突破。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接使用实时地球静止卫星数据训练,可逐小时生成天气预报,温度和湿度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 的 25 公里网格清晰约五倍。
MAI-Transcribe-2 语音转录模型发布,速度比 GPT-Transcribe 快 10 倍、比 Gemini 3.5 快 5 倍。该模型在 Artificial Analysis 准确率-延迟帕累托前沿排名第一,定价为市场最低。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
苹果 CEO Tim Cook 卸任,John Ternus 于 9 月 1 日正式接任;Anthropic 发布 Claude 5.1,GLM-5.3-Flash 以极高性价比推出。NVIDIA 计划以 129 亿美元收购 Hugging Face,OpenAI 公测 Ultrafast 模式并宣称提升 14 倍,还联合 Broadcom 研发 LLM 推理加速芯片。