在 AI SDK 中使用 Grok 4.6
AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。
AI SDK 现已支持 Grok 4.6。xAI 发布的 Grok 4.6 相比 Grok 4.5 在同等价格下带来前沿智能水平的显著提升。
xAI 发布 Grok 4.6,已在 Grok Build、Cursor、Grok Bot 和 API 中可用。首周在 Cursor 和 Grok Build 内提供 2 倍用量,详情见 x.ai/news/grok-4-6。
xAI 发布 Grok 4.6,称其速度超过同类模型,且能处理比 Grok 4.5 更具挑战性的任务。定价为每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,为其他前沿模型价格的一半。
xAI 发布 Grok 4.6,称其具备前沿智能水平,相比 Grok 4.5 有显著提升,且保持相同价格。
Google DeepMind 的 SL2T 在学术基准上达到 SOTA,并针对单手打手语等真实使用场景做了优化。为保护隐私,它在设备端追踪身体姿态,再由服务器将其翻译为文本。
Google DeepMind 发布手语转文本模型 SL2T,并已在 Android 上线相关功能。首批支持美国手语转英文、落地 Pixel 11,用户可直接在 Gboard 和 Live Transcribe 中用手语输入,无需打字。
Google DeepMind 推出大规模多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中上线手语转文字听写功能,首批支持美国手语(ASL)转英文,更多设备与语言将陆续跟进。
Qwen 3.8 27b 将于周三美国东部时间上午 11:00 发布。有用户称其热度甚至会超过 @UseCorgi cafe,并表示人们排起长队等待体验这款新模型的能力。
Qwen3.8-2.4T-A95B 以开放权重模型形式发布,并已在 Modal 上线。相比 Qwen 3.7,新模型在编码、工作、研究和长周期任务上有明显提升;Modal 称提前与 Qwen 合作实现 day zero 支持 Auto Endpoints,底层由 SGLang 和针对 Qwen3.8 结构调优的 DFlash 推测器支撑。
Mustafa Suleyman 宣布最新代码模型上线 GitHub Copilot,相比 6 月发布的模型效率提升 25%、质量更高、成本仅为四分之一。他邀请用户在 GitHub Copilot 中试用该模型。
Meta 发布新的开放权重模型 Muse Glimmer,扎克伯格同时披露 Muse Spark 1.2 即将推出,并阐述其个人超级智能愿景:一个 24/7 面向所有人可用的 AI 智能体,可覆盖工作、学习、人际关系与心理健康等场景。Meta 还宣布在相关人才与社区上投入,包括 America's Workforce Academy 以及与其数据中心扩张挂钩的 10 亿美元社区基金。
Meta 宣布开放 Muse Glimmer 的模型权重,这是一个可在本地运行的 30B 参数稠密模型,Muse Spark 1.2 的权重也将在不久后发布。扎克伯格称 Meta 是开源的支持者,并向 @alexandr_wang 和 MSL 团队致意。
微软的 MAI-Image-2.6 在 Text-to-Image Arena 以 1336 分位列第二,比第一名的 GPT Image 2(Medium)低 45 分,领先第三名 Grok Imagine Image 2.0(Low)20 分,超过 Nano Banana、Meta 等对手。
吴恩达公开致谢 Mark Zuckerberg、Alexandr Wang 及 Meta 团队对开放权重 AI 的贡献。所引 Mark Zuckerberg 表示 Meta 当天开放 Muse Glimmer 的权重,这是一个可本地运行的 30B 参数稠密模型,并称不久后还将发布其最新基础模型 Muse Spark 1.2 的权重。
Meta 发布 30B 参数稠密模型 Muse Glimmer 并开放权重,该模型可本地运行。扎克伯格同时表示将很快开放其最新基础模型 Muse Spark 1.2 的权重,并称 Meta 是开源的支持者。
MiniMax H3 技术团队在周五晚的 Reddit AMA 和 ComfyUI Live 直播中,回应了模型架构、长视频续写、画质局限与后续开源计划等问题。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其在预测气旋路径、强度和风场结构上达到 SOTA。
Google DeepMind 公开气象模型权重与代码,并说明其预报精度提升大致相当于十年气象学进展。
腾讯发布混元 Hy3,官方称其为实用 AI 设计,兼具旗舰级性能与紧凑、低成本的特点,并带入先进的推理与 Agent 能力,覆盖研究、编码、办公生产力、设计和云工作流。该模型现已在腾讯产品、API 和开发者平台上面向全球开放,官方给出官网 hy.tencent.ai、OpenRouter 上的 API 定价页,以及 WorkBuddy、Miora、腾讯云 TokenHub 等入口。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,实现边看、边听、边说的实时交互;模型已在豆包 App 全量上线,选择打电话进入视频通话即可体验。
字节跳动公布音视频全双工模型的统一架构与端到端人评结果,可对照级联方案理解实时交互的改法。
Mistral 的 Shieldstral 现以 Apache 2.0 许可开放,可在 Hugging Face 上获取并使用。该模型由 Mistral AI 发布,官方同时给出了试用链接。
黑森林实验室的 FLUX 3 Video 已在 Replicate 上线,该多模态模型覆盖视频、音频、图像和动作预测,本次先放出视频能力。它支持生成最长 20 秒、最高 1080p 的视频,具备原生音频、文生视频、多帧图生视频、视频续写和多语言对话,并提供 Draft 模式以更低成本快速试想法,可通过 API 或常用工具使用;2K、4K 和开放权重版本即将推出。
Mistral 发布 Shieldstral,一个 3B 开源权重的内容安全模型,可在设备端部署。官方给出 mistral.ai/news/shieldstral 链接,未披露更多能力细节。
Mistral 推出多模态内容审核模型 Shieldstral,可在单张 16GB NVIDIA GPU 上运行,官方称其效率为业界领先。该模型还允许企业对"何为安全内容"进行自定义控制。
微软发布 PRISM2,一个用病理图像和真实病理报告语言训练的多模态基础模型。仅靠简单问答,PRISM2 在多项基准任务上追平专用癌症检测系统,且无需为每项任务单独建模型。
腾讯 Hy ASR 3.0 preview 今日发布,由 Hy3 的语言能力驱动,主打精准语音识别加深度语义理解。官方称其在通用识别、上下文感知、多场景鲁棒性和方言覆盖上表现领先,多语言 WER 约为 3%,可将嘈杂的真实音频转成连贯转录并准确理解意图。
腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于 Hy3 大语言模型的语言理解能力,融合高精度语音识别与深度语义理解。开源评测集上多语种 WER 控制在 3% 左右,中文普通话 3.34%、英语 2.62%、粤语 3.12%。
MiniMax H3 开源后 24 小时内,超百家合作伙伴完成 Day 0 适配和接入,其中包括华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 共 9 家国内外芯片厂商。
可了解 MiniMax H3 开源后 24 小时内的芯片与云平台适配名单,以及其在视频评测榜单中的位置。
jina-reranker-v3.5 在四个基准的质量-参数量对比中均处于 Pareto 前沿,评估范围内没有任何模型同时做到更小且更好。
Jina AI 发布 v3.5 重排序模型(reranker),同步公开博客、arXiv 论文(2607.18152)及 HuggingFace 模型页。
Jina AI 发布 jina-reranker-v3.5,这是一个 0.6B 的列表式重排序模型,改进了 v3 的交互方式,速度更快,并针对企业搜索数据做了优化。它在 BEIR 上取得 63.20 nDCG@10,以约 7 倍更少的参数超过 Qwen3-Reranker-4B。
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。
MiniMax 开源新一代通用视频模型 MiniMax H3,可统一理解文本、图像、视频和音频,生成最高 2K、最长 15 秒并带原生立体声音频的视频,稳定支持 11 种对话语言。
H3 开源了 33B 全模态生成主干,并说明稀疏注意力等模块后续才放出,读者可据此判断当前可复现到哪一步。
Google AI 汇总了近期多项发布。Gemini Robotics 2 由 Google DeepMind 推出,为机器人带来全身智能;Gemini 3.5 Flash-Lite 是速度最快。
腾讯混元 Hy-MT2 自 5 月开源以来累计下载量超 70 万,其中 Hy-MT2-1.8B 登顶 Hugging Face trending,30B-A3B 位列第 4。
DeepSeek-V4-Flash-0731 与预览版保持完全相同的模型架构和规模,本次升级只作用于 DeepSeek-V4-Flash API。DeepSeek-V4-Pro API 以及 App/Web 端模型暂未变动,官方称 V4-Pro 的正式发布将尽快到来。
DeepSeek-V4-Flash 官方 API 现已进入公测。官方称其 Agent 能力大幅升级,基准测试分数已明显超过 V4-Pro-Preview。V4-Flash 官方版原生支持 Responses API 格式,并已完整适配 Codex,配置细节见官方 API 文档 api-docs.deepseek.com。
DeepSeek-V4-Flash 官方 API 公测,Agent 能力大幅升级并原生支持 Responses API 格式,读者可据此判断接入方式与能力变化。
字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒,并支持多轮延长。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,强化了白模参考、运动参考、创意参考能力;编辑方面支持时间戳精准控制与定向修改,并升级绿幕、视角、参考编辑。
MiniMax 正式发布通用全模态生成模型 H3,支持文本、图像、视频、声音组成的多模态上下文理解,可输出原生双声道音视频,最高支持 15s 2K 分辨率。官方称在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2,并计划在未来几天内在符合法律法规的前提下开放模型权重,设计初期已考虑多款国产芯片兼容性。
MiniMax 官方给出 H3 的全模态生成能力、每秒价格对比与即将开源权重的安排,读者可据此判断视频生成领域的开放化进展。
Cognition 更新 FrontierCode 1.1,以反映 GPT-5.6 Terra 和 GPT-5.6 Luna 的新折扣,GPT-5.6 系列由此落在性价比效率的帕累托曲线上。Scott Wu 表示所有 Devin 用户都会自动看到成本下降。
Google DeepMind 发布 Gemini Robotics 2,这是一套面向机器人的新一代物理 AI 模型。官方称机器人现在可以推理每一个动作,完成此前无法实现的任务,例如系精细的绳结,并支持多机器人协作解决复杂工作流。该系列还为人形机器人带来全身智能与更高级的灵巧操作能力。
DeepMind 官方发布 Gemini Robotics 2,点出全身智能、精细操作与多机器人协作三项能力。