跳到正文

#模型发布

今日 21 条
8月25日周二
  1. xAI(@xai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 的 Grok Voice Think Fast 2.0 登顶 Artificial Analysis Speech-to-Speech Index

    xAI 宣布 Grok Voice Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 上排名第一。该指数衡量语音智能体能否对听到的语音进行推理、解决真实客户问题,并通过智能体工具正确完成任务。

  2. Replicate(@replicate)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Wan 3.0 上线 Replicate,支持 30 秒单镜头视频与同步音频

    Replicate 上线阿里 Wan 团队的 Wan 3.0,称其可原生生成 30 秒单镜头视频并带同步音频。该内容为转载的模型上线信息,未给出更多参数、定价或开放范围细节。

8月24日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 结合 Cursor 数据,智能体效率大幅提升

    Grok 4.6 结合 Cursor 数据后,在长时间运行的 knowledge work 任务上所需轮次仅为其他领先模型的一半,轮次减少意味着复杂智能体应用的成本更低。该模型由 xAI 推出,官方同步放出了架构细节。

  2. 阿里研究院AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里视频生成模型Wan3.0正式上线,单次可生成30秒视频

    阿里视频生成模型Wan3.0于8月24日正式上线,单次可生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,在生成时长、参考一致性和真实世界还原等维度升级。

    为什么值得看

    原文给出Wan3.0的时长、文档输入与API定价,读者可据此判断它在短剧、广告等生产流程中的落地成本。

  3. Andrew Ng(@AndrewYNg)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 称赞 Marin 项目开放模型训练全过程

    Andrew Ng 表示,Marin 项目在模型训练上展现了开放性,公开了代码、数据、配方乃至实验结果。

8月23日周日
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Marin 535B-A23B 启动训练:全程开放,18.75T tokens、11 套 GB200 NVL72 跑约 3 个月

    Percy Liang 宣布 Marin 535B-A23B 本周开始训练,全程开放。预训练(80%)加中期训练(20%)共 18.75T tokens,用 11 套 GB200 NVL72 跑约 3 个月,约 2.7e24 FLOPs,之后进行后训练。

8月22日周六
  1. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 称 Gemini 3.7 是迄今增长最快的模型发布

    Google 的 Logan Kilpatrick 表示,Gemini 3.7 是他们迄今增长最快的模型发布,并对目前的接受度感到惊喜。该推文未披露具体用户或调用数据。

  2. Sundar Pichai(@sundarpichai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 成为 Google 增长最快模型,ARC-AGI-2 得分 84.6%

    Google 的 Gemini 3.7 Flash 首周打破了此前 Gemini 的增长纪录,成为 Google 增长最快的模型,目前已接入 Search 和 Gemini app。ARC Prize 公布的评测数据显示,该模型在 ARC-AGI-2 上得分 84.6%、每任务 0.25 美元,在 ARC-AGI-1 上得分 95.5%、每任务 0.12 美元,以低成本和高分在前沿模型中较为突出。

    为什么值得看

    Google CEO 给出 Gemini 3.7 Flash 首周增速与 ARC-AGI 两项成绩,可据成本与分数判断其定位。

  3. Windsurf(@windsurf_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 Sol 成为 Devin Desktop 与 Devin CLI 上最实惠的前沿模型

    OpenAI 将 GPT-5.6 Sol 价格下调 20%,为期 3 个月,叠加此前 70% 折扣后,至 10 月 3 日可享原价 76% 的优惠。Cognition 称 GPT-5.6 Sol 现为 Devin Desktop 和 Devin CLI 上最实惠的前沿模型。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布挑战 OpenAI 与 Anthropic,Anthropic 为 Claude 加水印,阿里开源 Qwen3.8 Max

    SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。

8月21日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4-Flash-Vision-Exp 展示多模态智能体能力

    DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。

  2. DeepSeek(@deepseek_ai)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台

    DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,这是一款实验性多模态模型,文本能力与 DeepSeek-V4-Flash 持平,涵盖智能体、推理和世界知识。

  3. DeepSeekAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线多模态 API

    DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,用户可通过设置 model='deepseek-v4-flash-vision-exp' 调用。

  4. Microsoft Research BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并集成至 Psi4、FHI-aims、ORCA、VASP

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首个公开版本增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,以 meta-GGA 的计算成本超越当前最昂贵的全局杂化泛函。

8月19日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hyra 数学能力再进阶:3D Blaschke–Lebesgue 等四项问题取得新进展

    腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。

  2. ollama(@ollama)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上线 Kimi K3 模型页面

    Ollama 模型库新增 Kimi K3 页面,地址为 ollama.com/library/kimi-k3。该条目已获 21 个点赞、10871 次浏览,相关数据由 xgo.ing 提供。

  3. 智谱AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 上线,API 开放且权重下周五开源

    智谱 GLM-5.3 正式上线并开放 API,在 Artificial Analysis Intelligence Index 中取得 60 分,进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 处于同一水平,并与 Kimi K3 并列开源模型第一。

  4. Windsurf(@windsurf_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 Sol 在 FrontierCode 1.1 上的表现解读

    GPT-5.6 Sol 在 FrontierCode 1.1 上的性能表现已有详细解读,原文链接指向 devin.ai 的博客。该内容由 Windsurf 转发分享,但正文未给出具体分数或评测细节。

  5. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MAI-Image-2.6 在文生图与图像编辑榜单分列第 2、第 3

    MAI-Image-2.6 在文生图 benchmark 排名第 2,同一模型在图像编辑排行榜上拿下第 3。该模型由此被定位为可胜任各类图像生成任务的全能选手。

  6. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI-Image-2.6-Preview 登 Arena.ai 图像编辑榜第 3,超越 Google Nano Banana

    微软 AI 的 MAI-Image-2.6-Preview 在 Arena.ai 单图编辑榜以 1,420 分升至第 3 名,较 MAI-Image-2.5 提升 19 分、排名从第 5 前进两位,超过 Google Nano Banana 和 Meta Muse Image。

8月17日周一
  1. 哔哩哔哩技术AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哔哩哔哩发布 IndexTTS 2.5,支持五语种零样本配音并提速约 2.28 倍

    哔哩哔哩 Index 语音团队发布 IndexTTS 2.5,支持中、英、日、西、阿五语种零样本配音,开放语速控制,并补齐上代的速度短板。

8月15日周六
  1. Interconnects AI — Nathan LambertAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 发布:中国实验室如何跟上前沿

    Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。

    为什么值得看

    以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。

  2. Augment Code(@augmentcode)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 接入 Cosmos 三天,创下该平台最快采用曲线

    Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)

  3. Google Gemini App(@GeminiApp)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 向 Pro 和 Ultra 用户开放

    Google 宣布 Gemini 3.7 Flash 已面向所有 Pro 和 Ultra 用户在 Gemini 聊天中开放。官方称此次模型更新提升了多步任务的推理能力与准确率,例如把数十个文件和邮件整合成一份总文档。

8月14日周五
  1. Paul Couvert(@itsPaulAi)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里开源 Qwen3.8-27B 多模态模型,27B 参数对标 Opus 4.6 Max

    阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。

    为什么值得看

    原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。

  2. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:Gemini 4 是迄今最具雄心的预训练

    Logan Kilpatrick 称 Gemini 4 是迄今最具雄心的预训练。该说法转自 @haider1,原帖为 Gemini 4 预热内容,目前仅披露预训练定位,未公布参数规模、benchmark 分数或发布时间。

  4. Varun Mohan(@_mohansolo)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 上线 Google Antigravity,API 成本减半

    Google Antigravity 宣布 Gemini 3.7 Flash 上线,称其为面向编码和智能体任务的最强主力模型,可下载或升级 Antigravity 试用。原推作者(Varun Mohan)转发时评价能力大幅提升且 API 成本减半。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash

    Google 发布 Gemini 3.7 Flash,作者称其是同等智能水平下效率最高的模型之一,表现优于 Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2。

  6. Google AI Developers(@googleaidevs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,主打编码与智能体任务

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体任务最智能的主力模型,带来更高的指令遵循、首轮代码准确率和智能体任务执行质量。

  7. Patrick Loeber(@patloeber)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 发布,价格较 3.6 Flash 降低 50%

    Gemini 3.7 Flash 发布,相比 3.6 在多项任务上有较大提升。Logan Kilpatrick 介绍该版本速度快,价格比 3.6 Flash 低 50%(截至年底),并在约 3 周内依靠算法改进实现智能水平明显提升,已在 API、AI Studio、Antigravity 等平台上线。

  8. Demis Hassabis(@demishassabis)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 发布,软件工程与网页开发能力升级

    Google DeepMind 发布 Gemini 3.7 Flash,在软件工程、网页开发和知识工作方面带来较大升级。该版本的首发价格为原 Gemini 3.6 Flash 成本的一半。Demis Hassabis 表示这一版本在编码、知识工作和网页开发上更强。

  9. Google AI(@GoogleAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 3.7 Flash,Pro 与 Ultra 订阅者可在 Gemini App 中体验

    Google 宣布 3.7 Flash 上线,Google AI Pro 与 Ultra 订阅者即日起可通过 Gemini App 中的 Spark 体验该模型。

  10. Google AI(@GoogleAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,面向编码与智能体并推出半价优惠

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。

    为什么值得看

    Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。

  11. Sundar Pichai(@sundarpichai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周

    Google 在 3.6 Flash 发布仅三周后推出 3.7 Flash,称其在编码和智能体任务上有显著提升,并在软件工程、知识工作和网页开发方面带来改进,首发价格为 3.6 Flash 原价的一半。该模型已在 Antigravity 中供 Google 内部工程师使用,同时通过 Gemini API 在 Google AI Studio、Gemini Enterprise 等渠道提供。

  12. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash:价格较 3.6 Flash 低 50%,智能水平提升

    Google 发布 Gemini 3.7 Flash,官方称其速度很快,价格比 3.6 Flash 低 50%(优惠持续至年底),并在约 3 周内通过算法改进实现智能水平明显提升。该模型已在 API、AI Studio、Antigravity 等渠道上线。

    为什么值得看

    Google 员工发布 Gemini 3.7 Flash,价格与推理提升幅度及可用渠道都给出了具体数字。

  13. Google DeepMind BlogAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,输入百万 token 0.75 美元

    Google DeepMind 发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 仅三周,定位为面向编码和智能体的主力模型。

  14. Google DeepMind(@GoogleDeepMind)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 3.7 Flash,在调试与问题解决等编码任务上升级

    Google DeepMind 发布 3.7 Flash,相比 3.6 Flash 在调试、问题解决等关键编码任务上有明显提升,并能用更少提示词设计更实用的网页布局和应用,在真实业务工作流中的推理与准确率也有改善。

  15. Google DeepMind(@GoogleDeepMind)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,官方称其在编码、知识工作和网页开发方面表现更强。该条推文未披露具体参数、价格或开放范围。

8月13日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro

    DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。