跳到正文

全部动态

今日 0 条
9月14日周一
  1. 小红书技术REDtechAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书 AllSpark 发布开源 Search Agent Iris,35B 版本逼近万亿参数模型

    小红书 AllSpark 团队发布 Search Agent Iris,权重与评测代码已开源,并计划陆续公布数据与训练完整配方。

9月13日周日
  1. LovartAI(@lovart_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-Image 2.5 演示:一句提示词让模型帮忙插花

    LovartAI 展示了一段 GPT-Image 2.5 的演示,用户只需说“GPT-Image 2.5, help me arrange the flowers.”,模型便能完成插花安排。该内容在 X 上获得 31 个点赞、7 条评论和约 2 万次浏览。

  2. Simon Willison(@simonw)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT Work 与 GPT-6 Astra 可根据地址生成 5K/10K 环形跑步路线

    ChatGPT Work 和 GPT-6 Astra(作者用的是 "Max")能基于 OSM 数据,从给定地址生成 5K/10K 环形跑步路线。该体验由 Simon Willison 分享,称其"挺不错"。

9月12日周六
  1. ChatGPT(@ChatGPTapp)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-VI ASTRA 发布

    GPT-VI ASTRA 亮相,相关视频已在 X 上发布,该帖获得 4431 次点赞、196 次转发和 298 条回复,浏览量达 550388。目前公开信息仅包含该视频演示,尚未披露模型参数、上下文长度或可用性细节。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 分享微软 MAI 模型详情链接

    Mustafa Suleyman 在 X 上发帖,引导读者前往 microsoft.ai/models/mai-tra… 了解该模型详情,正文未披露模型名称、参数规模或评测数据。

9月11日周五
  1. LovartAI(@lovart_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-Image 2.5 在像素艺术上表现出色

    GPT-Image 2.5 在像素艺术上表现出色,相关演示视频已在 Twitter 发布,获得 639 次点赞、48 次转发和 5.6 万余次浏览。该推文由 xgo.ing 提供支持。

  2. ollama(@ollama)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 在 Ollama 云全面上线

    DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。

  3. Hunyuan(@TXhunyuan)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元预告 Hy4 Preview 只是冰山一角,更多 AI 即将到来

    腾讯混元团队在北京接待 Ivan Fioravanti 后预告,Hy4 Preview 只是冰山一角,未来还会有更多 AI 产品发布。Fioravanti 参观了腾讯北京总部,并与混元团队讨论了混合 AI 场景等话题,称期待看到腾讯近期交付的新成果。

  4. ollama(@ollama)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 在 Ollama 云端面向 Pro 订阅用户推送

    Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。

  5. Fireworks AI(@FireworksAI_HQ)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-2,评测对标前沿模型且成本最高降 70%

    Cognition 发布 SWE-2,称这是其目前最接近前沿的模型,在主要评测上与近期前沿模型持平,成本最高降低 70%。该模型将强化学习扩展到数万亿参数规模,使用改进后的配方同时推进能力与成本两个维度。Fireworks 表示参与了其背后的基础设施栈,并链接了自家关于 RL 的博客文章。

  6. Greg Brockman(@gdb)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 在抗体可开发性预测基准上超越其他前沿模型

    GPT-6 Astra 在抗体可开发性预测基准测试中成为表现最好的前沿模型,在聚集性、稳定性、成药性等可开发性属性上的预测优于其他受测前沿模型。展示抗体工作机理的交互式可视化同样由 Astra 构建,耗时约 1 小时。

  7. Scott Wu(@ScottWu46)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-2 模型,评测表现接近前沿且成本最高降低 70%

    Cognition 发布 SWE-2,官方称这是其迄今最接近前沿水平的模型,在主流评测上得分与近期前沿模型持平,成本最高低 70%。Scott Wu 表示,这是团队第一个性能可与前沿水平相比的模型,将把 RL 扩展到数万亿参数规模,并在能力与成本两端同时推进帕累托曲线。SWE-2 面向 Devin 套餐用户免费开放一个月。

  8. Eric Jing(@ericjing_ai)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 首个 AI 模型 Gen-1 Slides 发布:性能对标前沿模型,价格仅 1/17

    Genspark 推出首个自研 AI 模型 Gen-1 Slides,官方称其性能与最先进的前沿模型相当,价格仅为后者的 1/17。该模型已在 genspark.ai 上线,可通过 ai_slides 页面体验。

  9. Eric Jing(@ericjing_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 与 Fireworks 发布开源模型 Gen-1 Slides

    Genspark 与 Fireworks 发布开源模型 Gen-1 Slides,在幻灯片生成任务上对标 Claude Opus 5,输入 token 价格约为后者的 1/17。该模型基于 MiniMax M3 通过 Fireworks Lab 的长时程 RL 后训练而来,已在 Genspark AI Slides 中作为默认模型上线。

  10. Eric Jing(@ericjing_ai)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 发布首个办公 AI 模型 Gen-1 Slides

    Genspark 发布其首个面向知识工作的 AI 模型 Gen-1 Slides,基于开源权重基座并与 Fireworks AI 共同训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其生成质量对标前沿模型,价格约为 Opus 5 的 1/17。

  11. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 实测 GPT-Live:任务完成率翻倍、理解率 92%,并接入 Call for Me 等产品

    Genspark 祝贺 OpenAI 发布 GPT-Live,并称先跑了 80 通真实餐厅预订电话:任务完成率相比上一代翻倍以上,理解准确率 92%,打断处理更顺畅,轻声的 mm-hmm 不再打断它,句中插入新问题也能无停顿切换。

  12. Eric Jing(@ericjing_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 发布知识工作模型 Gen-1 Slides

    Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,由 Genspark 与 Fireworks AI 基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其质量达到前沿水平,价格约为 Opus 5 的 1/17,完整说明见 Genspark 博客。

  13. Windsurf(@windsurf_ai)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 发布 SWE-2,在 Devin Desktop 和 CLI 上线

    Cognition 发布 SWE-2,称其是在前沿能力上最接近自家前沿水平的模型,在主要评测上得分与近期前沿模型相当,成本最多低 70%。该模型已可在 Devin Desktop 和 CLI 使用,Pro、Teams 用户及接下来一个月可无限使用。团队称将 RL 扩展到数万亿参数规模,配方在能力与成本上同时推进帕累托曲线。

  14. Genspark(@genspark_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 发布面向知识工作的首个模型 Gen-1 Slides

    Genspark 发布其首个面向知识工作的模型 Gen-1 Slides,与 Fireworks AI 合作基于开源权重底座训练,现已驱动 Genspark AI Slides 的 Standard 模式。官方称其可生成前沿质量幻灯片,价格约为 Opus 5 的 1/17,博客全文见 genspark.ai/blog/gen-1-sli。

9月10日周四
  1. Browser Use(@browser_use)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1 Flash 在浏览器任务上成本比 Sol 和 Opus 低 50 倍

    Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。

  2. Hunyuan(@TXhunyuan)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元开源统一语音生成与编辑模型 AuK,并推出 4 步推理的 AuK-Flash

    腾讯混元正式发布开源基础模型 AuK,面向统一语音生成与编辑,支持自然语言指令加参考音频的单一接口,能力覆盖零样本 TTS、指令控制生成、内容编辑、Whisper-conversion、去口音以及音色、风格、情感编辑和语速、音高控制,还包括增强、降噪、多说话人分离与音乐分离。

  3. DeepSeek(@deepseek_ai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 将携手开源社区支持 V4.1-Flash 推理并扩展部署选项

    DeepSeek 宣布将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时开放 2000 块 GPU 加存储集群的大规模部署合作洽谈。相关模型已发布在 Hugging Face 的 deepseek-ai 主页。

  4. DeepSeek(@deepseek_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4.1-Flash 并下调 API 价格

    DeepSeek 宣布 V4.1-Flash 采用更高效的架构,可以更低成本服务更多用户,并将节省的成本让利给用户。新价格于 2026 年 9 月 10 日 04:00 UTC 生效,继续采用峰谷定价以平衡需求,非高峰时段费率为高峰时段的 50%,灵活负载可安排到非高峰时段以节省费用。

  5. DeepSeek(@deepseek_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 上线 API,原生支持多模态

    DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。

  6. DeepSeek(@deepseek_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 将 KV cache 的 HBM 需求降至上一代的 1/4

    DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。

  7. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 552B 参数 MoE 非对称架构模型

    DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。

  8. DeepSeek(@deepseek_ai)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 发布:新架构家族最小模型,原生视觉理解

    DeepSeek 发布 DeepSeek-V4.1-Flash,是新架构家族中体量最小的模型,原生支持视觉理解。该模型主打更强能力、更快推理与更高吞吐,并可扩展至更大模型。

  9. DeepSeekAI 评估 · 89/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4.1 Flash:原生多模态、552B MoE,模型开源并调整 API 定价

    DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

    为什么值得看

    官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。

  10. DeeplearningAIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomson Reuters 发布法律金融领域专用模型 Thomson

    Thomson Reuters 推出专有 LLM 系列 Thomson,基于 Qwen 模型构建,专注法律、商业、税务、金融和新闻等领域,将率先部署在 CoCounsel Legal 中。

  11. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Cyber,防御能力超过 Mythos

    Google 的 Logan Kilpatrick 表示,Gemini 3.8 Cyber 在许多网络防御基准和真实用例上比 Mythos 更强。该模型已在 Google 内部被 Chrome、Wiz 和 Cloud 广泛使用,并将很快向外部扩展。原文附有 deepmind.google/models/gemini/ 链接。

  12. Paul Couvert(@itsPaulAi)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenBMB 发布 MiniCPM 小模型及 Meshy 强化学习训练框架

    OpenBMB 公开了小模型 MiniCPM 的 HuggingFace 与 GitHub 链接,并同步放出强化学习训练框架 Meshy 以及长时程强化学习项目 JustRLII。相关资源分别托管在 HuggingFace、GitHub 与 Notion 文档上,作者称小规模开源模型的表现正变得越来越好。

  13. Paul Couvert(@itsPaulAi)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面壁发布 MiniCPM5-2B:2B 参数可在手机离线跑智能体

    面壁(ModelBest)发布 100% 开源的 MiniCPM5-2B,仅 2B 参数、2GB RAM 即可在任意笔记本甚至手机上完全离线运行智能体,支持编码、智能体和工具调用任务。

9月9日周三
  1. DeeplearningAIAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3-Flash,Ox Alpha 谜底揭晓并开放权重下载

    Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。

    为什么值得看

    智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。

  2. Greg Brockman(@gdb)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-Image-2.5 的 Sunburst 与 Flare 登顶图像 Arena 榜单

    Arena.ai 数据显示,OpenAI 的 GPT-Image-2.5-Sunburst 在 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单均排名第一,Flare 排名第二。

  3. ManusAI(@ManusAI_HQ)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 评测 GPT-Image-2.5:Flare 出图速度达 GPT-Image-2 的两到四倍

    Manus 在自家评估中称 GPT-Image-2.5 是明显进步,其 Flare 能以 GPT-Image-2 两到四倍的速度生成高质量图像,透明背景生成也有改进,适合 Manus 上的品牌素材、演示和网站等创意工作,并邀请用户在 Manus 中体验。被引用的 OpenAI 推文介绍 ChatGPT Images 2.5 生成更快、还原度更高、多次编辑细节一致,并支持基于评论的局部编辑。

  4. Sam Altman(@sama)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 Images 2.5

    OpenAI 发布 Images 2.5,Sam Altman 表示它可能无法解决特别困难的数学问题,但表现很好,希望用户喜欢;介绍页面链接为 openai.com/index/introduc…。

  5. Sam Altman(@sama)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将于 9 月 16 日在旧金山举办 GPT-6 用户活动

    OpenAI 将于 9 月 16 日在旧金山举办 GPT-6 用户聚会,聊模型本身以及下一步该做什么,申请截止 9 月 10 日。此前 GPT-5.5 也曾办过同类活动。

  6. Google Gemini App(@GeminiApp)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Transcribe 发布:面向精准实时转写的语音转文本模型

    Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,主打精准、智能的实时转写。官方同时放出了详细介绍链接,未披露参数量、benchmark 分数或开放方式等细节。

9月8日周二
  1. Demis Hassabis(@demishassabis)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepMind 发布 AlphaGenome Atlas,可预测 90 亿个单字母 DNA 变异影响

    DeepMind 发布 AlphaGenome Atlas。继 AlphaFold 绘制蛋白质宇宙之后,该工具用于绘制人类基因组,可预测全部 90 亿个可能的单字母 DNA 变异带来的影响,帮助科研人员更好地理解疾病。该资源面向学术研究免费开放,地址为 alphagenome.google/atlas。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    走红的 Ox Alpha 模型确认为智谱 GLM-5.3-Flash

    DeepLearning.AI 称,近期走红的 Ox Alpha 模型已确认为智谱的 GLM-5.3-Flash。该模型为 320B 参数、每 token 激活 18B,采用线性注意力与稀疏注意力混合架构,在 GDPval AA v2 等真实任务上表现领先,单任务成本仅 0.09 美元。智谱此次大规模免费预览全部运行在中国产硬件上,用于验证内存优化可突破硬件限制。