跳到正文

#DeepSeek

今日 5 条
10月5日周一
  1. 腾讯科技AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源模型烧向硅谷:企业用开放权重模型重构AI成本账

    腾讯科技报道,随着AI支出上升,美国企业正越来越多地转向价格更低的开放权重模型。AlphaSense 数据显示,今年 8 月和 9 月美国企业财报电话会议和投资者会议中提及开放权重或开源模型的次数是去年同期的 6 倍。

10月4日周日
  1. 极客公园AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。

10月3日周六
  1. orange.ai(@oran_ge)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地跑 Qwen Flash 读写速度一周内提升近十倍

    作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。

  2. Last Week in AIAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #258:Opus 5.5、GPT-6 Sol 与 Luna、Meta Muse、DeepSeek-V4.1-Flash

    Anthropic 发布 Opus 5.5,价格更低、速度更快、基准测试成绩强劲,并扩大面向防御方的网络安全访问权限。OpenAI 推出更低价的 GPT-6 层级 Sol 和 Luna;Meta 的 Muse 登陆 Mac 并开放电脑操作能力,但被 Amazon 以政策与隐私安全为由封禁。

  3. 山行AIAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CourseRaptor 本地校园 Agent 架构拆解:31 个工具、三端入口与本地凭证保护

    南京工业大学适配的校园 Agent 项目 CourseRaptor 把课表、成绩、考试、通知、待办、文档生成和日历订阅拆成 31 个可调用工具,终端 TUI、本地 Web UI(127.0.0.1:3210)、QQ 机器人和无头 CLI 共用同一个 ToolLoopAgent 内核。

  4. bolt.new(@boltdotnew)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt 为所有用户重置 Forge tokens,模型选择器新增 GLM、DeepSeek 和 Kimi

    Bolt 为所有用户重置了 Forge tokens,并在模型选择器中加入 GLM、DeepSeek 和 Kimi。官方以"去构建点什么"号召用户使用这些新可用模型。

10月2日周五
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Batch 本周:开源权重模型 GLM-5.3 漏洞利用能力逼近 Claude Mythos,12% vs 14%

    Andrew 在 The Batch 本周通讯中指出,开源权重模型 GLM-5.3 在漏洞利用测试中达到 12%,逼近 Claude Mythos 的 14%。同期内容还包括小米新的开源权重模型、Gemini 3.8 Live、DeepSeek-V4.1-Flash 以及 AREX 智能体中心。

  2. DeepSeek(@deepseek_ai)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 Harness 桌面版,支持 macOS 与 Windows

    DeepSeek 发布了 DeepSeek Harness 的打包桌面版,现已支持 macOS 和 Windows。Linux 用户可通过 npm 上的 @deepseek-ai/dsh 包获取,详情见 deepseek.com/harness。

  3. AI寒武纪AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 开放 Mod 支持,可自行改造界面与行为

    Claude Code 支持安装 Mod,用户可用 TypeScript 写模块,也可直接让 Claude 现场生成并热加载,改造界面、操作逻辑和底层功能,官方已把 /diff 和 AGENTS.md 支持改为 Mod 实现。

  4. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 测算:2027 年前出货的 AI 芯片能跑多少 AI 智能体?

    Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。

10月1日周四
  1. Geek(@geekbb)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    坏了一根 16G 内存后,我用 Qwen3.8-Max 修了一天 PVE

    三台 PVE 同时挂了两台,作者称用 Qwen3.8-Max 修了一天,感觉其表现强于 Grok-4.7 和 DeepSeek-V4.1-Flash,目前一台已修好,并因此对 Qwen3.8 刮目相看。

  2. Geek(@geekbb)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Qwen3.8-Max 修复 PVE 故障,用户称其比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打

    一位用户三台 PVE 同时挂了两台,用 Qwen3.8-Max 修了一天,称其表现比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打,目前已修好一台。该用户表示因此对 Qwen3.8 刮目相看。

9月30日周三
  1. orange.ai(@oran_ge)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 报告批评开源模型安全,被指借机推销闭源模型

    在 OpenAI 宣布企业套餐加入 GLM 5.3 等开源模型后,Anthropic 发布报告批评开源模型安全问题。报告称 GLM 5.3 是网络安全能力最强的开源模型、落后美国前沿模型约 4 个月,且是测试中唯一具备漏洞利用能力的模型,但可通过 abliteration 移除拒绝行为,单次成本约 4400 美元。

  2. Z PotentialsAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    外滩大会AI2C论坛全纪实:从入口到交易,AI正在重写消费的每一个环节

    2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。

  3. DeepSeekAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 开源面向华为昇腾的基础设施组件

    DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。

  4. Geek(@geekbb)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 上线,登录赠送 6 元

    DeepSeek 推出 Harness,访问入口为 deepseek.com/harness/。登录该服务可获赠 6 元额度。

9月29日周二
  1. DatawhaleAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 桌面版发布,同步更新 v0.2 预览版

    DeepSeek Harness 桌面版正式发布,macOS 和 Windows 安装包同步上线,并伴随 DeepSeek Harness v0.2 预览版更新。

    为什么值得看

    材料完整列出桌面版、v0.2 预览版的插件管理与创造模式等变化,可据此判断其工作流整合程度。

  2. SemiAnalysisAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM5.3 稀疏注意力如何影响 HBM 显存占用

    SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。

9月28日周一
  1. AI科技评论AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naive AI 发布开源模型 Naive-N0.5-Flash,并披露两项 AI 研发任务

    Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。

  2. Geek(@geekbb)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Magpie 接上 DeepSeek 并叠加 RTK,Bash 工具输出 token 省七成多

    Magpie 接入 DeepSeek 后 prompt 成本已压得很低,再叠加一层 RTK 过滤 Bash 工具输出的噪声,实测可省掉七成多的工具输出 token。两个省钱方向叠加后性价比明显提升。

  3. Geek(@geekbb)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Command Code 跟进竞争,GOAT 套餐 DeepSeek V4.1 Flash 额度永久提至 $60

    Command Code 将 $10/月 GOAT 套餐中 DeepSeek V4.1 Flash 的使用额度永久提升至 $60。该套餐被其称为市场上面向开源模型的最佳方案。

  4. dbaplus社群AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图灵奖得主 Stonebraker 谈 LLM、智能体与数据库的未来

    图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。

9月27日周日
  1. 浮之静AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    浅谈 AI 进化史:从 ChatGPT 到 Agent 工作系统

    从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。

9月26日周六
  1. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    作者称用 DeepSeek Flash 做工程陷入无尽细节,转用 Opus 5.5 重构 ColaMD 2.0 求根治

    ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。

9月25日周五
  1. SemiAnalysisAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 发布中国数据中心模型:中国数据中心容量超 24GW

    SemiAnalysis 推出 SemiAnalysis China Datacenter Model,追踪中国 60 多家运营商的 1000 多个数据中心设施,显示中国数据中心容量超过 24GW,超过 EMEA 和亚洲其他地区。

  2. Guillermo Rauch(@rauchg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 数据:OpenAI 支出占比 10%→24%,Anthropic 从 69% 降至 40%

    Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。

9月24日周四
  1. DifyAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify Marketplace 新增精选推荐位与点赞评分反馈功能

    Dify Marketplace 新增精选展示位,并上线点赞、星级评分与文字反馈功能,插件和模板详情页均可提交,创作者中心会汇总所有反馈。目前平台已收录 1,000+ 插件和 300+ 开箱即用模板,用户可调用 DeepSeek 做内容生成与复杂推理,或用通义千问处理多模态内容。

  2. Eric Jing(@ericjing_ai)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线编码智能体 GenCode,支持按任务自选模型

    Genspark 正式上线编码智能体 GenCode,集成在 Genspark Super App 中,可在 Claude、GPT、DeepSeek 或开放权重模型之间按任务自行选择,无需配置 API key。引用推文称开放权重方案的成本为前沿模型的 1/10 到 1/20,作者表示该工具原为内部开发工具,现已对外开放。

  3. bolt.new(@boltdotnew)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt Forge 开放模型一周数据:GLM 5.3 Flash 占 63%,DeepSeek V4.1 Flash 占 17%

    Bolt Forge 上线开放模型一周后,GLM 5.3 Flash 拿下 63% 的调用占比,DeepSeek V4.1 Flash 为 17%,两款 Flash 模型合计承接 80% 的提示词。更大模型就在选择器里,开发者仍持续选择快速模型,另有 9 美元/月的 bolt.new/lite 方案。

  4. Genspark(@genspark_ai)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GenCode 编程智能体:一个账号可选 Claude、GPT、DeepSeek 或开放权重模型

    Genspark 在 Super App 内上线编程智能体 GenCode,用户可在同一账号内按任务选择 Claude、GPT、DeepSeek 或开放权重模型,无需自行配置 API key。官方称开放权重模型成本仅为 1/10 至 1/20,且模型选择权交给用户而非由智能体代为决定。

9月23日周三
  1. 网易科技AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026网易科技未来大奖揭晓:梁文锋、杨植麟等获评AI创新先锋人物

    2026网易科技未来大奖获奖名单揭晓,梁文锋(DeepSeek CEO)、杨植麟(月之暗面kimi CEO)等10人获评"AI创新先锋人物"。宇树科技、智元等10家企业获"具身智能先锋企业",京东JoyAI、蚂蚁百灵、理想VLA、百川智能、水木分子、面壁智能CPM for Legal入选"行业大模型应用标杆"。

  2. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。

  3. 字节跳动技术团队AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案

    字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。

  4. 有机大橘子AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Sol 和 Luna 降价 50%,Opus 5.5 降价 40%

    OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。

  5. Milvus(@milvusio)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 团队将 Jev 集成进 DeepSearcher、MemSearch 与 Vector Graph RAG 三个开源项目

    Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。

9月22日周二
  1. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  2. ollama(@ollama)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 就 deepseek-v4.1-flash 计费错误致歉:已重置用量并返还额度

    Ollama 上 deepseek-v4.1-flash 模型的部分请求因费率错误被多扣用量,官方已致歉并重置用户月度(或旧方案的周度+会话)用量,同时把该模型造成的额外消耗额度返还到账户。

  3. 数字生命卡兹克AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo V2.6 系列模型并全面开源

    小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。

    为什么值得看

    作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。

  4. Paul Couvert(@itsPaulAi)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源多模态模型 MiMo-V2.6-Pro,称智能水平接近 GPT-5.6-Sol Max

    小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。

    为什么值得看

    小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。

  5. Browser Use(@browser_use)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,Long Horizon Browser Use Benchmark v2 得分 39.9 仍落后 DeepSeek

    Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。