跳到正文

#部署/工程

今日 0 条
9月2日周三
  1. Patrick Loeber(@patloeber)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 推出智能体视频理解,token 消耗降低最多 88%

    Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。

  2. NVIDIA Technical BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Nemotron 构建自适应智能体网络安全系统

    NVIDIA 发布基于 Nemotron 构建自适应智能体网络安全系统的方案,用于应对现有告警、预定义工作流和已知攻击行为难以覆盖的防御盲区。该系统让智能体跨安全运营环节协同工作、在长周期内追求复杂目标,重点识别防御遗漏并将缺口转化为改进方向。

  3. Fish Audio(@FishAudio)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio S2.1 Pro 通过 SLNG 在欧洲和澳大利亚上线,覆盖 83 种语言

    Fish Audio S2.1 Pro 通过 @slng_ai 在欧洲和澳大利亚上线,支持 83 种语言并部署区域内 GPU 基础设施。该服务主打更贴近用户的低延迟与企业级管控,官方称其为生产级语音 AI 所需的能力。

  4. bolt.new(@boltdotnew)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt.new 用 plan mode 排查网站图片体积,两张图可压缩超 90%

    Bolt.new 在 plan mode 下可让 AI 检查站点所有图片是否过大并给出压缩建议。示例中它找出两张可缩小 90% 以上、且画质无明显损失的图片,用于优化带宽占用。

  5. Visual Studio BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Visual Studio 教程:如何在 IDE 内审查 GitHub PR 并接入 Copilot

    Visual Studio 支持在 IDE 内直接查看和审查 GitHub PR:通过 Git → GitHub → View Pull Requests 打开列表,PR 按分配给我、仓库全部以及 Copilot 代为创建三类分组。

9月1日周二
  1. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为 AI 推理与 TCO 规划 GPU 规模而不超支

    NVIDIA 技术博客解析如何为 AI 推理负载合理规划 GPU 资源并优化总拥有成本(TCO),避免超支。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让企业难以确定 GPU 规模,需在推理需求与成本之间找到平衡。

  2. Anton Osika – eu/acc(@antonosika)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 称模型选择器时代将结束,超 10 亿条 prompt 已用于自动选型

    Lovable 联创 Anton Osika 表示,模型选择器时代正在结束,平台已收到超过 10 亿条 prompt,并借此学习每个任务上哪种模型表现最好。系统会为每条 prompt 决定合适的模型、工具、指令和上下文,并判断何时重试、何时重新规划、何时把工作路由到自家训练的模型。

  3. AWS Architecture BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MCP 无状态化后,你的 AWS MCP server 部署是否架构良好

    MCP 于 2026 年 7 月 28 日发布其发布以来最大的一次修订,协议核心改为无状态:initialize 握手和 Mcp-Session-Id 头被移除,每个请求自带协议版本与客户端上下文,首个消息即可直接发起工具调用,任一 server 实例都能响应。

  4. Qdrant(@qdrant_engine)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 发布生产级向量搜索公开基准与 Supernova 数据集

    Qdrant 公开了面向生产环境的向量搜索基准、数据集与 Supernova 代码,目标场景是数十亿向量、数千 RPS 且尾部延迟紧张,现有公开基准无法覆盖。数据集已托管在 HuggingFace,代码以 qdrant-labs/supernova 开源,配套说明见官方博客。

  5. Dify(@dify_ai)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 发布新 Agent:把智能体灵活性带入可信任的工作流

    Dify 推出全新 Agent,主打将智能体的灵活性与 Workflow 结合,让团队能信任、管理和持续运行业务流程。官方同时分享了 Agent PM 在自身工作中使用 Agent 与 Workflow 的真实案例,并回顾了产品在 Agent 热潮中坚持既定方向而非跟风的选择。

  6. 奇舞精选AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 为什么会“忘事”:从上下文拼接到可治理的记忆系统

    Agent“忘事”的根因在于记忆并非模型原生能力,而是应用层围绕上下文构建的工程系统,核心问题是每轮请求该把哪些历史信息带给模型。文章将记忆分为工作记忆、情节记忆、语义记忆和过程记忆四层,对应上下文、文档库与向量索引、KV/关系库、版本化配置等不同载体,并比较截断滑动窗口、滚动摘要、RAG 式记忆、事实抽取、知识图谱与主动调页等实现方式。

  7. 腾讯混元AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview 轻量量化版,权重从 1.5 TB 压到 214 GB

    腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。

  8. AI产品黄叔(@PMbackttfuture)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 实测:8核/16G/126G 专享配置可分担本机任务,支持调用 DeepSeek API

    Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘的专享配置和 Grok 额度,还可自行调用 DeepSeek API,无需理解服务器即可上手,被认为能分担不少本机任务。作者用 Zcode + GLM 5.3 Flash 整合《Grok Bot 橙皮书》与 awesome-grok-bot,做了网站 grokbot.aihuangshu.com 方便阅读理解。

  9. v0(@v0)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 现已接入 Claude Design,可将设计稿转为全栈应用

    v0 现已上线 Claude Design,用户可把设计稿发送给 v0,由其转换为全栈应用并部署到生产环境。该消息由 v0 官方账号发布,互动数据为 270 次点赞、19 次转发、11 条回复。

  10. Qdrant(@qdrant_engine)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 分享 token 原生存储研究:压缩 2–3×、读取快 10–100×

    Qdrant 在一场 session 中探讨 token 原生存储,研究显示其在规模化负载下可实现 2–3× 压缩、10–100× 更快的读取和 2–20× 更快的写入。该内容为系列分享的第 2 部分。

  11. Dify(@dify_ai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 介绍 Agent 与 Workflow 的协作方式

    Dify 的 Agent 既能独立运行,也能作为 Workflow 中更大流程的一环:在 Workflow 里 Agent 决定下一步做什么,Workflow 负责让整个流程保持有序可控。无论 Agent 在哪里运行,都可以用日志检查每次运行,并通过监控观察其长期表现,一次构建即可按需复用并持续改进。

  12. Lovable(@lovable_dev)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovable 让 Codex 内直接添加鉴权、角色权限和数据库并部署

    Lovable 支持在 Codex 中直接为原型添加鉴权、基于角色的访问控制和真实数据库,随后完成部署,用户无需离开编码智能体即可拿到可运行的应用。该能力以视频形式在 Twitter 上演示。

  13. Dify(@dify_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 新 Agent 可独立运行,也可嵌入 Workflow 协同

    Dify 新 Agent 既能独立工作,也能作为更大流程的一环嵌入 Workflow:在 Workflow 中由 Agent 决定下一步动作,Workflow 负责整体流程的组织与可控。Agent 每次运行都可用日志逐次检查,并通过监控观察长期表现,构建一次即可按需复用并持续改进。

  14. Anthropic NewsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Enterprise Frontier Safeguards,将监测数据存放在客户自有云中

    Anthropic 宣布推出 Enterprise Frontier Safeguards(EFS),把零数据留存(ZDR)的隐私性与检测滥用的安全监测结合起来,数据存放在客户控制的云基础设施而非 Anthropic 处,将于今年秋季起分阶段向客户推出。

  15. NVIDIA Technical BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Omniverse NuRec 跨车型平台扩展自动驾驶感知

    NVIDIA Omniverse NuRec 用于把自动驾驶感知栈跨车型平台扩展。同一套软件从 SUV 换到轿车或其他车型时,传感器位置、标定、视场、遮挡、车身几何、时序与覆盖范围都会变化,交通灯可能出现在画面不同位置;NuRec 通过重建方式应对这些差异。

8月31日周一
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 靠后训练追平开源模型榜首,CyberGym 得分 84.5% 引发安全暂缓

    GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60,在开源权重模型中并列第一。其整体智能提升完全来自对 GLM-5.2 的微调,而非训练新的基础架构,通过在长时间运行的软件工程环境中训练,模型涌现出网络安全能力,在 CyberGym 上得分 84.5%。

  2. Clip设计夹AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovart 全新升级:把灵感采集、100+ 专业 Skill 串进设计师工作流

    Lovart 完成版本更新,面向所有用户开放,国内可直接访问体验。新版把灵感采集、参考整理与交付串成工作流:浏览器插件悬停即可收藏图片并同步到 Lovart,连接器可直连 Pinterest 账号调用此前采集内容;同时提供 100+ 专业 Skill,覆盖品牌设计系统、营销套图、移动应用上架工具包和动态海报,并支持基于对话创建个人 Skill。

  3. DeeplearningAIAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达来信:AI 工程技能图谱详解——软件工程基础

    吴恩达在来信中梳理 AI 工程技能图谱里的软件工程基础,涵盖构建全栈应用、管理数据、设计系统架构、构建安全可靠的系统、在生产环境中扩展并运维五类能力。他指出理解软件基础能帮助开发者引导编码智能体在延迟、可用性、可靠性、成本等方面做出正确权衡,而不懂基础的新手用 vibe coding 只会做出糟糕取舍。他强调深刻理解软件如何工作的开发者远优于仅凭感觉编程的人,后续两封信将继续讨论。

  4. AI产品黄叔(@PMbackttfuture)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Grok Bot 云端批量提取视频截图和文案,再存回本地

    有用户发现 Grok Bot 的云端资源可用来批量提取视频截图和文案,处理完再把结果存到本地,全程只需三次交互。他此前用 Zcode 配合 GLM 5.3 Flash 蹭周末赠送的 3 亿 Token,但会占用 Mac 的内存和硬盘、速度慢,还一度导致电脑重启两三次。Grok Bot 提供 8 核、16G 内存、126G 硬盘的云端环境,并支持开启多线程处理。

  5. 得物技术AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    入职得物五年后:两位校招生的技术成长故事

    得物技术两位司龄5年的校招生海狸(Hayley)和骅征(huazheng)分享了各自的成长经历。海狸在交易平台做后端开发,参与AI导购项目,经历了方案多次调整与反复试错;骅征在国际技术做后端开发,参与香港仓寄售、日本开仓、美国自建站等项目,并在国际火山云多云迁移中将RT涨幅控制在10-13毫秒,实现用户无感知的平稳迁移。

  6. 腾讯混元AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    混元 Hy4 preview 调用激增,WorkBuddy 紧急扩容推理集群

    混元 Hy4 preview 自 2026 年 8 月 28 日在 WorkBuddy 首发接入后调用激增,上线首日即出现任务队列排队,腾讯混元已对 Hy4 preview 推理集群紧急扩容并动态调配资源。

  7. 宝玉的分享AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 原生思维:像训练大模型一样训练自己

    AI 博主宝玉在腾讯内部用自己做三年的字幕翻译 App 串起 AI 产品全流程:找需求看模型能力边界,同一提示词在模型具备检索能力后从无人问津到 Google CEO 致谢。他把成本优化做到调用从 33 次降至 12 次、单集处理从 31 分钟降至 18 分钟,并提出以终为始重设计、把 App 做成 Agent 插件的三条准则。

  8. 土猛的员外AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkBuddy、豆包工作、千问办公开战,企业 AI 的机会反而更清楚了

    腾讯升级 WorkBuddy 并推出企业版 AI 工作台,阿里把多条产品线整合为千问办公并接入钉钉,字节发布豆包工作并与飞书打通,AI 办公竞争进入由 Agent 接收目标、拆解任务、调用工具并交付结果的阶段。但员工个人提效不等于企业提效,组织、流程、知识与协同四类问题仍待解决,这类市场更重、更难标准化,也并非大厂优先级最高的生意。

  9. 十字路口CrossingAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pyromind 创始人 Kevin Ding 谈 AI 下半场:不会只剩一个超级模型,押注 AutoRL 与 PyroDash

    Pyromind 创始人兼 CEO Kevin Ding 认为,AI 终局更像 Agent 蜂群而非超级基础模型一统天下,需求世界的多元性决定了小模型不会被中心化大模型完全替代。

8月30日周日
  1. SemiAnalysisAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:多数 Neocloud 的安全性堪忧

    SemiAnalysis 在 ClusterMAX 3.0 的 neocloud 测试中发现 5 类令人担忧的安全模式,并推出 cmax audit security 免费审计脚本,可自动识别 Slurm、Kubernetes、独立 VM、裸金属和容器并比对存在已知漏洞的基线软件版本。

  2. Hunyuan(@TXhunyuan)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯 Hy4-preview 在 vLLM 上首日可运行

    腾讯 Hy4-preview 发布预览权重,并已在 vLLM 的 day 0 支持,在 NVIDIA GPU 上完成验证。

8月29日周六
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达:AI 工程仍离不开软件工程基本功,从数据管理到用户界面

    吴恩达在本周通讯中指出,开发者若缺乏软件工程基础,就无法引导 coding agent 做出构建优秀应用所需的结构性决策,容易把玩具版直接部署上线,事后才面对延迟、可用性和算力成本问题。

  2. AI炼金术AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OPC 已凉、FDE 会消亡?AI 炼金术聊 Codex 上门装机与 DeepSeek 新 harness

    徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。

  3. Hunyuan(@TXhunyuan)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4-preview 以 MIX-STQ1_0 混合量化从 1.5TB 压缩至约 200GiB GGUF

    腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。

  4. Hunyuan(@TXhunyuan)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy4 preview,已在 Cline 开放试用

    腾讯混元发布 Hy4 preview,该模型采用 770B 总参数、49B 激活参数,支持 1M 上下文,并在 SWE-bench Pro 上领先。官方称这是其迄今测得的最大代际提升,并给出在 Cline 中通过 npm i -g cline、/model 选择 Hy4 preview 的试用步骤。

  5. ollama(@ollama)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Desktop 可配置使用 GLM 5.3 和 GLM 5.3 Flash

    Claude Desktop 可以配置使用 GLM 5.3 和 GLM 5.3 Flash 两款模型。该消息由 ollama 发布,浏览量超过 7600 次。

  6. ollama(@ollama)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 云全面上线 GLM 5.3 与 GLM 5.3 Flash(原 Ox Alpha)

    Ollama 云已全面上线 GLM 5.3 与 GLM 5.3 Flash(原 Ox Alpha),支持私有化、托管于美国和欧洲、零数据留存。

  7. Replicate(@replicate)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Wan 3.0 在 Replicate 限时半价,仅限本周末

    阿里 Wan 3.0 在 Replicate 上线限时半价,仅限本周末,用户可通过 replicate.com/alibaba/wan-3 使用。该模型由 Replicate 托管,官方鼓励用户趁折扣期进行创作。

  8. NVIDIA Technical BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA TensorRT Model Connect:两条命令将开放模型从 Checkpoint 部署到推理

    NVIDIA TensorRT Model Connect 提供参考实现集合,用两条命令即可将开放模型从 checkpoint 部署到 NVIDIA TensorRT 推理,无需针对模型单独编写转换、预处理、后处理和运行时代码。该方案支持在原生 C++ 中运行受支持的模型。

8月28日周五
  1. Milvus(@milvusio)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 Backfill:无需在线重写,增量更新十亿级嵌入向量

    Milvus 3.0 Backfill 面向嵌入模型升级场景,当 Spark 已把新嵌入生成为 Parquet 文件时,无需通过在线写入路径重写全部记录。它只读取更新所需的现有数据,仅写入发生变化的目标字段,未变字段保持不变;对向量字段还可校验并归一化维度与稀疏向量格式。