Gemini 推出智能体视频理解,token 消耗降低最多 88%
Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。
Gemini 推出智能体视频理解能力,让 Gemini 调用工具并动态分析视频。官方称该方式最多降低 88% 的 token 消耗,成本最多降低 66%,并配套发布了开发者指南。
NVIDIA 发布基于 Nemotron 构建自适应智能体网络安全系统的方案,用于应对现有告警、预定义工作流和已知攻击行为难以覆盖的防御盲区。该系统让智能体跨安全运营环节协同工作、在长周期内追求复杂目标,重点识别防御遗漏并将缺口转化为改进方向。
Fish Audio S2.1 Pro 通过 @slng_ai 在欧洲和澳大利亚上线,支持 83 种语言并部署区域内 GPU 基础设施。该服务主打更贴近用户的低延迟与企业级管控,官方称其为生产级语音 AI 所需的能力。
Bolt.new 在 plan mode 下可让 AI 检查站点所有图片是否过大并给出压缩建议。示例中它找出两张可缩小 90% 以上、且画质无明显损失的图片,用于优化带宽占用。
Visual Studio 支持在 IDE 内直接查看和审查 GitHub PR:通过 Git → GitHub → View Pull Requests 打开列表,PR 按分配给我、仓库全部以及 Copilot 代为创建三类分组。
NVIDIA 技术博客解析如何为 AI 推理负载合理规划 GPU 资源并优化总拥有成本(TCO),避免超支。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让企业难以确定 GPU 规模,需在推理需求与成本之间找到平衡。
Lovable 联创 Anton Osika 表示,模型选择器时代正在结束,平台已收到超过 10 亿条 prompt,并借此学习每个任务上哪种模型表现最好。系统会为每条 prompt 决定合适的模型、工具、指令和上下文,并判断何时重试、何时重新规划、何时把工作路由到自家训练的模型。
MCP 于 2026 年 7 月 28 日发布其发布以来最大的一次修订,协议核心改为无状态:initialize 握手和 Mcp-Session-Id 头被移除,每个请求自带协议版本与客户端上下文,首个消息即可直接发起工具调用,任一 server 实例都能响应。
Qdrant 公开了面向生产环境的向量搜索基准、数据集与 Supernova 代码,目标场景是数十亿向量、数千 RPS 且尾部延迟紧张,现有公开基准无法覆盖。数据集已托管在 HuggingFace,代码以 qdrant-labs/supernova 开源,配套说明见官方博客。
Dify 推出全新 Agent,主打将智能体的灵活性与 Workflow 结合,让团队能信任、管理和持续运行业务流程。官方同时分享了 Agent PM 在自身工作中使用 Agent 与 Workflow 的真实案例,并回顾了产品在 Agent 热潮中坚持既定方向而非跟风的选择。
Agent“忘事”的根因在于记忆并非模型原生能力,而是应用层围绕上下文构建的工程系统,核心问题是每轮请求该把哪些历史信息带给模型。文章将记忆分为工作记忆、情节记忆、语义记忆和过程记忆四层,对应上下文、文档库与向量索引、KV/关系库、版本化配置等不同载体,并比较截断滑动窗口、滚动摘要、RAG 式记忆、事实抽取、知识图谱与主动调页等实现方式。
腾讯混元把开源模型 Hy4 preview 的权重从接近 1.5 TB 压缩到约 214 GB,并放出量化 GGUF 库。压缩依靠自研 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,最激进一档平均 1.25 比特、文件实际开销约 1.31 bpw。
Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘的专享配置和 Grok 额度,还可自行调用 DeepSeek API,无需理解服务器即可上手,被认为能分担不少本机任务。作者用 Zcode + GLM 5.3 Flash 整合《Grok Bot 橙皮书》与 awesome-grok-bot,做了网站 grokbot.aihuangshu.com 方便阅读理解。
v0 现已上线 Claude Design,用户可把设计稿发送给 v0,由其转换为全栈应用并部署到生产环境。该消息由 v0 官方账号发布,互动数据为 270 次点赞、19 次转发、11 条回复。
Qdrant 在一场 session 中探讨 token 原生存储,研究显示其在规模化负载下可实现 2–3× 压缩、10–100× 更快的读取和 2–20× 更快的写入。该内容为系列分享的第 2 部分。
Dify 的 Agent 既能独立运行,也能作为 Workflow 中更大流程的一环:在 Workflow 里 Agent 决定下一步做什么,Workflow 负责让整个流程保持有序可控。无论 Agent 在哪里运行,都可以用日志检查每次运行,并通过监控观察其长期表现,一次构建即可按需复用并持续改进。
Lovable 支持在 Codex 中直接为原型添加鉴权、基于角色的访问控制和真实数据库,随后完成部署,用户无需离开编码智能体即可拿到可运行的应用。该能力以视频形式在 Twitter 上演示。
Dify 新 Agent 既能独立工作,也能作为更大流程的一环嵌入 Workflow:在 Workflow 中由 Agent 决定下一步动作,Workflow 负责整体流程的组织与可控。Agent 每次运行都可用日志逐次检查,并通过监控观察长期表现,构建一次即可按需复用并持续改进。
Anthropic 宣布推出 Enterprise Frontier Safeguards(EFS),把零数据留存(ZDR)的隐私性与检测滥用的安全监测结合起来,数据存放在客户控制的云基础设施而非 Anthropic 处,将于今年秋季起分阶段向客户推出。
NVIDIA Omniverse NuRec 用于把自动驾驶感知栈跨车型平台扩展。同一套软件从 SUV 换到轿车或其他车型时,传感器位置、标定、视场、遮挡、车身几何、时序与覆盖范围都会变化,交通灯可能出现在画面不同位置;NuRec 通过重建方式应对这些差异。
GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60,在开源权重模型中并列第一。其整体智能提升完全来自对 GLM-5.2 的微调,而非训练新的基础架构,通过在长时间运行的软件工程环境中训练,模型涌现出网络安全能力,在 CyberGym 上得分 84.5%。
Lovart 完成版本更新,面向所有用户开放,国内可直接访问体验。新版把灵感采集、参考整理与交付串成工作流:浏览器插件悬停即可收藏图片并同步到 Lovart,连接器可直连 Pinterest 账号调用此前采集内容;同时提供 100+ 专业 Skill,覆盖品牌设计系统、营销套图、移动应用上架工具包和动态海报,并支持基于对话创建个人 Skill。
吴恩达在来信中梳理 AI 工程技能图谱里的软件工程基础,涵盖构建全栈应用、管理数据、设计系统架构、构建安全可靠的系统、在生产环境中扩展并运维五类能力。他指出理解软件基础能帮助开发者引导编码智能体在延迟、可用性、可靠性、成本等方面做出正确权衡,而不懂基础的新手用 vibe coding 只会做出糟糕取舍。他强调深刻理解软件如何工作的开发者远优于仅凭感觉编程的人,后续两封信将继续讨论。
有用户发现 Grok Bot 的云端资源可用来批量提取视频截图和文案,处理完再把结果存到本地,全程只需三次交互。他此前用 Zcode 配合 GLM 5.3 Flash 蹭周末赠送的 3 亿 Token,但会占用 Mac 的内存和硬盘、速度慢,还一度导致电脑重启两三次。Grok Bot 提供 8 核、16G 内存、126G 硬盘的云端环境,并支持开启多线程处理。
得物技术两位司龄5年的校招生海狸(Hayley)和骅征(huazheng)分享了各自的成长经历。海狸在交易平台做后端开发,参与AI导购项目,经历了方案多次调整与反复试错;骅征在国际技术做后端开发,参与香港仓寄售、日本开仓、美国自建站等项目,并在国际火山云多云迁移中将RT涨幅控制在10-13毫秒,实现用户无感知的平稳迁移。
混元 Hy4 preview 自 2026 年 8 月 28 日在 WorkBuddy 首发接入后调用激增,上线首日即出现任务队列排队,腾讯混元已对 Hy4 preview 推理集群紧急扩容并动态调配资源。
AI 博主宝玉在腾讯内部用自己做三年的字幕翻译 App 串起 AI 产品全流程:找需求看模型能力边界,同一提示词在模型具备检索能力后从无人问津到 Google CEO 致谢。他把成本优化做到调用从 33 次降至 12 次、单集处理从 31 分钟降至 18 分钟,并提出以终为始重设计、把 App 做成 Agent 插件的三条准则。
腾讯升级 WorkBuddy 并推出企业版 AI 工作台,阿里把多条产品线整合为千问办公并接入钉钉,字节发布豆包工作并与飞书打通,AI 办公竞争进入由 Agent 接收目标、拆解任务、调用工具并交付结果的阶段。但员工个人提效不等于企业提效,组织、流程、知识与协同四类问题仍待解决,这类市场更重、更难标准化,也并非大厂优先级最高的生意。
Pyromind 创始人兼 CEO Kevin Ding 认为,AI 终局更像 Agent 蜂群而非超级基础模型一统天下,需求世界的多元性决定了小模型不会被中心化大模型完全替代。
SemiAnalysis 在 ClusterMAX 3.0 的 neocloud 测试中发现 5 类令人担忧的安全模式,并推出 cmax audit security 免费审计脚本,可自动识别 Slurm、Kubernetes、独立 VM、裸金属和容器并比对存在已知漏洞的基线软件版本。
腾讯 Hy4-preview 发布预览权重,并已在 vLLM 的 day 0 支持,在 NVIDIA GPU 上完成验证。
吴恩达在本周通讯中指出,开发者若缺乏软件工程基础,就无法引导 coding agent 做出构建优秀应用所需的结构性决策,容易把玩具版直接部署上线,事后才面对延迟、可用性和算力成本问题。
徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。
腾讯混元将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,采用 MIX-STQ1_0 混合量化,用校准数据为每层分配不同位宽,部分低至 1.31-bit STQ1_0。
腾讯混元发布 Hy4 preview,该模型采用 770B 总参数、49B 激活参数,支持 1M 上下文,并在 SWE-bench Pro 上领先。官方称这是其迄今测得的最大代际提升,并给出在 Cline 中通过 npm i -g cline、/model 选择 Hy4 preview 的试用步骤。
Claude Desktop 可以配置使用 GLM 5.3 和 GLM 5.3 Flash 两款模型。该消息由 ollama 发布,浏览量超过 7600 次。
Ollama 云已全面上线 GLM 5.3 与 GLM 5.3 Flash(原 Ox Alpha),支持私有化、托管于美国和欧洲、零数据留存。
阿里 Wan 3.0 在 Replicate 上线限时半价,仅限本周末,用户可通过 replicate.com/alibaba/wan-3 使用。该模型由 Replicate 托管,官方鼓励用户趁折扣期进行创作。
NVIDIA TensorRT Model Connect 提供参考实现集合,用两条命令即可将开放模型从 checkpoint 部署到 NVIDIA TensorRT 推理,无需针对模型单独编写转换、预处理、后处理和运行时代码。该方案支持在原生 C++ 中运行受支持的模型。
Milvus 3.0 Backfill 面向嵌入模型升级场景,当 Spark 已把新嵌入生成为 Parquet 文件时,无需通过在线写入路径重写全部记录。它只读取更新所需的现有数据,仅写入发生变化的目标字段,未变字段保持不变;对向量字段还可校验并归一化维度与稀疏向量格式。