Browser Use 云平台上线 DeepSeek V4.1 Flash:性能达 GPT 5.6 Sol xhigh 的 97%,成本低 30 倍
Browser Use 云平台现可运行 DeepSeek V4.1 Flash,其性能达 GPT 5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,智能体成本低 30 倍。新用户可用 15 美元免费额度运行 100 个复杂网页智能体任务。
Browser Use 云平台现可运行 DeepSeek V4.1 Flash,其性能达 GPT 5.6 Sol xhigh 的 97%、Claude Opus 5 的 95%,智能体成本低 30 倍。新用户可用 15 美元免费额度运行 100 个复杂网页智能体任务。
Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。
Ollama 宣布其应用现已支持启用 ChatGPT,用户需先下载 Ollama 并在应用中开启该功能,下载地址为 ollama.com/download。
ChatGPT 设置中可自定义模型选择器里显示哪些模型,本地模型和云端模型都能被选中。该功能通过设置项管理模型的可见范围。
Ollama 宣布 ChatGPT Desktop(Codex 应用)现在可以配置为使用 Ollama 模型。用户需下载或更新到 Ollama 0.34 即可开始使用。
Genspark 与 Fireworks AI 合作,其 AI 幻灯片(ai_slides)每天生成 12 万份,并用到 Fireworks AI 的训练平台。目前该功能定价仅为 Opus-5 的 1/17,用户可通过 genspark.ai/ai_slides 试用。
Cursor 推出 Projects 功能,现已进入 beta 阶段并从今日起逐步推送。该功能详情发布在 cursor.com/blog/projects,官方未披露更多参数或可用范围信息。
Cursor 项目内的 Agents 可共享记忆和生成的产物,包括计划与演示等文件。这些文件会在你的设备和 Agents 的电脑之间自动同步。
Google AI Studio 推出 Gemini API 文档首个预览版,文档直接集成在 AI Studio 中,与开发环境同处一地。官方称该文档平台为从零重建,目的是带来更好的整合度与便利性,用户可通过 ai.studio/docs 体验并反馈。
NVIDIA 详解全栈 NIM 优化如何让 Nemotron 3 Ultra 在现有 GPU 上支撑 2.5 倍并发用户,同时保持交互响应速度。这一权衡对智能体 AI 负载尤为关键,因为其提示词更长、上下文会在多步之间复用。
Cognition 发布 SWE-2,称其是在前沿能力上最接近自家前沿水平的模型,在主要评测上得分与近期前沿模型相当,成本最多低 70%。该模型已可在 Devin Desktop 和 CLI 使用,Pro、Teams 用户及接下来一个月可无限使用。团队称将 RL 扩展到数万亿参数规模,配方在能力与成本上同时推进帕累托曲线。
AWS 介绍用 Amazon DynamoDB 条件写实现分布式租约,配合 Amazon ECS on AWS Fargate 管理实时转写服务的 WebSocket 连接归属与故障转移。该模式把连接恢复时间从数分钟缩短到数秒,减少故障和部署期间的人工干预,无需外部协调服务,同一套租约逻辑也可迁移到 Amazon EKS 或 Amazon EC2。
Milvus 官方给出常规 Collection 与 External Collection 的选用边界:应用需持续 insert/upsert、删除须经在线写入路径可搜。
NVIDIA 推出 BioNeMo Inference Runtime(BioIR),在高通量蛋白质组规模下加速生物分子结构预测模型。该运行时基于 NVIDIA GPU,采用优化 kernel 并在适用场景使用 CUDA Graphs 提速,同时保留原有 PyTorch 工作流。
SemiAnalysis 的 Energy Model 目前追踪到表后 AI 算力供应链中 75GW 已签订单,其中约 20GW 仅在 2026 年 Q2 下单;到今年底约 3GW 美国数据中心 IT 容量将采用表后供电,并将连续多年三位数增长。
CCF 与快手联合发布第三期"CCF-快手大模型探索者基金"并启动申报,面向全球学者发布 5 个研究方向共 18 项研究课题,每项课题提供人民币 25 万元资助,申报截止时间为 2026 年 10 月 7 日 24:00(北京时间)。
超级小爱基于 Xiaomi MiMo 模型引入 RAG-Planning 并将推理从 think 模式切换为 no-think 模式,模型耗时平均下降约 35%,端到端最快快出 3 到 6 秒。全双工升级把拒识、判停和打断统一决策,配合三级 Session 压缩体系使上下文 Token 量下降 60%—86%,支持边听边说与随时插话。小米澎程 SkyNomad 已搭载专家版超级小爱。
李忠泽自研的 Agentic Harness Workflow 把 AI 编码拆成需求澄清、方案设计、编码实现、审查验收、提交归档等固定阶段,每阶段由只干一件事的 Sub-Agent 执行,主会话 Manager 统一调度把关。
NVIDIA 将供应链专业知识编码进 Nemotron 与 Palantir Foundry,用以衡量从 wafer-out 到 first token 的绩效。该周期分为两段:time-to-rack 覆盖硅片离开晶圆厂到组装系统抵达数据中心;time-to-token 则涵盖此后的电力、冷却、网络与软件栈。
DeepSeek 宣布将与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时开放 2000 块 GPU 加存储集群的大规模部署合作洽谈。相关模型已发布在 Hugging Face 的 deepseek-ai 主页。
DeepSeek 宣布 V4.1-Flash 采用更高效的架构,可以更低成本服务更多用户,并将节省的成本让利给用户。新价格于 2026 年 9 月 10 日 04:00 UTC 生效,继续采用峰谷定价以平衡需求,非高峰时段费率为高峰时段的 50%,灵活负载可安排到非高峰时段以节省费用。
DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。
月之暗面 Kimi 启动企业合作伙伴计划,与 IT 服务商、集成商共建前线部署工程师(FDE)队伍,把 AI 部署进企业核心业务。合作伙伴可接入 Kimi 模型能力,基于 Agent 运行底座 Kimi Hosted Agents 完成定制开发,并将项目成果沉淀为可复用行业方案。华胜天成、金山云、亚康股份、亚信科技、中软国际等已签约加入。
腾讯开源跨端框架 Kuikly 基于 Kotlin Multiplatform 与共享 UI 体系,支持 Android、iOS、HarmonyOS、H5、微信小程序、Mac 六大平台,日活用户超 5 亿。
终端工具 termany.sh 发布了一款 Windows 98 经典主题。开发者 Benn 称其最新 Termany 主题采用了 Windows 98 外观,并表示搭配 Claude 和 Codex 使用体验良好,推荐经常与编码智能体协作的用户尝试。
Browser Use 宣布 cloud.browser-use.com 正式上线。原文未披露该云端服务的具体功能、定价或可用范围等信息。
NVIDIA 发文说明 Encode-Prefill-Decode(EPD)解耦这一多模态模型推理优化技术:它将视觉编码阶段与 prefill、decode 阶段分离,在图像密集提示词、中短输出和量化 MoE 模型上最有效。配合 NVIDIA Dynamo 使用 EPD 解耦,最高可带来 5 倍加速。
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,此前 CUDA 应用在 Arm 上仅通过 Linux 支持,此次将该能力扩展至 Windows on Arm。该版本还增强了对共享 GPU 的控制能力,并为 NVIDIA GPU 及软件平台带来功能与性能改进。
Genspark 给 AI 布置了一个真实世界挑战——用真实工具、真实决策和真实约束搭建并运营一个柠檬水摊,并将直播复盘幕后过程与 Genspark 的具体用法。官方称这展示了智能体正从聊天走向实际执行,直播由 @filupmolina 与品牌负责人 Kim 主讲,时间为太平洋时间明天下午 3 点。
Dify 用新 Agent 在 Calendly 上补齐了一个缺失功能,无需替换现有工具或从零重建,就拼出了一套贴合自身需求的 workflow。官方称这一思路可轻松套用到日常使用的其他工具上,完整实践见其博客。
Qdrant 上线面向零基础学习者的 Beginner Course,从传统搜索的局限、嵌入向量表意和相似度原理讲起,带学员搭建第一个 Qdrant collection,并理解向量、payload、HNSW 以及 dense、sparse、hybrid 搜索的差异。
Firecrawl 为付费计划推出按量付费模式,余额用尽时自动充值 5 美元,用户可自行设置月度消费上限,也能随时按需购买额度,以支撑业务扩展时任务持续运行。
Milvus 3.0 External Collection 通过显式 Refresh 边界避免生产搜索暴露未就绪索引。新文件、元数据或嵌入更新到达数据湖时,Refresh 只识别变更的源片段,未变更分片复用已有 segment 和索引,期间查询继续使用上一发布版本,完成后新版本整体生效。
Weaviate 介绍其磁盘向量索引 HFresh:用紧凑 HNSW 索引将查询路由到最相关的质心,再检索存于磁盘的压缩倒排数据。其中 RQ8 让质心向量缩小约 4 倍,RQ1 使存储的倒排向量数据较 32 位浮点最多减少 32 倍,后台拆分、合并与重分配操作让索引持续保持平衡。它面向更低堆内存占用、可控查询 I/O 和大型可变数据集,无需周期性全量重建;追求峰值查询性能仍应选 HNSW。
快手技术沙龙第5期将于9月19日举办,主题为「Data Agent:数据生产与智能决策新范式」,来自快手数据平台部、云器科技与腾讯的嘉宾将分享一线实践。议题涵盖快手 Data Agent 从 Workflow 到 Agentic 的产品演进与父子 Agent 架构、云器科技 DEAgent 的设计与基础设施、Data Agent 在快手电商的落地,以及腾讯灯塔 AI 的记忆工程与知识工程。
vivo 互联网存储团队提出知识驱动计算(KDC)研究框架,主张 AI 应用软件应先明确系统面对的领域现实,再讨论现实模型、数字表示与验证反馈。文章以退款接口返回成功但资金未到账为例,说明数据库只保存表示而非现实,表示层缺口会沿 AI 判断链被放大为行动错误。该理论目前仍处开放研究阶段,团队表示 KDC 不替代 DDD 与 RAG。
得物技术披露基于 AgentScope Java 的企业级 MultiAgent 平台,将 Plan-and-Execute 从 Prompt 中拆出:计划由模型通过 create_plan、activate_subtask 等工具动态创建,独立持久化并支持断点恢复,状态经 SSE 以 PROCESSING 事件实时推送。
腾讯 WorkBuddy 团队整理 10 个使用技巧,核心是看住上下文用量、用对模式与会话、减少不必要的技能和废话占用窗口。对话框右下角的灰色小圈可查看上下文用量,显示如 4.9% · 49.4K/1000K;用量超过一半就建议压缩上下文或新开任务。
小红书 AI 通信库团队开源 CommInsight,一个面向大规模分布式训练与推理的系统级诊断平台,从 NCCL 底层事件流恢复通信组角色与 Step、Forward/Backward、梯度同步等训练语义,并定位 Hang、Failure 和 Straggler。
淘天集团直播技术团队分享了基于 Spring AI Alibaba 框架(版本 1.1.2.0)的 Agent 长程任务断点续传方案,采用框架层 Checkpoint 加上层任务调度的两层架构,且不修改框架源码。