GitHub Copilot 将推出本地模型智能路由,可节省 AI credits
GitHub Copilot 即将支持智能本地模型路由,能在最合适时自动把任务分派给本地模型,帮助用户节省 AI credits。该功能是 Project HydraFusion 愿景的下一步。
GitHub Copilot 即将支持智能本地模型路由,能在最合适时自动把任务分派给本地模型,帮助用户节省 AI credits。该功能是 Project HydraFusion 愿景的下一步。
ChromeBox3 CN65 升级到 PVE9.0 后开机一分钟内不断重启,排除电源、固件和直通 USB 网口等因素后,AI 联网搜索判断这是 ChromeBox 作无头服务器时的通病。在 PDD 花五元买了个 HDMI 诱骗器后,问题随之解决。
Prime-Sentinel Command(PSC)是一个用 Python 面向对象实现的 master-agent 架构,由中央编排器 PrimeProgram 协调多个自主边缘诊断节点 SentinelProgram,后者采集 CPU 负载、内存占用与网络状态并返回结构化遥测数据。
Varun Jindal 提出在模型之外为编码智能体搭建一套 harness,包含宪法、自主边界、分层上下文、持久记忆、多视角评审面板和编辑后钩子六个部件。
Stack Overflow 博客发布六层 LLM 生产系统成熟度模型的第一层「确定性层」,主张智能体应是从上下文到提案的纯函数,无权直接改变业务状态,由经过充分测试的 substrate 在审批后执行提案。
Stack Overflow 博客发布了一份生产级 LLM 与智能体实战指南,提出从 Notebook 演示到生产级构建的六级成熟度模型,涵盖确定性、评测、置信度、安全治理与运维等层次。文中给出可勾选的自检清单,例如智能体只能提出建议而非直接改动业务状态、提示词或模型变更导致质量回退时应使 CI 失败、敏感数据在边界处脱敏并采用只追加审计账本。作者建议团队先找到自己最弱的一层,再按顺序逐级补齐。
Datadog 是面向云应用的可观测性与安全平台,可对基础设施、分布式系统以及 AI 智能体行为进行实时监控。该平台此次聚焦如何查看 AI 智能体的内部运行状态。
一种新玩法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,再把其他 Code plan 用不完的额度接入其中。之后由 Grok Bot 调用这些 token 去写代码、渲染视频,让闲置额度不再浪费。
一种省钱玩法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,然后把其他 Code plan 用不完的额度配置进去。再让 Grok Bot 调用这些 token 写代码、渲染视频,避免闲置额度浪费。
微软开源了一个跨平台沙箱库 MxC,覆盖 Windows、macOS 和 Linux,底层使用 processcontainer、bubblewrap 和 seatbelt(地址 github.com/microsoft/mxc)。
Anthropic 将 Claude Sonnet 5.5 的缓存读取价格减半,降至 $0.10 每百万 token。这使得 Sonnet 5.5 在大多数长时间运行的任务上成本降低约 20%。
微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。
LangChain 为 Deep Agents 框架的 Skills 带来三项工程升级:工具绑定 Skills 通过 SKILL.md 的 metadata.include_tools 声明工具。
T3 Stack 作者 theo 开源了 TypeScript 编译器、类型检查器与 LSP 的 Rust 完整移植 tsc-rs,它并非从零设计,而是对微软 TypeScript 7(typescript-go)的逐行为移植,锁定上游提交 typescript-go @673a5f17,采用 MIT 协议并保留上游 Apache-2.0 / BSD-3 声明。
Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,长请求为 0.5 和 2.5 美元,便宜一半。
Haiku 5.5 的降价与跑分变化并列给出,可据此判断小模型在批量任务和子智能体场景中的成本位置。
Theo(t3.gg)反驳 Cursor 工程师 Lauren 每年 1.32 亿美元 Token 成本的估算,称真实 API 成本约为每月 10 万-50 万美元,按当前价格更接近每年 300 万美元。
Dair.ai 创始人 Elvis 用 AI 员工 Viktor 自动排查 agent harness 的夜间评测结果:23 个昨天通过、今天失败的任务会被逐一检查日志、追溯到引发失败的改动并建议回滚。Viktor 在 Slack 中运行,还会主动标记问题,目前可免费试用并赠送 $100 额度、无需信用卡。
爱范儿作者在 RTX 5080 上实测 DLSS 5 正式版,在《NBA 2K27》中开启后球员皮肤、球衣织物、地板木纹与整体光影更接近真实比赛质感。
微软在 Windows 与 Surface 特别活动上联合英伟达推出 ARM 架构 SoC RTX Spark,把 CPU、GPU 和最高 128GB 统一内存集成在一起,FP4 AI 算力最高 1 PFLOP,可在本地运行 1250 亿参数的 Qwen 3.8 Flash Next 等模型。
微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。
梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。
乔木剪藏发布一段可直接复制的 prompt,让 Agent 自动完成插件与助手安装升级。prompt 要求 Agent 先读 README.md 和 native/README.md。
Qdrant 与 DeepLearning.AI 合作推出免费课程,由 Dylan Couzon 讲授如何用 Qdrant Edge 让机器人在无网络连接、无远程服务器的情况下拥有真正的本地记忆。课程已在 DeepLearning.AI 平台开放免费报名。
Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。
在 Go 中为实时对话 AI 平台构建 Kafka 消息层,用一致性哈希把同一会话的消息路由到固定 worker,再以每会话一个 goroutine 串行处理,从而在数千并发会话下保证会话内严格有序。系统已在生产处理超 4000 万条消息、未观察到乱序,测试中发送侧吞吐突破 100,000 条/秒。重试在会话 goroutine 内原地进行并配合指数退避,避免消息被后发消息超越。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?
Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。
Jev Router 最常用的 5 个模型中 4 个位于帕累托前沿,可操控性表现突出,但整体权衡不及直接调用 DeepSeek V4.1 Flash——后者以更低成本和延迟取得相近表现。该评测显示,同时平衡任务成功率、可操控性、成本与延迟仍是模型路由的未解难题。
Jev Router 的端到端请求延迟高于同类 Pareto 最优模型,中位数为 6.18 秒,DeepSeek V4.1 Flash(Max)为 3.64 秒。在 P90(最慢 10% 请求)上差距扩大,Jev Router 耗时 30.59 秒,DeepSeek 为 14.26 秒。
Cohere 的搜索与检索平台 Compass 即将上云,Compass Cloud 目前已进入私有测试阶段,主打以更低开销获得优质检索效果。企业团队可申请早期访问名额参与测试。
AWS 推出一个为期六周的 AI 构建能力培养项目,参与者每周投入约 4 小时,用 Amazon Bedrock 与 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具搭建可运行的 AI 原型。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答。其 Discovery Agent 上线以来为客户发现超过 100,000 条异常与离群点,Lintech International 索引了 17,000 多份技术文档,响应速度提升 75%,业务经理每周节省最多 7 小时。
LangChain 发布 Managed Deep Agents v0.9,新增 Schedules SDK,让智能体可在对话中自行创建提醒、跟进和周期性任务。该版本支持按每次运行选择模型、技能、MCP 服务器和沙箱,使单次部署即可服务不同团队或代码仓库;智能体在启动运行时会通过 Slack Reactions 回应消息。
OpenDocRouter 是一个统一文档解析 API,可将文档转写为 markdown,按成本价提供前沿与开源权重模型,仅收取少量交易抽成,并统一处理各模型的速率限制。它提供 bounding boxes 与 layout 作为服务,可为任意模型补充 grounding,解析候选新模型将先在 ParseBench 上评测再上线,自动化路由等新功能也在开发中。
Jerry Liu 发布 OpenDocRouter,一个面向文档解析的统一 API,可在一个接口和计费体系下比较并使用 MinerU 等轻量开源 OCR 模型到 Opus 5.5 等前沿 VLM。
美团搜索团队披露 LLM 语义表征在服务零售排序场景的三期实践,累计完成 3 个 Launch Review 并全量上线,一期将 Query 与 POI 的语义向量 cosine 相似度分桶注入精排,带来大盘搜索支付订单 +0.20%、服务零售订单 +0.27%、长尾 NDCG@5 +2.21pp。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻、30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。
Mistral AI 的 Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 净提升分,比上一版 Mistral Medium 3.5 的 -12.60% 高出 11 个名次,综合排名第 43。
GMI Cloud 将 Qwen3.8-Max、Qwen3.8-Flash 与 Wan3.0 的免费访问再延长 7 天,并提高了三款模型的速率限制。用户可用 Qwen 或 Wan 构建作品参赛,按最有创意、最具挑战和投入最多评选 3 名获奖者,各得 200 美元现金加 200 美元 GMI 额度。