PEC 2026 提示工程大会 9 月 12 日北京举行,主题定为 "Won Token, Won World"
PEC 2026 AI 创新者大会暨第三届提示工程峰会将于 9 月 12 日在北京·众智园举行,主题为 "Won Token, Won World",以 Token 产业链为贯穿全场的线索,从 Token 生产、调度到实际应用连接模型、基础设施、产品与业务。
PEC 2026 AI 创新者大会暨第三届提示工程峰会将于 9 月 12 日在北京·众智园举行,主题为 "Won Token, Won World",以 Token 产业链为贯穿全场的线索,从 Token 生产、调度到实际应用连接模型、基础设施、产品与业务。
阿里云开发者发布文章,探讨如何让 AI Agent 承担“架构师”职能,完成跨复杂存量分布式系统的技术方案设计。作者提出知识库建设应先“对齐领域”做结构化设计,而非首选 RAG,因为检索无法保证 AI 拿到完整工程判断所需的知识集合。文章还从技术方案设计 Agent 切入,逐步落地架构师 Agent。
AI 时代下,美团、阿里等大厂已跳过原型图和设计稿,由产品经理用 AI coding 直接生成前端页面,纯执行型 UI 设计岗位持续收缩。文章认为 UI 设计师的需求分析、用户调研、原型设计与竞品拆解能力,正是 AI 产品经理岗位的核心要求,并推荐了一门主打 Agent、RAG、Function Calling 与 Vibe Coding 的「零基础入门AI产品岗」课程。
Docker 发布文章解析沙箱环境的六大优势,并以 Docker Sandboxes 对应实现:每个沙箱运行在独立 microVM 中,由硬件支持的 hypervisor 边界与主机隔离;网络与文件系统策略可按沙箱设定并在运行时于边界执行。凭证保留在主机 keychain,由沙箱在出站请求时注入,环境本身不持有密钥;沙箱定义为代码、可快速重建与丢弃,便于并行运行多个 AI 智能体。
OpenAI 与 Anthropic 双双改写企业数据政策。Anthropic 允许使用 Claude Fable 5.1 等顶级模型的企业将数据留在自有服务器上 30 天,OpenAI 则通过一套新的安全处理系统承诺零数据保留。两家均用自动化系统标记滥用行为,但相关系统缺乏技术透明度。
Augment Code 展示了一段演示:一位 PM 先用她的 agent 起草 PRD,工程师打开同一份文件、用自己的 agent 评审并留下评论,她的 agent 回复评论并更新文档。整个过程在 Cosmos 内完成,共用一个文件系统,两个人和两个 agent 同时参与。
LangChain 在 deepagents 最新版本中引入 context modes,支持 "isolated" 和 "fork" 两种子智能体上下文模式。
面对跨 Web 前端、后端服务、数据库与外部 API 的分布式 .NET 应用延迟,Visual Studio 性能分析器可用于定位真正负责慢操作的那个进程并采集其 CPU 活动。
Dify 的 Agent 可跨不同部门运行,同一 Agent 同时服务 Web Apps、API 和多个 Workflow。Logs 与 Tracing 展示每次运行的具体情况,Monitoring 则持续跟踪用量、质量、性能与成本。
IntelliJ IDEA 新增安全提示嵌入(Security Inlays),可在调试 Spring MVC 接口遇到 403/401 时直接查看运行中应用对该端点要求的 hasRole/hasAuthority 角色,并在不修改 SecurityConfig、不重启应用的前提下解锁端点。
NVIDIA 宣布推进 Rust 原生 GPU 编程,推出 CUDA Rust,并提供两条编写 GPU 内核的路径,计划将其持续发展和成熟到 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,而 AI 系统层涵盖推理引擎、服务基础设施、驱动和智能体运行时,随模型与技术变化不断迭代。
Qdrant 在五个公开数据集上测试了向量检索的调参策略,发现该调哪个参数取决于问题出在哪里。将候选深度从 10 提升到 500,最佳可达分数最多提高 0.28,但最终分数提升至多只有 0.01,因为相关文档已被召回、只是排名不够高。Qdrant 因此建议先定位失败环节,再调整与之对应的 `hnsw_ef`、候选深度、RRF `k`、量化或重排序等参数,而非反复试参数。
PayPal CTO Srini Venkatesan 在 Ai4 大会上探讨如何用 AI 安全地扩展资金业务。该期节目由 Stack Overflow Blog 发布,并同期收录了 Anaconda AI 产品工程副总裁 Greg Jennings 关于构建默认安全 AI 编码智能体的对谈。
结合 E-SAGE 电商 Agent 服务平台实践,给出三条判断标准——咨询频次高、判断路径固定、结论因人而异,符合任意两条就值得做成 Agent。门槛不在编程能力而在业务理解,已上线 Agent 的建设方以业务角色为主而非研发工程师。E-SAGE 通过自建的云原生架构 cns 将 Agent Loop、状态与执行环境三层解耦,实现多会话并行与故障自动恢复。
一位 MHXX 老玩家为已无人维护的开源存档编辑器 MHXXSaveEditor 补上缺失词条,把 AI 接入逆向研究流程。AI 通过 MCP 或 JSON Lines 接入,只能读取差分证据、提交候选判断并申请推进下一步;写入需人工在 Human Gate 逐次批准,且只改测试副本,原始存档不被覆盖。
Browser Use 宣布取消所有订阅,改为按实际用量付费,不再有月度承诺,新用户可获 15 美元免费额度。该浏览器服务商称开发者应为使用量而非访问权限付费,调整即日起生效。
AI 落地实施正越来越像咨询工作:项目起点从明确需求变成"建企业级 AI 平台、知识库、智能问答、智能体"这类大方向,前半程的重点转为与客户一起发现价值。作者认为可复制的是方法和经验而非项目答案,总体设计须先回答"为什么建、先建什么、怎样证明值得继续建"。企业级知识库的长期有效还需同时解决知识生命周期、知识质量与知识价值,软件则内化运营管理方法。
Browser Use 宣布取消所有订阅套餐,改为纯按用量付费、无月度承诺,新用户可获 15 美元免费额度,即刻生效。官方称开发者应为实际使用量付费,而非为访问权限付费。
SemiAnalysis 发布 TPUv7 Ironwood 在 InferenceX 预览版上的首批第三方推理结果,在与 B200/B300 的同等条件对比中,Ironwood 每美元性能最高提升 50%。
小米秋季旗舰新品发布会上,小米澎程N70 Pro、N70 Max、N90 Max 和 N90 Max 探索版四款车型正式上市,售价 20.99 万至 29.99 万元。
天猫新品 MDI 项目按四个阶段推进 AI 研发协同:单兵攻坚期用 AGENTS.md 入口地图加六个 collar Skill 构建结构化知识库,加人提速期以站点地图式 spec 目录物理隔离分工。
Qdrant 将在 9 月 16-17 日举办 3 场免费社区活动。9 月 16 日为 Discord Office Hours 与柏林 Bring Your Own Demo Night(联合 cognee。
作者 lencx 介绍了自己新项目采用的围绕 AI 反馈闭环的技术栈,包括 pnpm v12、TypeScript v7、Vite v8、Oxlint、Oxfmt、React 与基于 StyleX 的 Astryx,目标是缩短 AI agent 从修改代码到获得有效反馈的周期。
AI产品黄叔发布 Grok Bot 蓝皮书 v0.1,记录如何把 xAI 的 Grok Bot 当作调度器而非执行者使用。作者称同一账号下的 Bot 共用一台云电脑(8 核、16G 内存、126G 硬盘)并支持群聊协作,自己只与大管家 Bot 对话,由它派活给 X 热点抓取、网站开发等 Bot 完成网站自动更新。
开发者分享自己如今从 100K LOC 压缩到几千行的做法:把大量曲折的实验、验证测试和加载/对抗性破坏脚本留在一个混乱分支里,很少让这些冗余代码进入主分支。他只做帮助理解各部分的小实验,并公开征求更好的做法。
Ollama 公开了其定价页面,链接为 ollama.com/pricing。
Ollama 宣布推出错峰时段 token 费率,DeepSeek-V4-Flash 和 Pro 在工作日 UTC 12:00 至 18:00(太平洋时间 5am-11am)之外以及整个周末均按半价计费,错峰定价后续将覆盖更多模型。Ollama 云端上的 DeepSeek 模型托管在美国和欧洲,提供 ZDR 与快速性能。
Perplexity 的服务基础设施降低了在线与批量嵌入工作负载的延迟并提升吞吐。将 Ivy、Tulip 和 ROSE 结合后,搜索速度更快、成本低于现成方案。
Qdrant 发布 1.19.1 补丁版本,量化 HNSW 搜索速度提升约 1.5–2.5 倍,payload 密集的 shard 迁移提速 1.5 倍。该版本还改进了 TurboQuant SIMD 打分、批量 HNSW 搜索与删除检查等。
NVIDIA 发布技术指南,讲解如何在 Jetson 边缘设备上部署与优化具备多步推理能力的模型。此前这类推理模型体量过大,只能将推理请求绕行数据中心处理,带来网络依赖、成本上升和敏感数据离机的风险。该限制正在解除。
Hailuo AI 提议将 MiniMax H3 作为工作流的最终渲染器使用。用户 @mojon1 正在尝试把 MiniMax H3 当作产品 CG 的渲染器,并指出其可本地处理;在本地确定方向后再提交 API,可减少浪费。
字节跳动技术团队基于内存快照研发线上 Memory Graph 方案,还原对象引用关系、识别异常内存来源并辅助归因,落地三个月内使头条和抖音的 OOM 崩溃率下降超过 50%。该方案针对 iOS 应用因内存占用过高被系统终止、却缺乏普通崩溃日志的定位难题。滴滴则复盘了 HDFS 从 2.7 滚动升级至 3.2 的完整实践,在不中断业务的前提下完成长期升级。
Greg Brockman 表示期待 Astra 登陆 Azure,并转述 Satya Nadella 称已有早期客户开始使用。Satya Nadella 同时分享了 Azure 官方博客中关于 Astra 的链接。
Next.js 团队在约三周内关闭了 1,462 个 GitHub issue,把积压从 2026 年 8 月 10 日的 2,244 降到 9 月 4 日的 995,期间还新增 218 条报告。
Satya Nadella 表示,已有早期客户在 Azure 上使用 Astra。推文附带的链接指向 Azure 官方博客中关于 GPT 的内容。
淘宝百亿补贴团队上线 bybt-data-analysis-assistant 数据分析智能体,用自然语言提问即可完成找表、写 SQL、执行到深度归因的全流程。
NVIDIA 技术博客解析如何让用户身份跨越联邦 Kubernetes 集群与 AI 平台边界:用户从中央门户打开受治理数据集、启动 notebook 并调用另一集群中的助手服务,身份每步都要穿越控制面与数据面,传统单点登录在此失效。
YOLO Mode 指 AI 智能体自动批准所有操作、不再弹出确认提示,Claude Code 的对应开关是 --dangerously-skip-permissions,Codex CLI 为 --full-auto,Gemini CLI 用 --yolo,GitHub Copilot CLI 为 --allow-all,Cursor 则在设置中提供 auto-run。
LlamaIndex 为 Extract 推出 Turbo 模式,从文档中提取结构化数据的速度约为其 Cost Effective Tier 的 4 倍,准确率相当,中位延迟为每页 3.7 秒。Turbo 采用页面并行处理,文档规模增大时延迟几乎保持平稳,目前以 beta 形式开放。
Lovable 现已可从 Linear 中直接调用,Linear issue 里的 spec 只需一次调用 Lovable 就能变成在线托管的应用。用户可通过 linear.app/integrations/l… 开始使用。