把几十万份企业文档塞进知识库,为什么“导进去”只是最容易的一步
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
AI产品经理的技术门槛不是会训练大模型,而是能否用技术知识改变产品决策。文章以售后客服助手为例,拆解政策解释、订单查询、退款执行三类任务在模型边界、API与权限、数据流上的差异,并给出评估分层与上线边界。作者认为,产品经理不必补齐程序员训练路径,而应学会判断任务该交给生成、检索、工具还是人工。
AI项目写进简历却没面试邀约,常见误区有三种:写成技术清单(大模型、RAG、Agent)、只罗列功能、或空写“提升工作效率”,都看不出产品经理发现问题、选择方案和验证价值的过程。有效写法是围绕三点:先写清解决了谁的什么问题再做功能,写出关键取舍,并用脱敏记录测试遗漏情况和整理耗时等验证过程或结果证明项目不止于Demo。
阿里巴巴高级技术专家孙鹏将在 QCon 上海 2026 分享 BoRP(Bootstrapped Regression Probing)评测范式,不再让模型写评语,而是直接读取 LLM 隐状态中的满意度信号,评测成本降低 97%,人类对齐度超过传统生成式 Judge。该方案在 8B 模型上对齐 GPT-4 级评测精度,成本约为其 3%,已在万亿级流量的 A/B 测试中落地。
InfoQ 中文发表 Nik Kale 的文章,提出把 MCP 部署安全拆成四个控制层:安全的工具执行、隔离的管理平面、受限的出站信任边界和基于 Manifest 固定的语义完整性。
Uber 法务红线 Agent 从朴素 RAG 起步失败,历经反馈闭环、语气分层、Agentic 修改草拟四版架构,把合同决策准确率做到 91%、平均审核时间下降 20%+。
这篇内容介绍 LLM 推理性能的核心框架:一次推理由 Prefill 和 Decode 两个阶段组成,Prefill 并行读入整个 prompt 并写入 KV 缓存、产出第一个 token,瓶颈在算力;Decode 自回归逐 token 生成、每次都要读权重和全部历史 KV,瓶颈在内存带宽。
数字生命卡兹克创始人用5天时间为30多人的公司自建了一套以Agent操作为原生的企业中台,底层数据实时同步飞书文档与多维表格,并复用飞书权限体系。该中台把部署与分享包装成MCP,同事只需把一段Prompt发给Claude或Codex即可自动完成应用部署、子域名分配与权限配置,同时支持应用上架、Skill分发、品牌VI与PPT模板沉淀。
LovartAI 在 X 上分享了一段用于生成俯拍猫咪照片的提示词,画面为橘猫穿黑色长袖针织毛衣仰躺沉睡在复古波斯花纹地毯上,午后阳光透过百叶窗投下条纹阴影,规格为写实摄影风格、8K、浅景深、暖色调、16:9。
Oddly 称其终于把 Claude 的动态效果调到位,并用 Claude 在 30 分钟内制作出一支地铁 Logo 广告。该成果以视频形式发布在 X 上。
Claude 可被用于产品经理场景:只需向它提问"上周谁使用这个功能最多?整理一份使用量最高的前 10 名报告,然后联系他们,安排 15 分钟交流",即可自动找出产品重度用户并直接约访,这可能是获取真实用户反馈最快的方法。
一位产品经理分享 Claude 的用法:让 Claude 查出上周使用量最高的用户,生成用量 Top 10 的 artifact,再主动联系这些人并安排 15 分钟交流。她称这是获取用户反馈最快的方式。
宝玉介绍了一个用 Claude Dashboard 分析 X 账号数据的用法:从 X 账号数据页下载各 Tab 数据,作为附件上传到 claude.ai/artifacts 新建的 Dashboard,交给 Claude Dashboard 分析。参考提示词为「帮我分析一下我的推文数据,看看哪些推文更受欢迎,怎么优化」。
以修改 UI 为主的功能不必先写技术方案,可以直接从改原型开始;原型改好后用 Agent 内置浏览器的“标记”工具在要改的地方标注并写评论。原型完成后,可在同一会话里让它把原型修改同步到正式代码中。作者通常用 Fable 做设计、Opus 执行、再由 Fable 验收。
Lee Robinson 在斯坦福 CS146S 课程第三周讲座中,以 Grok Bot 为例讲解「常驻式主动智能体」的工作原理,即常驻运行、主动观察环境、自主决定何时介入的 agent。讲座分六部分,涵盖从聊天式助手到常驻 agent 的演进、模型能力变化、内部架构拆解、执行框架(工具调用、循环控制、权限与安全边界)、上下文工程以及范式前瞻。
Claude Code Projects 向所有 Pro 和 Max 用户开放,小互给出 4 分钟入门指南:创建项目并填入目标和相关代码仓库,Claude 会把大目标拆成多个任务,每项任务建立独立线程并行执行,线程默认在云端运行,合上电脑也能继续,需要本地文件或工具时可改到电脑上运行。作者提示并行任务会更快消耗套餐额度,可以规定它如何工作、多久汇报、是否先给计划,线程之间共享项目记忆。
一条建议称,在完成优化后,可以再用 Opus 5.5 去 review 一下,然后让它学习一下。原文未说明具体优化对象与流程细节。
宝玉描述自己的功能开发和 bug 修复都跑在一个 loop 循环里,Agent 和自己都能快速拿到反馈,loop 转得越快效率越高。Loop 跑通后可尝试多任务并行,因为大部分时间由 Agent 生成和验证,人可以专注定义问题和验证。当前主要瓶颈是电脑设备不够多和 Token 不够用,他计划多在云端开任务来缓解设备不足。
宝玉建议用 /autocompact 400k 限制 Claude Code 的自动压缩上下文长度,认为 400k 左右比较合理,他自己设置为 300k。他还表示此前建议在 ~/.claude/settings.json 中禁用 1M 上下文的 "CLAUDE_CODE_DISABLE_1M_CONTEXT" 现已没必要,应删除,否则最多只能到 200k。
宝玉建议 Claude Code 用户删除 ~/.claude/settings.json 中的 CLAUDE_CODE_DISABLE_1M_CONTEXT 配置,该设置已无必要,保留会导致上下文最多只能到 200k。同时他建议将 autocompact 自动压缩上下文长度设为 300-400K,自己设置的是 300k,通过 /autocompact 400k 命令调整。
GitHub 博客称黑客马拉松仍是学习构建的最佳场所,参赛者可在两天内完成机器人、应用、网站或硬件原型。借助 GitHub Copilot 等 AI 工具,自然语言正成为通用编程语言,没有计算机科学学位的人也能把想法变成代码,有团队用 Copilot 在 30 分钟内搭出前端并接入新闻 API。
宝玉将文章中的开发方法论完整应用于开源项目 baocut,流程涵盖技术方案文档、原型与 UI 设计、编码实现和测试验收。他让 Agent 先做调研并撰写技术方案文档,反复沟通定稿后再产出接近正式 UI 的高保真原型,最后才实现代码。验收阶段 Agent 借助 Electron 的浏览器能力自行测试,多数活由 Agent 完成,人只负责定义问题和验收。
宝玉将其文章方法论完整应用于开源项目 baocut,流程分四步:先让 Agent 写技术方案文档并反复修改定稿,再做高保真原型与 UI 设计,然后实现代码,最后由 Agent 自行测试验收、人工复测收尾。他把技术栈改回 Electron,Agent 通过浏览器即可验证绝大部分功能,仅复杂场景才用 Computer Use 辅助。人主要负责定义问题和验收两端。
NVIDIA 2026 年论文《World Action Models are Zero-shot Policies》带火了 World Action Models(WAMs)这一概念,其 DreamZero 基于预训练视频扩散模型,联合生成未来视频帧与动作。
Eric Zakariasson 在推文中表示这些模板来自 @pjvann,建议关注他并试用这些模板。
LangChain 提出 agent 构建者应能回答三个问题:agent 在哪里失败、如何复现、如何让它停止失败。Jake Broekhuizen 就此做了一场分享,视频已发布在 YouTube。
Rillet 借助 Vercel 开源智能体框架 eve 将上线速度提升 3 倍,两人前端团队 4 个月内关闭 800+ Linear 工单,客户需求最快 2 小时上线。其智能体通过 Vercel Connect 接入 Slack 和 Linear,并借 AI Gateway 统一路由 Anthropic、OpenAI 等模型请求,配置只需在 agent.ts 中改一个模型字符串。
freeCodeCamp.org 在 YouTube 上线免费 n8n 与 AI 自动化课程,时长约 1 小时,讲解如何把 n8n 打造成 AI 驱动的编排引擎。
LangChain 在 Managed Deep Agents v0.9 中新增 reactions API,可为 Slack 等渠道的分布式智能体动态分配 emoji 回应,取值可以是 emoji 字符串或返回 emoji 的可调用对象。
LangChain 在 Open SWE 中把模型路由做进 agent harness,按任务类型和难度在 GLM-5.3-Flash、GPT-5.6 Sol、GPT-6 Astra 三档模型间选择,相比始终使用顶级模型的基线把每线程中位成本降低 64%,质量没有可测量变化。
GPT-5.5 在 KernelBench-Verified 修正后的整体几何平均加速比从 1.43× 降到 0.88×,原因是基线补上了 TF32 和隐藏输入分布。
Simon Willison 征询适合编程、能在 60GB 内存以内运行的开源权重 MoE 大模型,认为 MoE 是其可用硬件上达到可交互速度的必要条件,目标是超过 12 tokens/秒。
一个节约 Token 的 Claude Design 原型流程:先在 Claude 网站把设计稿迭代到满意,导出为 HTML 下载到本地,之后让 Claude Code 把它当作本地网页更新维护,不再依赖 Claude Design 网站。有用户反馈深度使用后,一个产品设计基本会耗尽一周的 token 用量。示例原型见 github.com/JimLiu/baocut。
Postman 披露其 Agent Mode 运行在 Amazon Bedrock 上,服务 4000 万开发者。团队发现工具数量超过约 40 个后工具选择错误上升,于是将 170 多个工具按任务动态收窄至约 15 个;同时把上下文而非模型能力视为主要瓶颈,并采用亚马逊云科技跨区域推理、多级提示词缓存,以及修改应用状态前需用户批准的设计。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里边聊边让 GPT-6 Astra High 为博客搭出 Newsletters 页面,包括新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成。
Nubank 的 Aman 与 Snowglobe 的 Shreya 展示了如何在仿真环境中测试银行客服智能体,在上线真实实验前先做验证。该分享来自 World's Fair 2026 的录播,活动于 10 月 12 日至 14 日在纽约举行。
Simon Willison 全程用语音、通过 Codex Desktop 给自己的博客开发了一个新功能,过程中他正在做晚饭。相关记录发布在其博客 simonwillison.net 上。
一份 Claude Motion 与 Claude Dashboards 的完整上手指南,涵盖 Dashboards 实战与避坑要点、Motion 核心工作流,以及如何把一句话需求写成可交付的视频提示词。指南还拆解了官方单车案例 81 秒演示的业务闭环,并附新手交付前实操检查清单。
西湖大学特聘研究员李昊阳在《AI4S 实战派》第十五期直播中讲解如何用 AI 从 H&E 病理切片预测空间转录组分子信息,梳理了判别式建模、扩散模型与流匹配等生成式方法,以及 UNI、GigaPath、CONCH、OmniCLIP 等病理基础模型和对齐工作。
袋鼠帝实测了 Vidu 上线的新一代视频旗舰模型首个预览版 Vidu Q4 Preview,并用它复刻《你的名字》真人版最后一幕、用五种情绪演绎同一句台词。据其介绍,该模型主打传神表现力,支持最多 3 段参考音频和 15 张参考图,可直出 720P、1080P、2K、4K,单次最长 16 秒,首发 0.09 元/秒起。