把几十万份企业文档塞进知识库,为什么“导进去”只是最容易的一步
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
美国陆军一场沙漠试验暴露出装备局限与体制障碍,阻碍其现代化并跟上精通 AI 的对手。
谷歌云在 Gemini at Work 2026 大会上推出 Gemini 通用工作代理(Gemini Universal Work Agent),可自主规划任务、调用工具并连接企业业务系统。
刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。
Cola 套餐将于 10 月 12 日升级,改为基础会员卡 $10/月、进阶会员卡 $30/月、专业会员卡 $99/月三档,并推出永久积分、月度通用积分、月度 Auto 积分三种积分体系。
10 月 9 日 Ryan Dahl 宣布 Deno 全团队加入 Cloudflare,团队后续将把更多精力放在 celld 与 Cloudflare Workers 的整合上,重点是让 Workers 和 Durable Objects 更方便地运行在自托管环境中,AI Agent 是官方特别看好的应用场景之一。
AI产品经理的技术门槛不是会训练大模型,而是能否用技术知识改变产品决策。文章以售后客服助手为例,拆解政策解释、订单查询、退款执行三类任务在模型边界、API与权限、数据流上的差异,并给出评估分层与上线边界。作者认为,产品经理不必补齐程序员训练路径,而应学会判断任务该交给生成、检索、工具还是人工。
闲鱼2026年上半年AI服务交易达981.6万单,同比增长157%,近500万人购买过AI服务,其中AI技能接单占45.1%,AI编程和网站搭建订单同比增长1732%。
阿里巴巴高级技术专家孙鹏将在 QCon 上海 2026 分享 BoRP(Bootstrapped Regression Probing)评测范式,不再让模型写评语,而是直接读取 LLM 隐状态中的满意度信号,评测成本降低 97%,人类对齐度超过传统生成式 Judge。该方案在 8B 模型上对齐 GPT-4 级评测精度,成本约为其 3%,已在万亿级流量的 A/B 测试中落地。
InfoQ 中文发表 Nik Kale 的文章,提出把 MCP 部署安全拆成四个控制层:安全的工具执行、隔离的管理平面、受限的出站信任边界和基于 Manifest 固定的语义完整性。
Uber 法务红线 Agent 从朴素 RAG 起步失败,历经反馈闭环、语气分层、Agentic 修改草拟四版架构,把合同决策准确率做到 91%、平均审核时间下降 20%+。
这篇内容介绍 LLM 推理性能的核心框架:一次推理由 Prefill 和 Decode 两个阶段组成,Prefill 并行读入整个 prompt 并写入 KV 缓存、产出第一个 token,瓶颈在算力;Decode 自回归逐 token 生成、每次都要读权重和全部历史 KV,瓶颈在内存带宽。
数字生命卡兹克创始人用5天时间为30多人的公司自建了一套以Agent操作为原生的企业中台,底层数据实时同步飞书文档与多维表格,并复用飞书权限体系。该中台把部署与分享包装成MCP,同事只需把一段Prompt发给Claude或Codex即可自动完成应用部署、子域名分配与权限配置,同时支持应用上架、Skill分发、品牌VI与PPT模板沉淀。
技嘉 10 月 9 日宣布,全部 B760 和 H610 主板将通过 BIOS 更新支持预计 2027 年初推出的新款英特尔 LGA1700 处理器,其中包含 DDR4 主板。
智能激光金属加工设备公司LaserCyber已完成数千万元融资,由启高资本投资、为溪创投跟投。该公司2025年8月成立于深圳,首款激光焊机L1系列覆盖600W、900W和1200W三个功率段,可焊接铜、铝等高反射材料,并集成手持焊接、切割和激光清洗。产品已登陆Kickstarter众筹,获得超百万美金支持,主要面向海外小型加工厂和金属创作者。
OpenAI 的 Tibo 回应 Codex 上下文长度选择问题,称团队测算后认为 300K 是更好的默认值。Codex 实际也能跑 1M 上下文,但那样只会消耗更多用量。
Cloudflare 将 Traces 开放公测,把安全规则、URL 转换、缓存决策、路由、Worker 执行和回源处理都变成 OpenTelemetry span,汇聚到单一请求时间线,无需自行埋点。
AI 竞赛的下一道瓶颈可能不是芯片而是电力。美国电网今年计划新增 86GW,其中太阳能 43.4GW、电池储能 24.3GW、风电 11.8GW、天然气 6.3GW,新核电为 0GW,而 AI 实验室规划的电力需求是数百 GW。a16z 就此分析了美国如何为下一轮增长提供电力。
鲲为科技推出经颅超声产品 Rocvue T 系列,可辨认中脑、丘脑、侧脑室等结构并观察脑内血流,已取得国内注册及欧盟 CE MDR 认证,2025 年第四季度启动商业化并当季获得数千万元订单,其中西安市第三医院采购一台 Rocvue T7 的中标单价为 197 万元。
「豆包工作」独立电脑版将资料研究、浏览器与电脑操作、表格整理和 PPT 制作放进同一任务入口,可在本地电脑或云端执行。实测一份两人六天五晚的北京行程方案中,它通过「浏览器录制与回放」Skill 复用查询方法,并行调用多个 Agent 研究行前准备、景点与展览信息,最终生成 20 页 PPT,预算页给出两人估算约 6310 元(不含往返北京大交通)。目前下载电脑端可限时免费领取 30 天订阅权益。
马斯克表示旗下公司将独立建设并运营得克萨斯州 Terafab 芯片工厂,台积电仅可能租用部分厂区,不参与运营,英特尔 CEO 陈立武称将继续与马斯克合作推进该项目。
聿核科技正在研发 Physical AI 原生架构芯片聿启 Y10,计划今年底推出 FPGA 版本计算平台供客户实测。创始人许飞翔称,与客户现用的 x86 加 Orin 方案相比,仿真验证结果是整体性能提高 5 倍、成本降低 80%,芯片开发已过半。团队核心成员曾参与英伟达多代 GPU 设计,主张芯片架构对易用性的影响占 70%、软件占 30%。
LangChain 作者 Harrison Chase 分享 @ch3nweiii 的观点:agent 中大量步骤是 yes/no 判断而非生成,不应交给每月 $20-$200 的前沿模型。
LangChain 的 Open SWE 把模型选择移入 harness,每个任务交给仍能完成工作的最便宜模型,并按质量进行测试,单任务中位成本下降 64%。开发者反馈 DeepSeek v4.1 Flash 作为编排器表现突出,可协调编码、测试、研究和子智能体,并在验证环节低成本复查代码改动,仅在更难的长尾场景才动用 Opus 或 Sol。
OpenRouter 为内部 5 人销售团队打造的 AI 销售智能体 Rasp,每月节省约 600 小时工时,当前推理使用 GLM 5.2、成本约 18 美元/天。
Mole 正在开发 AI 清理与维护功能,覆盖主流 AICoding 工具和 CLI,可处理旧版本、worktree、老对话、不在用的工具及过期内容。目前对话清理默认检查「120 天之前」,也可选择「永不清理」,Mole 就哪种默认策略更好向用户征求意见。
LangChain 推出 Managed Deep Agents 0.8,新增用户自有凭证、用户级记忆、HTTP channels、Slack 文件传输,以及由 Parallel 驱动的联网搜索预置工具。
LangChain 发布 LangSmith Fine-Tuning 和 smithtune,这是一个把 LangSmith 轨迹转成 Agent 专用微调模型的 CLI,覆盖数据集构建、基于 Fireworks 或 Baseten 的训练以及 LangSmith 评估。
Notion 正在原生重建其 iPad 应用。侧边栏、AI 和 Search 已完成原生化以提升速度,接下来移动端将上线原生编辑器,验证稳定后再在 iPad 上测试,随后探索 Apple Pencil 支持。
Devin 推出按需云环境,支持 macOS、Linux、Windows 和 Android,让硬件不再决定开发者能在哪里、构建什么。有用户表示自己用的是 Windows PC,也能借此无缝为 iOS 构建应用。
Lee Robinson 在斯坦福 CS146S 课程第三周讲座中,以 Grok Bot 为例讲解「常驻式主动智能体」的工作原理,即常驻运行、主动观察环境、自主决定何时介入的 agent。讲座分六部分,涵盖从聊天式助手到常驻 agent 的演进、模型能力变化、内部架构拆解、执行框架(工具调用、循环控制、权限与安全边界)、上下文工程以及范式前瞻。
Supabase 官网访问量已连续 12 个月高于 Vercel。过去一年构建层平台流量集体翻倍:Vercel 涨 2.6 倍、Supabase 涨 2.1 倍、Cloudflare 涨 2 倍、OpenRouter 涨 2.4 倍;与此同时,单一用途的 AI 网站访问量出现萎缩。
Cloudflare 收购 Deno 整个团队,Deno 运行时仅再维护一年,Deno Deploy 六个月后关闭,JSR 由 Cloudflare 承接。Cactus 发布 16.9 MB 的本地语音识别模型 Whistle,CPU 运行,支持七种语言并输出词级时间戳,每次最多处理 30 秒音频,暂不支持中文。
为争夺支撑 AI 热潮的算力资源,昔日竞争对手开始结盟,高管不得不亲自出面介入。这场算力争夺战正在重塑硅谷的格局。
Microsoft 的 Decision-1 模型已在 AI Gateway 上线,可针对文本回答带概率、选项和评分的类型化问题,支持是/否判断、命名类别选择以及按有序标准评分,多个问题可在一次请求中共享同一输入。
Replit Desktop for Windows 进入私密预览,与 Microsoft 和 NVIDIA 合作,可在本地 PC 上构建并运行应用,每个应用都有独立沙箱,现已开放等待名单。Replit 还支持在单一聊天中跨项目操作,可查找项目、读取文件、下发任务并在应用间迁移功能;新增 TikTok Ads MCP,可在 Replit 内创建、发布和追踪 TikTok 广告并优化投放。
Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。
Radxa Dragon Q8B 单板计算机售价 209 美元,搭载 Snapdragon 8cx Gen 3,CPU 核心数为 Raspberry Pi 5 的两倍,多核性能超过 Pi 5 两倍,并内置 NPU、双 2.5G 网口和多个 M.2 插槽。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
LangSmith LLM Gateway 现已支持 OpenAI Decisions API,可为智能体提供低延迟推理。该网关同时提供模型回退、数据脱敏策略和支出限额,作为集中管控入口。