企业AI项目为什么跑不出价值?知识工程正在成为大型企业的隐性共识
大型企业AI项目验收后常出现使用率不及预期的情况,核心原因是AI系统未能有效利用企业自身知识。文章指出,企业AI真正落地取决于知识工程是否扎实,需在入库前完成知识准入、清洗、预标注与抽取,并覆盖版本管理、权限控制和持续优化。金融、高端制造和大型集团的AI应用至少要具备知识准入、知识治理、权限控制和持续优化能力。
大型企业AI项目验收后常出现使用率不及预期的情况,核心原因是AI系统未能有效利用企业自身知识。文章指出,企业AI真正落地取决于知识工程是否扎实,需在入库前完成知识准入、清洗、预标注与抽取,并覆盖版本管理、权限控制和持续优化。金融、高端制造和大型集团的AI应用至少要具备知识准入、知识治理、权限控制和持续优化能力。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
作者用 Claude Code 给字幕转录翻译 App BaoCut 加远程转录功能,把可行性分析、设计文档、高精度原型、编码、测试五个环节全部交给 Agent 执行,人只在关键节点确认和拍板。
Qdrant 发布五篇系列文章,介绍如何不靠猜测地调优向量检索,实测覆盖 5,183 到 460 万文档的五个公开数据集。文章指出七个集合设置会悄悄限制搜索质量,例如稀疏向量缺少 IDF 修饰符、BM25 平均长度用默认值;在其实测中,25 条标注查询不足以区分融合调优带来的增益。
Qdrant 发布技术分析,给出集合超出 RAM 时的量化配置方法:先在 bits4(约 8 倍压缩)起步,用公式 vectors × dimensions × 4 bytes × 1.5 估算常驻内存,并固定量化副本、让原始向量保持 cold。
Percy Liang 宣布 Marin 535B-A23B 本周开始训练,全程开放。预训练(80%)加中期训练(20%)共 18.75T tokens,用 11 套 GB200 NVL72 跑约 3 个月,约 2.7e24 FLOPs,之后进行后训练。
Qdrant 提出用候选排序上限与 nDCG@10 基线之差来判断是否值得引入重排序:在 200 个候选的深度下,五个数据集的 nDCG@10 差距介于 0.247 至 0.487。
AI 原生组织转型系列第一期提出,AI 不是组织的工具而是组织的替代品,应让 AI 接管对齐事实与对齐打法。作者认为知识工作约 60% 的时间耗在开会与协调上,局部提效动不了这个大头;AI 可把 N×N 沟通变成 N,并用 skill、检查点等方式把规范写进执行环境。文中列举出门问问、安克创新、Claude Tag、ZooClaw 等正在发生的做法。
Devin 现已开放桌面端下载,下载地址为 devin.ai/download。该消息由 Windsurf 官方账号发布,未披露版本号、功能细节或价格信息。
OpenAI 将 GPT-5.6 Sol 价格下调 20%,为期 3 个月,叠加此前 70% 折扣后,至 10 月 3 日可享原价 76% 的优惠。Cognition 称 GPT-5.6 Sol 现为 Devin Desktop 和 Devin CLI 上最实惠的前沿模型。
Qdrant 在五个数据集上对比了默认 RRF(k=2)与 DBSF 两种融合策略,其中四个数据集上融合优于单一最优检索,DBPedia-entity 是例外,融合反而落后稠密检索 0.0039。
Milvus 3.0 新增 =~ 和 !~ 过滤器,可在向量检索、全文检索和标量过滤之外匹配或排除结构化字符串模式。其分层执行路径先用 RE2 做线性时间校验并拒绝非法模式,再将 ^ERROR$ 等简单模式改写为等值或前后缀检查,并在 sealed segment 上复用编译后的模式、优先检查必需字面量,必要时用 NGRAM 收窄候选集,否则回退到原始验证。
吴恩达(Andrew Ng)分享了构建与部署 AI 应用所需的最重要技能,相关长文发布在其 X 账号文章中,该推文获得 260 条回复、2076 次转发和 12131 次点赞。
Firecrawl 发布 Developer Index,这是一个专为编程智能体打造的索引,可检索 7000 万+ 一手来源,覆盖代码仓库、文档和 issue,官方称其召回率为所有编程类索引中最高。该索引旨在让智能体每次都能交付正确、最新的代码。
在 v0 中构建的应用和智能体现可借助 Vercel Connect 安全连接 Slack、GitHub、Salesforce 等 100+ 服务。该能力通过可复用的团队 connector 和短期 token 完成认证。
吴恩达列出的 AI 应用开发者必备技能包括:LLM 基础、用数据为模型提供依据、构建智能体系统、评测驱动开发、生产环境运维、机器学习基础。这是 AI Engineering Skills Map 的第二期内容。
吴恩达给出 AI 应用开发者的七项基础技能清单:LLM 基础、用数据为模型提供事实依据、构建智能体系统、评估驱动开发、生产环境运维,以及机器学习基础。这是 AI Engineering Skills Map 的第二期内容。
Qdrant v1.17.1 新增实验性写入路径设置 prevent_unoptimized,让正在优化的 segment 中新写入的点进入 deferred 状态、暂不参与检索,直到优化完成;配合已有的 indexed_only 读路径参数,可减少批量上传后落在未索引 segment 上的全量扫描。
Qdrant 1.19 支持 turbo4 数据类型,将稠密向量以每维度 4-bit 存盘,仅为 float32 存储量的八分之一。
面向智能体的开发中,零规格的"氛围编程"并不省钱,纠正循环会把成本推给人类审查者;而完整形式化规格前期代价高,却让更多验收标准变成可执行测试。多智能体场景下,一个智能体的误解会被下一层当作事实继续放大,此时规格更接近契约,需要 schema、不变量、验证规则和契约测试。作者建议在实现前用智能体先做规格校验,找出矛盾、不可测主张与缺失的失败模式。
DeepSeek 的 Files API 已上线且免费使用。用户只需上传一次图片,之后通过 file_id 引用即可复用同一张图片,无需重复上传,从而节省请求带宽。
OpenCode 宣布 Hy3 面向所有 Go 订阅用户提供 8 倍日常用量,活动持续至 8 月 30 日,用户花 $10 即可获得价值 $480 的用量。
Qdrant 发文给出候选深度的调优方法:把 limit 设在 100 到 200 作为起点,再用自己的标注数据测试更大取值。在五个数据集上,从 limit=10 提到 500,理想上限(best possible nDCG@10)提升 0.103 至 0.282,而融合实际得分变化仅 0.002 至 0.010。
生成式 AI、LLM 与智能体工作流正被整合进工程交付流程,让技术项目经理从事务性协调转向"AI 增强的系统架构师"。文章给出的数据是:状态跟踪耗时占比从 25% 降至 8%,风险管理从 15% 降至 5%,资源分配从 10% 降至 5%,而战略规划从 10% 升至 25%,相关方对齐从 8% 升至 18%。
DeepSeek Harness 被比作"造车工厂"而非 Codex 那样的"整车厂",主打可插拔的 Agent 生产架构。节目讨论其插件机制 Cordis 能否真正做到插拔自由,并质疑多数企业尚不具备 AI 原生工作流的落地条件,认为架构先进不等于能落地。
Milvus 3.0 将 regex 过滤下推到查询路径,可与向量搜索、全文搜索和标量过滤同时执行,不再需要先取回 top-K 再用 re.match() 逐条过滤。
Tina Sharma 用 Qdrant 构建了一套 AI Agent 语义缓存,可识别表述不同但含义相同的问题并复用已有回答,避免重复调用 LLM。实测缓存命中率 57.1%、token 消耗减少 55.7%,命中时响应时间约 15ms,文中还对相似度阈值做了调优并对比了单向量与多向量检索。
Qdrant 举办 Discord Office Hours,主题为 Qdrant 1.19 的最新功能与更新,时间为中欧夏令时 17:00,随后进行开放问答和社区讨论。更多 Qdrant 1.19 细节见官方博客。
字节扣子上线桌面端,主打办公场景,新增云盘、深度截图等功能,并支持自动识别本地 Codex CLI、Claude Code 接入为 Agent。扣子云盘与本地双向同步新增、修改、重命名和删除,云端 Agent 产出的文件存入其中,垃圾箱默认保留 30 天;深度截图可把窗口截图和界面结构文本一并放入输入框。
硅谷101 这期播客讨论 Token Maxing 热潮的转折:Uber 四个月烧穿全年 AI 预算,Meta 给员工设 token 上限,嘉宾黄东旭从每天烧三四百美元转向本地开源模型底座加前沿模型的搭配,日常任务每天电费约 1 美元。
IDC 受 Elastic 委托调研 11 家大型企业后发现,使用 Elasticsearch 平台的组织三年 ROI 达 517%,平均回本周期 11 个月,每家年均收益 1340 万美元。这些企业将最低可用 AI 产品的落地时间缩短 40%,AI 产品更新提速 35%,搜索相关性提升 44%。研究覆盖金融服务、医疗、零售与政府行业,用例包括客服机器人、欺诈检测与智能体工作流。
调优 Qdrant 集合前应先确认前置状态:用 GET /collections/{collection_name} 比对 indexed_vectors_count 与 points_count,未建索引的向量走精确扫描,结果有效但延迟更高,且 hnsw_ef 在索引建立前不起作用。
Google AI Studio 现已支持导入 GitHub 仓库,并新增 GitHub 双向同步(push / pull)。新 UI 同时支持 force push、merge 等操作。官方称双向 push / pull 功能开发耗时较久,现已正式上线。
Fish Audio 的 S2.1 Pro Free 成为 OpenRouter 上排名第一的语音模型,上周请求量达 1.04M,一周增长 413%,超过 Google、x-AI、Microsoft、MiniMax 和 Deepgram 的同类模型。该模型免费提供,背后依赖自研 FP8 CUDA kernel、连续批处理等重建的推理栈,GPU 利用率超过 90%。
Milvus 3.0 新增 Search Aggregation,把保留的 ANN 候选按 doc_id、租户、产品线或内容类型分桶,返回桶计数、指标与代表性命中,用于判断 RAG 检索结果是集中还是分散。
Grok 4.6 已在 Amazon Bedrock 上线,xAI 通过官方账号公布了这一消息并附上 x.ai 新闻链接。该版本可经 Bedrock 平台调用。
得物技术基于开源项目 Multica 二次开发出 EP-Harness,把 Agent 当作团队成员管理,使其具备身份、任务、状态、执行记录和权限边界。该平台以 Backend.Execute(ctx, prompt, ExecOptions) 作为各 Agent Runtime 的统一执行入口,并接入飞书、代码管理与发布平台等内部系统。
腾讯混元 Hy3 已接入讯兔科技旗下 Alpha派,可在其 AI 投研工作台 PaiWork 中直接调用,成为该平台多模型体系新增的基座模型之一。Hy3 于今年 7 月推出,采用 MoE 架构,总参数 295B、激活参数 21B,支持 256K 上下文,发布首周 API 调用量较上一代增长 68 倍。
作者通过 AIS-Skill 把 Codex 与 TorchV AIS 知识引擎连接,让 Codex 从单次任务执行转向跨会话的长期协作。接通后 Codex 可定位知识库、关键词与语义检索、读写文档、上传下载文件并返回文档链接,形成"读取上下文→执行任务→人工确认→回写知识→持续复用"的循环。作者计划用 AIS 建立 common 公共资料库、项目长期上下文、Skill 资产库和自动日报四套体系。
GPT-5.6 Sol 在 Devin Desktop 和 Devin CLI 中限时 70% 折扣,活动持续至 10 月 3 日。在 FrontierCode 1.1 上,Sol 取得顶级成绩;借此次促销,它成为 Devin 中运行性价比最高的前沿模型之一。