跳到正文

#部署/工程

今日 0 条
8月28日周五
  1. ollama(@ollama)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama v0.33 发布:Claude Desktop 可一键接入 Ollama 云与本地模型

    Ollama v0.33 发布,用户现在可以在 Claude Desktop 中一键将 Ollama 配置为第三方网关提供方,云端与本地模型均可直接使用。该版本通过单个开关完成设置,无需额外配置。

  2. QdrantAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 内存分层怎么选:从全缓存到量化向量 Pin 的配置指南

    Qdrant 支持把 dense vectors、HNSW 图、量化向量和 payload 分别放到 Pinned、Cached、Cold 三种内存层级,Dense vectors 和 payload 无法 pinned。

  3. 月之暗面 KimiAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    法律行业为什么都在用 Kimi K3?

    2.8 万亿参数的 Kimi K3 在 Harvey LAB 法律基准测试中从 K2.6 的 0 分提升到 26.7%,该测试包含 1200 多个真实律所任务。Harvey 基于 Kimi K3 发布首个法律行业专属模型 Tenet,多项法律基准测试超过当前最先进闭源模型。国内多家红圈律所已为员工配备 Kimi 企业版,可将审查建议以 Word 批注和修订形式呈现,并支持溯源核验。

  4. HelloGitHubAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 125 期:airllm 4GB 显存跑 70B 大模型、DeepSeek 开源智能体框架

    HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。

  5. Cursor(@cursor_ai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    现在可以用 Cursor 创建 Web 应用,代码存到 Origin,再部署到 Vercel

    Cursor 支持创建新的 Web 应用,代码可存储到 Origin,并部署到 Vercel。这条来自 Cursor 官方账号的消息显示三者已打通为一条从编写、托管到上线的流程,但未披露具体版本号或开放范围。

8月27日周四
  1. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 StructArray 将多向量搜索引入单个实体内

    Milvus 3.0 推出 StructArray,可在单个实体内完成多向量搜索,视频、文档、商品各自的片段嵌入无需拆成独立数据库行,元素与父实体保持关联并携带自身向量和标量元数据。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muennighoff 等提出 Prefix Sliding:用前缀滑窗提升长推理效率

    Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。

  3. Weaviate • vector database(@weaviate_io)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 1.39 发布:Boost API 与 MMR 多样性选择转 GA,新增 4-bit RQ 预览

    Weaviate 1.39 发布,Boost API 和 MMR 多样性选择两个搜索功能转为 GA,前者可在查询时上调或下调结果排序且不丢弃任何结果,后者用于混合搜索和向量搜索中避免首页结果重复。

  4. Martin Fowler(@martinfowler)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler:要让 AI 真正发挥作用,组织需要像样的数据

    Pramod Sadalage 与 Premanand Chandrasekaran 在 Martin Fowler 网站发文指出,AI 要产生效果,组织必须先把数据基础打好。文章从质量根基、语义上下文、清晰的访问控制和可观测性四个方面展开说明。

  5. 向阳乔木推荐看AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱认领匿名模型 Ox-Alpha 为 GLM-5.3-Flash,开源并以 Opus 4.8 的 1/40 价格提供

    智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。

    为什么值得看

    文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。

  6. Qwen(@Alibaba_Qwen)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 上线 QwenCloud,输入 $0.15/1M tokens

    Qwen3.8-Flash 的 API 已在 QwenCloud 上线,原生上下文 262K,可扩展至 1M。定价为输入 $0.15/1M tokens、输出 $0.47/1M tokens、缓存命中 $0.016/1M tokens,官方称该价格面向规模化使用。

  7. LangChain BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 8 月简报:Managed Deep Agents 与 LLM Gateway 公测,Deep Agents v0.7 发布

    LangChain 的 Managed Deep Agents 和 LLM Gateway 进入公开测试:前者可用一条命令把 Deep Agent 部署到托管 LangSmith 运行时,内置持久化执行、沙箱与追踪;后者为智能体提供成本控制、速率限制、模型回退和敏感数据处理。

  8. Dify(@dify_ai)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify 将参展沙特 LEAP2026,展示企业级 AI 智能体

    Dify 宣布将于 8 月 31 日至 9 月 3 日在沙特阿拉伯利雅得参展 LEAP2026,现场提供 Dify 实机演示,并与团队交流企业级 AI 智能体相关话题。展位位于 Hall H3 / Stand H3.D138。

  9. AI炼金术AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 原生组织转型 02:用 AI 推进流程、闭环迭代

    AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。

  10. NVIDIA Technical BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施

    NVIDIA 通过 NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施,面向超大规模厂商和 AI 原生公司自研的 XPU。随着 AI 工厂需支撑更大模型与更复杂推理负载,这些加速器规模化部署依赖高带宽内存(HBM)持续供给算力,并需要足够的封装与芯片面积承载更多计算。

  11. AWS Architecture BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gallup 基于 Amazon Bedrock 打造 Gallup AI,为数万组织提供实时教练服务

    Gallup 基于 Amazon Bedrock 构建生成式 AI 助手 Gallup AI,将其 90 余年职场研究转化为实时个性化教练,直接嵌入 Gallup Access 应用。

  12. LangChain BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 State of AI 2024 报告:AI 智能体崛起,开源模型使用量激增

    LangChain 发布 State of AI 2024 报告,基于 LangSmith 每月近 3 万新增用户的使用数据。OpenAI 仍是最常用的 LLM 提供商,使用量是第二名 Ollama 的 6 倍以上,Ollama、Groq 首次进入前五,开源模型提供商合计占前 20 名的 20%。

  13. LangChain BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Factory 如何用 LangSmith 自动化反馈闭环,迭代速度提升 2 倍

    Factory 借助自托管 LangSmith 为其 Droids 构建可观测性与反馈闭环,将提示词迭代速度提升 2 倍。其反馈流程由 Droid 发布评论收集正负反馈,经 LangSmith Feedback API 导出为数据集并用自定义 LangChain 工具优化提示词。

  14. LangChain BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith 重新设计产品主页,并推出 Resource Tags 优化资源组织

    LangSmith 发布重新设计的产品主页,将功能划分为可观测性、评估和提示词工程三大板块,并新增覆盖这三部分的入门引导。可观测性包含 Tracing Projects 与 Dashboards,评估包含 Datasets、Experiments 和 Annotation Queues,提示词工程包含 Prompts 与 Playground。

  15. LangChain BlogAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布 LangGraph v0.1 稳定版与 LangGraph Cloud

    LangChain 发布 LangGraph v0.1 稳定版,并推出处于封闭测试的 LangGraph Cloud,用于以可扩展、容错的方式部署 LangGraph 智能体。

  16. LangChain BlogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith 与 LangChain OSS 如何满足 EU AI Act 合规要求

    LangChain 发文说明 LangSmith 与 LangChain OSS 如何对应 EU AI Act 的高风险系统要求,该法合规截止日为 2026 年 8 月 2 日,违规最高罚 1500 万欧元或全球年营业额的 3%。

  17. LangChain BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Podium 如何用 LangSmith 优化智能体行为,将工程介入减少 90%

    Podium 借助 LangSmith 优化其 AI Employee 智能体,将工程介入减少 90%。团队用 LangSmith 追踪每次交互中 20-30 次 LLM 调用,构建数据集并微调模型,使判断对话自然结束的 F1 分数从 91.7% 提升至 98.6%,超过 98% 的质量阈值。

  18. LangChain BlogAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为何重构自家 Chatbot,以及其中的经验

    LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。

  19. LangChain BlogAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 公测 LangSmith LLM Gateway,为生产 Agent 提供运行时控制

    LangSmith LLM Gateway 进入公开 beta,作为位于 Agent 与模型之间的治理层,集中施加运行时控制。它支持组织、工作区、API key 和用户四级的限时支出上限与速率限制,命中上限时向 Agent 返回 402 响应;还可按自定义请求头识别终端客户,在多租户场景下用单个 API key 分别控制各客户的支出与速率。

  20. LangChain BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit Agent 如何借 LangSmith 攻克复杂工作流可观测性难题

    LangChain 与 Replit 团队合作扩展 LangSmith 能力,以支撑 Replit Agent 动辄数百步的复杂 trace。新增能力包括:提升大 trace 的摄取性能与前端渲染、支持在单条 trace 内部按条件搜索过滤、以及将同一多轮对话的分散 trace 聚合为 thread view。Replit 借此加快调试速度,并定位用户卡点与需要人工介入的环节。

  21. LangChain BlogAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 2026 年 1 月简报:LangSmith Agent Builder 正式 GA

    LangSmith Agent Builder 现已正式 GA,用户可用自然语言描述需求,由系统自动生成提示词、选择工具、拆分子智能体并配置技能。LangSmith 还上线了 LLM 实验并排对比功能,可按输入、输出、状态或元数据筛选,Insights Agent 则面向自托管客户开放,自动分析 trace 以识别使用模式与失败模式。

  22. LangChain BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangGraph Platform 正式 GA,面向长时间运行的有状态 Agent 提供部署与管理

    LangChain 宣布 LangGraph Platform 正式 GA,定位为部署和扩展长时间运行、有状态 Agent 的基础设施与管理层;自去年 6 月 beta 以来,已有近 400 家公司用它把 Agent 部署到生产环境。

    为什么值得看

    原文列出 1-click 部署、30 个 API 端点和持久化层等能力,并给出三种部署选项的适用边界。

  23. LangChain BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 与 NVIDIA 发布 NemoClaw Deep Agents 蓝图

    LangChain 与 NVIDIA 联合发布 NemoClaw for LangChain Deep Agents 蓝图,将 LangChain Deep Agents Code、NVIDIA Nemotron 3 Ultra 和 NVIDIA OpenShell 运行时组合为开源、可治理的企业级智能体栈,今日可用。

  24. LangChain BlogAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 联合 NVIDIA 发布企业级 Agentic AI 平台

    LangChain 宣布与 NVIDIA 合作推出企业级 Agentic AI 开发平台,整合 LangSmith 与 Deep Agents、LangGraph、LangChain 开源框架及 NVIDIA Agent Toolkit,并加入 NVIDIA Nemotron Coalition。

  25. LangChain BlogAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Agent 延迟优化指南:如何加速你的 AI 智能体?

    LangChain 提出加速 AI 智能体的五类做法:先用 LangSmith 的 waterfall 视图定位延迟瓶颈,再通过流式返回中间步骤或后台运行降低用户感知延迟。减少 LLM 调用可用 LangGraph 替代 ReAct、多智能体等架构,实测能显著减少调用次数、更快更省;提速 LLM 调用可换 Gemini Flash 等更小更快的模型,或缩短输入上下文。

  26. Firecrawl(@firecrawl_dev)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 推出创业公司计划:每月额度翻倍一年,最高 3 万美元

    Firecrawl 面向创业公司推出新优惠:每月额度翻倍、持续一整年,最高可获 3 万美元额度,并提供与团队共享的 Slack 频道和周边礼品。

  27. Qwen(@Alibaba_Qwen)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 经 Unsloth GGUF 支持 75GB 内存本地运行

    Unsloth AI 宣布 Qwen3.8-Flash 可本地运行,这个 125B MoE 模型通过 Unsloth GGUF 只需 75GB RAM,并称其性能超过 Claude-Opus-4.6(Max)。Qwen3.8-Flash-Next 面向 CPU RAM 与统一内存配置,可提供接近 VRAM 的速度,官方同时给出了使用指南和 GGUF 权重链接。

  28. xAI(@xai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 LiveKit 中使用 Grok Voice 模型构建支持 ZDR 的语音智能体

    LiveKit 与 xAI 合作,让开发者可在 LiveKit 中调用 Grok Voice 模型构建语音智能体,全链路支持 ZDR。示例患者接诊智能体采用 Grok STT → Grok 4.3 → Grok TTS 级联,通过 LiveKit Inference 在单个 AgentSession 中传入三个模型字符串,无需单独 API key 和计费。

  29. Visual Studio BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Visual Studio Debugger Agent 新增测试驱动调查工作流

    Visual Studio Debugger Agent 新增 Test-Driven Investigation 工作流,可自动创建或识别聚焦测试,并通过该测试调试、定位根因,最后重跑测试验证修复。该流程适用于异常、堆栈跟踪或“有时失败”等难以手动复现的 bug,需要已有的测试基础设施支持。用户仍可审阅或修改测试、引导调查并批准修复。

8月26日周三
  1. Milvus(@milvusio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cốc Cốc 用 Milvus 支撑越南全国规模 AI 搜索,生产环境 7 亿向量

    越南本土搜索引擎与浏览器 Cốc Cốc 采用 Milvus 作为自托管检索底座,支撑其搜索、广告、推荐、定向与内部 RAG 共 5 个生产系统。其生产环境已部署 7 亿向量,规划容量约 15 亿,峰值流量下语义搜索 P90 延迟为 19.8 ms。此前 FAISS 与 USearch 无法跨机分布数亿向量或支持持续生产更新。

  2. LangChain BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Candidly 如何在 LangSmith 中构建状态感知的 Agent Harness

    Candidly 在 LangSmith 中为 AI 财务助手 Cait 构建了状态感知的 agent harness,用混合标注流水线(确定性规则加 LLM-as-judge)标记生产对话结果,与人工标注数据集达到 92.3% 一致率。

  3. LangChain BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 谈 Wiki Memory:用文件为 AI 智能体构建记忆层

    LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。

  4. LangChain BlogAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Perplexity 和 LangGraph 构建可审计的 VC 研究智能体

    基于 Perplexity Agent API 与 LangGraph 构建的投资备忘录智能体,约 90 秒、约 0.40 美元 API 成本即可生成含七大板块的初稿,每条引用均可回溯到原始信源。

  5. LangChain BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 与 Pay-i 联合解读:金融服务如何证明 Agentic AI 的 ROI

    LangChain 与 Pay-i 联合发文,讲解金融机构如何用量化 KPI 证明智能体 AI 的投资回报,并结合 RFP 处理与反洗钱(AML)合规监控两个真实场景拆解方法。

  6. LangChain BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何构建 LangSmith Engine:一个改进智能体的智能体

    LangChain 详述上周发布的 LangSmith Engine 的技术实现,它基于 Deep Agents 构建,读取 agent traces 找出反复出现的失败并生成 issue、评估器和数据集样例。