Ollama v0.33 发布:Claude Desktop 可一键接入 Ollama 云与本地模型
Ollama v0.33 发布,用户现在可以在 Claude Desktop 中一键将 Ollama 配置为第三方网关提供方,云端与本地模型均可直接使用。该版本通过单个开关完成设置,无需额外配置。
Ollama v0.33 发布,用户现在可以在 Claude Desktop 中一键将 Ollama 配置为第三方网关提供方,云端与本地模型均可直接使用。该版本通过单个开关完成设置,无需额外配置。
Qdrant 支持把 dense vectors、HNSW 图、量化向量和 payload 分别放到 Pinned、Cached、Cold 三种内存层级,Dense vectors 和 payload 无法 pinned。
2.8 万亿参数的 Kimi K3 在 Harvey LAB 法律基准测试中从 K2.6 的 0 分提升到 26.7%,该测试包含 1200 多个真实律所任务。Harvey 基于 Kimi K3 发布首个法律行业专属模型 Tenet,多项法律基准测试超过当前最先进闭源模型。国内多家红圈律所已为员工配备 Kimi 企业版,可将审查建议以 Word 批注和修订形式呈现,并支持溯源核验。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
Cursor 支持创建新的 Web 应用,代码可存储到 Origin,并部署到 Vercel。这条来自 Cursor 官方账号的消息显示三者已打通为一条从编写、托管到上线的流程,但未披露具体版本号或开放范围。
Milvus 3.0 推出 StructArray,可在单个实体内完成多向量搜索,视频、文档、商品各自的片段嵌入无需拆成独立数据库行,元素与父实体保持关联并携带自身向量和标量元数据。
Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。
Weaviate 1.39 发布,Boost API 和 MMR 多样性选择两个搜索功能转为 GA,前者可在查询时上调或下调结果排序且不丢弃任何结果,后者用于混合搜索和向量搜索中避免首页结果重复。
Pramod Sadalage 与 Premanand Chandrasekaran 在 Martin Fowler 网站发文指出,AI 要产生效果,组织必须先把数据基础打好。文章从质量根基、语义上下文、清晰的访问控制和可观测性四个方面展开说明。
智谱认领了此前在 X 上刷屏的匿名模型 Ox-Alpha(中文社区称“牛来”),正式名称为 GLM-5.3-Flash,320B 总参数、仅激活 18B,是 GLM-5 系列首个原生多模态模型。
文章把匿名模型的身份揭晓、参数与价格和多个实测案例放在一起,读者可据此判断它在多模态任务上的成本与可用性。
Qwen3.8-Flash 的 API 已在 QwenCloud 上线,原生上下文 262K,可扩展至 1M。定价为输入 $0.15/1M tokens、输出 $0.47/1M tokens、缓存命中 $0.016/1M tokens,官方称该价格面向规模化使用。
LangChain 的 Managed Deep Agents 和 LLM Gateway 进入公开测试:前者可用一条命令把 Deep Agent 部署到托管 LangSmith 运行时,内置持久化执行、沙箱与追踪;后者为智能体提供成本控制、速率限制、模型回退和敏感数据处理。
Dify 宣布将于 8 月 31 日至 9 月 3 日在沙特阿拉伯利雅得参展 LEAP2026,现场提供 Dify 实机演示,并与团队交流企业级 AI 智能体相关话题。展位位于 Hall H3 / Stand H3.D138。
AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。
NVIDIA 通过 NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施,面向超大规模厂商和 AI 原生公司自研的 XPU。随着 AI 工厂需支撑更大模型与更复杂推理负载,这些加速器规模化部署依赖高带宽内存(HBM)持续供给算力,并需要足够的封装与芯片面积承载更多计算。
Gallup 基于 Amazon Bedrock 构建生成式 AI 助手 Gallup AI,将其 90 余年职场研究转化为实时个性化教练,直接嵌入 Gallup Access 应用。
LangChain 发布 State of AI 2024 报告,基于 LangSmith 每月近 3 万新增用户的使用数据。OpenAI 仍是最常用的 LLM 提供商,使用量是第二名 Ollama 的 6 倍以上,Ollama、Groq 首次进入前五,开源模型提供商合计占前 20 名的 20%。
Factory 借助自托管 LangSmith 为其 Droids 构建可观测性与反馈闭环,将提示词迭代速度提升 2 倍。其反馈流程由 Droid 发布评论收集正负反馈,经 LangSmith Feedback API 导出为数据集并用自定义 LangChain 工具优化提示词。
LangSmith 发布重新设计的产品主页,将功能划分为可观测性、评估和提示词工程三大板块,并新增覆盖这三部分的入门引导。可观测性包含 Tracing Projects 与 Dashboards,评估包含 Datasets、Experiments 和 Annotation Queues,提示词工程包含 Prompts 与 Playground。
LangChain 发布 LangGraph v0.1 稳定版,并推出处于封闭测试的 LangGraph Cloud,用于以可扩展、容错的方式部署 LangGraph 智能体。
LangChain 发文说明 LangSmith 与 LangChain OSS 如何对应 EU AI Act 的高风险系统要求,该法合规截止日为 2026 年 8 月 2 日,违规最高罚 1500 万欧元或全球年营业额的 3%。
Podium 借助 LangSmith 优化其 AI Employee 智能体,将工程介入减少 90%。团队用 LangSmith 追踪每次交互中 20-30 次 LLM 调用,构建数据集并微调模型,使判断对话自然结束的 F1 分数从 91.7% 提升至 98.6%,超过 98% 的质量阈值。
LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。
LangSmith LLM Gateway 进入公开 beta,作为位于 Agent 与模型之间的治理层,集中施加运行时控制。它支持组织、工作区、API key 和用户四级的限时支出上限与速率限制,命中上限时向 Agent 返回 402 响应;还可按自定义请求头识别终端客户,在多租户场景下用单个 API key 分别控制各客户的支出与速率。
LangChain 与 Replit 团队合作扩展 LangSmith 能力,以支撑 Replit Agent 动辄数百步的复杂 trace。新增能力包括:提升大 trace 的摄取性能与前端渲染、支持在单条 trace 内部按条件搜索过滤、以及将同一多轮对话的分散 trace 聚合为 thread view。Replit 借此加快调试速度,并定位用户卡点与需要人工介入的环节。
LangSmith Agent Builder 现已正式 GA,用户可用自然语言描述需求,由系统自动生成提示词、选择工具、拆分子智能体并配置技能。LangSmith 还上线了 LLM 实验并排对比功能,可按输入、输出、状态或元数据筛选,Insights Agent 则面向自托管客户开放,自动分析 trace 以识别使用模式与失败模式。
LangChain 宣布 LangGraph Platform 正式 GA,定位为部署和扩展长时间运行、有状态 Agent 的基础设施与管理层;自去年 6 月 beta 以来,已有近 400 家公司用它把 Agent 部署到生产环境。
原文列出 1-click 部署、30 个 API 端点和持久化层等能力,并给出三种部署选项的适用边界。
LangChain 与 NVIDIA 联合发布 NemoClaw for LangChain Deep Agents 蓝图,将 LangChain Deep Agents Code、NVIDIA Nemotron 3 Ultra 和 NVIDIA OpenShell 运行时组合为开源、可治理的企业级智能体栈,今日可用。
LangChain 宣布与 NVIDIA 合作推出企业级 Agentic AI 开发平台,整合 LangSmith 与 Deep Agents、LangGraph、LangChain 开源框架及 NVIDIA Agent Toolkit,并加入 NVIDIA Nemotron Coalition。
LangChain 提出加速 AI 智能体的五类做法:先用 LangSmith 的 waterfall 视图定位延迟瓶颈,再通过流式返回中间步骤或后台运行降低用户感知延迟。减少 LLM 调用可用 LangGraph 替代 ReAct、多智能体等架构,实测能显著减少调用次数、更快更省;提速 LLM 调用可换 Gemini Flash 等更小更快的模型,或缩短输入上下文。
Firecrawl 面向创业公司推出新优惠:每月额度翻倍、持续一整年,最高可获 3 万美元额度,并提供与团队共享的 Slack 频道和周边礼品。
Unsloth AI 宣布 Qwen3.8-Flash 可本地运行,这个 125B MoE 模型通过 Unsloth GGUF 只需 75GB RAM,并称其性能超过 Claude-Opus-4.6(Max)。Qwen3.8-Flash-Next 面向 CPU RAM 与统一内存配置,可提供接近 VRAM 的速度,官方同时给出了使用指南和 GGUF 权重链接。
LiveKit 与 xAI 合作,让开发者可在 LiveKit 中调用 Grok Voice 模型构建语音智能体,全链路支持 ZDR。示例患者接诊智能体采用 Grok STT → Grok 4.3 → Grok TTS 级联,通过 LiveKit Inference 在单个 AgentSession 中传入三个模型字符串,无需单独 API key 和计费。
Visual Studio Debugger Agent 新增 Test-Driven Investigation 工作流,可自动创建或识别聚焦测试,并通过该测试调试、定位根因,最后重跑测试验证修复。该流程适用于异常、堆栈跟踪或“有时失败”等难以手动复现的 bug,需要已有的测试基础设施支持。用户仍可审阅或修改测试、引导调查并批准修复。
越南本土搜索引擎与浏览器 Cốc Cốc 采用 Milvus 作为自托管检索底座,支撑其搜索、广告、推荐、定向与内部 RAG 共 5 个生产系统。其生产环境已部署 7 亿向量,规划容量约 15 亿,峰值流量下语义搜索 P90 延迟为 19.8 ms。此前 FAISS 与 USearch 无法跨机分布数亿向量或支持持续生产更新。
Candidly 在 LangSmith 中为 AI 财务助手 Cait 构建了状态感知的 agent harness,用混合标注流水线(确定性规则加 LLM-as-judge)标记生产对话结果,与人工标注数据集达到 92.3% 一致率。
LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。
基于 Perplexity Agent API 与 LangGraph 构建的投资备忘录智能体,约 90 秒、约 0.40 美元 API 成本即可生成含七大板块的初稿,每条引用均可回溯到原始信源。
LangChain 与 Pay-i 联合发文,讲解金融机构如何用量化 KPI 证明智能体 AI 的投资回报,并结合 RFP 处理与反洗钱(AML)合规监控两个真实场景拆解方法。
LangChain 详述上周发布的 LangSmith Engine 的技术实现,它基于 Deep Agents 构建,读取 agent traces 找出反复出现的失败并生成 issue、评估器和数据集样例。