Elastic 如何用原子化断言核查对抗 LLM 幻觉
Elastic 工程师 Toby Sutor 分享了用原子化断言核查(atomic claim checking)把 LLM 合并知识库文章变得可控的做法:合并与验证分成两遍,第二遍把每篇源文章拆成最小的可核查断言,逐条比对合并结果并标记为 present、partial 或 missing,同时记录两篇文章的冲突。
Elastic 工程师 Toby Sutor 分享了用原子化断言核查(atomic claim checking)把 LLM 合并知识库文章变得可控的做法:合并与验证分成两遍,第二遍把每篇源文章拆成最小的可核查断言,逐条比对合并结果并标记为 present、partial 或 missing,同时记录两篇文章的冲突。
GitHub 与 Muse 推出新的账号连接方式,用户无需切换标签页即可审查 PR、跟进 issue 和通知,还能直接留言评论。该动态获 2730 个点赞、160 次转发,浏览量超 26.5 万。
Ollama 现在允许用户为付费云端模型添加用量额度,无需订阅即可按量付费,相关设置入口在 ollama.com/settings。此举让云端模型的使用门槛从包月订阅变为按实际用量充值。
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 的详细评测,市场观察范围从 ClusterMAX 2.0 的 209 家扩大到 323 家,并访谈了 200 多名 neocloud 终端用户。
Cursor 推出 Rollouts,它会先编写一份监控计划,再在部署过程中持续观察变更。部署经过验证,因此回归问题能在用户接触到之前被捕获。
Cursor 的 Rollouts 与 Security Reviewer 现已面向 Teams 和 Enterprise 套餐开放使用。官方同时为 Rollouts 提供未来 10 天的使用额度,方便团队在真实改动上试用,详情见 cursor.com/blog/rollouts。
团队为超大 pull request 搭建了一套无人值守运行的测量闭环,用生产环境埋点检测空白间隙、卡顿(jank)、观察者泄漏和滚动校正。该闭环在无人干预下持续跑测,用于捕捉大型 PR 中的这些性能问题。
该方案将布局拆成两套独立几何:代码高度确定、可提前获知,评论块高度则懒测量并在视口附近校正。这样评论重排就不会触发代码布局重建。
GPU 集群即使每块 GPU、网络链路和 pod 都报健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄把流量引向慢速路径。这类问题往往要等到训练运行数小时后才被发现,因此需要在 AI 工作负载落地前验证集群就绪状态。
NVIDIA 推出 NodeWright,用于管理 Kubernetes 节点本身——内核设置、系统软件包、存储布局、安全代理及 GPU 工作负载依赖的主机级调优。这些工作此前多靠 Ansible playbook、自定义脚本和手动 runbook 完成,但新集群在不同区域上线或内核升级破坏 RDMA 时便会失效。
Cognition 宣布 Devin 现在可以在 Microsoft Teams 内使用,用户无需离开聊天即可私信 Devin、发起群聊,或从 Teams 频道创建 Automations。Devin 还能 @ 提及同事提问、发送文件附件,并在完成任务后将自己静音。
Cohere 发布指南,介绍如何在几分钟内完成首个 Vault 的设置,并附上 cohere.com/solutions 的页面链接。原文未披露 Vault 的具体功能细节与适用版本。
Cohere 的 Model Vault 现已在加拿大上线,当地用户可借助自动伸缩工作负载、单租户部署和更低的 TCO 完全掌控自己的 AI。该服务仅提供 Cohere 模型,并主打完全私有。
Fireworks 发布面向强化学习的新压缩器 ARCv3,可将 BF16 权重更新的体积缩减近 50%。该压缩器让跨区域训练更易落地,并保持 rollout 处于最新状态。对于使用自有 trainer 搭配 Fireworks rollouts 的团队,相关细节已在其博客公布。
Genspark 推出 GenCode,可读取你现有的配置,一键把 instructions、rules 和 memory 迁移过来,并提供多种模型可选,无需重新教一遍。官方称"配置税"就此消失。
Vercel 发布 Sandbox 的持久化存储 Drives,目前已进入公开测试,所有套餐可用,单个 Sandbox 最多挂载四个 Drives,每个容量上限 16 TiB。Drives 可将文件存储从智能体运行环境中解耦,直接读写文件而无需启动完整智能体计算机,用于存放工作区、数据、模型与依赖,并支持跨并行 Sandbox 读取快照。
Bolt Forge 上线开放模型一周后,GLM 5.3 Flash 拿下 63% 的提示词份额,DeepSeek V4.1 Flash 占 17%,两款 Flash 模型合计吃下 80% 的提示词。尽管选择器中同时提供更大的模型,开发者仍持续选择速度更快的版本。bolt.new/lite 定价为 $9/月。
Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更精简的提示词、选择性工具加载、更好的缓存以及压缩文件读取。开发者建议构建智能体的人给智能体阅读相关发现并让其落地实现。
LangChain 的 Managed Deep Agents 现可添加定时调度,智能体在后台自主运行。用户只需在 schedules/ 目录添加含 cron 表达式和提示词的文件,然后部署即可。相关文档见 docs.langchain.com。
微软研究院新发现显示,将 AI 推理从机器人本体转移到外部可提升任务成功率、提高效率,并支持更复杂的物理 AI 工作负载。该结论针对机器人智能化提升而硬件难以同步跟上的问题提出。
微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。
Google Private AI Compute 团队公布新的技术方案,为平台加入持久化服务端记忆,让 AI 助手在跨设备场景下保持连续性,同时沿用端侧隐私标准。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。
Cursor 宣布其 token 成本降低 7%,智能体质量没有下降。节省来自更紧凑的提示词、选择性工具加载、更好的缓存以及压缩文件读取。
Cursor 公布了对自家 agent harness 的改进方案,说明如何提升其 AI 智能体的运行表现。原文未披露具体模型版本、参数规模或 benchmark 数据,仅指向官方博客的详细说明。
Gemini API 现已支持逐句微调音频生成,可调整节奏、情绪以及笑声、停顿等提示。所有生成的音频都带 SynthID 水印,可被可靠识别为 AI 生成内容。开发者可通过 Google AI Studio 使用 Gemini API 开始构建。
NVIDIA 在 Hugging Face 上线了一个可直接试用的实时演示,并配有一篇介绍其工作原理与上手方式的博客。演示位于 huggingface.co/spaces/nvidia/,博客发布在 huggingface.co/blog/nvidia/。
Douchat 可自动识别电脑上的本地 Agent,把 codex、claude code、grok build、hermes 等建为联系人并共享给他人使用。其核心功能是多人 + 多 Agent 对话,可为每个联系人指定不同模型,并用 jev 模型做群聊调度分配任务,云端模型按量充值 credits,使用自有模型和本地 Agent 完全免费。
中国移动在2026中国国际信息通信展览会(PT展)上正式展示6G光场全息通信原型系统,无需佩戴任何辅助设备即可重现远端光场。该系统通过采集6个视角实现超百视角光场还原,单视角分辨率接近2K,并将通信时延控制在200ms左右。未来将面向AI+AR眼镜、3D手机平板等终端开展互通研究,推进沉浸式直播、通话及远程医疗等场景落地。
作者在 2026 云栖大会期间实测阿里开源的 Qwen-Image-2.1 图像模型,该模型视觉生成部分为 7B、32 层 Single-Stream DiT,用 Comfy 桌面端在 3090 上即可运行。
Weaviate 发布新指南,梳理配置 Engram 记忆时的四个关键决策:记住哪些内容、记忆如何划分作用域与更新、用哪种检索模式读回、以及放在提示词的哪个位置。指南用真实输出和测试运行展示调整每项决策后的变化,包括过滤掉过程噪声、避免动态记忆破坏 prompt caching。全文见 weaviate.io/blog/engram-me。
得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。
OpenViking 上线 Compile 功能,可基于自定义或预置的 LLM-Wiki skill,把本地文件、GitHub 仓库、飞书文档等导入的原始资料编译成相互链接、带出处的团队 Wiki。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
用Opencode(基座为百度千帆Token Plan个人版中的DeepSeek-V4-Flash)在llama.cpp复现TypeSafe AI的Jev推理模式,将自回归LLM改造为单次前向传播的并行决策引擎,约400行C++,共消耗313.9积分、折合1.395元。
云端 Agent 的爆发正把算力瓶颈从 GPU 外溢到 CPU:Chatbot 时代一次 GPU 推理即可返回答案,而 Agent 时代要循环几十甚至上百次调用工具、执行代码、管理状态,这些环节都依赖 CPU。
腾讯技术工程基于智能体编排平台搭建错误码治理 Agent,把知识库、代码关系图谱、可观测平台和代码托管平台四类能力挂载到同一个 Agent,由它自主编排五步排查流程,分钟级产出根因分析与修复建议。
小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。
阿里巴巴在云栖大会发布《AI Native 研发范式实践手册》,从 AIDC 数字投手、千问用增 Agent、万有无界三个业务案例提炼出环境与验证驱动、平台能力升级、提效度量、数字员工、组织配套五个共性挑战。
山东烟台油气设备公司杰瑞股份在不到一年内拿下超31亿美元的数据中心发电订单,其中北美一个云服务客户贡献17.2亿美元,为缺电的AI数据中心提供燃气轮机发电机组。这项能力源于其2011年进入北美市场后积累的移动式燃气发电技术储备。