用 Rust 重写 cross-encoder 推理:cross-encode-rs 对比 Python 实测
Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。
Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。
Midjourney 为其新编辑模型发布了一支使用视频,回应大量用户关于如何用该模型实现角色一致性等效果的疑问。视频通过推文发布,附有浏览器端播放链接。
LlamaIndex 发布新文章,从"能否用于决定自动化与人工审核"的角度审视文档抽取中的置信度评分,覆盖置信度阈值、精度与召回、分数覆盖率、分数粒度和人工审核量。借助 ExtractBench,其对比了不同抽取系统在置信度过滤后的表现:在 97% 精度目标下,LlamaParse Agentic Plus 过滤后在预期字段上达到 66.48% 召回。
Grafana Labs 把可靠性工程中的错误预算(error budget)用于 AI 智能体质量,通过 evaluations 让模型裁判对 groundedness、fulfillment、toxicity、latency、cost 等行为分别打分,再把分数变成带目标的 SLO,例如设定 30 天内 95% 的对话被判定为 fulfilled。
Seedance 2.5 支持上传参考视频与新角色图片来替换画面中的人物,只需替换一位表演者并保留其余人物的动作、表情与镜头信息。部分参考视频会被拒绝,可先用 Codex 模糊人脸后重新提交,且最好每次只处理两个角色。作者用它把《The Office》剧集里的演员依次换成 Dario、Jensen 和 Sam。
有人在征集 LLM 数据检查工具,重点关注 SFT traces 和 RL env tasks 等场景的查看需求。该帖获得 19 条回复、5 次转发和 98 个点赞,浏览量 16626。
Qdrant 与 DeepLearning.AI 合作推出新课程 Building AI Assistants with On-Device Memory,由 Qdrant 开发者关系负责人 Dylan Couzon 讲授。
Anton Osika 在播客录制中与 @siliconvalleymm 用 Lovable 搭建了一套业务工具:重做旧网站、上线品牌合作开放表单,并用 AI 按相关度给所有投稿排序的收件箱。新站点还做了 SEO 与 AI 搜索优化,便于 Google 和 AI 智能体发现;团队会在每次投稿时收到邮件通知,Lovable 还提交了一条假投稿做端到端测试,并完成深度安全扫描。
优设发布《超实用!24条提示词技巧教你文章去AI味》,将文章中的AI味问题拆解为24条具体修改方法,覆盖开头、用词、句式、情绪和语气,逐条说明哪些地方该删、该换、该保留。作者特别提到最后一遍真人化检查值得反复使用。
Gumroad 创始人 Sahil Lavingia 把《The Minimalist Entrepreneur》(中文版《小而美》)做成了一系列 skills,已发布在 GitHub 的 slavingia/skills 仓库。这些 skills 按几个常见场景和步骤拆分,适合想做产品和个人品牌的人参考。
tinyjs 能用不到 10MB 的体积构建 JavaScript 桌面应用,内置 txiki.js 驱动的后端,可访问包括 FFI 在内的完整系统能力,配合原生 WebView 渲染,支持打包到 macOS、Linux 和 Windows。
京东海博团队把大模型“读不懂业务全貌”重新定义为“经营好上下文”,采用 OKF 规范将知识编译从运行时前移到维护期,构建项目知识×领域知识矩阵、角色化知识层与 Skill 能力层三层结构,并用 AB 实验验证带知识库“更快更全”。以 40w 行代码的 yzt-erp-wms 仓库为例,共沉淀约 1051 篇知识文档,其中 flows/ 接口与流程 1001 篇、chains/ 业务链路 41 篇。
Kaivid Labs 团队将 40 万+文档向量从 Milvus 迁移到 Qdrant,并记录了整个过程。他们说明了迁移的处理方式、验证数据完整性,并对比了两套系统在延迟、吞吐量和内存占用上的表现。完整记录已发布在 kaivid.com 博客。
Klaviyo 在 Vercel 上搭建内部应用平台,向全员开放后头两周就有 512 名员工部署了 356 个应用,其中 196 个是带独立数据库的全栈应用。应用默认 SSO 门控且私有,员工从想法到上线不超过 3 分钟;Klaviyo 还自建 K:Forge 流水线,借助 Secure Compute 让应用直连自有数据库而不经公网。
Grok Bot 支持跨频道发送通信,可让一个 bot 给另一个 bot 发信息,对方执行完成后再发通知回来,类似 herdr 的跨 panel 通信。该技巧被评价为实际使用中相当实用。
中秋前夕,一节面向新手设计师的公开课将分享审美提升的练习思路,强调好审美是设计师的基础。公开课定于当天下午两点半开讲,需通过按钮预约。
Elastic 工程师 Toby Sutor 分享了用原子化断言核查(atomic claim checking)把 LLM 合并知识库文章变得可控的做法:合并与验证分成两遍,第二遍把每篇源文章拆成最小的可核查断言,逐条比对合并结果并标记为 present、partial 或 missing,同时记录两篇文章的冲突。
团队为超大 pull request 搭建了一套无人值守运行的测量闭环,用生产环境埋点检测空白间隙、卡顿(jank)、观察者泄漏和滚动校正。该闭环在无人干预下持续跑测,用于捕捉大型 PR 中的这些性能问题。
GitHub 发布工程实践深潜,探讨如何让百万行规模、附带数百条评论的 pull request 变得像普通代码评审一样易于处理。该内容以 github.blog 工程博客形式发布,聚焦超大型 PR 的评审体验问题。
该方案将布局拆成两套独立几何:代码高度确定、可提前获知,评论块高度则懒测量并在视口附近校正。这样评论重排就不会触发代码布局重建。
GPU 集群即使每块 GPU、网络链路和 pod 都报健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄把流量引向慢速路径。这类问题往往要等到训练运行数小时后才被发现,因此需要在 AI 工作负载落地前验证集群就绪状态。
Cursor 将 token 成本降低了 7%,且智能体质量没有下降。节省来自更精简的提示词、选择性工具加载、更好的缓存以及压缩文件读取。开发者建议构建智能体的人给智能体阅读相关发现并让其落地实现。
超人电话亭发布半年度干货合集,覆盖UI界面设计、作品集优化、AI生成UI与求职四大方向。AI部分包含三篇文章,分别讲解AI生成UI的应用逻辑、切入点和工具,以及AI Agent、Skill和Vibe Coding概念,并附Figma Make建站个人主页的实操,从提示词到上线。Figma系列课已重新录制完毕,AI生成UI系列正在陆续上传。
Recraft 发布文章说明其模型生成速度的测量方法,并给出方法说明链接 go.recraft.ai/8CF9MC/。该内容未披露具体的速度倍数、基准或模型版本信息。
Weaviate 发布新指南,梳理配置 Engram 记忆时的四个关键决策:记住哪些内容、记忆如何划分作用域与更新、用哪种检索模式读回、以及放在提示词的哪个位置。指南用真实输出和测试运行展示调整每项决策后的变化,包括过滤掉过程噪声、避免动态记忆破坏 prompt caching。全文见 weaviate.io/blog/engram-me。
Patrick Loeber 与 @timeyoutakeit 联合发布一份实用指南,拆解 Gemini API 技能并演示如何在编码智能体中使用,内容涵盖 Gemini API、Live API 与 Omni。
vivo 互联网存储团队提出知识驱动计算(KDC)理论,将知识定义为"已经验证、可复用,并能降低预测、推理、决策或行动不确定性的认知成果",而非文件、向量或 RAG 检索片段。
得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。
面向使用 Claude Code 或 Codex 的开发者,这篇指南按项目 v1.2.3 的技能集合介绍了 Matt Pocock 维护的 mattpocock-skills 的安装与使用流程。
腾讯技术工程基于智能体编排平台搭建错误码治理 Agent,把知识库、代码关系图谱、可观测平台和代码托管平台四类能力挂载到同一个 Agent,由它自主编排五步排查流程,分钟级产出根因分析与修复建议。
OpenAI 在 2026 年 7 月发布的 GPT-5.6 首次把自我改进列为评测科目,其 RSI 指数从 GPT-5.5 的 41.7% 升至 GPT-5.6 Sol 的 57.9%,相差 16.2 个百分点。文章按四条标准(持久改进、自主闭环、递归增益、稳健可控)划分 RSI 层级,指出前两层已有实现,递归自我加速尚无充分公开证据。
小米黑客松 Sensaro OS 团队在 48 小时内基于 Xiaomi MiMo 赛道搭建了一套智能家居系统原型,把用户意图转化为包含目标、作用范围、动作、安全边界和时长的“Sensaro State”,而非单条设备指令。
阿里巴巴在云栖大会发布《AI Native 研发范式实践手册》,从 AIDC 数字投手、千问用增 Agent、万有无界三个业务案例提炼出环境与验证驱动、平台能力升级、提效度量、数字员工、组织配套五个共性挑战。
淘天营销&交易技术团队公开了一套覆盖小游戏选型、生产、上线与迭代全链路的多 Agent 系统,由人定义北极星指标与行动边界并审核关键方案,AI 负责策略、开发与数据归因。
优设整理了一套AI做界面常用的10个UI风格和界面名词卡片,涵盖Editorial Design、Swiss Style、Glassmorphism、Grain & Noise,以及AI产品常见的Prompt-bar-first和Agent Status等。每种风格都附有适用场景、避坑提醒和可直接放进提示词的关键词,另附一张10种风格速查表,供写Prompt时参考。
Boris Cherny 表示自己用 Opus 5.5 对 Claude Agent SDK 做形式化验证,仅用几个简短提示词就产生 16 个 PR,修复多个 bug 和竞态条件。
作者认为用 AI 写代码时记忆缺失、改完即停、会犯错是三个主要断点,因此给 AI 套上一层 Harness 系统。做法上先建两级索引知识库并只记阴性知识、代码位置索引和隐含关联关系,再用 hook 硬拦截让 AI 先读索引;随后用访问、提交、等待、本地验证四个 skill 补上手脚,并把排查到线上验证的步骤写死成 close-loop 等 command。
Modal 分享了为 Moonshot AI 的 Kimi K2.6 模型优化推理服务以支撑编码智能体的实践,单副本每用户性能提升 2.8 倍、跨用户提升 5.6 倍。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
LangChain 发文介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准后的评估器和自动化发布门禁。