有人用 Claude 搭工作流替代每月 38 美元的 QuickBooks 订阅
一位用户用 Claude 构建的工作流替代了每月 38 美元的 QuickBooks 订阅,该工作流可解析银行对账单、为每笔支出分类,并接入一个消费看板。该案例由 Michael Saif 分享。
一位用户用 Claude 构建的工作流替代了每月 38 美元的 QuickBooks 订阅,该工作流可解析银行对账单、为每笔支出分类,并接入一个消费看板。该案例由 Michael Saif 分享。
Rowan Cheung 介绍了一套约 1 美分/场的会议助手方案,来源署名 Steve Farmer。做法是用手机录制会议,把音频发送到 Telegram,再由本地托管的 AI 智能体完成转写、说话人识别、提取行动项并归档任务。
Andrej Karpathy 将 Simon Willison "骑自行车鹈鹕"测试的源码上传到 karpathy.ai/lotr-movie/,该测试如今可在浏览器中直接运行并支持 fork。他还调侃说 GTA Hobbiton 会在 GTA VI 之前推出。
奇舞周刊第593期聚焦 AI 编程时代瓶颈从"生产代码"转向"理解代码",作者提出技术债、认知债、意图债的"三元债模型",认为 AI 在降低技术债的同时正加速累积后两者,开发者不能外包"理解"。
作者 Daniela Baron 分享了一套降低 Claude Code token 消耗的工具与习惯组合,用于解决企业版月度额度月中耗尽的问题。方案包括用 rtk 压缩 CLI 命令输出、用 Caveman 精简模型回复、用 CodeGraph 以图数据库回答代码结构问题,以及默认使用 Sonnet 并把 advisor 设为 Opus。
Weaviate 启动 Building Foundry 系列,第一集聚焦创意工作流中的检索难题:项目变大后文件名和文件夹结构越来越不可靠,设计师记得氛围却记不住文件名。文章提出用语义搜索按含义而非精确词匹配素材,并让元数据、嵌入向量与向量搜索协同工作,最终将用 Weaviate 做成创意搜索原型。
Giles Edwards-Alexander 做了一项实验,验证把大函数拆解为小函数是否能降低 token 成本,结果表明如今或许已经可以衡量重构带来的经济收益。该文发表于 martinfowler.com。
Qdrant 发布 FastEmbed,一个专注文本嵌入向量生成的 Python 库,默认加载 BAAI/bge-small-en-v1.5 模型,输出 384 维向量,最大上下文 512 tokens。
LangChain 与 Qdrant 集成实现检索增强生成问答流水线,需两个模型配合:FastEmbed 默认使用 BAAI/bge-small-en-v1.5 将事实向量化存入 Qdrant,再检索相关文档拼入提示词交给 Claude 或 GPT 生成答案。教程用 Natural Questions 数据集演示,仅需几行代码,Qdrant Cloud 提供 URL 和 API key 接入。
FastEmbed 是 Qdrant 维护的 Python 库,可在 CPU 上生成嵌入向量,无需 GPU、PyTorch 或 API key,默认模型为 BAAI/bge-small-en-v1.5,首次使用时下载量化 ONNX 文件,单条嵌入为 384 维。
LangChain 与 Qdrant 集成实现检索增强生成问答:先用 FastEmbed 默认的 BAAI/bge-small-en-v1.5 量化模型(可在 CPU 运行)将事实向量化存入 Qdrant,检索最相关文档后拼入提示词,交给 Claude 或 GPT 生成答案。示例使用 Natural Questions 数据集(含 10 万+ 行),演示时取前 100 对问答。
作者以 Codex Subagents 为例,讲如何用大白话把任务拆给多个子智能体:只需说清叫谁、干啥、并行还是排队、结果给谁,文中给出了代码排查和 reviewer、security-auditor、qa-expert 并行审核两类可照抄范例。
Hugging Face 建议开发者在网站或应用中添加「Sign-In with Hugging Face」OAuth 按钮,让社区成员可便捷地分享邮箱、创建模型或数据集仓库、在 Buckets 中存储数据,甚至启动 GPU 支持的 Jobs。相关接入文档见 huggingface.co/docs/hub/en/oauth。
Kling MCP 教程演示了如何把产品照片转化为高质量时尚视频,涵盖定义视觉风格、准备模特图片到批量生成产品展示视频的完整流程。该流程主打更少制作、更多内容。
一次企业级智能知识库项目的总体设计实践表明,企业级知识库的真正门槛不是支持多少文件格式或单次测试准确率,而是能否建立知识持续进入、使用、发现问题并优化的运行机制。
作者在使用 Coding Agent 时从 TL 转向 EM 角色,转折点在 Fable 5 前后——发现 AI 写的代码质量已相当可以,只需稍加验证。他现在只与 Agent 一起定技术方案,再用 /goal 加上方案让 Agent 执行写代码和自动化测试,最后验收功能。
借助生成式世界模型,real-to-sim-to-real(R2S2R)仿真引擎可将一个物理任务转化为多个可控、可复用的世界,帮助机器人团队更快训练策略模型、更早发现失败并减少昂贵的硬件实验。
Hugging Face 发布 "Training Agents 3" 教程,讲解如何用强化学习训练一个本地运行的开源权重智能体(open weight agent),并以直播形式呈现。内容聚焦训练流程本身,具体模型、参数与效果原文未披露。
Weaviate 发布教程,演示跳过转录直接对音频做嵌入和检索。流程包括把原始音频切成重叠片段、用 Gemini Embedding 2 生成多模态嵌入向量、存入 Weaviate 并支持文本或音频查询检索相关片段,最后用 Gemini 3 Flash 基于检索到的音频生成回答。示例使用 Robert Frost 诗歌《Birches》的录音,同一方法可用于播客、访谈、课程和通话录音等音频集合。
Martin Fowler 发布新文章,指出 Subagents 常被"节省时间"和"并行执行"来论证价值,但 @techygarg 认为真正关键的是保护 orchestrator 的上下文。文章由 martinfowler.com/articles/orche 发布。
有意思小周刊 vol.170 提出面向 React Native 项目的 AI 需求开发闭环实践:把 PRD、接口文档、Figma 输入转化为可审阅的「需求规格」,并设人工门禁做需求审阅与架构确认,再依次执行代码生成、编译验证和视觉审计,形成从需求到可验证代码的人机协作流水线。
Slack 设计团队没有采用自上而下的 AI 培训,而是搭建了一个允许困惑、鼓励探索的学习社群。团队开设周五活动「会 Vibe 的设计师 & AI」,并在 2026 年推出为期三天的 Builder Days,让设计师、工程师和产品经理放下路线图,用 AI 一起动手造东西。其经验是:不要从工具赋能开始,而是先给设计师一个可以安心当新手的地方。
强少来了推荐开源书《深入理解 AI Agent》,该书围绕 Agent = LLM + 上下文 + 工具的核心公式,用 10 章把 AI Agent 从原理讲到工程实战,正文、配图与 92 个配套实验全部开源。
Qdrant 用 580 万条真实 Amazon 服饰商品搭建了 Qdrant Shopping 演示店铺,每次文本搜索都是对 Query API 的单次请求,约 40 毫秒返回排序货架,代码已开源于 GitHub。
Weaviate 指出,更大的上下文窗口无法修复有问题的智能体 RAG 流程,长上下文会引入矛盾信息、淹没相关工具并导致后续输入被忽略。其视频将智能体 RAG 流程拆解为查询增强、检索、记忆、工具、智能体五个系统,强调生产级智能体 RAG 本质是上下文工程问题。
播客「牛油果烤面包」第 153 期邀请 laike9m 和 Rice,聊 AI 编程的历史与技术核心,从「古法编程」、编译系统、测试与代码审核讲到 AI 编程工具的演进,重点剖析 Claude Code 与 Agentic Coding。
Tatsunori Hashimoto 称 Gigatoken 速度极快,让他(有望)不必再等待 tokenization,并认为训练前无需等待 tokenization 是一种范式转变。他指出,即便是 tokenizer 这类成熟组件,只要贴近硬件、用状态机实现,仍有数量级的提升空间。
Qdrant 发布增量嵌入更新教程,提供一套从第一天就能部署的流水线,检测文本数据变更并只重新嵌入改动的分块:未变的分块保持不动、文本移动时复用向量、新增与删除同步处理。
Andrej Karpathy 分享了一个与 LLM 协作的实用模式:信息不足又懒得打字时,切换到 /voice 语音输入漫谈约 10 分钟,任由思维发散,甚至可以说"切换到语音识别,抱歉有错别字"。他发现 LLM 很擅长重构冗长不连贯的漫谈,回显出的思路往往比原始输入更清晰,从而减少后续纠错。
Hugging Face 进行了一场名为 Local AI 201 的直播,标题与链接均指向 x.com 的广播页面。原文未披露直播涉及的具体模型、参数或技术细节。
React Server Components 传输的 Flight 流式协议本质是一套反序列化系统,其 $ 前缀解析机制(尤其是返回原始 Chunk 对象的 $@)构成攻击面。
Dify 团队总结了让 AI 支出花得更值的四种实践:按任务选择合适规模的模型、用 Annotation Reply 缓存重复答案、自托管以获得可预测的容量,以及按节点追踪成本、延迟与质量。文中提出"AI 成本不随用量增长,而随未优化的架构增长",并指出收益最大的团队并非花得最少,而是花得有章法。
一位用户分享用 Claude Cowork 管理日历的提示词:让 Claude 规划一周日程,把会议控制在 20 小时以内,合并冲突会议,并参考过往几周判断哪些会议会被拒绝,晚餐不计入 20 小时,更新邀请前先征求确认,同时构建一个可迭代打磨的技能。
Hugging Face 将于本周二举办本地 AI 主题活动,邀请 Ahmad Osman、Mike Bradley 讲解硬件配置与本地推理,并做现场演示。Alex Ocheema 与 0xSero 将分享如何按硬件选模型、模型压缩及 REAPs。
GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。
吴恩达与 Cerebras 合作推出新课,教你用其 Wafer-Scale Engine 构建快速响应的 LLM 应用。该硬件通过让模型权重贴近计算单元,减少内存到计算的搬运,使 token 生成比典型 GPU 方案快数倍。课程还涵盖构建网页个性化、多步市场信号分析等实时应用,以及快速推理下的智能体编码习惯。
Nik Malykhin 需要让一套 Java 1.5 代码库跑在现代硬件上,最初直接使用 LLM 并未奏效,直到他用细致的步骤引导整个过程才取得进展。他把这段经历写成了文章发布在 martinfowler.com。
Unmesh Joshi 在 Martin Fowler 站点分享经验:LLM 生成代码速度极快,但要确保产出符合预期,需要清晰的边界,他用抽象和领域特定语言(DSL)构建了强约束。文章已在 martinfowler.com 发布。
Qdrant 发布批量上传数据指南,针对大规模写入密集和稀疏向量时的内存、磁盘与搜索可用性问题给出配置策略。指南基于 Qdrant v1.19 引入的 memory 设置,提供三条路径:将密集向量设为 cold 存盘、上传前建好 payload 索引、以及用 TurboQuant 量化在 RAM 中保留压缩副本,其中 BITS4 为默认最接近全精度、BITS1 压缩最高。
TorchV 的 AIS 知识引擎把企业文档解析拆成解析引擎、解析实例、解析策略三层,策略按文件类型路由,PDF 可走 MinerU 并开启公式、表格、图片理解,Word 走 TorchV 默认解析,Excel 走 TextIn,音频走 Qwen ASR。