Birgitta Böckeler 实测本地 LLM 跑编程任务,梳理影响可行性的因素
Birgitta Böckeler 近期实测用本地 LLM 完成部分编程任务,并梳理出影响其可行性的多项因素。相关备忘已发布在 martinfowler.com。
Birgitta Böckeler 近期实测用本地 LLM 完成部分编程任务,并梳理出影响其可行性的多项因素。相关备忘已发布在 martinfowler.com。
播客「AI 炼金术」中,徐文浩分享做大项目的 Harness 设计,认为纯 vibe coding 做大项目一定会塌掉,但不该得出 AI 没用的结论,而是要靠一整套基建管理复杂度并持续迭代。
李继刚「人生周报v080」以 Bayes 为主题,推荐日本作者所写的《统计学关我什么事》,并用先验、似然比、后验五步取景框分析问题。文中还提出「语言是一种技术」、把进化论引入笔记系统让笔记每天繁衍变异,并分享生成 PPT 的 skill /ljg-present。
Claude Code 团队把“循环”定义为 AI 智能体不断重复执行工作周期直到满足预设停止条件,并按触发方式、停止条件、所用基础指令和适配任务四个维度分类。
有用户分享用 Claude Code 搭配 workflows 和 artifacts 搜寻候选人的用法:向 Claude Code 描述职位与目标背景,让它启动动态工作流找出 100 名候选人,并为每人附上 LinkedIn、Twitter、博客、播客及一句话简介,再生成 artifact 邮件发送,随后可在离开电脑后随时查看结果。
有用户提示,可让 Claude Code 借助 computer use 功能自动完成 Claude Tag 的配置:只需把它指向 Claude Tag 文档,它就会为团队接入 GitHub 仓库、数据仓库、Google Drive 及其他数据源。
LLM 基于对话训练导致行业把所有 AI 能力塞进聊天框,但文本输入与输出各有代价:空白输入框让用户猜能力、须把模糊想法翻译成精确提示词,长文本回复则把解读负担转嫁给用户。文章提出用任务审计和输入/输出对齐矩阵两种工具,按用户当下意图匹配模态。
Qdrant 提出分支感知的语义代码搜索方法,用向量索引按语义检索代码,并让每次查询只作用于某一分支的实时视图:包含该分支自身的提交及其从祖先继承的内容,排除后续提交已替换的版本。
UX × AI 系列第二篇提出"提示词就是新的设计简报",认为写 prompt 并非新技能,而是设计师早已掌握的设计简报写作能力在新界面的应用。文章指出优秀简报与有效 prompt 共享四大要素:目标、受众、约束与上下文,提示词本质是沟通与设计能力,而非来自软件开发的"提示词工程"这类技术技能。
HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。
Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。
Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。
Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。
Hugging Face 发布"Welcome to Open Source AI: Run Your Own Models Locally",主题是在本地运行开源 AI 模型,内容以 X 平台直播形式呈现。该帖获得 346 次点赞、55 次转发和约 5.1 万次浏览。
Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。
Qdrant 提出用廉价信号在检索路径上提前识别弱检索,避免为每个查询都调用 LLM 判断。这些信号读取检索器已返回的结果,至多增加一次复用查询向量的 Qdrant 查询,包括 max_score、dense_variance、evidence_coverage、retriever_divergence 和 dense_agreement 等。
MongoDB 提出一套从 POC 走向生产的 Agentic AI 四步信任框架,涵盖基础层、验证层、治理层等环节。框架以客户退款为例,用 RAG 和运行数据减少模型幻觉,并将可观测性作为"黑匣子记录仪"记录每一步推理、工具调用与 token 开销。验证层引入 Agent 置信度分数(ACS)与业务风险分数(BRS),治理层则用 ADS = ACS x (1 - BRS) 决定智能体的自主程度。
Modal 指出多数沙箱基准只测容器调度与启动的 time to interactive,但生产环境中复制 repo、安装依赖等应用层初始化才占用户等待的大头。
有几个实现就是这样上线到生产环境的,均运行在拥有数千活跃用户的系统上,且没有一个引发事故。
吴恩达推出新课,教你用 VocalBridge 为 AI 智能体与应用添加语音,兼顾可靠性与速度。课程包含三类应用:语音命令与鼠标点击共用单通道的语音互动游戏、约 10 行代码就能为现有智能体加语音且不改动提示词或工具、以及用 make_phone_call 函数发起外呼电话的智能体。课程还教授外呼与实时转录、语音评估打分与回归检测。
Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。
Jim Fan 披露 Physical AutoResearch 的幕后工程:ENPIRE 让 8 台机器人整夜无人值守运行,通过硬运动学限制与力矩受限柔性夹爪两层机制保障安全。系统在 AutoResearch 前冻结奖励函数,并用机器人秒、GPU 秒、token 三类遥测(如 MRU、MTU)让 ENPIRE 实时感知资源,避免盲目爬山。
Air Canada 聊天机器人曾给出不存在的丧亲票价退款政策,航空公司拒绝兑现后被裁定败诉,暴露了把 AI 预测当作事实的风险。文章主张设计师应以概率思维看待 AI 输出——它们是信号而非结论,并可用结构化提示词在产品设计前模拟结果,但模拟不能替代真实实验,因为模型基于历史数据,往往反映过去行为而非预测未来变化。
Anthropic 的 Alex Albert 分享了 Fable 提示词指南中的一条技巧,指南还包含更多使用 Fable 的提示词方法。完整指南可在 platform.claude.com 的构建文档中查看。
Alex Albert 称 Fable 在长时间智能体对话中表现"超人",有时快到他跟不上。他分享了一段提示词片段,用于让 Fable 写得更清楚、去掉术语行话,并称这是目前找到的最好解决办法。
Richard Socher 提出"更快训练达到同等质量"(Faster training to the same quality),该帖获 36 次点赞、8905 次浏览。原文未披露具体模型、参数或速度倍数等细节。
Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。
阿里通义团队介绍在 MNN 推理引擎中开启 Arm SME2 指令集加速,让 Qwen3-VL-4B 多模态模型在支持 SME2 的旗舰手机上实时推理。文章给出从引擎编译、模型转换量化、adb 推送到构建 Android APP 的完整流程,并附实测数据:在 vivo X300 上 Prefill 阶段提速 81%,Decode 阶段提升 13%。
Fable 与加州大学尔湾分校合作开展认知可用性研究,招募 30 名被试(10 人/网站,认知障碍与普通用户各半),在三个 AI 生成的网站上完成预约、购物车、食谱检索等任务并填写 Accessible Usability Scale(AUS)问卷。研究通过录像与转录统计每位被试提出的问题与改进建议,以验证认知障碍测试者能否比普通用户发现更多可用性洞察。
硬地骇客 EP127 讨论了从 Claude Code、Codex 到 OpenClaw,哪些 Skills 真正改变了工作流,并分析 GrillMe、TDD、Playwright、Computer Use 等热门 Skills 解决的具体问题。节目还覆盖知识管理、投资研究、邮件处理等 Coding 之外的场景,以及自定义 Skill 的开发与自动化沉淀,探讨如何让 Agent 成为个人数字分身。
通义实验室与 Efflora 团队基于 Qwen3.7-Max 做了一场实验,仅给一份约 15 万字的产品调研文档,就在隔离环境中从 0 交付移动端和 Web 端两套可运行应用,单端约 4 个多小时全自动完成。
Andrew Ng 联合 Red Hat 推出高效 LLM 服务短课程,由 cedricclyburn 主讲。课程教你用量化压缩模型显存占用,并用 vLLM 通过智能内存管理高效处理大量并发请求,还将对部署进行基准测试,在速度、成本与精度间做权衡。70B 参数模型仅加载权重就需约 140 GB 显存,每个活跃请求还需独立的 KV cache。
让 AI 生成的原型更稳定,关键在于把设计决策当作基础设施,写入供 AI 读取的 Markdown spec files,并配合 token 层与审计脚本约束硬编码值。文中推荐的免费 Figma 插件 FigmaLint 可审计 token、状态、无障碍与硬编码值。Atlassian、Carbon、CMS、Nordhealth 等已给出 AI-Ready 设计系统示例。
AI短剧《安徽小木匠》作者小果哥哥在播客中复盘,该剧制作成本不到3000元,播放量超过3.5亿次,收益50多万元。他介绍了从番茄小说选IP、用AI生成并拼接剧本、小云雀生成视频、重新拼接音画到抖音和红果上线分发的完整流程,并提到上线受益还涉及投流,从学习AI到剧集上线共19天。
有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。
有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。
Birgitta Böckeler 在 martinfowler.com 发文,探讨传感器在编码智能体中的作用,重点分析测试套件如何充当回归传感器,以及变异测试(mutation testing)能在其中扮演的角色。
Martin Fowler 的四位同事在 martinfowler.com 发文,分享将良好安全实践应用到 vibe coding 中的亲身经验。文章以多人经验合集的形式呈现。
哔哩哔哩商业广告团队基于 Google A2UI 协议自研 Vue 渲染器和 Agent 工具链,让 AI 助手从 Markdown 文本输出升级为生成可交互 UI。方案包含 Runtime Schema 装配、结构与过渡双重校验、SSE 双通道输出,并以 npm 包形式交付 SDK,业务方三步即可接入,新场景接入周期从天级缩短到小时级。
用 LLM 保障源代码安全需要走完一条完整流程:建立威胁模型、发现漏洞、验证、分类定级,最后完成补丁修复。