WorkBuddy 接入 Miora,袋鼠帝开源 3 个 AI 短片制作 Skill
袋鼠帝把 AI 短片制作流程沉淀为 3 个 Skill 并开源:视觉资产提示词、动作打戏提示词和 Miora 视频执行规范,可直接装入 WorkBuddy 使用。
袋鼠帝把 AI 短片制作流程沉淀为 3 个 Skill 并开源:视觉资产提示词、动作打戏提示词和 Miora 视频执行规范,可直接装入 WorkBuddy 使用。
歸藏开源了 Skill guizang-product-video-skill(https://github.com/op7418/guizang-product-video-skill),用纯前端代码渲染产品宣传片,不依赖视频生成模型。
作者用 ChatGPT Pro 中的 GPT 6 Astra 将《桃花源记》全文做成可实时交互的 3D 网页《桃源·豁然开朗》,拆成 20 幕,支持连贯体验与逐章慢读、原文与白话切换。
NVIDIA 发布 AIPerf,用于大规模 LLM 推理的基准测试。文章指出用 curl 命令、手写 asyncio 脚本或临时压测工具测推理性能,都会受单进程性能上限和 Python GIL 并发限制影响,导致测得的数字不可靠。
奇舞周刊第597期汇编多篇 Agent 工程实践:淘宝百亿补贴数据分析助手 Agent 在自然语言与 SQL 间加入业务语义层,结合多 Agent 编排、知识检索与执行校验,案例查询耗时从 30—120 秒降至 3—10 秒。
Jev 在分类任务上表现突出,做邮件分类和对线索评分都很好用。有用户为验证 Jev 的判断速度,让其进行邮件分类,并与各家 AI 的高速模型 Luna、Sonnet、Flash 对比,Jev 结果领先。
React 19.3 正式发布,View Transitions 与 Fragment Refs 转为稳定,并加入 Trusted Types 支持。
Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。
Browser Use 创始人 Gregor Zunic 发布实测视频,展示浏览器 Agent 查询真实航班机票从打开网页到返回结果只用 7 秒,1 倍原速无快进,单次成本 0.0039 美元。
有人尝试用 ChatGPT 的 live 模式打电话改文章,方案是先在 Codex 里打电话并提前把 md 文件路径给它,写作则指定 Codex 调用 gemini 3.8 flash(可通过 agy cli 接入),再用任意 md 阅读器打开文件随时聊着改内容。
大淘宝技术针对策略效果类 Agent 提出“五层、四步、三阶段”评测方法论:五层评测对象界定评什么,四步质量归因(诊断、定位、优化、验证)决定评完怎么办,三阶段上线治理(准入、灰度、监控)解决如何上线。团队同时提出 Auto Rubrics 方法,用结构化 Rubrics 替代黑盒 Reward Model,通过三层架构构建可解释的业务效果 Judge 体系,规避位置偏差与选择过拟合等陷阱。
一篇综述把 Agent 的能力来源从模型转向模型之外的 Harness,按「一个循环、四个子系统、生产化、长时运行、评测、选型」展开。
Equinix 将原先自建在 Amazon EC2 上的自管理 Kubernetes 迁移到 Amazon EKS,改用多账号共享服务架构:Workloads、Platform、Network 三个核心账号分别承载应用服务、共享基础设施与网络枢纽,由云运维团队集中治理。成效包括部署速度提升 4 倍,运维开销显著下降。
Included Health 基于 LangGraph 和 Deep Agents 搭建了联邦式多智能体架构,支撑其 AI 医疗导航产品 Dot。主 LangGraph 图被称为 Dot supergraph,Dot 负责对话路由,子工作流覆盖急诊接诊、预约挂号、专科医生匹配和行为健康等场景,不同产品团队各自拥有图中的不同部分。
Milvus 发布教程,介绍如何把 Milvus 用作 EverOS 的搜索后端。EverOS 来自 @evermind,GitHub 星标超过 13,000,用 LLM 从对话中提取记忆并保存为 Markdown 文件,让智能体跨对话保留长期记忆。
多院区医院网络可将传统本地 PACS 迁移为 AWS 云原生架构,把各院区独立 SAN/NAS 存储替换为集中式对象存储并按生命周期策略自动分层。
DHI Group 与 AWS 合作推出 Hackathon Acceleration Package(HAP),通过三天黑客松让 20 名参与者分 3 组构建原型,覆盖雇主分析、候选人匹配与 ClearanceJobs–AgileATS 集成三类用例。
基于 Claudian 改造的版本新增了对 antigravity cli 的支持,并可通过 OpenCodex 接入 Codex,同时该 Claudian 插件已可安装到 Obsidian 中使用。原推未披露模型版本、参数或性能数据。
O'Reilly Media 将自身定位为技术转移公司,通过图书、在线学习平台以及新推出的 O'Reilly Expert Intelligence 工具,同时塑造人类与 AI 智能体的学习方式。该工具是其在 agentic 学习方向上的最新落点。
腾讯云轻量云团队在多 Agent 开发工作流 DevFlow 中定位到,Token 消耗主要来自长上下文在多轮请求中被反复携带,而非代码本身;Developer 阶段上下文曾达到约 120K tokens。
智能体 AI 工作流可用于为物理 AI 系统准备并验证数字孪生:智能体检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并按仿真就绪(SimReady)要求校验结果。该流程演示了从 Blender 中的场景到交付给 NVIDIA 的仿真就绪 OpenUSD 的完整过程。
Unsloth 放出配套免费 Google Colab Notebook 与 GitHub 仓库,并提供专门文档页,供用户上手其微调流程。
在免费 Google Colab 中可借助 Unsloth Studio 微调 500+ 开源模型,并支持上传 PDF/CSV 转成可用的合成数据集。流程为安装 Unsloth Studio、选择模型、上传数据集后直接开跑,完成后可导出模型。
长时运行的 AI 智能体面临上下文限制与信息丢失问题,一款新工具正帮助开发者优化记忆管理并削减 API 成本。高效的信息检索被视为生产级 AI 的关键技能。完整分析刊于 The Batch。
开发者 Suhail 发布了新技能 /deslop-shared-libs,从最近两周的 commits 和 PRs 入手,找出可抽取共享代码以减少重复、提升可靠性的位置。他指出 AI 智能体倾向于大量编写全新代码,往往不做模块化和共享组件,导致技术债增加、测试变多、编译变慢;该技能可用于定期清理这类代码冗余。
NVIDIA 展示用智能体 AI 把 CUDA Tile 运算从 Python 转译到 Rust。目标系统 cuTile Rust(cutile-rs)是一个基于 tile 的 GPU kernel 编写框架,将 Rust 的所有权模型扩展到 tile 级 kernel,把可变输出拆分为互不相交的分片,并在 kernel 启动间保持主机端所有权契约;开发者也可在需要底层控制时局部退出该约束。
LlamaIndex 将举办网络研讨会,由解决方案架构师 Abrar Mahi 讲解如何用 LlamaParse 和 Extract 把保险文档转为结构化数据,用于核保、保单审查和理赔流程。内容涵盖解析保单等复杂表单、按既定 schema 抽取保单与财产信息及理赔历史,并用引用和边界框校验抽取结果。还会结合置信度分数与验证规则,决定哪些环节自动放行、哪些需人工复核。
IntelliJ IDEA 2026.2 改进了 Logpoints,新增在任意两行可执行代码之间的 gutter 处点击即可输入日志表达式的方式,无需重建或重新部署即可修改日志。文章用一个 gRPC 客户端-服务器示例演示如何用 Logpoints 定位租户名未规范化导致折扣为 0 的 bug,并可在调试中直接验证修复效果。
清华博士、苏黎世联邦理工博士后张托肯用 AI 三天完成从零到流片的 Attention 计算芯片设计,并借真格「Token Grant」算力支持推进「芯片开卷」计划。
vivo IT 技术团队用 1 个编排器 dev-workflow 加多个单职责 Skill 组成 AI 协作流水线,把存量代码变更拆成增量流程 A 和存量流程 B,流程 B 依次执行影响面分析、处理原则提取、最小侵入分析、埋点与回归用例生成。
得物技术推动指标字典从0到1落地,用业务、数仓、产品三条线建立语义底座:存量报表逆向梳理、隐性指标先登记后转正,数仓消费收敛到域控宽表,并在提报环节拦截二义性。该语义层支撑 Text2SQL 与 AI Coding 两条消费主线,系统测评 SQL 准确率从 85%+ 提升到 95%+;OneData 建设全流程提效 40%+,核心模型开发阶段提效 70%+。
腾讯程序员 daisy 公开了一份用于约束 AI 编程模型的 AGENTS.md,把「本文件中的每一条规则都是强制性的」写进开头。规则禁止用 try-except 包 import、用 Git 回滚代码、读写 /tmp、主动使用视觉功能、以 mock 或 workaround 通过测试,也禁止「不是……而是……」句式和单字缩写。
AgentWork 开源社区发布《魔搭紫皮书》,共 8 篇 34 章、约 40 万字,面向想系统学习 AI 的读者。内容覆盖开源模型下载、无资源体验、用 ms-swift 做轻量微调、用 EvalScope 评测,以及 AI 健身教练、智能客服质检、语音助手、企业知识问答等场景,并含 Claude Code、Pi、DeepSeek Harness 的 Agent 篇。
DeepSeek Harness(DSH)是 DeepSeek AI 基于 Cordis 开发的开源 Agent Harness,采用 MIT 许可证,官方仓库仍标注为开发者预览版。
淘天集团营销与交易技术团队基于ICLR 2026论文GEPA(Reflective Prompt Evolution)设计并实现了一套Prompt自进化系统,构建推理→评分→反思→选择闭环,让LLM自动分析Badcase、归因至Prompt具体规则并生成候选变体,再按帕累托前沿多目标择优。
12 个极简审美视觉 Skill 可把普通照片转成水墨写意、摄影 Zine、纸张旧影、手绘插画、8-bit 像素、Riso 印刷以及秦唐宋东方美学等多种视觉风格,适用于照片二创、海报和日常视觉练习。上传一张随手拍或旅行照即可换一种视觉语言重新表达。Skill 下载地址在评论区回复“666”获取。
NVIDIA 发布技术解析,解释 30B 参数模型为何每 token 只激活 3B 参数却仍能调用全部模型容量。文章对比稠密模型与 MoE 模型在参数使用方式上的差异,并说明这对吞吐量、内存占用和部署复杂度的影响。
腾讯云架构师技术同盟成员黄浩贤用 WorkBuddy 两三个月,把写 PRD、跑数据、挑方案漏洞等执行工作外包给 AI,写 PRD 效率翻了三倍不止。他让 WorkBuddy 扮演挑剔用户和强势业务方对方案做红队测试,并为数据任务立下三条护栏约束模型幻觉。
NVIDIA 技术博客解析 Dense 与 MoE 两类模型架构的差异:以 Nemotron 3.5 Lightning 为例,30B 参数模型通过 MoE 架构每个 token 仅激活 3B 参数,仍能利用更大模型的容量。文章对比两者的激活参数与吞吐量,并给出各自的选型时机。
在 Interview Coach 应用中先用 Visual Studio 的 Analyze Code Coverage 定位测试缺口,再用 GitHub Copilot 的 Test Agent 为 InterviewSessionTool 生成 8 个新测试和一个新测试项目。