用 TensorFlow + OpenAI Gym 实现深度强化学习模型
这篇教程讲解如何用 TensorFlow 和 OpenAI Gym 实现深度强化学习模型,完整代码已开源于 lilian/deep-reinforcement-learning-gym。
这篇教程讲解如何用 TensorFlow 和 OpenAI Gym 实现深度强化学习模型,完整代码已开源于 lilian/deep-reinforcement-learning-gym。
这篇综述系统梳理了策略梯度算法,涵盖从基础到进阶的多种方法,后续更新加入 SAC、D4PG、TD3、SVPG、IMPALA、PPG 等,并补充了 PPO 讨论及自动调节温度的 SAC 版本。文中详解了 IMPALA 的 importance weighted actor-learner 架构与 V-trace 离线策略修正,并总结了降低方差、离线策略、经验回放、目标网络等共性设计原则。
Lilian Weng 在 Lil'Log 发布长文梳理强化学习(RL),从智能体与环境的交互出发,形式化定义状态、动作、奖励、模型、策略与价值函数等核心概念,并把 RL 算法按 model-based / model-free、on-policy / off-policy 分类,随后介绍求解 RL 问题的经典方法。
多臂老虎机问题是探索与利用困境的经典模型:K 台老虎机各有未知的奖励概率 θ,玩家需在 T 步内最大化累计奖励,或等价地最小化总遗憾。
R-CNN 系列包含 R-CNN、Fast R-CNN、Faster R-CNN(目标识别)与 Mask R-CNN(图像分割)四个模型。R-CNN 先用 selective search 提出约 2k 个候选区域,再逐区域提取 CNN 特征分类并用回归模型校正边界框,召回率以 IoU 0.3 为界、bbox 回归以 0.6 IoU 为界。该系列还常用非极大值抑制与难负样本挖掘等技巧。
"Object Detection for Dummies"系列第二篇回顾图像分类的经典 CNN 架构:AlexNet 用 5 层卷积加 2 层 MLP,VGG 为 19 层、只用 3x3 卷积和 2x2 池化,ResNet 达 152 层并靠残差块保持可训练。
Lilian Weng 在 "Object Detection for Dummies" 系列第一篇中讲解了图像处理的基础概念——图像梯度向量由 x、y 两个方向的偏导数构成,其幅值为 L2 范数、方向为 arctan(g_y/g_x),并可用 Prewitt、Sobel 等卷积核在整张图像上一次性计算,无需逐像素迭代。
词嵌入把词和短语表示为低维稠密向量,以近似词间相似度并揭示如“cat-kitten”与“dog-puppy”的语义类比关系。学习词嵌入主要有两类依赖上下文的方法:基于计数的无监督方法(对全局词共现矩阵做矩阵分解,PCA、主题模型、神经概率语言模型均属此类)和基于上下文的监督方法(如 Skip-Gram 与 CBOW,在预测目标词或上下文词的同时学到词向量)。
机器学习模型正进入医疗、司法与金融等关键领域,但深度神经网络天生是黑盒,难以解释其决策过程。文章梳理了可解释模型的方法,包括线性回归用系数或 $w_i x_i$ 衡量特征贡献、Naive Bayes 通过后验概率衡量单特征影响,以及决策树/决策列表(如 FRL、BRL、IDS)。作者还指出随机森林并非黑盒,可用平均不纯度下降衡量全局特征重要性。
这篇 RNN 股票价格预测教程第二部分在第一部分模型基础上加入股票代码嵌入向量,使其能同时处理多只股票。作者用长度为 3 的 embedding 替代 one-hot 编码,把价格向量与嵌入向量拼接后输入 LSTM,并新增 embedding_size 与 stock_count 两个配置项。
这篇教程演示如何用 TensorFlow 构建带 LSTM 单元的 RNN 模型,预测标普 500 指数价格,完整代码已开源在 GitHub。示例使用 1950 年 1 月 3 日至 2017 年 6 月 23 日的标普 500 日收盘价数据,并以均方误差为损失、RMSPropOptimizer 做优化,同时展示了如何用 TensorBoard 调试和跟踪模型。
2016 年 AlphaGo 以 1-4 击败九段棋手李世石,让深度学习和 AI 应用获得大量关注。深度学习的兴起源于两个条件:数据规模大幅增长,以及算力显著提升,使深层神经网络能够自动学习特征、在数据量增大后超越传统机器学习算法。文章随后介绍了几类经典模型,包括受视觉皮层启发的 CNN、Residual Net 的残差连接,以及适合处理长序列、应用于手写识别、语音识别和机器翻译的 RNN。