基于 深度 学习 的 医学 图像 识别 研究 进展
刘飞 张俊然 杨豪
四川 大学 电气 信息 学院
中国 生物 医学 工程 学报 2018 ( 01 )

摘要 ： 近年 来 , 随着 医学 影像 技术 的 快速 发展 , 医学 图像 分析 步入 大数据 时代 , 如何 从 海量 的 医学 图像 数据 中 挖掘 出 有用 信息 , 对 医学 图像 识别 带来 巨大 的 挑战 。 深度 学习 是 机器 学习 的 一 个 新 领域 , 传统 的 机器 学习 方法 不 能 有效 地 挖掘 到 医学 图像 中 蕴含 的 丰富 信息 , 而 深度 学习 通过 模拟 人脑 建立 分层 模型 , 具有 强大 的 自动 特征 提取 、 复杂 模型 构建 以及 高效 的 特征 表达 能力 , 更 重要 的 是 深度 学习 方法 能 从 像素 级 的 原始 数据 中 逐级 提取 从 底层 到 高层 的 特征 , 这 为 解决 医学 图像 识别 面临 的 新 问题 提供 了 新 思路 。 首先 阐述 深度 学习 方法 , 列举 深度 学习 方法 的 三 种 常见 的 实现 模型 , 并 介绍 深度 学习 的 训练 过程 ; 随后 总结 了 深度 学习 方法 在 疾病 检测 与 分类 和 病变 识别 两 方面 的 应用 情况 , 以及 深度 学习 应用 在 医学 图像 识别 中 的 两 个 共性 问题 ; 最后 对 深度 学习 在 医学 图像 识别 中 存在 的 问题 进行 分析 及 展望 .
基金 ： 广西 高校 重点 实验室 科学 基金 ( GXSCIIP201411 ) ; 四川省 科技 计划 资助 项目 ( 2015HH0036 ) ; 成都市 科技 惠 民 资助 项目 ( 2015-HM01-00561-SF )
关键 词 ： 医学 图像 识别 ; 机器 学习 ; 深度 学习
作者 简介 ： 张俊然 , E-mail:zhangjunran@126.com ;
收 稿 日期 ： 2016-12-02

引言
医学 图像 识别 是 综合 医学 影像 、 数学 建 模 、 计算机 技术 等 多 学科 的 交叉 领域 , 在 医学 图像 大数据 时代 , 海量 而 复杂 的 图像 数据 带来 两 个 方面 的 新 问题 : 一 方面 要 处理 的 医学 图像 数据 维数 更 高 , 要求 有 更 强 学习 适应 能力 的 模型 ; 另外 一 方面 医学 图像 大数据 更加 分散 破碎 , 数据 结构 更加 复杂 , 常常 需要 整合 不同 的 信息 [ 1 ] 。 传统 的 数据 分析 方法 常常 不 能 满足 人们 的 要求 , 因此 在 医学 大数据 时代 , 如何 从 海量 医学 图像 数据 中 挖掘 出 有用 信息 , 已 成为 学术界 和 工业界 的 研究 热点 。
深度 学习 [ 2 ] 是 机器 学习 [ 3 ] 中 的 新 领域 , 旨 在 通过 模拟 人脑 自动 地 学习 数据 各 个 层次 的 抽象 特征 , 从而 更 好 地 反映 数据 的 本质 特征 [ 4 ] 。 自 2006 年 , Hinton [ 2 ] 提出 一 种 基于 概率 图 模型 的 多 层 受限 波尔兹曼机 ( restricted Boltzmann machine , RBM ) 后 , 深度 学习 已 成为 图像 处理 和 计算机 视觉 领域 的 主导 工具 。 近年 来 , 深度 学习 在 图像 识别 [ 5 ] 、 语音 识别 [ 6 - 7 ] 、 自然 语言 处理 [ 8 - 9 ] 、 计算机 视觉 [ 10 - 11 ] 等 领域 取得 了 巨大 的 成功 , 并 引发 了 更 多 领域 利用 深度 学习 进行 数据 挖掘 和 分析 的 热潮 , 在 医学 领域 也 引起 相应 专家 及 公司 的 重视 , 如 研发 出 Alpha Go 的 Google 子公司 Deep Mind 宣布 Deep Mind Health 健康 [ 12 ] ; IBM 公司 提出 Watson for Oncology [ 13 ] , 通过 学习 大量 数据 分析 病人 的 肿瘤 影像 信息 , 从而 为 医生 制定 可靠 的 医疗 方案 提供 帮助 。
首先 介绍 深度 学习 网络 的 分类 方式 、 常见 的 3 种 深度 学习 模型 及 深度 学习 的 训练 过程 ; 然后 介绍 深度 学习 在 疾病 检测 与 分类 和 病变 识别 中 的 应用 ; 最后 分析 深度 学习 方法 应用 在 医学 图像 识别 中 面临 的 问题 并 对 未来 进行 展望 。
1 深度 学习 方法
深度 学习 从 人工 神经 网络 发展 而 来 , 20 世纪 80 年代 用于 人工 神经 网路 的 BP 算法 的 提出 , 开启 了 基于 统计 学习 的 机器 学习 热潮 , 但 在 随后 的 训练 过程 发现 , BP 算法 存在 收敛 速度 慢 、 易 陷入 局部 最 小 等 缺陷 [ 14 ] 。 20 世纪 90年代 , 各 种 浅 层 机器 学习 模型 如 boosting [ 15 ] 、 SVM [ 16-17 ] 等 被 提出 , 这些 模型 在 理论 上 和 应用 中 都 获得 了 巨大 的 成功 , 但 由于 训练 方法 需要 很多 经验 和 技巧 , 使得 浅 层 的 机器 学习 长 时间 处于 平静 期 。 直 到 2006 年 深度 信任 网络 的 提出 [ 4 ] , 开启 了 对 深度 学习 研究 的 新 篇章 , 其中 2012 年 Hinton 采用 CNN 模型 赢得 Image Net 图像 分类 的 冠军 , 准确率 比 第二 名 提高 10% 以上 [ 18 ] , 在 计算机 视觉 领域 取得 了 突破性 的 进展 。 此后 随着 用于 序列 数据 建 模 的 递 归 神经 网络 ( recurrent neural networks , RNN ) [ 19 - 20 ] 、 自然 语言 处理 和 音 素 识别 的 深度 条件 随 机场 ( deep - structured conditional random fields , DCRF ) [ 21 - 22 ] 、 图像 处理 的 深层 残 差 网络 ( deep residual networks , DRN ) [ 23 - 24 ] 等 模型 的 出现 和 各 种 深度 学习 算法 的 提出 及 GPU 计算 能力 的 提升 , 使得 深度 学习 在 图像 识别 、 语音 识别 等 众多 领域 取得 了 巨大 的 成功 , 2016 年 Goole Alpha 与 李世石 的 人机 围棋 大赛 使得 深度 学习 技术 广 为 人 知 。
深度 学习 的 目的 在于 通过 构建 多 层 隐层 的 机器 学习 模型 和 海量 训练 数据 来 学习 更 有用 的 特征 , 从而 提高 分类 或 预测 的 准确性 [ 25 ] 。 与 传统 的 浅 层 学习 相比 , 深度 学习 具有 如下 特点 : 一 是 特征 学习 , 深度 学习 方法 能够 根据 不同 的 应用 自动 从 海量 数据 中 学习 到 所 需 的 高级 特征 表示 , 更 能 表达 数据 的 内在 信息 。 二 是 深层 结构 , 深度 学习 模型 结构 深 , 通常 拥有 5 层 甚至 更 多 层 的 隐层 节点 , 包含 更 多 的 非线性 变换 , 使得 拟 合 复杂 模型 的 能力 大大 增强 。 三 是 无 监督 学习 , 输入 的 数据 只有 本身 数据 信息 , 没有 标签 信息 , 深度 学习 未 标记 数据 的 模式 ; 通过 数据 内在 的 一些 特征 和 联系 将 数据 自动 分类 。 通过 在 训练 过程 中 加入 无 监督 学习 作为 预 训练 , 使得 深度 学习 模型 相比 人工 神经 网络 具有 更 好 的 分类 能力 。
1 . 1 深度 学习 网络 的 分类
深度 学习 是 通过 多 层 非线 信息 处理 方法 来 构建 深层 网络 [ 26 ] , 根据 结构 的 不同 分为 如下 3 类 [ 27 ] : 生成 式 深层 网络 、 有 监督 ( 判别 式 ) 深层 网络 、 混合 深层 网络 。
1 ) 生成 式 深层 网络 : 通过 学习 观测 数据 高阶 相关性 , 或 观测 数据 和 关联 类别 之间 的 统计 特征 分布 来 实现 模式 分类 的 一 类 深层 结构 [ 28 ] , 用于 在 没有 目标 类 标签 信息 的 情况 下 捕捉 观测 到 的 或 可见 数据 的 高阶 相关性 。 常见 的 生成 式 模型 是 深层 玻尔兹曼机 ( deep Boltzmann machine , DBM ) [ 29 ] 、 和 积 网络 ( sum - product network , SPN ) [ 30 ] 、 递 归 神经 网络 ( recurrent neural networks , RNN ) [ 19 - 20 ] 等 。
2 ) 有 监督 ( 判别 式 ) 深层 网络 : 描述 在 可见 数据 条件 下 的 类别 后 验 分布 [ 31 ] , 目标 类别 标签 以 直接 或者 间接 的 形式 给出 , 因此 , 有 监督 深度 网络 也 称为 判别 式 深度 网络 。 深度 堆叠 网络 ( deep stacking network , DSN ) [ 32 ] 、 深度 结构 条件 随 机场 ( deepstructured conditional random fields , DCRF ) [ 33 - 34 ] 是 典型 的 有 监督 学习 深度 网络 。
3 ) 混合 深层 网络 : 将 生成 式 深层 结构 与 判别 式 深层 结构 相 结合 的 一 类 深层 结构 。 通常 情况 下 , 数据 被 用于 作为 预 训练 网络 的 权重 , 以 加快 监督 阶段 学习 过程 , 无 监督 深度 网络 的 结果 作为 重要 辅助 [ 35 ] , 预 训练 深度 神经 网络 ( pre - trained deep nerual networks , PDNN ) [ 36 ] 是 一 种 混合 深度 网络 。
1 . 2 深度 学习 模型
深度 学习 方法 的 模型 种类 较 多 , 其中 比较 常用 的 模型 是 深度 自 编码 网络 ( deep auto - encoder network , DAN ) 、 深度 信念 网络 ( deep belief network , DBN ) 、 卷 积 神经 网络 ( convolution neural network , CNN ) , 近年 来 还 出现 了 许多 新 的 深度 模型 , 如 循环 神经 网络 模型 ( recurrent neural nets , RNN ) [ 37 ] 、 张 量 堆叠 网络 模型 ( tensor deep stacking network , TDSN ) [ 38 ] , 本 节 介绍 常见 的 3 种 深度 学习 模型 及其 构建 方法 。
1.2.1 深度 自动 编码 器 DAE
Bengio 等 通过 改进 原型 自动 编码 器 结构 ( 如 图 1 所 示 ) , 产生 了 深度 自 编码 器 ( deep autoencoder , DAE ) [ 39 ] , 深度 自 编码 器 的 基本 元件 是 AE , AE 包含 一 个 输入 层 、 一 个 隐层 、 一 个 输出 层 , AE 主要 用于 学习 压缩 的 或 过 完备 的 特征 表示 , 当 自 编码 器 包含 多 个 隐层 时 就 形成 了 DAE 。 DAE 是 一 类 经过 无 监督 逐 层 贪心 预 训练 和 系统性 参数 优化 的 多 层 非线性 网络 , 从 无 标签 数据 中 提取 高维 输入 数据 的 分层 特征 , 并 得到 原始 数据 的 分布式 特征 表示 的 深度 学习 神经 网络 结构 [ 40 ] 。
图 1 原型 自动 编码器 [ 41 ] Fig.1 Prototype Automatic Encoder [ 41 ]
DAE 的 构建 主要 有 两 步 : 第一 步 , 改进 原型 自动 编码 器 , 通过 增加 隐含 层 和 神经元 的 数量 、 调整 隐含 层 的 节点 分布 、 改变 权 值 的 分享 方式 等 途径 构建 DAE 的 基本 结构 ; 第二 步 , 根据 不同 的 任务 选取 合适 的 代价 函数 及 优化 策略 、 隐含 层 品质 因数 、 系统性 参数 优化 的 性能 指数 等 确定 DAE 的 训练 方案 [ 41 ] 。 编码 器 在 输入 数据 中 加入 含有 一定 统计 特性 的 噪声 , 构成 基于 统计 理论 的 DAE , 在 原型 自动 编码 器 的 代价 函数 表达式 中 加入 解析 性 收缩 惩罚 因子 , 就 构成 了 基于 鲁棒 理论 的 DAE 。
1.2.2 深度 信念 网络 DBN
2006 年 , Hinton 提出 DBN [ 4 ] , 开启 了 机器 学习 第二 次 浪潮 — — — 深度 学习 。 将 多 个 限制 玻尔兹曼机 ( restricted Boltzmann machine , RBM ) 堆叠 得到 深度 波尔兹曼机 ( deep Boltzmann machine , DBM ) , 如果 靠近 数据 层 的 部分 层 之间 的 连接 为 有 向 连接 , 即 为 DBN [ 42 ] , 如 图 2 所 示 。 DBN 的 基本 单元 是 RBM , 单个 RBM 包含 一 个 由 随机 的 隐 单元 构成 的 隐 层 ( 一般 是 伯努利 分布 ) 和 一 个 由 随机 的 可见 单元 构成 的 可见 层 ( 一般 是 伯努利 分布 或 高斯 分布 ) : 其中 隐 层 和 可见 层 之间 是 双向 连接 , 隐 单元 两 两 之间 、 可见 单元 两 两 之间 无 连接 ; RBM 采用 对比 梯度 算法 ( contrastive divergence , CD ) 对 无 标签 样本 进行 训练 , 属于 无 监督 学习 算法 ; DBN 通过 组合 许多 RBM , 把 上 一 层 RBM 的 特征 激励 作为 下 一 层 的 训练 数据 , 从而 可以 对 隐 层 的 数据 特征 进行 高效 的 学习 [ 35 ] 。
图 2 深度 信念 网络 [ 43 ] Fig.2 Deep belief network [ 43 ]
DBN 的 构建 步骤 如 下 :
步骤 1 , 首先 充分 训练 第一 个 RBM , 将 训练 得到 的 权 重 和 偏移 量 固定 , 并 将 隐 层 作为 第二 个 RBM 的 输入 向量 。
步骤 2 , 采用 同样 的 方法 训练 第二 个 RBM , 并 将 第二 个 RBM 堆叠 在 第一 个 RBM 的 上方 。
步骤 3 , 重复 前面 两 个 步骤 得到 多 个 RBM , 最后 将 多 个 RBM 按 顺序 堆叠 在 一起 就 得到 DBN 。 其中 堆叠 的 过程 是 : 训练 一 个 高斯 - 伯努利 RBM 或者 伯努利 - 伯努利 RBM 后 , 将 隐 层 的 激活 概率 作为 下 一 层 伯努利 - 伯努利 RBM 的 可见 层 输入 数据 , 依次 类推 , 这 种 堆叠 过程 达到 最 大 似然 学习 效果 , 且 是 无 监督 学习 过程 , 因此 不 需要 标签 信息 。
1.2.3 卷 积 神经 网络 CNN
CNN 是 受 生物学 上 的 感受 野 机制 而 提出 的 , 经过 不断 的 改进 最终 发展 成 一 个 特别 适合 图像 处理 的 深度 学习 模型 , 同时 CNN 是 一 种 特殊 的 神经 网络 模型 : 一 方面 , CNN 除了 全 连接 层 与 输出 层 之外 的 神经元 之间 采用 部分 连接 , 而 传统 的 神经 网络 都 是 采用 全 连接 的 方式 , 这 就 使得 传统 的 神经 网络 训练 耗时 且 难以 训练 ; 另 一 方面 , CNN 在 同 一 层 的 神经元 之间 共享 权 值 , 通过 权 值 的 共享 既 减少 了 权 值 的 数量 又 降低 了 网络 模型 的 复杂 度 。 目前 在 国际 标准 的 Image Net 数据集 上 , 许多 成功 的 模型 都 是 基于 CNN , 如 大 规模 图像 识别 的 深度 学习 网络 Goog Le Net [ 44 ] 和 Adam [ 45 ] 以及 Le Net - 5 [ 46 ] 等 。
CNN 的 基本 单元 是 stage , 其 结构 如 图 3 所 示 , 每 个 stage 模块 都 是 由 卷 积 层 ( convolution layer ) 和 池 化 层 ( pooling player ) 组成 [ 47 ] , 卷 积 层 用于 增强 原始 信号 、 提高 信 噪 比 , 且 通过 权 值 的 共享 减少 了 模型 的 训练 参数 和 计算 的 复杂 度 ; 池 化 层 通过 减少 卷 积 层 之间 的 连接 , 进一步 减少 训练 的 数据 量 , 同时 对 卷 积 层 的 输出 进行 降 采样 , 达到 减少 下 一 层 的 数据 的 效果 [ 48 ] 。 通过 将 多 个 stage 堆叠 在 一起 , 并 在 模型 的 末端 加入 全 连接 层 和 分类 器 就 构成 CNN 。
图 3 CNN 的 基本 结构 单元 stage [ 47 ] Fig.3 Stage is the basic unit of the convolutional neural network [ 47 ]
1.3 深度 学习 训练 过程
深度 学习 从 人工 神经 网络 发展 而 来 , 训练 方法 继承 了 人工 神经 网络 的 反向 传播 方法 和 梯度 下降 方法 , 反向 传播 算法 [ 49 ] ( back propagation , BP ) 是 从 大量 样本 数据 中 学习 到 统计 规律 , 从而 对 测试 样本 做出 判别 。 相比 人工 提取 特征 , 反向 传播 算法 消除 了 手工 设计 的 影响 , 具有 很 大 的 优越性 , 但 采用 BP 算法 训练 深层 结构 的 网络 时 存在 以下 两 个 问题 : 一 是 BP 算法 主要 解决 复杂 的 非线性 问题 , 网络 的 权 值 沿着 局部 方向 逐渐 调整 , 使得 权 值 收敛 到 局部 极 小 点 , 从而 导致 整个 网络 训练 失败 ; 二 是 训练 速度 慢 , 而且 在 训练 深 层次 结构 的 网络 时 效果 不 明显 。
批量 梯度 下降 法 、 随机 梯度 下降 法 是 对 BP 算法 进行 改进 的 优化 方法 。 批量 梯度 下降 法 [ 50 ] 是 最 原始 的 梯度 下降 法 , 通过 最小化 所有 训练 样本 的 损失 函数 使得 最终 求解 的 是 全局 最优 解 , 它 的 优点 是 得到 一 个 全局 最优 解 , 而且 易于 实现 并行 , 但 批量 梯度 下降 每 次 学习 都 要 使用 整个 训练 集 , 可能 导致 非 凸 函数 收敛 于 局部 极 值 点 , 同时 训练 过程 会 随着 样本 数量 的 加大 导致 训练 时间 过 长 。 随机 梯度 下降 法 [ 51 ] 是 通过 对 所有 样本 进行 随机 选择 最 小 化 , 每 条 样本 的 损失 函数 来 求解 最优 解 , 在 更新 模型 参数 时 只 选择 一 个 样本 。 其 优点 是 训练 速度 快 , 但 随机 梯度 下降 法 需要 人为 调整 很多 超 参数 , 如 学习 速率 、 收敛 准则 、 层 数 以及 每 层 的 单元 个数 等 , 这些 超 参数 若 选择 不当 可能 导致 每 次 更新 不 会 按照 全局 的 方向 进行 。
在 深度 学习 模型 中 涉及 多 个 非线性 处理 单元 层 , 优化 目标 为 非 凸 函数 , 当 使用 批量 梯度 下降 法 、 随机 梯度 下降 法 来 训练 深层 网络 时 , 会 出现 训练 时间 过 长 、 梯度 不 稳定 、 目标 函数 常常 陷入 局部 最 优等 问题 , 同时 随着 网络 层 数 的 增加 , 局部 最优 的 情况 越来越 严重 [ 26 ] 。 为了 克服 这 一 问题 , Hinton 提出 一 种 贪婪 逐 层 预 训练 方法 [ 4 ] : 首先 逐 层 构建 单层 神经元 , 并 每 次 训练 一 个 单层 网络 , 然后 在 所有 层 都 训练 完成 后 采用 wake-sleep 算法 [ 52 ] 进行 调 优 , 该 方法 通过 在 非 监督 数据 上 建立 多 层 神经 网络 的 方法 有效 克服 了 训练 过程 中 梯度 下降 法 的 局部 最 小 值 和 梯度 不 稳定 的 缺点 。
Hinton 提出 的 贪婪 逐 层 预 训练 方法 在 训练 过程 中 加入 无 监督 学习 作为 预 训练 , 这 是 目前 深度 学习 模型 的 训练 过程 与 人工 神经 网络 训练 的 主要 区别 。 总结 起来 , 深度 学习 训练 过程 大致 可以 分 以下 两 步 :
1 ) 自下而上 的 非 监督 学习 : 采用 无 标签 数据 从 底层 开始 逐层 向上 分层 训练 各 层 参数 , 具体 来 说 就 是 先 采用 无 标签 数据 训练 第一 层 , 训练 时 先 学习 第一 层 的 参数 , 然后 将 第一 层 的 输出 作为 第二 层 的 输入 , 依次 类推 , 直 至 训练 到 最 顶层 , 由此 得到 各 层 的 参数 , 由于 模型 容量 限制 以及 稀疏 性 约束 , 使得 得到 的 模型 能够 学习 到 数据 本身 的 结构 , 从而 更 具 表示 能力 的 特征 , 这个 过程 可以 看作 是 一 个 无 监督 训练 过程 , 是 与 传统 神经 网络 区别 最 大 的 部分 ;
2 ) 自上而下 的 监督 学习 : 在 第一 步 学习 各 层 参数 的 基础 上 , 在 网络 的 最 顶层 添加 一 个 分类 器 , 通过 带 标签 的 数据 训练 , 使 误差 自 上 向 下 传输 , 从而 对 网络 进行 调 优 , 然后 再 利用 第一 步 中 得到 的 各 层 参数 进一步 微调 整个 多 层 模型 的 参数 , 这 一 过程 可以 看成 是 一 个 有 监督 训练 的 过程 。
2 深度 学习 在 医学 图像 识别 中 的 应用
深度 学习 广泛 应用 于 医学 图像 识别 中 , 通过 在 给定 的 数据 集上 训练 模型 来 完成 新 数据 上 的 特定 任务 , 而 在 传统 的 医学 图像 识别 方法 是 : 基于 多 特征 融合 方法 、 基于 奇异 值 分解 和 小 波 变换 方法 , 对于 特征 的 提取 效率 低 且 挖掘 到 的 信息 有限 , 识别 效果 不 理想 。 相比 传统 的 医学 图像 识别 方法 , 深度 学习 能够 挖掘 到 医学 图像 中 潜在 的 非线性 关系 , 特征 提取 效率 更 高 。 近年 来 , 已 有 不少 的 研究 人员 将 深度 学习 应用 在 医学 图像 识别 中 , 这些 工作 为 进一步 的 临床 应用 研究 提供 了 重要 的 依据 。 疾病 检测 与 分类 是 针对 一 批 样本 人群 进行 的 , 以 确定 某个 样本 是否 患病 或者 其 患病 程度 如何 ; 而 病变 识别 一般 是 针对 某个 样本 自身 医学 图像 中 某个 病变 部位 和 其他 部分 的 识别 。 目前 深度 学习 方法 在 医学 图像 领域 的 上述 两 方面 中 被 广泛 应用 , 具体 研究 成果 见 表 1 , 同时 深度 学习 在 图像 配 准 、 分割 等 图像 预 处理 过程 中 也 得到 了 广泛 应用 , 由于 篇幅 有限 对 此 部分 不 做 综述 。 因此 本 节 主要 从 疾病 检测 与 分类 和 病变 识别 两 个 方面 来 介绍 深度 学习 在 医学 图像 识别 中 的 研究 进展 。
表 1 近年 来 深度 学习 在 疾病 检测 与 分类 和 病变 识别 中 的 应用 Tab . 1 In recent years , the application of deep learning in disease detection and classification and lesion recognition
2.1 疾病 检测 与 分类
医学 图像 中 包含 着 大量 的 反映 人体 健康 水平 的 信息 , 目前 这 部分 数据 主要 依靠 人工 进行 分析 , 易 受 主观 因素 的 干扰 且 效率 不 高 , 容易 造成 数据 资源 的 浪费 。 深度 学习 通过 多 层 非线性 变化 , 从 海量 数据 中 自动 提取 抽象 特征 , 既 消除 了 主观 因素 的 影响 又 能 提取 到 更加 高级 的 抽象 特征 。
深度 学习 在 阿尔茨海默病 ( alzheimer disease , AD ) 和 轻度 认知 障碍 ( mild cognitive impairment , MCI ) 中 有 大量 的 研究 。 Sarraf 等 使用 CNN 分类 患有 AD 病 的 大脑 和 正常 大脑 , 该 模型 对 患有 AD 病 的 大脑 和 正常 大脑 的 分类 准确率 高达 96.85% [ 53 ] , 该 模型 还 能够 扩展 到 更加 复杂 的 分类 任务 ; Li 等 将 RBM 作为 基本 单元 构建 深度 学习 模型 , 并 用于 从 MRI 和 PET 扫描 图像 中 分类 AD / MCI 患者 , 该 模型 分类 准确率 平均 提高 5.9% [ 54 ] 。
在 实际 的 应用 中 基于 深度 学习 的 计算机 辅助 诊断 将 医学 图像 中 与 疾病 诊断 相关 的 特征 提取 出来 , 结合 临床 知识 在 很 大 程度 上 减少 医生 的 工作量 , 得到 十分 精确 的 诊断 或 分类 结果 。 Enlitic 公司 开发 出 基于 CNN 的 恶性 肿瘤 检测 系统 [ 55 ] , 对 放射师 检查 过 的 大量 医学 图像 数据 进行 学习 , 自动 总结 出 代表 恶性 肿瘤 形状 的 “ 特征 ” , 从而 识别 图像 中 是否 存在 恶性 肿瘤 , 该 系统 识别 肝癌 的 精度 是 放射师 检查 精度 的 5 倍 。 Sirinukunwattana 使用 空间 约束 卷 积 神经 网络 ( spatially constrained convolutional neural network , SC - CNN ) 来 检测 和 分类 大肠 腺 癌 细胞 [ 56 ] , 在 分类 问题 上 使用 邻近 集成 预测 ( neighboring ensemble predictor , NEP ) 方法 , 该 方法 相对 基于 经典 特征 分类 的 方法 有 更 好 的 分类 效果 ; Dou 使用 3D CNN 从 MR 图像 中 自动 检测 脑 微 出血 ( cerebral microbleeds , CMBs ) [ 57 ] , 该 方法 从 MRI 图像 中 提取 更 具 代表性 的 高级 特征 , 相对 手工 提取 特征 和 2D CNN 提取 特征 , 3D CNN 检测 精度 高达 93.16% 。
相对于 数字 图像 和 灰度 图像 来说 , 医学 图像 不 易 获得 且 数据 量 少 , 这 是 深度 学习 应用 在 医学 图像 领域 的 一 个 共性 问题 。 数据 的 缺少 易 造成 过 拟 合 问题 , 进而 导致 检测 和 分类 结果 不 理想 , 当前 有 不少 研究者 在 这 方面 做 了 很多 方面 的 探索 : 如 Shin 将 深度 学习 应用 于 CT 图像 中 腹部 淋巴结 ( 三维 图像 ) 的 检测 和 间质性 肺病 的 分类 ( 二 维 图像 ) [ 58 ] , 他 通过 transfer learning 方法 [ 59 ] 增加 数据 量 , 这 项 研究 表明 , transfer learning 能 减少 因 数据 的 缺乏 而 带来 的 影响 , 有助于 提高 分类 的 准确率 ; Roth 针对 CNN 训练 过程 中 数据 不足 , 通过 data augmentation 方法 [ 60 ] 扩充 训练 样本 和 测试 样本 的 数据 量 , 该 模型 对 硬化 转移 检测 的 准确率 提高 了 13% , 淋巴结 检测 的 准确率 提高 了 27% , 结肠 息肉 检测 的 准确率 提高 了 17% [ 61 ] ; 数据 的 缺少 不仅 容易 出现 过 拟 合 问题 , 而且 容易 导致 模型 在 测试 数据 上 的 泛 化 能力 难以 得到 保证 。 Srivastava 等 提出 dropout 技术 [ 62 ] , 通过 在 训练 过程 中 随机 剔除 神经元 来 避免 出现 过 拟 合 问题 从而 提高 模型 的 泛 化 能力 ; Wan 在 dropout 思想 的 基础 上 提出 dropconnect 方法 [ 63 ] 。 Setio 使用 包含 多 个 2D 卷 积 神经 网络 的 多 视图 卷积 网络 ( multi - view convolutional networks , MVCN ) 检测 肺结节 疾病 [ 64 ] , 采用 data augmentation 和 dropout 方法 避免 出现 过 拟 合 问题 , 准确率 高达 90.1% 。 Li 等 使用 CNN 模型 来 分类 间 质 性 肺病 [ 65 ] , 该 模型 采用 dropout 方法 和 单 卷 积 层 结构 来 避免 出现 过 拟 合 问题 。
2 . 2 病变 识别
病变 识别 是 深度 学习 方法 在 医学 图像 中 的 重要 应用 之一 , 传统 的 病变 识别 如 小 波 变换 方法 等 对 病变 识别 的 准确率 不 高 , 将 深度 学习 应用 于 病变 识别 具有 独特 的 优点 : 深度 学习 模型 能够 更 快 地 处理 数据 , 通过 深度 学习 模型 预测 异常 病变 可以 降低 病变 的 机率 , 同时 可 提高 医生 诊断 的 准确率 和 效率 。
相比 普通 的 图像 识别 , 医学 图像 识别 问题 更加 复杂 , 对 某些 复杂 的 医学 图像 识别 问题 , 可以 通过 构造 更加 深层 、 更加 复杂 的 深度 学习 模型 来 解决 。 Chakdar 使用 DBN 进行 基于 子宫 抹片 识别 低 级别 麟 状 上皮 内 的 病变 ( low grade squamous intraepithelial lesion , LGSIL ) , 该 方法 将 DBN 提取 出来 的 特征 和 原始 特征 共同 作用 于 SVM 模型 使得 分类 准确率 达到 100% [ 66 ] ; Kondo 利用 主 成分 回归 分析 算法 结合 深层 GMDH 型 神经 网络 来 识别 医学 图像 中 的 左右 肾 区 的 病变 [ 67 ] , 该 模型 通过 自动 适应 网络 中 的 结构 参数 来 提高 识别 的 准确率 ; Gao 使用 CNN 和 SVM 构建 一 个 自动 学习 特征 的 系统 , 并 用于 识别 图像 中 核 性 白内障 的 病变 , 该 模型 的 准确率 提高 了 5.6% [ 68 ] ; Yan 等 设计 了 一 个 多 阶段 深度 学习 框架 并 用于 身体 部位 病变 识别 , 在 训练 阶段 , 通过 CNN 来 提取 最 具 差异性 的 特征 和 从 训练 切片 中 提取 局部 信息 ; 在 增强 阶段 , 经过 预 训练 的 CNN 进一步 增强 图像 的 局部 信息 , 相对 基于 全局 图像 上下文 的 方法 , 局部 方法 鲁棒 性 更 好 , 准确率 高 达 92.23% [ 69 ] 。
目前 也 有 不少 研究 者 根据 某些 病理 特征 来 进行 病变 识别 。 Plis [ 70 ] 根据 头颅 CT 或 MRI 图像 中 的 尾 状 核 萎缩 程度 与 疾病 的 严重 程度 有关 , 将 DBN 应用 于 大脑 结构 和 功能 磁共振 成像 来 识别 Huntington 病变 , 实验 结果 表明 , 深度 学习 方法 能够 学习 重要 的 生理 特征 从而 提高 Huntington 病变 的 识别 ; Brosch 使用 三 个 DBN 对 大脑 形态 变化 建立 模型 , 该 模型 能够 自动 捕捉 到 脑 形态 和 脑 白质 的 病变 情况 , 从而 对 脑白质 进行 病变 识别 [ 71 ] ; Xu 使用 堆栈 稀疏 自动 编码 器 ( stacked sparse autoencoder , SAE ) 来 识别 乳腺癌 组织 病理学 图像 上 的 细胞核 , 通过 去 噪 自动 编码 器 ( denoising autoencoder , DA ) 来 提高 噪声 的 鲁棒 性 , 准确率 高达 88.84% [ 72 ] 。
此外 , 有 研究者 通过 借助 医学 图像 中 的 识别 对象 物 的 技术 来 进行 病变 识别 , 如 Kooi 将 CNN 用于 乳腺 恶性 病变 识别 , 该 方法 在 低 灵敏度 下 识别 结果 比 传统 的 计算机 辅助 方法 更 优 , 在 高 灵敏度 下 准确率 更 高 [ 73 ] ; Cruz - Roa 将 自 编码 神经 网络 用于 识别 图像 中 的 肿瘤 细胞 , 该 模型 增加 两 个 有助于 区分 癌 组织 和 正常 组织 的 可 判断层 , 相比 传统 方法 , 该 方法 的 准确率 提高 了 7% [ 74 ] 。
深度 学习 应用 在 医学 图像 领域 中 训练 时间 普遍 过 长 , 对 硬件 要求 高 , 模型 可 移植 性 差 , 这 是 深度 学习 应用 在 医学 图像 领域 的 另 一 个 共性 问题 。 有 研究者 通过 改进 基本 的 深度 学习 模型 , 可以 减少 训练 时间 , van 针对 训练 过程 中 时间 过 长 提出 一 种 改进 的 CNN , 用于 检测 彩色 眼底 图像 出血 病变 , 在 每 个 训练 过程 中 从 训练 数据 里 随机 选择 样本 进行 训练 , 迭 代 次数 从 170 次 减少 到 60 次 , 从而 大大 减少 训练 时间 [ 75 ] 。
3 结论
机器 学习 方法 广泛 地 应用 于 医学 图像 识别 中 , 通过 在 给定 的 数据集 上 的 训练 模型 来 完成 新 数据 上 的 特定 任务 。 然而 , 一 方面 传统 的 机器 学习 算法 常常 需要 利用 先验 知识 从 原始 数据 中 人工 提取 特征 来 训练 模型 , 此 方法 难以 提取 到 复杂 特征 , 而且 由于 特征 选取 难度 大 , 可能 出现 过 拟 合 问题 , 模型 的 泛 化 能力 难以 得到 保证 ; 另 一 方面 , 随着 医学 图像 产出 量 的 增大 , 传统 方法 难以 适应 大 规模 的 数据 集 , 模型 可 移植 能力 差 。 深度 学习 作为 机器 学习 的 新兴 领域 , 在 图像 处理 和 计算机 视觉 方面 的 成功 为 医学 图像 的 识别 提供 了 新 的 思路 。 尽管 当前 深度 学习 在 医学 图像 识别 中 已 取得 一定 经验性 的 研究 成果 , 但 就 总体 而 言 , 深度 学习 在 医学 图像 识别 中 的 应用 还 处于 起步 阶段 , 未来 还 有 许多 的 问题 需要 深入 研究 :
1 ) 在 计算机 视觉 领域 通过 利用 大量 训练 数据 取得 了 突破性 研究 进展 , 如 2015 年 何凯明 设计 一 个 具有 152 层 的 Res Net 模型 将 错误 率 刷新 到 3.6% , 该 模型 在 Image Net2 012 分类 数据集 上 训练 了 128万 张 图像 [ 18 - 19 ] 。 但 在 医学 图像 中 由于 数据 的 采集 和 疾病 罕见 等 原因 使得 大 规模 医学 图像 数据 的 获取 异常 困难 , 可以 借助 图像 处理 中 的 迁移 学习 ( transfer learning ) 和 微调 ( fine tuning ) 来 有效 解决 这 方面 的 问题 , 但 最 好 的 解决 方法 还是 应该 建立 更 多 公共 可 用 的 医学 图像 数据 集 , 通过 在 公共 数据 集 上 提取 更为 抽象 的 特征 , 从而 实现 在 医学 图像 识别 上 取得 突破性 的 研究 进展 。 [ 80 - 81 ]
2 ) 深度 学习 本质 上 是 模拟 人脑 进行 自动 学习 , 从 这 一 角度 来 看 , 深度 学习 是 一 种 数据 驱动 型 模型 , 但 当前 深度 学习 对 无 监督 数据 的 学习 能力 严重 不足 , 目前 无 监督 学习 算法 主要 面临 两 个 方面 的 困难 : 一 方面 是 高维 数据 通常 具有 数据 维度 高 、 数据量 大 等 特性 , 在 高维 空间 中 进行 相似 度量 会 遇到 低维 空间 中 不 曾 遇到 的 问题 , 而 相似性 度量 是 无 监督 学习 方法 的 一 个 重要 指标 ; 另 一 方面 是 数据 噪声 和 不 完全 数据 会 影响 分析 过程 , 使得 通过 无 监督 学习 方法 所 发现 的 模式 准确性 差 。 在 未来 可以 致力于 探索 新 的 无 监督 学习 算法 , 诸如 为了 提高 可 操作性 , 无 监督 学习 算法 应该 具有 交互 能力 , 可 交互 的 无 监督 学习 算法 的 研究 是 一 个 重要 的 方向 ; 为了 更 好 地 研究 疾病 , 基于 医学 图像 独特 的 复杂性 、 丰富性 、 重要性 , 需要 针对 这 方面 的 无 监督 学习 方法 进行 深入 研究 , 如 针对 癌 细胞 、 大脑 疾病 的 无 监督 学习 。
另外 , 不同 医院 采集 数据 的 设备 之间 的 异同 使得 采集 到 的 图像 质量 有所 差异 , 采集 到 的 不同 图像 会 影响 特征 的 提取 并 对 最终 的 结果 起 着 决定性 作用 , 为此 开发 出 一 种 新颖 的 算法 , 有效 克服 不同 设备 获取 的 图像 差异 带来 的 影响 , 这 也 是 未来 的 一 个 重要 的 研究 方向 。
