转录组 测 序 技术 的 研究 和 应用 进展
崔凯 吴伟伟 刁其玉
中国 农业 科学院 饲料 研究所 农业部 生物 饲料 重点 实验室 新疆 畜牧 科学院 畜牧 研究所
生物 技术 通报 2019 ( 07 )

摘要 ： 转录 组 ( Transcriptome ) 是 指 特定 细胞 或 组织 中 全部 转录 产物 , 包括 信使 RNA , 核糖 体 RNA 、 转运 RNA 以及 非 编码 RNA 。 高 通 量 测 序 技术 的 快速 发展 , 为 从 整体 水平 系统 地 研究 转录 组 学 研究 提供 快捷 可靠 的 平台 。 综述 了 当前 主流 的 高 通 量 测 序 技术 及其 在 转录 组 学 研究 中 的 应用 , 并 讨论 了 转录 组 数据 分析 中 一些 值得 关注 的 问题 , 以及 转录 组 测 序 技术 在 生物学 研究 中 的 应用 方向 。
基金 ： 国家 自然 科学 青年 科学 基金 项目 ( 31802088 )
关键 词 ： 转录组 ; RNA - seq ; 二 代 测 序 ; 三 代 测 序 ; 单细胞 转录组
作者 简介 ： 崔凯 , 男 , 副研究员 , 研究 方向 : 分子 营养 与 表观 遗传学 , E-mail : cuikai @ caas .cn ; * 刁其玉 , 男 , 研究员 , 博士生 导师 , 研究 方向 : 反刍 动物 营养 , E-mail : diaoqiyu @ caas.cn ;
收 稿 日期 ： 2019-04-28

转录 组 学 是 从 整体 转录 水平 系统 研究 基因 转录 图谱 并 揭示 复杂 生物学 通路 和 性状 调控 网络 分子 机制 的 学科 。 在 高 通 量 测 序 技术 发展 以前 ， 基于 cDNA 杂交 荧光 检测 的 高 通 量 基因 表达 芯片 （ Expression array ） 和 基因 表达 系列 分析 技术 （ Serial analysis of gene expression , SAGE ） 是 从 整体 水平 研究 动植物 组织 中 基因 表达 信息 的 主要 手段 。
在 2008 年前 后 ， 高 通 量 测 序 技术 开始 应用 于 细胞 和 组织 中 转录 本 （ 主要 是 m RNA ） 的 种类 和 表达 量 的 研究 ， 转录 组 测 序 （ RNA sequencing , RNA - seq ） 这样 的 名词 开始 出现 并 被 广泛 应用 [ 1 ] 。 与 基因 表达 芯片 方法 不同 ， RNA - Seq 不仅 能够 检测 与 现有 基因 组 序列 相 对应 的 转录 本 ， 并 能 发现 和 定量 新 的 转录 本 ， 对 选择性 剪接 事件 、 新 基因 和 转录 本 以及 融合 转录 本 的 研究 更 具 优势 ， 从而 能 更加 系统 地 研究 转录 组 学 。 2010 年 前后 ， 三 代 测 序 技术 （ 单 分子 测 序 技术 ） 兴起 ， 因 其 具有 测 序 读 长 较 长 的 优点 ， 在 研究 全长 转录本 上 具有 二 代 测 序 短 reads 所 不 能 达到 的 优势 。
随着 测 序 技术 的 发展 和 成本 的 降低 ， 使得 核酸 的 检测 与 定量 更加 便捷 和 准确 ， 高 通 量 测 序 在 转录 组 学 的 研究 上 越来越 普遍 ， 大 有 替代 基因 表达 芯片 的 趋势 。 运用 现有 的 转录 组 研究 手段 系统 、 准确 地 探究 从 DNA 向 RNA 转录 这 一 复杂 而 精细 的 调控 层次 ， 是 揭示 生物学 过程 中 的 复杂 性状 和 解析 转录 调控 网络 的 重要 方面 。
1 高 通 量 测 序 平台
1.1 二 代 测 序 平台
20 世纪 70 年代 ， 第一 代 测 序 技术 （ Sanger 双 脱氧 测 序 技术 ） 的 出现 ， 实现 了 对 核酸 序列 进行 测 序 。 但 Sanger 测 序 法 的 通 量 较 低 ， 不 能 满足 大批量 测 序 的 要求 ， 难以 应用 在 组 学 测 序 的 研究 中 。 后来 发展 的 高 通 量 测 序 （ High - throughput sequencing ） 技术 ， 即 二 代 测 序 （ Next generation sequencing , NGS ） 技术 ， 实现 了 测 序 的 高 通 量 和 自动化 ， 加速 了 转录 组 学 研究 的 快速 发展 。 目前 ， 二 代 测 序 平台 主要 包括 454Life Sciences 公司 推出 的 454 测 序 技术 、 Illumina 公司 和 ABI 公司 相继 推出 的 Solexa 和 SOLID 测 序 技术 等 ， 其中 454 测 序 技术 平台 最 早 实现 商业化 。 在 过去 10 年间 ， Illumina 公司 的 Solexa 技术 ， 即 边 合成 边 测 序 （ Sequencing by synthesis , SBS ） 技术 发展 迅速 ， 其 HiSeq 系列 的 测 序 平台 逐渐 成为 二 代 测 序 技术 中 最 被 广泛 应用 的 平台 。 Illumina / Solexa 的 测 序 平台 主要 是 采用 边 合成 边 测 序 （ SBS ） 的 方法 ， 此 种 方法 是 将 提取 的 核酸 片段 打断 到 几百 bp 大小 后 ， 加上 接头 和 测 序 引 物 等 序列 ， 经 PCR 扩 增 后 建成 library ， 在 含有 接头 序列 的 芯片 （ Flow cell ） 上 对 文库 进行 反应 ， 每 个 反应 循环 中 ， 标记 4 种 荧光 染料 的 碱基 通过 互补 碱 基 配对 被 加入 到 单 分子 的 合成 中 ， 这样 通过 CCD 采集 序列 上 的 荧光 信号 ， 读取 测 序 片段 的 碱 基 序列 。 Illumina 现有 桌面式 和 生产 规模 式 两 大 类 测 序 平台 （ 表 1 ） ， 可以 满足 中 小 实验室 以及 大 规模 平台 的 二 代 测 序 需求 。
1.2 三 代 测 序 平台
三 代 测 序 技术 也 叫 单 分子 测 序 技术 （ Single molecule sequencing ） ， 具有 超 长 读 长 （ 平均 读 长 10 - 15 kb ， 最 长 读 长 可达 60 kb ） 、 无 PCR 扩 增 偏向 性 及 GC 偏好 性 的 特点 ， 被 认为 是 进行 全 基因 组 de nove 组装 、 全长 转录 本 测 序 及 表 观 遗传学 测 序 的 理想 测 序 平台 。 PacBio 公司 的 单 分子 实时 测 序 技术 （ Single molecule real time sequencing , SMRT - seq ） [ 2 ] 和 Oxford Nanopore Technologies 的 纳米 孔 单 分子 测 序 平台 [ 3 ] 是 目前 主流 的 三 代 测 序 平台 。 由于 三 代 测 序 技术 由于 在 测 序 时 没有 经过 模板 扩 增 ， 测 序 信号 的 检测 相对于 边 合成 边 测 序 的 二 代 测 序 技术 较 弱 ， 容易 在 碱 基 识别 时 产生 随机 错误 。 因而 PacBio 平台 的 设计 是 对 核酸 分子 进行 环 化 测 序 （ Circular consensus sequencing , CCS ） ， 反复 读取 reads 后 对 碱 基 序列 进行 迭 代 校正 ， 从而 有效 提高 了 单 分子 测 序 的 准确性 [ 2 ] 。 目前 ， PacBio 公司 推出 的 SequelⅡ 测序 平台 ， 长 序列 reads 的 读取 精确 得到 进一步 提升 ， 平均 读长 13.5 kb 的 长 序列 reads 的 读取 精度 可 达 99.8% [ 4 ] 。
表 1 几 种 主要 测 序 平台 特点
( https://www.illumina.com.cn/systems/sequencing-platforms.html )
2 转录 组 测 序
转录 组 测 序 （ RNA - seq ） 就 是 利用 高 通 量 测 序 技术 将 细胞 或 组织 中 全部 或 部分 m RNA 、 small RNA 和 no - codingRNA 进行 测 序 分析 的 技术 。 转录组 测 序 和 分析 一般 流程 如 图 1 所 示 。 目前 最 常见 的 转录 组 测 序 是 基于 二 代 测 序 技术 ， 以 Illumina 的 NGS 测 序 平台 为 主流 。 这 种 方法 需要 根据 实验 目的 对 RNA 样本 进行 处理 ， 将 mRNA , miRNA , lncRNA 其中 的 部分 或 全部 反 转 录成 cDNA 文库 ， 再 利用 高 通 量 测 序 平台 进行 测 序 [ 1 , 5 ] 。 通常 会 根据 测 序 对象 长度 的 不同 ， 在 测 序 建 库 的 时候 会 选择 建立 不同 大小 片段 的 文库 。 一般 地 ， 进行 mRNA 测 序 ， 建 库 时 通常 建立 几百 bp 大小 片段 的 文库 ， 选择 双向 测 序 较 多 ； 进行 miRNA 测 序 时 ， 通常 将 miRNA 进行 分离 ， 单独 建立 小 片段 文库 后 再 进行 单向 测 序 ； 而 长 链 非 编码 RNA ( long non - coding RNA , lncRNA ） 存在 正向 转录 和 反向 转录 ， 所以 常 采用 链 特异 性 建 库 测 序 。
图 1 转录 组 测 序 和 分析 流程 示意图
2.1 mRNA 测 序
对于 mRNA 测 序 ， 利用 mRNA 在 3 ' 端 具有 poly - A 的 结构 特点 ， 富 集 出 特定 组织 或 细胞 在 特定 时空 条件 下 转录 出来 的 不 含 内含 子 序列 的 m RNA 分子 ， 反 转录 成 cDNA 建 库 测 序 。 根据 测 序 得到 的 m RNA 序列 ， 可以 精确 地 比对 至 参考 基因 组 序列 上 ， 从而 判断 外显 子 与 内含 子 的 边界 。 对于 无 参考 基因 组 的 物种 ， 通过 对 序列 进行 从 头 拼接 （ de nove assembly ） ， 得到 转录 本 具体 的 序列 信息 。 通过 对 不同 物种 、 不同 发育 阶段 的 不同 组织 中 的 转录 组 进行 研究 ， 可以 发现 基因 转录 的 物种 特异 性 和 时空 差异 的 特点 ， 为 深入 理解 物种 和 性状 的 分子 机理 提供 转录 组 水平 的 线索 。
2 . 2 small RNA 测 序
Small RNA 是 指 长度 在 20 - 50 nt 的 RNA 分子 ， 包括 miRNA 、 siRNA 、 snoRNA 和 piRNA 等 ， 通过 参与 m RNA 降解 、 抑制 翻译 过程 、 促进 异 染色 质 形成 和 DNA 表 观 修饰 等 多 种 途径 来 调控 生物学 过程 。 根据 small RNA 的 5 ' 端 磷酸基 和 3 ' 端 羟基 的 结构 特点 ， 链接 测 序 接头 并 筛选 small RNA 测 序 文库 进行 测 序 。 miRNA 在 物种 间 的 生物学 功能 较为 保守 ， 是 small RNA 测 序 研究 中 的 重点 。 Hutvagner 等 [ 6 ] 通过 small RNA 测 序 鉴定 得到 miRNA let - 7 ， 通过 与 m RNA 不 完全 匹配 发挥 抑制 翻译 的 作用 。
2.3 lncRNA 测 序
长 链 非 编码 RNA ( lncRNA ） 是 一 类 长度 在 200 nt 以上 、 无 编码 蛋白质 功能 的 RNA 分子 ， 往往 具有 很 强 的 物种 、 组织 特异 性 。 部分 lncRNA 位于 基因 的 增强 子 区域 ， 通过 自身 的 转录 而 实现 增强 子 的 功能 [ 7 ] 。 lncRNA 调控 方式 多样 且 广泛 存在 于 各 类 动植物 细胞 中 ， 可以 通过 参与 染色体 结构 形成 以及 与 转录 因子 、 蛋白质 、 RNA 前 体 、 miRNA 结合 等 多 种 方式 调节 各 类 生物学 分子 的 功能 。 部分 lncRNA 含有 ploy - A 尾 结构 ， 因而 在 m RNA 的 测 序 结果 中 往往 包含 部分 lncRNA 序列 信息 。 目前 对于 lncRNA 的 研究 ， 以 寻找 差异 表达 的 lncRNA 分子 入手 ， 主要 依据 lncRNA 与 关键 编码 基因 的 位置 关系 ， 进一步 预测 两 者 之间 的 调控 关系 。
2.4 circRNA 测 序
环状 RNA ( circRNA ） 具有 特殊 的 稳定性 良好 的 成 环 结构 ， 不 容易 被 RNA 酶 降解 ， 被 认为 在 生物 体内 可以 长效 行使 转录 调控 功能 。 同 一 段 基因 组 序列 可能 会 产生 多 种 类型 的 circRNA 分子 ， 外显 子 和 内含 子 的 不同 剪切 组合 使得 circRNA 可能 包含 多 个 外显 子 或 内含 子 序列 [ 8 ] 。 circRNA 具有 吸附 miRNA 分子 的 “ 海绵 ” 作用 ， 介入 miRNA 对 m RNA 的 调控 过程 。 circRNA 对 相同 基因 组 位置 上 的 mRNA 转录 有 竞争性 抑制 作用 [ 9 ] ， 含有 外显 子 的 circRNA 还 可能 开 环 并 重新 翻译 [ 10 ] 。 由于 circRNA 在 生物 体内 稳定 地 行使 功能 ， 并 具有 组织 特异 性 表达 模式 ， 与 宿主 基因 表达 不 太 相关 ， 被 认为 在 作为 相关 疾病 的 临床 诊断 、 预防 的 分子 标志 物 以及 药物 治疗 靶 点 等 方面 具有 极 大 的 潜力 [ 11 ] 。
2. 5 全 转录 测 序
mRNA 的 转录 水平 受 lncRNA 、 small RNA 和 circRNA 的 调控 作用 影响 ， 定量 分析 某个 时空 的 细胞 或 特定 组织 中 的 生物 分子 网络 和 调控 途径 时 ， 需要 对 整个 转录 组 中 全部 的 RNA 分子 进行 定量 和 定性 的 研究 。 全 转录 组 测 序 （ Whole transcriptome sequencing ） 能够 测定 样本 中 的 全部 完整 的 转录 本 ， 主要 包括 mRNA 和 非 编码 RNA ( lncRNA , circRNA 和 miRNA ） 。 全 转录 本 测 序 与 常规 RNA - seq 的 区别 主要 是 建 库 方式 的 不同 。 全 转录 组 测 序 在 建 库 过程 中 需 分别 建立 2 个 文库 （ mRNA + lncRNA + circRNA 文库 和 miRNA 文库 ） 或 3 个 文库 （ mRNA + lncRNA 文库 、 circRNA 文库 和 miRNA 文库 ） 。 通过 全 转录 组 数据 ， 不仅 可以 获得 全部 类型 转录 本 的 表达 图谱 ， 在 此 基础 之上 ， 对 不同 RNA 分子 进行 鉴定 和 注释 ， 分析 其 编码 蛋白 和 调控 功能 ， 并 对 RNA 分子 之间 的 互 作 调控 网络 进行 分析 ， 从 整体 上 全面 系统 的 分析 特定 细胞 在 特定 时空 下 的 生物学 特征 。
2.6 单细胞 转录 组 测 序
Eberwine 等 [ 12 ] 和 Brady 等 [ 13 ] 分别 开发 了 通过 体外 转录 线性 扩 增 和 PCR 指数 扩 增 单个 细胞 的 互补 DNA ( cDNAs ） 技术 ， 这 类 技术 与 高 通 量 测 序 技术 结合 ， 衍生 出 了 单个 细胞 内 转录 本 测 序 技术 （ single cell RNA - seq , scRNA - seq ） 。 单细胞 转录 组 测 序 技术 是 在 单细胞 水平 研究 整个 转录 组 的 技术 ， 用于 评估 单个 细胞 间 基因 表达 的 差异 ， 能 避免 细胞 类型 混杂 而 引入 的 假 阴性 结果 ， 有 可能 识别 出 无法 通过 混合 细胞 检测 到 的 罕见 的 细胞 群体 。 目前 常见 的 单细胞 测 序 平台 包括 Fluidigm 、 WaferGen 、 10×Genomics 、 和 Illumina / Bio - Rad 等 测 序 平台 。 与 其他 RNA 测 序 技术 不同 ， scRNA - seq 需要 首先 分离 并 获得 单个 细胞 内 的 全部 转录 组 。 单细胞 分离 是 scRNA - seq 的 关键 步骤 ， 主要 通过 连续 稀释 、 显微 操作 分离 、 荧光 激活 细胞 分 选 （ Fluorescence - activated cell sorting , FACS ） 和 微 流 控 分离 （ Microfluidic technology ） 等 技术 实现 。 2009 年 ， Tang 等 [ 14 ] 首次 报道 利用 scRNA - seq 技术 来 鉴定 早期 发育 阶段 的 不同 类别 细胞 。
3 转录组 测 序 文库 的 构建
进行 转录 组 测 序 时 ， 提取 样本 中 总 RNA 后 ， 去除 rRNA ， 对 目标 RNA 分子 富 集 后 进行 测 序 文库 的 构建 。 测 序 文库 ， 分为 非 链 特异 性 文库 （ Non-strandspecific library ） 和 链 特异 性 文库 （ Strand-specific library ） 两 种 。 非 链 特异性 文库 是 指 ， RNA 逆转 录成 双 链 cDNA ， 随机 加上 接头 、 不 区分 RNA 的 链 的 信息 的 文库 。 测 序 时 以 双 链 cDNA 进行 测 序 ， 无法 区分 m RNA 的 转录 方向 （ 图 2 - A ） 。 链 特异 性 文库 可以 分为 2 类 ， 一 种 以 化学 修饰 标记 一 条 链 ， 比如 通过 重 硫酸盐 处理 RNA 分子 （ 图 2 - B ） ， 或者 在 第二 链 cDNA 合成 时 引入 dUTP （ 图 2 - C ） ， 然后 降解 含有 U 的 链 ； 另 一 种 是 以 不同 接头 连接 RNA 分子 或 合成 cDNA 链 的 5 ' 和 3 ' 末端 ， 来 区分 正 反义 链 （ 图 2D - H ） 。 Levin 等 [ 15 ] 对 不同 类型 的 链 特性 文库 的 复杂性 、 均匀 性 和 覆盖 连续性 进行 评价 ， 并 与 已知 基因 组 注释 和 表达 谱 的 基因 定量 进行 比较 ， 再 结合 实验 操作 和 计算 的 简便 性 ， 认为 dUTP 第二 链 标记 的 方法 和 Illumina RNA ligation 方法 效果 较 好 。
在 转录 组 测 序 时 ， 区分 RNA 分子 链 的 来源 能够 避免 基因 反义 链上 的 reads 的 干扰 ， 能够 提高 基因 转录 本 鉴定 和 转录 本 定量 的 精确性 。 利用 转录 组 数据 进行 从 头 拼接 时 ， 有助于 划分 转录 本 的 边界 ， 确定 转录 本 的 正义 链 信息 。
4 转录组 数据 处理 流程
转录 本 测 序 数据 用于 比较 不同 组别 之间 基因 水平 或 转录 本 水平 的 定量 差异 时 ， 其 分析 基本 流程 包括 原始 数据 预 处理 、 reads 比对 、 转录 本 组装 、 新 转录 本 预测 、 转录 本 表达 水平 分析 等 步骤 。 后续 根据 实验 的 目的 ， 可 进一步 分析 实验 组 与 对照 组 之间 的 转录 本 表达 差异 情况 ， 样本 之间 基因 表达 模式 聚 类 ， 以及 和 其它 组 学 数据 进行 联合 分析 等 。 其中 ， 转录本 组装 是 根据 read 比对 的 结果 来 识别 样本 中 所有 表达 的 转录本 。 如果 没有 可 用 的 参考 基因 组 序列 ， 则 可以 直接 使用 从 头 组装 方法 执行 此 过程 。 一旦 确定 了 所有 转录 本 ， 就 可以 根据 比对 至 转录 本 序列 上 的 reads 数目 估计 基因 的 表达 丰 度 ， 进而 在 分组 样本 之间 计算 差异 表达 转录 本 并 分析 转录 本 表达 情况 与 分组 设计 之间 的 生物学 关联 。
4.1 原始 数据 预 处理
获得 的 二 代 测 序 原始 数据 后 ， 需要 对 数据 质量 进行 评估 并 进行 质量 控制 （ Quality control , QC ） ， 评估 内容 包括 数据 产出 量 、 GC 含量 、 rRNA 含量 、 碱基 质量 分布 和 重复 序列 等 。 将 其中 低质量 的 reads 和 接头 序列 等 去除 ， 得到 质控 后 的 clean data 用 于 后续 分析 。 常用 的 质控 软件 有 Trimmomatic [ 16 ] 、 RSeQC [ 17 ] 、 FASTX ( http ： / /hannonlab.cshl.edu/fastx＿toolkit / ） 、 Trim Galore ( https ： / /www.bioinformatics.babraham.ac.uk / projects / trim ＿ galore / ） 等 。 以 常用 的 Trimmomatic 软件 为 例 ， 对于 双 段 测 序 的 Illumina 格式 的 rawdata ， 其 默认 处理 参数 为 “ ILLUMINACLIP : TruSeq3 - PE . fa : 2 : 30 : 10 LEADING : 3 TRAILING : 3 SLIDINGWINDOW : 4 : 15 MINLEN : 36 ” , ILLUMINACLIP : TruSeq3 - PE . fa : 2 : 30 : 10 含义 是 根据 TruSeq3 - PE . fa 文件 中 的 测 序 接头 序列 信息 过滤 原始 数据 中 的 测 序 接头 和 引 物 序列 ， 允许 最 大 错 配 碱 基数 为 2 , plindrome clip 阈 值 为 30 , simple clip 阈 值 为 10 ， 根据 这 三 个 值 的 设定 来 判断 接头 序列 与 read 的 比对 程度 ； LEADING : 3 ， 从 序列 开头 去除 碱基 质量 低于 3 的 碱 基 ； TRAILING : 3 ， 从 序列 结尾 去除 碱 基 质量 低于 3 的 碱 基 ； SLIDINGWINDOW : 4 : 15 ， 设置 4 bp 窗口 ， 碱 基 平均 质量 值 阈 值 为 15 ; MINLEN : 36 ， 若 质控 后 read 长度 小于 36 bp 则 丢弃 此 条 read 。 QC 后 得到 的 数据 称为 clean data ， 用于 后续 的 数据 分析 。
图 2 几 种 类型 文库 的 构建 流程 示意图
A : 非 链 特异 性 文库 ; B - C : 标记 链 的 链 特异 性 文库 ; D - H : 基于 不同 接头 的 链 特异 性 文库 。 B : 重 硫酸盐 处理 , C : dUTP 第二 链 合成 文库 ; D : RNA ligation ( with cleanup ) 文库 ; E : Illumina RNA ligation ( without cleanup ) 文库 ; F : SMART ( Switching mechanism at 5 ' end of RNA template ) 文库 ; G : SMART - RNA ligation 文库 ; H : NNSR ( Not not so random priming ) 文库 。 灰色 代表 mRNA , 红色 为 3 ' 接头 , 蓝色 为 5 ' 接头 。 B- H 整理 自 文献 [ 15 ]
4.2 reads 比 对
转录组 数据 主要 来自 基因组 的 外显 子序列 ， 将 测序 获得 的 转录组 reads 比对 至 基因组 序列 上 ， 会 被 内含 子序列 隔断 。 应用 于 转录 组 数据 的 比对 软件 ， 常用 的 有 bowtie [ 18 ] ， bowtie2 [ 19 ] ， STAR [ 20 ] ， HISAT / HISAT2 [ 21 ] 等 。 这 类 软件 适用 于 转录组 reads 的 分割 并 比对 至 参考 基因组 序列 。 BWA [ 22 ] 软件 的 比对 算法 被 认为 对于 分割 比对 不 敏感 ， 因而 不 适合 用于 RNA 序列 与 含有 内含 子 序列 的 基因 组 序列 之间 的 比对 。
4.3 转录本 组装
转录本 组装 就 是 将 测 序 数据 组装 成 转录本 。 对于 有 参考 基因 组 的 物种 ， 根据 转录 组 比对 后 的 结果 ， 明确 外显 子 之间 的 连接 方式 ， 从而 构建 出 转录 本 的 结构 。 常用 工具 包括 Cufflinks [ 23 ] 和 Scripture [ 24 ] 。 对于 无 参考 基因 组 序列 的 转录 组 数据 ， 为了 获得 完整 的 转录 本 序列 ， 需要 对 RNA 测 序 得到 的 短 reads 进行 从 头 组装 。 对于 无 参 物种 进行 转录 组 研究 ， 往往 需要 较 多 的 测 序 数据 量 来 满足 进行 从 头 组装 的 要求 。 用于 组装 的 有效 数据量 越 大 ， 拼接 得到 的 转录 本 数量 和 完整性 越 好 ， 也 更 容易 检测 到 表达 量 较 低 的 转录 本 。 常 用 工具 包括 Trinity [ 25 ] 、 TransAbySS [ 26 ] 和 Velvet [ 27 ] 等 。 以 Trinity 组装 小鼠 的 转录组 数据 时 ， 为了 保证 组装 效果 ， 至少 需要 30× 以上 覆盖度 的 测 序 reads [ 28 ] 。
4.4 转录本 预测
大多数 基因 有 多 种 剪接 形式 ， 且 有 可能 产生 多 种 转录 本 ， 从而 编码 产生 不同 的 蛋白 ， 这样 有 可能 造成 一 个 基因 有 多 种 功能 。 对 转录 本 测 序 数据 进行 拼接 和 组装 后 ， 不仅 会 得到 已知 的 转录 本 信息 ， 也 会 得到 新 的 转录 本 序列 ， 需要 对 新 的 转录 本 进行 鉴定 和 注释 ， 特别 是 之前 研究 较 少 的 新 的 ncRNA 转录 本 。
对于 有 参考 基因 组 和 转录 本 参考 信息 的 物种 ， 转录 本 结构 主要 是 根据 测 序 得到 reads 进行 比对 ， reads 覆盖 了 全部 的 转录 本 序列 ， 依靠 基因 组 序列 组装 出 完整 的 转录 本 信息 。 对于 无 参考 基因 组 的 物种 ， 需要 自行 组装 出 基因 的 转录 本 序列 。 得到 的 基因 或 转录 本 序列 可以 与 同 物种 或 近 源 物种 的 unigene 和 EST 数据库 进行 比较 ， 以 判断 得到 的 基因 或 转录 本 序列 的 可靠性 。 这 一 过程 中 常用 blast 方法 进行 比对 ， 快速 鉴定 序列 之间 的 相似 度 。 在 新 的 lncRNA 的 鉴定 分析 中 ， 一般 是 根据 lncRNA 分子 特性 ， 在 转录 组 数据 中 提取 外显 子 总长 > 200 nt 的 转录 本 ， 然后 根据 开放 阅读 框 预测 和 与 已知 的 蛋白 数据库 进行 比较 ， 从而 进一步 将 lncRNA 从 mRNA 中 分离 出来 。
4 . 5 转录 本 表达 水平 分析
将 reads 比对到 相应 的 基因 组 位置 或 从 头组 装出 转录本 后 ， 得到 每 个 基因 或 转录本 上 的 reads 数 在 一定 程度 上 可以 反映 其 表达 丰度 。 由于 样本 间 的 数据 总 产出 量 、 样本 间 基因 表达 数目 、 样本 内 不同 基因 长度 甚至 是 同 一 个 基因 内部 不同 转录 本 分布 都 可能 存在 明显 差异 ， 在 不同 样本 之间 对于 同 一 个 基因 或 转录 本 的 表达 量 进行 比较 时 ， 则 需要 对于 样本 间 的 数据 进行 归 一 化 处理 [ 29 ] 。 处理 后 的 转录 本 表达量 一般 以 RPKM ( Reads per kilobase per million mapped reads ） 、 FPKM ( Fragments per kilobase per million mapped reads ） 或 TPM ( Transcripts per million ） 这 3 类 数值 表示 。 RPKM 针对 早期 的 SE 测 序 ， FPKM 则 是 在 PE 测 序 上 对 RPKM 的 校正 ， 且 应用 于 双 段 测 序 的 RNA - seq 分析 中 。 对于 单 端 测 序 结果 ， 基因 的 RPKM 与 FPKM 值 相等 。 TPM 以 转录 本 条 数 代表 每 个 转录 本 的 表达量 ， 当 样本 之间 表达 的 基因 综述 差异 很 大 的 时候 ， TPM 值 比 FPKM 值 更 能 代表 转录本 的 表达量 。 Cufflinks [ 30 ] 、 DESeq / DESeq2 [ 31-32 ] 、 EDGR [ 33 ] 等 软件 可 用来 进行 表达量 的 确定 。 另外 在 进行 不同 样本 之间 的 基因 表达 量 比较 分析 时 ， 依据 实验 设计 利用 统计学 方法 检验 实验 组 与 对照 组 之间 的 差异 基因 。 由于 同时 对 成千上万 的 基因 进行 统计 检验 ， 因而 需要 考虑 多 重 检验 引入 的 假 阳性 升高 ， 因而 常用 FDR 等 多 重 检验 校正 的 方法 对 比较 分析 的 显著 性 进行 校正 。
scRNA - seq 中 基因 表达 量 确定 与 常规 RNA - seq 数据 处理 思路 一致 ， 但 由于 scRNA - seq 的 产出 数据 中 一般 噪音 较 大 ， 并且 有 大量 的 空 值 （ Dropouts ） ， 在 基因 表达 矩阵 中 超过 50% 的 基因 为 空 值 也 很 常见 ， 因而 需要 使用 填充 算法 进行 数据 的 修正 [ 34 - 35 ] 。 对于 scRNA - seq 空 值 的 解释 ， 除 部分 基因 本身 在 该 单个 细胞 中 不 表达 ， 还 可能 是 因为 一些 基因 表达 量 较 低 或者是 测 序 深度 不 够 ， 导致 在 实验 中 未 被 检出 [ 34 ] 。 在 数据 分析 中 ， 需要 谨慎 对待 空 值 ， 根据 细胞 - 细胞 、 基因 - 基因 之间 关系 对 空 值 进行 推断 。 推断 scRNA - seq 中 的 技术 噪声 比较 困难 ， 单个 细胞 之间 的 测 序 结果 属于 生物学 重复 而 不 能 用于 推断 技术 重复 偏差 。
4.6 变异 检测
分析 转录 组 测 序 数据 ， 可以 获得 样本 的 全部 转录本 的 序列 信息 ， 包括 转录本 上 全部 的 SNP 和 Indel 等 突变 类型 。 转录 生成 的 RNA 分子 在 翻译 之前 可能 会 经历 多 种 修饰 [ 36 ] ， 如 A - to - I 的 RNA 编辑 过程 ， 从而 进一步 增加 转录 组 的 复杂性 。 分析 转录 本 中 的 突变 信息 ， 可以 捕获 基因 从 DNA 向 RNA 转录 中 修饰 过程 ， 从而 探究 转录 过程 中 复杂 的 调控 机制 。 SAMtools [ 37 ] 、 BCFtools [ 38 ] 和 GATK [ 39 ] 等 软件 可 用来 检测 转录组 中 相关 的 变异 。
5 RNA - seq 的 应用
5.1 确定 基因 的 表达 模式
RNA - seq 技术 使得 研究 整个 转录 组 中 基因 表达 情况 更为 快速 和 容易 ， 对于 有 参考 基因 组 的 物种 或 无 参考 基因 组 的 物种 ， 采取 不同 的 分析 策略 ， 即 可 高效 地 获得 某 一 特定 状态 下 细胞 或 组织 中 的 全部 转录 本 信息 ， 进而 研究 不同 组织 器官 或 发育 阶段 之间 的 基因 表达 模式 差异 。 另外 ， 随着 转录 组 测 序 数据 的 积累 ， 从而 建立 起 各 类 转录 组 数据库 ， 这些 信息 的 积累 为 后续 进一步 研究 特定 生理 条件 下 的 转录 本 种类 和 表达 量 、 转录 本 之间 互 作 以及 转录 调控 研究 等 提供 参考 。 例如 ， 基于 RNA - seq 数据 建立 起来 的 拟 南 芥 的 基因 表达 谱 数据库 TraVA ( http ： / / travadb . org / ） ， 包含 了 79 个 样本 的 25 706 个 蛋白质 编码 基因 ， 可以 提供 不同 器官 和 发育 阶段 之间 的 基因 表达 谱 和 差异 表达 基因 的 研究 [ 40 ] 。 基于 miRNA- seq 建立 的 miRBase 数据库 收录 了 200 多 个 物种 的 数 万 条 miRNA 信息 ， 可 用于 进行 miRNA 注释 和 比较 [ 41 ] 。
5.2 用于 发现 新 转录本
基于 NGS 技术 的 转录 组 测 序 ， 通过 拼接 算法 可以 获得 完整 的 转录 本 序列 ， 但 对于 存在 多 个 可变 剪接 形式 的 基因 ， 不同 转录 本 之间 的 识别 仍然 存在 困难 。 单 分子 测 序 技术 应用 于 转录 组 测 序 ， 可以 用 测 序 读 长 较 长 的 优势 直接 获得 完整 的 转录 本 序列 ， 不 再 需要 对于 NGS 短 的 reads 进行 组装 ， 可以 准确 获得 不同 可变 剪接 的 转录 本 序列 和 表达 量 [ 42 ] 。 Wang 等 [ 43 ] 利用 Pacbio Isoform Sequence ( Iso - seq ） 平台 分析 鉴定 玉米 和 高粱 的 异 构 体 ， 发现 超过 40% 的 转录 本 具有 新颖 和 多种多样 的 剪接 方式 。
5.3 非 编码 RNA 的 调控 机制
非 编码 RNA 不 能 形成 蛋白 产物 ， 但 其 在 生物学 过程 中 发挥 着 不 可 忽略 的 重要 的 调控 功能 。 近年 来 ， 通过 NGS 技术 和 RNA - seq 在 各 种 细胞 和 组织 中 发现 了 大量 的 ncRNA ， 它们 的 类型 和 表达 量 ， 往往 反映 了 物种 特征 以及 特定 生理 状态 。 特别 在 动植物 育种 、 抗病 和 环境 适应性 的 研究 中 ， ncRNA 的 作用 越来越 受到 重视 。 在 拟南芥 中 ， 病原菌 侵 染 过程 中 可以 激发 一些 小 RNA ， 在 相应 的 通路 中 发挥 作用 ， 最终 增强 植物 抗病 性 。 Zhao 等 [ 44 ] 通过 对 拟 南 芥 进行 转录 组 的 测 序 ， 研究 lncRNA 表达 谱 ， 从 鉴定 出 的 6 510 个 lncRNA 中 进一步 分析 了 影响 开花 的 lncRNA 及其 作用 机理 。 Ré 等 [ 45 ] 通过 对 低温 环境 中 的 拟 南 芥 种子 进行 miRNA 测 序 ， 鉴定 出 低温 状态 下 独立 于 HYL1 / SE 产生 的 特定 miRNA ， 分析 其 与 低温 环境 适应性 的 联系 。
5.4 单细胞 转录组
从 单个 细胞 水平 上 进行 转录 本 研究 ， 能够 深入 分析 细胞 之间 的 异质 性 ， 从而 解析 不同 类型 细胞 的 生理 特点 。 对于 特定 组织 研究 其 功能 ， 必须 要 了解 区分 其 细胞 类型 组成 ， 不同 的 细胞 类型 可能 发挥 了 特异 的 生理 功能 。 scRNA - seq 成为 深入 研究 不同 类型 细胞 的 转录本 的 差异 以及 细胞 之间 的 组合 的 解决 方案 。 目前 已经 有 多 种 方法 能够 实现 单细胞 分离 并 进行 scRNA - seq 的 研究 并 被 大量 的 应用 在 肿瘤 细胞 的 转录 组 研究 中 [ 46 - 47 ] 。 Moffitt 等 [ 48 ] 利用 scRNA - seq 技术 对 大脑 中 的 不同 类型 细胞 进行 鉴定 ， 不仅 发现 了 之前 未知 的 神经元 亚 型 ， 结合 MERFISH 这样 的 空间 成像 技术 ， 还 允许 对 鉴定 出来 的 不同 类型 细胞 的 空间 分布 进行 研究 ， 明确 不同 的 基因 在 不同 类型 的 细胞 中 表达 差异 。
6 展望
转录 组 测 序 技术 能够 确定 信使 RNA ( mRNA ） 和 非 编码 RNAs ( ncRNA ） 序列 和 转录 基因 的 结构 ， 并 定量 的 动态 表达 每 个 转录 本 在 不同 生物学 下 的 模式 条件 。 随着 测 序 技术 的 进一步 发展 ， 为 转录组 的 定位 和 定量 的 研究 提供 了 多 种 新 的 解决 方法 。 总体来说 ， 目前 的 RNA - seq 仍然 以 基于 二 代 测 序 为主 ， 基于 三 代 测 序 技术 进行 RNA - seq 成为 转录 组 学 研究 的 一 个 重要 方向 。 目前 的 高 通 量 测 序 技术 都 需 经过 建 库 过程 ， 即 首先 将 大量 的 RNA 分子 富 集 后 ， 转化 为 cDNA 测 序 文库 ， 并 在 建 库 过程 中 对 cDNA 分子 的 片段 连接 上 测 序 引 物 接头 和 样本 标记 序列 。 应用 最 广泛 的 Illumina 二 代 测 序 平台 ， 采用 边 合成 边 测 序 的 策略 ， 对 建 库 后 的 分子 进行 双 端 测 序 或 单 端 测 序 。 PacBio 的 单 分子 实时 测 序 技术 ， 具有 读 长 较 长 的 优点 ， 能够 进行 全长 转录 组 的 研究 ， 特别 适合 用于 发现 新 转录 本 。 根据 实验 目的 和 研究 对象 ， 基于 现有 的 测 序 平台 ， 已经 可以 在 整体 水平 系统 地 开展 多 种 RNA 分子 的 研究 ， 除了 全 转录 组 和 全长 转录 本 的 研究 外 ， 单细胞 转录 组 的 研究 是 近来 的 研究 热点 。 随着 单细胞 分离 以及 单 分子 测 序 技术 的 发展 ， 单细胞 转录 组 测 序 技术 在 异质 性 细胞 的 转录 组 研究 中 具有 广阔 的 前景 。 RNA - seq 技术 的 发展 为 从 整体 转录 水平 ， 细致 精确 地 研究 转录 调控 网络 与 性状 之间 的 关系 提供 了 有效 手段 。
