术语表

48. 术语表#

接头序列#

短的合成 DNA 或 RNA 序列,在为测序做文库准备时被连接到 DNA 或 RNA 片段的末端。这些接头(adapter)对于把片段结合到流动槽(flowcell)上、并实现扩增和测序至关重要。然而,如果测序后没有把接头修剪掉,它们可能出现在 reads 中,从而干扰比对和下游分析。

算法#

用于解决问题的预定义指令集。

注释#

为原始数据添加标签,以提供背景信息并使其可解读。例如,基因注释会给基因标注功能、位置、相关蛋白等信息;细胞注释则根据类型、状态或功能对细胞进行分类。这些只是几个例子,对生物数据进行注释的方式还有很多(例如基于批次、疾病、性别等)。

AnnData#

一个用于处理带注释数据矩阵的 Python 包,常用于单细胞及其他组学分析。它提供了一种高效的方式,把数据存储为矩阵,其中行(观测)和列(特征)都可以带有相关的元数据。 AnnData 支持切片、取子集,并以 H5AD 和 Zarr 等格式保存到磁盘。

BAM#

BAM 文件是 SAM(Sequence Alignment/Map)文件的二进制压缩版本,用于存储测序 reads 到参考基因组的比对结果。它们包含的信息与 SAM 文件相同——包括读序、质量分数和比对位置——但采用更节省空间的格式,从而实现更快的处理和更低的存储需求。

扩增偏差#

在 DNA 或 RNA 扩增(如 PCR)过程中产生的一种偏差,即某些序列的复制效率高于其他序列。这可能导致原始遗传物质的呈现不均衡或不准确,进而影响测序或基因表达分析等实验的结果。

条形码#

用于识别来自同一细胞的 reads 的短 DNA 条形码片段(“tag”)。在原始数据处理步骤中,reads 之后会按其条形码进行分组。

批次效应#

实验中导致数据集分布发生偏移的技术性混杂因素。如果批次效应的来源与实验关注的结果相关,往往会导致错误的结论,因此应当加以处理(通常是将其去除)。

基准#

对若干工具就预先定义的指标所做的(独立)性能比较。

bulk RNA 测序#

与单细胞测序相反,bulk 测序测得的是若干细胞的平均表达值。因此分辨率会下降,但 bulk 测序通常更便宜、更省力,分析也更快。

细胞#

生命的基本单位,由膜包裹的细胞质构成,内含蛋白质和核酸等生物分子。细胞会获得特定功能、向不同类型转变、分裂,并相互通讯以维持机体运转。研究细胞的结构、活动和相互作用,使我们得以深入理解基因表达动态、细胞轨迹、发育谱系和疾病机制。

细胞类型注释#

为各 聚类 的细胞群按 细胞类型 进行标注的过程。通常依据细胞类型特异性标记基因,由分类器自动完成,或通过与参考数据集比对来实现。

细胞类型#

具有共同形态特征或表型特征的细胞。

细胞状态#

细胞可以根据 细胞类型 来标注,也可以根据由细胞周期、扰动状态或其他特征所定义的其他细胞状态来标注。

染色质#

DNA 与蛋白质构成的复合体,能高效地把 DNA 包装在细胞核内,并参与调控基因表达。

密码子#

由三个核苷酸组成的序列,对应于蛋白质合成中的某个特定氨基酸或起始/终止信号。密码子是遗传密码的基本单位,决定遗传信息如何被翻译成蛋白质。

CpG#

一种 DNA 序列,沿 5′ → 3′ 方向,一个胞嘧啶(C)后面紧跟一个鸟嘌呤(G),二者通过磷酸二酯键连接。CpG 位点常成簇出现,在基因启动子附近形成所谓的 CpG 岛。未甲基化的 CpG 位点与基因激活相关,而甲基化的 CpG 位点则可能导致基因抑制。

聚类#

一群彼此相似的个体或数据点的集合。在单细胞中,同一聚类的细胞通常共享某种用于注释的共同功能或标记基因表达(参见 细胞类型注释)。

互补 DNA(cDNA)#

由逆转录酶以 RNA 为模板合成的 DNA。由于 cDNA 比 RNA 更稳定,常用于 RNA-seq 文库制备,使捕获到的转录本得以扩增并测序,用于基因表达分析。

解复用#

确定每条测序 read 分别属于哪个细胞的过程,所依据的是 条形码

有向图#

有向图(directed graph,或称 digraph)是由一组节点(顶点)通过边(弧)连接而成的图,其中每条边都有一个方向,表示节点之间的单向关系。

DNA#

DNA 是脱氧核糖核酸(Deoxyribonucleic acid)的缩写。它是储存遗传信息、并为蛋白质合成提供指令的有机化学物质。DNA 会被转录为 RNA

双细胞#

基于液滴的检测所得到的 reads,可能被错误地关联到单细胞,而实际上其 RNA 表达来自两个或多个细胞(即双细胞)。

下游分析#

继原始数据初步处理之后的数据分析阶段。在 scRNA-seq 中,这包括归一化、整合、过滤、细胞类型识别、轨迹推断,以及研究表达动态等任务。

驱动基因#

在生物学过程中主动控制或“引导”细胞从一种状态转变为另一种状态的基因。与仅用于识别细胞类型的标记基因不同,驱动基因在功能上对分叉点处的命运决定起决定作用。

基因漏检#

一种低表达的基因,它在某个细胞中被观测到,但在同一 细胞类型中的其他细胞里却没有。出现 dropout(基因漏检)的原因通常是细胞中 mRNA 表达量偏低,以及 mRNA 表达本身的随机性。dropout 是 scRNA-seq 数据稀疏的原因之一。

Drop-seq#

一种 scRNA-seq 方案,把细胞分隔到纳升级的水相液滴中,从而实现大规模分析。

编辑距离#

编辑距离(通常称为 Levenshtein 距离)衡量把一个字符串转换为另一个字符串所需的最少操作次数(替换、插入、删除)。

嵌入#

一种把复杂对象(如词语、蛋白质或基因)表示为数值向量的方法,便于计算机更容易地对其进行分析。

FASTQ#

以 FASTQ 格式保存的测序 reads。FASTQ 文件以 4 行格式存储 DNA/RNA 序列及其对应的质量分数:标识符、序列、可选描述,以及以 ASCII 字符编码的质量分数。随后,FASTQ 文件会与目标参考基因组进行比对,以获得各细胞的基因计数。

流动槽#

测序平台中用于对 DNA 或 RNA 片段进行测序的耗材。它由带有泳道或通道的玻璃或聚合物表面构成,表面涂有寡核苷酸,用于捕获并锚定 DNA 或 RNA 片段。测序时,这些片段被扩增成簇,并通过检测核苷酸掺入过程中发出的荧光信号来确定其序列。流动槽(flowcell)允许数百万个片段同时测序,从而实现高通量测序。

基因表达矩阵#

一个“细胞(条形码)× 基因”(scverse 生态系统)或“基因 × 细胞(条形码)”的矩阵,在矩阵的单元格中存储计数。

汉明距离#

衡量两个等长字符串中有多少个位置不同的度量。它常用于错误检测与校正,包括对测序数据中的条形码进行校正。

插补#

用通常是人为生成的值来替换缺失值。

inDrop#

一种基于液滴(droplet)的 scRNA-seq 方案。

文库#

又称测序文库。一组带有测序接头(adapter)的 DNA 片段。

模态#

在单细胞层面测得的不同类型的生物信息,包括基因表达、染色质可及性、表面蛋白、免疫受体序列以及空间组织。结合这些模态,可以更全面地理解细胞的身份、功能和相互作用。

位点#

基因组或转录组上某个特定序列或遗传特征所在的特定位置或区域。在测序中,loci(位点)指一条 read 或片段可能的来源,例如基因、外显子或基因间区。准确识别 loci 对于比对 reads、理解数据所处的基因组或转录组背景至关重要。

信使 RNA(mRNA)#

一段从基因读取出来、用作蛋白质蓝图的核苷酸序列。

标记基因#

其表达被用作某种特定细胞类型、生物学过程或细胞状态指示标志的基因。标记基因常用于单细胞和 bulk 转录组学,依据细胞的功能或身份来识别或分类细胞。

MuData#

一个用于多模态带注释数据矩阵的 Python 包,它构建于 AnnData。它是 scverse 生态系统中用于多模态数据的核心数据结构。

Muon#

scverse 推出的、用于在 Python 中进行多模态单细胞分析的 Python 包。

负二项分布#

一种离散概率分布,描述在出现指定次数的失败之前,一系列独立同分布的伯努利试验中成功次数的分布。

PCR#

聚合酶链反应(Polymerase chain reaction,PCR)是一种扩增序列、产生数十亿个拷贝的方法。PCR 需要引物(primer)——它们是短的合成 DNA 片段,用于选择要扩增的基因组片段,随后进行多轮 DNA 合成,以扩增目标片段。

分析流程#

也常被称为工作流程(workflow)。一组预先指定、通常按顺序执行的步骤。

泊松分布#
服从泊松分布#

一种离散概率分布,描述在固定的时间或空间区间内、以已知恒定平均速率独立发生的事件,发生指定次数的概率。

主成分分析(PCA)#

一种统计方法,通过减少变量数量、同时保留数据中的主要模式来简化复杂数据集。它把高维数据投影到正交轴(主成分)上,并按各成分所解释的方差大小排序。

启动子#

蛋白质(如 RNA 聚合酶和转录因子)结合的 DNA 序列,用于启动和控制转录。

伪时间#

一个潜在的、因而无法直接观测的维度,反映细胞在状态转变过程中的进展。伪时间(pseudotime)通常与真实时间事件相关,但不一定相同。

RNA#

核糖核酸(RNA)是一种存在于所有活细胞中的单链核酸,编码并调控基因表达。与 DNA 不同,RNA 可以高度动态,既可作为信使(mRNA)携带遗传指令,也可作为结构或催化组分(rRNA、snRNA),或作为基因表达的调控者(miRNA、siRNA、lncRNA)。RNA 在转录、翻译和细胞应答中起核心作用,因此对理解基因调控、发育和疾病至关重要。

RNA velocity#

RNA velocity 通过比较单细胞 RNA 测序数据中未剪接(pre-mRNA)与已剪接(成熟)mRNA 转录本的比例,来度量基因表达的变化速率。这一比例可以揭示基因是正在被积极转录(表达上升)还是正在降解(表达下降),从而让研究者预测细胞的未来状态。这一概念利用了如下事实:pre-mRNA 信号指示新的转录,而成熟 mRNA 水平反映稳态表达,由此可以推断细胞轨迹和发育动态。

SAM#

SAM(Sequence Alignment/Map)文件是以制表符分隔的文本文件,用于存储测序比对数据,展示测序 reads 如何比对到参考基因组。SAM 文件中的每一行都包含一条 read 比对的信息,包括读序、碱基质量分数、比对位置和比对质量。

Scanpy#

scverse 推出的、用于在 Python 中进行单细胞分析的 Python 包。

scverse#

一个面向生命科学基础单细胞工具的联盟,维护着 scanpy、muon 和 scvi-tools 等计算分析工具。参见: https://scverse.org/

测序#

测序(sequencing)是解读 DNA 核苷酸排列顺序的过程。

信噪比#

衡量信号相对于背景噪声清晰程度的指标。在测序中,信号代表从被测序的 DNA 或 RNA 分子中获得的可检测信息,而噪声则包括可能掩盖或扭曲真实数据的随机误差或无用信号。高信噪比(SNR)表示相对于噪声而言信号强而可靠,数据质量更好;反之,低信噪比意味着噪声可能干扰或降低测序结果的准确性。

稀疏数据#

指绝大多数取值为零、仅在少数情况下取其他值的数据(稀疏数据与缺失数据)。 这在基因表达数据中很常见,很多基因在大多数细胞中没有表达。

稀疏矩阵#

一种用于存储 稀疏数据 的方法。它不保存所有的零,而只保存非零值及其位置,从而节省空间、加快计算;对于大多为空值的大型数据集(如基因表达数据)非常有用。

Spike-in RNA#

已知序列和数量的 RNA 转录本,用于在 RNA-seq 的 RNA 杂交步骤中校准测量。

剪接位点#

在 RNA 剪接过程中,内含子被去除、外显子被连接到成熟 RNA 转录本上的那些位置。这些连接处位于特定的核苷酸序列上,对于正确组装出有功能的 mRNA 至关重要。

轨迹推断#

又称伪时序排序(pseudotemporal ordering)。通过按相似性或其他方式对细胞排序,来在计算上还原动态过程。

唯一分子标识符(UMI)#

一种特殊的分子条形码,为样本文库中的每个分子打上唯一的标签。例如,它可用于估计 PCR 重复率(参见 扩增偏差),从而实现纠错并提高准确性。

非翻译区(UTR)#

源自 mRNA 转录本、会被转录但不会被翻译成蛋白质的一段区域。UTR 位于编码序列的两端。