详细信息:
本项目主要提供一种基于质谱技术实现对未知序列的鉴定的方法。旨在解决当前数据库中不存在的蛋白序列或序列不公开的蛋白序列、测序过程中低峰度肽段信息丢失、以及对一级谱和二级谱的质量偏差和碎片离子数量有较高要求的问题,将此方法具体应用于抗体序列的鉴定,可用于药物研发、抗体研发、个体化诊疗等领域。
抗体是一种大分子量的免疫球蛋白(约150kDa),一个抗体可以根据肽链长度和肽链组成的可变性分为4个主要区域:轻链恒定区(CL)、轻链可变区(VL)、重链恒定区(CH)、重链可变区(VH)。由于恒定区氨基酸序列组成相对稳定,在Swiss-prot蛋白序列数据库中存在这部分序列,且数据库搜索方法较从头测序准确度更高,于是使用数据库搜索能够对这部分区域进行鉴定。然而可变区中的CDR区高度可变,蛋白质序列数据库中通常不包含这部分序列,不适宜用数据库搜索的方法。从头测序方法由于不依赖于序列数据库,能够对可变区的序列完成鉴定。但是从头测序方法准确度较低,测序结果中包含的许多歧义肽段需要可靠的信息优选出可信的肽段序列。将恒定区序列用于抗体数据库进行同源搜索可以获得多条同源的重链和轻链序列,对这些同源序列的可变区统计各位点氨基酸组成可以获得可变区的氨基酸频率分布表,基于此频率表能够对歧义肽段进行鉴别,优选出最可信的候选可变区序列。