Protein Language Models(PLMs)是专门针对"蛋白质"这一生物分子进行训练的深度学习模型。
简单来说,它们的工作原理与我们熟知的 ChatGPT(大型语言模型,LLM)非常相似,只不过"蛋白质"被当作了一种"语言"来理解。
1. 为什么把蛋白质看作"语言"?
在生物学中,蛋白质是由 20 种基本的氨基酸通过特定的顺序连接而成的长链。
类比:
- 人类语言:由 26 个字母组成单词,单词组成句子。
- 蛋白质语言:由 20 种氨基酸(用字母代号表示,如 M、A、S、K 等)组成"蛋白质序列"。
逻辑:蛋白质的氨基酸序列决定了它的三维结构,而结构又决定了它的功能。就像句子的语法结构决定了语义一样,氨基酸序列中隐藏着"生物学语法"。
2. PLM 是如何工作的?
这些模型通常使用大规模的蛋白质数据库(如 UniProt)进行自监督学习:
- 预训练阶段:模型通过阅读数以亿计的自然界已知的蛋白质序列,学习氨基酸之间的"上下文关系"。它会去猜测一段被遮盖的序列片段(例如:在序列中随机挖去几个字母,让模型补全)。
- 深度洞察:在训练过程中,模型会自动捕捉到哪些氨基酸经常一起出现、哪些位置对结构至关重要、哪些区域是功能位点。
3. PLM 能做什么?
PLM 的出现极大地加速了生物医药和材料科学的研发,常见的任务包括:
- 蛋白质结构预测:预测氨基酸序列折叠后的三维形状(如著名的 ESMFold)。
- 功能注释:通过序列推断这个蛋白质是干什么的(比如它是某种酶吗?它会结合特定的药物分子吗?)。
- 蛋白质设计(De Novo Design):这是最令人兴奋的领域——不再修改自然界的蛋白质,而是让 AI “从零创作"具有特定功能的全新蛋白质(例如设计能分解塑料的酶,或者能抗病毒的蛋白质药物)。
- 突变效应预测:预测如果将序列中的某个氨基酸换掉,该蛋白质的功能是会增强、减弱,还是会产生毒性。