蛋白水凝胶因其良好的应力松弛特性(材料受到应变后,内部应力逐渐下降)而有望用作三维干细胞和类器官培养的人工细胞外基质。由不同蛋白质链相互缠绕形成的结构为制备这类水凝胶的合成提供了一种有效策略。然而,如何在确保蛋白质链形成缠结的同时,精准调控结合能等特性,仍是设计此类结构面临的一大挑战。本研究提出深度学习框架 TangleDiff,用于从头设计具有可编程特性的缠结同质二聚体蛋白。TangleDiff 能够生成多样且可折叠的缠结蛋白序列,计算设计成功率超过 70%,显著高于现有模型约 1% 的成功率。研究团队将链间结合能作为生成条件,设计出结合能与预设范围高度吻合的新型蛋白质二聚体。在成功设计中,约 70% 的结合能符合预期范围。研究团队还设计了九个具有不同链间结合能的缠结同质二聚体蛋白,并对其进行了实验验证。其中七个蛋白成功被用来制备成了水凝胶,且水凝胶的应力松弛动力学与预设结合能相关。本研究为缠结蛋白设计建立了通用策略,也为开发基于蛋白质缠结的新型生物材料开辟了方向。
从分子间的缠绕出发,把水凝胶的动态力学性能交给AI设计
细胞并不是生活在一张静止不动的“支架”上,它们会持续牵拉周围的细胞外基质,而基质受力后能否逐渐释放应力,会影响细胞黏附、铺展、生长和分化。这种材料在变形后逐渐释放应力的现象称为应力松弛,能不能从蛋白质分子层面设计这种动态力学响应,是组织工程材料研究所关心的问题。
近日,香港科技大学高寒宇、孙飞团队与合作者提出深度学习框架 TangleDiff,用于从头设计彼此缠绕的蛋白质二聚体。研究进一步将这些设计蛋白引入水凝胶网络,并通过调节链间结合能,获得松弛行为不同的材料。这项工作把蛋白质结构设计与水凝胶力学性能调控连在一起,为细胞外基质仿生材料提供了新的设计思路。
相关研究以Generating protein hydrogels with customizable stress relaxation behavior via deep learning-driven entanglement design为题发表在Nature Communications 上。
为什么要设计蛋白质缠结
蛋白水凝胶常被用作组织工程、干细胞培养和类器官培养的支架。与理想弹性材料受力后迅速回弹不同,黏弹性材料会随着时间发生分子重排并逐步释放应力。细胞也会感受到这种力学差异,因此,应力松弛是设计细胞培养基质时需要考虑的重要参数。
蛋白链之间的物理缠结可以充当动态交联点:它们帮助网络维持整体连接,同时允许链段移动和重新排列。然而,天然界中可直接利用的能作为动态交联点的缠结蛋白结构有限,从头设计新的缠结蛋白也并不容易,这要求两条链各自正确折叠且彼此穿绕形成稳定的拓扑结构。研究团队希望借助生成模型学习天然缠结蛋白的序列规律,并进一步按照材料设计需求调节链间相互作用。
从天然序列中学习缠结规律
作者首先对 UniRef50 数据库中的约 7,000 万个序列簇进行两阶段筛选。第一阶段从代表序列中识别候选簇,第二阶段再对通过筛选的簇进行成员序列筛查。对于候选序列,作者使用 ESMFold 预测其同源二聚体结构,并依据 pLDDT、结构对称性和高斯链接数等指标进一步筛选。高斯链接数(GLN)用于描述两条蛋白链在空间中的相互缠绕程度。通常,|GLN| 越大,链间缠绕越明显。本研究将 |GLN| ≥ 0.7 作为识别缠结结构的标准之一。已有研究表明,这套筛选流程能够较准确地识别非二聚体以及虽为二聚体、但不具缠结结构的负样本。借助这些可计算的结构指标,作者得以系统筛查大规模序列库,最终构建出包含 79,890 条序列、32,339 个簇的缠结同源二聚体数据集,为后续模型训练提供了丰富的序列资源(如图1)。

图1|天然缠结蛋白数据集的构建与结构示例。研究从 UniRef50 数据库出发进行两阶段筛选,并依据序列长度、C2 对称性、结构预测置信度和 |GLN| 等条件筛选候选。图中展示筛选流程、分类分布、不同缠绕程度的二聚体结构,以及随机抽样结构的 GLN 分布。
TangleDiff:从噪声中生成缠结蛋白
基于前面筛选得到的缠结蛋白序列,作者开发了 TangleDiff,用于生成新的缠结蛋白。模型先借助预训练蛋白质语言模型 ESM2,将天然蛋白序列转换为连续的数值表示,再学习这些表示的分布。训练时,模型对序列表示逐步加噪,并学习如何将其还原。生成时则从随机噪声出发,经过多轮去噪,最终解码为氨基酸序列。团队采用扩散 Transformer 作为生成器,并利用自条件策略把前一步的预测结果作为辅助信息,同时将链间结合能作为条件输入模型,引导生成过程(图2)。

图2|TangleDiff 的训练流程、生成过程与模型结构。预训练蛋白质语言模型将序列转换为连续表示,扩散模型学习逐步去噪;生成时可输入链间结合能条件,引导候选序列朝目标性质生成。图中也展示了模型训练损失及生成指标随训练进程的变化。
在无条件生成测试中,团队共设计了 4,000 条序列,并分别使用 ESMFold 和 AlphaFold2 预测结构。两种工具预测得到的结构中,缠结比例分别为 88.4% 和 80.0%。研究将同时满足预测为缠结、且 pLDDT 高于 70 的序列定义为计算设计成功,由此得到的成功率超过 70%,远高于其他的序列生成模型(~1.02%)。生成序列也展现出一定的新颖性。多数设计序列与训练集中最相近序列的同一性约为 40% 至 60%,其中一部分低于 30%,说明模型并非只是复制训练序列。研究团队还将天然序列和设计序列映射到同一序列空间中进行比较。4,000 条设计序列分布于约 80,000 条天然缠结序列所覆盖的区域,整体分布与天然序列相近,同时展现出较丰富的变化。
团队还通过编码器比较和消融实验分析模型性能的来源。与 VHSE 理化性质描述符及 TAPE 系列表示相比,ESM2 表示得到的生成结果整体更好;在测试的 ESM2 模型中,较大的语言模型带来小幅提升。由于训练时冻结了 ESM2 参数,这种提升更可能来自更有信息量的序列表示,而非编码器在训练集上的过拟合。进一步的消融结果显示,直接预测去噪后的序列表示、加入自条件、采用线性噪声调度,以及对 ESM2 输出进行归一化,都有助于提高生成表现(如图3)。

图3|TangleDiff 无条件生成结果的评估。图中比较了 4,000 条设计序列的结构置信度和缠结比例,并展示序列新颖性、序列空间分布、与已知蛋白结构的比较,以及不同序列编码器和模型组件的评估结果。
把分子结合能变成材料设计旋钮
为了检验模型能否按目标性质进行生成,团队进一步将链间结合能作为条件输入。结合能由 Rosetta 计算,并用于比较不同二聚体链间相互作用的相对强弱,数值越负通常表示结合越强。作者把训练序列划分到五个结合能区间,再让模型按指定区间生成候选序列。计算结果显示,多数生成设计的结合能落在对应目标范围内。研究还用另一种基于分子模拟的评分方法进行交叉比较,结果与 Rosetta 评分总体呈一致趋势。尽管在训练和生成时并未将单位面积结合能作为条件,作者发现生成设计的单位面积结合能与整体结合能呈现一致的变化趋势,这表明结合能条件能同时控制缠结蛋白的结合界面质量,即单位面积结合能大小。
在此基础上,团队选择了强(< ?160 REU)、中(?140 ~ ?120 REU)、弱(> ?100 REU)三类结合能条件开展实验验证。每类先生成 4,000 条长度为 40 至 50 个氨基酸的序列,再通过虚拟筛选逐步检查序列与预测结构是否匹配、结构是否稳定缠结,以及蛋白是否可能可溶表达。经过筛选,强结合组、中等结合组和弱结合组分别保留 54、458 和 49 个候选。团队再从中各挑选 3 个设计,共 9 个,进入蛋白表达和水凝胶制备实验。结构分析还发现,不同结合能组呈现出不同的缠结构型。AlphaFold2 预测显示,强结合设计(< ?160 REU)的缠结主要由 β 折叠形成;中等结合组(?140 至 ?120 REU)和弱结合组(> ?100 REU)则更多呈现带状-螺旋-螺旋(ribbon-helix-helix,RHH)超家族相关构型。相较之下,弱结合设计中的缠绕更浅。

图4|按链间结合能条件生成和筛选缠结二聚体。图中展示不同结合能条件下的生成结果、Rosetta 与分子模拟能量评分之间的关系、虚拟筛选流程,以及进入实验验证的 9 个设计结构。
从计算设计到真实水凝胶
实验中,9 个设计蛋白均以可溶形式表达,圆二色光谱进一步验证了9个设计的二级结构。SEC-MALS结果显示8 个设计在溶液中形成了二聚体。团队将设计蛋白与弹性蛋白样多肽(ELP)连接,再利用 SpyTag/SpyCatcher 反应组装成两种蛋白网络。一类网络主要依靠设计蛋白之间的物理缠结形成凝胶样材料(AXA+BXB),另一类还加入共价支化交联(AXA+BBB)。最终有 7 个设计成功制备为这两类蛋白水凝胶。这些结果把计算设计进一步推进到真实蛋白和材料层面的验证,同时也显示从结构预测到实验成胶仍有筛选损耗(如图5)。

图5|设计蛋白的实验验证与水凝胶制备。示意图展示蛋白构建模块及两类网络的组装方式;其余面板包括 9 个设计的表达、二级结构和寡聚状态表征,以及两类网络中成功制备的 7 组凝胶样品。
流变测试显示,生成设计过程中指定的缠结蛋白链间结合能条件与最终蛋白水凝胶材料的松弛行为存在关联。较弱结合设计 C4_370 的连续松弛谱在约 2.4 秒处出现峰值,中等结合设计 C2_1020 的峰值约在 12.8 秒。研究中最强结合的一组没有出现明显松弛峰,表现出更偏弹性的响应。加入共价支化交联后,网络的整体储能模量提高,松弛峰也更明显,但峰的位置基本没有改变。需要注意的是,同一结合能组内不同设计的结构并不完全相同,部分成功成胶的设计也未出现清晰松弛峰。因此,结合能是重要的调节变量,但材料表现还会受到结构形态和结合界面等因素影响(如图6)。

图6|14 种蛋白水凝胶网络的流变分析。储能模量和损耗模量反映材料的弹性与能量耗散特征,连续松弛谱则呈现材料的松弛时间分布。不同结合能设计的谱峰位置和强度,展示了各网络应力松弛行为的差异。
结论:
这项工作建立了一条从天然序列挖掘、生成模型和虚拟筛选,到蛋白表达、凝胶制备及流变表征的设计流程。它的意义不只在于获得新的蛋白序列,也在于展示了如何从分子层面设定缠结链间相互作用,再将这种设定转化为可测量的材料力学差异。通过扩展可用的缠结蛋白结构类型,研究为设计不同应力松弛行为的蛋白材料提供了新的工具和思路。
目前,这项研究主要完成了蛋白水凝胶的体外制备和流变性质验证,尚未直接检验这些材料对干细胞或类器官培养的影响。不同设计之间也存在实验表现差异,说明目标结合能并不能单独决定最终材料性质。后续还需要在细胞培养体系中评估材料表现,并进一步考察缠结程度、二级结构组成和动力学稳定性等因素。TangleDiff 的条件生成框架有望扩展到这些分子性质,为后续材料设计提供更多可调参数。
论文信息
Deng, P., Wu, Y., Fok, H.K.F. et al. Generating protein hydrogels with customizable stress relaxation behavior via deep learning-driven entanglement design. Nat Commun (2026).
https://doi.org/10.1038/s41467-026-77607-9
- 浙江大学毛峥伟教授课题组Adv. Mater.:一种通用的聚电解质-锁定策略:从普通蛋白质到稳定的展开蛋白基粘合剂以实现快速稳健的组织密封 2025-12-25
- UCLA贺曦敏/燕山大学秦志辉、焦体峰 Adv. Mater.: 具有优异机械性能和耐久性的完全可降解蛋白质凝胶-氢键供体的调控 2025-06-27
- 华东理工刘润辉教授课题组 CCS Chem.:有效稳定蛋白质的伴侣样活性丝胶蛋白 2025-06-17
- 中国科大李良彬教授团队崔昆朋/李薛宇 Macromolecules:双交联强韧聚两性电解质水凝胶的多轴应力松弛机制 2026-04-29
- 南京大学胡文兵教授课题组 Macromolecules:双轴拉伸结晶时的应力松弛不利于热塑性弹性体产品的力学性能 2026-02-27
- 南京大学胡文兵教授课题组 Polymer:高分子薄膜成型的应力松弛调控机制 2025-05-25
- 厦门大学郭文熹教授、叶美丹教授团队 Nat. Commun.:离子介导水合工程-制备兼具高强度与高弹性的丝素蛋白水凝胶 2026-08-25