技术分享:虚拟组织基础模型VirTues解析空间蛋白质组学
组织,尤其是癌症组织,在不同患者、疾病阶段以及个体肿瘤内部均表现出显著的异质性,这体现在多样的细胞表型、状态和空间组织结构上[1]。肿瘤进展以及对治疗的反应取决于癌细胞及其与周围环境的相互作用,这使得肿瘤微环境(TME)的空间结构和功能成为治疗癌症的核心。空间蛋白质组学技术改变了人们对癌症中复杂组织结构的理解。例如多重免疫荧光和成像质谱细胞术(IMC)可以在亚细胞水平分辨率下测量完整组织中数十至数百种蛋白质[2],揭示肿瘤与免疫系统的相互作用、预后性空间微环境以及跨癌症类型的治疗耐药机制(图一a)。然而,这些检测方法强大的灵活性也导致该领域碎片化,每项研究使用定制化的抗体面板、方案和平台,导致数据集在标志物身份和数量、动态范围和噪声方面存在差异(图一b),且大多数方法都是针对单一队列定制的,这限制了知识迁移和稳健的生物标志物发现[3, 4]。基础模型已经重塑了自然语言处理、计算机视觉和生物学,支持从病理学和放射学进行肿瘤学诊断。然而,尚无通用模型能够直接处理异质面板上的高多重空间蛋白质组学信息。
2026年9月,Nature期刊的一项研究提出了虚拟组织(VirTues),这是一种通用的空间蛋白质组学基础模型,能够直接从多重成像数据中学习标志物感知的、跨尺度蛋白质、细胞、微环境及组织表征。基于单一预训练骨干网络,VirTues支持标志物重建、细胞分割与分型、生态位注释、空间生物标志物发现及患者分层,包括跨异质面板和数据集的零样本注释。在三阴性乳腺癌中,VirTues衍生的生物标志物可预测抗PD-L1化疗免疫疗法的反应,并在独立队列中对无病生存期进行分层,其表现优于从相同数据集和当前临床分层方案中得出的最先进生物标志物[5]。
基础模型的一个关键特征在于能够利用更大、更多样化的训练数据集,在多种下游任务中实现卓越的性能。然而,当前用于生物成像的视觉模型,如视觉Transformers(ViTs)在应用于多重数据时面临若干限制(图一e),这制约了它们在大规模异质数据集的可扩展性。为了克服这些挑战,研究者设计了一个专为蛋白质和mRNA多重成像而构建的ViT模型VirTues。通过将Transformer的注意力机制解耦为标志物和空间组分,VirTues能够在具有数十个通道的图像上进行训练(图一e),并分别学习构成组织分子特征的空间排列和细胞组成,以及蛋白质与RNA标志物之间的相互关系。另一项关键创新是为空间生物学设计了新型token化方案,通过将PLM嵌入与空间分块通道信息和可学习块汇总token结合,实现对可变标志物组合的灵活处理,并融入标志物的生物学意义和亚细胞空间分布(图一d)。该token化使VirTues能够纳入训练中未见的标志物,并整合不同标志物面板的异质数据集(图一b),且随着标志物深度的增加性能持续改善,尤其在前20个标志物上效果显著(图一e)。在包含8个器官部位15个成像质谱细胞术(IMC)数据集(图一c)上训练和评估VirTues,并为了评估跨技术泛化能力,将此语料库扩展至公开的CODEX、Orion和MIBI研究,最终形成一个涵盖来自17种不同组织来源的32个临床队列的数据集。

图一 VirTues平台概述[5]
为了探究VirTues对组织架构的理解,研究者测试了其在三种难度递增的掩蔽策略下重建组织的能力。独立掩蔽是每个标志物在随机位置独立地遮挡patch(图二a);标志物掩蔽是随机选择一个标志物,将其所有patch全部遮挡(图二b);生态位掩蔽是在所有标志物的随机位置同时遮挡patch,形成一块所有通道都缺失的“空洞”(图二c)。在独立掩蔽下,VirTues重建掩蔽区域,在跨标志物和数据集中具有高皮尔逊相关系数(平均rindependent = 0.800 ± 0.130),远超平均强度基线(Δrindependent = 0.295,图二d)。例如,肺癌组织[6]中的CAV1和CD3E,乳腺癌样本[7]中的MTOR和MYC,表明重建保留了空间分布和强度模式。在更严格的标志物掩蔽下,即整个通道被隐藏时,VirTues能够准确恢复被掩蔽标志物的表达(图二d),例如肺癌[6]中的ACTA2和CD68,以及乳腺癌组织[7]中的PTPRC和KRT19,超过了预测最相关标志物的基线,并证明了该模型学习和整合复杂标记物相互作用的能力。因为,在标志物掩蔽下,VirTues解码器仅接收编码的块汇总token作为输入,其重建缺失标志物的能力验证了这些token捕获了分子组织架构的稳健表征。在生态位掩蔽下,即整个区域跨所有标志物被遮挡时,VirTues能够重建复杂组织架构(平均rniche = 0.668 ± 0.132;图二d),并恢复标志物模式,例如肺癌[6]中的HLA-DRA和FUT4,以及乳腺癌组织[7]中的CA9和SOX9。空间连贯宏观结构的恢复,表明该模型捕获了全局的组织架构,而非仅依赖局部的像素信息。

图二 VirTues学习组织架构和标志物关系[5]
接着,研究者在一个完全独立的肺癌数据集[4]上评估零样本重建,该数据集完全未参与任何一项单独的训练运行(图二e),既包含了训练中存在的标志物,也存在未见过的新标志物(图二f)。VirTues对二者均产生了视觉上准确的重建,如CD14和CD63(图二g),标志物性能因标志物和策略而异(图二h)。对于已知标志物,尽管相对于域内评估(平均 r = 0.797)有所下降,但零样本重建达到了高相关性(平均 r = 0.667)。对于仅存在于零样本数据集中的新标志物,下降更为显著,但同样集中在标志物掩蔽条件下。此外,在独立掩蔽下的零样本性能超过了生态位掩蔽下的性能,表明即使对于新标志物,VirTues也利用了标志物间的相互关系,而不仅仅是局部空间模式。进一步分析了零样本重建在何时有望成功或失败,观察到一个明显的趋势:当目标标志物是预训练期间所见蛋白质中的近似类似物时,其表现最佳。通过标志物掩蔽和全组织范围重建产生的虚拟染色进一步支持了下游表型鉴定:依次掩蔽并填补所有B细胞标志物,然后填补所有T细胞标志物,同时保留了细胞类型分类,证实了重建信号的生物学有效性。
单细胞分辨率下的细胞类型预测是表征肿瘤微环境(TME)以及指导治疗决策的前提条件[8]。VirTues的统一框架包含patch、细胞、生态位和组织汇总token,支持跨生物尺度分析。于是,研究者对VirTues的细胞汇总token进行线性探测(逻辑回归)评估细胞分型(图三a),并与两个基线方法KRONOS和CA-MAE进行比较。在肺、乳腺和黑色素瘤数据集中,VirTues 在宏平均F1上始终领先,相对于KRONOS平均相对提升5.81%,相对于CA-MAE平均相对提升65.79%(图三b)。即使在低占比的细胞群体中也能保持优势,包括Cords等[6]中的血管、T细胞,以及Danenberg等[2]中的NK细胞、B 细胞等。以上表明在多种技术上未做任何架构改动的情况下训练,VirTues达到了最先进的细胞分型水平。

图三 VirTues在单细胞尺度上切割并注释组织[5]
基础模型的一个关键特性是随着训练数据的规模和多样性的增加,其性能会逐渐提高。在Danenberg等[2]的数据集上,VirTues使用所有可用数据集训练的模型在几乎所有类别上都优于仅使用Danenberg等[2]数据训练的模型(图三c),其中免疫细胞群体的增幅最大,例如B细胞提高了26.4%,髓系细胞34.3%,NK细胞109.7%,T细胞30.2%。这些结果证明了有效的跨数据集协同效应:VirTues利用了从多样化、独立队列中学到的表征,超越了仅使用Danenberg等[2]数据训练的模型。此外,VirTues在严格零样本设置下实现了泛化:在四个基准队列[6, 9, 10]中,训练时完全保留了每个评估队列,宏-F1相对域内训练的差异≤0.03(图三d)。以上结果表明,VirTues在多个数据集和技术上均优于KRONOS和CA-MAE,尤其跨技术迁移优势明显。
前述实验依赖于提供的分割掩蔽和数据集内部标签,尚未充分检验模型在完全未标记、跨队列场景下的分割与分型能力。鉴于VirTues将多样化的数据集映射到一个空间分辨图像块表征的共享空间,理论上支持跨队列分割和细胞分型,这对于注释新的未标记数据集尤其有价值。于是,研究者协调了跨数据集之间的细胞类型注释,利用提供的掩蔽,在VirTues之上训练了分割模块,后者联合预测实例掩蔽和语义细胞类型掩蔽(图三e)。为评估跨队列泛化能力,每个模块在除目标数据集外的所有数据集上进行训练,目标数据集被完全保留,使得评估时不做目标特异性微调。在跨数据集上,VirTues在实例分割(图三f)和细胞类型预测(图三g)上均表现强劲。在交并比(IoU)阈值为0.5时,它在9个数据集中的8个上优于已建立的模型Cellpose、InstanSeg和StarDist,类似改进在不同IoU阈值下均保持一致(图三h左)。对于细胞分型,VirTues的宏-F1在除一个数据集外的所有数据集上都超过了专用工具MAPS[11]和Astir[12]。比较各类别F1分数,VirTues在细胞类型间表现出最稳定的性能,而MAPS和Astir的方差显著更高(图三h右和i)。以上结果表明,VirTues能够学习细胞形态和表型在不同数据集和标志物面板中的稳健表征,从而能够很好地泛化到新的队列。
空间生物学的核心目标是寻找能够按临床风险对患者进行分层的细胞和多细胞特征[1]。研究者将完全训练好的VirTues应用于Danenberg等分析的METABRIC乳腺癌队列[13],并限制为雌激素受体阳性患者(n = 541)。对每位患者,用VirTues嵌入组织活检样本,将细胞token通过k-means划分为120种表型状态,生成表型组成指纹(图四a)。对这些指纹进行聚类,可将患者分为两个风险组。使用UMAP可视化中,这些组别显示出细胞层级表征的明显分布差异(图四b)。使用Kaplan–Meier生存曲线比较两个风险组时,两组生存差异显著:高风险组(n = 265)在21年期内有99例死亡,而低风险组(n = 276)有58例死亡(图四c)。为了检验这种基于VirTues的分层是否反映了TME已知的多细胞结构,研究者将其与Danenberg等鉴定的十种TME结构进行对比分析。结果显示,研究者的分层与已知预后结构高度一致:与风险降低相关的血管基质在高风险组中代表性不足,风险比为0.399,而不良的抑制性扩张和 APC富集结构则显著富集,风险比分别为4.464和5.636(图四d)。相比之下,不使用 VirTues,仅基于生存数据得出的分层分析并未显示这种趋势,仅抑制性扩张风险比轻度升高。

图四 VirTues的临床应用:风险分层、诊断预测和组织检索[5]
许多临床决策是在患者组织活检的尺度上做出的,此时需要将来自众多细胞和区域的信号整合为单一预测。研究者使用基于注意力机制的多实例学习(ABMIL)在多项诊断和预后任务中评估了VirTues的组织层级表征(图四e)。VirTues的组织层级预测(图四f)在关键临床诊断任务上表现尤为突出,包括肺癌的癌症亚型分型和肿瘤分级,以及乳腺癌的雌激素受体状态判定和分级。在NeoTRIP TNBC队列[10, 14]中,VirTues在预测治疗24周后的病理完全缓解方面表现出强劲性能。详细的注释使得能够区分同时接受化疗(卡铂、纳布帕利他赛)和抗PD-L1免疫治疗(阿特珠单抗)的患者,并比较治疗前、治疗期间和治疗后收集的样本性能。在治疗前样本上,VirTues宏平均F1为0.676,相对于KRONOS和ResNet分别提升20.2%和8.6%,与CA-MAE(0.685)相当。在治疗期间样本上,其达到0.714,较KRONOS、CA-MAE和ResNet分别提升30.2%、31.4%和19.5%。在治疗后样本上,其达到0.678,超过KRONOS和ResNet,并略高于CA-MAE。以上结果表明,VirTues能够捕捉到具有区分性的组织层级特征,这些特征可预测治疗结果,并强调了其在临床实践中的潜在应用价值。
为探究临床实用性,研究者使用VirTues从参考队列中检索临床相似的患者,以进行基于病例的决策支持。VirTues的生态位汇总token经过训练以捕获组织组成、架构和邻域相互作用,作为每个组织的紧凑指纹。将参考队列中的存档病例编码入这些token,形成一个可搜索的“虚拟组织数据库”,查询后通过计算新患者token与存储token之间的成对Wasserstein距离,返回最匹配的组织信息及其临床记录(图四g)。为了量化VirTues检索合适样本的能力,研究者设计了三个定量任务,并在Cords等的肺癌数据集上与基线模型ResNet、KRONOS、CA-MAE和随机检索进行对比评估。其一,比较了检索样本与参考样本在临床和诊断变量上的匹配率(图四h)。在所有变量上,VirTues的匹配率显著高于随机检索,在匹配癌症亚型方面表现尤为突出,其平均精确度超过了所有基线模型。其二,通过归一化直方图之间的L1距离来比较检索组织与参考组织之间的细胞类型分布,VirTues实现了最低的分布距离(图四i)。其三,使用计算多重图像原始像素值之间切片Wasserstein距离的最优传输度量,VirTues检索到了分子组成高度相似的存档样本,总体排名第二,仅次于KRONOS(图四j)。分别用三个案例研究展示了VirTues跨癌症检索表现:1)2级腺癌匹配到一例具有相似分级、淋巴结转移和复发结局的病例(图四k左),2)2级鳞状细胞癌匹配到相同的组织架构,但淋巴结转移状态和临床轨迹不同(图四k中),3)2级腺癌匹配到相同的疾病分级和临床轨迹,但淋巴结转移状态不同(图四k右)。以上结果表明,VirTues生态位汇总token在多个尺度上捕捉组织相似性,从分子、细胞类型组成到临床变量。VirTues检索优先选择那些在分子和结构上与查询样本相似、且富含相同癌症亚型的病例,这为训练学习具有临床意义的相似性提供了证据,并建立了一个可用于比较不同患者之间的组织表型、定量的、基于病例的框架。
为了预测治疗的成功,生物标志物应能捕捉反映患者反应的TME复杂性。尽管经典生物标志物通常依赖于单一标志物或细胞类型频率,但虚拟组织的表征本质上编码了微环境的空间和多细胞组织,并可用于挖掘反应性生物标志物。最后,研究者探究VirTues挖掘反应性生物标志物的临床实用性。首先进行一项合理性检验,测试了VirTues是否能捕捉到区分应答者的变化(图五a)。在NeoTRIP TNBC队列的治疗前、治疗期和治疗后样本中,VirTues的嵌入捕捉到了显著的变化能区分不同的结果,应答者的重塑程度远超过非应答者(图五b左),原始平均标志物强度未能揭示这种差异(图五b右),表明VirTues能捕捉组织层级动态变化。随后,通过无监督到监督的处理流程,从治疗前样本中推导出基于VirTues的生物标志物。使用VirTues嵌入所有治疗前细胞,进行多分辨率Leiden聚类以获得表型分区,按患者聚类细胞以计算簇频率,以及使用交叉验证的患者层级模型对每个簇的响应预测值进行评分与排序(图五c)。从最佳匹配中,保留了两个响应特征RS1、RS2和两个非响应特征NRS1、NRS2,分别占据不同的UMAP区域,并由多种细胞类型混合组成(图五d)。单独来看,它们的交叉验证AUROC分别为0.783、0.707、0.599和0.577,而结合所有四个的多变量模型,即所得的VirTues衍生生物标志物达到了0.823,比Wang等[10]的空间预测模型高出5.14%,比经典的临床免疫细胞比例基线高出26-32%(图五e)。

图五 VirTues用于挖掘指示治疗反应和生存预测的生物标志物[5]
细胞类型组成可区分这些特征:RS1显著富集了凋亡细胞、DNA损伤细胞和PD-L1+GZMB+细胞,表明处于一种受压、免疫靶向的状态;而RS2则富集了CD4+ T细胞和检查点阳性细胞(PD-L1+GZMB+;PD-L1+IDO+);两种非响应特征NRS1和NRS2均以肿瘤为主,且缺乏免疫细胞和基质细胞(图五f)。邻域分析显示,RS1凋亡细胞被更多的CD4+T、PD-L1+GZMB+细胞包围,B细胞邻域富集PD-L1+GZMB+和上皮-间充质转化(EMT)样肿瘤细胞,这与激活的免疫压力相一致;RS2 CD4+T细胞则位于更多的肿瘤细胞、主要组织相容性复合体-I/II+和PD-L1+GZMB+细胞之间,但CD8+T细胞较少,这与检查点调控的辅助T细胞反应相一致(图五g)。表明这两个响应特征捕捉了互补的抗肿瘤机制,RS1是由细胞毒性、应激驱动的程式,RS2是检查点调控的辅助T细胞程式,提示两者都能通过检查点阻断来放大有效的免疫激活。
为了测试泛化能力,研究者将特征转移到一个独立的TNBC队列[15](未用于预训练或发现),计算每个患者的VirTues嵌入,并应用基于发现队列训练的随机森林分类器(图五h)。结果显示,响应特征定位在免疫炎症区域,而非响应特征则位于免疫排斥区域(图五i)。由于缺乏响应标签,研究者评估了无病生存率。患者层级的特征频率被合并为单一的风险评分,该评分将患者分为三个明显分离的组别(图五j),达到0.628的一致性指数,超过了Meyer等[15]的系统和经典的临床免疫细胞比例基线(图五k)。治疗反应新发现的特征标志物也能在独立队列中对无病生存期进行分层,表明VirTues的表征捕获了可泛化的、具有预后意义的疾病生物学特征,而非队列特异性伪影。
综上所述,该研究提出的虚拟组织VirTues,通过创新的token化方案(将蛋白质语言模型嵌入与空间图像块信息结合)和Transformer架构,使得一个模型能够同时处理来自不同研究队列、测量不同标志物组合的空间蛋白质组数据。VirTues能够同时支持细胞层级、生态位层级和组织层级的多尺度分析,不仅可以描述组织状态,还可以预测治疗结局。该研究首次为空间蛋白质组学领域提供了一个能够跨技术平台、跨队列泛化、跨癌症类型的通用基础模型,将原本碎片化的空间生物学数据转化为一个可查询、可复用的虚拟组织图谱,解决了空间蛋白质组学领域因技术异质性而导致的知识难以迁移和整合的根本性瓶颈,展示了在患者分层、治疗反应预测、生物标志物发现和精准医学决策的临床应用前景,为未来构建“虚拟患者”AI驱动的模拟与诊断助力精准肿瘤学奠定了方法论基础。

GTP研发中心负责实施基因组标签计划(Genome tagging project, GTP),基于自主知识产权的类精子干细胞介导半克隆技术,为全基因组的功能基因一一贴上标签,致力于构建标签细胞和标签小鼠资源库。类精子干细胞是从精子来源单倍体囊胚中建系获得的一种孤雄单倍体胚胎干细胞,将其注入卵母细胞,能够像精子一样支持整个胚胎发育过程,产生健康的半克隆小鼠。GTP研发中心在类精子干细胞的蛋白质编码基因上原位敲入标签序列,建立了液氮保存的标签细胞资源库。研究需要时,利用半克隆技术将标签细胞注射到小鼠卵母细胞中,一步法获得标签小鼠。

已有标签产品可直接订购,详情查阅以下官网链接。如有需要欢迎联系,我们将竭诚为您服务。
标签细胞网址:
标签小鼠网址:
http://www.sibcb.ac.cn/gtp/msearch.jsp
地址:上海市岳阳路320号
责任编辑:甜点
新媒体运营:suway
参考文献
1. de Souza N, Zhao S, Bodenmiller B: Multiplex protein imaging in tumour biology. Nat Rev Cancer 2024, 24(3):171-191.
2. Danenberg E, Bardwell H, Zanotelli VRT, Provenzano E, Chin SF, Rueda OM, Green A, Rakha E, Aparicio S, Ellis IO et al: Breast tumor microenvironment structures are associated with genomic features and clinical outcome. Nat Genet 2022, 54(5):660-669.
3. Tsimberidou AM, Kahle M, Vo HH, Baysal MA, Johnson A, Meric-Bernstam F: Molecular tumour boards - current and future considerations for precision oncology. Nat Rev Clin Oncol 2023, 20(12):843-863.
4. Rigamonti A, Viatore M, Polidori R, Rahal D, Erreni M, Fumagalli MR, Zanini D, Doni A, Putignano AR, Bossi P et al: Integrating AI-Powered Digital Pathology and Imaging Mass Cytometry Identifies Key Classifiers of Tumor Cells, Stroma, and Immune Cells in Non-Small Cell Lung Cancer. Cancer Res 2024, 84(7):1165-1177.
5. Wenckstern J, Jain E, von Querfurth B, Cheng Y, Vasilev K, Pariset M, Cheng PF, Liakopoulos P, Michielin O, Wicki A et al: The Virtual Tissues foundation model resolves spatial proteomics across scales. Nature 2026, 657(8132):744-754.
6. Cords L, Engler S, Haberecker M, Ruschoff JH, Moch H, de Souza N, Bodenmiller B: Cancer-associated fibroblast phenotypes are associated with patient outcome in non-small cell lung cancer. Cancer Cell 2024, 42(3):396-412 e395.
7. Jackson HW, Fischer JR, Zanotelli VRT, Ali HR, Mechera R, Soysal SD, Moch H, Muenst S, Varga Z, Weber WP et al: The single-cell pathology landscape of breast cancer. Nature 2020, 578(7796):615-620.
8. Nederlof I, Isaeva OI, de Graaf M, Gielen R, Bakker NAM, Rolfes AL, Garner H, Boeckx B, Traets JJH, Mandjes IAM et al: Neoadjuvant nivolumab or nivolumab plus ipilimumab in early-stage triple-negative breast cancer: a phase 2 adaptive trial. Nat Med 2024, 30(11):3223-3235.
9. Hoch T, Schulz D, Eling N, Gomez JM, Levesque MP, Bodenmiller B: Multiplexed imaging mass cytometry of the chemokine milieus in melanoma characterizes features of the response to immunotherapy. Sci Immunol 2022, 7(70):eabk1692.
10. Wang XQ, Danenberg E, Huang CS, Egle D, Callari M, Bermejo B, Dugo M, Zamagni C, Thill M, Anton A et al: Spatial predictors of immunotherapy response in triple-negative breast cancer. Nature 2023, 621(7980):868-876.
11. Shaban M, Bai Y, Qiu H, Mao S, Yeung J, Yeo YY, Shanmugam V, Chen H, Zhu B, Weirather JL et al: MAPS: pathologist-level cell type annotation from tissue images through machine learning. Nat Commun 2024, 15(1):28.
12. Geuenich MJ, Hou J, Lee S, Ayub S, Jackson HW, Campbell KR: Automated assignment of cell identity from single-cell multiplexed imaging and proteomic data. Cell Syst 2021, 12(12):1173-1186 e1175.
13. Curtis C, Shah SP, Chin SF, Turashvili G, Rueda OM, Dunning MJ, Speed D, Lynch AG, Samarajiwa S, Yuan Y et al: The genomic and transcriptomic architecture of 2,000 breast tumours reveals novel subgroups. Nature 2012, 486(7403):346-352.
14. Gianni L, Huang CS, Egle D, Bermejo B, Zamagni C, Thill M, Anton A, Zambelli S, Bianchini G, Russo S et al: Pathologic complete response (pCR) to neoadjuvant treatment with or without atezolizumab in triple-negative, early high-risk and locally advanced breast cancer: NeoTRIP Michelangelo randomized study. Ann Oncol 2022, 33(5):534-543.
15. Meyer L, Jackson HW, Eling N, Zhao S, Usui G, Dakhli H, Schraml P, Dettwiler S, Elfgen C, Varga Z et al: A stratification system for breast cancer based on basoluminal tumor cells and spatial tumor architecture. Cancer Cell 2025, 43(9):1637-1655 e1639.
转载请注明来源于【GTP研发中心】
声明:本文仅用于分享,不代表GTP研发中心立场,若有侵权,请及时联系我们第一时间更正!


