1. 项目概述为什么我们需要一份靠谱的TCGA癌症简称对照表如果你刚接触癌症基因组学或者正在处理TCGAThe Cancer Genome Atlas的数据第一个让你头大的可能不是复杂的算法而是那些眼花缭乱的缩写。BRCA、LUAD、SKCM、COAD……这些看起来像密码一样的字母组合背后代表的是乳腺癌、肺腺癌、皮肤黑色素瘤、结肠腺癌等具体的癌症类型。我刚开始做生信分析的时候就曾经因为把“LUSC”肺鳞癌和“LUAD”肺腺癌搞混导致后续的差异表达分析完全跑偏浪费了好几天时间。这让我意识到一份准确、全面、随时可查的TCGA癌症中英文对照表绝不是可有可无的参考资料而是高效、准确开展研究工作的“导航仪”和“避坑指南”。这份对照表的核心价值在于建立一座桥梁连接起简洁的数据库标识符缩写和人类可理解的疾病名称全称。TCGA项目为了数据管理和标准化为每种癌症类型分配了唯一的、通常是四个字母的缩写。这些缩写大多遵循一定的命名逻辑比如取器官英文名的前几个字母加上癌症类型但也不乏一些历史原因形成的特例。对于数据分析师、临床研究员甚至期刊编辑来说能够快速、无误地进行这种转换是保证沟通无误、分析正确、论文严谨的基础。本文将不仅仅罗列一份对照表更会深入拆解这些缩写背后的命名规则、常见的使用场景、以及在实际工作中如何高效地管理和应用这份知识让你彻底摆脱缩写混淆的困扰。2. TCGA癌症缩写命名规则深度解析理解命名规则能让你从死记硬背变为逻辑推断即使遇到陌生的缩写也能猜个八九不离十。TCGA的癌症缩写体系并非完全随意其核心逻辑可以归纳为“器官类型”的简写组合。2.1 基于器官英文名称的缩写这是最常见的一类。通常取器官或组织英文名称的前2-3个字母。BRCA:BreastCarcinoma。乳腺癌。这里“Ca”是Carcinoma癌的常用缩写。LUAD:LungAdenocarcinoma。肺腺癌。注意是“肺”的“Lu”和“腺癌”的“Ad”。LUSC:LungSquamousCell carcinoma。肺鳞状细胞癌。这里体现了“鳞状细胞”的“S”和“C”。COAD:ColonAdenocarcinoma。结肠腺癌。READ:RectumAdenocarcinoma。直肠腺癌。KIRC:KidneyRenalClear cell carcinoma。肾透明细胞癌。这里稍微复杂“Ki”是肾脏“R”和“C”分别代表Renal和Clear。THCA:ThyroidCarcinoma。甲状腺癌。2.2 基于组织学类型或特殊命名的缩写有些缩写更侧重于癌症的特定组织学类型或沿用历史名称。SKCM:SkinCutaneousMelanoma。皮肤黑色素瘤。这里“M”代表Melanoma。GBM:GlioblastomaMultiforme。多形性胶质母细胞瘤。这是脑肿瘤中最常见且恶性程度最高的一种其缩写直接来源于疾病名称。LAML:LeukemiaAcuteMyeloidLeukemia。急性髓系白血病。这是一种血液系统肿瘤缩写体现了“白血病”和“急性髓系”的组合。OV:Ovarian serous cystadenocarcinoma。卵巢浆液性囊腺癌。这是一个特例只用“OV”两个字母代表卵巢癌主要是历史沿用和简洁性考虑。2.3 容易混淆的缩写对及其区分要点在实际工作中以下几对缩写最容易出错需要特别留意LUAD vs. LUSC: 这可能是最高频的“坑”。两者都是肺癌但LUAD是腺癌AdenocarcinomaLUSC是鳞癌Squamous Cell carcinoma。两者的起源细胞、驱动基因、治疗策略和预后都有显著差异。在下载数据或筛选样本时务必double-check。COAD vs. READ: 两者都是消化道腺癌但部位不同。COAD是结肠ColonREAD是直肠Rectum。在涉及结直肠癌的研究中有时会使用“CRC”Colorectal Cancer来统称但TCGA数据是分开的。KIRC vs. KIRP vs. KICH: 这都是肾脏肿瘤。KIRC是肾透明细胞癌最常见KIRP是肾乳头状细胞癌KICH是肾嫌色细胞癌。它们的分子特征和临床行为不同。注意永远不要凭印象猜测。当你在脚本中过滤样本、在论文中描述队列、或在报告中展示结果时对缩写的误用会导致整个研究基础的错误。最稳妥的方法是随时查阅可靠的对照表并在代码中用注释明确标注。3. 完整TCGA癌症类型中英文对照与关键信息表下面这张表是我在多年工作中整理和验证的核心对照表不仅包含缩写和全称还补充了常见样本量范围和关键注释这能帮助你在实验设计或数据解读时更有数。TCGA项目缩写英文全称中文全称常见样本量范围肿瘤正常关键注释与常见用途ACCAdrenocortical Carcinoma肾上腺皮质癌~80罕见肿瘤研究内分泌相关癌变机制BLCABladder Urothelial Carcinoma膀胱尿路上皮癌~400常用干湿结合验证模型BRCABreast invasive carcinoma乳腺浸润性癌~1100数据最丰富分型Luminal A/B, HER2, Basal-like研究多CESCCervical squamous cell carcinoma and endocervical adenocarcinoma宫颈鳞癌和宫颈腺癌~300包含两种主要病理类型与HPV感染强相关CHOLCholangiocarcinoma胆管癌~50样本量小预后差是研究难点COADColon adenocarcinoma结肠腺癌~450常与READ合并为结直肠癌CRC分析DLBCLymphoid Neoplasm Diffuse Large B-cell Lymphoma弥漫大B细胞淋巴瘤~50血液淋巴系统肿瘤基因组变异复杂ESCAEsophageal carcinoma食管癌~200需注意区分食管鳞癌ESCC和腺癌EAC亚型GBMGlioblastoma multiforme多形性胶质母细胞瘤~600中枢神经系统最常见恶性瘤免疫治疗研究热点HNSCHead and Neck squamous cell carcinoma头颈部鳞状细胞癌~500与HPV感染状态密切相关影响预后KICHKidney Chromophobe肾嫌色细胞癌~70肾癌三种主要类型之一相对惰性KIRCKidney renal clear cell carcinoma肾透明细胞癌~600肾癌最常见类型VHL基因突变特征明显KIRPKidney renal papillary cell carcinoma肾乳头状细胞癌~300另一种主要肾癌类型LAMLAcute Myeloid Leukemia急性髓系白血病~200血液肿瘤样本多为外周血或骨髓LGGBrain Lower Grade Glioma脑低级别胶质瘤~500包含星形细胞瘤、少突胶质细胞瘤等LIHCLiver hepatocellular carcinoma肝细胞肝癌~400与乙肝病毒、肝硬化关联大异质性强LUADLung adenocarcinoma肺腺癌~500非小细胞肺癌主要亚型驱动基因EGFR, ALK明确LUSCLung squamous cell carcinoma肺鳞状细胞癌~500非小细胞肺癌另一主要亚型与吸烟关系更密切MESOMesothelioma间皮瘤~80罕见多与石棉暴露相关OVOvarian serous cystadenocarcinoma卵巢浆液性囊腺癌~600妇科常见恶性肿瘤早期诊断难PAADPancreatic adenocarcinoma胰腺腺癌~180“癌王”预后极差肿瘤微环境研究多PCPGPheochromocytoma and Paraganglioma嗜铬细胞瘤和副神经节瘤~180神经内分泌肿瘤多与遗传综合征相关PRADProstate adenocarcinoma前列腺腺癌~500男性常见肿瘤雄激素受体信号通路是关键READRectum adenocarcinoma直肠腺癌~170常与COAD合并分析但保留独立标识SARCSarcoma肉瘤~250间叶组织来源包含多种亚型异质性极高SKCMSkin Cutaneous Melanoma皮肤黑色素瘤~470免疫检查点抑制剂疗效显著的癌种STADStomach adenocarcinoma胃腺癌~440与幽门螺杆菌感染相关分子分型如TCGA分型重要TGCTTesticular Germ Cell Tumors睾丸生殖细胞肿瘤~150年轻人多见治愈率高THCAThyroid carcinoma甲状腺癌~500最常见内分泌恶性肿瘤通常预后良好THYMThymoma胸腺瘤~120前纵隔肿瘤常伴发自身免疫性疾病UCECUterine Corpus Endometrial Carcinoma子宫体子宫内膜癌~550妇科常见肿瘤分型POLE突变型、MSI型等影响治疗UCSUterine Carcinosarcoma子宫癌肉瘤~60罕见但高度恶性UVMUveal Melanoma葡萄膜黑色素瘤~80眼内恶性肿瘤与皮肤黑色素瘤基因组特征不同这张表的价值在于当你在UCSC Xena、cBioPortal或GDC数据门户浏览数据集时可以快速定位。比如你想研究免疫治疗相关的生物标志物那么SKCM黑色素瘤、LUAD肺腺癌和BLCA膀胱癌通常是首选因为这些癌种对免疫检查点抑制剂的响应数据相对丰富。4. 实操应用如何在数据分析流程中高效集成与使用对照表知道了对照表更关键的是把它用起来融入你的日常工作流避免每次用到都去临时搜索。这里分享几种我实践过的高效方法。4.1 在生物信息学分析脚本中的集成最推荐的方式是将对照表直接编码到你的R或Python分析脚本的开头作为一个字典或数据框。这样既能保证准确性又能实现自动化查询。R语言示例# 在脚本开头定义TCGA癌症类型对照字典 tcga_dict - list( ACC Adrenocortical Carcinoma, BLCA Bladder Urothelial Carcinoma, BRCA Breast invasive carcinoma, LUAD Lung adenocarcinoma, LUSC Lung squamous cell carcinoma, SKCM Skin Cutaneous Melanoma # ... 可以继续补充完整 ) # 使用函数进行转换 get_cancer_full_name - function(abbr) { if (abbr %in% names(tcga_dict)) { return(tcga_dict[[abbr]]) } else { warning(paste(Abbreviation, abbr, not found in dictionary.)) return(NA) } } # 应用清洗样本ID中的癌症类型信息 sample_ids - c(TCGA-AA-3972-01A, TCGA-DD-A39V-01A) cancer_abbr - substr(sample_ids, 6, 7) # 假设项目缩写在6-7位根据GDC最新ID结构可能需调整 cancer_full - sapply(cancer_abbr, get_cancer_full_name) print(cancer_full)Python示例# 定义对照字典 tcga_dict { ACC: Adrenocortical Carcinoma, BLCA: Bladder Urothelial Carcinoma, BRCA: Breast invasive carcinoma, LUAD: Lung adenocarcinoma, LUSC: Lung squamous cell carcinoma, SKCM: Skin Cutaneous Melanoma } # 使用函数 def get_cancer_full_name(abbr): return tcga_dict.get(abbr, fUnknown abbreviation: {abbr}) # 应用在pandas DataFrame中添加一列全称 import pandas as pd # 假设df有一个‘project_id’列值为‘TCGA-LUAD’等 df[cancer_abbr] df[project_id].str.split(-).str[1] df[cancer_full_name] df[cancer_abbr].map(tcga_dict)4.2 在数据可视化图表中的规范使用在绘制发表级图表时使用全称或“缩写全称”的格式能极大提升图表的可读性和专业性。不佳示例图例直接写“LUAD”、“LUSC”。对于非本领域的读者或审稿人不够友好。推荐示例图例写“Lung adenocarcinoma (LUAD)” 和 “Lung squamous cell carcinoma (LUSC)”。或在图表标题或注释中说明“LUAD, lung adenocarcinoma; LUSC, lung squamous cell carcinoma”。在ggplot2 (R) 或 matplotlib/seaborn (Python) 中你可以在绘制前通过一个映射向量将数据框中的缩写列直接替换为这种组合格式的标签。4.3 创建个人知识库或速查笔记除了嵌入代码建立一个随时可查的个人知识库也至关重要。我习惯使用以下任何一种方式本地文本文件如tcga_abbreviations.txt或tcga_cheatsheet.md放在项目根目录。电子表格如Excel或Google Sheets可以方便地排序、筛选并添加更多自定义列如“相关标志物”、“常用分析工具”等。笔记软件如Notion、Obsidian等利用双向链接功能将TCGA缩写与相关的分析笔记、文献链接起来形成知识网络。5. 常见问题与易错点排查实录即使有了对照表在实际操作中还是会遇到一些坑。这里总结几个我踩过的雷和解决方案。5.1 样本ID与项目缩写提取错误问题TCGA的样本ID格式经历过变化如旧版的“TCGA-02-0001-01”到GDC的“b117f0b6-7b7f-4e9b-89b3-2f6b5c5b5b5b”等UUID。直接从样本ID中提取项目缩写时位置可能不对。旧版IDTCGA-02-0001-01项目缩写是前两个字母后的两位数字02需要再对照一个内部映射表02可能对应某种癌症。GDC数据更可靠的方式不是从样本ID硬提取而是利用元数据文件。下载数据时通常会有一个metadata.json或MANIFEST.txt文件里面包含了每个文件对应的project_id例如TCGA-LUAD这才是准确的项目标识。实操心得永远不要假设ID的结构是固定的。优先使用官方数据门户如GDC Data Portal提供的元数据中的project_id字段来获取癌症类型缩写这是最权威的方法。5.2 合并癌种分析时的缩写处理问题当需要合并多个癌种进行分析时例如研究泛癌标志物如何在结果中清晰标识来源错误做法在最终结果表格或图中只用一个新代号如“Pan-Cancer”丢失了具体癌种信息。正确做法保留原始缩写作为前缀或后缀。例如在基因表达矩阵中列名可以使用LUAD_TCGA-AA-1234和LUSC_TCGA-BB-5678这样的格式。在绘制热图时可以通过行或列注释条annotation bar来高亮显示不同的癌种缩写。5.3 与其它数据库缩写体系的冲突问题除了TCGA其他数据库如ICGC、CCLE等也有自己的样本命名或癌症缩写体系混用时容易混淆。案例CCLE癌症细胞系百科全书中一个肺癌细胞系可能叫NCI-H1650它对应的癌症类型是肺腺癌LUAD但在CCLE内部标识中可能不直接使用“LUAD”。解决方案在涉及多数据源整合的项目中建议建立一个中心映射表。这个表至少包含以下几列数据源、内部标识符、统一癌症类型缩写TCGA标准、癌症全称。所有后续分析都基于“统一癌症类型缩写”进行这样可以确保一致性。5.4 缩写更新与版本管理问题TCGA项目本身是动态的虽然主要癌种已固定但一些子项目或更新数据集的命名可能需要留意。建议定期查看NCI GDC官方网站的文档。对于关键项目在论文方法部分或代码的README中注明你所使用的数据版本和癌症类型缩写对照的来源例如“Cancer type abbreviations were based on the TCGA project designations as retrieved from the GDC Data Portal in January 2023”。这增加了研究的可重复性。6. 进阶技巧从缩写到深度理解的资源延伸掌握缩写只是第一步。真正发挥TCGA数据价值需要知道每个癌种背后的生物学特性、临床问题和分析资源。6.1 关联癌种特异性分析工具与数据库每个TCGA癌种都有一些特别受关注的分析工具或数据库BRCA: 可以使用BRCAness相关签名来评估同源重组修复缺陷状态。关注cBioPortal上的乳腺癌专属数据集。GBM/LGG: 脑肿瘤浸润免疫细胞分析工具如CIBERSORTx常用需注意血脑屏障的影响。参考IVY GAP数据库的空间转录组数据。SKCM/LUAD: 免疫检查点抑制剂疗效预测是热点。TIDE数据库和IMvigor210等免疫治疗队列数据是重要的验证资源。PAAD: 肿瘤微环境特别是癌症相关成纤维细胞分析至关重要。EPIC、MCP-counter等反卷积工具常用。6.2 利用缩写进行高效数据检索与批量下载当你需要下载多个癌种的数据时缩写列表就是你的批处理脚本的核心输入。# 假设有一个包含目标癌种缩写的文件 cancer_list.txt # 内容 # BRCA # LUAD # COAD # 使用GDC Data Transfer Tool进行批量下载示例 while read cancer; do gdc-client download -m manifest_${cancer}.txt done cancer_list.txt在R的TCGAbiolinks包或Python的gdcdownload等工具中你也可以轻松地循环遍历一个缩写列表来自动化数据查询和下载流程这能节省大量手动操作的时间。6.3 在论文写作与学术交流中的规范表达在撰写论文时首次出现时定义在摘要或引言部分首次提到某个TCGA癌种时应使用全称并括号注明缩写例如“...using lung adenocarcinoma (LUAD) data from The Cancer Genome Atlas (TCGA).”图表中保持一致如前所述图表中的标签应尽可能清晰。方法部分详细说明在“数据获取”部分明确列出所使用的所有TCGA项目缩写并说明数据版本和下载来源。这体现了研究的严谨性。最后我个人最深刻的体会是对待这些缩写就像对待实验中的化学试剂标签一样必须准确无误。它看似是微不足道的细节却构成了整个数据分析大厦的基石。花一点时间整理好这份对照表并将其固化到你的分析流程和知识体系中未来在处理任何TCGA相关数据时你都会感到无比顺畅和自信。我习惯在每一个新的癌症基因组学分析项目的开头第一个脚本就是定义这个tcga_dict它像是一把可靠的钥匙帮我打开后续所有分析的大门。
TCGA癌症类型缩写对照表:命名规则、核心价值与数据分析实战指南
1. 项目概述为什么我们需要一份靠谱的TCGA癌症简称对照表如果你刚接触癌症基因组学或者正在处理TCGAThe Cancer Genome Atlas的数据第一个让你头大的可能不是复杂的算法而是那些眼花缭乱的缩写。BRCA、LUAD、SKCM、COAD……这些看起来像密码一样的字母组合背后代表的是乳腺癌、肺腺癌、皮肤黑色素瘤、结肠腺癌等具体的癌症类型。我刚开始做生信分析的时候就曾经因为把“LUSC”肺鳞癌和“LUAD”肺腺癌搞混导致后续的差异表达分析完全跑偏浪费了好几天时间。这让我意识到一份准确、全面、随时可查的TCGA癌症中英文对照表绝不是可有可无的参考资料而是高效、准确开展研究工作的“导航仪”和“避坑指南”。这份对照表的核心价值在于建立一座桥梁连接起简洁的数据库标识符缩写和人类可理解的疾病名称全称。TCGA项目为了数据管理和标准化为每种癌症类型分配了唯一的、通常是四个字母的缩写。这些缩写大多遵循一定的命名逻辑比如取器官英文名的前几个字母加上癌症类型但也不乏一些历史原因形成的特例。对于数据分析师、临床研究员甚至期刊编辑来说能够快速、无误地进行这种转换是保证沟通无误、分析正确、论文严谨的基础。本文将不仅仅罗列一份对照表更会深入拆解这些缩写背后的命名规则、常见的使用场景、以及在实际工作中如何高效地管理和应用这份知识让你彻底摆脱缩写混淆的困扰。2. TCGA癌症缩写命名规则深度解析理解命名规则能让你从死记硬背变为逻辑推断即使遇到陌生的缩写也能猜个八九不离十。TCGA的癌症缩写体系并非完全随意其核心逻辑可以归纳为“器官类型”的简写组合。2.1 基于器官英文名称的缩写这是最常见的一类。通常取器官或组织英文名称的前2-3个字母。BRCA:BreastCarcinoma。乳腺癌。这里“Ca”是Carcinoma癌的常用缩写。LUAD:LungAdenocarcinoma。肺腺癌。注意是“肺”的“Lu”和“腺癌”的“Ad”。LUSC:LungSquamousCell carcinoma。肺鳞状细胞癌。这里体现了“鳞状细胞”的“S”和“C”。COAD:ColonAdenocarcinoma。结肠腺癌。READ:RectumAdenocarcinoma。直肠腺癌。KIRC:KidneyRenalClear cell carcinoma。肾透明细胞癌。这里稍微复杂“Ki”是肾脏“R”和“C”分别代表Renal和Clear。THCA:ThyroidCarcinoma。甲状腺癌。2.2 基于组织学类型或特殊命名的缩写有些缩写更侧重于癌症的特定组织学类型或沿用历史名称。SKCM:SkinCutaneousMelanoma。皮肤黑色素瘤。这里“M”代表Melanoma。GBM:GlioblastomaMultiforme。多形性胶质母细胞瘤。这是脑肿瘤中最常见且恶性程度最高的一种其缩写直接来源于疾病名称。LAML:LeukemiaAcuteMyeloidLeukemia。急性髓系白血病。这是一种血液系统肿瘤缩写体现了“白血病”和“急性髓系”的组合。OV:Ovarian serous cystadenocarcinoma。卵巢浆液性囊腺癌。这是一个特例只用“OV”两个字母代表卵巢癌主要是历史沿用和简洁性考虑。2.3 容易混淆的缩写对及其区分要点在实际工作中以下几对缩写最容易出错需要特别留意LUAD vs. LUSC: 这可能是最高频的“坑”。两者都是肺癌但LUAD是腺癌AdenocarcinomaLUSC是鳞癌Squamous Cell carcinoma。两者的起源细胞、驱动基因、治疗策略和预后都有显著差异。在下载数据或筛选样本时务必double-check。COAD vs. READ: 两者都是消化道腺癌但部位不同。COAD是结肠ColonREAD是直肠Rectum。在涉及结直肠癌的研究中有时会使用“CRC”Colorectal Cancer来统称但TCGA数据是分开的。KIRC vs. KIRP vs. KICH: 这都是肾脏肿瘤。KIRC是肾透明细胞癌最常见KIRP是肾乳头状细胞癌KICH是肾嫌色细胞癌。它们的分子特征和临床行为不同。注意永远不要凭印象猜测。当你在脚本中过滤样本、在论文中描述队列、或在报告中展示结果时对缩写的误用会导致整个研究基础的错误。最稳妥的方法是随时查阅可靠的对照表并在代码中用注释明确标注。3. 完整TCGA癌症类型中英文对照与关键信息表下面这张表是我在多年工作中整理和验证的核心对照表不仅包含缩写和全称还补充了常见样本量范围和关键注释这能帮助你在实验设计或数据解读时更有数。TCGA项目缩写英文全称中文全称常见样本量范围肿瘤正常关键注释与常见用途ACCAdrenocortical Carcinoma肾上腺皮质癌~80罕见肿瘤研究内分泌相关癌变机制BLCABladder Urothelial Carcinoma膀胱尿路上皮癌~400常用干湿结合验证模型BRCABreast invasive carcinoma乳腺浸润性癌~1100数据最丰富分型Luminal A/B, HER2, Basal-like研究多CESCCervical squamous cell carcinoma and endocervical adenocarcinoma宫颈鳞癌和宫颈腺癌~300包含两种主要病理类型与HPV感染强相关CHOLCholangiocarcinoma胆管癌~50样本量小预后差是研究难点COADColon adenocarcinoma结肠腺癌~450常与READ合并为结直肠癌CRC分析DLBCLymphoid Neoplasm Diffuse Large B-cell Lymphoma弥漫大B细胞淋巴瘤~50血液淋巴系统肿瘤基因组变异复杂ESCAEsophageal carcinoma食管癌~200需注意区分食管鳞癌ESCC和腺癌EAC亚型GBMGlioblastoma multiforme多形性胶质母细胞瘤~600中枢神经系统最常见恶性瘤免疫治疗研究热点HNSCHead and Neck squamous cell carcinoma头颈部鳞状细胞癌~500与HPV感染状态密切相关影响预后KICHKidney Chromophobe肾嫌色细胞癌~70肾癌三种主要类型之一相对惰性KIRCKidney renal clear cell carcinoma肾透明细胞癌~600肾癌最常见类型VHL基因突变特征明显KIRPKidney renal papillary cell carcinoma肾乳头状细胞癌~300另一种主要肾癌类型LAMLAcute Myeloid Leukemia急性髓系白血病~200血液肿瘤样本多为外周血或骨髓LGGBrain Lower Grade Glioma脑低级别胶质瘤~500包含星形细胞瘤、少突胶质细胞瘤等LIHCLiver hepatocellular carcinoma肝细胞肝癌~400与乙肝病毒、肝硬化关联大异质性强LUADLung adenocarcinoma肺腺癌~500非小细胞肺癌主要亚型驱动基因EGFR, ALK明确LUSCLung squamous cell carcinoma肺鳞状细胞癌~500非小细胞肺癌另一主要亚型与吸烟关系更密切MESOMesothelioma间皮瘤~80罕见多与石棉暴露相关OVOvarian serous cystadenocarcinoma卵巢浆液性囊腺癌~600妇科常见恶性肿瘤早期诊断难PAADPancreatic adenocarcinoma胰腺腺癌~180“癌王”预后极差肿瘤微环境研究多PCPGPheochromocytoma and Paraganglioma嗜铬细胞瘤和副神经节瘤~180神经内分泌肿瘤多与遗传综合征相关PRADProstate adenocarcinoma前列腺腺癌~500男性常见肿瘤雄激素受体信号通路是关键READRectum adenocarcinoma直肠腺癌~170常与COAD合并分析但保留独立标识SARCSarcoma肉瘤~250间叶组织来源包含多种亚型异质性极高SKCMSkin Cutaneous Melanoma皮肤黑色素瘤~470免疫检查点抑制剂疗效显著的癌种STADStomach adenocarcinoma胃腺癌~440与幽门螺杆菌感染相关分子分型如TCGA分型重要TGCTTesticular Germ Cell Tumors睾丸生殖细胞肿瘤~150年轻人多见治愈率高THCAThyroid carcinoma甲状腺癌~500最常见内分泌恶性肿瘤通常预后良好THYMThymoma胸腺瘤~120前纵隔肿瘤常伴发自身免疫性疾病UCECUterine Corpus Endometrial Carcinoma子宫体子宫内膜癌~550妇科常见肿瘤分型POLE突变型、MSI型等影响治疗UCSUterine Carcinosarcoma子宫癌肉瘤~60罕见但高度恶性UVMUveal Melanoma葡萄膜黑色素瘤~80眼内恶性肿瘤与皮肤黑色素瘤基因组特征不同这张表的价值在于当你在UCSC Xena、cBioPortal或GDC数据门户浏览数据集时可以快速定位。比如你想研究免疫治疗相关的生物标志物那么SKCM黑色素瘤、LUAD肺腺癌和BLCA膀胱癌通常是首选因为这些癌种对免疫检查点抑制剂的响应数据相对丰富。4. 实操应用如何在数据分析流程中高效集成与使用对照表知道了对照表更关键的是把它用起来融入你的日常工作流避免每次用到都去临时搜索。这里分享几种我实践过的高效方法。4.1 在生物信息学分析脚本中的集成最推荐的方式是将对照表直接编码到你的R或Python分析脚本的开头作为一个字典或数据框。这样既能保证准确性又能实现自动化查询。R语言示例# 在脚本开头定义TCGA癌症类型对照字典 tcga_dict - list( ACC Adrenocortical Carcinoma, BLCA Bladder Urothelial Carcinoma, BRCA Breast invasive carcinoma, LUAD Lung adenocarcinoma, LUSC Lung squamous cell carcinoma, SKCM Skin Cutaneous Melanoma # ... 可以继续补充完整 ) # 使用函数进行转换 get_cancer_full_name - function(abbr) { if (abbr %in% names(tcga_dict)) { return(tcga_dict[[abbr]]) } else { warning(paste(Abbreviation, abbr, not found in dictionary.)) return(NA) } } # 应用清洗样本ID中的癌症类型信息 sample_ids - c(TCGA-AA-3972-01A, TCGA-DD-A39V-01A) cancer_abbr - substr(sample_ids, 6, 7) # 假设项目缩写在6-7位根据GDC最新ID结构可能需调整 cancer_full - sapply(cancer_abbr, get_cancer_full_name) print(cancer_full)Python示例# 定义对照字典 tcga_dict { ACC: Adrenocortical Carcinoma, BLCA: Bladder Urothelial Carcinoma, BRCA: Breast invasive carcinoma, LUAD: Lung adenocarcinoma, LUSC: Lung squamous cell carcinoma, SKCM: Skin Cutaneous Melanoma } # 使用函数 def get_cancer_full_name(abbr): return tcga_dict.get(abbr, fUnknown abbreviation: {abbr}) # 应用在pandas DataFrame中添加一列全称 import pandas as pd # 假设df有一个‘project_id’列值为‘TCGA-LUAD’等 df[cancer_abbr] df[project_id].str.split(-).str[1] df[cancer_full_name] df[cancer_abbr].map(tcga_dict)4.2 在数据可视化图表中的规范使用在绘制发表级图表时使用全称或“缩写全称”的格式能极大提升图表的可读性和专业性。不佳示例图例直接写“LUAD”、“LUSC”。对于非本领域的读者或审稿人不够友好。推荐示例图例写“Lung adenocarcinoma (LUAD)” 和 “Lung squamous cell carcinoma (LUSC)”。或在图表标题或注释中说明“LUAD, lung adenocarcinoma; LUSC, lung squamous cell carcinoma”。在ggplot2 (R) 或 matplotlib/seaborn (Python) 中你可以在绘制前通过一个映射向量将数据框中的缩写列直接替换为这种组合格式的标签。4.3 创建个人知识库或速查笔记除了嵌入代码建立一个随时可查的个人知识库也至关重要。我习惯使用以下任何一种方式本地文本文件如tcga_abbreviations.txt或tcga_cheatsheet.md放在项目根目录。电子表格如Excel或Google Sheets可以方便地排序、筛选并添加更多自定义列如“相关标志物”、“常用分析工具”等。笔记软件如Notion、Obsidian等利用双向链接功能将TCGA缩写与相关的分析笔记、文献链接起来形成知识网络。5. 常见问题与易错点排查实录即使有了对照表在实际操作中还是会遇到一些坑。这里总结几个我踩过的雷和解决方案。5.1 样本ID与项目缩写提取错误问题TCGA的样本ID格式经历过变化如旧版的“TCGA-02-0001-01”到GDC的“b117f0b6-7b7f-4e9b-89b3-2f6b5c5b5b5b”等UUID。直接从样本ID中提取项目缩写时位置可能不对。旧版IDTCGA-02-0001-01项目缩写是前两个字母后的两位数字02需要再对照一个内部映射表02可能对应某种癌症。GDC数据更可靠的方式不是从样本ID硬提取而是利用元数据文件。下载数据时通常会有一个metadata.json或MANIFEST.txt文件里面包含了每个文件对应的project_id例如TCGA-LUAD这才是准确的项目标识。实操心得永远不要假设ID的结构是固定的。优先使用官方数据门户如GDC Data Portal提供的元数据中的project_id字段来获取癌症类型缩写这是最权威的方法。5.2 合并癌种分析时的缩写处理问题当需要合并多个癌种进行分析时例如研究泛癌标志物如何在结果中清晰标识来源错误做法在最终结果表格或图中只用一个新代号如“Pan-Cancer”丢失了具体癌种信息。正确做法保留原始缩写作为前缀或后缀。例如在基因表达矩阵中列名可以使用LUAD_TCGA-AA-1234和LUSC_TCGA-BB-5678这样的格式。在绘制热图时可以通过行或列注释条annotation bar来高亮显示不同的癌种缩写。5.3 与其它数据库缩写体系的冲突问题除了TCGA其他数据库如ICGC、CCLE等也有自己的样本命名或癌症缩写体系混用时容易混淆。案例CCLE癌症细胞系百科全书中一个肺癌细胞系可能叫NCI-H1650它对应的癌症类型是肺腺癌LUAD但在CCLE内部标识中可能不直接使用“LUAD”。解决方案在涉及多数据源整合的项目中建议建立一个中心映射表。这个表至少包含以下几列数据源、内部标识符、统一癌症类型缩写TCGA标准、癌症全称。所有后续分析都基于“统一癌症类型缩写”进行这样可以确保一致性。5.4 缩写更新与版本管理问题TCGA项目本身是动态的虽然主要癌种已固定但一些子项目或更新数据集的命名可能需要留意。建议定期查看NCI GDC官方网站的文档。对于关键项目在论文方法部分或代码的README中注明你所使用的数据版本和癌症类型缩写对照的来源例如“Cancer type abbreviations were based on the TCGA project designations as retrieved from the GDC Data Portal in January 2023”。这增加了研究的可重复性。6. 进阶技巧从缩写到深度理解的资源延伸掌握缩写只是第一步。真正发挥TCGA数据价值需要知道每个癌种背后的生物学特性、临床问题和分析资源。6.1 关联癌种特异性分析工具与数据库每个TCGA癌种都有一些特别受关注的分析工具或数据库BRCA: 可以使用BRCAness相关签名来评估同源重组修复缺陷状态。关注cBioPortal上的乳腺癌专属数据集。GBM/LGG: 脑肿瘤浸润免疫细胞分析工具如CIBERSORTx常用需注意血脑屏障的影响。参考IVY GAP数据库的空间转录组数据。SKCM/LUAD: 免疫检查点抑制剂疗效预测是热点。TIDE数据库和IMvigor210等免疫治疗队列数据是重要的验证资源。PAAD: 肿瘤微环境特别是癌症相关成纤维细胞分析至关重要。EPIC、MCP-counter等反卷积工具常用。6.2 利用缩写进行高效数据检索与批量下载当你需要下载多个癌种的数据时缩写列表就是你的批处理脚本的核心输入。# 假设有一个包含目标癌种缩写的文件 cancer_list.txt # 内容 # BRCA # LUAD # COAD # 使用GDC Data Transfer Tool进行批量下载示例 while read cancer; do gdc-client download -m manifest_${cancer}.txt done cancer_list.txt在R的TCGAbiolinks包或Python的gdcdownload等工具中你也可以轻松地循环遍历一个缩写列表来自动化数据查询和下载流程这能节省大量手动操作的时间。6.3 在论文写作与学术交流中的规范表达在撰写论文时首次出现时定义在摘要或引言部分首次提到某个TCGA癌种时应使用全称并括号注明缩写例如“...using lung adenocarcinoma (LUAD) data from The Cancer Genome Atlas (TCGA).”图表中保持一致如前所述图表中的标签应尽可能清晰。方法部分详细说明在“数据获取”部分明确列出所使用的所有TCGA项目缩写并说明数据版本和下载来源。这体现了研究的严谨性。最后我个人最深刻的体会是对待这些缩写就像对待实验中的化学试剂标签一样必须准确无误。它看似是微不足道的细节却构成了整个数据分析大厦的基石。花一点时间整理好这份对照表并将其固化到你的分析流程和知识体系中未来在处理任何TCGA相关数据时你都会感到无比顺畅和自信。我习惯在每一个新的癌症基因组学分析项目的开头第一个脚本就是定义这个tcga_dict它像是一把可靠的钥匙帮我打开后续所有分析的大门。