FBFlyBitADDRESS & EVIDENCE
注册入口下载

数据来源 · 2026-06-22

从GEO与ENCODE编号追溯一项实验,应该看哪些信息

编号只是入口;样本来源、处理、抗体、重复、参考基因组和处理流程才决定资料能否比较。

编号先解决身份问题

GEO的GSM通常对应样本,GSE对应系列;ENCODE则以自己的accession组织实验、文件、生物样本和分析流程。引用编号的价值是让其他人回到原记录,而不是把一串字母数字当成质量标签。打开记录后应确认它描述的是原始数据、处理文件还是整个实验集合。

样本来源决定问题是否相同

细胞系、原代细胞、组织和类器官不是可以任意合并的标签。培养条件、供体信息、分化阶段、疾病状态与处理时间都会改变染色质和表达。若论文只写“human cells”,而数据库记录能提供更具体条件,解释应以可核对的元数据为准。

实验设计藏在细节里

ChIP-seq需要关注抗体、input或IgG对照、重复和交联条件;ATAC-seq要关注细胞数、核提取、转座反应与线粒体比例;RNA-seq则涉及链特异性、文库类型和测序深度。两份文件格式相同,不代表实验设计可比。

处理流程会改变峰集合

不同版本的比对器、黑名单、重复序列处理、peak caller和阈值会产生不同结果。ENCODE的保守IDR峰与研究者自行上传的单次peak文件属于不同处理层级。整合前最好回到方法说明,而不是只下载最终BED。

基因组版本必须明确

GRCh37/hg19和GRCh38/hg38的坐标不能直接叠加。liftOver可迁移许多区域,但无法保证一一对应;重复区域、结构变化和未映射片段都要保留。小鼠mm9与mm10也有相同问题。

下载之后建立最小记录

保存文件时同时记录accession、下载日期、文件校验值、参考版本和使用目的。文件名应能区分原始、标准化和自己处理的版本。若重新运行流程,把参数和软件版本与结果放在同一个项目记录中。

比较前先写排除条件

明确哪些样本会因组织不符、处理条件缺失、重复不足或版本无法统一而被排除。预先写条件能减少看到结果后再挑样本的偏差,也让后续人员理解为什么数据库里明明有更多记录却没有全部使用。

从系列说明找到实验设计

GSE页面通常描述研究问题和整体样本安排,GSM则记录单个样本。先读系列设计,再打开具体样本,比较组别、处理和重复会更清楚。只从一个GSM进入,容易漏掉与它配对的对照。

补充文件名称透露处理层级

文件名中的raw、counts、normalized、peaks、signal等词提示内容,但不能替代README或方法。一个名为final的文件也可能是作者项目内部的最终版,而不是数据库标准流程的最终产物。

FASTQ、BAM、BED各自回答不同阶段

FASTQ保留测序reads,BAM记录比对结果,BED常用于峰或区间。若只拿到BED,就无法重新判断比对和去重复策略;若要统一处理多个研究,应尽量从较早的数据层级开始,同时评估计算成本。

参考样本和实验对照不能混称

健康组织不一定是技术对照,input也不是生物学对照。前者用于回答状态差异,后者帮助识别实验背景。资料表中应分开记录,避免在差异分析中把技术控制当作独立生物样本。

发布日期与数据产生时间不同

数据库公开日期、论文发表日期和实验采集日期可能相隔很久。判断技术版本和样本时代时,应看实验记录;判断何时可以公开引用,则看数据库和论文日期。

撤回、更新和替换文件需要追踪

作者可能补充元数据、替换文件或撤回样本。再次下载时比较文件大小、校验值和页面更新时间。旧分析若依赖已替换文件,应在报告中保留当时版本,而不是静默覆盖。

跨研究批次效应不能靠样本数消失

把更多研究合并会增加规模,也会带入实验室、平台、抗体和流程差异。批次校正只能处理模型能够识别的部分。研究设计若与分组完全重合,算法无法区分真实效应和批次效应。

把原始事实与自己的判断分栏

样本名称、处理时间和accession属于来源事实;是否纳入、如何分组和质量是否足够属于分析判断。两类信息分开保存,之后修改筛选规则时不必重抄原始记录。

引用时给别人回去的路径

文章中写数据库名称还不够,应列出系列或实验accession,并说明使用了哪些文件。若数据经过自己的流程处理,再提供软件版本和关键参数。可追溯引用能让读者判断结论是否超出原实验。

自动抓取之后仍需人工阅读

API适合批量取得字段,但数据库中的自由文本、补充文件和论文方法往往包含关键条件。自动化可以找候选,不能替代对重要样本的逐项阅读。最值得人工核对的是最终进入结论的那一小组数据。

SRA与GEO之间要建立对应关系

部分GEO样本会链接到SRA运行编号。一个GSM可能对应多个run,也可能把技术重复拆开保存。下载原始reads时建立GSM、SRX、SRR之间的对应表,才能在合并和质控时保留原实验结构。

受控访问资料不能假装公开下载

涉及个体基因组或临床资料的数据可能只公开摘要,原始文件需要申请。缺少访问权限时,可以引用元数据和论文,不应使用来源不明的镜像补齐。研究计划也应区分公开资料与获批后才能使用的资料。

样本名称中的缩写需要回到原文

同一个细胞系可能有不同拼写,组织名称也可能用简称。自动合并前先建立同义词,并保留原始名称。过早标准化会把处理状态或亚型信息一起删掉,导致看似整齐却无法解释的样本表。

负对照文件也要进入清单

input、IgG、未处理样本和mock处理承担不同作用。下载时若只保留目标样本,后续无法重新评估背景。清单应记录每个目标样本对应哪个控制,以及控制是否真正来自同一实验批次。

同一论文可能发布多套处理结果

作者会同时提供原始计数、标准化矩阵、差异结果和用于作图的筛选表。使用前确认文件层级,避免把已经筛选过的显著结果重新当作完整输入进行统计。

元数据缺失时建立不确定等级

对于处理剂量、供体信息或参考版本缺失的样本,可以标记为高、中、低可用性。标记不是质量打分,而是说明当前研究问题所需字段是否齐全。关键字段缺失的样本可用于探索,不应进入主要比较。

下载日志也属于研究材料

记录下载工具、日期、接口、失败重试和文件校验。数据库更新后,日志能说明当时实际取得的版本。对于大批量下载,成功请求数不等于完整文件数,仍要检查大小与校验结果。

数据清理规则应在看结果前确定

去除低质量样本、异常重复和缺失字段都可能改变结论。先写清规则并保留排除原因,可以降低为了得到预期结果而调整样本的风险。探索阶段允许修改规则,但每次修改要留下版本。

重新分析应尊重原研究问题

统一流程能够减少技术差异,却可能忽略原作者针对特殊实验做的处理。阅读原方法,理解为什么选择特定对齐或峰调用参数,再决定统一重跑还是保留作者结果。

最终资料表只保留有用字段

元数据字段很多,全部搬进正文会妨碍阅读。工作底表可以完整保存,公开报告则选出与结论直接相关的样本、处理、来源、版本和质量信息,并提供清楚的追溯方式。

论文图表与数据库文件可能不是同一版本

作者在投稿后可能重新处理数据,数据库也可能晚于图表更新。若复现结果不同,检查文件日期、补充材料和作者说明,不要立刻把差异归因于代码错误。

标准化表达值不能跨项目直接拼接

TPM、FPKM和标准化counts的计算背景不同。跨研究比较时应尽量从一致层级重新处理,或使用适合批次与组成差异的方法。把已标准化矩阵直接连接,常会制造项目边界。

元数据本体有助统一但会损失细节

使用标准组织和细胞本体可以合并同义词,却可能把疾病亚型、培养阶段或处理状态压平。保留标准术语和原始描述两列,既便于检索,也能回看具体语境。

样本删除应允许后来复议

排除清单记录样本编号、理由、检查者和日期。新资料补充后,如果原先缺失字段得到确认,可以重新评估,而不必从零追查为什么当初没有纳入。

项目结束时冻结一份可引用快照

数据库会持续变化。分析完成后保存使用过的元数据、文件清单和许可允许范围内的衍生结果,并赋予项目版本。这样论文审阅或后续更新时仍能重建当时结论。

敏感样本的公开字段也要谨慎组合

单个字段看似不具识别性,多个地点、时间和罕见疾病字段组合后可能增加风险。公开报告只展示回答问题所需的粒度,受控资料遵守访问协议。

数据库页面的状态也要记录

同一accession可能暂时受限、撤回或只开放部分文件。采集时保存页面状态,能解释为什么后来的人看到不同内容。不可访问不应被写成数据不存在。

补充材料常保存关键对应表

论文正文篇幅有限,样本编号、抗体和处理组对应关系可能只在补充表。忽略补充材料会让下载文件无法正确分组。重要项目应把补充表纳入资料清单。

作者命名与数据库命名需要对照

论文中的Sample A可能对应数据库中的GSM编号,文件又使用另一套简写。建立三者对照后再进入分析,可避免把重复误认为独立样本或把处理组标签调换。

质控阈值应解释来源

FRiP、重复率和测序深度的门槛会随实验类型变化。采用平台建议、领域经验或项目内分布都可以,但要说明依据。没有依据的统一数字容易误删特殊样本。

最终引用应精确到实际使用对象

若只使用一个GSE中的三个GSM,就列出三个样本;若使用ENCODE的特定文件,就记录文件accession。精确引用让数据贡献者获得正确归属,也方便复现。

处理脚本要和输入清单绑定

同一段代码面对不同样本清单会产生不同结果。运行时保存实际输入文件列表、参数和日志,不要只保存脚本最新版。这样才能解释某个样本何时加入或移除。

人工核对要集中在高影响字段

不必逐字检查数据库所有描述。优先核对影响分组和解释的字段:生物样本、处理、时间、重复、抗体、参考版本和文件层级。把有限时间放在会改变结论的位置。

结论更新时注明新增资料

后来加入样本或替换文件后,结果变化应说明来自哪些新增证据。版本说明不需要很长,但要让读者知道变化源于资料更新,而不是同一数据得出相反结论。

让编号真正承担追溯功能

accession应带读者回到样本、实验和文件,而不是只装饰参考文献。能从结论走回原始记录,跨数据库整合才具备复查基础。