基因坐标 · 2026-06-09
hg19与hg38坐标不同,调控峰迁移后还能直接比较吗
组装版本改变的不只是数字
新参考组装会修正错误、补入序列并调整染色体表示。一个区域在hg19和hg38中的起止位置不同,有些片段甚至改变方向或无法唯一放置。因此把版本标签从文件名改掉,并不会让坐标自动变成新版本。
链文件描述的是映射关系
常用转换工具依赖chain file记录组装之间的对齐。能够转换表示找到了可接受的对应区域,但不代表局部序列和功能注释完全相同。对于宽峰,还要检查转换后长度是否异常、是否被拆成多段。
无法映射也是研究结果
一些peak会落在新组装重构或移除的区域。把这些记录静默删除会高估一致性。应报告原始数量、成功转换数量、重复映射和失败数量,并检查失败是否集中在特定染色体或重复序列。
基因注释版本要一起更新
即使坐标成功迁移,最近基因、TSS、外显子和启动子定义也可能因GENCODE或RefSeq版本变化而不同。旧研究把一个峰标给基因A,新注释可能出现更近的转录本。比较时应保留当时注释与当前注释两层信息。
信号轨道与峰文件分开处理
bigWig信号、BED峰、差异分析结果和基因列表需要不同转换策略。只迁移peak而继续使用旧版信号轨道,会让浏览器显示位置错位。原始reads若条件允许,重新比对到目标组装通常比多次坐标转换更稳妥。
跨版本比较的最低报告
至少记录原版本、目标版本、转换工具、chain file版本、成功率和失败处理。若结论依赖单个关键增强子,应检查该区域的序列、注释和浏览器轨道,而不是只相信批量转换的返回状态。
何时不应强行合并
当旧数据缺少版本说明、峰大量无法映射或样本处理差异远大于版本差异时,强行合并可能制造精确假象。可以把旧数据用于提出假设,把新版一致流程的数据用于主要统计,并在图中明确区分。
先识别文件到底使用哪个版本
有些旧文件没有在文件名写组装版本,可以从染色体长度、论文方法、轨道链接或同时发布的注释推断。推断仍应标记为不确定;关键结果若无法确认版本,不宜与新数据直接叠加。
染色体命名也会阻断工具
chr1与1、chrM与MT看似只是格式差异,却可能让工具认为不存在相同染色体。转换前统一命名风格,并检查非标准contig和未定位片段是否被保留。
一对多映射需要明确策略
某些旧区域可能对应新组装的多个位置。保留全部会重复计数,只留第一个又可能选错。策略应根据研究问题制定,并单独报告多重映射区域,而不是混入唯一映射结果。
区间端点的处理会影响峰宽
BED采用零起始、半开区间,其他格式可能使用一起始和闭区间。格式转换若忽略这一点,会产生一个碱基偏移。对窄motif或切割位点,这种偏移比对宽峰更明显。
转换后的排序与索引要重建
坐标变化后,原文件排序可能失效。许多工具要求按染色体和起点排序,tabix等索引也必须重建。继续使用旧索引会返回错误区域或直接报错。
差异峰分析最好在同一版本重跑
若能取得原始reads,把所有样本重新比对到同一参考组装并用一致流程调用峰,通常比转换不同来源的最终峰更适合定量比较。坐标迁移更适合历史定位和无法重跑的数据。
功能注释数据库也有版本
motif、保守性、重复序列和调控区目录会更新。坐标迁移成功后继续套用旧注释,可能形成时间层级混杂。报告中应区分坐标版本和功能注释版本。
图形检查能发现批量统计漏掉的问题
随机抽查几个稳定区域、几个失败区域和研究中的关键区域。查看局部序列、基因注释和信号轨道,常能发现方向颠倒、区间异常放大或错误染色体命名。
跨物种比较不是普通坐标转换
hg38与mm10之间涉及同源区域和物种差异,不能使用同一物种组装转换的逻辑。需要考虑同源基因、保守元件和一对多关系,结论也应从“同一位置”改为“可能对应的保守区域”。
为未来保留双版本索引
发布结果时可保存原始坐标和目标坐标,并附转换状态。未来参考组装再次更新时,仍能从原始版本重新转换,不必从已经转换过一次的坐标继续累计误差。
参考组装与补丁版本也要区分
GRCh38仍包含补丁和替代位点更新。多数常规分析使用主要组装,但某些免疫或高度多态区域可能依赖替代序列。记录具体参考FASTA和索引来源,比只写hg38更完整。
黑名单区域需要使用对应版本
ENCODE blacklist用于排除容易产生异常高信号的区域。hg19与hg38黑名单坐标不同,不能把旧文件直接套到新组装。黑名单处理也应记录,因为它会改变峰数量和局部结论。
基因符号更新可能造成表面丢失
坐标迁移后若使用新版注释,旧基因符号可能变成新名称或拆分记录。建立稳定ID和符号历史对应关系,可以区分真正没有映射与只是名称更新。
临床变异不能只靠坐标迁移
变异描述还涉及参考与替代等位基因、左对齐和规范化。迁移后要检查新参考序列是否与记录一致。对于医学解释,应使用专门工具和标准,不把普通区间转换当作完整变异转换。
峰中心与整个区间的转换用途不同
motif分析常关注峰中心附近,区域富集则使用完整峰宽。转换后中心位置可能相对移动,宽峰也可能改变边界。后续分析需要哪一种对象,应在迁移前确定。
合并多个旧研究时先建立版本矩阵
列出每个研究的组装、注释、文件类型和是否有原始reads。能够重跑的放入统一流程,只能转换的单独标记,版本未知的保留在探索层。矩阵能避免处理中途才发现无法对齐。
链式多次转换会累计损失
从hg18转hg19再转hg38通常不如直接使用hg18到hg38的对应关系。每次转换都可能丢失或拆分区间。保留最初坐标和直接转换路径,可以减少累积误差。
统计显著不代表转换影响可以忽略
大量peak中即使只有少数转换失败,若失败区域集中在研究关键基因,仍会改变结论。应同时报告整体成功率和关键集合成功率,而不是只给一个很高的总百分比。
公开轨道需要在说明中写清版本
浏览器hub、bigBed和bigWig若缺少组装标记,读者很容易加载到错误环境。轨道名称、说明和下载页应重复标注版本,并让文件URL保持稳定。
停止强行比较也是合理结论
若关键样本版本不明、映射失败集中、注释差异巨大,最严谨的决定可能是不合并。可以分别报告各版本内部结果,并解释为何无法形成统一统计。
坐标转换前先保留文件校验值
原始BED或VCF的哈希能证明后续处理使用的是哪一个输入。转换脚本、日志和输出校验值一起保存,可把每次处理连成清楚链条,也能发现文件被意外覆盖。
注释窗口应在新版本重新计算
旧文件中已经写好的最近基因和TSS距离,不能随坐标一起原样搬到新组装。迁移完成后应使用目标版本注释重新计算,旧字段保留作历史对照。
可重复区域特别容易出现变化
着丝粒附近、端粒、免疫基因簇和其他复杂区域在组装更新中改变较多。研究若聚焦这些位置,应优先检查组装说明和替代位点,而不是依赖通用成功率。
浏览器会话也需要版本管理
保存的session包含轨道URL、显示范围和组装。更新轨道后旧session可能仍加载缓存文件。关键图应记录会话日期和轨道版本,并导出一份可复查配置。
下游富集分析会继承迁移偏差
若无法映射的peak集中在特定基因家族,后续GO或通路富集会发生系统偏差。迁移后比较成功与失败集合的功能分布,可以判断缺失是否近似随机。
最终报告同时给出数量和比例
只写成功转换了十万个区域无法判断质量,只写百分比又看不到规模。报告原始、唯一成功、多重映射、拆分和失败的数量及比例,更容易评估对结论的影响。
转换日志需要能定位单条失败
总数报告之后,还应保存每个原始区间的状态和目标坐标。遇到关键基因异常时,可以直接查回失败原因,不必重新运行全部数据。
BED文件中的附加列不能随意丢弃
名称、分数、链方向和实验标签可能位于第四列之后。转换工具只处理前三列时,应在转换前建立稳定ID,再把附加资料按ID合并回来。
坐标排序规则要处理特殊染色体
字符串排序会把chr10放在chr2之前,某些流程因此出现索引问题。使用自然染色体顺序,并明确如何处理chrX、chrY、chrM与非标准contig。
多个峰合并时保留来源
迁移后重叠的旧峰不一定是同一实验事件。合并区间可以用于总览,但应保留来源样本和原始坐标,否则无法判断重叠来自生物一致性还是转换后的边界扩大。
图表中的旧坐标要明确标识
如果为了对应历史论文同时展示hg19和hg38,应在轴标签、图注和下载文件中重复标注。让读者靠上下文猜版本,是坐标错误最常见的来源之一。
转换工具升级也可能改变结果
工具版本、chain解析和错误处理会更新。项目复现时应记录版本和命令。新版本重跑若产生差异,把差异作为版本更新记录,而不是覆盖原输出。
局部序列变化会影响motif判断
一个区域成功迁移,并不表示其中碱基完全相同。若结论依赖具体motif,应该从目标组装重新提取序列并扫描,而不是沿用旧版motif结果。
定量信号不适合只移动区间
bigWig中的每个位置都有信号值,普通BED转换无法完整迁移。能取得原始比对时应重新生成信号;只能使用旧轨道时,限制解释为定位参考,不做精确定量比较。
浏览器截图中的基因模型会更新
同一坐标在新版浏览器可能显示不同转录本。引用历史截图时说明当时注释,制作新图时使用当前注释,并解释重要差异,不把显示变化误认为实验结果变化。
建立自动检查但保留人工抽样
脚本可以检查染色体、范围、排序、重复和转换率。自动检查通过后仍抽看关键区域,因为格式正确不代表生物解释正确。两层检查比只依赖其中一种可靠。
迁移结束后再做一次局部核对
批量转换给出规模,关键区域检查保证解释。把失败和不确定映射保留下来,通常比追求百分之百成功率更诚实。