返回 Liquid Agent 首页
使用文档
血液信号编码(中文)¶
项目保留一个内部血液信号编码核心,在其上提供按类型区分的用户入口脚本。
普通引导式使用从 liquid-agent 或 liquid-agent web 开始,请求对当前数据集编码。以下脚本仍是面向高级用户的可复现直接入口。
类型专用入口¶
scripts/encode_cfdna_foundation_features.pyscripts/encode_epigenomic_signal_features.pyscripts/encode_lpwgs_features.pyscripts/encode_variant_features.py
支持矩阵¶
| 信号家族 | 默认编码器 | 可选编码器 | 说明 |
|---|---|---|---|
cfchip_seq |
ntv2 |
dnabert2, hyenadna, caduceus, epibert, epcot, enformer, coverage_profile |
区间/比对输入使用基础模型编码器;连续轨道使用 coverage_profile |
cfmedip_seq |
epibert |
ntv2, dnabert2, hyenadna, caduceus, epcot, enformer, coverage_profile |
默认倾向甲基化感知 |
medip_seq |
epibert |
同上 | 与 cfmedip_seq 使用相同路由策略 |
lpwgs / ulpwgs |
lpwgs_cnv_profile |
coverage_profile、DNA 基础模型编码器 |
基础模型编码器在此仍属探索性 |
ctdna_variant / variant |
vcf_signature |
variant_effect_profile |
variant_effect_profile 需要预先注释的效应评分 |
接受的输入¶
根据不同信号家族,编码层支持:
bed,bed.gznarrowPeak,broadPeak,gappedPeakbam,crambedGraph,WIG,bigWigvcf,vcf.gzmaf,maf.gz,maf.tsv,maf.tsv.gzcnv_parquet
设计规则¶
只有在存在生物学上合理的序列窗口解释时才使用基础模型。否则,使用保留信号原生语义的确定性谱型编码器。
为何选择这些默认值¶
当前默认值并非简单选择最新模型。
ntv2保持为默认区间编码器,因为它成熟、公开,且在通用基因组表示学习中仍有基准竞争力。epibert保持为甲基化富集默认值,因为它比通用序列模型更贴合模态,但用户应比使用ntv2或dnabert2更谨慎地看待其打包检查点来源。lpwgs_cnv_profile保持为 LPWGS 默认值,因为 LPWGS 最适合作为拷贝数/覆盖度问题处理,而非通用序列嵌入问题。vcf_signature保持为变异默认值,因为原始 VCF/MAF 是稀疏事件表;只有上游注释确实存在时,才应采用可选效应模型聚合。
完整的保留/可选/观察列表理由见组件与方法。
核心参考¶
- Nucleotide Transformer
- DNABERT-2
- HyenaDNA
- Caduceus
- EpiBERT
- EPCOT / EPCOTv2
- Enformer
- 2025 年 DNA 基础模型基准
示例¶
cfDNA 基础模型:
python scripts/encode_cfdna_foundation_features.py \
--input_dir <dataset_or_subdir> \
--fasta <fasta_path> \
--model ntv2
表观基因组:
python scripts/encode_epigenomic_signal_features.py \
--signal cfchip_seq \
--input_format bed.gz \
--input_dir <input_dir> \
--encoder ntv2
LPWGS:
python scripts/encode_lpwgs_features.py \
--signal lpwgs \
--input_format bed.gz \
--input_dir <input_dir> \
--encoder lpwgs_cnv_profile
变异:
python scripts/encode_variant_features.py \
--signal variant \
--input_format vcf.gz \
--input_dir <input_dir> \
--encoder vcf_signature
元数据感知的后续分析¶
编码后,使用元数据感知的 cfDNA 分析或可视化查看样本组。助手可将 her2、HER2、Her2 或 response 等近似标签名与可用元数据列进行模糊匹配,仅当仍有多个合理选项时才请求澄清。