Methodology
분석 방법론 및 재현성 표준
SBM Lab의 분석 가이드는 재현 가능한 과학(reproducible science) 원칙을 따릅니다. 이 페이지는 콘텐츠 작성 시 적용되는 방법론적 표준을 명시합니다.
1. 재현성 원칙 (Reproducibility Principles)
모든 분석 가이드는 다음 4가지 재현성 기준을 충족합니다:
- 도구 버전 명시 — 사용한 R/Python 패키지의 정확한 버전 (예: DESeq2 v1.42.0)
- 의존성 관리 — 시스템 요구사항, 운영 체제, 의존 라이브러리 명시
- 매개변수 공개 — 모든 분석 파라미터를 본문에 명시 (기본값 사용 시도 명시)
- 실행 가능한 코드 — 복사·붙여넣기로 실제 실행 가능한 형태
2. 도구 버전 관리 정책
분야별 도구 버전 기준 (2026년 5월 기준):
| 도구 | 권장 버전 | 비고 |
|---|---|---|
| DESeq2 | v1.42+ | Bioconductor 3.18+ |
| edgeR | v4.0+ | Bioconductor 3.18+ |
| limma | v3.58+ | |
| Seurat | v5.0+ | v4 대비 메모리 효율 개선 |
| Scanpy | v1.10+ | |
| clusterProfiler | v4.10+ | |
| fgsea | v1.28+ | |
| STRINGdb | v2.14+ | STRING DB v12.0 사용 |
| Cytoscape | v3.10+ | |
| GATK | v4.5+ | |
| Cell Ranger | v8.0+ | 10x Genomics 공식 |
| Bioconductor | v3.18+ | R ≥ 4.3 기준 |
글마다 작성 시점의 버전이 명시되며, 도구 버전이 메이저 업데이트되면 (호환성 깨질 수 있음) 글을 검토하여 갱신합니다.
3. 코드 검증 절차
블로그에 게재되는 모든 코드 예제는 다음 검증을 거칩니다:
- 문법 검증 — 실제 R/Python 환경에서 syntax 오류 없이 실행됨을 확인
- 의도 검증 — 코드가 의도한 결과를 생성하는지 샘플 데이터로 확인
- 버전 호환성 — 최소 한 가지 권장 도구 버전에서 작동 확인
- 주석 정확성 — 모든 주석이 코드의 실제 동작과 일치하는지 검토
- 의존성 명시 — 필요한
library()/import문 모두 포함
코드 예제 사용 안내
제공된 코드는 교육·참고 목적입니다. 실제 연구에 적용 시 본인의 데이터 특성에 맞게 매개변수를 조정하고, 결과를 본인 환경에서 재현 검증해주세요. 코드는 MIT 라이선스로 자유롭게 사용할 수 있습니다 (보증 없음).
4. 통계 보고 표준 (Statistical Reporting Standards)
통계 분석 가이드는 다음 reporting 표준을 따릅니다:
차등 발현 분석 (DE Analysis)
- 다중 검정 보정 방법 명시 (Benjamini-Hochberg FDR가 기본)
- p-value/FDR 컷오프와 효과 크기(log2FC) 컷오프 모두 보고
- 표본 크기 (그룹별 N) 명시
- 배치 효과 처리 방법 명시
- 사전 필터링 기준 명시 (저발현 유전자 제거 등)
기능 농축 분석 (Enrichment)
- Background (universe) 정의 명확히 — 전체 유전체 vs 발현 검출된 유전자
- 다중 검정 보정 방법 (BH가 표준)
- FDR 컷오프 (보통 0.05) 와 효과 크기(NES) 컷오프 모두 보고
- 사용한 gene set 데이터베이스 버전 (MSigDB v2023.2.Hs 등)
- Leading edge 유전자 목록 supplementary 권장
생존 분석 (Survival Analysis)
- Cox proportional hazards 가정 검증 결과 보고
- Hazard Ratio (HR), 95% 신뢰구간, p-value 함께 제시
- 독립 코호트 검증 권장 (TCGA → METABRIC 등)
- 다변량 모델 시 공변량 명시
바이오마커 보고
- REMARK 가이드라인 준수 (Altman et al., 2012)
- TRIPOD 가이드라인 준수 (예측 모델, Collins et al., 2015)
- Discovery cohort와 validation cohort 명확히 구분
- 임상 적용성과 한계 함께 보고
5. 데이터 출처 기준
분석 가이드에서 사용하는 데이터 출처:
| 카테고리 | 권장 출처 | 라이선스 |
|---|---|---|
| 벌크 RNA-seq | TCGA, GEO, ArrayExpress | 공개 (CC-BY 등) |
| 단일세포 RNA-seq | Single Cell Portal, Tabula Sapiens, HCA | 공개 또는 dbGaP |
| 프로테오믹스 | PRIDE, MassIVE, iProX | 공개 |
| 유전체 변이 | 1000 Genomes, gnomAD | 공개 |
| 임상 | TCGA Pan-Cancer, MIMIC-III/IV | 신청 후 접근 |
| 참조 네트워크 | STRING, BioGRID, Reactome, KEGG | 공개 (KEGG 상업 제한) |
| 주석 | Ensembl, GENCODE, RefSeq, UniProt | 공개 |
| 발현 참조 | GTEx, Human Protein Atlas, FANTOM | 공개 |
예제에 사용된 데이터셋은 가능한 경우 GEO/SRA accession 번호 또는 다운로드 링크를 명시합니다.
6. 코드 공유 정책
블로그 글의 코드 예제는 다음 형태로 제공됩니다:
- 인라인 코드 블록 — 본문 내 직접 복사 가능
- 완전한 워크플로 — 입력에서 결과까지 단계별 코드
- 의존성 정보 —
library()/import문 포함 - 샘플 데이터 — 가능한 경우 공개 데이터 활용 또는 합성 데이터 생성 코드 포함
향후 GitHub repository에 더 큰 워크플로를 정리할 계획이 있습니다. 특정 글의 전체 코드 요청은 Contact를 통해 문의 가능합니다.
7. 함정과 한계 명시 (Pitfalls Documentation)
모든 기술 가이드는 다음 항목을 포함합니다:
- 흔한 실수 — 초보자가 자주 빠지는 함정
- 해석 함정 — 통계적으로 유의하지만 생물학적으로 무의미한 케이스
- 도구의 한계 — 어떤 데이터·시나리오에서 작동하지 않는지
- 대안 제시 — 한계가 있을 때 사용할 다른 방법
이 정책은 독자가 분석 결과를 비판적으로 해석할 수 있도록 돕습니다.
8. 콘텐츠 갱신 주기
분야별 권장 갱신 주기:
- 도구 비교 — 6개월~1년마다 검토 (도구 메이저 업데이트 시 즉시)
- 방법론 가이드 — 1년마다 검토 (best practice 변화 시 갱신)
- 벤치마크 결과 — 새 벤치마크 논문 발표 시 갱신
- 데이터베이스 정보 — 메이저 릴리스 시 갱신 (예: STRING v12 → v13)
- 임상 정보 — 새 가이드라인 발표 시 즉시 갱신
중요한 갱신은 글 상단에 "마지막 업데이트" 날짜를 명시합니다.
9. 한계와 면책
모든 분석 방법론에는 한계가 있습니다. SBM Lab의 가이드는 일반적인 best practice를 제시하지만, 특정 연구 맥락에서는 다른 접근이 더 적절할 수 있습니다.
본 블로그의 콘텐츠를 사용한 분석 결과의 정확성·적용 가능성은 사용자가 검증해야 합니다. SBM Lab은 콘텐츠를 통해 얻은 결과로 인한 직접적·간접적 손해에 대해 책임지지 않습니다.
10. 정책 갱신
이 Methodology 페이지는 분야의 발전에 따라 갱신됩니다. 주요 변경사항은 페이지 상단에 명시되며, 전반적 검토는 연 1회 이상 수행됩니다.
방법론 관련 제안 또는 문의는 Contact를 통해 보내주세요.
관련 페이지:SBM Lab 소개 ·Editorial Policy ·Privacy Policy ·Contact