Methodology

분석 방법론 및 재현성 표준

SBM Lab의 분석 가이드는 재현 가능한 과학(reproducible science) 원칙을 따릅니다. 이 페이지는 콘텐츠 작성 시 적용되는 방법론적 표준을 명시합니다.

1. 재현성 원칙 (Reproducibility Principles)

모든 분석 가이드는 다음 4가지 재현성 기준을 충족합니다:

  • 도구 버전 명시 — 사용한 R/Python 패키지의 정확한 버전 (예: DESeq2 v1.42.0)
  • 의존성 관리 — 시스템 요구사항, 운영 체제, 의존 라이브러리 명시
  • 매개변수 공개 — 모든 분석 파라미터를 본문에 명시 (기본값 사용 시도 명시)
  • 실행 가능한 코드 — 복사·붙여넣기로 실제 실행 가능한 형태

2. 도구 버전 관리 정책

분야별 도구 버전 기준 (2026년 5월 기준):

도구권장 버전비고
DESeq2v1.42+Bioconductor 3.18+
edgeRv4.0+Bioconductor 3.18+
limmav3.58+
Seuratv5.0+v4 대비 메모리 효율 개선
Scanpyv1.10+
clusterProfilerv4.10+
fgseav1.28+
STRINGdbv2.14+STRING DB v12.0 사용
Cytoscapev3.10+
GATKv4.5+
Cell Rangerv8.0+10x Genomics 공식
Bioconductorv3.18+R ≥ 4.3 기준

글마다 작성 시점의 버전이 명시되며, 도구 버전이 메이저 업데이트되면 (호환성 깨질 수 있음) 글을 검토하여 갱신합니다.

3. 코드 검증 절차

블로그에 게재되는 모든 코드 예제는 다음 검증을 거칩니다:

  1. 문법 검증 — 실제 R/Python 환경에서 syntax 오류 없이 실행됨을 확인
  2. 의도 검증 — 코드가 의도한 결과를 생성하는지 샘플 데이터로 확인
  3. 버전 호환성 — 최소 한 가지 권장 도구 버전에서 작동 확인
  4. 주석 정확성 — 모든 주석이 코드의 실제 동작과 일치하는지 검토
  5. 의존성 명시 — 필요한 library() / import 문 모두 포함

코드 예제 사용 안내

제공된 코드는 교육·참고 목적입니다. 실제 연구에 적용 시 본인의 데이터 특성에 맞게 매개변수를 조정하고, 결과를 본인 환경에서 재현 검증해주세요. 코드는 MIT 라이선스로 자유롭게 사용할 수 있습니다 (보증 없음).

4. 통계 보고 표준 (Statistical Reporting Standards)

통계 분석 가이드는 다음 reporting 표준을 따릅니다:

차등 발현 분석 (DE Analysis)

  • 다중 검정 보정 방법 명시 (Benjamini-Hochberg FDR가 기본)
  • p-value/FDR 컷오프와 효과 크기(log2FC) 컷오프 모두 보고
  • 표본 크기 (그룹별 N) 명시
  • 배치 효과 처리 방법 명시
  • 사전 필터링 기준 명시 (저발현 유전자 제거 등)

기능 농축 분석 (Enrichment)

  • Background (universe) 정의 명확히 — 전체 유전체 vs 발현 검출된 유전자
  • 다중 검정 보정 방법 (BH가 표준)
  • FDR 컷오프 (보통 0.05) 와 효과 크기(NES) 컷오프 모두 보고
  • 사용한 gene set 데이터베이스 버전 (MSigDB v2023.2.Hs 등)
  • Leading edge 유전자 목록 supplementary 권장

생존 분석 (Survival Analysis)

  • Cox proportional hazards 가정 검증 결과 보고
  • Hazard Ratio (HR), 95% 신뢰구간, p-value 함께 제시
  • 독립 코호트 검증 권장 (TCGA → METABRIC 등)
  • 다변량 모델 시 공변량 명시

바이오마커 보고

  • REMARK 가이드라인 준수 (Altman et al., 2012)
  • TRIPOD 가이드라인 준수 (예측 모델, Collins et al., 2015)
  • Discovery cohort와 validation cohort 명확히 구분
  • 임상 적용성과 한계 함께 보고

5. 데이터 출처 기준

분석 가이드에서 사용하는 데이터 출처:

카테고리권장 출처라이선스
벌크 RNA-seqTCGA, GEO, ArrayExpress공개 (CC-BY 등)
단일세포 RNA-seqSingle Cell Portal, Tabula Sapiens, HCA공개 또는 dbGaP
프로테오믹스PRIDE, MassIVE, iProX공개
유전체 변이1000 Genomes, gnomAD공개
임상TCGA Pan-Cancer, MIMIC-III/IV신청 후 접근
참조 네트워크STRING, BioGRID, Reactome, KEGG공개 (KEGG 상업 제한)
주석Ensembl, GENCODE, RefSeq, UniProt공개
발현 참조GTEx, Human Protein Atlas, FANTOM공개

예제에 사용된 데이터셋은 가능한 경우 GEO/SRA accession 번호 또는 다운로드 링크를 명시합니다.

6. 코드 공유 정책

블로그 글의 코드 예제는 다음 형태로 제공됩니다:

  • 인라인 코드 블록 — 본문 내 직접 복사 가능
  • 완전한 워크플로 — 입력에서 결과까지 단계별 코드
  • 의존성 정보library() / import 문 포함
  • 샘플 데이터 — 가능한 경우 공개 데이터 활용 또는 합성 데이터 생성 코드 포함

향후 GitHub repository에 더 큰 워크플로를 정리할 계획이 있습니다. 특정 글의 전체 코드 요청은 Contact를 통해 문의 가능합니다.

7. 함정과 한계 명시 (Pitfalls Documentation)

모든 기술 가이드는 다음 항목을 포함합니다:

  • 흔한 실수 — 초보자가 자주 빠지는 함정
  • 해석 함정 — 통계적으로 유의하지만 생물학적으로 무의미한 케이스
  • 도구의 한계 — 어떤 데이터·시나리오에서 작동하지 않는지
  • 대안 제시 — 한계가 있을 때 사용할 다른 방법

이 정책은 독자가 분석 결과를 비판적으로 해석할 수 있도록 돕습니다.

8. 콘텐츠 갱신 주기

분야별 권장 갱신 주기:

  • 도구 비교 — 6개월~1년마다 검토 (도구 메이저 업데이트 시 즉시)
  • 방법론 가이드 — 1년마다 검토 (best practice 변화 시 갱신)
  • 벤치마크 결과 — 새 벤치마크 논문 발표 시 갱신
  • 데이터베이스 정보 — 메이저 릴리스 시 갱신 (예: STRING v12 → v13)
  • 임상 정보 — 새 가이드라인 발표 시 즉시 갱신

중요한 갱신은 글 상단에 "마지막 업데이트" 날짜를 명시합니다.

9. 한계와 면책

모든 분석 방법론에는 한계가 있습니다. SBM Lab의 가이드는 일반적인 best practice를 제시하지만, 특정 연구 맥락에서는 다른 접근이 더 적절할 수 있습니다.

본 블로그의 콘텐츠를 사용한 분석 결과의 정확성·적용 가능성은 사용자가 검증해야 합니다. SBM Lab은 콘텐츠를 통해 얻은 결과로 인한 직접적·간접적 손해에 대해 책임지지 않습니다.

10. 정책 갱신

이 Methodology 페이지는 분야의 발전에 따라 갱신됩니다. 주요 변경사항은 페이지 상단에 명시되며, 전반적 검토는 연 1회 이상 수행됩니다.

방법론 관련 제안 또는 문의는 Contact를 통해 보내주세요.