콘텐츠로 이동

증거 평가(Evidence Evaluation)

1. 일상 비유로 이해하는 증거 평가

섹션 제목: “1. 일상 비유로 이해하는 증거 평가”

새로 오픈한 샐러드 가게 사장님이 이렇게 말합니다.

“우리 가게 샐러드에 들어가는 아보카도가 손님들의 면역력을 극적으로 끌어올려 감기를 예방합니다! 지난달 우리 정기 구독 고객 100명 중 감기에 걸린 사람이 단 2명뿐이었거든요.”

얼핏 들으면 그럴듯해 보이지만, 증거 평가의 눈으로 보면 수많은 질문이 터져 나옵니다:

  1. 비교군(대조군)이 있는가? 같은 기간 샐러드를 안 먹은 일반인 100명의 감기 발병률은 몇 명이었는가? (원래 그 계절 발병률이 2%라면 아보카도는 아무 영향도 주지 않은 것입니다.)
  2. 선택 편향(Selection Bias)은 없는가? 비싼 돈을 내고 샐러드 정기 구독을 할 정도의 사람이라면 이미 운동을 열심히 하고 영양제를 챙겨 먹는 ‘건강 고관여자’일 가능성이 높지 않은가?
  3. 상관과 인과의 혼동은 없는가? ‘샐러드를 먹었다’와 ‘감기에 안 걸렸다’가 시간상 함께 일어났다고 해서 샐러드가 감기를 막았다는 증거가 되는가?

증거 평가(Evidence Evaluation)는 화려한 수사와 당당한 확신 뒤에 숨은 “그 주장을 지탱하는 실질적인 증거의 무게가 얼마인가?”를 저울에 달아보는 비판적 인식론 도구입니다.


증거 평가(Evidence Evaluation)는 주장(Claim)과 근거(Evidence)를 분리하고, 제시된 증거가 주장을 실제로 얼마나 지지하는지(Evidential Support)를 과학적·인식론적 프레임워크로 검증하는 체계적 방법론입니다.

  1. 주장과 증거의 분리 (Claim-Evidence Decoupling):
    • 문장력이 뛰어나고 논리적으로 매끄러운 주장이라도 증거의 질이 낮으면 거짓일 수 있습니다. ‘설득력 있는 문장’과 ‘증거가 뒷받침된 명제’는 완전히 다릅니다.
  2. 무징불신(無徵不信)과 이원 지식 인프라:
    • 《논어》 팔일편에서 공자는 “기나라와 송나라가 하나라와 은나라의 예를 고증하기에 부족하니, 문헌(기록된 전적 文)과 현자(살아있는 전문가 獻)가 부족하기 때문이다”라고 한탄하며, 증거가 없으면 함부로 단정하지 않는 실증적 침묵을 지켰습니다. 주희와 다산 정약용이 강조했듯 “증거가 없으면 믿지 않는다(無徵不信)“가 합리적 의사결정의 출발점입니다.
  3. 특별한 주장에는 특별한 증거가 필요하다 (ECOR: Extraordinary Claims Require Extraordinary Evidence):
    • 사회학자 마르첼로 트루치(Marcello Truzzi)가 정립하고 칼 세이건(Carl Sagan)이 대중화한 원리로, 기존의 정설이나 상식을 크게 뒤흔드는 파격적인 주장일수록 일화나 단편적 상관관계가 아닌, 극도로 엄격하고 재현 가능한 증거가 요구됩니다.
  4. 증거의 부재는 부재의 증거가 아니다 (Absence of Evidence is not Evidence of Absence):
    • “위험하다는 증거가 발견되지 않았다”는 말이 곧 “안전하다는 증거”가 되지는 않습니다. 조사가 덜 이루어져 발견하지 못한 것(탐지 한계)인지, 실제로 위험이 존재하지 않는 것인지를 엄격히 구분해야 합니다.

1) 증거 계층 피라미드 (Oxford CEBM & GRADE)

섹션 제목: “1) 증거 계층 피라미드 (Oxford CEBM & GRADE)”

의학 및 실증 과학에서 발전한 증거 수준 평가 체계는 일화적 경험부터 엄격한 실험까지 증거의 강도를 계층화합니다:

등급증거 유형특성 및 신뢰도비즈니스/실무 대응 예시
Level 1 (최상위)체계적 문헌고찰 및 메타분석 (Systematic Review & Meta-analysis)복수의 고품질 무작위 대조군 연구 결과를 편향 없이 종합수십 건의 글로벌 A/B 테스트 및 업계 전반의 교차 검증 데이터
Level 2무작위 대조 시험 (RCT, Randomized Controlled Trial)무작위 배정으로 외생 변수와 혼란 변수(Confounders)를 통제무작위 트래픽 분할 A/B 테스트 (충분한 표본 크기와 기간 확보)
Level 3통제된 코호트 연구 / 준실험 (Cohort / Quasi-experimental)무작위 배정은 아니나 대조군을 두고 시간 경과를 추적코호트 잔존율 분석, 특정 기능 도입 전/후 비교(DID 분석)
Level 4단면 연구 / 상관관계 조사 (Cross-sectional Survey / Correlation)특정 시점의 데이터 관찰. 시간적 선후관계 불명확사용자 설문조사, “헤비 유저가 기능 X를 더 많이 쓴다”는 로그 통계
Level 5 (최하위)전문가 의견, 권위자의 주장, 단편적 사례 (Anecdotal Evidence)개인의 편향, 표본 추출 편향, 사후 확신 편향에 취약“업계 유명 VC가 이 전략이 맞다고 했다”, “내 주변 대표들은 다 쓴다”

2) 브래드퍼드 힐의 인과성 9대 기준 (Bradford Hill Criteria)

섹션 제목: “2) 브래드퍼드 힐의 인과성 9대 기준 (Bradford Hill Criteria)”

1965년 영국 역학자 오스틴 브래드퍼드 힐(Austin Bradford Hill)이 제시한 ‘연관성에서 인과관계를 추론할 때 검토해야 할 9가지 기준’은 오늘날 비즈니스와 데이터 분석에서도 인과성 검증의 표준 잣대로 사용됩니다:

  1. 연관의 강도 (Strength): 두 변수 간의 통계적 효과 크기가 얼마나 큰가? (사소한 1% 차이보다 300% 차이가 인과일 가능성이 높음)
  2. 일관성 (Consistency): 서로 다른 환경, 다른 표본, 다른 시점에서도 동일한 결과가 반복적으로 관찰되는가?
  3. 특이성 (Specificity): 원인 X가 발생했을 때 특정한 결과 Y만 선택적으로 발생하는가? (다양한 요인이 뒤섞여 있지 않은가)
  4. 시간적 선후관계 (Temporality): [절대적 필수 조건] 원인이 결과보다 반드시 시간적으로 앞서는가? (결과가 먼저 발생하고 원인이 사후에 정당화된 것은 아닌가)
  5. 용량-반응 관계 (Biological Gradient / Dose-Response): 원인의 투입량(노출량)이 늘어날수록 결과의 크기도 비례하여 증가하는가?
  6. 개연성 (Plausibility): 기존의 과학적 지식이나 도메인 메커니즘으로 원인과 결과의 연결 과정이 논리적으로 설명되는가?
  7. 정합성 (Coherence): 기존에 이미 입증된 다른 사실들이나 업계 기본 상식과 모순을 일으키지 않는가?
  8. 실험적 입증 (Experiment): 인위적으로 원인을 제거하거나 투입했을 때 결과가 사라지거나 다시 나타나는가? (A/B 롤백 테스트 등)
  9. 유추 (Analogy): 구조적으로 유사한 다른 시스템이나 도메인에서도 유사한 메커니즘이 작동한 사례가 있는가?

3) 리처즈 호이어의 경쟁 가설 분석 (ACH: Analysis of Competing Hypotheses)

섹션 제목: “3) 리처즈 호이어의 경쟁 가설 분석 (ACH: Analysis of Competing Hypotheses)”

CIA 수석 분석가 리처즈 호이어(Richards J. Heuer Jr.)는 인간의 확증 편향(선호하는 가설을 지지하는 증거만 찾는 본능)을 극복하기 위해 경쟁 가설 분석을 고안했습니다:

[핵심 철학]:
"가장 많은 지지 증거를 가진 가설을 고르는 것이 아니라,
증거와 모순(Inconsistency)되는 정도가 가장 적은 가설을 찾는 것이다."
  • 절차:
    1. 발생 가능한 모든 대안 가설($H_1, H_2, H_3$)을 빠짐없이 나열한다.
    2. 수집된 모든 증거($E_1, E_2, E_3$)의 목록을 작성한다.
    3. 가설-증거 매트릭스를 만들어 각 증거가 각 가설과 부합하는지(I), 모순되는지(N), 무관한지(NA)를 교차 평가한다.
    4. 모든 가설을 동시에 지지하는 ‘흔한 증거’는 진단 가치(Diagnostic Value)가 0이다.
    5. 특정 가설을 결정적으로 기각(Disprove)시키는 불일치 증거(Inconsistent Evidence)에 집중하여 가설을 하나씩 탈락시킨다.

flowchart TD
A["주장(Claim) 식별 및 성격 분류<br/>(서술 / 상관 / 인과 / 예측)"] --> B["제시된 증거(Evidence) 추출 및 계층 분류<br/>(Level 1~5 / 출처 / 이해관계)"]
B --> C{"인과적 주장인가?"}
C -- 예 --> D["브래드퍼드 힐 9대 기준 검증<br/>(선후관계, 연관 강도, 용량반응 등)"]
C -- 아니오 --> E["사실성 및 측정 타당도 검증"]
D --> F["대안 가설 수립 및 ACH 분석<br/>(다른 설명 배제 및 불일치 증거 탐색)"]
E --> F
F --> G["누락된 증거(Silent Evidence) & 반대 증거 식별"]
G --> H["최종 확신도 판정<br/>(충분히 입증됨 / 조건부 지지 / 근거 미흡 / 기각)"]
  1. 주장과 유형 식별:
    • 주장이 단순 사실의 기술인가, 상관관계인가, 인과관계(“A가 B를 유발했다”)인가, 미래에 대한 예측인가를 엄격히 분리합니다.
  2. 증거 품질 감사:
    • 데이터 출처의 독립성(이해관계 상충 여부), 표본 크기, 수집 방법의 편향(생존 편향, 자발적 참여 편향)을 확인합니다.
  3. 인과성 필터링 (Hill’s Criteria):
    • 상관관계를 인과로 포장하지 않았는지, 시간적 선후관계가 확실한지, 제3의 교란 변수(Lurking Variable)는 통제되었는지 확인합니다.
  4. 경쟁 가설 대조 (ACH):
    • “이 결과가 사실이라 해도, 다른 이유(예: 계절적 성수기, 가격 할인, 자연적 회귀) 때문일 가능성은 없는가?”
  5. 누락된 증거 탐색:
    • 만약 이 주장이 참이라면 마땅히 관찰되어야 하는데도 숨겨져 있거나 제시되지 않은 증거(침묵하는 증거)를 밝혀냅니다.
  6. 최종 확신도 판정:
    • 충분한 근거(Sufficient), 조건부 지지(Contingent), 근거 미흡(Insufficient), 기각(Refuted)으로 최종 판정을 내리고, 추가 검증 액션을 도출합니다.

5. 흔한 인지적 함정과 오적용 방지

섹션 제목: “5. 흔한 인지적 함정과 오적용 방지”
  1. 상관관계를 인과관계로 착각 (Cum hoc ergo propter hoc):
    • 두 지표가 함께 상승했다고 해서 하나가 다른 하나의 원인이 아닙니다. 아이스크림 판매량과 익사 사고율은 함께 오르지만, 원인은 ‘여름철 기온 상승’입니다.
  2. 확증 편향과 텍사스 명사수 오류 (Texas Sharpshooter Fallacy):
    • 사격을 먼저 해놓고 총알이 맞은 곳에 과녁을 그리는 것처럼, 결론을 먼저 정해두고 그것을 지지하는 유리한 데이터만 체리피킹(Cherry-picking)하는 행태를 경계해야 합니다.
  3. 권위에 호소하는 오류 (Argument from Authority):
    • 노벨상 수상자나 유명 컨설팅 펌의 보고서라도, 그들이 제시한 원천 데이터와 방법론의 한계를 벗어나면 단순한 ‘Level 5(전문가 의견)‘에 불과합니다.
  4. 증거의 부재를 안전의 증거로 둔갑:
    • “우리 제품에서 보안 취약점이 발견된 적 없다”는 보고는 “보안 검사를 제대로 한 적이 없다”는 뜻일 수 있습니다.

관련 스킬

주장

증거 점검

주장을 근거와 엄격히 분리하고, 증거 계층(GRADE/CEBM)·브래드퍼드 힐 9대 인과 기준·경쟁 가설 분석(ACH)을 적용해 데이터와 보고서의 논리적 비약과 허위 상관을 가려냅니다. 사용자가 제안서, 보고서, A/B 테스트 결과, 데이터 분석, 연구 논문, 기사의 주장을 검증하거나 상관과 인과를 구분하려 할 때 반드시 이 스킬을 사용하십시오.

사고법: 증거 평가

출처

  1. Austin Bradford Hill. The Environment and Disease: Association or Causation? (새 탭에서 열림). 1965 · 논문 — 관찰 데이터에서 인과관계를 판별하는 9대 역학 기준
  2. Richards J. Heuer Jr.. Psychology of Intelligence Analysis (새 탭에서 열림). 1999 · 책 — 정보분석에서의 인지 편향 극복과 경쟁 가설 분석(ACH) 방법론
  3. Carl Sagan. The Demon-Haunted World: Science as a Candle in the Dark (새 탭에서 열림). 1995 · 책 — 회의주의적 사고의 도구상자, 특별한 주장과 증거 원칙
  4. Oxford CEBM. CEBM Levels of Evidence (새 탭에서 열림). 2011 · 공식 문서 — 근거 중심 의사결정을 위한 체계적 증거 품질 평가 프레임워크
  5. Bradford Hill criteria (새 탭에서 열림) · 백과사전 — 인과성 판별 9대 기준 상세
  6. Analysis of competing hypotheses (새 탭에서 열림) · 백과사전 — 경쟁 가설 분석 상세