강의 6-1: 알고리즘 편향의 구조

13 min

이 강의는 신학적 논의에 앞서 문제의 실제 구조를 정확히 파악합니다. 알고리즘 편향은 어떻게 발생하며, 왜 제거하기 어렵고, 왜 그것이 인간의 차별보다 더 위험할 수 있는가?

What these 13 minutes give you

  • 알고리즘 편향의 세 발생 경로(데이터·설계·배치)를 구분한다.
  • '대리 변수' 문제와 그것이 만드는 회피 불가능성을 이해한다.
  • '객관성의 신화'와 자동화 편애가 왜 위험한지 설명한다.
  • 편향 문제가 순수한 기술적 해결로 끝나지 않는 이유를 논증한다.

너희는 재판할 때에 불의를 행치 말며 가난한 자의 편을 들지 말며 세력있는 자라고 두호하지 말고 공의로 사람을 재판할지며

레위기 19:15

너는 주머니에 같지 않은 저울추 곧 큰 것과 작은 것을 넣지 말 것이며

신명기 25:13

3.1 문제의 실제 형태

알고리즘 편향은 추상적 우려가 아닙니다. 다음은 실제로 보고되어 온 문제 유형들입니다.

영역 문제의 형태 영향받는 사람
채용 과거 채용 데이터를 학습해 특정 성별·학교·지역 지원자를 낮게 평가 구직자
대출·신용 거주 지역이나 소비 패턴을 근거로 특정 계층에 높은 이자율 부과 저소득층
형사 사법 재범 위험 예측이 특정 집단에 대해 체계적으로 높게 산출 피고인
의료 과거 의료비 지출을 건강 필요의 대리 지표로 삼아, 의료 접근성이 낮았던 집단의 필요를 과소평가 소외 계층 환자
얼굴 인식 특정 피부색·성별 집단에서 오인식률이 현저히 높음 소수 집단
콘텐츠 심사 특정 언어·문화권의 표현을 과잉 차단하거나 과소 차단 소수 언어 사용자

주목할 점은 이 사례들 어디에도 "이 집단을 차별하라"는 명령이 프로그램에 들어 있지 않다는 사실입니다. 편향은 명시적 규칙이 아니라 학습의 산물입니다.

3.2 편향의 세 발생 경로

① 데이터 경로 — 과거의 불의가 학습된다

기계학습의 기본 원리(1-1강)를 상기하십시오. 시스템은 데이터에서 패턴을 추출합니다. 그런데 그 데이터는 과거의 인간 사회가 만든 기록입니다.

과거에 특정 집단이 승진에서 배제되었다면, 그 기록으로 학습한 채용 모델은 "이 집단은 성공 가능성이 낮다"는 패턴을 발견합니다. 모델은 차별하려는 것이 아닙니다. 모델은 정확하게 과거를 반영하고 있을 뿐입니다. 그리고 바로 그것이 문제입니다.

   과거의 차별적 관행
          ↓
   그 결과가 데이터로 기록됨
          ↓
   모델이 패턴을 학습함
          ↓
   모델이 미래의 결정을 내림
          ↓
   차별이 재생산됨 → 다시 데이터가 됨
          ↓
   (순환 강화)

이 순환 구조가 핵심입니다. 편향은 한 번 일어나고 끝나는 것이 아니라 자기 강화적입니다.

② 설계 경로 — 무엇을 측정할지 정하는 선택

모든 모델은 무언가를 예측하도록 설계되며, 그 '무언가'를 정하는 것은 인간입니다. 그리고 이 선택은 중립적이지 않습니다.

예를 들어 "이 환자가 얼마나 아픈가"를 직접 측정하기는 어렵습니다. 그래서 "이 환자에게 얼마나 의료비가 지출되었는가"를 대신 사용할 수 있습니다. 그런데 의료 접근성이 낮은 집단은 아파도 병원에 가지 못했으므로 지출이 적습니다. 결과적으로 모델은 그들을 "덜 아프다"고 판단합니다.

이것이 대리 변수(proxy variable) 문제입니다. 측정하려는 것과 실제 측정한 것 사이의 간극에 편향이 스며듭니다.

대리 변수는 회피하기 어렵습니다. 법적으로 인종이나 성별을 사용하지 못하게 해도, 거주 지역·이름·구매 이력·통근 거리 등이 그것과 높은 상관관계를 가집니다. 금지된 변수를 제거해도 그 변수의 그림자는 남습니다.

③ 배치 경로 — 어디에, 누구에게 적용하는가

같은 시스템이라도 어디에 배치되느냐에 따라 영향이 달라집니다. 감시 시스템이 특정 지역에 집중 배치되면, 그 지역에서 더 많은 사건이 '탐지'되고, 그 데이터가 다시 "이 지역이 위험하다"는 근거가 됩니다.

도표: 세 경로 비교

경로 편향의 원천 대응 방법 한계
데이터 과거 사회의 불의가 기록됨 데이터 보정, 균형 샘플링 과거를 지울 수는 없음
설계 목표 변수와 대리 변수의 선택 목표 재정의, 공정성 지표 도입 공정성 정의가 여럿이고 서로 충돌
배치 적용 대상과 범위의 선택 영향 평가, 배치 제한 정치적·경제적 이해관계

3.3 왜 순수한 기술적 해결이 불가능한가

이 부분이 적으로 중요합니다.

기술적 공정성 연구는 실제로 활발히 진행되고 있으며, 상당한 성과도 있습니다. 그러나 근본적 난점이 있습니다.

공정성에는 여러 정의가 있고, 그것들은 수학적으로 동시에 만족될 수 없습니다.

예를 들어 다음 두 요구를 생각해 봅시다.

  • 요구 A: 각 집단에서 동일한 비율로 합격시켜야 한다 (결과의 균등)
  • 요구 B: 동일한 능력을 가진 개인은 집단과 무관하게 동일하게 대우받아야 한다 (개인의 공정)

집단 간 능력 분포가 (과거의 불평등한 기회 때문에) 다르다면, A와 B는 동시에 충족될 수 없습니다. A를 만족시키면 B가 깨지고, B를 만족시키면 A가 깨집니다.

이것은 알고리즘을 더 잘 설계하면 해결되는 문제가 아닙니다. 이것은 "정의란 무엇인가"라는 질문이며, 수천 년간 철학과 신학이 씨름해 온 문제입니다. 기술은 이 질문에 답할 수 없습니다. 기술은 우리가 답을 정하면 그것을 구현할 뿐입니다.

결론: 알고리즘 공정성 문제는 결국 가치 판단의 문제이며, 따라서 신학이 발언할 자리가 있습니다.

3.4 객관성의 신화와 자동화 편애

여기에 문제를 악화시키는 두 요소가 더해집니다.

① 객관성의 신화. 숫자로 표현된 판단은 객관적으로 보입니다. "면접관이 당신을 탈락시켰습니다"와 "시스템 점수가 62점입니다"는 심리적으로 전혀 다르게 받아들여집니다. 후자는 논쟁의 여지가 없어 보입니다.

그러나 그 62점은 인간이 선택한 데이터, 인간이 정한 목표, 인간이 설계한 가중치의 산물입니다. 객관적으로 보이는 것과 객관적인 것은 다릅니다.

② 자동화 편애(automation bias). 인간은 자동화된 판단을 자신의 판단보다 더 신뢰하는 경향이 있습니다. 시스템의 권고에 반대하려면 특별한 근거가 필요하다고 느끼며, 시스템에 동의하면 책임에서 벗어난 것처럼 느낍니다.

이 둘이 결합하면 다음과 같은 상황이 만들어집니다.

   인간의 편견 → 데이터 → 알고리즘 → 숫자로 표현된 판단
                                             ↓
                                    "객관적" 외관을 얻음
                                             ↓
                                    비판하기 어려워짐
                                             ↓
                                    책임 소재가 흐려짐
                                    ("시스템이 그렇게 판단했다")

이것이 알고리즘 편향이 인간의 차별보다 더 위험할 수 있는 이유입니다. 인간의 차별은 얼굴이 있고, 항의할 대상이 있고, 할 주체가 있습니다. 자동화된 차별은 그 셋이 모두 없습니다.

3.5 성경적 예비 고찰

본격적인 신학적 분석은 6-2강의 몫이지만, 여기서 두 본문을 미리 놓아 둡니다.

신명기 25:13-16 — 저울추. "너는 다른 저울추 곧 큰 것과 작은 것을 주머니에 넣지 말 것이며." 고대의 저울추는 오늘날의 알고리즘에 해당합니다. 그것은 거래의 판단 기준이며, 눈에 잘 띄지 않고, 조작 여부를 일반인이 확인하기 어렵습니다. 성경은 이 보이지 않는 판단 도구의 정직성을 하나님이 가증히 여기시는 문제로 규정합니다(25:16).

레위기 19:15 — 재판. "가난한 자의 편을 들지 말며 세력 있는 자라고 두둔하지 말고." 흥미롭게도 이 구절은 양방향의 편향을 모두 금합니다. 약자에 대한 동정도, 강자에 대한 아첨도 재판을 왜곡합니다. 성경적 는 감정적 편들기가 아니라 진실에 따른 판단입니다.

이 두 본문은 알고리즘 공정성 논의에 정확히 대응합니다. 저울추의 정직성은 투명성과 검증 가능성의 요구이며, 재판의 공평성은 어떤 집단에 대해서도 체계적 왜곡이 없어야 한다는 요구입니다.

3.6 목회적 착지점

첫째, 성도가 겪은 일을 알아보라. 대출을 거절당하고, 채용에서 이유 없이 탈락하고, 보험료가 갑자기 오른 성도가 있을 수 있습니다. 그것이 알고리즘의 결과일 수 있다는 사실을 아는 목회자는, "당신 탓이 아닐 수도 있습니다"라고 말해 줄 수 있습니다.

둘째, '객관적 평가'라는 말 앞에서 멈추게 하라. 성도가 "시스템이 그렇게 나왔대요"라며 자책할 때, 그 시스템이 어떻게 만들어졌는지를 함께 물어보는 것은 목회적 돌봄입니다.

셋째, 기술 종사 성도에게 이 문제를 이야기하라. 4-3강의 다섯 기준 중 '이웃의 기준'이 여기서 구체화됩니다. 그들이 실제로 이 결정에 관여하고 있을 수 있습니다.


4-1. 편향의 자기 강화 순환

차별이 데이터가 되고 학습되어 다시 차별을 재생산하는 순환 구조

4-2. 알고리즘 편향 점검 질문

질문 확인 대상
이 모델은 어떤 데이터로 학습되었는가? 데이터 경로
그 데이터가 반영하는 과거는 정의로웠는가? 데이터 경로
이 모델이 실제로 예측하는 것은 무엇인가? 설계 경로
측정하려는 것과 실제 측정한 것 사이에 간극이 있는가? 대리 변수
어떤 공정성 정의를 채택했으며, 무엇을 포기했는가? 설계 경로
이 시스템은 누구에게 적용되며 누구에게는 적용되지 않는가? 배치 경로
판단에 대해 이의를 제기할 통로가 있는가? 책임 구조
최종 책임을 지는 사람이 있는가? 책임 구조

In short

  • 알고리즘 편향은 명시적 차별 규칙이 아니라 학습의 산물이며, 채용·대출·사법·의료·인식 등 실제 삶의 결정에서 이미 작동하고 있다.
  • 편향은 세 경로로 발생한다: 데이터(과거의 불의가 학습됨), 설계(목표 변수와 대리 변수의 선택), 배치(적용 대상의 선택).
  • 데이터 경로는 자기 강화적 순환을 이룬다. 차별 → 데이터 → 학습 → 결정 → 다시 데이터.
  • 대리 변수 문제로 인해, 금지된 속성을 제거해도 그 그림자는 다른 변수에 남는다.
  • 순수한 기술적 해결은 불가능하다. 공정성에는 여러 정의가 있고 수학적으로 동시에 만족될 수 없기 때문이다. 어느 정의를 택할지는 가치 판단이며, 여기에 신학이 발언할 자리가 있다.
  • 객관성의 신화와 자동화 편애가 결합하면, 불의가 '객관적 계산'의 외피를 얻어 비판하기 어려워지고 책임 소재가 흐려진다. 이것이 자동화된 차별이 인간의 차별보다 위험할 수 있는 이유다 — 얼굴도, 항의 대상도, 회개할 주체도 없다.
  • 신명기 25:13-16(저울추)과 레위기 19:15(재판)는 각각 투명성과 체계적 왜곡의 금지를 요구하며, 알고리즘 공정성 논의에 정확히 대응한다.
Review every summary in this course →

Check yourself

Not "did you read it" but "can you explain it". Ticks are kept on this device only.

Reflection and discussion

  • 알고리즘 편향의 세 경로 중, 가장 해결하기 어렵다고 생각하는 것은 무엇이며 왜 그런가?
  • 데이터 순환 강화 구조(차별 → 데이터 → 학습 → 결정 → 차별)를 끊으려면 어디에 개입해야 하는가?
  • 두 공정성 정의(결과의 균등 vs 개인의 공정)가 충돌할 때, 성경적 정의는 어느 쪽을 지지한다고 보는가? 그 근거는?
  • "객관적으로 보이는 것과 객관적인 것은 다르다"는 명제를 성도에게 설명할 비유를 만들어 보라.
  • 신명기 25:13-16의 저울추 규정이 오늘날 알고리즘 투명성 요구와 어떻게 대응하는가?
  • 레위기 19:15가 약자 편들기도 금한다는 사실을, 알고리즘 공정성 논의에 어떻게 적용할 수 있는가?

Sign in to write and keep your answers

The lecture ends here. What follows was written by its readers.

Questions and answers

Questions asked here are answered within 7 days.

No questions on this lecture yet. Yours can be the first.

Sign in to ask a question or write an answer. Sign in