부록

자료실 · 용어집 · 참고문헌

학습 중 참조할 핵심 용어 정의, 규제·표준 원문, 오픈소스 도구, 추천 도서와 학술 자료를 모았습니다. 외부 링크는 공식 원문 또는 검색 결과 페이지로 연결되며, 링크가 만료되지 않도록 가급적 기관 공식 페이지를 사용했습니다.

1. 핵심 용어집

📖 공정성 · 편향
용어정의
통계적 동등성
Demographic Parity
집단 간 선발률이 같아야 한다는 기준. P(Ŷ=1|A=a)가 모든 a에 대해 동일. 독립성 계열.
기회 균등
Equal Opportunity
실제로 자격이 있는 사람들 사이에서 합격률(TPR)이 집단 간 같아야 한다는 기준. 분리 계열.
균등화 승산
Equalized Odds
TPR과 FPR이 모두 집단 간 같아야 한다는 기준. 분리 계열의 강한 형태.
보정
Calibration
같은 점수를 받은 사람의 실제 확률이 집단과 무관하게 같아야 한다는 기준. 충분성 계열.
예측값 동등성
Predictive Parity
양성 예측도(PPV)가 집단 간 같아야 한다는 기준. 충분성 계열.
불가능성 정리기저율이 다르고 예측이 불완전하면 보정·FPR 형평·FNR 형평을 동시 만족할 수 없다는 수학적 결과.
4/5 규칙
Disparate Impact
소수 집단 선발률 ÷ 다수 집단 선발률 ≥ 0.8. 미국 고용 차별 판단의 실무 기준.
무지를 통한 공정성보호속성을 입력에서 제거하는 접근. 중복 부호화 때문에 대부분 실패한다.
중복 부호화
Redundant Encoding
우편번호·소비 패턴 등 다른 변수가 보호속성의 대리로 작동하는 현상.
교차성
Intersectionality
성별×인종처럼 축이 교차하는 집단에서 격차가 증폭되는 현상. 단일 축 평균은 이를 감춘다.
최소집단 성능
Worst-group performance
가장 성능이 낮은 하위집단의 성능. 롤스적 정의론의 지표적 구현.
선택적 레이블
Selective Labels
거절된 대상의 결과가 관측되지 않아 평가 자체가 왜곡되는 문제.
대리변수
Proxy
직접 측정 불가한 개념(건강 필요)을 대신하는 측정치(의료비 지출). 오차가 집단과 상관되면 차별의 원인이 된다.
📖 투명성 · 설명가능성
용어정의
해석가능성
Interpretability
모델의 내부 작동을 인간이 직접 이해할 수 있는 정도. 모델 구조의 속성.
설명가능성
Explainability
특정 출력에 대해 사후에 근거를 제시하는 능력. 개별 결정에 대한 것.
추적가능성
Traceability
어떤 데이터·모델 버전·승인으로 결정이 만들어졌는지 재구성하는 능력. 사고 조사의 실질적 근거.
충실성
Faithfulness
설명이 모델의 실제 계산을 반영하는 정도. 사후 설명 평가의 1순위 축.
LIME설명 지점 주변을 교란해 국소 선형 모델을 적합시키는 기법. 교란 설정에 따라 불안정하다.
SHAP협력게임의 섀플리 값으로 특징 기여도를 배분하는 기법. 특징 상관이 강하면 왜곡될 수 있다.
반사실적 설명
Counterfactual
"무엇을 바꾸면 결과가 달라지는가". 정보주체에게 실행 가능한 유일한 설명 형태에 가깝다.
모델 카드모델의 용도·범위 밖 사용·분해 성능·한계를 표준 형식으로 기록한 문서.
데이터시트데이터셋의 동기·구성·수집 과정·사용·유지관리를 기록한 문서.
불충실한 설명
Unfaithful CoT
LLM의 사고사슬이 실제 결정 요인을 반영하지 않고 사후 합리화인 현상.
자동화 편향인간 검토자가 기계 출력을 비판 없이 수용하는 경향. 지표는 뒤집기 비율.
📖 프라이버시 · 데이터
용어정의
맥락적 무결성프라이버시를 "정보가 원래 맥락의 규범에 맞게 흐르는가"로 정의하는 틀. 5요소: 발신자·수신자·주체·정보 유형·전송 원칙.
차등 프라이버시
Differential Privacy
한 개인의 포함 여부가 출력 분포에 미치는 영향을 eε배 이내로 제한하는 수학적 보증. 참여 여부를 보호하며 집단적 사실은 보호하지 않는다.
ε (엡실론)DP의 프라이버시 예산. 작을수록 강한 보호. 단위(쿼리당/전체), δ, 인접성 정의(레코드/사용자), 누적 예산과 함께 읽어야 한다.
DP-SGD그래디언트 클리핑 + 노이즈로 학습에 DP를 적용하는 표준 방법. 소수 집단 성능이 먼저 저하되어 공정성과 충돌한다.
k-익명성같은 준식별자 조합이 최소 k명이 되도록 하는 기법. 동질성 공격에 취약.
연합학습원본 데이터 대신 모델 업데이트를 공유하는 학습 방식. 그 자체로는 프라이버시 보증이 아니다.
보안 집계서버가 개별 업데이트를 볼 수 없게 하는 암호 프로토콜. 연합학습의 필수 보완재.
멤버십 추론특정 레코드가 학습에 사용되었는지 알아내는 공격. AUC가 0.5에 가까울수록 안전.
학습 데이터 추출모델이 암기한 학습 텍스트·이미지를 프롬프트로 끌어내는 공격. 중복 제거가 주요 방어.
기계 망각
Machine Unlearning
학습된 모델에서 특정 데이터의 영향을 제거하려는 기법. 보증 수준은 아직 제한적.
TDM 예외텍스트·데이터 마이닝을 위한 저작권 예외. EU에서는 권리자의 옵트아웃 유보가 가능.
섀도우 AI승인되지 않은 외부 AI 도구의 업무 사용. 금지보다 대체재 제공 + 데이터 등급화가 효과적.
📖 안전성 · 정렬 · 에이전트
용어정의
명세 게이밍명시된 목표를 정확히 달성하면서 설계 의도를 위반하는 현상. 굿하트 법칙의 기술적 판본.
목표 오일반화학습 분포에서 구분되지 않던 두 목표가 배포 분포에서 갈라져, 유능하게 잘못된 목표를 추구하는 현상.
보상 해킹보상모델의 허점을 정책이 착취하는 현상.
아첨
Sycophancy
인간 평가자의 동의 선호가 학습되어 사실 정확성보다 사용자 의견에 맞추는 경향.
RLHF인간 선호 데이터로 보상모델을 학습하고 정책을 최적화하는 정렬 기법.
헌법적 AI명시된 원칙 목록에 따라 모델이 자기 출력을 비평·수정해 선호 데이터를 생성하는 방식. 규칙이 공개 검토 가능하다는 것이 장점.
확장 가능한 감독인간이 직접 평가할 수 없는 출력에 대해 감독을 가능하게 하는 연구 방향(토론, 비평 모델, 재귀적 보상 모델링).
레드팀의도적으로 시스템의 유해 출력·취약점을 유도해 찾아내는 활동.
안전 사례
Safety Case
주장 → 논증 → 증거 → 가정 → 반박 가능성 구조로 안전을 반증 가능하게 문서화하는 형식.
간접 프롬프트 주입에이전트가 읽는 문서·웹·메일에 명령을 심어 조종하는 공격. 완전 방어는 존재하지 않는다.
신뢰 경계비신뢰 콘텐츠를 처리하는 세션과 민감 권한을 가진 세션을 분리하는 설계 원칙.
바이브 코딩LLM과의 반복 대화로 코드를 생성·수정하는 개발 방식. 책임은 통제 가능성을 따라 배분된다.
📖 규제 · 거버넌스
용어정의
제공자 / 배포자
Provider / Deployer
EU AI Act의 역할 구분. 자기 상표 부착이나 의도된 목적의 실질적 변경은 배포자를 제공자로 전환시킨다.
고위험 AI고용·신용·교육·법 집행·필수 서비스 등 특정 용도의 시스템. 위험관리·데이터 거버넌스·기술문서·로그·인간 감독 등의 의무가 부과된다.
GPAI범용 AI 모델. 기술문서·저작권 정책·학습 콘텐츠 요약 공개 의무. 시스템적 위험 모델은 평가·사고 보고 추가.
금지 관행조작·취약성 이용, 사회적 점수화, 특정 생체 식별 등 전면 금지되는 용도.
NIST AI RMFGOVERN·MAP·MEASURE·MANAGE 4기능으로 구성된 자발적 위험관리 프레임워크.
ISO/IEC 42001AI 경영시스템(AIMS) 표준. 제3자 인증이 가능하다는 점이 실무적 가치.
AIA
알고리즘 영향평가
시스템의 사회적·법적·기술적 영향을 사전 평가하는 문서. 품질 기준은 "읽고 반대할 수 있는가".
3선 방어1선 제품 / 2선 리스크·컴플라이언스 / 3선 내부감사. 2선은 지연 권한을 가져야 한다.
책임 격차학습 시스템의 행동을 예견·통제할 수 없어 책임 귀속이 어렵다는 주장. 제도 설계로 상당 부분 메울 수 있다는 반론이 있다.
C2PA콘텐츠에 서명된 출처 매니페스트를 부착하는 표준. 탐지가 아니라 출처 기록 접근.
거짓말쟁이의 배당진짜 증거를 "AI 조작"이라 부인하는 전략이 가능해지는 현상. 탐지 기술로 해결되지 않는다.
윤리 워싱실질적 제약 없이 윤리 활동의 외형만 갖추는 것. 판별 기준은 "실제로 무언가를 못 하게 만들었는가".

2. 규제 · 표준 원문

3. 핵심 논문 30선

주제논문
공정성Hardt et al. (2016), Equality of Opportunity in Supervised Learning
Kleinberg et al. (2016), Inherent Trade-Offs in Fair Risk Scores
Chouldechova (2017), Fair Prediction with Disparate Impact
Dwork et al. (2012), Fairness Through Awareness
Obermeyer et al. (2019), Dissecting racial bias in health algorithms
설명가능성Ribeiro et al. (2016), LIME
Lundberg & Lee (2017), SHAP
Doshi-Velez & Kim (2017), Rigorous Science of Interpretable ML
Lipton (2016), The Mythos of Model Interpretability
Mitchell et al. (2019), Model Cards for Model Reporting
프라이버시Abadi et al. (2016), Deep Learning with Differential Privacy
Shokri et al. (2017), Membership Inference Attacks
Carlini et al. (2021), Extracting Training Data from LLMs
Nasr, Carlini et al. (2023), Scalable Extraction from Production LMs
McMahan et al. (2016), Federated Learning
안전 · 정렬Amodei et al. (2016), Concrete Problems in AI Safety
Ouyang et al. (2022), InstructGPT / RLHF
Bai et al. (2022), Constitutional AI
Shah et al. (2022), Goal Misgeneralization
Ganguli et al. (2022), Red Teaming Language Models
Hubinger et al. (2024), Sleeper Agents
Chan et al. (2024), Visibility into AI Agents
거버넌스 · 사회Raji et al. (2020), Closing the AI Accountability Gap
Weidinger et al. (2021), Ethical and social risks of LMs
Bommasani et al. (2021), Foundation Models
Bommasani et al. (2023), Foundation Model Transparency Index
환경 · 노동 · 위험Strubell et al. (2019), Energy and Policy Considerations
Patterson et al. (2021), Carbon Emissions of Neural Network Training
Bengio et al. (2023), Managing extreme AI risks
Anderljung et al. (2023), Frontier AI Regulation

4. 오픈소스 도구

도구용도링크
Fairlearn공정성 지표 계산, 완화 알고리즘, 대시보드fairlearn.org
AI Fairness 36070+ 공정성 지표, 10+ 완화 알고리즘GitHub
SHAP특징 기여도 계산·시각화GitHub
LIME국소 대리 모델 기반 설명GitHub
InterpretML내재적 해석가능 모델(EBM)과 설명 도구interpret.ml
OpacusPyTorch용 DP-SGD 구현opacus.ai
TensorFlow PrivacyDP 학습 및 프라이버시 예산 계산GitHub
ML CO2 Impact학습 탄소 배출량 추정mlco2.github.io
Model Card Toolkit모델 카드 생성·배포Hugging Face 가이드
AI Incident Database공개 AI 사고 사례 검색incidentdatabase.ai
ML-fairness-gym피드백 루프 시뮬레이션GitHub

5. 추천 도서

  • 📖 Fairness and Machine Learning — Barocas, Hardt, Narayanan · 무료 온라인 — 이 분야 표준 교재
  • 📖 Interpretable Machine Learning — Molnar · 무료 온라인
  • 📖 The Alignment Problem — Brian Christian — 공정성·해석가능성·정렬을 하나의 서사로
  • 📖 Weapons of Math Destruction — Cathy O'Neil — 규모·불투명성·피해 순환의 대중적 정식화
  • 📖 Atlas of AI — Kate Crawford — 광물·노동·에너지의 물질적 관점
  • 📖 Automating Inequality — Virginia Eubanks — 복지 행정 자동화와 빈곤
  • 📖 Ghost Work — Gray & Suri — 보이지 않는 데이터 노동
  • 📖 Privacy in Context — Helen Nissenbaum — 맥락적 무결성의 원전
  • 📖 The Black Box Society — Frank Pasquale — 알고리즘 책임성 담론의 고전
  • 📖 Power and Progress — Acemoglu & Johnson — 기술 진보의 분배는 선택이라는 논증
  • 📖 Race After Technology — Ruha Benjamin — '새로운 짐 코드' 개념
  • 📖 The Age of Surveillance Capitalism — Shoshana Zuboff — 데이터 축적의 정치경제

6. 지속 학습 채널

7. 전 과정 체크리스트

다음 항목에 모두 "예"라고 답할 수 있으면 이 과정의 목표에 도달한 것입니다.

  • 임의의 AI 시스템에 대해 사회기술 7층 분석을 수행할 수 있다
  • 공정성 지표 3계열을 수식으로 쓰고, 맥락에 맞는 주 지표를 선택·정당화할 수 있다
  • 불가능성 정리를 이용해 "모든 공정성을 만족시키자"는 요구를 반박할 수 있다
  • 수신자별로 다른 설명 산출물을 설계하고 충실성·안정성을 검증할 계획을 세울 수 있다
  • 모델 카드와 데이터시트를 처음부터 작성할 수 있다
  • ε 값을 단위·δ·인접성·누적 예산과 함께 해석하고 감사 질문을 던질 수 있다
  • 학습 데이터 추출·멤버십 추론 위험을 릴리스 게이트 지표로 설정할 수 있다
  • 명세 게이밍과 목표 오일반화를 구분하고 각각의 대응을 설계할 수 있다
  • 에이전트 권한 6원칙으로 최대 피해액을 산정하고 게이트를 설계할 수 있다
  • EU AI Act에서 시스템의 위험 등급과 자사 역할을 조문 근거로 판정할 수 있다
  • NIST RMF × ISO 42001 × AI Act 매핑 표를 작성할 수 있다
  • 노동·환경·집중 위험을 조달 계약과 운영 절차로 번역할 수 있다
  • 비배포가 정당한 조건 6가지를 적용해 판단할 수 있다
  • AIA 14절을 작성하고, 그 문서에 대해 스스로 반론 3개를 제기할 수 있다
  • AI 사고 대응 9단계를 기한·책임자·산출물과 함께 설계할 수 있다

자료의 최신성에 관하여. AI 규제와 판례는 빠르게 변합니다. 이 자료실의 법령·표준 링크는 원문 확인용 출발점이며, 실제 의사결정 전에는 반드시 시행일·개정 이력·하위 고시를 직접 확인하고 문서에 확인 일자를 기재하세요. 학술 링크는 arXiv·출판사 공식 페이지를 사용했습니다.