부록
자료실 · 용어집 · 참고문헌
학습 중 참조할 핵심 용어 정의, 규제·표준 원문, 오픈소스 도구, 추천 도서와 학술 자료를 모았습니다. 외부 링크는 공식 원문 또는 검색 결과 페이지로 연결되며, 링크가 만료되지 않도록 가급적 기관 공식 페이지를 사용했습니다.
1. 핵심 용어집
📖 공정성 · 편향
| 용어 | 정의 |
|---|---|
| 통계적 동등성 Demographic Parity | 집단 간 선발률이 같아야 한다는 기준. P(Ŷ=1|A=a)가 모든 a에 대해 동일. 독립성 계열. |
| 기회 균등 Equal Opportunity | 실제로 자격이 있는 사람들 사이에서 합격률(TPR)이 집단 간 같아야 한다는 기준. 분리 계열. |
| 균등화 승산 Equalized Odds | TPR과 FPR이 모두 집단 간 같아야 한다는 기준. 분리 계열의 강한 형태. |
| 보정 Calibration | 같은 점수를 받은 사람의 실제 확률이 집단과 무관하게 같아야 한다는 기준. 충분성 계열. |
| 예측값 동등성 Predictive Parity | 양성 예측도(PPV)가 집단 간 같아야 한다는 기준. 충분성 계열. |
| 불가능성 정리 | 기저율이 다르고 예측이 불완전하면 보정·FPR 형평·FNR 형평을 동시 만족할 수 없다는 수학적 결과. |
| 4/5 규칙 Disparate Impact | 소수 집단 선발률 ÷ 다수 집단 선발률 ≥ 0.8. 미국 고용 차별 판단의 실무 기준. |
| 무지를 통한 공정성 | 보호속성을 입력에서 제거하는 접근. 중복 부호화 때문에 대부분 실패한다. |
| 중복 부호화 Redundant Encoding | 우편번호·소비 패턴 등 다른 변수가 보호속성의 대리로 작동하는 현상. |
| 교차성 Intersectionality | 성별×인종처럼 축이 교차하는 집단에서 격차가 증폭되는 현상. 단일 축 평균은 이를 감춘다. |
| 최소집단 성능 Worst-group performance | 가장 성능이 낮은 하위집단의 성능. 롤스적 정의론의 지표적 구현. |
| 선택적 레이블 Selective Labels | 거절된 대상의 결과가 관측되지 않아 평가 자체가 왜곡되는 문제. |
| 대리변수 Proxy | 직접 측정 불가한 개념(건강 필요)을 대신하는 측정치(의료비 지출). 오차가 집단과 상관되면 차별의 원인이 된다. |
📖 투명성 · 설명가능성
| 용어 | 정의 |
|---|---|
| 해석가능성 Interpretability | 모델의 내부 작동을 인간이 직접 이해할 수 있는 정도. 모델 구조의 속성. |
| 설명가능성 Explainability | 특정 출력에 대해 사후에 근거를 제시하는 능력. 개별 결정에 대한 것. |
| 추적가능성 Traceability | 어떤 데이터·모델 버전·승인으로 결정이 만들어졌는지 재구성하는 능력. 사고 조사의 실질적 근거. |
| 충실성 Faithfulness | 설명이 모델의 실제 계산을 반영하는 정도. 사후 설명 평가의 1순위 축. |
| LIME | 설명 지점 주변을 교란해 국소 선형 모델을 적합시키는 기법. 교란 설정에 따라 불안정하다. |
| SHAP | 협력게임의 섀플리 값으로 특징 기여도를 배분하는 기법. 특징 상관이 강하면 왜곡될 수 있다. |
| 반사실적 설명 Counterfactual | "무엇을 바꾸면 결과가 달라지는가". 정보주체에게 실행 가능한 유일한 설명 형태에 가깝다. |
| 모델 카드 | 모델의 용도·범위 밖 사용·분해 성능·한계를 표준 형식으로 기록한 문서. |
| 데이터시트 | 데이터셋의 동기·구성·수집 과정·사용·유지관리를 기록한 문서. |
| 불충실한 설명 Unfaithful CoT | LLM의 사고사슬이 실제 결정 요인을 반영하지 않고 사후 합리화인 현상. |
| 자동화 편향 | 인간 검토자가 기계 출력을 비판 없이 수용하는 경향. 지표는 뒤집기 비율. |
📖 프라이버시 · 데이터
| 용어 | 정의 |
|---|---|
| 맥락적 무결성 | 프라이버시를 "정보가 원래 맥락의 규범에 맞게 흐르는가"로 정의하는 틀. 5요소: 발신자·수신자·주체·정보 유형·전송 원칙. |
| 차등 프라이버시 Differential Privacy | 한 개인의 포함 여부가 출력 분포에 미치는 영향을 eε배 이내로 제한하는 수학적 보증. 참여 여부를 보호하며 집단적 사실은 보호하지 않는다. |
| ε (엡실론) | DP의 프라이버시 예산. 작을수록 강한 보호. 단위(쿼리당/전체), δ, 인접성 정의(레코드/사용자), 누적 예산과 함께 읽어야 한다. |
| DP-SGD | 그래디언트 클리핑 + 노이즈로 학습에 DP를 적용하는 표준 방법. 소수 집단 성능이 먼저 저하되어 공정성과 충돌한다. |
| k-익명성 | 같은 준식별자 조합이 최소 k명이 되도록 하는 기법. 동질성 공격에 취약. |
| 연합학습 | 원본 데이터 대신 모델 업데이트를 공유하는 학습 방식. 그 자체로는 프라이버시 보증이 아니다. |
| 보안 집계 | 서버가 개별 업데이트를 볼 수 없게 하는 암호 프로토콜. 연합학습의 필수 보완재. |
| 멤버십 추론 | 특정 레코드가 학습에 사용되었는지 알아내는 공격. AUC가 0.5에 가까울수록 안전. |
| 학습 데이터 추출 | 모델이 암기한 학습 텍스트·이미지를 프롬프트로 끌어내는 공격. 중복 제거가 주요 방어. |
| 기계 망각 Machine Unlearning | 학습된 모델에서 특정 데이터의 영향을 제거하려는 기법. 보증 수준은 아직 제한적. |
| TDM 예외 | 텍스트·데이터 마이닝을 위한 저작권 예외. EU에서는 권리자의 옵트아웃 유보가 가능. |
| 섀도우 AI | 승인되지 않은 외부 AI 도구의 업무 사용. 금지보다 대체재 제공 + 데이터 등급화가 효과적. |
📖 안전성 · 정렬 · 에이전트
| 용어 | 정의 |
|---|---|
| 명세 게이밍 | 명시된 목표를 정확히 달성하면서 설계 의도를 위반하는 현상. 굿하트 법칙의 기술적 판본. |
| 목표 오일반화 | 학습 분포에서 구분되지 않던 두 목표가 배포 분포에서 갈라져, 유능하게 잘못된 목표를 추구하는 현상. |
| 보상 해킹 | 보상모델의 허점을 정책이 착취하는 현상. |
| 아첨 Sycophancy | 인간 평가자의 동의 선호가 학습되어 사실 정확성보다 사용자 의견에 맞추는 경향. |
| RLHF | 인간 선호 데이터로 보상모델을 학습하고 정책을 최적화하는 정렬 기법. |
| 헌법적 AI | 명시된 원칙 목록에 따라 모델이 자기 출력을 비평·수정해 선호 데이터를 생성하는 방식. 규칙이 공개 검토 가능하다는 것이 장점. |
| 확장 가능한 감독 | 인간이 직접 평가할 수 없는 출력에 대해 감독을 가능하게 하는 연구 방향(토론, 비평 모델, 재귀적 보상 모델링). |
| 레드팀 | 의도적으로 시스템의 유해 출력·취약점을 유도해 찾아내는 활동. |
| 안전 사례 Safety Case | 주장 → 논증 → 증거 → 가정 → 반박 가능성 구조로 안전을 반증 가능하게 문서화하는 형식. |
| 간접 프롬프트 주입 | 에이전트가 읽는 문서·웹·메일에 명령을 심어 조종하는 공격. 완전 방어는 존재하지 않는다. |
| 신뢰 경계 | 비신뢰 콘텐츠를 처리하는 세션과 민감 권한을 가진 세션을 분리하는 설계 원칙. |
| 바이브 코딩 | LLM과의 반복 대화로 코드를 생성·수정하는 개발 방식. 책임은 통제 가능성을 따라 배분된다. |
📖 규제 · 거버넌스
| 용어 | 정의 |
|---|---|
| 제공자 / 배포자 Provider / Deployer | EU AI Act의 역할 구분. 자기 상표 부착이나 의도된 목적의 실질적 변경은 배포자를 제공자로 전환시킨다. |
| 고위험 AI | 고용·신용·교육·법 집행·필수 서비스 등 특정 용도의 시스템. 위험관리·데이터 거버넌스·기술문서·로그·인간 감독 등의 의무가 부과된다. |
| GPAI | 범용 AI 모델. 기술문서·저작권 정책·학습 콘텐츠 요약 공개 의무. 시스템적 위험 모델은 평가·사고 보고 추가. |
| 금지 관행 | 조작·취약성 이용, 사회적 점수화, 특정 생체 식별 등 전면 금지되는 용도. |
| NIST AI RMF | GOVERN·MAP·MEASURE·MANAGE 4기능으로 구성된 자발적 위험관리 프레임워크. |
| ISO/IEC 42001 | AI 경영시스템(AIMS) 표준. 제3자 인증이 가능하다는 점이 실무적 가치. |
| AIA 알고리즘 영향평가 | 시스템의 사회적·법적·기술적 영향을 사전 평가하는 문서. 품질 기준은 "읽고 반대할 수 있는가". |
| 3선 방어 | 1선 제품 / 2선 리스크·컴플라이언스 / 3선 내부감사. 2선은 지연 권한을 가져야 한다. |
| 책임 격차 | 학습 시스템의 행동을 예견·통제할 수 없어 책임 귀속이 어렵다는 주장. 제도 설계로 상당 부분 메울 수 있다는 반론이 있다. |
| C2PA | 콘텐츠에 서명된 출처 매니페스트를 부착하는 표준. 탐지가 아니라 출처 기록 접근. |
| 거짓말쟁이의 배당 | 진짜 증거를 "AI 조작"이라 부인하는 전략이 가능해지는 현상. 탐지 기술로 해결되지 않는다. |
| 윤리 워싱 | 실질적 제약 없이 윤리 활동의 외형만 갖추는 것. 판별 기준은 "실제로 무언가를 못 하게 만들었는가". |
2. 규제 · 표준 원문
국제 규범
EU AI Act — Regulation (EU) 2024/1689 원문 (EUR-Lex)
AI Act Explorer — 조문·부속서 탐색 도구
European Commission — AI 규제 프레임워크
OECD AI Principles · OECD.AI 정책 대시보드
UNESCO — Recommendation on the Ethics of AI (2021)
GDPR 전문 (제22조 자동화된 결정, 제35조 DPIA)
AI Act Explorer — 조문·부속서 탐색 도구
European Commission — AI 규제 프레임워크
OECD AI Principles · OECD.AI 정책 대시보드
UNESCO — Recommendation on the Ethics of AI (2021)
GDPR 전문 (제22조 자동화된 결정, 제35조 DPIA)
표준 · 프레임워크
NIST AI Risk Management Framework 1.0
NIST AI RMF Playbook — 실행 항목
ISO/IEC 42001:2023 — AI 경영시스템
C2PA — 콘텐츠 출처·진정성 표준
OWASP Top 10 for LLM Applications
NIST AI RMF Playbook — 실행 항목
ISO/IEC 42001:2023 — AI 경영시스템
C2PA — 콘텐츠 출처·진정성 표준
OWASP Top 10 for LLM Applications
국내
국가법령정보센터 — AI 기본법·개인정보보호법 원문
개인정보보호위원회 — AI 개인정보 처리 안내서
과학기술정보통신부 — AI 정책
한국저작권위원회 — 생성형 AI 저작권 안내
소프트웨어정책연구소 — AI 정책 리포트
개인정보보호위원회 — AI 개인정보 처리 안내서
과학기술정보통신부 — AI 정책
한국저작권위원회 — 생성형 AI 저작권 안내
소프트웨어정책연구소 — AI 정책 리포트
3. 핵심 논문 30선
4. 오픈소스 도구
| 도구 | 용도 | 링크 |
|---|---|---|
| Fairlearn | 공정성 지표 계산, 완화 알고리즘, 대시보드 | fairlearn.org |
| AI Fairness 360 | 70+ 공정성 지표, 10+ 완화 알고리즘 | GitHub |
| SHAP | 특징 기여도 계산·시각화 | GitHub |
| LIME | 국소 대리 모델 기반 설명 | GitHub |
| InterpretML | 내재적 해석가능 모델(EBM)과 설명 도구 | interpret.ml |
| Opacus | PyTorch용 DP-SGD 구현 | opacus.ai |
| TensorFlow Privacy | DP 학습 및 프라이버시 예산 계산 | GitHub |
| ML CO2 Impact | 학습 탄소 배출량 추정 | mlco2.github.io |
| Model Card Toolkit | 모델 카드 생성·배포 | Hugging Face 가이드 |
| AI Incident Database | 공개 AI 사고 사례 검색 | incidentdatabase.ai |
| ML-fairness-gym | 피드백 루프 시뮬레이션 | GitHub |
5. 추천 도서
- 📖 Fairness and Machine Learning — Barocas, Hardt, Narayanan · 무료 온라인 — 이 분야 표준 교재
- 📖 Interpretable Machine Learning — Molnar · 무료 온라인
- 📖 The Alignment Problem — Brian Christian — 공정성·해석가능성·정렬을 하나의 서사로
- 📖 Weapons of Math Destruction — Cathy O'Neil — 규모·불투명성·피해 순환의 대중적 정식화
- 📖 Atlas of AI — Kate Crawford — 광물·노동·에너지의 물질적 관점
- 📖 Automating Inequality — Virginia Eubanks — 복지 행정 자동화와 빈곤
- 📖 Ghost Work — Gray & Suri — 보이지 않는 데이터 노동
- 📖 Privacy in Context — Helen Nissenbaum — 맥락적 무결성의 원전
- 📖 The Black Box Society — Frank Pasquale — 알고리즘 책임성 담론의 고전
- 📖 Power and Progress — Acemoglu & Johnson — 기술 진보의 분배는 선택이라는 논증
- 📖 Race After Technology — Ruha Benjamin — '새로운 짐 코드' 개념
- 📖 The Age of Surveillance Capitalism — Shoshana Zuboff — 데이터 축적의 정치경제
6. 지속 학습 채널
연구·정책 기관
Stanford HAI — AI Index Report (연례 데이터)
Ada Lovelace Institute — 감사·영향평가 실무 연구
AI Now Institute — 권력·노동 관점
Partnership on AI — 배포 가이드·데이터 노동
EPIC · EFF — 프라이버시·디지털 권리
ACM FAccT — 공정성·책임성·투명성 학회
AAAI/ACM AIES — AI 윤리·사회 학회
Ada Lovelace Institute — 감사·영향평가 실무 연구
AI Now Institute — 권력·노동 관점
Partnership on AI — 배포 가이드·데이터 노동
EPIC · EFF — 프라이버시·디지털 권리
ACM FAccT — 공정성·책임성·투명성 학회
AAAI/ACM AIES — AI 윤리·사회 학회
7. 전 과정 체크리스트
다음 항목에 모두 "예"라고 답할 수 있으면 이 과정의 목표에 도달한 것입니다.
- 임의의 AI 시스템에 대해 사회기술 7층 분석을 수행할 수 있다
- 공정성 지표 3계열을 수식으로 쓰고, 맥락에 맞는 주 지표를 선택·정당화할 수 있다
- 불가능성 정리를 이용해 "모든 공정성을 만족시키자"는 요구를 반박할 수 있다
- 수신자별로 다른 설명 산출물을 설계하고 충실성·안정성을 검증할 계획을 세울 수 있다
- 모델 카드와 데이터시트를 처음부터 작성할 수 있다
- ε 값을 단위·δ·인접성·누적 예산과 함께 해석하고 감사 질문을 던질 수 있다
- 학습 데이터 추출·멤버십 추론 위험을 릴리스 게이트 지표로 설정할 수 있다
- 명세 게이밍과 목표 오일반화를 구분하고 각각의 대응을 설계할 수 있다
- 에이전트 권한 6원칙으로 최대 피해액을 산정하고 게이트를 설계할 수 있다
- EU AI Act에서 시스템의 위험 등급과 자사 역할을 조문 근거로 판정할 수 있다
- NIST RMF × ISO 42001 × AI Act 매핑 표를 작성할 수 있다
- 노동·환경·집중 위험을 조달 계약과 운영 절차로 번역할 수 있다
- 비배포가 정당한 조건 6가지를 적용해 판단할 수 있다
- AIA 14절을 작성하고, 그 문서에 대해 스스로 반론 3개를 제기할 수 있다
- AI 사고 대응 9단계를 기한·책임자·산출물과 함께 설계할 수 있다
자료의 최신성에 관하여. AI 규제와 판례는 빠르게 변합니다. 이 자료실의 법령·표준 링크는 원문 확인용 출발점이며, 실제 의사결정 전에는 반드시 시행일·개정 이력·하위 고시를 직접 확인하고 문서에 확인 일자를 기재하세요. 학술 링크는 arXiv·출판사 공식 페이지를 사용했습니다.