첨단 AI 개발을 위한 안전 사례(Safety Cases) 구축 가이드라인
Towards safety cases for frontier AI training
OpenAI News첨단 인공지능(AI)의 위험성을 사전에 관리하기 위해, 구조화된 안전 문서인 ‘안전 사례(Safety Cases)’ 작성을 필수적으로 요구해야 한다고 제시했습니다.
- 제시된 안전 사례는 모델 정렬(Alignment), 격리(Containment), 모니터링 세 가지 기술적 방어막을 구축하며, 최고 경영진의 승인과 사전 위험 분석 등 운영 절차를 포함합니다.
- 이는 고위험 산업의 표준을 따르는 방식으로, AI 시스템의 신뢰도를 높이고 사고 발생 시 책임 소재를 명확히 하는 중요한 산업 지침이 될 전망입니다.
- 다만, 이 가이드라인은 첨단 강화 학습 훈련 단계에 초점을 맞춘 것이며, 실제 모델의 외부 배포 및 활용에는 훨씬 광범위한 안전성 검토가 추가로 필요합니다.
최전선 인공지능(frontier AI)의 훈련 단계에 진입함에 따라, 구조화된 '안전 사례(safety cases)' 작성이 필수적으로 요구된다는 지침이 제시되었다. 안전 사례는 항공이나 원자력 등 다른 안전 중요 산업에서 사용되는 포괄적이고 증거 기반의 위험 논증을 목표로 한다. 이 가이드라인은 모델 정렬 훈련, 격리(containment), 모니터링 세 가지 기술적 측면을 모두 다루어, 모델이 오정렬된 행동을 하더라도 이를 막고 감지할 수 있는 방어막 구축에 초점을 맞추고 있다.
기술적 안전장치로는 첫째, 훈련 환경에서 자동화/수동 데이터셋 검토를 통해 편향되거나 악용될 여지가 있는 부분을 제거하고, 평가(eval) 시에는 오프라인 정렬 평가와 최악의 경우 스트레스 테스트 등을 수행해야 한다. 둘째, 모델이 오정렬될 경우 피해를 막기 위해 및 연구 인프라 보안을 강화하고, 교차 샘플 통신 경로를 제한하며 불변 기록(immutable transcripts)을 저장하는 등 격리 조치가 필요하다. 셋째, 실시간 모니터링 시스템을 통해 잠재적 오정렬 행동을 포착하고, 경고 발생 시 정의된 SLA에 따라 즉시 대응하거나 훈련을 자동 일시 중지해야 한다.
기술적 방어막 외에도 운영상의 안전 사례 구축이 강조된다. 여기에는 사전 위험 분석(pre-mortems)을 위한 다른 팀원의 반대 의견 제시, 최고 경영진의 승인 및 거부권 행사 등 다중 내부 검증 절차가 포함되어야 한다. 또한, 훈련 책임자에게 안전 사례와 사고 대응에 대한 명확한 책임 소재를 부여하고, 문제가 발견되면 모든 관련 훈련을 일시 중지할 수 있는 기술적 통제 장치가 필수적이다. 나아가 심각한 오정렬 사고 발생 후에는 근본 원인 분석(root-cause)과 운영 및 문화적 사후 검토가 이루어져야 한다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 샌드박스
- 프로그램을 바깥과 분리된 안전한 공간에서 실행하게 하는 환경.