AI 기술의 신뢰성을 높이는 측정 및 평가 방법론
AI measurement and evaluation
NIST Artificial Intelligence미국 국립표준기술연구소(NIST)는 AI 기술의 신뢰성 확보를 위해 측정 기준, 평가 방법론을 개발하고 표준화하는 작업을 주도합니다.
AI 기술이 복잡해지면서 단순한 정확도만으로는 신뢰하기 어려워졌어요. NIST의 표준화 노력은 AI가 안전하고 책임감 있게 사용될 수 있는 기반을 마련하여, 우리 생활 전반에 걸쳐 활용도를 높여줘요.
- 단순 정확도를 넘어 편향성, 투명성, 해석 가능성 등 복잡한 특성을 다루며, 특히 위험 및 영향 평가(ARIA), 생성형 AI 분야에 집중하고 있습니다.
- 이러한 표준화 노력은 기술적 한계를 명확히 하고 전반적인 신뢰도를 높여 안전하고 책임감 있는 AI 생태계 구축을 목표로 합니다.
- AI의 특성별 평가는 작동하는 '맥락(Context)'에 따라 기준과 방식이 크게 달라지므로, 시스템 사용 환경을 반드시 고려해야 합니다.
신뢰할 수 있는 AI 제품과 서비스 개발은 기반 기술에 대한 정확하고 신뢰성 높은 측정 및 평가에 크게 의존합니다. NIST는 AI 기술이 성숙하고 새로운 응용 분야를 찾음에 따라, 관련 표준, 가이드라인, 모범 사례 채택을 촉진하며 측정 방법론 연구와 표준화 작업을 수행하고 있습니다. NIST는 1960년대 후반부터 자동 지문 식별 시스템 평가 활동을 시작했으며, 초기에는 정확도와 견고성(robustness)에 초점을 맞추었으나 현재는 편향성(bias), 해석 가능성(interpretability), 투명성 등 다양한 측면의 측정 및 평가를 다루고 있습니다.
NIST는 AI 기술의 신뢰도를 높이기 위해 네 가지 주요 활동을 수행합니다. 첫째, AI 특성을 정량적/정성적으로 분석하는 측정 과학을 발전시키고 정의합니다. 둘째, 테스트베드 구축과 데이터셋 큐레이션을 포함하여 실제 평가를 진행하고 기술적 한계를 식별합니다. 셋째, 학계, 산업계, 정부 프로그램을 위한 기술 가이드라인 및 관행을 공유합니다. 마지막으로, AI 측정 및 평가에 대한 자발적인 합의 기반 표준 개발에 기여하며, 이러한 노력은 NIST AI 혁신 연구소(NAIIL)와 새로운 미국 인공지능 안전 연구소 등을 통해 진행됩니다.
최근 주요 평가 노력으로는 'AI 위험 및 영향 평가(ARIA)' 프로그램과 'NIST GenAI' 프로그램이 있습니다. NIST는 신뢰할 수 있는 AI 시스템의 기반을 마련하기 위해 정확도, 설명 가능성, 개인 정보 보호, 견고성, 안전성 등 다양한 특성에 대한 공통 용어와 정의를 확립하는 데 집중하고 있습니다. 특히 이러한 특성들은 작동하는 '맥락(Context)'에 따라 측정 및 평가 기준이 달라지므로, 시스템 사용 환경을 고려한 포트폴리오가 필수적입니다.
AI의 신뢰성이라고 할 때, 어떤 것들을 평가하나요?
단순히 얼마나 정확한지 외에도 편향성(bias), 해석 가능성(interpretability), 투명성 등 다양한 측면을 측정하고 평가해요. 특히 안전성과 개인 정보 보호 같은 특성에 대한 공통 용어와 정의를 확립하는 데 집중하고 있어요.
NIST는 구체적으로 어떤 활동을 통해 AI 평가를 진행하나요?
첫째, AI의 특성을 정량적/정성적으로 분석하는 측정 과학을 발전시키고 정의해요. 둘째, 실제 테스트베드를 구축하고 데이터셋 큐레이션을 포함하여 기술적인 한계를 식별하며 평가를 진행해요. 셋째, 학계나 산업계 등 다양한 주체와 가이드라인과 관행을 공유하고요.
AI 평가 시 '맥락(Context)'을 고려해야 하는 이유는 무엇인가요?
AI의 특성별 평가는 시스템이 작동하는 환경, 즉 맥락에 따라 측정 및 평가 기준과 방식 자체가 크게 달라지기 때문이에요. 따라서 특정 상황만을 기준으로 삼기보다 사용 환경을 종합적으로 고려한 포트폴리오가 필수적이에요.