LLM의 직업별 전문 지식 측정 프레임워크 ORQA 공개 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM의 직업별 전문 지식 측정 프레임워크 ORQA 공개

ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge

arXiv9월 14일 발표 · 3분 · 심사 전 논문

연구진은 LLM의 직업별 전문 지식을 측정하기 위해 'ORQA'라는 프레임워크를 개발했습니다. 이 방법은 규제 기관 등 신뢰할 수 있는 출처에서 질문-답변 쌍을 추출하여 전문성을 검증합니다.

세 줄 요약arXiv 원문 기반
  1. ORQA는 21개 주요 직업군 116개 직종을 다루며, 테스트 결과 최고 성능은 의료 관련 직종(78%)에서 나타나 모델 간 지식 격차가 매우 크다는 것을 보여줍니다.
  2. 이 프레임워크는 추상적인 능력을 넘어 실제 산업 현장의 구체적이고 출처가 명확한 전문 지식을 측정하여, LLM의 실질적인 업무 활용 가치를 평가하는 기준을 제시합니다.
  3. 성능은 직업군별 편차가 크고 개별 직종에서는 낮은 점수를 보였으나, ORQA는 전문 영역 AI 성능 평가를 위한 확장 가능하고 유용한 방법론임을 입증했습니다.

연구진은 (LLM)의 직업 수준 전문 지식을 테스트하기 위한 방법론인 ORQA를 제시했습니다. 기존 방식들이 추상적인 기술을 직업에 매핑하거나 확보가 어렵고 비용이 많이 드는 전문가 지식에 의존했던 것과 달리, ORQA는 O*NET 직업군을 신뢰할 수 있는 직업별 웹사이트(규제 기관, 면허 발급 기관 등)와 연결합니다. 이를 통해 출처를 추적할 수 있는 질문-답변 쌍을 생성하여 고품질의 전문 지식 테스트 세트를 구축했습니다.

이 방법론으로 생성된 질문 세트는 SOC의 21개 주요 그룹에 걸친 116개 직업군을 다루며, 총 187개의 다양한 웹사이트에서 가져온 480개의 질문으로 구성되었습니다. 각 질문은 해당 직업과 관련된 실제 세계의 기술적 질문을 탐구하도록 설계되었으며, 이를 통해 LLM이 전문 영역에서의 실질적인 업무 활용 가치를 평가할 수 있게 합니다.

15개의 최신 및 모델을 대상으로 테스트한 결과, 성능 편차가 크게 나타났습니다. 특히 의료 관련 직업군에서 78%로 가장 높은 성능을 보였으며, 오피스 및 행정 지원 분야는 약 40%의 성능을 기록했습니다. 최고 성능을 보인 모델로는 Claude Opus 4.6, GPT-5.4, Claude Sonnet 4.6 등이 각각 약 58~62%를 달성한 반면, 소규모 오픈 웨이트 모델들은 약 33~41%의 성능을 기록했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
오픈 웨이트
학습된 가중치를 공개해 누구나 내려받아 쓸 수 있게 한 모델. 학습 데이터까지 공개한다는 뜻은 아니에요.
원문arXiv · ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv