문맥 증강 지식 그래프 추론을 통한 다단계 질문 답변 연구
Repair Before Reinforce: Context-Augmented Knowledge Graph Reasoning for Multi-Hop Question Answering
arXiv다단계 질문에 답하려면 단순한 사실 관계 이상의 추론이 필요하며, 본 연구는 지식 그래프 기반의 문맥 증강 학습 프레임워크를 제안했습니다.
- 개별 트리플 외 주변 텍스트에서 추출한 '문맥 그래프'로 모델을 학습시키고, LLM 기반의 적응형 복구 과정을 통해 오류를 스스로 수정합니다.
- 이러한 문맥 정보 활용과 정교한 오류 보정 덕분에, 모델은 지식 그래프만 사용할 때보다 훨씬 안정적이고 높은 성능으로 다단계 추론에 성공했습니다.
- 질병 관련 KG를 대상으로 초기 지도학습(SFT) 후 강화학습(RL)을 적용하여 3~5단계와 같은 고난도 질문에서도 뛰어난 일반화 능력을 입증했습니다.
지식 그래프(KG)는 여러 연결된 사실 관계를 구조적으로 표현하는 데 유용하지만, (LLM)을 고립된 KG 트리플에만 학습시킬 경우 다단계 추론에 필요한 주변 문맥 학습이 제한될 수 있습니다. 본 연구에서는 이러한 문제를 해결하기 위해 문맥 증강 훈련 프레임워크를 제안했습니다. 이 프레임워크는 각 주요 KG 트리플마다 동일한 출처 텍스트 청크에서 추출된 지원 트리플을 첨부하여 '문맥 그래프(CG)'를 형성합니다. 이를 통해 타겟 KG 트리플 또는 경로만을 사용하는 KG 기반 감독 설정과, 지원 문맥 트리플까지 함께 사용하는 CG 기반 감독 설정의 두 가지 학습 환경이 구축됩니다.
모델의 낮은 단계 사실적 기초를 강화하기 위해, LLM 판정 및 이력 인지 적응형 복구 파이프라인을 도입했습니다. 이 파이프라인은 해결되지 않은 1단계 실패 지점을 식별하고, 목표로 하는 복구 예제에 대해 지속적으로 하며, 문제가 되는 노이즈 트리플을 제거하거나 격리합니다. 이러한 복구 단계를 거치면 모델은 정리된 1단계 검증 세트에서 100% 정확도에 도달할 수 있습니다.
최종적으로, 낮은 단계의 질문-답변 항목을 사용하여 (RL)을 적용하고 3~5단계와 같은 더 어려운 과제에서의 일반화 성능을 평가했습니다. 연구 결과, 두 질병 모두에서 문맥 증강 감독 방식은 KG만 사용한 감독 방식보다 일관되게 다단계 성능을 향상시켰으며, 복구된 SFT 체크포인트에서 시작한 RL은 더욱 크고 안정적인 성능 향상을 가져왔습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.