LLM의 붙여넣기 자료와 사용자 코멘트 분리 문제 연구 결과
Can LLMs Separate Pasted Artifacts from User Speech? Absorption at Unmarked Prompt Seams
대규모 언어 모델(LLM)이 사용자가 붙여넣은 외부 자료와 그 아래에 추가하는 사용자 코멘트를 하나의 텍스트로 오인하여 처리하는 '흡수' 현상이 발생합니다.
LLM이 외부 자료와 사용자의 코멘트를 구분하지 못하면, 중요한 데이터가 의도치 않게 편집 결과물에 포함되어 정보의 무결성이 손상될 수 있어요.
- 연구 결과, 모델들은 자료와 코멘트의 경계를 명확히 구분하는 데 어려움을 겪었으며, 프롬프트에 명시적인 경계 표시를 추가할 경우 흡수 현상을 크게 줄일 수 있었습니다.
- 이는 사용자가 외부 자료를 붙여 넣고 설명을 추가할 때, 모델이 의도치 않은 코멘트까지 편집 결과물에 포함시켜 데이터의 무결성을 해칠 위험성이 있음을 의미합니다.
- 단순히 빈 줄을 추가하는 것만으로는 한계가 있으며, 특히 코드 주석처럼 성격이 유사한 내용은 여전히 혼합될 수 있으므로 경계 마커 사용이 필수적입니다.
(LLM)은 사용자가 입력하는 모든 메시지를 일반 텍스트로 처리합니다. 이 과정에서 '흡수' 현상이 발생하는데, 이는 사용자가 붙여넣은 자료 아래에 추가한 사용자 코멘트를 모델이 마치 원래 붙여넣기 된 내용의 일부인 것처럼 오인하여 편집 결과물에 포함시키는 현상입니다. 기존의 명령어-데이터 분리 는 이러한 경계가 명확하지 않은 상황에서 발생하는 사용자의 발언을 테스트하지 못하는 한계를 가집니다.
연구진은 SEAM이라는 통제된 벤치마크(300개 편집 예시)를 도입하여 이 문제를 분석했습니다. 20개의 모델을 대상으로 실험한 결과, 단순히 빈 줄만 추가했을 경우 흡수 현상이 크게 감소하지 않았습니다. 반면, 경계 마커를 사용했을 때는 20개 모델 중 19개 모델에서 흡수율이 감소하는 것으로 나타났으며, 맨 줄 바꿈(bare newline)에서의 흡수율은 7.7%에서 최대 66.7%까지 다양하게 측정되었습니다.
특히 코드 주석처럼 붙여넣기 자료와 성격이 유사한 코멘트는 20개 모델 중 17개 모델에서 더 자주 흡수되는 경향을 보였습니다. 연구 결과에 따르면, 모델들은 붙여넣은 자료와 이후의 사용자 발언을 분리하는 데 어려움을 겪으며, 명시적인 경계 처리가 문제를 줄일 수는 있지만 완전히 해결하지는 못하는 것으로 확인되었습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
LLM의 '흡수' 현상이란 무엇인가요?
사용자가 붙여넣은 외부 자료 아래에 추가한 사용자 코멘트를 모델이 마치 원래 내용의 일부인 것처럼 오인하여 편집 결과물에 포함시키는 현상을 말해요.
단순히 빈 줄을 추가하는 것만으로도 흡수 현상을 막을 수 있나요?
연구 결과에 따르면, 단순히 빈 줄만 추가했을 경우 흡수 현상이 크게 감소하지 않았어요.
흡수 현상을 줄이려면 어떤 방법이 가장 효과적인가요?
경계 마커를 사용했을 때 흡수율 감소 효과가 나타났어요. 다만, 모델들이 자료와 발언을 완전히 분리하는 데 어려움을 겪기 때문에 명시적인 경계 처리가 필수적이라고 해요.