잠재적 프롬프팅: 언어 모델의 숨겨진 특성 전달 메커니즘 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

잠재적 프롬프팅: 언어 모델의 숨겨진 특성 전달 메커니즘 연구

Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds

arXiv9월 18일 발표 · 3분 · 심사 전 논문

언어 모델이 출력과 직접적인 관련 없이 숨겨진 특성을 전달하는 '잠재적 프롬프팅' 현상을 분석하고, 이를 설명할 수 있는 다양한 측정 방법론을 비교했습니다.

세 줄 요약arXiv 원문 기반
  1. 단순히 출력을 관찰하거나 고정된 벡터를 비교하는 방식으로는 특성 전달 메커니즘 설명이 어려웠으나, 특정 내부 상태를 인과적으로 조작하는 실험에서 유의미한 성능 향상이 확인되었습니다.
  2. 이는 언어 모델이 단순 패턴 학습을 넘어, 외부 요인에 의해 정보를 의도적으로 '제어'하거나 조작할 수 있는 깊은 작동 원리를 가졌음을 시사합니다.
  3. 다만 연구진은 관찰 가능성, 인과적 타이밍 등 네 가지 측정 방식이 모두 독립적인 특성이며, 이들만으로 전체 학습 메커니즘을 완전히 규명하기는 어렵다고 결론지었습니다.

언어 모델이 출력과 직접적인 관련 없이 숨겨진 특성을 전달하는 '잠재적 학습(Subliminal learning)' 현상을 분석했다. 기존에는 출력이 공변하는지, 고정된 출력 벡터가 정렬되는지, 은닉 상태에서 답을 읽을 수 있는지, 또는 특정 상태가 인과적으로 답변을 제어하는지를 측정해왔다. 연구진은 Llama-3.1-8B부터 70B까지의 모델에 대해 이 프로토콜을 적용한 결과, 고정된 출력 벡터 유사성은 행동 예측력이 낮았으며(쌍별 평균 상관 변화 -0.080), 고정된 출력 헤드 판독값에서는 정규화 깊이 AUC의 해소된 변화가 관찰되지 않았다.

인과적 제어 여부를 테스트하기 위해, 연구진은 한 숫자 의 임시 답변 위치 상태를 다른 프롬프트로 복사하는 '도너-제어(Donor-control)' 방식을 사용했다. 이 방법은 AUC를 0.254에서 0.540으로 상승시키는 데 성공했으며(쌍별 변화 +0.286), 이는 모든 개념에 걸쳐 증가세를 보였다. 또한, 두 개의 Qwen 모델에서는 단위 평균화가 양의 결합 연관성을 만들었으나, 숫자 폭을 제어하자 이 연관성이 사라지는 현상이 관찰되어 길이 혼란(length confound)이 있음을 밝혔다.

연구는 고정된 기하학적 구조, 관찰 가능성, 인과적 타이밍, 다중 토큰 측정 등 네 가지 측정 방식이 모두 독립적인 특성을 가진다고 결론지었다. 이러한 방법들은 토큰 수준의 설명을 제약할 수는 있지만, 언어 모델의 훈련 시점 특성 전달 메커니즘 자체를 규명하는 데는 한계가 있음을 지적했다.

용어 풀이

프롬프트
AI에게 주는 지시나 질문 글.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv