J 공간을 활용한 LLM 행동 제어 벡터 추출 연구 — AI 생성 일러스트AI 일러스트
모델 뉴스

J 공간을 활용한 LLM 행동 제어 벡터 추출 연구

Extracting Steering Vectors from J space

Hacker News9월 6일 발표 · 2분

연구진은 LLM의 중간 활성화 공간인 J 공간을 활용하여, 특정 개념 토큰만으로 모델이 원하는 행동을 하도록 유도하는 '조향 벡터(steering vector)'를 추출했습니다.

세 줄 요약Hacker News 원문 기반
  1. 모든 단어를 대문자로 출력하는 같은 단순한 행동은 성공적으로 제어했으나, 거절이나 복잡한 윤리적 판단과 관련된 행동 구현 시에는 노이즈가 많고 취약하다는 한계를 보였습니다.
  2. 이는 모델 전체를 재학습하지 않고도 AI의 출력을 조작할 수 있는 새로운 이론적 접근법을 제시하지만, 복잡한 개념 제어에는 여전히 기술적 난이도가 높습니다.
  3. 궁극적으로 J 공간만으로는 복잡한 행동에 필요한 모든 정보를 담아내기 어려워 정보 손실이 발생하며, 추출된 벡터 자체가 불안정하다는 한계가 명확합니다.

연구진은 (LLM)의 중간 활성화 공간인 J 공간을 이용하여, 특정 개념 만으로 모델이 원하는 행동을 유도하는 '조향 벡터(steering vector)'를 추출할 수 있음을 확인했다. 이 방법은 모든 단어를 대문자로 출력하는 것과 같은 단순한 모델 행동 제어에는 효과적이었으나, 거절이나 복잡하고 윤리적인 판단이 필요한 행동 구현 시에는 노이즈가 많고 취약하다는 한계를 보였다.

거절과 같은 복잡한 개념을 제어하기 위해 연구진은 구체적인 알고리즘을 제시했다. 이 방법은 먼저 관련 토큰들을 수집하고, 그중 C=5개의 토큰을 샘플링하여 자코비안 역행렬(Jacobian inverse)을 통해 활성화 벡터를 계산한다. 이를 K번 반복하여 평균화한 후, 전체 어휘의 평균 활성화 벡터에서 빼서 최종 조향 벡터를 얻는 방식으로 진행된다.

실험 결과, 이 방법으로 추출된 활성화 벡터는 노이즈가 많고 불안정하며, 특히 복잡한 행동을 제어할 때 취약하다는 한계가 명확했다. 연구진은 J 공간만으로는 특정 행동에 필요한 모든 정보를 담아내기 어려워 정보 손실이 발생한다고 결론지었다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문Hacker News · Extracting Steering Vectors from J space같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기