LLM 활성화 제어를 위한 기하학적 최적화 방법 GeoSteer — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 활성화 제어를 위한 기하학적 최적화 방법 GeoSteer

GEOSTEER: Geodesic Optimization for Activation Steering in Large Language Models

arXiv9월 11일 발표 · 2분 · 심사 전 논문

대규모 언어 모델(LLM)의 동작을 제어하는 활성화 스티어링 기법 중, 기존 방식의 한계를 극복한 최적화 기반 방법 'GeoSteer'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. GeoSteer는 활성화를 리만 기하학적 최적화 문제로 정의하고, 여러 단계에 걸친 지오데식 단계를 통해 안정적이고 일관된 변화를 유도합니다.
  2. 활성화의 크기(Norm)를 보존하며 모델 행동을 정밀하게 제어하여, LLM의 신뢰성 및 안전성을 높이는 데 기여하는 기술입니다.
  3. 고정된 방향 대신 활성화 공간의 기하학적 구조를 활용해 목표를 설정하는 것이 핵심이며, 실제 벤치마크에서 성능 개선을 입증했습니다.

활성화 스티어링은 (LLMs)의 은닉 활성화를 추론 시점에 수정하여 모델 동작을 제어하는 경량화된 방식입니다. 특히 활성화 노름(norm)을 보존하려는 접근법이 연구되지만, 기존 방법들은 미리 정의된 스티어링 궤적에 의존하거나 단일 단계 업데이트에 한계가 있어 복잡한 활성화 분포 구조를 포착하기 어렵다는 문제가 있었습니다.

GeoSteer는 이러한 문제를 해결하기 위해 최적화 기반의 방법을 제안합니다. 이 방식은 스티어링을 리만 다양체(Riemannian optimization) 문제로 공식화하고, 표현 매니폴드 위에서 일련의 작은 지오데식 단계(geodesic steps)를 통해 활성화를 업데이트합니다. 고정된 방향 대신 원하는 활성화와 원치 않는 활성화를 구분하는 비선형 목표 함수를 학습하여 각 스티어링 단계를 적응적으로 안내합니다.

이러한 다단계 최적화 접근 방식은 활성화 노름을 보존하면서도 더 부드럽고 안정적이며 일관된 제어 행동을 제공합니다. GeoSteer는 TruthfulQA, RealToxicityPrompts, UltraFeedback 등의 에서 기존의 최고 성능(state-of-the-art) 활성화 스티어링 기준보다 지속적으로 개선되는 결과를 보여주었습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · GEOSTEER: Geodesic Optimization for Activation Steering in Large Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv