문법 구조에 맞춰 추론 과정을 압축하는 SynLat 프레임워크
SYNLAT: Syntax-Aligned Text-Latent Compression for Chain-of-Thought Reasoning
긴 추론 과정(CoT)이 발생하는 막대한 토큰 비용 문제를 해결하기 위해, 문법 구조에 맞춰 압축 경계를 설정하는 SynLat 프레임워크가 제안되었습니다.
복잡한 추론 과정에서 발생하는 막대한 토큰 비용을 줄이면서도, 문법 구조를 활용해 핵심 정보를 정확하게 보존할 수 있게 해줘요.
- SynLat은 텍스트의 구문 분석 단위(SAU)를 활용하여 압축 지점을 결정함으로써, 기존 방식보다 문맥적 일관성을 유지하며 핵심 정보를 보존합니다.
- 이 기술은 복잡한 추론 과정의 토큰 비용을 크게 줄이는 동시에 성능 저하를 최소화하여, 대규모 언어 모델 기반 AI 서비스의 효율성과 신뢰도를 높일 잠재력을 가집니다.
- 실험 결과, SynLat은 특히 긴 CoT 그룹처럼 강력한 압축이 필요한 환경에서 기존 최고 성능 기준 모델을 능가하는 높은 효율성을 입증했습니다.
긴 추론 과정(CoT)을 생성할 경우 막대한 출력 비용이 발생하며, 제한된 예산 내에서 핵심 답변 정보를 보존하는 것이 중요합니다. 기존의 토큰 단위 또는 고정 길이 경계 설정 방식은 구나 공식 같은 일관된 내용을 분절시킬 수 있습니다. 이에 SynLat은 비중복적인 문법 구조 단위(SAU)를 활용하여 압축 경계를 문법적 구조에 맞추는 텍스트-잠재 압축 프레임워크를 도입했습니다.
SynLat의 작동 방식은 답변 조건이 부여된 Teacher가 점진적인 KEEP/LATENT 목표를 생성하고, 이를 단일 압축 기반 Student 모델이 활용하는 것입니다. 이 과정에서 학생 모델은 추론 시 질문과 요청된 압축 레벨만을 사용하여 혼합된 추론을 생성할 수 있도록 설계되었습니다.
Qwen3-8B 및 Qwen3-14B 모델을 대상으로 Standard-CoT와 Long-CoT 그룹, 세 가지 압축 레벨에서 테스트한 결과, SynLat은 모든 12개 태스크 그룹 집계에서 기존 최고 성능 기준(baseline)과 같거나 능가하는 결과를 보였습니다. 특히 Long-CoT 그룹처럼 강력한 압축이 필요한 환경에서 큰 이점을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
긴 추론 과정에서 토큰 비용이 많이 드는 이유는 무엇인가요?
긴 추론 과정을 생성할 경우 막대한 출력 토큰 비용이 발생하기 때문이에요. 이 때문에 제한된 예산 내에서도 핵심 답변 정보를 보존하는 것이 중요해요.
SynLat은 기존 방식과 어떻게 다른가요?
SynLat은 비중복적인 문법 구조 단위(SAU)를 활용하여 압축 경계를 문법적 구조에 맞추는 프레임워크예요. 이 덕분에 일관된 내용을 분절시키는 문제를 해결하고, 문맥적 일관성을 유지하며 핵심 정보를 보존할 수 있어요.