활용 사례 연구
FLM: Frequency-Aware Language Models for Generative Image Compression
ARarXiv
FLM은 주파수 영역의 확률적 모델링을 활용하여 이미지 손실 압축 효율을 극대화하는 언어 모델 기반 방식입니다. 기존 생성 모델이 가졌던 원본과의 충실도 저하 문제를 해결했습니다.
세 줄 요약
- 이미지를 DCT 계수로 변환하고 이를 토큰화한 뒤, FLM이 다음 주파수 계수를 예측하여 비트스트림을 생성합니다. 이 과정은 압축 효율과 재구성의 정확성을 동시에 확보합니다.
- FLM은 기존 방식 대비 높은 압축 성능(BD-PSNR 개선)을 보장할 뿐만 아니라, 의미적 충실도를 높이고 블록킹 아티팩트를 억제하여 시각적 품질도 크게 향상시킵니다.
- 손실 및 무손실 재압축 환경 모두에 적용 가능하며 기존 JPEG 프레임워크와 호환되지만, 최적 성능을 위해 전용 데이터셋과 2단계 미세 조정이 필요합니다.
FLM은 주파수 영역의 확률적 모델링을 활용하여 이미지 손실 압축 효율을 극대화하는 언어 모델 기반 방식입니다. 기존 생성 모델이 가졌던 원본과의 충실도 저하 문제를 해결했습니다.