MLX 기반, Apple Silicon 최적화 구조화 데이터 추출 기술
harshatheg/Qwen-2.5-1B-RLCD
Hugging Face기존의 토큰 단위 순차 생성 방식의 한계를 극복한 '병렬 제약 디코딩' 기술입니다. 이 엔진은 여러 데이터 필드를 동시에 평가하여 구조화된 정보 추출 및 분류 효율을 혁신적으로 높였습니다.
- 실제 벤치마크 결과, 복잡한 엔터프라이즈 트리아지(28개 필드) 같은 작업에서 최대 7.0배의 지연 시간 감소를 기록했습니다. 또한 JSON 문법 오류 없이 구조적 무결성을 100% 보장합니다.
- 금융 사기 탐지, IT 보안 감사 등 높은 신뢰성과 빠른 처리가 필수적인 고난도 AI 서비스에 적용되어 핵심 성능을 대폭 끌어올릴 수 있습니다.
- 이 기술은 MLX 프레임워크 기반의 Apple Silicon 환경에 최적화되었으며, 정확한 결과를 위해서는 필드별 타입과 선택지(Schema) 정의가 필수적으로 요구됩니다.
기존의 구조화 생성 방식은 단위로 순차적인(autoregressive) 디코딩에 의존합니다. 이 과정에서 각 토큰마다 별도의 포워드 패스가 필요하며, 스키마 크기가 커질수록 지연 시간도 선형적으로 증가하는 한계가 있습니다. 병렬 제약 디코딩은 이러한 문제를 해결하기 위해, 필드 값들이 유한 후보 집합(bounded candidate sets)에 속한다는 특성을 활용합니다. 컨텍스트 프리픽스 전처리 후, KV-Cache를 여러 스키마 필드에 동시에 브로드캐스팅하여 모든 필드를 병렬로 평가하는 것이 핵심입니다.
이 기술은 Apple Silicon M4 Max 환경에서 높은 처리량의 추론 엔진을 제공하며, 표준 자가회귀 디코딩 대비 최대 7.0배의 지연 시간 감소를 보여줍니다. 예를 들어, 28개 필드가 포함된 엔터프라이즈 지원 트리아지 시나리오에서는 1,900ms에서 270ms로 속도가 개선되었습니다. 또한, 이 방식은 JSON 파싱 오류 없이 구조적 무결성을 100% 보장하며, 각 필드별 신뢰도 점수(confidence scores)를 제공합니다.
개발자는 Apple Silicon Mac (M1~M4 시리즈) 및 macOS 14.0 이상 환경에서 이 엔진을 사용할 수 있습니다. 스키마는 `StructuredSchema` 클래스를 사용하여 정의하며, 각 필드는 모델 추론을 안내하는 'description'과 선택지(choices)를 지정해야 합니다. 예를 들어, 우선순위나 부서와 같은 필드에 대해 열거형(enum) 또는 불리언 타입을 명시적으로 정의하여 병렬 생성을 위한 기반을 마련합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.