단일 패스로 100개 언어를 처리하는 결정 엔진 Laya
NandhaKishorM/laya
GitHubLaya는 텍스트를 생성하지 않는 비자체회귀식(non-autoregressive) 결정 엔진으로, 복잡한 상태 정보(JSON, 이메일 등)에서 의도나 속성을 판단합니다.
- 단일 포워드 패스로 100개 이상의 다국어를 지원하며, 요청에 따라 최적의 모델을 자동으로 선택하는 라우터 기능을 제공합니다.
- 고객 문의 분류, 보안 가드레일 등 다양한 비즈니스 워크플로우에 즉시 적용 가능하며, 통계적으로 신뢰도 높은 확신 점수를 제공합니다.
- 배치 처리 시 초당 수십 개의 질문을 처리할 만큼 매우 빠르며, 운영 환경에서는 모델 재로드 지연 방지를 위해 사전 로딩(Preload)이 필수적입니다.
Laya는 비자체회귀식(non-autoregressive) 의사결정 엔진으로, 텍스트를 생성하지 않고도 복잡한 상태 정보(예: 이메일, JSON 문서 등)에서 'choice', 'score', 'noul'과 같은 형태의 결정(typed decisions)을 수행합니다. 이 시스템은 단일 포워드 패스만으로 100개 이상의 다국어를 지원하며, 한 질문에 대해 33ms가 소요됩니다. 특히 요청이 들어올 때마다 최적의 모델 체크포인트를 자동으로 선택하는 라우터 기능을 통해 정확성과 효율성을 높였습니다.
운영 환경에서 Laya를 사용할 때는 사전 로딩(Preload)을 권장합니다. 기본 설정(`max_loaded=1`)에서는 언어가 바뀔 때마다 모델 재구축이 발생하여 지연 시간이 길어질 수 있습니다. 하지만 `Router(preload=True)`와 같이 미리 체크포인트를 메모리에 올려두면, 언어 전환에 따른 오버헤드를 제거하고 32.8ms/질문과 같은 낮은 레이턴시를 유지할 수 있습니다.
Laya는 다양한 비즈니스 워크플로우에 적용 가능한 사전 설정된 질문 스키마를 제공합니다. 예를 들어, 지원 티켓 분류(intent, urgency, frustration)나 콘텐츠 안전성 검사(toxicity, harassment) 등에 활용 가능하며, 결정 결과에는 해당 선택이 이루어진 이유와 같은 라우팅 메타데이터가 포함됩니다. 에 따르면, Laya는 배치 처리 시 질문당 평균 7.2ms의 레이턴시를 보여주며, 이는 경쟁 모델 대비 빠른 성능을 입증합니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.