장기 조직 업무를 위한 비파괴 메모리 시스템 Mem++
Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agents
arXiv대규모 언어 모델(LLM) 에이전트가 복잡한 조직 환경에서 장기간 업무를 수행할 때, 시간 흐름에 따른 정확한 정보 검색을 돕는 새로운 메모리 시스템 Mem++가 제안되었습니다.
LLM 에이전트가 장기간에 걸쳐 복잡한 업무를 수행할 때, 과거의 정확한 기록을 추적하는 것이 매우 중요해요. Mem++는 시간적 요소를 고려하여 정보 검색 능력을 크게 향상시켜 줘요.
- 기존 방식이 정보를 작성 시점에 요약하거나 압축하는 것과 달리, Mem++는 모든 원본 문서를 그대로 보존하며 질문 시점까지의 자료를 선별적으로 결합합니다.
- 실제 조직 업무 벤치마크(OrgMemBench) 평가에서 기존 최고 성능 대비 큰 폭으로 높은 점수를 기록하며, 기업 환경에서의 정보 검색 능력을 크게 향상시켰습니다.
- 이 기술은 특히 '언제'라는 시간적 요소를 고려하여 문서의 버전을 관리하는 데 최적화되어 있어, 과거 기록 추적이 중요한 상황에 강력한 강점을 가집니다.
(LLM) 가 장기간에 걸쳐 조직적 업무를 수행할 때, 결정 사항은 문서 형태로 기록되므로 질문에 답하려면 특정 시점에 어떤 버전의 정보가 존재했는지 아는 것이 중요합니다. 기존 메모리 시스템들은 문서를 작성하는 시점(write-time)에 정보를 사실이나 그래프 엣지로 압축하여 저장하기 때문에, 과거 버전을 추적하는 데 한계가 있었습니다.
이를 해결하기 위해 Mem++라는 비파괴 메모리 프레임워크가 제안되었습니다. 이 시스템은 모든 문서를 작성일과 저자 정보와 함께 원본 그대로 보존하며, 문서 작성 시점에는 생성 모델을 호출하지 않습니다. 대신 질문이 들어오는 읽기 시점(read-time)에만 작동하여, 질문 시점까지의 날짜를 가진 문서들만을 검색하고 렉시컬 및 의미적 순위를 결합합니다.
조직 업무 인 OrgMemBench 평가 결과, Mem++는 기존 최고 성능 메모리 시스템 대비 두 가지 답변 모델에서 각각 8.0점에서 13.1점 높은 점수를 기록했습니다. 특히 gpt-4.1-mini를 사용했을 때 최고의 종합 점수를 달성했으며, 이는 방식보다 2.6점 높은 수치입니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- RAG
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
기존 메모리 시스템은 어떤 한계가 있었나요?
기존 메모리 시스템들은 문서를 작성하는 시점(write-time)에 정보를 사실이나 그래프 엣지 형태로 압축하여 저장하기 때문에, 과거 버전의 기록을 추적하는 데 어려움이 있었습니다.
Mem++는 어떤 방식으로 작동하나요?
Mem++는 모든 문서를 원본 그대로 보존하고, 질문이 들어오는 읽기 시점(read-time)에만 작동해요. 이때 질문 시점까지의 날짜를 가진 문서들만을 검색하여 결합합니다.
실제 성능은 어느 정도인가요?
조직 업무 벤치마크인 OrgMemBench 평가에서 기존 최고 성능 메모리 시스템보다 높은 점수를 기록했어요. 특히 gpt-4.1-mini를 사용했을 때 최고의 종합 점수를 달성했습니다.