AI 에이전트 도구

기업 지식 기반 에이전트 검색 성능 벤치마크 공개

Benchmarking retrieval for agents on messy real-world company knowledge

HNHacker News10월 2일 발표 · 2분

기업의 복잡한 내부 지식(문서, 채팅 기록 등)을 다루는 에이전트 검색 성능 측정을 위해 실제 데이터를 기반으로 한 'Company Knowledge Bench'를 개발했습니다.

왜 중요해요AI 정리

기업의 복잡한 내부 자료를 검색할 때 단순히 키워드를 찾는 것을 넘어, 질문에 답하는 데 필요한 모든 정보를 빠짐없이 찾아주는 정교한 시스템이 중요해요.

세 줄 요약Hacker News 원문 기반
  1. 테스트 결과, 단순 하이브리드 검색보다 리랭커를 추가한 고도화된 파이프라인이 큰 성능 향상을 보였으며, 최적화된 고정식 방식이 에이전트 기반 방식에 근접하는 결과를 빠른 속도로 달성했습니다.
  2. 이 벤치마크는 단순 키워드 매칭을 넘어, 정보의 출처 권위와 최신성 등 복잡한 기준을 적용하여 실제 업무 환경에 맞는 정교한 평가 기준을 제시합니다.
  3. 궁극적으로 성공적인 검색 시스템은 단순히 관련 정보를 찾는 것을 넘어, 질문에 답하는 데 필요한 모든 정보(완전성)를 빠짐없이 제공하고 불필요한 내용이 없어야 합니다.

가 의존하는 핵심 지식원인 회사 내부 자료(문서, 티켓, 채팅 기록 등)의 검색 성능을 측정하기 위해 'Company Knowledge Bench'를 개발했습니다. 기존의 공용 는 법률이나 의료 같은 특정 도메인에 국한되거나 너무 인위적인 문서를 사용해 실제 업무 환경에서 발생하는 다양한 질의 유형과 사용 사례를 포괄하지 못한다는 문제점을 해결하고자 했습니다.

이 벤치마크는 단순 검색을 넘어, 정보가 질문에 답하는 데 필요한 모든 내용을 포함해야 하는 '완전성(Completeness)'과 불필요한 내용이 없어야 하는 '최소성(Minimality)' 같은 복합적인 속성을 기준으로 평가합니다. 또한, 출처의 권위나 최신성과 같은 기준을 적용하여 가장 선호되는 자료를 식별하는 '출처 선호도'까지 고려합니다.

다양한 검색 방식을 비교한 결과, 단순 하이브리드 검색 방식은 0.41의 점수를 기록했지만, 리랭커를 추가한 고정식 파이프라인은 0.50으로 성능을 높였습니다. 특히 최적화된 에이전트 기반 검색기(Kapa Deep)는 약 5초 만에 0.65라는 높은 점수를 기록하며, 단순 키워드 매칭 방식보다 우수한 성능을 보여주었습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
궁금한 점AI 정리 · 원문 기반
기존 벤치마크는 어떤 문제점이 있었나요?

기존의 공용 벤치마크는 법률이나 의료 같은 특정 분야에만 국한되거나, 실제 업무 환경과 동떨어진 인위적인 문서를 사용해서 다양한 질의 유형을 포괄하지 못하는 문제가 있었어요. 이 벤치마크는 회사 내부 자료를 다루어 이런 문제점을 해결했어요.

이 벤치마크가 평가하는 복합적인 기준은 무엇인가요?

단순 검색을 넘어, 정보가 질문에 답하는 데 필요한 모든 내용을 포함해야 하는 '완전성'과 불필요한 내용이 없어야 하는 '최소성' 같은 속성을 기준으로 평가해요. 또한 출처의 권위나 최신성까지 고려하여 가장 선호되는 자료를 식별하기도 합니다.

가장 높은 성능을 보인 검색 방식은 무엇인가요?

다양한 방식을 비교했을 때, 최적화된 에이전트 기반 검색기(Kapa Deep)가 약 5초 만에 0.65라는 점수를 기록하며 가장 우수한 성능을 보여주었어요. 이는 단순 키워드 매칭 방식보다 훨씬 높은 수치예요.

원문Hacker News · Benchmarking retrieval for agents on messy real-world company knowledge
궁금한 점 3개AI 정리