AI 과학자 워크플로우 평가를 위한 과정 추적 데이터셋 공개
OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows
arXiv기존 AI 평가는 최종 결과물만 검증했지만, 이제는 모델이 추론하는 '과정' 자체를 분석할 수 있는 대규모 공개 데이터셋 OpenDiscoveryTrace가 발표되었습니다.
- 파일럿 테스트 결과, 최신 LLM들이 비슷한 성공률을 보여도 오류 유형이나 행동 패턴에서 근본적인 차이가 명확히 드러나 모델의 미묘한 성능 격차를 포착합니다.
- 이 데이터셋은 AI가 결론에 도달하는 과학적 방법론 자체를 감사하고, 시스템적인 실패 원인을 진단하여 AI 거버넌스 연구에 필수적인 기준을 제시합니다.
- 생각(thoughts), 도구 호출 등 9개 필드를 포함한 이 트레이스는 프로세스 레벨 평가와 과학적 에이전트 감사 연구를 위해 공개되었습니다.
기존의 자율 AI 과학자 는 생성된 코드, 가설 또는 논문과 같은 최종 결과물만을 평가하는 경향이 있어, 해당 결과가 도출된 추론 과정을 간과해왔습니다. 이러한 한계로 인해 과학적 방법론을 감사하거나 실패 모드를 진단하기 어려웠습니다. 이에 연구진은 모델이 단순히 무엇을 생성했는지뿐만 아니라 어떻게 추론하는지를 포착한 공개 데이터셋인 OpenDiscoveryTrace를 발표했습니다.
OpenDiscoveryTrace는 약 558개의 완전한 AI 과학 궤적(trajectory)으로 구성되어 있으며, 생각(thoughts), 도구 호출(tool calls), 관찰(observations), 오류(errors), 수정 트리거 등 총 9개 필드를 포함하는 구조화된 단계별 추적을 기록합니다. 이 데이터셋은 신약 개발, 재료 과학, 유전체학, 과학 문헌 분석에 걸친 124개의 과학 과제를 다루며, GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro와 같은 최신 모델과 Qwen2.5-7B 등 오픈 모델을 포함합니다.
파일럿 분석 결과에 따르면, 과정 추적은 최종 출력만으로는 알 수 없는 행동 차이를 드러냅니다. 세 가지 최첨단 모델이 유사한 성공률(84~89%)을 보였음에도 불구하고, Claude Opus 4.6는 GPT-5.4보다 트레이젝토리당 약 30배 많은 오류를 발생시키는 등 질적으로 다른 오류 패턴을 보여주었습니다. 이 데이터셋은 프로세스 레벨 평가와 과학적 에이전트 감사 연구를 위해 공개되었습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.