AI 자가 개선을 위한 Dream-RSI 프레임워크 공개
zhengkid/Dream-RSI
GitHubDream-RSI는 AI의 자가 개선(Self-Improvement)을 위해, 과거 탐색 기록 전체를 재사용 가능한 '재생 시뮬레이터'로 활용하는 혁신적인 프레임워크입니다.
- 온라인 탐색으로 얻은 데이터를 가상 환경(Replay Simulator)으로 구축하고, 이 시뮬레이터에서 후보 정책을 평가하여 성능을 개선한 뒤 다시 시스템에 적용하는 순환 구조를 완성했습니다.
- 이는 AI가 스스로 지식을 축적하며 점진적으로 성능을 끌어올리는 '재귀적 자기 개선' 모델로, 복잡한 문제 해결 능력을 획기적으로 향상시킬 잠재력이 있습니다.
- 이 방법론은 탐색 과정의 기록(History) 축적이 필수적이며, 알고리즘 공학 등 다양한 분야에서 높은 효율성과 효과를 입증했습니다.
효율적인 탐색은 재귀적 자기 개선(Recursive Self-Improvement)의 핵심 요소입니다. 기존 시스템들은 검색 공간이 커질수록 고정된 전략으로는 적응하기 어렵고, 비효율적인 탐색 방향에 막대한 컴퓨팅 자원을 낭비하는 문제가 있었습니다. Dream-RSI는 이러한 한계를 극복하고자, 완료된 발견 과정의 기록(discovery history) 전체를 재사용 가능한 '재생 시뮬레이터'로 개념화합니다. 이를 통해 는 과거에 저장된 기록을 읽어냄으로써 새로운 정책을 평가할 수 있게 됩니다.
Dream-RSI는 탐색 계층에서 자가 개선 루프를 구축합니다. 먼저 현재의 정책이 온라인으로 발견 과정을 주도하며 모든 추적 기록(traces)을 남깁니다. 이 기록된 트리들은 재사용 가능한 시뮬레이터 풀로 변환되며, 이후 후보 정책은 이 풀 위에서 '꿈꾸듯' 평가됩니다. 이 과정은 즉각적이고 저비용의 오프라인 피드백을 제공하며, 개선된 정책이 다시 온라인에 배포되어 시뮬레이터 풀을 지속적으로 확장하는 순환 구조를 완성합니다.
이 방법론은 알고리즘 공학, 수학적 최적화, 커널 엔지니어링 등 다양한 분야에서 그 효과가 입증되었습니다. 구체적인 테스트 결과에 따르면, Dream-RSI는 다운스트림 런타임이 1.22배 빨라지고 발견 컴퓨팅(discovery compute)은 1.74배 적게 사용되었으며, SimpleTES 대비 162배 적은 호출로 성능을 개선하는 등의 성과를 보였습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.