도메인 무작위화 강화학습을 이용한 HVAC 제어 일반화 — AI 생성 일러스트AI 일러스트
리서치 연구

도메인 무작위화 강화학습을 이용한 HVAC 제어 일반화

Generalizing HVAC Control With Domain Randomized Reinforcement Learning

arXiv9월 9일 발표 · 3분 · 심사 전 논문

건물 모델링이나 현장 재조정이 어려웠던 기존 HVAC 제어 문제를 해결하기 위해, 범용 강화학습(RL) 기반 컨트롤러 NOMAD-RL이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. NOMAD-RL은 물리 정보를 반영한 적응형 도메인 무작위화 기법을 핵심으로 사용하여, 다양한 열 구역 간 성능 전이성을 확보하고 현실적인 학습 환경을 구축했습니다.
  2. 실험 결과, 이 컨트롤러는 기존 PID 제어기나 일반 RL 방식보다 일관되게 높은 성능을 보였으며, 특히 복잡한 다중 구역에서 MPC에 근접하는 우수성을 입증했습니다.
  3. 본 기술은 HVAC 시스템의 견고성과 전이성 향상 잠재력을 보여주지만, 실제 현장 적용 시에는 다양한 외부 변수에 대한 추가적인 검증과 통합 작업이 필요합니다.

대규모 환경에서 첨단 HVAC(냉난방 공조) 컨트롤러를 배치하는 것은 성능이 정확한 건물 모델이나 현장별 재조정에 의존하기 때문에 어렵습니다. 이에 연구진은 NOMAD-RL (Neural Online Meta-Adaptation for Dynamics)이라는 범용 (RL) 기반 컨트롤러를 제안했습니다. 이 컨트롤러는 구역 측정값과 예측값을 이용해 온도 설정점에 작용하며, 부분 관측 하에서도 온라인 적응을 지원하는 순환 정책을 활용합니다.

본 연구의 핵심 기여는 물리 정보가 반영된 정규화 흐름(physics-informed normalizing flows)에 기반한 적응형 도메인 무작위화 방식입니다. 이 방식은 열 구역 의 상관관계가 있고 다중 모드적인 분포를 모델링하면서도 물리적 개연성과 제어 가능성을 유지합니다. 이를 통해 건물 간 성능 전이를 개선하는 현실적이고 점진적으로 적응하는 학습 커리큘럼을 생성할 수 있습니다.

NOMAD-RL의 성능은 상수 설정점 PID 컨트롤러, 도메인 무작위화가 없는 RL 방식, 그리고 MPC와 비교 평가되었습니다. 그 결과, NOMAD-RL은 PID 및 비무작위화된 RL 기준선보다 일관되게 우수한 성능을 보였으며, 특히 난이도가 높은 다중 구역 환경에서 MPC의 성능에 근접하는 결과를 입증했습니다.

용어 풀이

강화학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · Generalizing HVAC Control With Domain Randomized Reinforcement Learning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv