본문으로 건너뛰기
논문 목록으로

국제 학회

Overcoming Catastrophic Forgetting by Incremental Moment Matching

과제별로 독립적으로 학습한 네트워크의 가중치 사후 분포 모멘트를 맞춰 병합함으로써, 새로운 과제의 학습을 제약하지 않고 catastrophic forgetting을 줄이는 지속학습 방법입니다.

발표 연도
2017
학회
NeurIPS 2017★ Spotlight
저자
Sang-Woo Lee, Jin-Hwa Kim, Jaehyun Jun, Jung-Woo Ha, Byoung-Tak Zhang
  • Continual Learning
  • Catastrophic Forgetting
disjoint MNIST(순차 과제 2개)와 shuffled MNIST(순차 과제 3개)의 평균 정확도(논문 Table 1). untuned는 각 알고리즘의 기본 수식에 따른 하이퍼파라미터를 사용하고, tuned는 직접 조정한 값을 사용한 설정입니다.
disjoint MNIST(순차 과제 2개)와 shuffled MNIST(순차 과제 3개)의 평균 정확도(논문 Table 1). untuned는 각 알고리즘의 기본 수식에 따른 하이퍼파라미터를 사용하고, tuned는 직접 조정한 값을 사용한 설정입니다.

개요

Incremental Moment Matching(IMM)은 지속학습에서 발생하는 catastrophic forgetting을 해결하기 위한 연구입니다. 새로운 과제의 학습을 제약하는 대신, 과제별로 독립적으로 학습한 네트워크의 파라미터 분포를 모멘트 매칭으로 병합합니다.

이 연구는 NeurIPS 2017 Spotlight 논문으로 발표됐습니다.

기여 내용

  • 지속학습을 사후 분포의 모멘트 매칭에 기반한 네트워크 병합 문제로 재정의한 연구의 공동 저자로 참여했습니다.
  • IMM 방법론과 실험 코드베이스를 구현했습니다.
  • MNIST 기반 전이 학습 실험을 설계하고 수행해 IMM 방법론을 검증했습니다.

기술적 접근

  • 과제별 독립 학습 — 이후 과제의 최적화 경로를 직접 제한하지 않고 각 과제를 학습합니다.
  • mean-IMM — 독립적으로 학습한 네트워크의 파라미터를 평균해 병합합니다.
  • mode-IMM — 과제별 Fisher information을 이용해 가우시안 혼합의 mode를 찾고, 각 과제에서 파라미터가 갖는 중요도에 따라 가중치를 부여합니다.
  • 전이 기법 — weight transfer, L2-transfer, drop-transfer로 파라미터 공간을 매끄럽게 만들어 보간된 지점이 유효한 공동 해가 되도록 합니다.

성과

  • disjoint MNIST에서 평균 정확도 **94.12%**를 달성했습니다. 같은 조건에서 EWC는 52.72%, 일반 SGD는 71.32%를 기록했습니다.
  • mode-IMM과 L2-transfer를 적용한 shuffled MNIST에서 **98.30%**에 도달했습니다.
  • MNIST뿐 아니라 이미지 인식 및 Lifelog 데이터셋에서도 일반화 가능성을 확인했습니다.
  • NeurIPS 2017 Spotlight 논문으로 선정됐습니다.

의의

IMM은 지속학습을 다른 관점에서 바라봤습니다. 이후 학습을 제한하는 데 집중하지 않고, 독립적으로 최적화한 모델을 결합해 기존 지식을 보존할 수 있음을 보여줬습니다. 이를 통해 새로운 과제를 자유롭게 학습한 뒤 지식을 통합하는 접근이 가능해졌습니다.