Linear Mapping have a Memory

개요

선형 사상이 선형 연관 기억으로 취급될 때, 가중 합이 용량을 초과하여 훈련될 경우 새로운 예제가 기존 예제를 단순히 지우는 것이 아니라, 가중 벡터가 지속적으로 교란되며 기존 연관에 점진적으로 노이즈를 추가한다는 점을 관찰했습니다.

주요 내용

* 가중 합이 훈련 용량을 초과하면, 새로운 예제는 기존 예제를 완전히 지우지 않고 가중 벡터를 미세하게 조정하며 노이즈를 추가합니다.
* 최근에 학습된 예제가 더 잘 기억되는 경향이 있지만, 오래된 예제도 통계적으로 예상보다 오랫동안 지속될 수 있습니다.
* 훈련 용량 이하에서는 특정 훈련 예제를 제거해도 가중 벡터에 아무런 변화가 없을 수 있습니다.
* 하지만 가중 감쇠(weight decay)를 도입하면, 가중 사상은 다른 저차원 해법으로 이동하면서도 남아있는 연관을 보존할 수 있습니다.
* 이러한 관찰은 초기화, 가중 감쇠, SGD 동역학, 그리고 CCSLM (Conditional Continued Supervised Learning Method)에 대한 흥미로운 결과를 시사합니다. CCSLM에서 로컬 전문가는 자체적으로 인수분해된 연관 기억으로 간주될 수 있습니다.

시사점

선형 사상이 연관 기억으로서 작동하는 방식에 대한 이해는 신경망 훈련, 특히 가중 감쇠와 초기화 전략의 효과를 이해하는 데 중요한 단서를 제공하며, CCSLM과 같은 모델의 내부 메커니즘 해석에도 기여할 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions