ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
치명적 망각이란? 새 능력을 배운 모델이 옛 능력을 잃는 이유

치명적 망각이란? 새 능력을 배운 모델이 옛 능력을 잃는 이유

AI 백과사전 • Admin • • 7 회 조회

치명적 망각은 신경망이 여러 과제를 차례로 배울 때, 뒤의 과제를 익히는 대신 앞서 배운 것을 넓은 범위에서 잊어버리는 현상입니다. 완성된 모델에 새 분야 데이터로 추가 미세조정을 하면 새 과제 점수는 오르는데, 잘하던 질의응답이나 분류, 특정 언어 실력이 눈에 띄게 나빠지는 일이 생깁니다. 증분 학습을 처음 해 보는 팀 대부분이 여기서 부딪힙니다. 모델이 멍청해진 것이 아니라 학습 방식 자체에 이 부작용이 붙어 다닙니다.

새 데이터가 옛 파라미터를 씻어 내는 이유

모델의 능력은 과제별 별도 창고에 보관되는 것이 아니라 같은 파라미터 집합 전체에 흩어져 있습니다. 계속 학습할 때 목적은 새 데이터의 오차만 재므로, 기울기는 파라미터를 새 과제에 유리한 방향으로 밀고 옛 위치를 지켜 줄 사람은 없습니다. 과제가 공유하는 파라미터가 겹칠수록, 학습이 길고 학습률이 클수록 옛 능력은 더 많이 다시 쓰입니다. 하나의 화이트보드를 매 수업마다 재사용하면서 옛 내용을 위한 자리를 남겨 두지 않으면, 지워지는 것은 귀퉁이가 아니라 면 전체입니다.

닮았지만 다른 두 상황과의 경계

첫째는 평범한 일반화 부족입니다. 못 본 문제를 틀리는 것은 애초에 익히지 못한 것이지 망각이 아닙니다. 판정 기준은 엄격합니다. 같은 옛 과제를 추가 학습 전에는 맞히고 후에는 틀리며, 그 낙차가 이번 학습 때문일 때 치명적 망각입니다. 둘째는 사람의 망각으로, 보통 점진적이고 복습과 연상으로 되돌릴 수 있습니다. 신경망의 망각은 갑자기 일어날 수 있어, 한 번의 학습으로 과제 정확도가 거의 무작위 수준까지 떨어지기도 하며, 그래서 치명적이라는 말이 붙었습니다.

자주 밟는 장면

고객지원 모델에 신제품 문답을 계속 덧붙이면 구제품 답변을 서서히 못하게 될 수 있습니다. 한 언어 뒤에 다른 언어를 집중 학습시키면 첫 언어의 섬세한 표현이 무뎌집니다. 로봇이나 자율주행 모델을 새 도시의 센서 데이터로 재학습하면 옛 환경에서의 판단이 옅어질 수도 있습니다. 공통점은 데이터가 차례로 도착하고 매번 지금 데이터로만 채점한다는 것입니다. 전부 섞어 한 번에 학습하면 영향은 보통 훨씬 작고, 사전학습에서 이 문제가 잘 거론되지 않고 증분 미세조정과 지속 학습에서 자주 나오는 이유가 여기에 있습니다.

완화책은 각자 한 구간씩 맡는다

리플레이는 가장 소박하고 흔한 방법입니다. 새 데이터에 옛 과제 샘플을 섞어, 복습하면서 새 수업을 배우는 셈이며, 대가는 옛 데이터 보관과 추가 연산입니다. 정규화 방식은 옛 과제에 중요했던 파라미터에 자물쇠를 걸어 바꾸면 벌칙을 줍니다. 대표적 발상이 탄성 가중치 고정입니다. 격리 방식은 새 과제에 비교적 독립된 공간을 마련해, 소량의 추가 파라미터, 저랭크 적응 모듈, 전용 어댑터만 학습시켜 본체를 거의 건드리지 않습니다. 실무에서는 작은 학습률, 옛 샘플 혼합, 어댑터만 학습, 그리고 업데이트마다 옛 과제 회귀 테스트를 돌리는 조합이 흔합니다.

망각이 적을수록 좋은 것은 아니다

놓치기 쉬운 점도 있습니다. 적당한 망각이 나쁘기만 한 것은 아닙니다. 옛 데이터에는 낡은 표현, 잘못된 라벨, 이미 폐기된 업무 규칙이 들어 있고, 그것을 전혀 놓지 않는 모델은 새 지식을 받아들이지 못합니다. 막아야 할 것은 통제되지 않는 망각, 즉 중요한 능력이 모르는 사이에 검증도 없이 씻겨 나가는 일입니다. 공학상의 핵심은 망각 제로를 요구하는 것이 아니라, 증분 학습 때마다 고정된 옛 과제 테스트로 다시 재고 낙차가 허용 범위 안일 때만 배포하는 것입니다.

추천 도구

더보기