Dropout: 왜 일반화에 도움이 되나, 그리고 학습/추론 스케일링 트릭

Dropout은 두 아이디어를 붙여놓은 것이다: 학습 때 유닛을 무작위로 꺼버리고, 추론 때는 조용히 전부 다시 켠다. 흥미로운 지점은 (1) 유닛을 무작위로 끄는 게 왜 일반화를 개선하는가, 그리고 (2) “전부 다시 켠다"가 공짜가 아니라는 것 — 보정을 안 하면 activation이 잘못된 스케일로 나온다. 이 스케일링을 틀리는 건 딥러닝에서 가장 흔한 버그 중 하나라, 이 글은 둘 다 L1/L2 글과 같은 엔지니어링 깊이로 짚는다. Dropout이 하는 일 학습 중 dropout layer는 각 유닛의 activation \(a\)를, 독립적으로, keep probability \(p\)로 유지하거나 \(1-p\)로 0으로 만든다. 형식적으로는 유닛마다 mask \(m \sim \text{Bernoulli}(p)\)를 뽑아 \(m \cdot a\)를 출력한다. ...

2026년 3월 16일 · 7 분