본문 바로가기
728x90
반응형

ML36

Model EMA Model EMA는 원본 model의 weight를 평균내어 저장하는 shadow model 을 사용함. Model EMA(Exponential Moving Average, 지수 이동 평균)학습 중 계속 변화하는 원본 model의 weight(가중치)를지수 가중 방식으로 평균내어 저장하는 기법임.일반적인 Model EMA에서는 다음 두 model을 함께 유지함.원본 model: gradient와 optimizer를 통해 실제로 학습되는 modelEMA model: 원본 model의 weight를 받아 평균값으로 갱신되는 model핵심은 다음과 같음.Gradient는 원본 model에서만 계산되며,EMA model은 원본 model의 weight를 평균내어 갱신만 수행함.원본 model의 학습 과정에서 생.. 2026. 7. 19.
Patch Embedding - Vision Transformers Patch Embedding (Patch Partition + Linear Embedding)Patch Embedding은 입력 영상을 Transformer가 처리할 수 있는 token으로 변환하는 과정.Patch Partition과 Linear Embedding의 두 단계로 구성됨.CNN에서 입력 영상을 최초의 feature representation으로 변환하는 stem과 동일한 역할을 수행함.Patch Partition입력 영상을 겹치지 않는 $P\times P$ 크기의 patch로 분할한 후, 각 patch를 하나의 벡터로 flattening함.입력 영상의 크기가 $H\times W$, 입력 channel 수가 $C$일 때, patch의 개수는 다음과 같음:$$N=\frac{H}{P}\times\.. 2026. 7. 19.
CNN / Vision Transformer 모델별 Dropout 위치와 Fine-tuning 시 설정 이 문서는주요 CNN backbone (VGG16, ResNet, DenseNet, EfficientNet, EfficientNetV2),vision transformer (ViT, Swin),그리고 pure ConvNet인 ConvNeXt의dropout 위치를 비교 하고,linear probing 및 gradual unfreezing 시 dropout / BatchNorm 처리 방법을 정리함.https://dsaint31.me/mkdocs_site/ML/ch09/dl_dropout/ BMEalpha-dropout dropout mc-dropout pytorch regularization Dropout and MC Dropout Dropout은 학습 중 일부 neuron의 출력(=activation) 을.. 2026. 7. 14.
DL Vision Model들에서 Stem이란? 1. Stem의 어원영어 stem 은고대 영어의 stefn 또는 stemn 에서 유래했다고 함.본래 식물의 줄기, 나무의 몸통, 배의 선수 부분처럼전체 구조를 지탱하는 중심축을 의미 함.여러 분야에서 다른 구성 요소가 연결되거나 뻗어나가는 기반 부분이라는 의미로 확장 (Merriam-Webster)이후 언어학에서는 접사가 붙는 단어의 중심 부분을 word stem 이라고 부르는 등,딥러닝의 vision model들에서 사용하는 stem도 이러한 비유에서 나온 용어임.입력을 처음 받아 처리하고,이후의 여러 stage와 block으로 feature를 전달하는네트워크의 시작 부분식물에서 줄기가 가지와 잎으로 신호와 영양분을 전달하듯이,신경망의 stem은 원시 입력을 초기 feature로 변환하여 네트워크 본체.. 2026. 7. 13.
Patch Merging of SWIN Patch MergingPatch Merging Module (or Layer) 는CNN에서 널리 사용되는 Max (or Averaging) Pooling과 유사한 downsampling 역할을 수행하되,최댓값(or 평균값)을 선택하는 대신$2 \times 2$ 인접 patch의 feature를 결합하고 선형 변환하여공간 해상도는 감소시키고 채널 수는 증가시킴으로써,Swin Transformer가 CNN과 유사한 hierarchical representation을 학습하도록 함.Patch Merging 의 위치첫번째 stage를 제외하고 이 후 stage 의 앞에 위치하며, 해상도를 가로세로로 1/2씩 줄이고, feature의 차원을 2배로 올림.Stage 내에서는 dimension이 유지되고 Stage.. 2026. 7. 11.
optuna : Automatic Hyperparameter Optimization Framework Optuna는2018년 Preferred Networks에서 공개하고2019년 논문 Optuna: A Next-generation Hyperparameter Optimization Framework로 소개됨Machine Learning(기계학습)을 위한Automatic Hyperparameter Optimization Framework(자동 하이퍼파라미터 최적화 프레임워크)임.Optuna는 Hyperparameter Search Space(하이퍼파라미터 탐색 공간) 안에서Learning Rate(학습률), Batch Size(배치 크기), Optimizer(최적화 알고리즘) 종류, Layer 수(층 수), Epoch 수(학습 반복 횟수) 같은 Hyperparameter(하이퍼파라미터) 후보값들을Trial.. 2026. 6. 27.
728x90
반응형