1. loss function 데이터의 실제 정답과 모델이 내놓은 예측값의 차이로 정의되는 함수 그렇다면 이렇게 생각할 수 있다. loss function의 값이 작을수록 모델의 성능이 좋은 것인가? 여러 모델을 학습시켜보고 loss function의 값이 작은 모델을 선택하면 되는 것 아닌가? 2. loss function과 evaluation metric loss function은 딥러닝 모델 학습 중에 사용되고, 모델이 예측한 출력과 실제 출력 간의 차이를 측정 이 차이를 최소화함으로써 모델의 파라미터를 최적화하는 것이 목적이다. 반면 evaluation metric은 모델을 훈련하고 나서 사용되며, 모델이 새로운 데이터에 대해 얼마나 잘 일반화하고, 정확한 예측을 하는지 평가하는 지표이다. 또한..
1. Bernoulli distribution coin flip, head and tail 확률변수 값이 0 또는 1로 나타나는 분포 X ~ Ber(p)라고 표시 베르누이 분포는 p라는 모수 하나만 있으면 표현이 가능하다. P(X=1) = p라 하면 자동적으로 P(X=0) = 1-p이 결정되니까 2. Categorical distribution m-sided dice Bernoulli distribution의 확장판 확률변수 값이 1,2,3,...,m중 하나를 가질 수 있는 분포 Y~ Cat(p1,p2,...,pm)으로 표시 이 분포를 표현하기 위해 필요한 parameter의 수는 m-1개이다. 왜냐하면 각 카테고리별로 확률을 부여하면 이렇게 쓸 수 있어 필요한 모수의 수가 m개같이 ..
precision은 정답과는 무관하게 데이터들끼리 얼마나 같은 경향을 나타내는가 데이터들끼리 얼마나 멀리 분포하는지, 얼마나 좁게 분포하는지 variance에 관한 이야기 accuracy는 분포하는 경향과는 무관하게 데이터 하나하나가 정답을 맞췄는지 아닌지 bias에 관한 이야기 빨간 점이 정답과는 상관없이 비슷한 경향, 가깝게 뭉쳐있으면 precision이 높다고함 반면 accuracy는 정답인지 아닌지를 판단함 2번과 4번을 보면 정답에 있더라도 뭉쳐있지 않은 2번은 precision이 떨어지고 4번은 precision이 높음 3번과 4번을 보면 정답이 아니더라도 뭉쳐있는 둘은 precision이 높음
1. 처리시간 하나의 입력이 처리되어 출력이 나올때까지 걸리는 시간 수식인식기의 경우 offline test는 ‘이미지 입력 후 수식 영역 정보가 출력될 때까지의 시간’ online test는 ‘이미지 촬영 후 이미지에서 수식 영역 정보가 화면 상에 표현되기까지의 시간’ 무슨 차이지? 무슨 차이인지 생각한다는게 좀 그런가? online tests는 사용자 체감 시간이 중요하다는 뜻인것 같다 시간차이의 경우에도 앱으로 사진을 포팅할때 offline과 online의 시간차이도 분명 있는 것 같다 2. 목표 정확도 해당 기술 모듈의 정량적인 정확도 신용카드 인식의 경우 offline test는 입력된 이미지 내 카드번호와 실제 정답의 distance online test는 사용자가 AI 모델에 인식하였을 때..
모델을 처음부터 만들어서 경량화 시켜 사용할 수 있지만 처음부터 만든다는 것이 쉬운일도 아니고 다른 domain에서 성능이 좋으리라는 보장도 없다 그러나 이미 검증된 ResNet, VGGNet, MobileNet, SqueezeNet 등등은 많은 사람들에게 여러 방면에서 검증이 되어 있어서 backbone으로 사용하기에 적절하다. 단점도 보완되어 발전하여 최신버전들로 계속 나오며 pretrain된 모델을 torchvision등에서 쉽게 가져와 사용할수도 있다 유명한 backbone들은 각각의 특징도 다양하다 dataset도 직접 모을 수 있지만 직접 모으는 것은 비용이 많이 든다. 쉽게 사용하라고 cifar10, cifar100, imagenet 등 공개되어 잘 알려진 dataset을 사용하..
1. elastic net 알고리즘 L1 regularization과 L2 regularization을 모두 사용한 regularization loss에 L1 term과 L2 term의 선형결합을 더해서 모델을 학습시키는 알고리즘 2. L1 , L2, elastic net 비교 L1, L2는 모두 계수 $\lambda$가 크면 클수록 parameter를 축소시킨다. L2는 parameter를 0으로 근사시키나 L1은 parameter를 완전하게 0으로 축소시키는 경향이 있다. L1은 무수히 많은 변수들이 있는데 영향력이 강력한 변수들은 별로 없다고 생각이 들면 대부분의 변수를 0으로 축소시켜 일부 변수만 선택하고자할때 유리함 그러나 L1은 covariate가 sample에 비해 충분히 많을 때 상관관..