'gan' 태그의 글 목록

간단하게 살펴보는 여러가지 GAN

GAN은 그 아이디어가 나온 뒤로 1~2년만에 급격하게 후속논문이 등장했다 그런데 DALL-E가 transformer로 엄청난 generation을 했는데 generation 문제에서 GAN이 정답이 아닐 수 있다는 것이다 1. DCGAN 이미지를 discriminator할 때는 Convolution해가면서 마지막에 generating할 때는 deconvolution으로 생성했다는 것 같다 2. Info-GAN Generation에 class 정보도 집어넣으면서 특정 class에 집중할 수 있게 해준다는거?? 3. Text2Image 문장이 주어지면 그것에 맞는 이미지를 생성한다 4. Puzzle-GAN 이미지의 subpatch를 넣으면 원래 이미지를 복원한다 5. CycleGAN 두 이미지간 domai..

format_list_bulleted 딥러닝/Computer Vision
· 2024. 4. 15.
textsms

multimodal learning2 - show, attend and tell, visual question answering -

1. visual and text cross modal translation 1-1) motivation 대표적으로 image captioning image(CNN)에서 text sequence(RNN)로 변환하는 문제 이미지가 주어지면 이미지를 가장 잘 설명하는 text description을 생성하는 문제 1-2) show and tell image captioning의 시초격인 모델 ImageNet에서 pre-train한 CNN을 이용하여 image를 encoding함 image encoding vector를 LSTM의 초기 vector로 사용 start token을 넣어 word를 생성 token을 넣기 전에 fully connected layer에 넣은 다음에 LSTM module에 넣는다 예측..

format_list_bulleted 딥러닝/Computer Vision
· 2023. 7. 5.
textsms

GAN loss의 단점을 극복하기 위한 Perceptual loss

1. motivation CycleGAN이 unsupervised data set으로 학습할 수 있다는 가능성을 보여주었고 심지어 더 쉬운 MAE loss나 MSE loss를 사용한 학습 방법이 있는데 supervised data set을 이용한 conditional GAN(Pix2Pix)을 주로 사용하는 이유는.... 선명한 이미지를 얻을 수 있다는 장점이 있기 때문임 그러나 conditional GAN은 학습이 대단히 어렵다. discriminator와 generator의 alternating training이라는 구현이 어려우면서 실제로 원하는대로 잘 안되는 단점이 크다. GAN을 안쓰고는 선명한 이미지를 얻을 수 있는 방법은 없을까? 2. perceptual loss vs. GAN loss GAN..

format_list_bulleted 딥러닝/Computer Vision
· 2023. 7. 1.
textsms

서로 관련없는 이미지로 바꿔버리는 CycleGAN의 핵심 아이디어

1. motivation Pix2Pix에서는 pairwise data로 x에 대한 ground truth인 y가 필요한 supervised learning 문제는 항상 이런 pairwise data를 얻는 것이 쉽지가 않다. 사실상 불가능한 경우도 많다 그래서 서로 무관한 X라는 style의 image dataset과 Y라는 style의 image dataset을 활용하는 방법은 없을까? 직접적인 대응관계가 없는 X,Y 사이에서 image translation이 가능하도록 만든 것이 CycleGAN이다. pairwise data가 필요하다는 제약사항을 뛰어넘으면서 응용범위가 늘어났다 2. CycleGAN loss X에서 Y를 생성하는 GAN loss와 Y에서 X를 생성하는 GAN loss와 Cycle c..

format_list_bulleted 딥러닝/Computer Vision
· 2023. 6. 30.
textsms

image to image translation의 기본 모델인 Pix2Pix이 GAN의 약점 mode collapse를 어떻게 해결했는가

1. image translation 하나의 이미지 스타일을 다른 이미지 스타일로 변화시키는 문제 흑백사진을 컬러사진으로 바꾸고 낮 사진을 밤사진으로 바꾸거나 스케치 사진을 실제 이미지 사진으로 바꾸는 단순한 문제부터 semantic segmentation 이미지를 일반 이미지로 바꾸거나 일반 인공위성 사진으로부터 지도를 출력하는 문제 등 다양하다 앞에서 다룬 super resolution도 하나의 예시 2. GAN loss의 치명적인 문제점 - mode collapse 앞에서 MAE loss는 평균적인 blurry한 이미지를 출력해준다며 안좋다고 했고 GAN loss가 실제 이미지에 가까운 사진을 출력해준다며 극찬을 했는데 실제로 GAN이 대단하다는 이미지 때문에 생각하기 어려운데 GAN은 사실 치명적..

format_list_bulleted 딥러닝/Computer Vision
· 2023. 6. 29.
textsms

image to image translation - super resolution, colorization, style transfer - 의 개념 이해하기

1. motivation 한 image를 다른 image로 바꾸는 것이라고 생각하면 된다 저해상도 image를 고해상도 image로 바꾸는 super resolution 흑백사진을 컬러사진으로 바꾸는 colorization image의 style을 바꾸는 style transfer 다음은 input image를 Van Gogh, Monet 스타일 등으로 바꾼 예시 다음은 전혀 다른 느낌의 게임 테마를 만드는 예시 디자이너, 게임감독 비용을 감소시키며 디자이너들에게 영감을 주는 용도로도 활용될 수 있다 2. super resolution 저해상도 이미지를 고해상도 이미지로 출력하는 문제 conditional GAN의 대표적인 예시 GAN을 이야기해서 GAN으로만 풀 수 있는 거 아니냐고 물을 수 있겠지만 ..

format_list_bulleted 딥러닝/Computer Vision
· 2023. 6. 29.
textsms