본문 바로가기

전체 글

ControlNet (Adding Conditional Control to Text-to-Image Diffusion Models) 논문 정리 Text to image에 조건을 부여하기 위해 사용하는 ControlNet 의 논문을 읽고 내용을 간략하게 정리해보았다.AbstractControlNet : pre-trained text-to-image에 공간적인 조건을 주는 아키텍쳐encoding layers만 많은 이미지로 재학습 한다.zero convolution으로 연결 → 0으로 초기화 되어서 점점 커지며 불필요한 노이즈가 파인튜닝에 영향을 못미치도록 함.1. Introductiontext-to-image를 공간적 요소에 대한 control에 한계가 있음.text를 통해 설명이 어렵기 때문추가적인 이미지로 공간적인 컨트롤이 가능하다.image-to-image 모델은 conditioning 이미지에서 target 이미지로의 매핑을 배울 수 있.. 더보기
FRIEREN: Efficient Video-to-Audio Generation Network with Rectified Flow Matching Flow Matching 이란?Rectified Flow Matching(RFM)의 기본 원리노이즈 분포에서 데이터 분포로의 전송 경로를 학습하는 모델 • 노이즈 분포: 무작위 샘플(p_0(x)), 예를 들어 랜덤 숫자. • 데이터 분포: 우리가 원하는 결과(p_1(x)), 예를 들어 오디오의 멜스펙트로그램.Probability path를 정의하고 이를 기반으로 샘플을 변환함Probability path: 노이즈 샘플( $x_0$)에서 데이터 분포( $x_0$)으로 이동하는 경로RFM은 이 경로를 직선에 가깝게 설계합니다.경로 학습 • x_0: 노이즈 분포에서 샘플링된 초기 값. • x_1: 데이터 분포에서 샘플링된 목표 값. • x(t): 시간 t에 따라 x_0에서 x_1로 이.. 더보기
[독서모임 책 추천] 복잡한 삶에서 '단하나'를 찾다: 원씽으로 인생 바꾸는 법 '갓생'을 사는 사람들은 운동, 독서, 업무 공부 등 뭐 하나 놓치는 것 없이 잘 해내고 있는 것 같다.그럼 나는 무엇에 집중하며 살아야할까?삶이 너무 복잡하다. 하고싶은 것도 많고, 해야할 것도 많다. '갓생'을 사는 사람들은 운동, 독서, 업무 공부 등 뭐 하나 놓치는 것 없이 잘 해내고 있는 것 같다. 이러한 사회에서 '단 하나'에 집중해야한다고 이야기하는 책이 있었다. '원씽'이 그 책인데, 도대체 나는 어떤 단하나에 집중해야하고, 그 단하나를 어떻게 실현할 수 있을 지 궁금해서 이 책을 읽게 되었다.1. 원씽 찾는 법- 원씽이란, 다른 모든 걸 제쳐두고 해야할 '단 하나'를 의미한다.- 도미노 효과를 원씽에 적용할 수 있다. 도미노는 가장 작은 조각부터 쓰러뜨리는 데, 즉 가장 쉬운 일부터 시작.. 더보기
Adding Conditional Control to Text-to-Image Diffusion Models 논문 리뷰 이미지 생성형 모델에 이미지로 조건을 줄 수 있는 아키텍쳐인 ControlNet에 대한 논문을 읽어보았다.AbstractControlNet : pre-trained text-to-image에 공간적인 조건을 주는 아키텍쳐encoding layers만 많은 이미지로 재학습 한다.zero convolution으로 연결→ 0으로 초기화 되어서 점점 커지며 불필요한 노이즈가 파인튜닝에 영향을 못미치도록 함.1. Introductiontext-to-image를 공간적 요소에 대한 control에 한계가 있음.text를 통해 설명이 어렵기 때문추가적인 이미지로 공간적인 컨트롤이 가능하다.image-to-image 모델은 conditioning 이미지에서 target 이미지로의 매핑을 배울 수 있다.spatial m.. 더보기
슈퍼노멀, 30대 자기계발서 추천, 자기계발서 입문 슈퍼노멀, 나처럼 평범한 사람도 성공할 수 있을까? 재능없는 사람이 성장을 지속 가능하기 위해서는 어떻게 해야할까? 라는 질문에서 출발하여 이 책을 읽게 되었다. 나는 특별히 잘하는 것도 없고, 뭘 해도 오래 지속하지 못하는 스타일이다. 그 문제에 답을 찾고자 했다.슈퍼노멀에서는 아래와 같은 방법으로, 평범한 사람이 특별함을 이룰 수 있는 즉, '슈퍼노멀'이 될 수 있다고 이야기한다.1. 내 핑계에서 돌연변이를 찾아 요소를 분해한다.돌연변이란 나와 비슷한 조건에서 압도적인 성과를 만든 사건을 의미한다.나의 핑계에서, 그럼에도 불구하고 성공한 사례를 찾는다면 성공의 힌트를 얻을 수 있다.즉 -> '나는 키가 작은데, 무슨 운동 선수를 할 수 있겠어?' 라는 생각이 든다면 그 분야에서 키가 작지만 성공한 운.. 더보기
[논문 정리]Introduction to VLM(3/3) 4. Approaches for Responsible VLM Evaluationvisio-linguistic abilities(단어가 visual clue에 잘 매핑되는 지) 추정하는 것이 중요함VQA, zero-shot prediction, bias or hallucination 등을 고려4. 1 Benchmarking visio-linguistic abilities특정 단어나 문장을 일치하는 visual clue와 잘 연관시키는 능력을 평가4. 1. 1 Image captioning생성한 caption을 BLEU score나 ROUGE로 측정 → BLEU score는 너무 heuristic함CLIPScore : image와 caption의 CLIP representation 유사도→ CLIP 모델 성.. 더보기
[논문 정리]Introduction to VLM(2/3) 3. A Guide to VLM Trainingdata curation pipeline으로 scaling law를 깨고 잘 학습시킬 수 있다.VLM Training 시 Data, Grounding, alignment가 중요하다.3. 1 Training DataDataComp → Pretraining dataset에 대한 벤치마크Data Pruningheuristic하게 low-quality pair 제거pre-trained VLM을 이용해서 랭킹 후 poorly aligned data pair를 모두 버림다양하고 균형있는 데이터셋 만들기Ranking based on pretrained VLMCLIP-score : image와 text embedding 사이의 cosine similarity 계산→ ima.. 더보기
[논문 정리]Introduction to VLM(1/3) 1. Introductionlanguage와는 다르게 vision은 훨신 고차원의 공간을 가지고, 개념들이 쉽게 분리될 수 없다.LLM → vision input을 받을 수 있도록 확장되고 있다.vision-language 연구가 엄청난 혁신을 가져올 것이다.현재 많은 VLM은 특성이나 순서를 이해하지 못하고, 할루시네이션이 있다.2. Families of VLMcontrastive learningpositive pair → similar representationnegative pair → different representationmaskingtext는 그대로 두고, image match를 masking한 후 reconstructionimage는 그대로 두고, text는 masking한 후 recon.. 더보기