전체 글 30

웨이크워드 기술 정리

"Hey Siri", "OK Google", "알렉사", "아리아". 스마트폰과 스피커가 잠들어 있다가 특정 단어 하나에 깨어나는 이 기술의 정식 이름은 키워드 스포팅(Keyword Spotting, KWS), 그중에서도 기기를 깨우는 용도로 쓰일 때 웨이크워드(Wake Word) 검출이라고 부릅니다. 이 글에서는 이 기술이 무엇인지, 어떤 원리로 동작하는지, 분야를 정의한 주요 논문은 무엇인지, 그리고 실제로 구현하려면 어떤 선택지가 있는지를 정리합니다.1. 키워드 스포팅이란 무엇인가키워드 스포팅은 연속적으로 들어오는 오디오 스트림에서 미리 정해진 소수의 단어(키워드)가 등장하는 순간을 실시간으로 검출하는 기술입니다.언뜻 보면 음성인식(ASR, Automatic Speech Recognition)의 축..

카테고리 없음 2026.06.12

LLM 양자화

양자화를 하는 이유 ?양자화(quantization)는 모델의 숫자(가중치/활성값/캐시)를 더 적은 비트로 표현해서 메모리·대역폭·연산 비용을 줄이는 기술입니다.양자화는 고비트 부동 소수점 숫자를 int4 또는 int8과 같은 저비트 데이터 유형으로 변환하는 과정을 말합니다.비트를 줄이면 메모리와 연산량이 줄지만, 아무렇게나 내리면 정확도가 깨지기 때문에 "정확도 유지형 양자화"가 핵심 연구 주제가 되고 있습니다. 양자화의 일반적인 단계는 다음과 같습니다.1. 부동 소수점 가중치를 미러링하고 양자화한 후 양자화된 가중치를 저장합니다.2. 양자화된 가중치를 추론에 사용합니다.양자화 종류(1) Weights(가중치, W)모델의 학습된 파라미터대형 모델의 경우 수십~수백 GB까지 차지한 번 로드하면 추론 내내..

카테고리 없음 2026.02.20

"FedDr+ 논문 이해하기: 연합학습(FL)부터 피처 증류(Feature Distillation)"

FedDr+: Stabilizing Dot-regression with Global Feature Distillation for Federated Learning알고 있어야 할 배경 개념Federated Learning(연합 학습, FL) : 데이터를 중앙 서버로 모으지 않고 로컬 서버에서 인공지능 모델을 학습하는 분산형 학습 방식 • 여러 기관(클라이언트)이 각자 데이터를 가진 채, 데이터를 직접 공유하지 않고 각자의 모델을 학습한 뒤 서버에 모델 파라미터만 모아 집계하는 방식Non-IID 데이터 문제 : 각 기관마다 데이터의 특성이 다름 (예: 어떤 병원에 아동 환자가 많고, 다른 곳엔 노인 환자가 많음)즉, 학습 데이터를 합쳐서 모델을 만들어도 모든 케이스를 잘 반영하지 못함Dot-regressio..

[Paper Review] : Fast R-CNN

Fast R-CNNBackground기존 R-CNN의 시간이 오래걸리다는 점과 selective search 알고리즘을 통해 2K 후보를 wrap 시킨 후, 별도로 cnn을 실행하고, 추출된 특징을 저장한 뒤 svm과 바운딩 박스 Regression을 진행해야 하는 multi-task piepline 이었다.이러한 문제들을 해결하기 위해서 Fast R-cnn이 등장했다.ContributionsHigher dection quality than R-CNN, SPPnetTraining is single-stage, using a multi-task lossTraining can update all network layersNo disk storage is required for feature cachingTr..

[Paper Review] : Alpha-CLIP

1. OverviewCLIP 모델에 사용자 관심 영역에 집중할 수 있는 능력을 부여한 연구기존 CLIP의 이미지 RGB input과 병렬적으로, 집중 영역을 나타내는 Alpha channel을 입력할 수 있는 Alpha-CLIP을 제안데이터 생성 pipeline을 고안했고, 기존 CLIP의 능력을 보존하면서 “Region focus 능력”을 부여함.2. Introduction이미지 전체의 content에 대한 포착 능력을 갖도록 학습되기 때문에 특정 영역에 집중할 수 없음. (유사도 부분만 측정)특정 영역에 집중할수 있도록 만드는 방법들은 존재하지만 각자의 한계들이 존재함이미지의 전체적인 context를 생략하게 되는 한계들이 존재함.⇒ 이를 해결 하기 위해 Region focusing 방법을 제안함.R..

[Paper Review] : SAM(Segment Anything Model)

SAM(Segment Anything Model)이란?어떤 이미지든, 어떤 객체든, 마스크 영역을 자동으로 잘라주는 segmentation 기법SAM 모델 구조Image InputImage Encoder(ViT 기반) => MAE(Masked Autoencoder)로 pre-training 한 ViT 구조를 사용3. Prompt Encoder : 프롬포트는 (sparse, dense) 2가지로 고차원 벡터 임베딩으로 변환하는 역할로 최종 Mask 출력을 유도함.Sparse prompt : points, boxes, text로 이미지에서 segment할 대상을 지정할 정보Point Prompt : 좌표(x,y)를 클릭함.Box Prompt : 바운딩 박스로 관심영역을 지정Text Prompt :..

[Paper Review] : ViT(Vision Transformer)

ViT(Vision Transformer) ?ViT는 Vision Transformer의 약자로, 이미지 데이터를 처리하기 위해 CNN 대신 Transformer 구조를 적용한 모델입니다. 이미지를 일정한 크기의 패치로 나눈 뒤, 각 패치를 단어처럼 인코딩해서 Transformer로 처리하고, 맨 앞의 [CLS] 토큰을 통해 전체 이미지를 분류하는 방식입니다.”Paper : Attend and Tell: Neural Image Caption Generation With Visual Attention 20151. Patch Embedding이미지를 16x16 같은 Patch로 자른다음에 Flatten 하여 선형 변화하여 벡터로 만든다.⇒ 벡터로 만들때 위치를 기억하기 위해서 Positional Embedd..

[Paper Review] : CLIP(Contrastive Language-Image Pre-training)

2021년에 발표된 CLIP(Contrastive Language–Image Pre‑training) 논문, "Learning Transferable Visual Models From Natural Language Supervision"는 이미지와 텍스트 캡션을 동일한 임베딩 공간에 매핑하여 대조 학습(contrastive learning)을 수행함으로써, 다양한 시각 인식 태스크에서 뛰어난 제로샷 성능을 보여준 연구입니다. 이번 글에서는 CLIP의 핵심 아이디어, 아키텍처, 학습 방식, 그리고 주요 실험 결과를 정리해 보겠습니다.1. 핵심 아이디어대조 학습(Contrastive Pre-training): 이미지-텍스트 쌍(예: 사진과 그에 대한 설명)을 이용해, 올바른 쌍은 임베딩 공간에서 가까워지도..

Attention이란?

Attention MechanismAttention을 통해서 현재 출력 대상에 대해 모든 Encoder의 Hidden state를 고려할 수 있음Attention이란?입력의 모든 부분을 동일한 비중으로 처리하는 것이 아니라, 특정 단어나 문맥에 따라 더 중요한 부분에 가중치를 부여하는 방식• Sequence 모델링에서 필수적인 요소• Input이나, Ouput Sequence에 관계없이, Dependencies(종속성)을 학습할 수 있음Self-Attention이란?Self-Attention은 문장 내에서 단어들이 서로 어떤 관계를 가지는지를 학습하는 메커니즘으로 Self-Attention은 하나의 입력 시퀀스 내에서 단어 간의 관계를 학습합✅ Query(Q): 질문 역할( 입력 )✅ Key(K): 데이..

SVM(Support Vetor Machine) 이란 ??

SVM(Supprt Vector Machine) ?N차원 공간에서 각 클래스 간의 거리를 최대화하는 최적의 선 또는 초평면을 찾아 데이터를 분류하는 지도형 머신 러닝 알고리즘마진 : 클래스들 사이의 간격 ( 각 클래스의 말단에 위치한 데이터들 사이의 거리를 의미)Support vector: 마진에서 가장 가까이 위치해 있는 각 클래스의 데이터장점과적합을 피할 수 있음분류 성능이 좋음저차원, 고차원 공간의 적은 데이터에 대해서 일반화 능력이 우수함잡음에 강함단점커널함수 선택이 명확하지 않음데이터 특성의 스케일링에 민감함커널 함수 ??배경 : SVM은 기본적으로 선형분류 기법이지만 선형 분류가 되지 않은 경우, 해결하기 위해 “커널 함수를 통해 저차원의 데이터를 고차원으로 매핑”하여 선형분류를 가능하게 한다..