Devin.KR
데빈의 AI 기술 뉴스룸

객체 감지 기술의 발전: CNN 기반 이미지 분류와 DPM, Overfeat 모델

객체 감지 기술의 기초를 다지는 합성곱 신경망(CNN) 아키텍처와 Deformable Parts Model(DPM), 그리고 분류, 지역화, 감지를 통합한 Overfeat 모델의 주요 특징과 작동 방식을 설명한다.

데빈 · AI 기술 에디터 · 6분 읽기

AI 추론의 일반 흐름: 입력 데이터, 모델 계산, 출력 검토
Devin.KR 제작 · 주제 이해를 돕는 개념도. 이 기사의 실제 제품·구성이나 취재 사진을 나타내지 않습니다.

객체 감지 기술의 이해를 돕기 위한 시리즈의 두 번째 글로, 이미지 분류를 위한 합성곱 신경망(CNN) 아키텍처와 객체 감지 모델인 Deformable Parts Model(DPM), 그리고 Overfeat 모델이 소개된다. 이 글은 딥러닝 기반 객체 감지 모델의 발전을 위한 핵심적인 기반 지식을 제공하며, CNN의 기본 연산부터 AlexNet, VGG, ResNet과 같은 주요 아키텍처의 특징을 다룬다. 또한, 객체 감지 성능 평가에 사용되는 mAP(mean Average Precision) 지표와 DPM, Overfeat 모델의 구체적인 작동 방식 및 구조를 설명한다.

합성곱 신경망(CNN)은 딥러닝 분야에서 컴퓨터 비전 문제 해결을 위한 핵심적인 기술로 자리 잡았다. 이는 인간의 시각 피질 시스템 작동 방식에서 영감을 받아 개발되었으며, 이미지 내 특징을 효과적으로 추출하는 데 사용된다. CNN의 핵심인 합성곱 연산은 미리 정의된 커널(필터)을 입력 특징 맵(이미지 픽셀 행렬) 위에 슬라이드하며, 커널과 부분 입력 특징의 값을 곱하고 더하여 출력을 생성한다. 이 과정에서 패딩 크기와 스트라이드 길이를 조절하여 출력 행렬의 크기를 제어할 수 있다.

초기 CNN 아키텍처로는 2012년 Krizhevsky 등이 발표한 AlexNet이 있다. AlexNet은 5개의 합성곱 레이어(선택적 최대 풀링 포함), 2개의 다층 퍼셉트론(MLP) 레이어, 1개의 로지스틱 회귀(LR) 레이어로 구성된다. 이 모델은 이미지 변환, 수평 반사, 패치 추출과 같은 데이터 증강 기법을 활용하여 훈련 데이터셋을 확장했다. 이후 2014년 Simonyan과 Zisserman이 제안한 VGG는 당시 '매우 깊은' 네트워크로 평가받는 19개 레이어로 구성되었으며, 3x3 합성곱 레이어와 2x2 풀링 레이어만을 사용하여 아키텍처를 극도로 단순화했다. 작은 필터들을 쌓는 방식은 더 적은 파라미터로 더 큰 필터의 효과를 모방하는 결과를 가져왔다.

2015년 He 등이 발표한 ResNet은 152개의 레이어로 구성된 '매우 깊은' 네트워크로, 잔여 블록(Residual Block)이라는 핵심 개념을 도입했다. 잔여 블록은 특정 레이어의 입력을 두 레이어 뒤의 구성 요소로 직접 전달할 수 있게 하여, 깊은 네트워크의 훈련 가능성을 유지하고 성능을 향상시키는 데 필수적이다. 잔여 블록이 없는 일반적인 깊은 네트워크는 기울기 소실 및 폭발 문제로 인해 레이어 수가 증가함에 따라 훈련 손실이 단조적으로 감소하지 않는 경향이 있다. ResNet의 이러한 설계는 깊은 네트워크의 훈련 안정성을 크게 개선했다.

객체 인식 및 감지 작업의 성능을 평가하는 일반적인 지표는 mAP(mean Average Precision)이다. mAP는 0에서 100 사이의 값을 가지며, 값이 높을수록 더 좋은 성능을 의미한다. 이 지표는 모든 테스트 이미지의 모든 감지 결과를 결합하여 각 클래스에 대한 정밀도-재현율(PR) 곡선을 그린 다음, PR 곡선 아래 면적을 계산하여 평균 정밀도(AP)를 산출한다. 최종 mAP는 각 클래스별로 계산된 AP를 평균하여 얻는다. 감지된 객체가 실제 객체(ground-truth box)와 IoU(Intersection over Union)가 특정 임계값(일반적으로 0.5)보다 크면 참 양성(true positive)으로 간주하며, 이때의 지표를 mAP@0.5라고 한다.

Deformable Parts Model(DPM)은 2010년 Felzenszwalb 등이 제안한 모델로, 변형 가능한 부분들의 혼합 그래픽 모델(마르코프 랜덤 필드)을 사용하여 객체를 인식한다. DPM은 세 가지 주요 구성 요소로 이루어진다. 첫째, 전체 객체를 대략적으로 덮는 감지 창을 정의하는 거친 루트 필터. 둘째, 객체의 더 작은 부분들을 덮는 여러 부분 필터로, 루트 필터보다 두 배 높은 해상도로 학습된다. 셋째, 루트에 대한 부분 필터의 위치를 점수화하는 공간 모델이다. 객체 감지의 품질은 필터 점수에서 변형 비용을 뺀 값으로 측정되며, 기본 점수 모델은 필터와 영역 특징 벡터의 내적을 사용한다. 특징 벡터는 HOG(Histogram of Oriented Gradients)와 같은 알고리즘으로 정의될 수 있다. DPM은 잠재 SVM(Latent SVM)을 사용하여 분류기를 모델링한다.

Overfeat 모델은 2013년 Sermanet 등이 발표한 선구적인 모델로, 객체 감지, 지역화, 분류 작업을 단일 합성곱 신경망에 통합했다. 이 모델의 핵심 아이디어는 (i) 슬라이딩 윈도우 방식으로 이미지의 여러 스케일 영역에서 이미지 분류를 수행하고, (ii) 동일한 합성곱 레이어 위에 훈련된 회귀 모델을 사용하여 경계 상자 위치를 예측하는 것이다. Overfeat의 아키텍처는 AlexNet과 매우 유사하며, 훈련은 이미지 분류 작업으로 CNN 모델을 훈련한 다음, 상위 분류기 레이어를 회귀 네트워크로 대체하고 각 공간 위치와 스케일에서 객체 경계 상자를 예측하도록 훈련하는 방식으로 진행된다. 이 회귀 모델은 클래스별로 특화되어 있으며, 생성된 경계 상자와 실제 경계 상자 간의 L2 norm을 최소화하도록 훈련된다.

Overfeat의 감지 과정에서는 먼저 사전 훈련된 CNN 모델을 사용하여 각 위치에서 분류를 수행한다. 이어서 분류기가 생성한 모든 분류된 영역에 대해 객체 경계 상자를 예측한다. 마지막으로, 지역화 결과에서 충분한 중첩이 있고 분류기에서 동일한 객체일 가능성이 충분히 높은 경계 상자들을 병합한다. DPM과 CNN 모델은 별개의 접근 방식이 아니라, DPM 추론 알고리즘을 펼치고 각 단계를 동등한 CNN 레이어에 매핑함으로써 DPM 모델을 CNN으로 공식화할 수 있다는 연구 결과(Girshick et al., 2015)도 제시되어, 두 기술 간의 연관성을 보여준다.

데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.

출처 · 원문 확인

Lilian Weng

Object Detection for Dummies Part 2: CNN, DPM and Overfeat

원문 발행: 2017-12-15 09:00:00

원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.

댓글 0

아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.

댓글을 남기려면 로그인이 필요합니다.

← 전체 소식 개발 도구 둘러보기