개방형 어휘 영상 분할을 활용한 산업현장 위험 객체 실시간 탐지 시스템
Open-Vocabulary Semantic Segmentation for Real-Time Hazard Object Detection in Industrial Sites: Benchmark Validation and Live Camera Deployment
1. 프로젝트 개요
프로젝트 요약
사전에 정의되지 않은 물체까지 인식할 수 있는 개방형 어휘 의미론적 분할(OVSS) 기술을 산업현장 위험 객체 탐지에 적용한다. 비전-언어 모델 SigLIP 2를 백본으로 하여 별도 학습 없이 텍스트로 지정한 객체를 픽셀 단위로 분할하는 training-free 파이프라인을 설계하고, 8개 표준 OVSS 벤치마크에서 정량 검증한다. 이어서 노트북 카메라를 연동한 실시간 추론 시스템을 구현하고, 덤프트럭·굴착기·철근 등 현장 객체를 축소 모형(장난감·미니어처)으로 구성한 실증 환경에서 카메라 입력만으로 위험 객체가 분할·경보되는 과정을 라이브로 확인한다.
핵심 키워드
2. 프로젝트 목표 및 내용
배경 및 필요성
제조·건설·물류 현장의 AI 영상 감시는 대부분 학습 시점에 클래스가 확정되는 닫힌 어휘(closed-set) 모델을 쓴다. 사람이나 지게차처럼 미리 정의된 대상은 잘 잡지만, 학습에 포함되지 않은 장비나 자재는 애초에 인식 대상이 아니어서 탐지되지 않는다. 새 위험 유형을 추가하려면 라벨링과 재학습을 다시 거쳐야 하는데, 설비 배치와 반입 자재가 수시로 바뀌는 현장의 속도를 이 주기가 따라가지 못한다.
개방형 어휘 의미론적 분할(OVSS)은 이 문제의 직접적 해법이다. 비전-언어 모델이 이미지와 텍스트를 공통 임베딩 공간에 정렬하므로, 재학습 없이 텍스트로 지정한 임의의 개념을 픽셀 단위로 분할할 수 있다. 관리자가 새로운 위험 대상을 인지한 즉시 클래스명을 추가해 시스템에 반영할 수 있다는 뜻이다.
백본으로는 SigLIP 2를 채택한다. CLIP 대비 sigmoid 손실, 캡셔닝 기반 사전학습, 자기증류(self-distillation)와 마스크 예측을 결합해 dense feature 품질이 개선되었고, NaFlex 변형은 원본 종횡비와 가변 해상도를 그대로 입력할 수 있어 카메라 영상에 유리하다. 다만 기존 training-free OVSS 기법(SCLIP, ClearCLIP, NACLIP)은 CLS 토큰 구조를 전제하는 반면 SigLIP 2는 attention 기반 MAP head로 특징을 풀링하므로, 동일 기법이 그대로 이식된다는 보장이 없다. 본 과제는 이 이식 문제를 핵심 기술 과제로 설정하며, 필요한 조정 지점을 규명하는 것 또한 성과로 정의한다.
실증 대상 객체는 zero-shot 인식 신뢰도가 높은 것으로 한정한다. "적치물", "이단 적재"와 같은 개념은 물체 자체가 아니라 물체의 배치 상태를 가리키는 관계적 개념이어서, 픽셀-텍스트 정렬만으로 안정적으로 분할하기 어렵다. 반면 덤프트럭, 굴착기, 지게차, 철근 다발, 안전모, 가스통처럼 시각적으로 구별되고 웹 사전학습 데이터에 충분히 등장하는 객체는 별도 학습 없이도 높은 정확도를 기대할 수 있다. 실증은 이러한 객체의 축소 모형을 노트북 카메라 앞에 배치한 미니어처 현장 환경에서 수행하며, 실제 현장 촬영이 어려운 조건에서도 카메라 입력→추론→경보의 전 과정을 재현 가능하게 한다.
프로젝트 목표
본 과제의 최종 목표는 SigLIP 2의 MAP head 구조에 적합한 training-free OVSS 파이프라인을 설계하고, 표준 벤치마크에서 정량 검증한 뒤 실시간 카메라 시스템으로 구현하는 것이다. 별도의 학습이나 외부 세그멘테이션 모델 없이 frozen 인코더 내부 구조만으로 픽셀 단위 개방형 어휘 분할을 달성하는 것을 기술적 지향점으로 삼는다.
표준 평가는 이 분야의 표준 구성인 8개 벤치마크로 수행한다. 배경 클래스를 포함하는 VOC21, Context60, COCO-Object와 배경 클래스가 없는 VOC20, Context59, COCO-Stuff, ADE20K, Cityscapes로 나누어 mIoU를 측정하며, 데이터셋별 하이퍼파라미터 튜닝 없이 단일 설정으로 전 벤치마크를 보고해 방법의 일반성을 확보한다.
세부 목표는 네 가지다.
정렬 실패 지점 규명 및 디코더 재설계. SigLIP 2의 patch token과 텍스트 임베딩 간 정렬 실패 지점을 정량적으로 규명하고, MAP head를 patch 단위 디코더로 재해석하는 구조를 구현한다. 기존 기법의 MAP head 이식. CLS 토큰 구조를 전제한 SCLIP, ClearCLIP, NACLIP이 MAP head 구조로 어떻게 이식되는지, 어떤 조정이 필요한지를 ablation으로 정리한다. 실시간 카메라 실증 시스템 구현. 노트북 카메라(OpenCV) 입력을 프레임 단위로 받아 분할 마스크를 오버레이하고, 지정 위험 객체가 화면에 등장하면 경보를 발생시키는 Streamlit 기반 시스템을 구현한다. 텍스트 임베딩은 사전 계산해 캐시하고 프레임당 이미지 인코더만 실행한다. 정량 근거를 남기기 위해 카메라로 녹화한 프레임 50~100장에 픽셀 라벨을 부여한 소규모 실증 세트를 구축하고, 클래스별 IoU와 mIoU를 보고한다. 엣지 경량화. 최종 구성을 엣지 디바이스에서 실시간 추론 가능한 형태로 경량화하고 FPS와 지연 시간을 보고한다.
정량 지표는 8개 벤치마크 평균 mIoU를 주 지표로 하되, vanilla SigLIP 2 대비 개선폭과 동일 백본 조건에서의 비교를 함께 제시한다. 카메라 실증 축에서는 실증 세트 mIoU와 클래스별 IoU, 그리고 경보 정확도(객체 등장/미등장 프레임 기준 precision·recall)를 보고한다. 철근처럼 가늘고 반복적인 구조는 개별 객체가 아닌 다발 단위로 정의해 평가한다. 실시간 추론은 5 FPS 이상을 목표로 한다. 절대 수치는 베이스라인 실측 이후 확정한다.
실증 성능 확보 전략 (파인튜닝 없이)
카메라 실증에서 예상되는 품질 한계와 대응을 사전에 정의한다. SigLIP 2의 patch grid(384 입력 기준 24×24 또는 27×27)는 카메라 프레임 대비 해상도가 낮아 마스크 경계가 거칠어질 수 있으며, 이는 파인튜닝으로 해결되는 문제가 아니다. 따라서 다음 순서로 대응한다.
배경 프롬프트 설계. 목표 객체 클래스 외에 "desk", "floor", "wall", "hand" 등 실증 환경의 배경 클래스를 함께 입력해 배경 픽셀이 목표 클래스로 흡수되는 현상을 억제한다. 슬라이딩 윈도우 추론. 벤치마크 평가와 동일한 슬라이딩 윈도우 방식을 카메라 프레임에 적용하되, FPS 목표와의 균형을 위해 윈도우 수를 제한한다. 경량 마스크 정제. PAMR 등 학습·외부 모델이 필요 없는 정제 기법으로 경계를 다듬는다. 플랜 B. 위 조치로도 부족할 경우에 한해, 인코더는 frozen으로 유지한 채 patch token 위에 linear head 하나만 실증 세트로 소량 학습하는 최소 침습 방식을 검토한다. 백본 파인튜닝은 "재학습 없는 어휘 확장"이라는 본 과제의 전제와 상충하므로 수행하지 않는다.
최종 결과물 형태
알고리즘/모델
3. 시연 계획
이 프로젝트는 최종 발표에서 실물 또는 조작 가능한 형태의 라이브 시연을 수행합니다. 화면 출력만으로 끝나는 결과물이 아니라, 실제로 만들어 동작시키는 것을 목표로 하는 팀을 모집합니다.
실물 시연 형태
최종 시연 시나리오
Streamlit으로 구현한 실시간 추론 데모를 노트북과 GPU 서버에 연결해 발표장에서 직접 조작한다. 시연은 세 단계로 진행한다. 첫째, 8개 표준 OVSS 벤치마크(VOC20, VOC21, Context59, Context60, COCO-Object, COCO-Stuff, ADE20K, Cityscapes) 중 심사위원이 지정하는 데이터셋과 이미지를 그 자리에서 선택해 추론을 실행하고, 원본·예측 마스크·정답 마스크를 나란히 출력하며 해당 이미지의 mIoU를 즉시 산출해 표시한다. 사전 저장된 결과가 아니라 현장에서 실행되는 추론임을 보이기 위해, 이미지 인덱스를 임의로 바꿔가며 반복 실행한다. 둘째, 클래스 프롬프트 입력창에 심사위원이 부르는 임의의 단어를 한국어와 영어로 각각 입력해, 사전 학습하지 않은 어휘에 대해서도 분할 결과가 생성되는지를 확인한다. 동일 대상에 대한 한국어·영어 결과를 나란히 놓아 다국어 인코더 도입의 효과를 대조한다. 셋째, 벤치마크별 mIoU 비교표와 vanilla SigLIP 2 대비 개선폭, ablation 결과를 대시보드 형태로 제시하고, 마지막으로 웹캠 또는 임의 업로드 이미지를 입력해 벤치마크 밖 실제 장면에서도 동작함을 확인한다.
4. 학부생 팀원 모집 공고
모집 분야/역할
데이터 전처리, 연구
필요 역량/선수과목
지원 방법/문의
플렛폼 지원, 메일
5. 학기별 추진 계획
| 기간 | 단계 | 주요 활동 |
|---|---|---|
| 1~2주 | 팀 빌딩 & 주제 구체화 | — |
| 3~5주 | 문헌조사 & 데이터 준비 | — |
| 6~9주 | 설계 및 1차 구현 (중간발표) | — |
| 10~13주 | 개선 및 실험/검증 | — |
| 14~16주 | 결과 정리 & 발표 (최종발표) | — |
6. 기대 효과 및 활용 계획
작성된 내용이 없습니다.