글 목록

AI · Data

Vision Model 살펴보기: OmDet, OWLv2, LLMDet, RT-DETRv2는 무엇이 다를까?

OmDet, OWLv2, LLMDet, RT-DETRv2를 중심으로 최근 Object Detection 모델이 open vocabulary, language supervision, real-time detection이라는 서로 다른 문제를 어떻게 풀고 있는지 살펴봅니다.

들어가며

Object Detection이라고 하면 한동안 YOLO, Faster R-CNN 같은 모델을 먼저 떠올렸습니다.

이미지 한 장을 입력하면 학습된 클래스에 대해 bounding box와 class probability를 출력하는 구조입니다.

그런데 최근 detection 모델들을 살펴보면 조금 다른 흐름이 보입니다.

"학습할 때 정의하지 않은 객체도 text로 찾아낼 수 없을까?"

이 질문에서 Open-Vocabulary Object Detection(OVD) 이 시작됩니다.

예를 들어 기존 detector가 person, car, dog라는 class로 학습되었다면, 기본적으로 inference에서도 이 class taxonomy 안에서 결과를 찾습니다.

반면 open-vocabulary detector에서는 다음과 같은 text query를 줄 수 있습니다.

"person"
"red car"
"fire extinguisher"
"yellow construction helmet"

즉, detection이 단순한 fixed-class classification 문제가 아니라 image와 language를 연결하는 문제로 확장됩니다.

이번 글에서는 이 흐름을 이해하기 위해 다음 네 모델을 살펴봅니다.

  • OmDet / OmDet-Turbo
  • OWLv2
  • LLMDet
  • RT-DETRv2

재미있는 점은 네 모델 모두 Object Detection과 관련되어 있지만, 해결하려는 문제는 상당히 다르다는 것입니다.


먼저 구분해야 하는 두 가지 Detection

네 모델을 비교하기 전에 가장 먼저 구분해야 할 것이 있습니다.

Closed-set Object Detection

전통적인 detector는 학습할 때 class가 정해집니다.

Image
  ↓
Vision Backbone
  ↓
Detection Head
  ↓
person / car / dog / ...

대표적으로 COCO 80 classes를 학습했다면 detector가 예측하는 label space 역시 기본적으로 그 80개 class입니다.

RT-DETRv2는 이 방향에 가깝습니다.

핵심 질문은 다음과 같습니다.

"정해진 object class를 얼마나 정확하고 빠르게 detect할 수 있는가?"


Open-Vocabulary Object Detection

Open-vocabulary detector는 여기에 language를 추가합니다.

Image ──────────────┐
                    ↓
              Vision-Language
                    Fusion
                    ↑
Text Query ─────────┘
                    ↓
            Bounding Boxes

예를 들어 다음과 같은 query를 runtime에 전달할 수 있습니다.

"helmet"
"safety vest"
"forklift"
"fire extinguisher"

모델 입장에서 class vocabulary가 inference 시점에도 열려 있는 셈입니다.

OmDet, OWLv2, LLMDet은 이 문제와 직접 연결되어 있습니다.

따라서 네 모델을 하나의 accuracy leaderboard에 올려놓고 비교하는 것은 조금 위험합니다.

RT-DETRv2와 나머지 세 모델은 애초에 풀고 있는 문제가 다르기 때문입니다.


1. OmDet

Multi-dataset을 하나의 language space로 연결하다

OmDet의 출발점은 꽤 흥미롭습니다.

Object Detection dataset이 여러 개 있다고 생각해 보겠습니다.

Dataset A
cat / dog / person

Dataset B
car / bus / bicycle

Dataset C
helmet / worker / crane

기존 detector에서 여러 dataset을 함께 학습하려면 label taxonomy를 어떻게 합칠 것인지가 문제가 됩니다.

더 까다로운 경우도 있습니다.

Dataset A에서는 cat이 annotation되어 있는데 Dataset B의 이미지에도 고양이가 존재하면서 annotation에는 포함되지 않을 수 있습니다.

이런 heterogeneous dataset을 단순히 합치면 supervision이 충돌할 수 있습니다.

OmDet은 이 문제를 natural language를 공통 representation으로 사용하는 방식으로 접근합니다. 다양한 detection/grounding dataset의 지식을 language-conditioned detection framework 안에 축적하는 것이 핵심 아이디어입니다.

구조를 단순화하면 다음과 같이 볼 수 있습니다.

Image
  ↓
Vision Backbone
  ↓
Visual Features ────────────┐
                            │
Task / Label Text           │
  ↓                         ↓
Language Representation → Multimodal Detection Network
                            ↓
                      Object Detection

OmDet 논문에서는 vision backbone, task encoder, label encoder와 Multimodal Detection Network(MDN) 를 사용하고, latent query를 중심으로 vision과 language feature를 반복적으로 결합합니다.

OmDet이 흥미로운 이유

핵심은 detector가 하나의 고정 taxonomy만 배우는 것이 아니라는 점입니다.

Natural language가 서로 다른 dataset 사이의 일종의 universal interface 역할을 합니다.

그래서 OmDet의 방향을 한 문장으로 정리하면 다음과 같습니다.

Detection dataset의 서로 다른 vocabulary를 language를 이용해 하나의 detector 안으로 가져오자.


OmDet-Turbo

실제 inference 관점에서는 OmDet-Turbo도 같이 볼 필요가 있습니다.

OmDet-Turbo는 transformer 기반의 real-time open-vocabulary detector이며 Efficient Fusion Head를 사용해 multimodal fusion의 계산 비용을 줄이는 방향으로 설계되었습니다. 공식 구현에서는 OmDet-Turbo-Base가 A100에서 COCO val2017 기준 약 100.2 FPS에 도달했다고 보고합니다. 단, 이 숫자는 특정 hardware와 benchmark 조건에서 측정된 값이므로 다른 모델의 FPS와 직접 비교할 때는 주의해야 합니다.

즉,

Open Vocabulary
      +
Vision-Language Fusion
      +
Fast Inference

를 동시에 노리는 모델이라고 이해할 수 있습니다.


2. OWLv2

Open-Vocabulary Detection을 scale하면 어떻게 될까?

OWLv2의 핵심 키워드는 scaling입니다.

Open-vocabulary detector를 만들려면 다양한 object와 language를 연결한 detection data가 필요합니다.

하지만 bounding box annotation은 비쌉니다.

웹에는 image-text pair가 엄청나게 많지만, 각 object에 bounding box가 달려 있는 것은 아닙니다.

OWLv2는 이 문제를 self-training으로 접근합니다.

기존 detector를 이용해 web image-text pair에 pseudo-box annotation을 만들고, 그 결과를 다시 training data로 사용하는 OWL-ST recipe를 제안합니다.

흐름을 단순화하면 다음과 같습니다.

Web Image + Text
       ↓
Existing Detector
       ↓
Pseudo Box Annotation
       ↓
Large-scale Training
       ↓
OWLv2

이 접근이 중요한 이유는 detection training의 규모를 크게 확장할 수 있기 때문입니다.

OWLv2 연구에서는 self-training을 통해 학습 규모를 10억 개가 넘는 example까지 확장했고, L/14 architecture에서 human box annotation을 보지 않은 LVIS rare classes의 AP를 31.2에서 44.6으로 개선했다고 보고했습니다.


OWLv2의 핵심은 모델보다 Data Scaling에 있다

OWLv2를 볼 때 architecture만 보는 것보다 중요한 질문은 이것입니다.

"Detection에서도 web-scale training이 가능한가?"

Classification과 language model에서는 데이터 규모를 키우는 것이 성능 향상의 핵심 전략이 되었습니다.

하지만 detection에는 bounding box가 필요합니다.

OWLv2는 pseudo labeling과 self-training을 사용해 이 annotation bottleneck을 완화합니다.

따라서 OWLv2를 한 문장으로 정리하면 다음과 같습니다.

Open-vocabulary detector의 성능을 Web-scale self-training으로 확장하자.


3. LLMDet

이번에는 LLM이 Detector를 가르친다

LLMDet은 이름 때문에 처음 보면 LLM 자체가 bounding box를 직접 생성하는 모델처럼 느껴질 수 있습니다.

하지만 핵심 아이디어는 조금 다릅니다.

LLMDet은 Large Language Model의 supervision을 이용해 open-vocabulary detector를 더 강하게 만드는 방법에 가깝습니다.

이 연구에서는 GroundingCap-1M이라는 dataset을 구성합니다.

각 image에는 grounding label뿐 아니라 image-level detailed caption도 연결됩니다. 그리고 detector를 standard grounding loss와 caption generation loss를 함께 사용해 학습합니다.

개념적으로 보면 다음과 같습니다.

               LLM
                ↓
       Rich Text Supervision
        ↙              ↘
Region Caption     Image Caption
        \              /
         \            /
          Detector Training
                ↓
             LLMDet

LLM을 이용해 region-level short caption과 image-level long caption을 생성하고 이를 detector 학습에 활용합니다.


왜 detailed caption이 도움이 될까?

기존 detection annotation은 정보량이 많지 않습니다.

bounding box → "dog"
bounding box → "person"
bounding box → "car"

하지만 실제 image에는 훨씬 많은 semantic information이 있습니다.

"a brown dog running beside a person"

"a worker wearing a yellow safety helmet"

"a red vehicle parked behind the building"

이런 description에는 object category뿐 아니라 attribute, relationship, scene context가 들어 있습니다.

LLMDet은 바로 이 richer supervision을 detector 학습에 활용합니다.

그래서 LLMDet의 핵심 질문은 다음과 같습니다.

LLM이 가지고 있는 풍부한 language knowledge를 detector training supervision으로 활용하면 open-vocabulary ability를 더 높일 수 있지 않을까?

CVPR 2025에 발표된 LLMDet 연구에서는 이런 방식으로 baseline 대비 open-vocabulary detection 성능이 향상되었으며, 개선된 detector가 다시 더 강한 large multimodal model을 만드는 데 사용될 수 있다는 상호 보완 관계도 제시합니다.

참고로 LLMDet은 현재 Hugging Face Transformers에도 통합되어 있어 연구 코드만 존재하는 초기 단계보다는 접근성이 좋아졌습니다. 공식 repository에 따르면 2025년 8월 transformers==4.55.0에 통합되었습니다.


4. RT-DETRv2

Language 대신 Real-Time Detection에 집중한다

RT-DETRv2는 앞의 세 모델과 성격이 다릅니다.

OmDet, OWLv2, LLMDet을 따라오다 보면 자연스럽게 모든 최신 detector가 vision-language 방향으로 가고 있다고 생각할 수 있습니다.

하지만 실제 production 환경에서는 여전히 중요한 요구사항이 있습니다.

Accuracy
+
Latency
+
Throughput
+
Deployment

RT-DETR 계열은 DETR 구조를 real-time object detection 영역으로 가져오는 것에 초점을 둡니다.

그리고 RT-DETRv2는 기존 RT-DETR을 기반으로 실제 활용성과 training strategy를 개선합니다.


RT-DETRv2에서 달라진 부분

대표적인 변화는 세 가지입니다.

1. Selective Multi-Scale Feature Extraction

RT-DETRv2에서는 deformable attention에서 feature scale마다 서로 다른 sampling point 수를 설정할 수 있도록 합니다.

즉 모든 scale을 동일하게 처리하기보다는 scale에 따라 feature sampling을 조절할 수 있습니다.

2. Discrete Sampling Operator

기존 RT-DETR에서 사용하던 grid_sample은 deployment 환경에 따라 제약이 될 수 있습니다.

RT-DETRv2에서는 optional discrete sampling operator를 도입해 이런 deployment compatibility 문제를 완화합니다.

3. Training Strategy 개선

새로운 architecture를 계속 추가하는 대신 inference cost를 증가시키지 않는 bag-of-freebies 관점의 개선도 적용합니다.

대표적으로

Dynamic Data Augmentation
Scale-Adaptive Hyperparameters

등을 이용해 training을 개선하면서 inference speed는 유지하는 방향입니다.

공식 구현에 보고된 COCO 결과에서는 RT-DETRv2-L이 53.4 AP, RT-DETRv2-X가 54.3 AP를 기록합니다.

RT-DETRv2를 한 문장으로 표현하면 다음과 같습니다.

DETR의 end-to-end detection 구조를 real-time production detector로 더 실용적으로 만들자.


네 모델을 한 번에 비교해 보면

Model Detection Type Language Input 핵심 아이디어 주요 관심사
OmDet Open Vocabulary O Multi-dataset vision-language training 서로 다른 detection dataset의 지식 통합
OWLv2 Open Vocabulary O Web-scale self-training Detection data scaling
LLMDet Open Vocabulary O LLM-generated supervision Rich semantic supervision
RT-DETRv2 Closed-set 중심 X Efficient end-to-end DETR Real-time inference & deployment

여기서 중요한 것은 어떤 모델이 절대적으로 가장 좋은가가 아닙니다.

목적이 다릅니다.


그래서 어떤 모델을 선택해야 할까?

예를 들어 production에서 탐지해야 하는 object가 명확하게 정해져 있다고 해보겠습니다.

person
helmet
vehicle
forklift

class가 고정되어 있고 latency가 중요하다면 RT-DETRv2 같은 real-time detector가 자연스러운 선택지가 됩니다.

반대로 사용자가 runtime에 다음처럼 임의의 object를 입력해야 한다면 이야기가 달라집니다.

"red helmet"

"person holding an umbrella"

"small fire extinguisher"

"yellow construction vehicle"

이 경우 fixed-class detector만으로 해결하기 어렵기 때문에 OmDet이나 OWLv2 같은 open-vocabulary detector가 더 적합합니다.

그리고 detector 자체를 학습하는 단계에서 richer semantic supervision과 LLM knowledge를 활용하는 연구 방향에 관심이 있다면 LLMDet이 흥미로운 선택지가 됩니다.

이를 간단히 정리하면 다음과 같습니다.

Need Object Detection
        │
        ├── Classes are fixed
        │       │
        │       └── Real-time important
        │               ↓
        │          RT-DETRv2
        │
        └── Classes are open
                │
                ├── Multi-dataset / fast OVD
                │       ↓
                │     OmDet
                │
                ├── Web-scale training
                │       ↓
                │     OWLv2
                │
                └── LLM supervision
                        ↓
                      LLMDet

물론 실제 선택에서는 GPU, target resolution, custom dataset 규모, TensorRT/ONNX 지원 여부, target latency까지 함께 benchmark해야 합니다.


조금 더 큰 흐름에서 보면

네 모델을 조사하면서 가장 흥미로운 부분은 Object Detection의 발전 방향이었습니다.

과거에는 detection 문제를 대략 이렇게 정의했습니다.

Image
 ↓
Detector
 ↓
Bounding Box + Fixed Class

지금은 점점 다음과 같은 형태로 확장되고 있습니다.

Image + Language
       ↓
Vision-Language Model
       ↓
Open-ended Localization

그리고 여기서 세 가지 서로 다른 scaling 방향이 보입니다.

Dataset을 연결한다 — OmDet

서로 다른 domain과 taxonomy를 language를 통해 하나의 detector 안에 연결합니다.

Data 자체를 확장한다 — OWLv2

Pseudo annotation과 self-training을 이용해 detection training을 Web scale로 확장합니다.

Supervision의 정보량을 늘린다 — LLMDet

LLM이 생성한 detailed caption을 이용해 단순 category label보다 풍부한 semantic supervision을 제공합니다.

반면 RT-DETRv2는 다른 축을 담당합니다.

Inference를 현실적으로 만든다 — RT-DETRv2

정확도뿐 아니라 latency와 deployment까지 고려해 transformer detector를 real-time 환경으로 가져갑니다.

그래서 이 네 모델은 경쟁 모델이라기보다 현대 Object Detection이 어디로 발전하고 있는지를 보여주는 서로 다른 사례로 보는 편이 더 정확합니다.


마치며

OmDet, OWLv2, LLMDet, RT-DETRv2를 한꺼번에 보면 처음에는 비슷한 Vision Model처럼 보입니다.

하지만 조금 더 들여다보면 각각 다른 질문을 던지고 있습니다.

OmDet

여러 detection dataset의 knowledge를 어떻게 하나의 모델에 담을까?

OWLv2

Detection training data를 어떻게 Web scale까지 키울까?

LLMDet

LLM의 language knowledge를 detector가 배울 수 있을까?

RT-DETRv2

Transformer detector를 어떻게 더 빠르고 실용적으로 만들까?

그리고 이 차이를 이해하고 나면 모델 선택 기준도 조금 명확해집니다.

Open Vocabulary가 필요한가?

사용자가 runtime에 text query를 입력해야 하는가?

아니면 class는 이미 정해져 있고 latency가 가장 중요한가?

결국 "어떤 Vision Model이 가장 좋은가?"보다 먼저 물어야 하는 질문은 이것인지도 모릅니다.

우리가 풀고 싶은 detection problem은 정확히 무엇인가?


References

  1. Zhao, T., Liu, P., Lee, K. — OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network, IET Computer Vision.
  2. Om AI Lab — OmDet-Turbo: Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head.
  3. Minderer, M., Gritsenko, A., Houlsby, N. — Scaling Open-Vocabulary Object Detection (OWLv2).
  4. Fu, S. et al. — LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models, CVPR 2025.
  5. Lv, W. et al. — RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer.

Tags

태그

VMVision ModelObject DetectionOmDetLLMDetRT-DETRv2