글 목록

AI · Data

VLM vs. LLM: 텍스트를 이해하는 AI에서 세상을 보는 AI로

LLM이 텍스트를 중심으로 세상을 이해한다면 VLM은 이미지와 텍스트를 함께 이해합니다. 두 모델의 구조와 차이, 실제 활용 사례를 개발자의 관점에서 정리합니다.

ChatGPT 같은 서비스가 익숙해지면서 LLM(Large Language Model)​이라는 용어도 이제 개발자에게는 꽤 친숙해졌습니다.

그런데 최근 AI 서비스를 살펴보면 조금 다른 장면을 자주 만나게 됩니다.

사용자가 스크린샷 하나를 올리고 이렇게 질문합니다.

"이 화면에서 문제가 뭔지 알려줘."

모델은 이미지 안의 텍스트를 읽는 것뿐 아니라 버튼, 레이아웃, 그래프 같은 시각적 요소까지 파악해서 답변합니다.

여기서 사용되는 핵심 기술이 VLM(Vision-Language Model)​입니다.

처음에는 VLM을 단순히 "이미지를 볼 수 있는 LLM" 정도로 생각하기 쉽습니다. 큰 틀에서는 맞는 설명이지만, 실제 구조와 활용 방식을 살펴보면 둘 사이에는 꽤 중요한 차이가 있습니다.

이번 글에서는 LLM과 VLM이 각각 무엇인지부터 시작해서, 내부적으로 어떤 방식으로 동작하고 실제 서비스를 만들 때 어떤 모델을 선택하면 좋은지 정리해보겠습니다.


1. 먼저 LLM은 무엇일까?

LLM은 Large Language Model, 말 그대로 대규모 언어 모델입니다.

GPT 계열이나 Llama 같은 모델이 대표적입니다.

LLM의 핵심은 텍스트를 token이라는 작은 단위로 나누고, 주어진 문맥을 바탕으로 다음에 올 token의 확률을 예측하는 것입니다.

예를 들어 다음과 같은 문장이 있다고 해보겠습니다.

대한민국의 수도는

모델은 앞에 등장한 token들을 기반으로 다음 token으로 서울이 등장할 가능성이 높다고 판단합니다.

아주 단순화하면 다음과 같습니다.

Input Text
    ↓
Tokenizer
    ↓
Text Tokens
    ↓
Transformer
    ↓
Next Token Prediction
    ↓
Generated Text

이 과정을 매우 큰 데이터와 모델 규모로 학습하면 단순한 문장 완성을 넘어 질문 답변, 요약, 번역, 코드 생성, 추론 같은 능력이 나타납니다.

그래서 일반적인 LLM의 세계에서는 기본적으로 다음과 같은 관계가 성립합니다.

Text → Model → Text

즉, 언어가 모델과 현실 세계를 연결하는 인터페이스입니다.


2. 그런데 현실은 텍스트로만 이루어져 있지 않다

여기서 한 가지 문제가 생깁니다.

우리가 실제로 다루는 정보는 텍스트만으로 존재하지 않습니다.

웹 서비스에는 버튼과 이미지가 있고, 운영 대시보드에는 그래프가 있으며, 문서에는 표와 다이어그램이 있습니다. 개발 과정에서도 UI 스크린샷이나 아키텍처 다이어그램을 보고 문제를 판단하는 경우가 많습니다.

예를 들어 다음 질문을 생각해보겠습니다.

"이 그래프에서 CPU 사용량이 급격하게 증가한 시점은 언제야?"

그래프가 이미지로만 제공된다면 text-only LLM은 그래프 자체를 직접 이해할 수 없습니다.

이미지 속 정보를 먼저 텍스트로 변환해야 합니다.

Image
  ↓
OCR / Image Processing
  ↓
Text
  ↓
LLM

이 접근도 충분히 유용하지만 한계가 있습니다.

OCR은 글자를 추출할 수는 있어도 버튼의 위치, 그래프의 형태, 객체 간 관계처럼 시각적인 의미 자체를 완전히 표현하기 어렵기 때문입니다.

이 문제를 해결하기 위해 언어 모델의 영역을 vision까지 확장한 것이 VLM입니다.


3. VLM(Vision-Language Model)이란?

VLM은 Vision-Language Model의 약자로 이미지와 텍스트를 함께 처리하고 그 관계를 이해하도록 설계된 모델입니다.

일반적인 입력 형태를 단순하게 표현하면 다음과 같습니다.

Image + Text
      ↓
     VLM
      ↓
    Text

예를 들어 UI 스크린샷을 모델에게 보여주면서 이렇게 질문할 수 있습니다.

"로그인 버튼이 어디에 있어?"

VLM은 단순히 이미지 안에서 로그인이라는 글자를 OCR로 찾는 것에 그치지 않습니다.

잘 학습된 모델이라면 화면의 구조와 객체 간 관계를 함께 해석해서 "화면 오른쪽 상단에 있는 파란색 버튼"처럼 답할 수 있습니다.

여기서 중요한 차이가 나타납니다.

LLM은 언어적 context를 이해하는 데 집중한다면, VLM은 언어적 context와 visual context를 함께 이해합니다.


4. VLM은 이미지를 어떻게 이해할까?

VLM의 구조를 이해하려면 이미지가 모델 내부에서 어떻게 처리되는지를 살펴보는 것이 좋습니다.

대표적인 구조를 매우 단순화하면 다음과 같습니다.

             ┌──────────────┐
Image ──────▶│ Vision       │
             │ Encoder      │
             └──────┬───────┘
                    │
              Visual Features
                    │
                    ▼
             ┌──────────────┐
             │ Projector /  │
             │ Adapter      │
             └──────┬───────┘
                    │
                    ▼
                LLM Space
                    ▲
                    │
Text ──▶ Tokenizer ─┘
                    │
                    ▼
                   LLM
                    │
                    ▼
                 Answer

핵심 구성 요소를 하나씩 살펴보겠습니다.

Vision Encoder

이미지를 받아 visual feature를 추출합니다.

이미지를 그대로 LLM에 전달하는 것이 아니라 모델이 처리할 수 있는 수치 표현으로 변환하는 역할을 합니다.

Vision Transformer(ViT) 계열 구조가 대표적으로 사용됩니다.

Projector / Adapter

Vision Encoder에서 생성된 visual representation과 LLM이 사용하는 embedding space는 서로 다를 수 있습니다.

따라서 중간에서 두 표현을 연결해주는 projector 또는 adapter가 필요합니다.

쉽게 표현하면 다음과 같습니다.

Visual Features
      ↓
"LLM이 이해할 수 있는 표현으로 변환"
      ↓
Language Model

Language Model

마지막에는 LLM이 visual information과 text prompt를 함께 context로 받아 답변을 생성합니다.

그래서 많은 VLM을 개념적으로 보면 완전히 새로운 종류의 모델이라기보다는 LLM에 visual understanding capability가 결합된 multimodal architecture에 가깝습니다.

다만 실제 구현은 모델마다 다르기 때문에 모든 VLM이 정확히 이 구조를 따르는 것은 아닙니다.


5. LLM과 VLM의 차이를 한 번에 정리하면

구분 LLM VLM
Full Name Large Language Model Vision-Language Model
주요 입력 Text Image + Text
주요 출력 Text 주로 Text, 모델에 따라 다양
핵심 능력 Language Understanding & Generation Visual + Language Understanding
대표적인 처리 대상 문서, 코드, 대화 사진, UI, 차트, 문서 이미지 + 텍스트
Vision Encoder 일반적으로 없음 일반적으로 사용
OCR 이상의 시각적 이해 제한적 가능
Multimodal 보통 text 중심 Yes

한 문장으로 줄이면 다음과 같습니다.

LLM은 "무엇이라고 쓰여 있는가?"에 강하고, VLM은 여기에 "무엇이 보이는가?"라는 정보를 함께 사용할 수 있습니다.


6. 그렇다면 VLM은 OCR과 무엇이 다를까?

VLM을 처음 접할 때 가장 많이 생기는 의문 중 하나입니다.

"이미지에서 글자를 읽는 거라면 OCR과 같은 것 아닌가?"

둘은 상당히 다릅니다.

OCR의 주요 목적은 이미지에서 문자를 추출하는 것입니다.

[Image]

TOTAL: $42.50
       ↓
      OCR
       ↓
"TOTAL: $42.50"

반면 VLM에는 다음과 같이 질문할 수 있습니다.

"이 영수증에서 가장 비싼 항목은 무엇이고,
전체 금액의 몇 퍼센트를 차지해?"

이 경우 필요한 작업은 단순한 문자 인식이 아닙니다.

Visual Recognition
       +
Text Recognition
       +
Layout Understanding
       +
Reasoning
       ↓
     Answer

즉 OCR이 text extraction에 가깝다면, VLM은 visual understanding + language reasoning에 가깝습니다.

물론 실제 production system에서는 OCR과 VLM을 경쟁 관계로 볼 필요는 없습니다.

정확한 문자 추출이 중요하다면 OCR을 먼저 사용하고, 그 결과와 이미지를 VLM 또는 LLM에 함께 전달하는 hybrid architecture가 더 적합할 수도 있습니다.


7. 개발자 입장에서 VLM이 흥미로운 이유

VLM이 등장하면서 AI application의 입력 인터페이스가 크게 달라졌습니다.

LLM 기반 애플리케이션에서는 보통 데이터를 텍스트로 만드는 과정이 중요했습니다.

Real World
    ↓
Convert to Text
    ↓
LLM

하지만 VLM을 활용하면 일부 경우 이 단계를 줄일 수 있습니다.

Real World
    ↓
Image / Screenshot / Document
    ↓
VLM

예를 들어 QA automation을 생각해보겠습니다.

기존에는 UI의 DOM이나 accessibility tree를 분석해 버튼의 상태를 확인했다면 VLM을 이용해 다음과 같은 방식도 가능합니다.

Screenshot
   +
"결제 버튼이 활성화되어 있는지 확인해줘."
   ↓
VLM
   ↓
"The payment button is disabled."

이 특징은 browser automation, visual QA, document processing, robotics 등에서 특히 흥미롭습니다.


8. VLM이 특히 잘 맞는 use case

VLM을 사용한다고 해서 모든 AI 시스템이 더 좋아지는 것은 아닙니다.

입력 데이터에 시각 정보 자체가 중요한 의미를 가지고 있을 때 VLM의 장점이 커집니다.

대표적인 사례는 다음과 같습니다.

UI Understanding

웹이나 모바일 화면을 분석하는 경우입니다.

Screenshot
+
"사용자가 checkout을 완료하려면 어떤 버튼을 눌러야 해?"

VLM은 UI element와 화면의 visual hierarchy를 함께 이해할 수 있습니다.

Document Understanding

PDF나 스캔 문서에는 텍스트만 있는 것이 아닙니다.

표, 이미지, 문단 위치, 제목 구조 등이 모두 의미를 가질 수 있습니다.

Invoice Image
      ↓
     VLM
      ↓
Vendor
Date
Items
Total

Chart & Dashboard Analysis

모니터링 dashboard나 business chart를 분석하는 것도 대표적인 사례입니다.

단순 OCR로 축의 숫자를 읽는 것보다 그래프의 형태와 데이터의 관계를 함께 이해해야 하기 때문입니다.

Visual Question Answering

사진을 보고 자연어 질문에 답하는 형태입니다.

Image: 교차로 사진

Question:
"빨간 신호를 받고 있는 차량은 몇 대야?"

이런 문제에서는 visual perception과 language reasoning이 동시에 필요합니다.


9. 그렇다면 무조건 VLM을 사용하면 될까?

그렇지는 않습니다.

VLM은 처리해야 하는 정보가 더 많기 때문에 일반적인 text-only LLM보다 비용과 latency가 증가할 수 있습니다.

예를 들어 사용자의 질문이 다음과 같다고 해보겠습니다.

"JavaScript에서 Promise와 async/await의 차이를 설명해줘."

여기에는 visual information이 전혀 필요하지 않습니다.

이런 요청을 처리하기 위해 굳이 이미지를 처리할 수 있는 pipeline을 구성할 이유는 없습니다.

실제 서비스를 설계할 때는 다음처럼 생각하는 편이 좋습니다.

Does the task require visual information?
             │
        ┌────┴────┐
       No         Yes
       │           │
      LLM         VLM

하지만 한 가지 예외가 있습니다.

최근의 frontier model들은 하나의 모델에서 text와 image를 모두 지원하는 방향으로 발전하고 있습니다.

따라서 실제 API 선택에서는 "LLM 제품 vs VLM 제품"이라는 이분법보다 요청마다 어떤 modality가 필요한가를 판단하는 것이 더 중요해지고 있습니다.


10. VLM도 결국 모든 것을 정확하게 보는 것은 아니다

VLM을 사용하다 보면 모델이 이미지를 "사람처럼 본다"고 느껴질 때가 있습니다.

하지만 그렇게 이해하면 위험합니다.

VLM 역시 확률적 모델이며 visual hallucination이 발생할 수 있습니다.

예를 들어 이미지에 실제로 존재하지 않는 버튼을 있다고 판단하거나, 작은 글자를 잘못 읽거나, 복잡한 차트에서 수치를 잘못 해석할 수 있습니다.

특히 다음과 같은 상황에서는 주의가 필요합니다.

  • 작은 글씨가 많은 이미지
  • 매우 높은 해상도의 복잡한 화면
  • 비슷한 객체가 반복되는 UI
  • 정확한 좌표가 필요한 작업
  • 숫자 하나의 오차도 허용되지 않는 문서
  • 의료·법률·금융 등 높은 정확성이 필요한 판단

따라서 production 환경에서는 VLM의 응답을 곧바로 truth로 사용하는 것보다 validation layer를 함께 설계하는 것이 좋습니다.

예를 들면 다음과 같습니다.

Image
  ↓
VLM
  ↓
Structured Output
  ↓
Validation
  ↓
Business Logic

AI 모델의 능력만큼이나 모델이 틀렸을 때 시스템이 어떻게 동작하는지가 중요합니다.


11. LLM에서 VLM으로, 그리고 Multimodal Model로

LLM과 VLM의 차이를 공부하다 보면 결국 더 큰 흐름 하나가 보입니다.

AI 모델의 interface가 점점 확장되고 있다는 점입니다.

초기의 LLM은 주로 다음과 같았습니다.

Text → Text

VLM에서는 다음과 같이 확장됩니다.

Image + Text → Text

그리고 multimodal model은 더 다양한 입력과 출력을 다룹니다.

Text
Image
Audio
Video
   ↓
Multimodal Model
   ↓
Text
Image
Audio
Action

결국 중요한 변화는 모델의 이름이 아닐지도 모릅니다.

AI가 이해할 수 있는 context의 범위가 넓어지고 있다는 것이 핵심입니다.

텍스트만 이해하던 모델이 이미지까지 이해하기 시작했고, 이제는 음성이나 영상, 실제 컴퓨터 화면과의 interaction까지 모델의 context로 들어오고 있습니다.


12. 마무리

LLM과 VLM의 관계를 아주 간단하게 정리하면 다음과 같습니다.

LLM
└── Language Understanding
        +
VLM
└── Visual Understanding
        +
   Language Understanding

LLM이 자연어를 AI와 연결하는 강력한 interface를 만들었다면, VLM은 그 interface를 우리가 실제로 보는 세계까지 확장하고 있습니다.

그래서 새로운 AI 서비스를 설계할 때는 단순히 "어떤 LLM을 사용할까?"만 고민하기보다 먼저 이런 질문을 해보는 것이 좋습니다.

우리 서비스에서 모델이 이해해야 하는 정보는 어떤 형태로 존재하는가?

텍스트만으로 충분하다면 LLM이 더 단순하고 효율적인 선택일 수 있습니다.

반대로 screenshot, document layout, chart, photo처럼 시각 정보 자체가 문제 해결의 중요한 context라면 VLM이 훨씬 자연스러운 선택이 됩니다.

결국 LLM과 VLM의 차이는 단순히 모델 종류의 차이라기보다 AI에게 우리가 세상을 어떤 형태로 보여줄 것인가의 차이라고 볼 수 있습니다.

Tags

태그

LLMVLMVision Language ModelLarge Language ModelMultimodal AIGenerative AI