지식 · AI 기초

양자화 · 경량화

Quantization

📂AI 기초읽기 1분📊심화🔗관련 4

양자화란?

한 줄 정의
모델 내부 숫자의 정밀도를 낮춰(예: 32비트→8비트) 크기와 연산을 줄이는 기술. 성능은 지키며 더 가볍고 빠르게 만든다.
⚡ 3줄 요약
  • 숫자 정밀도를 낮춰 크기·연산↓
  • 성능 지키며 가볍게
  • 온디바이스의 바탕

AI 모델의 파라미터는 정밀한 소수로 저장되는데, 양자화는 그 정밀도를 의도적으로 낮춰 용량과 계산량을 크게 줄입니다. 고해상도 사진을 적당히 압축해도 알아볼 수 있듯, 정밀도를 낮춰도 성능은 크게 안 떨어지는 경우가 많습니다.

덕분에 대형 모델을 노트북·스마트폰 같은 작은 기기에서도 돌릴 수 있게 됩니다. 지식 증류와 함께 'AI를 가볍고 저렴하게 배포'하는 핵심 기법이며, 온디바이스 AI(기기 내 AI)의 바탕이 됩니다.

물론 정밀도를 지나치게 낮추면 성능이 눈에 띄게 떨어질 수 있어, 8비트·4비트처럼 손실과 효율의 균형점을 고릅니다. '얼마나 줄여도 쓸 만한가'를 실제 과제로 검증하는 것이 관건이며, 이 절충을 잘 잡으면 큰 모델을 훨씬 싼 비용·작은 기기에서 실용적으로 돌릴 수 있습니다.

💡 쉽게 말하면
고해상도 사진을 적당히 압축해도 알아보듯 — 정밀도를 낮춰 모델을 가볍게 만듭니다.
실무에서 왜 중요한가
큰 모델을 작은 기기·낮은 비용으로 돌리게 해줍니다. AI 대중화·온디바이스 실행의 열쇠입니다.
유래와 출처

신호처리·컴퓨팅의 오래된 양자화 개념을 딥러닝에 적용한 것으로, 대형 모델을 효율적으로 배포하려는 필요에서 널리 쓰이게 됐습니다.

사례로 이해하기

예를 들어, 대형 모델을 노트북에서 돌린다고 해봅시다.

  1. 원본 — 고정밀(예: 32비트) 대형 모델은 무겁습니다.
  2. 양자화 — 정밀도를 8비트 등으로 낮춥니다.
  3. 경량화 — 용량·연산이 크게 줄어듭니다.
  4. 실행 — 일반 노트북·스마트폰에서도 구동됩니다.
  5. 검증 — 성능 저하가 미미한지 확인합니다.
관련 용어
이 용어와 연결된 교육
📚에이전트 AI 실무 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →
이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
교육 문의하기
최종 수정 2026-07-11 · 감수 김종혁

자주 묻는 질문

약간의 손실은 있지만 대개 미미합니다. 얻는 속도·비용 이점이 훨씬 큽니다.
네. 양자화 덕분에 큰 모델을 기기 안에서 돌릴 수 있어, 온디바이스 AI의 핵심 기술입니다.
적당히 낮추면 성능은 거의 유지됩니다. 지나치면 떨어지므로 균형점(8비트·4비트)을 찾습니다.
네. 양자화로 가벼워진 모델이라야 스마트폰 등 작은 기기에서 돌아갑니다.