지식 · AI 기초
임베딩 · 벡터 DB
Embedding / Vector Database
📂AI 기초⏱읽기 1분📊심화🔗관련 4
임베딩이란?
한 줄 정의
글의 '의미'를 숫자 벡터로 바꾼 것이 임베딩, 그 벡터를 저장해 의미가 비슷한 것을 빠르게 찾는 저장소가 벡터 DB. RAG의 핵심 부품.
⚡ 3줄 요약
- 의미를 숫자 벡터로(임베딩)
- 비슷한 것 빠르게 찾는 벡터DB
- RAG의 핵심 부품
임베딩은 단어·문장을 '의미가 담긴 숫자 배열(벡터)'로 바꾸는 기술입니다. 의미가 비슷하면 벡터도 가까워져서, '연차 규정'과 '휴가 며칠'처럼 표현이 달라도 가까운 것으로 인식합니다.
이 벡터들을 모아 두고 '질문과 의미가 가장 가까운 조각'을 순식간에 찾아 주는 것이 벡터 데이터베이스입니다. RAG는 바로 이 구조로 관련 문서를 검색해 AI에게 근거로 넘깁니다. 즉, 임베딩과 벡터 DB는 '의미 기반 검색'의 뼈대입니다.
벡터 간 유사도는 보통 '코사인 유사도'로 잽니다 — 방향이 비슷할수록 의미가 가깝다고 보는 것입니다. 실무에서는 전용 벡터 DB나 기존 DB의 벡터 확장 기능을 쓰며, 임베딩 모델의 품질과 문서를 어떻게 잘게 나누는지(청킹)가 검색·RAG 결과의 정확도를 크게 좌우합니다.
💡 쉽게 말하면
글의 의미를 좌표로 바꿔 '가까운 것=비슷한 것'으로 찾는 것 — 의미 검색의 뼈대입니다.
실무에서 왜 중요한가
키워드가 정확히 일치하지 않아도 '의미로' 찾아주기 때문에, 사내 문서 검색·RAG의 품질을 좌우합니다.
유래와 출처
단어를 의미가 담긴 벡터로 바꾸는 임베딩은 2013년 구글이 공개한 word2vec으로 대중화됐고, 이후 문장 임베딩과 벡터 데이터베이스로 발전해 RAG의 뼈대가 됐습니다.
출처 · 단어 임베딩 word2vec, 미콜로프(Mikolov) 등(2013)
사례로 이해하기
예를 들어, 사내 규정 검색에 임베딩·벡터 DB를 쓴다고 해봅시다.
- 변환 — 규정 문서를 문단 단위로 임베딩(벡터)으로 바꿉니다.
- 저장 — 그 벡터들을 벡터 DB에 넣어 둡니다.
- 질문 — 직원이 '반차도 쓸 수 있나요?'라고 묻습니다.
- 검색 — 질문을 벡터로 바꿔 의미가 가장 가까운 규정 조각을 찾습니다.
- 활용 — 그 조각을 AI에게 근거로 넘겨(RAG) 정확한 답을 만들게 합니다.
관련 용어
RAG · 검색증강생성AI가 답하기 전에 사내 문서·데이터베이스 등 외부 지식을 먼저 검색해 그 근거 위에서 답을 생성하게 하는 기법.LLM · 대규모 언어모델방대한 텍스트로 학습해 '다음에 올 말'을 예측하며 문장을 생성하는 대규모 신경망. ChatGPT·Claude의 두뇌.생성형 AI텍스트·이미지·코드·음성 등 새로운 콘텐츠를 만들어내는 AI. ChatGPT·Claude 같은 대규모 언어모델이 대표적이다.파인튜닝이미 학습된 AI 모델을 특정 분야·작업·말투에 맞춰 소량의 데이터로 추가 학습시키는 것.
이 용어와 연결된 교육
📚내 데이터로 답하는 AI 만들기 — RAG 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
자주 묻는 질문
키워드는 글자 일치를, 임베딩은 '의미 유사도'를 봅니다. 표현이 달라도 뜻이 같으면 찾아냅니다.
문서가 많아 의미 검색을 빠르게 하려면 필요합니다. 소량이면 간단한 검색으로도 됩니다.
키워드는 '글자 일치', 임베딩은 '의미 유사'로 찾습니다. 표현이 달라도 뜻으로 찾습니다.
데이터가 많으면 필요합니다. 소량이면 간단한 방식도 되지만, RAG엔 사실상 표준입니다.