지식 · AI 기초

RLHF · 인간 피드백 강화학습

Reinforcement Learning from Human Feedback

📂AI 기초읽기 1분📊심화🔗관련 4

RLHF이란?

한 줄 정의
사람이 매긴 선호(어느 답이 더 좋은지)로 AI를 다듬어, 더 유용하고 안전하게 만드는 학습 기법. ChatGPT를 '쓸 만하게' 만든 비결.
⚡ 3줄 요약
  • 사람 선호로 AI를 다듬음
  • 더 유용·안전하게
  • ChatGPT를 쓸 만하게 만든 비결

거대한 텍스트로 학습한 언어모델은 똑똑하지만 무례하거나 엉뚱할 수 있습니다. RLHF는 사람이 여러 답변 중 더 나은 것을 고르게 해 '선호 모델'을 만들고, 그 선호를 보상 삼아 AI를 강화학습으로 다듬습니다. 결과적으로 사람이 원하는 방식으로 답하게 됩니다.

ChatGPT가 갑자기 유용해진 핵심 이유가 이 기법입니다. 유용함·정직함·무해함 같은 인간의 가치에 AI를 '정렬(alignment)'하는 대표 방법으로, 최근엔 더 효율적인 변형들도 나오고 있습니다.

💡 쉽게 말하면
'이 답이 저 답보다 낫다'는 사람 평가로 AI를 길들이는 것 — 똑똑함을 예의 바르게 만듭니다.
실무에서 왜 중요한가
AI가 '똑똑함'을 넘어 '사람에게 도움이 되게' 만드는 기법입니다. AI 정렬·안전의 핵심입니다.
유래와 출처

2022년 OpenAI의 InstructGPT·ChatGPT에 적용되며 대중적으로 알려졌고, 대형 언어모델을 사람 선호에 맞추는 표준 정렬 기법으로 자리잡았습니다.

출처 · 크리스티아노(Christiano) 등, 「Deep RL from Human Preferences」(2017)
사례로 이해하기

예를 들어, RLHF로 AI 답변을 다듬는 과정을 봅시다.

  1. 생성 — AI가 한 질문에 여러 답을 만듭니다.
  2. 사람 평가 — 평가자가 더 나은 답을 고릅니다.
  3. 보상 모델 — 그 선호를 학습해 '좋은 답' 기준을 만듭니다.
  4. 강화학습 — AI가 그 보상을 높이도록 스스로 조정합니다.
  5. 결과 — 더 유용하고 안전한 답을 내놓습니다.
관련 용어
이 용어와 연결된 교육
📚에이전트 AI 실무 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →
이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
교육 문의하기
최종 수정 2026-07-11 · 감수 김종혁

자주 묻는 질문

모델을 '똑똑함'에서 '사람에게 유용·안전함'으로 정렬하기 때문입니다. ChatGPT 성공의 핵심입니다.
초기 선호 데이터에 사람이 필요합니다. 이후엔 학습된 보상 모델이 대신하며, 더 효율적인 변형도 연구됩니다.
사람 선호로 AI를 다듬어 더 유용·안전하게 만듭니다 — ChatGPT를 '쓸 만하게' 만든 비결입니다.
초기 다듬기에 사람 평가가 필요합니다. 이후 AI 피드백으로 보완하는 방법도 연구됩니다.