지식 · AI 기초
강화학습
Reinforcement Learning
📂AI 기초⏱읽기 1분📊심화🔗관련 4
강화학습이란?
한 줄 정의
보상과 벌을 통해 '무엇이 좋은 행동인지'를 시행착오로 배우는 학습 방식. 게임·로봇·AI 정렬에 쓰인다.
⚡ 3줄 요약
- 보상·벌로 시행착오 학습
- '좋은 행동'을 스스로 익힘
- 게임·로봇·RLHF에 활용
강화학습은 에이전트가 환경에서 행동하고, 그 결과로 보상(또는 벌)을 받으며 '보상을 최대화하는 전략'을 스스로 익히는 방식입니다. 정답을 주는 게 아니라, 잘하면 상을 주는 식으로 시행착오를 통해 배웁니다. 강아지 훈련과 비슷합니다.
바둑 AI(알파고), 로봇 제어, 게임에서 큰 성과를 냈고, 최근에는 대형 언어모델을 사람 선호에 맞추는 RLHF에도 쓰입니다. 명확한 정답은 없지만 '좋고 나쁨'을 보상으로 정의할 수 있는 문제에 강합니다.
강화학습의 오랜 숙제는 '탐험 대 활용(exploration vs exploitation)'의 균형입니다 — 이미 아는 좋은 선택만 반복하면 더 나은 길을 못 찾고, 새로운 시도만 하면 손해가 큽니다. 또 보상을 잘못 설계하면 엉뚱한 편법을 학습하므로, '무엇에 보상할지'를 정교하게 정의하는 것이 관건입니다.
💡 쉽게 말하면
강아지 훈련처럼 — 잘하면 상을 줘서, 스스로 좋은 전략을 찾아가게 합니다.
실무에서 왜 중요한가
AI가 '스스로 전략을 학습'하는 원리입니다. AI 에이전트·AI 정렬(RLHF)의 바탕이 됩니다.
유래와 출처
행동심리학의 보상 학습에 뿌리를 두고, 1980~90년대 서턴과 바토(Sutton & Barto)가 이론을 정립했습니다. 2016년 알파고의 성공으로 크게 주목받았습니다.
출처 · 리처드 서튼·앤드루 바토의 표준 교재로 체계화
사례로 이해하기
예를 들어, 강화학습으로 게임 AI를 훈련한다고 해봅시다.
- 행동 — AI가 게임에서 여러 수를 시도합니다.
- 보상 — 이기면 +점수, 지면 −점수를 받습니다.
- 학습 — 점수를 높이는 행동을 강화합니다.
- 반복 — 수백만 판을 스스로 두며 개선합니다.
- 숙달 — 사람을 능가하는 전략을 발견합니다.
관련 용어
RLHF · 인간 피드백 강화학습사람이 매긴 선호(어느 답이 더 좋은지)로 AI를 다듬어, 더 유용하고 안전하게 만드는 학습 기법. ChatGPT를 '쓸 만하게' 만든 비결.머신러닝 · 딥러닝머신러닝은 데이터로 규칙을 스스로 학습하는 AI의 방법, 딥러닝은 그중 인공신경망을 깊게 쌓아 학습하는 강력한 갈래.지도학습 · 비지도학습지도학습은 '정답이 붙은' 데이터로 배우는 방식, 비지도학습은 정답 없이 데이터 속 패턴·구조를 스스로 찾는 방식.AI 에이전트단순히 답만 하는 것을 넘어, 목표를 받으면 스스로 계획을 세우고 도구를 사용해 여러 단계의 작업을 수행하는 AI.
이 용어와 연결된 교육
📚에이전트 AI 실무 입문나눔경영컨설팅 기업교육 · 대면/온라인과정 보기 →이 주제로 사내 교육이 필요하신가요?
담당자 맞춤 커리큘럼·견적을 바로 받아보세요.
자주 묻는 질문
정답을 주지 않고 '보상'만 줍니다. AI가 시행착오로 좋은 행동을 스스로 찾습니다.
게임·로봇·최적화·AI 정렬(RLHF)에 쓰이며, 일반 업무 자동화보다는 특수 영역에 강합니다.
지도학습은 '정답'을 주고, 강화학습은 '보상'으로 스스로 좋은 전략을 찾게 합니다.
게임·로봇·추천·RLHF에 쓰이지만, 설계가 까다로워 일반 업무엔 덜 직접적입니다.