강화학습(Reinforcement Learning)
컴퓨터시스템응용기술사 제131회 4교시 26번 문항으로, 과목은 AI/신기술입니다.
원문 문제
컴퓨터시스템응용기술사 제131회 26번. 강화학습(Reinforcement Learning)
- 가. 가치기반 강화학습, 정책기반 강화학습, 액터 크리틱(Actor-Critic) 강화학습
- 나. 정책경사(Policy Gradient) 방식 강화학습
핵심 키워드
- 가치 기반 강화학습
- 정책 기반 강화학습
- Actor-Critic
- Policy Gradient
- 상태 가치
- 행동 가치
고득점 가이드 — 1. 개요
강화학습은 에이전트가 환경과의 시행착오적 상호작용에서 누적 보상을 극대화하도록 최적 정책을 학습하는 방식으로, MDP(Markov Decision Process) 의 상태·행동·보상·전이 확률을 기본 프레임으로 한다. 학습 대상에 따라 가치 함수를 추정하는 가치기반, 정책을 직접 파라미터화하는 정책기반, 두 접근을 결합한 Actor-Critic 으로 구분되며 게임·로보틱스·추천·자율주행 등 자율 에이전트 설계의 기반 기법이다.
출제 이력
- 가치 기반 강화학습기출 1문항
- 정책 기반 강화학습기출 1문항
- Actor-Critic기출 1문항
- Policy Gradient기출 1문항
- 상태 가치기출 1문항
- 행동 가치기출 1문항
다른 회차에서 같은 키워드가 나온 문항이 아직 없어요.