본문으로 건너뛰기

강화학습(Reinforcement Learning)

제131회4교시AI/신기술신규

컴퓨터시스템응용기술사 제131회 4교시 26번 문항으로, 과목은 AI/신기술입니다.

원문 문제

컴퓨터시스템응용기술사 제131회 26번. 강화학습(Reinforcement Learning)

  1. 가. 가치기반 강화학습, 정책기반 강화학습, 액터 크리틱(Actor-Critic) 강화학습
  2. 나. 정책경사(Policy Gradient) 방식 강화학습

핵심 키워드

  • 가치 기반 강화학습
  • 정책 기반 강화학습
  • Actor-Critic
  • Policy Gradient
  • 상태 가치
  • 행동 가치

고득점 가이드 — 1. 개요

강화학습은 에이전트가 환경과의 시행착오적 상호작용에서 누적 보상을 극대화하도록 최적 정책을 학습하는 방식으로, MDP(Markov Decision Process) 의 상태·행동·보상·전이 확률을 기본 프레임으로 한다. 학습 대상에 따라 가치 함수를 추정하는 가치기반, 정책을 직접 파라미터화하는 정책기반, 두 접근을 결합한 Actor-Critic 으로 구분되며 게임·로보틱스·추천·자율주행 등 자율 에이전트 설계의 기반 기법이다.

로그인하면 하루 1편은 무료로 전문을 볼 수 있어요

  • 변형 문제
  • 답안 골격
  • 고득점 가이드 전문

출제 이력

  • 가치 기반 강화학습기출 1문항
  • 정책 기반 강화학습기출 1문항
  • Actor-Critic기출 1문항
  • Policy Gradient기출 1문항
  • 상태 가치기출 1문항
  • 행동 가치기출 1문항

다른 회차에서 같은 키워드가 나온 문항이 아직 없어요.

같은 과목 문항

AI/신기술 기출 전체 보기 →

AI 생성 골격 · 미검수