마르코프 특성(Markov Property)과 마르코프 결정 프로세스
컴퓨터시스템응용기술사 제131회 2교시 14번 문항으로, 과목은 AI/신기술입니다.
원문 문제
컴퓨터시스템응용기술사 제131회 14번. 마르코프 특성(Markov Property)과 마르코프 결정 프로세스
- 가. 마르코프 결정 프로세스(Markov Decision Process)와 전이확률(Transition Probability)
- 나. 상태가치함수(State Value Function)와 액션가치함수(State-Action Value Function)
- 다. 벨만기대방정식(Bellman Expectation Equation)과 벨만최적방정식(Bellman Optimality Equation)
핵심 키워드
- 마르코프 결정 프로세스
- 상태 전이 확률
- 상태 가치 함수
- 행동 가치 함수
- 벨만 기대 방정식
- 벨만 최적 방정식
- 정책 최적화
고득점 가이드 — 1. 개요
마르코프 결정 프로세스 (MDP, Markov Decision Process) 는 다음 상태가 현재 상태와 행동에만 의존하는 마르코프 특성 위에 보상·정책 개념을 추가한 강화학습의 수학적 의사결정 모델이다. 에이전트는 환경과 순차적으로 상호작용하며 할인 누적 보상을 최대화하는 최적 정책 pi* 를 탐색하며, 가치 함수와 벨만 방정식은 정책 평가·개선의 핵심 도구이다.
출제 이력
- 마르코프 결정 프로세스기출 1문항
- 상태 전이 확률기출 1문항
- 상태 가치 함수기출 1문항
- 행동 가치 함수기출 1문항
- 벨만 기대 방정식기출 1문항
- 벨만 최적 방정식기출 1문항
- 정책 최적화기출 1문항
다른 회차에서 같은 키워드가 나온 문항이 아직 없어요.