<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://devhrxoobm.itwiki.kr/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Aimaster</id>
	<title>IT 위키 - 사용자 기여 [ko]</title>
	<link rel="self" type="application/atom+xml" href="https://devhrxoobm.itwiki.kr/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Aimaster"/>
	<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/w/%ED%8A%B9%EC%88%98:%EA%B8%B0%EC%97%AC/Aimaster"/>
	<updated>2026-09-16T01:38:38Z</updated>
	<subtitle>사용자 기여</subtitle>
	<generator>MediaWiki 1.45.1</generator>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=Q_%EB%9F%AC%EB%8B%9D&amp;diff=4456</id>
		<title>Q 러닝</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=Q_%EB%9F%AC%EB%8B%9D&amp;diff=4456"/>
		<updated>2019-10-28T13:47:17Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 새 문서: 분류:인공지능 ;Q Learning; Q-learning ;특정 상태에서 행동에 대한 미래값(Q)을 계산하여, 최적 정책을 찾는 마르코프 결정 프로세스 기반...&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;Q Learning; Q-learning&lt;br /&gt;
;특정 상태에서 행동에 대한 미래값(Q)을 계산하여, 최적 정책을 찾는 [[마르코프 결정 프로세스]] 기반 [[강화 학습]] 기법&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4455</id>
		<title>마르코프 결정 프로세스</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4455"/>
		<updated>2019-10-28T13:05:25Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;MDP; Markov Decision Process&lt;br /&gt;
&lt;br /&gt;
== 특징 ==&lt;br /&gt;
* Stochastic: 다음 결과는 확률적으로 결정됨&lt;br /&gt;
* Partially Observable: 전체 결정 과정을 조망할 수 없음&lt;br /&gt;
&lt;br /&gt;
== 구성 ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! 구성 !! 설명&lt;br /&gt;
|-&lt;br /&gt;
| S || 상태의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| A || 행동의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| R || 보상 기대값, R(s, a)&lt;br /&gt;
|-&lt;br /&gt;
| r || 차감 요인, 0~1&lt;br /&gt;
|-&lt;br /&gt;
| T || 전이확률, T(s&#039;, a, s)&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== Q 러닝과의 비교 ==&lt;br /&gt;
;유사한 목적으로 강화학습에 사용되는 Q Learning&lt;br /&gt;
{{MDP와 Q 러닝}}&lt;br /&gt;
&lt;br /&gt;
== 같이 보기 ==&lt;br /&gt;
* [[머신러닝]]&lt;br /&gt;
* [[강화 학습]]&lt;br /&gt;
* [[은닉 마르코프 모델]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%ED%8B%80:MDP%EC%99%80_Q_%EB%9F%AC%EB%8B%9D&amp;diff=4454</id>
		<title>틀:MDP와 Q 러닝</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%ED%8B%80:MDP%EC%99%80_Q_%EB%9F%AC%EB%8B%9D&amp;diff=4454"/>
		<updated>2019-10-28T13:04:42Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 새 문서: {| class=&amp;quot;wikitable&amp;quot; |- ! 항목 !! MDP !! Q 러닝 |- | 결정 과정 || 전이확률T(s’,a,s) 계산 || 미래값(Q) 계산 |- | 정책(Policy) || π(s) = 𝑎𝑟𝑔𝑚...&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! 항목 !! [[MDP]] !! [[Q 러닝]]&lt;br /&gt;
|-&lt;br /&gt;
| 결정 과정 || 전이확률T(s’,a,s) 계산 || 미래값(Q) 계산&lt;br /&gt;
|-&lt;br /&gt;
| 정책(Policy) || π(s) = 𝑎𝑟𝑔𝑚𝑎𝑥 𝑇(𝑠’, 𝑎, 𝑠) || π(s) = 𝑎𝑟𝑔𝑚𝑎𝑥 𝑄(𝑠, 𝑎)&lt;br /&gt;
|-&lt;br /&gt;
| 최적 값 || 수렴 시까지 V(s)수행 || Q 테이블 업데이트&lt;br /&gt;
|}&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5&amp;diff=4453</id>
		<title>강화학습</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5&amp;diff=4453"/>
		<updated>2019-10-28T13:00:49Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 강화 학습 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[강화 학습]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=Reinforcement_Learning&amp;diff=4452</id>
		<title>Reinforcement Learning</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=Reinforcement_Learning&amp;diff=4452"/>
		<updated>2019-10-28T13:00:35Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 강화 학습 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[강화 학습]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=Data_Quality_Management&amp;diff=4451</id>
		<title>Data Quality Management</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=Data_Quality_Management&amp;diff=4451"/>
		<updated>2019-10-28T13:00:09Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 데이터 품질 관리 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[데이터 품질 관리]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=Markov_Decision_Process&amp;diff=4450</id>
		<title>Markov Decision Process</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=Markov_Decision_Process&amp;diff=4450"/>
		<updated>2019-10-28T12:59:24Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 마르코프 결정 프로세스 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[마르코프 결정 프로세스]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=MDP&amp;diff=4449</id>
		<title>MDP</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=MDP&amp;diff=4449"/>
		<updated>2019-10-28T12:59:06Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 마르코프 결정 프로세스 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[마르코프 결정 프로세스]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%EA%B3%BC%EC%A0%95&amp;diff=4448</id>
		<title>마코프 결정 과정</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%EA%B3%BC%EC%A0%95&amp;diff=4448"/>
		<updated>2019-10-28T12:58:48Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 마르코프 결정 프로세스 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[마르코프 결정 프로세스]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%EA%B3%BC%EC%A0%95&amp;diff=4447</id>
		<title>마르코프 결정 과정</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%EA%B3%BC%EC%A0%95&amp;diff=4447"/>
		<updated>2019-10-28T12:58:33Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 마르코프 결정 프로세스 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[마르코프 결정 프로세스]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4446</id>
		<title>마코프 결정 프로세스</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4446"/>
		<updated>2019-10-28T12:58:12Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 마르코프 결정 프로세스 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[마르코프 결정 프로세스]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=HMM&amp;diff=4445</id>
		<title>HMM</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=HMM&amp;diff=4445"/>
		<updated>2019-10-28T12:57:49Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 은닉 마르코프 모델 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[은닉 마르코프 모델]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=Hidden_Markov_Model&amp;diff=4444</id>
		<title>Hidden Markov Model</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=Hidden_Markov_Model&amp;diff=4444"/>
		<updated>2019-10-28T12:57:27Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 은닉 마르코프 모델 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[은닉 마르코프 모델]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EC%9D%80%EB%8B%89_%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EB%AA%A8%EB%8D%B8&amp;diff=4443</id>
		<title>은닉 마르코프 모델</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EC%9D%80%EB%8B%89_%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EB%AA%A8%EB%8D%B8&amp;diff=4443"/>
		<updated>2019-10-28T12:57:06Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 새 문서: 분류:인공지능 ;HMM; Hidden Markov Model ;시스템이 은닉된 상태와 관찰 가능한 결과의 두 가지 요소로 이루어졌다고 보는 통계 기반의 모델...&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;HMM; Hidden Markov Model&lt;br /&gt;
;시스템이 은닉된 상태와 관찰 가능한 결과의 두 가지 요소로 이루어졌다고 보는 통계 기반의 모델&lt;br /&gt;
&lt;br /&gt;
* 마코프 체인을 기반으로 하고 있음&lt;br /&gt;
* 마코프 체인의 핵심 개념: 한 상태(state)의 확률은 단지 그 이전 상태에만 의존한다.&lt;br /&gt;
&lt;br /&gt;
== 특징 == &lt;br /&gt;
* 은닉 상태: 상태를 직접적으로 볼 수 없고 상태들로부터 야기된 결과들만을 관찰 가능&lt;br /&gt;
* 마르코프 체인: 각 시행 결과가 바로 앞의 시행 결과에만 영향을 받는 일련의 확률적 시행&lt;br /&gt;
* 순차 데이터: 시간성을 갖는 데이터, 대부분 가변 길이를 가짐&lt;br /&gt;
&lt;br /&gt;
== 주요 변수 ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! 변수 !! 설명&lt;br /&gt;
|-&lt;br /&gt;
| 초기화 확률 || HMM 시작 시점 어느 상태에서 시작할지 결정 시 확률&lt;br /&gt;
|-&lt;br /&gt;
| 상태 전이 확률 || 상태 전이 시 발생하는 확률&lt;br /&gt;
|-&lt;br /&gt;
| 관측 확률 || 어느 한 상태, 관측된 상태 확률&lt;br /&gt;
|}&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EC%9D%80%EB%8B%89_%EB%A7%88%EC%BD%94%ED%94%84_%EB%AA%A8%EB%8D%B8&amp;diff=4442</id>
		<title>은닉 마코프 모델</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EC%9D%80%EB%8B%89_%EB%A7%88%EC%BD%94%ED%94%84_%EB%AA%A8%EB%8D%B8&amp;diff=4442"/>
		<updated>2019-10-28T12:56:52Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 은닉 마르코프 모델 문서로 넘겨주기&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#넘겨주기 [[은닉 마르코프 모델]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4441</id>
		<title>마르코프 결정 프로세스</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4441"/>
		<updated>2019-10-28T12:53:41Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;MDP; Markov Decision Process&lt;br /&gt;
&lt;br /&gt;
== 특징 ==&lt;br /&gt;
* Stochastic: 다음 결과는 확률적으로 결정됨&lt;br /&gt;
* Partially Observable: 전체 결정 과정을 조망할 수 없음&lt;br /&gt;
&lt;br /&gt;
== 구성 ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! 구성 !! 설명&lt;br /&gt;
|-&lt;br /&gt;
| S || 상태의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| A || 행동의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| R || 보상 기대값, R(s, a)&lt;br /&gt;
|-&lt;br /&gt;
| r || 차감 요인, 0~1&lt;br /&gt;
|-&lt;br /&gt;
| T || 전이확률, T(s&#039;, a, s)&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 같이 보기 ==&lt;br /&gt;
* [[머신러닝]]&lt;br /&gt;
* [[강화 학습]]&lt;br /&gt;
* [[은닉 마르코프 모델]]&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4440</id>
		<title>마르코프 결정 프로세스</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EB%A7%88%EB%A5%B4%EC%BD%94%ED%94%84_%EA%B2%B0%EC%A0%95_%ED%94%84%EB%A1%9C%EC%84%B8%EC%8A%A4&amp;diff=4440"/>
		<updated>2019-10-28T12:44:47Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: 새 문서: 분류:인공지능 ;MDP; Markov Decision Process  == 특징 == * Stochastic: 다음 결과는 확률적으로 결정됨 * Partially Observable: 전체 결정 과정을 조망할...&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;MDP; Markov Decision Process&lt;br /&gt;
&lt;br /&gt;
== 특징 ==&lt;br /&gt;
* Stochastic: 다음 결과는 확률적으로 결정됨&lt;br /&gt;
* Partially Observable: 전체 결정 과정을 조망할 수 없음&lt;br /&gt;
&lt;br /&gt;
== 구성 ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! 구성 !! 설명&lt;br /&gt;
|-&lt;br /&gt;
| S || 상태의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| A || 행동의 유한 집합&lt;br /&gt;
|-&lt;br /&gt;
| R || 보상 기대값, R(s, a)&lt;br /&gt;
|-&lt;br /&gt;
| r || 차감 요인, 0~1&lt;br /&gt;
|-&lt;br /&gt;
| T || 전이확률, T(s&#039;, a, s)&lt;br /&gt;
|}&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5&amp;diff=4439</id>
		<title>강화 학습</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5&amp;diff=4439"/>
		<updated>2019-10-28T12:40:20Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;Reinforcement learning&lt;br /&gt;
;[[머신러닝]]의 학습 모델로, 현재 상태에서 어떤 행동(Action)을 하면 가장 보상(Reward)를 많이 받을 지 스스로 학습하는 모델&lt;br /&gt;
* 행동 심리학을 기반으로 고안됨&lt;br /&gt;
&lt;br /&gt;
[[파일:강화 학습.png]]&lt;br /&gt;
&lt;br /&gt;
== 특징 ==&lt;br /&gt;
* 보상 기반: 행동 심리학 기반, 보상을 통한 행동 유도&lt;br /&gt;
* 목표 지향: 구체적으로 정해진 목표 수행 의도&lt;br /&gt;
* 상호 작용: 데이터가 아닌 반복 수행 및 피드백을 통한 습득&lt;br /&gt;
&lt;br /&gt;
== 종류 ==&lt;br /&gt;
&lt;br /&gt;
=== [[마르코프 결정 프로세스]] ===&lt;br /&gt;
;MDP; Markov Decision Process&lt;br /&gt;
* 특징&lt;br /&gt;
** Stochastic: 다음 결과는 확률적으로 결정됨&lt;br /&gt;
** Partially Observable: 전체 결정 과정을 조망할 수 없음&lt;br /&gt;
* 구성&lt;br /&gt;
** S: 상태들의 유한 집합&lt;br /&gt;
** A: 행동들의 유한 집합&lt;br /&gt;
** Policy = ㅠ(s) -&amp;gt; S&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5&amp;diff=4438</id>
		<title>강화 학습</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5&amp;diff=4438"/>
		<updated>2019-10-28T12:34:26Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[분류:인공지능]]&lt;br /&gt;
;Reinforcement learning&lt;br /&gt;
;[[머신러닝]]의 학습 모델로, 현재 상태에서 어떤 행동(Action)을 하면 가장 보상(Reward)를 많이 받을 지 스스로 학습하는 모델&lt;br /&gt;
* 행동 심리학을 기반으로 고안됨&lt;br /&gt;
&lt;br /&gt;
[[파일:강화 학습.png]]&lt;br /&gt;
&lt;br /&gt;
== 특징 ==&lt;br /&gt;
* 보상 기반: 행동 심리학 기반, 보상을 통한 행동 유도&lt;br /&gt;
* 목표 지향: 구체적으로 정해진 목표 수행 의도&lt;br /&gt;
* 상호 작용: 데이터가 아닌 반복 수행 및 피드백을 통한 습득&lt;br /&gt;
&lt;br /&gt;
== 종류 ==&lt;br /&gt;
&lt;br /&gt;
=== 마르코프 결정 프로세스 ===&lt;br /&gt;
;MDP; Markov Decision Process&lt;br /&gt;
* 특징&lt;br /&gt;
** Stochastic: 다음 결과는 확률적으로 결정됨&lt;br /&gt;
** Partially Observable: 전체 결정 과정을 조망할 수 없음&lt;br /&gt;
* 구성&lt;br /&gt;
** S: 상태들의 유한 집합&lt;br /&gt;
** A: 행동들의 유한 집합&lt;br /&gt;
** Policy = ㅠ(s) -&amp;gt; S&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
	<entry>
		<id>https://devhrxoobm.itwiki.kr/index.php?title=%ED%8C%8C%EC%9D%BC:%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5.png&amp;diff=4437</id>
		<title>파일:강화 학습.png</title>
		<link rel="alternate" type="text/html" href="https://devhrxoobm.itwiki.kr/index.php?title=%ED%8C%8C%EC%9D%BC:%EA%B0%95%ED%99%94_%ED%95%99%EC%8A%B5.png&amp;diff=4437"/>
		<updated>2019-10-28T11:56:24Z</updated>

		<summary type="html">&lt;p&gt;Aimaster: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Aimaster</name></author>
	</entry>
</feed>