• 메인으로 이동
    AD광고
    New행복을 선택하는 삶의 태도불행에 몰두하지 않는다
    AD광고
    New사랑과 우정으로 빛나는 모험프린세스 캐치 티니핑
    • 베스트
    • 소득공제
    • 무료배송
    • 절판

    단단한 심층강화학습 - 심층강화학습 기본 개념을 제대로 정리한 인공지능 교과서

    • 로라그레서,와룬켕 저
    • 김성우 역
    • 제이펍
    • 2022년 02월 17일
    10%27,00030,000
    적립금
    1,500원 (5% 적립)
    추가 적립
    추가 적립 안내
    • 5만원 이상 결제 시 (*배송비 제외)

      정가제FREE(상품/사은품) 금액이 2,000원 이상이면 2,000원 추가적립

    • 10만원 이상 결제 시 (*배송비 제외)

      정가제FREE(상품/사은품) 금액이 2,000원 이상이면 2,000원 추가적립

      정가제FREE(상품/사은품) 금액이 5,000원 이상이면 5,000원 추가적립

    결제혜택
    무이자 할부
    결제사 혜택
    쿠폰
    회원 가입 즉시 지급되는 적립금 과 등급별 다양한 회원 혜택 보기
    택배보다 빠른, 나우드림

    [네이버페이]

    상품 규격 정보
    상품상세정보
    ISBN ISBN-13 : 9791191600674
    쪽수428쪽
    크기기타 규격
    제품구성단행본
    이 책이 속한 분야
    • 컴퓨터/IT > 시스템공학
    관련 이벤트
    • 사은품

    이달의 리뷰왕

    2026.01.01 ~ 2026.12.31

    • 사은품

    신규가입시 최대 10,800원

    2025.12.31 ~ 2026.12.31

    • 사은품

    『유치원 Wars 17』 출간 기념 포토카드 증정!

    2026.09.01 ~ 2026.09.28

    • 사은품

    9월 특별선물 《영풍문고 리유저블백》

    2026.09.01 ~ 2026.09.30

    • 사은품

    이달의 리뷰왕

    2026.01.01 ~ 2026.12.31

    • 사은품

    신규가입시 최대 10,800원

    2025.12.31 ~ 2026.12.31

    • 사은품

    『유치원 Wars 17』 출간 기념 포토카드 증정!

    2026.09.01 ~ 2026.09.28

    • 사은품

    9월 특별선물 《영풍문고 리유저블백》

    2026.09.01 ~ 2026.09.30

    책 소개
    심층강화학습의 확고한 기반을 다지기 위한 완벽한 방법!
    지금 당장 활용할 수 있는 심층강화학습의 이론 및 실무를 소개합니다.


    이 책은 이론과 실무적 내용을 독특하게 결합한 심층강화학습 소개서입니다. 직관적인 설명에서 시작하여 심층강화학습 알고리즘에 대한 자세한 설명과 SLM Lab 라이브러리를 이용한 구현 방법으로 이어지고, 마지막으로는 심층강화학습을 실무에 적용하기 위한 세부 내용을 다룹니다.
    기본적인 기계학습 개념에 대한 이해와 파이썬을 다룰 줄 아는 컴퓨터과학 전공 학생 및 소프트웨어 엔지니어 모두에게 최선의 선택이 될 것입니다.

    목차
    옮긴이 머리말 xii
    베타리더 후기 xiii
    추천사 xv
    시작하며 xvi
    감사의 글 xxi

    CHAPTER 01 강화학습 소개 1
    1.1 강화학습 1
    1.2 MDP로서의 강화학습 7
    1.3 강화학습에서 학습하는 함수 11
    1.4 심층강화학습 알고리즘 13
    1.4.1 정책 기반 알고리즘 14
    1.4.2 가치 기반 알고리즘 15
    1.4.3 모델 기반 알고리즘 16
    1.4.4 결합된 방법 17
    1.4.5 이 책에서 다루는 알고리즘 18
    1.4.6 활성정책과 비활성정책 알고리즘 19
    1.4.7 요약 19
    1.5 강화학습을 위한 심층학습 20
    1.6 강화학습과 지도학습 22
    1.6.1 오라클의 부재 23
    1.6.2 피드백의 희소성 24
    1.6.3 데이터 생성 24
    1.7 요약 25

    PART I 정책 기반 알고리즘과 가치 기반 알고리즘
    CHAPTER 02 REINFORCE 29
    2.1 정책 30
    2.2 목적 함수 31
    2.3 정책 경사 31
    2.3.1 정책 경사 계산 33
    2.4 몬테카를로 표본추출 36
    2.5 REINFORCE 알고리즘 37
    2.5.1 향상된 REINFORCE 38
    2.6 REINFORCE 구현 39
    2.6.1 최소 형태의 REINFORCE 구현 39
    2.6.2 파이토치로 정책 생성하기 42
    2.6.3 행동 추출 44
    2.6.4 정책 손실 계산 45
    2.6.5 REINFORCE 훈련 루프 46
    2.6.6 활성정책 재현 메모리 47
    2.7 REINFORCE 에이전트의 훈련 50
    2.8 실험 결과 53
    2.8.1 실험: 할인율 ? 의 효과 53
    2.8.2 실험: 기준값의 효과 55
    2.9 요약 57
    2.10 더 읽을거리 57
    2.11 역사 58

    CHAPTER 03 살사(SARSA) 59
    3.1 Q 함수와 V 함수 60
    3.2 시간차 학습 63
    3.2.1 시간차 학습에 대한 직관 66
    3.3 살사의 행동 선택 73
    3.3.1 탐험과 활용 74
    3.4 살사 알고리즘 75
    3.4.1 활성정책 알고리즘 76
    3.5 살사의 적용 77
    3.5.1 행동 함수: 엡실론 탐욕적 77
    3.5.2 Q 손실의 계산 78
    3.5.3 살사 훈련 루프 80
    3.5.4 활성정책 배치 재현 메모리 81
    3.6 살사 에이전트의 훈련 83
    3.7 실험 결과 86
    3.7.1 실험: 학습률의 효과 86
    3.8 요약 87
    3.9 더 읽을거리 88
    3.10 역사 89

    CHAPTER 04 심층 Q 네트워크(DQN) 91
    4.1 DQN의 Q 함수 학습 92
    4.2 DQN의 행동 선택 94
    4.2.1 볼츠만 정책 97
    4.3 경험 재현 100
    4.4 DQN 알고리즘 101
    4.5 DQN의 적용 103
    4.5.1 Q 손실의 계산 103
    4.5.2 DQN 훈련 루프 104
    4.5.3 재현 메모리 105
    4.6 DQN 에이전트의 훈련 108
    4.7 실험 결과 111
    4.7.1 실험: 신경망 아키텍처의 효과 111
    4.8 요약 113
    4.9 더 읽을거리 114
    4.10 역사 114

    CHAPTER 05 향상된 DQN 115
    5.1 목표 네트워크 116
    5.2 이중 DQN 119
    5.3 우선순위가 있는 경험 재현(PER) 123
    5.3.1 중요도 표본추출 125
    5.4 수정된 DQN의 구현 126
    5.4.1 네트워크 초기화 127
    5.4.2 Q 손실의 계산 128
    5.4.3 목표 네트워크의 업데이트 129
    5.4.4 목표 네트워크를 갖는 DQN 130
    5.4.5 이중 DQN 130
    5.4.6 우선순위가 있는 경험 재현 131
    5.5 아타리 게임을 위한 DQN 에이전트의 훈련 137
    5.6 실험 결과 142
    5.6.1 실험: 이중 DQN과 PER의 효과 142
    5.7 요약 146
    5.8 더 읽을거리 146

    PART II 결합된 방법
    CHAPTER 06 어드밴티지 행동자-비평자(A2C) 149
    6.1 행동자 150
    6.2 비평자 150
    6.2.1 어드밴티지 함수 151
    6.2.2 어드밴티지 함수에 대한 학습 155
    6.3 A2C 알고리즘 156
    6.4 A2C의 구현 159
    6.4.1 어드밴티지 추정 160
    6.4.2 가치 손실과 정책 손실의 계산 162
    6.4.3 행동자-비평자 훈련 루프 163
    6.5 네트워크 아키텍처 164
    6.6 A2C 에이전트의 훈련 166
    6.6.1 n단계 이득을 이용한 A2C를 퐁 게임에 적용 166
    6.6.2 GAE를 이용한 A2C를 퐁 게임에 적용 169
    6.6.3 두 발 보행자 문제에서 n단계 이득을 이용한 A2C 170
    6.7 실험 결과 173
    6.7.1 실험: n단계 이득의 효과 173
    6.7.2 실험: GAE의 ?가 미치는 효과 175
    6.8 요약 176
    6.9 더 읽을거리 177
    6.10 역사 177

    CHAPTER 07 근위 정책 최적화(PPO) 179
    7.1 대리목적 180
    7.1.1 성능붕괴 180
    7.1.2 목적 함수의 수정 182
    7.2 근위 정책 최적화(PPO) 189
    7.3 PPO 알고리즘 193
    7.4 PPO의 구현 195
    7.4.1 PPO 정책 손실의 계산 195
    7.4.2 PPO 훈련 루프 196
    7.5 PPO 에이전트의 훈련 198
    7.5.1 퐁 게임을 위한 PPO 198
    7.5.2 두 발 보행자를 위한 PPO 201
    7.6 실험 결과 203
    7.6.1 실험: GAE의 ?가 미치는 효과 204
    7.6.2 실험: 클리핑 변수 ?의 효과 205
    7.7 요약 207
    7.8 더 읽을거리 208

    CHAPTER 병렬화 방법 209
    8.1 동기 병렬화 210
    8.2 비동기 병렬화 212
    8.2.1 호그와일드! 213
    8.3 A3C 에이전트의 훈련 216
    8.4 요약 219
    8.5 더 읽을거리 219

    CHAPTER 09 알고리즘 요약 221

    PART III 실전을 위한 세부사항
    CHAPTER 10 심층강화학습으로 작업하기 225
    10.1 소프트웨어 공학적 기법 226
    10.1.1 단위 테스트 226
    10.1.2 코드 품질 232
    10.1.3 깃 워크플로 233
    10.2 디버깅 팁 236
    10.2.1 생존 신호 236
    10.2.2 정책 경사에 대한 진단 237
    10.2.3 데이터에 대한 진단 238
    10.2.4 전처리기 239
    10.2.5 메모리 239
    10.2.6 알고리즘 함수 240
    10.2.7 신경망 240
    10.2.8 알고리즘 간소화 243
    10.2.9 문제 간소화 243
    10.2.10 하이퍼파라미터 244
    10.2.11 Lab 워크플로 244
    10.3 아타리 트릭 245
    10.4 심층강화학습 알마낵 249
    10.4.1 하이퍼파라미터 표 249
    10.4.2 알고리즘 성능 비교 252
    10.5 요약 255

    CHAPTER 11 SLM Lab 257
    11.1 SLM Lab에 구현된 알고리즘 257
    11.2 spec 파일 260
    11.2.1 검색 스펙 구문 262
    11.3 SLM Lab의 실행 265
    11.3.1 SLM Lab의 명령어 265
    11.4 실험 결과의 분석 266
    11.4.1 실험 데이터의 개요 266
    11.5 요약 268

    CHAPTER 12 네트워크 아키텍처 269
    12.1 신경망의 유형 269
    12.1.1 다층 퍼셉트론(MLP) 270
    12.1.2 합성곱신경망(CNN) 272
    12.1.3 회귀신경망(RNN) 274
    12.2 네트워크 그룹 선택을 위한 가이드 275
    12.2.1 MDP와 POMDP 275
    12.2.2 환경을 위한 네트워크 선정 279
    12.3 Net API 282
    12.3.1 입력과 출력 층위 모양의 추정 284
    12.3.2 네트워크의 자동 생성 286
    12.3.3 훈련 단계 289
    12.3.4 기반 메소드의 노출 290
    12.4 요약 291
    12.5 더 읽을거리 292

    CHAPTER 13 하드웨어 293
    13.1 컴퓨터 294
    13.2 데이터 유형 300
    13.3 강화학습에서 데이터 유형 최적화 302
    13.4 하드웨어의 선택 307
    13.5 요약 308

    CHAPTER 14 상태 311
    14.1 상태의 예제 312
    14.2 상태의 완결성 319
    14.3 상태의 복잡성 320
    14.4 상태 정보 손실 325
    14.4.1 이미지 그레이스케일링 325
    14.4.2 이산화 326
    14.4.3 해시 출동 327
    14.4.4 메타정보 손실 327
    14.5 전처리 331
    14.5.1 표준화 332
    14.5.2 이미지 처리 333
    14.5.3 시간적 전처리 335
    14.6 요약 339

    CHAPTER 15 행동 341
    15.1 행동의 예제 341
    15.2 행동의 완결성 345
    15.3 행동의 복잡성 347
    15.4 요약 352
    15.5 더 읽을거리: 일상에서의 행동 설계 353

    CHAPTER 16 보상 357
    16.1 보상의 역할 357
    16.2 보상 설계의 가이드라인 359
    16.3 요약 364

    CHAPTER 17 전이 함수 365
    17.1 실현 가능성 확인 366
    17.2 현실성 확인 368
    17.3 요약 371

    APPENDIX A 심층강화학습 타임라인 372
    APPENDIX B 환경의 예제 374
    B.1 이산적 환경 375
    B.1.1 CartPole-v0 375
    B.1.2 MountainCar-v0 376
    B.1.3 LunarLander-v2 377
    B.1.4 PongNoFrameskip-v4 378
    B.1.5 BreakoutNoFrameskip-v4 378
    B.2 연속 환경 379
    B.2.1 Pendulum-v0 379
    B.2.2 BipedalWalker-v2 380

    에필로그 381

    저자 소개
    저자 : 로라그레서,와룬켕

      옮긴이 김성우
      연세대학교 천문우주학과에서 인공위성 자세/궤도 제어에 지도학습을 적용한 연구로 박사학위를 받았고, 쎄트렉아이에서 인공위성 지상 시스템 엔지니어로 근무했다. 새로운 모험을 위해 트리마란에서 인공위성 분야 기획/연구에 참여했다. 현재는 한화시스템에서 인공위성 시스템 엔지니어로서 더 큰 모험을 즐기고 있다.

      도서리뷰 (0)
      이 책을 읽고 어떤 느낌을 받으셨나요? 리뷰를 남기고 다른 독자들과 함께 공유해보세요.

      등록된 리뷰가 없습니다

      첫번째 리뷰어가 되어주세요

      이 분야에서 요즘 뜨는 책
      에러가 무섭지 않게 되는 책 - 에러 잘 읽는 법부터 효율적으로 디버깅하고 디버깅이 쉬운 코드를 작성하는 법까지사쿠라바 히로유키, 모치즈키 고타로 | 제이펍
      AI혁신:개정판 - 나의 커리어를 높이는 스마트워크 전략박대형, 김상용, 차명일, 임성기 | 지식과감성
      인생 언리얼 5 프로젝트 교과서 - 언리얼 엔진으로 3D 이머시브 콘텐츠 개발이영호, 박원석, 박현상, 탁광욱, 이영훈, 김현진 | BM성안당
      비전공자를 위한 이해할 수 있는 파이썬 - 챗GPT 시대에 최적화된 파이썬 공부법최원영 | 티더블유아이지
      엔트리 인공지능 with 햄스터 로봇 - 개정판강윤지,박찬규,강성웅,김원유,심재민,김연구,홍성용,김경상,정인재 | 영진닷컴
      에러가 무섭지 않게 되는 책 - 에러 잘 읽는 법부터 효율적으로 디버깅하고 디버깅이 쉬운 코드를 작성하는 법까지사쿠라바 히로유키, 모치즈키 고타로 | 제이펍
      AI혁신:개정판 - 나의 커리어를 높이는 스마트워크 전략박대형, 김상용, 차명일, 임성기 | 지식과감성
      인생 언리얼 5 프로젝트 교과서 - 언리얼 엔진으로 3D 이머시브 콘텐츠 개발이영호, 박원석, 박현상, 탁광욱, 이영훈, 김현진 | BM성안당
      비전공자를 위한 이해할 수 있는 파이썬 - 챗GPT 시대에 최적화된 파이썬 공부법최원영 | 티더블유아이지
      엔트리 인공지능 with 햄스터 로봇 - 개정판강윤지,박찬규,강성웅,김원유,심재민,김연구,홍성용,김경상,정인재 | 영진닷컴
      에러가 무섭지 않게 되는 책 - 에러 잘 읽는 법부터 효율적으로 디버깅하고 디버깅이 쉬운 코드를 작성하는 법까지사쿠라바 히로유키, 모치즈키 고타로 | 제이펍
      AI혁신:개정판 - 나의 커리어를 높이는 스마트워크 전략박대형, 김상용, 차명일, 임성기 | 지식과감성
      인생 언리얼 5 프로젝트 교과서 - 언리얼 엔진으로 3D 이머시브 콘텐츠 개발이영호, 박원석, 박현상, 탁광욱, 이영훈, 김현진 | BM성안당
      이 분야의 화제의 신간
      혼자 공부하는 SQL with AI - AI와 함께 1:1 과외하듯 배우는 데이터베이스 자습서: SQLD 유형문제 수록 해설 강의 제공우재남 | 한빛미디어
      직장인을 위한 AI 에이전트 클로드 코워크 - 앤트로픽 공식 플러그인으로 익히는 32가지 실무 예제케이트리 | 제이펍
      이기적 컴퓨터활용능력 1급 필기+실기 올인원(2027대비)홍태성, 박윤정 | 영진닷컴
      AI 팀원을 고용한 회사는 다르게 일한다 - 부서별 업무별 챗GPT 실전 도입 가이드 영업 마케팅 인사 경영기획 백오피스 업무 경영자(모두의 AI)이케다 도모히로 | 길벗
      AI와 일하는 기술 - 성과를 만드는 365가지 AI 치트키최정혜, 김여립, 이동근, 뉴럴웨이브 | 한국경제신문
      혼자 공부하는 SQL with AI - AI와 함께 1:1 과외하듯 배우는 데이터베이스 자습서: SQLD 유형문제 수록 해설 강의 제공우재남 | 한빛미디어
      직장인을 위한 AI 에이전트 클로드 코워크 - 앤트로픽 공식 플러그인으로 익히는 32가지 실무 예제케이트리 | 제이펍
      이기적 컴퓨터활용능력 1급 필기+실기 올인원(2027대비)홍태성, 박윤정 | 영진닷컴
      AI 팀원을 고용한 회사는 다르게 일한다 - 부서별 업무별 챗GPT 실전 도입 가이드 영업 마케팅 인사 경영기획 백오피스 업무 경영자(모두의 AI)이케다 도모히로 | 길벗
      AI와 일하는 기술 - 성과를 만드는 365가지 AI 치트키최정혜, 김여립, 이동근, 뉴럴웨이브 | 한국경제신문
      혼자 공부하는 SQL with AI - AI와 함께 1:1 과외하듯 배우는 데이터베이스 자습서: SQLD 유형문제 수록 해설 강의 제공우재남 | 한빛미디어
      직장인을 위한 AI 에이전트 클로드 코워크 - 앤트로픽 공식 플러그인으로 익히는 32가지 실무 예제케이트리 | 제이펍
      이기적 컴퓨터활용능력 1급 필기+실기 올인원(2027대비)홍태성, 박윤정 | 영진닷컴
      이 분야의 새로 나온 도서
      클로드와 엑셀로 시작하는 AI 주식 투자 - 데이터 수집부터 대시보드 자동화와 투자 판단까지 나만의 AI 주식 비서 만들기LearnAI Team | 위키북스
      AI 광고 콘텐츠 제작법 - 기획 카피부터 촬영 제작 분석까지 AI 광고 제작 마스터하기김남훈, 임성희, 황성연 | 이은북
      AIED 인공지능 활용 교육(AI총서)김민지 | 커뮤니케이션북스
      AIED 인공지능 활용 교육(큰글자책)(AI총서)김민지 | 커뮤니케이션북스
      AI가 못하는 일(큰글자책)(인공지능총서)소병수 | 커뮤니케이션북스
      AI로 PR하기(인공지능총서)김태욱 | 커뮤니케이션북스
      AI로 PR하기(큰글자책)(인공지능총서)김태욱 | 커뮤니케이션북스
      이기적 정보처리기사 실기 최신문제집 2주 패스(2027 대비)고소현, 한진만 | 영진닷컴
      클로드와 엑셀로 시작하는 AI 주식 투자 - 데이터 수집부터 대시보드 자동화와 투자 판단까지 나만의 AI 주식 비서 만들기LearnAI Team | 위키북스
      AI 광고 콘텐츠 제작법 - 기획 카피부터 촬영 제작 분석까지 AI 광고 제작 마스터하기김남훈, 임성희, 황성연 | 이은북
      AIED 인공지능 활용 교육(AI총서)김민지 | 커뮤니케이션북스
      AIED 인공지능 활용 교육(큰글자책)(AI총서)김민지 | 커뮤니케이션북스
      AI가 못하는 일(큰글자책)(인공지능총서)소병수 | 커뮤니케이션북스
      AI로 PR하기(인공지능총서)김태욱 | 커뮤니케이션북스
      AI로 PR하기(큰글자책)(인공지능총서)김태욱 | 커뮤니케이션북스
      이기적 정보처리기사 실기 최신문제집 2주 패스(2027 대비)고소현, 한진만 | 영진닷컴
      교환/반품/환불
      반품/교환방법
      • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
      • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
      반품/교환 가능기간
      • 변심반품의 경우 수령 후 7일 이내
      • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
      반품/교환비용
      • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
      • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
      반품/교환 불가 사유
      • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
      • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
        예) 만화, 잡지, 수험서 및 문제집류
      • 복제가 가능한 상품 등의 포장을 훼손한 경우
        예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
      • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
      • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
      • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
      • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
      상품 품절
      • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
      소비자 피해보상
      환불지연에 따른 배상
      • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
      • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함
      공지사항
      • [이벤트 당첨자 발표] 9월 모두의 서가 이벤트 당첨자 안내
      • [공지사항] 스타필드마켓 월계 문구복합매장 그랜드 오픈 🎊 이벤트 안내!
      • [공지사항] 2026년 9월 1일 개인정보 처리방침 개정 안내(3.개인정보 처리, 항목, 보유기간)
      • [이벤트 당첨자 발표] 26년 8월 <이달의 작가> 댓글 이벤트 당첨자 안내
      • [공지사항] 폭우로 인한 거제·통영 지역 배송불가 안내 ('26년 8월 19일 09시 30분 기준)
      공지더보기