관리 메뉴

AI바라기의 인공지능

AI : 논문 리뷰 : Hierarchical Reinforcement Learning for Air-to-Air Combat 본문

논문리뷰

AI : 논문 리뷰 : Hierarchical Reinforcement Learning for Air-to-Air Combat

AI바라기 2026. 9. 18. 18:41


용어 설명

  • BFM (Basic Flight Maneuvers): 전투기 조종사가 근접 공중전(dogfighting) 시 사용하는 기초 비행 기동 기술.
  • WEZ (Weapons Engagement Zone): 기총 유효 사격 범위. 본 환경에서는 기수 전방 2도 원뿔각 및 거리 500~3000 ft 사이 공간으로 정의되며, 거리 역비례로 상대 체력에 초당 데미지를 가함.
  • Hard Deck: 최저 비행 고도 제한선 (본 환경에서는 1000 ft). 이 고도 아래로 떨어지면 즉시 체력이 0이 되어 패배 처리됨.
  • JSBSim: 6자유도(6-DOF) F-16 비행 역학을 시뮬레이션하는 오픈소스 고충실도(high-fidelity) 공기역학 엔진.
  • Gun Snap: 발사체 시뮬레이션 대신 상대 항공기를 기총 조준선(WEZ) 내 순간적으로 포착하는 기하학적 정렬 상태.
  • Track Angle / Adverse Angle: Track Angle은 자기 기수 벡터와 상대 기체 중심 간의 사잇각, Adverse Angle은 상대 꼬리 벡터와 자기 중심 간의 사잇각.
  • Policy Selector: 여러 특화된 low-level policy 중 현재 교전 컨텍스트에 최적인 policy를 주기적으로 선택(10 Hz)하는 계층형 상위 에이전트.
  • PHANG-MAN: 본 논문에서 제안한 2계층 계층형 에이전트 명칭 (Policy Hierarchy for Adaptive Novel Generation of MANeuvers).

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 공중전 강화학습 연구는 2D/저충실도 시뮬레이션 환경에 국한되거나, 고수준 매크로 기동(15개 이산 기동 등) 선택에 머물러 실제 비행 제어 입력을 직접 다루지 못함.
    • 단일 end-to-end 신경망은 탐색 공간이 지나치게 방대하고, 상대방의 변화무쌍한 전술(공격형, 방어형, 무작위 기동)에 적응적인 전술 모듈성을 확보하기 어려움.
  • 새로운 문제 정의 및 접근:
    • 6-DOF F-16 비행 제어면(에일러론, 엘리베이터, 러더, 스로틀)을 50 Hz로 직접 연속 제어(continuous control)하는 고충실도 환경에 도전.
    • 복잡한 교전 상황을 단일 정책으로 풀지 않고, 특정 전술 영역에 특화된 sub-policy들을 사전 학습한 뒤 최적의 정책을 문맥에 따라 동적 전환하는 2계층 Hierarchical Reinforcement Learning (HRL) 프레임워크 제시.

Key Contributions & Novelty

  • 2계층 모듈형 Hierarchical Reinforcement Learning (PHANG-MAN) 구축:
    • Low-level Policies (50 Hz): 3가지 특화 정책(Control Zone, Aggressive Shooter, Conservative Shooter)으로 구성되며, 동일한 3계층 MLP 구조로 직접 비행 제어면을 조작.
    • High-level Policy Selector (10 Hz): 현재 교전 맥락(상태 벡터)을 입력받아 최적의 low-level policy를 선택.
    • Novelty: Sub-policy를 사전 훈련한 후 가중치를 고정(frozen)한 상태에서 Policy Selector를 학습시킴으로써, 계층형 RL의 고질적 난제인 non-stationary policy 문제를 제거하고 전술의 재사용성 및 모듈성(modularity)을 확보.
  • 전투기 조종사 도메인 지식 기반의 Reward Shaping:
    • 무기 교전 영역(WEZ)에만 의존하는 sparse reward 문제를 해결하기 위해 Control Zone, 추적각(track angle), 접근 속도(closure rate), 고도 제한(hard deck penalty), 오버슈트 방지(too-close penalty) 등 다차원 보상 함수를 정교하게 설계.
  • 연속형 Soft Actor-Critic (SAC) 기반의 전술 선택 최적화:
    • Policy Selector의 이산 선택 문제를 이산 SAC 대신 연속형 SAC 출력에 argmax를 결합하는 방식으로 해결하여 더 뛰어난 최적화 안정성과 성능을 달성.
    • Maximum Entropy RL을 적용하여 높은 보상 영역에서는 결정론적(low entropy)으로, 미지의 영역에서는 다양한 기동 탐색(high entropy)을 유도.

Experimental Highlights

  • 대회 환경 및 설정:
    • DARPA AlphaDogfight Trials (ADT) 최종 라운드.
    • 환경: JHU-APL OpenAI Gym 인터페이스 + JSBSim F-16 6-DOF 동역학. 무노이즈 상태 정보, 50 Hz 연속 제어.
  • 주요 정량적 성과:
    • 전체 최종 2위 달성: 8개 기관(보잉, 록히드 마틴, 오로라 등) 중 Day 2 라운드로빈 2위 통과 후 Day 3 준결승에서 Aurora 승리(16W-0D-4L), 결승 진출하여 최종 2위.
    • USAF 무기교관 조종사 상대 5:0 완승: VR 콕핏을 탑재한 실제 F-16 무기교관 과정(Weapons Instructor Course) 졸업생과의 5전 전승(5W - 0L) 달성.
  • Policy Selector의 성능 우위 검증:
    • 단일 상대로 테스트 시 Policy Selector의 성능은 해당 상대에 특화된 최고 단일 low-level policy와 대등하거나 우수함.
    • 여러 상대(예: 자기 자신 vs 무작위 기동 에이전트 Randy)를 동시에 상대할 때, 상대 성향에 따라 선택 정책 비율을 극명히 달리하며 모든 단일 low-level policy의 승률을 유의미하게 상회함.

Limitations and Future Work

  • 명확한 한계점 (Limitations):
    • 킬 보상 부재 및 체력 인플레이션에 따른 전술적 결함: 학습 안정성을 위해 기체 체력을 10배로 증폭하고 적 체력 고갈에 대한 보너스(kill reward)를 누락함. 이로 인해 결승전(Heron 상대)에서 근거리(800 ft 이내) 헤드온 교전 시 즉각적인 킬을 노리지 않고 다음 턴의 위치적 우위를 위해 이탈하는 비효율 발생(유리한 상황에서 승리를 넘겨줌).
    • 완벽한 상태 정보 가설: 센서 노이즈가 없는 완벽한 환경 정보(oracle state)를 가정하여 실기체 탑재 시의 오차에 취약함.
  • 향후 연구 방향 (Future Work):
    • 현실 반영 시뮬레이션 고도화: Domain Randomization 기법, 부분 관측성(partial observability), 불완전 추정 정보, 센서 노이즈 추가.
    • 이기종 플랫폼 확장: F-16을 넘어 쿼드콥터, 소형 고정익 UAV, F-22 등 다양한 공기역학 모델로 알고리즘 전이 및 실기체(full-scale aircraft) 비행 시험 추진 (DARPA ACE 연계).

Overall Summary

본 논문은 DARPA AlphaDogfight Trials에서 F-16의 6자유도 연속 비행 제어를 성공적으로 수행한 2계층 계층형 강화학습(HRL) 에이전트 'PHANG-MAN'을 제안한다. 전문가 도메인 지식 기반으로 사전 학습된 3개의 전술 모듈(CZ, AS, CS)을 고정하고, 상위 Policy Selector가 Soft Actor-Critic을 통해 상황별 최적 정책을 10 Hz로 동적 선택하도록 구성하여 비정상성 문제를 극복했다. 이 시스템은 최종 대회 준우승 및 미 공군 F-16 탑건 교관 조종사 대상 5:0 완승을 기록함으로써, 복잡하고 위험한 실전 공중전 도메인에서 모듈형 HRL이 안전성과 적응성을 동시에 확보할 수 있는 유망한 경로임을 입증했다.


쉬운 설명

이 연구는 복잡한 공중전을 프로 골퍼가 상황에 맞춰 골프채를 골라 쓰는 방식에 비유할 수 있습니다.

비행기를 조종하는 방법을 매 순간 맨땅에서 전부 학습시키는 대신, '뒤를 끈질기게 쫓는 기술(드라이버)', '공격적으로 돌진해 유효타를 날리는 기술(아이언)', '무리하지 않고 거리를 재며 피하는 기술(퍼터)'을 가진 세 명의 전문 파일럿(Low-level policies)을 먼저 훈련시켜 완성해 둡니다. 그리고 그 위에 지휘관(Policy Selector)을 두어, "지금은 상대가 등을 보였으니 추격 기술을 쓰고, 정면으로 마주쳤을 땐 회피 기술을 써라"고 1초에 10번씩 가장 알맞은 기술을 골라 실행하도록 지시하는 원리입니다

 

 

 

Abstract

Artificial Intelligence(AI)는 최근 DARPA의 AlphaDogfight Trials(ADT)에서 입증되었듯이 국방 산업에서 핵심적인 요소가 되고 있습니다. ADT는 모의 공대공 전투에서 F-16을 조종할 수 있는 AI algorithms의 실현 가능성을 검증하고자 했습니다.

ADT 참가자로서 Lockheed Martin(LM)의 approach는 hierarchical architecture와 maximum-entropy reinforcement learning(RL)을 결합하고, reward shaping을 통해 전문가 지식을 통합하며, policies의 모듈성을 지원합니다.

이러한 approach는 최종 ADT 이벤트에서 총 8개 경쟁 팀 중 2위를 달성했으며, 매치 플레이에서 미 공군(USAF) F-16 Weapons Instructor Course 졸업생을 상대로 승리를 거두었습니다.

 

 

I. INTRODUCTION

더보기

DARPA가 설립한 Air Combat Evolution(ACE) 프로그램은 공대공 전투 autonomy를 발전시키고 이에 대한 신뢰를 구축하고자 합니다. 실전 배치에서 공대공 전투 autonomy는 현재 자동 조종 장치 및 지형 회피와 같은 rule-based systems로 제한되어 있습니다.

전투기 조종사 사회에서 가시거리 내 전투(근접 공중전, dogfighting)를 학습하는 것은 신뢰할 수 있는 편대원이 되기 위해 필요한 많은 기본 비행 기동(BFM)을 포함합니다. autonomous systems가 적 방공망 제압, 호위 및 거점 방어와 같이 더 복잡한 교전에서 효과적이기 위해서는 먼저 BFM을 숙달해야 합니다.

이러한 이유로 ACE는 고도화된 autonomous systems에 대한 신뢰를 구축하기 위한 출발점으로 dogfight를 선택했습니다. ACE 프로그램은 실제 실물 항공기를 통한 실비행 훈련으로 절정에 달합니다.

AlphaDogfight Trials(ADT)는 위험을 완화하기 위한 ACE 프로그램의 선행 단계로 신설되었습니다. ADT를 위해 8개 팀이 선정되었으며, 각 팀의 approaches는 rule-based systems부터 완전한 end-to-end machine learned architectures에 이르기까지 다양했습니다.

trials 전반에 걸쳐 각 팀은 고충실도 F-16 비행 역학 model 내의 1 vs 1 모의 dogfights에서 테스트되었습니다. 이러한 스크리미지는 DARPA가 제공한 다양한 행동을 수행하는 agents(예: 고속 수평 비행, 미사일 요격 임무 모사), 다른 경쟁 팀 agents, 그리고 숙련된 인간 전투기 조종사 등 다양한 적대적 agents를 상대로 치러졌습니다.

본 paper에서는 environment와 우리의 agent 설계를 제시하고, 대회 결과를 논의하며, 기술을 더욱 발전시키기 위해 계획된 future work를 개략적으로 설명할 것입니다.

우리의 approach는 hierarchical reinforcement learning(RL)을 사용하며 교전의 현재 context에 따라 동적으로 선택되는 일련의 특화된 policies를 활용합니다.

우리의 agent는 최종 토너먼트에서 2위를 차지했으며 매치 플레이에서 미 공군(USAF) F-16 Weapons Instructor Course 졸업생을 상대로 승리(5승 - 0패)했습니다.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

더보기

기존에는 공격과 방어의 극단적인 목표 상충
미세 비행 제어가 어렵고 거시적인 전술 판단이 어려움
그래서 지휘관 두고 전문 조종사를 아래에 둠 



CZ (Control Zone) 뒤잡기(선회전), 에너지 보존
AS (Aggressive) 헤드온 돌진, 순간 폭딜
CS (Conservative) 거리 유지 사격, 칼회피

3개 하위 모델 먼저 프리즈 시켜놓고 메인 모델 학습


메인 모델은 0.1초마다(10 Hz) "지금 전황에서는 1번(CZ), 2번(AS), 3번(CS) 중 누구를 출전시켜야 이길까?"를 시행착오(RL)를 겪으며 배움




하위 모델 학습
[1. 공중에 랜덤 스폰] 
       ↓
[2. 0.02초마다 관측 → 조종간 조작 → 채점 → 메모리에 저장] (50 Hz 반복)
       ↓ (동시에 백그라운드에서)
[3. 메모리에서 256개씩 꺼내서 MLP 가중치 수정 (공부)]
       ↓
[4. 격추/추락/300초 초과 시 리셋 후 1번으로 반복]



메인모델
비슷하게 함.




 

스킬 자율 발견의 부재

hrl의 포장을 쓴 단순 스위처

확장성 제로

하위 모델간 협업 시너지 상실

10배 체력 훈련 -> 자멸적 버릇

 

 

연구 관점으로 보나 엔지니어링 관점으로 보나 크게 부족한게 보임. 

2.5점 / 5점

 

 

 

 

 

 

Research Notes: Section I. INTRODUCTION

1. 연구 배경 및 동기 (Context & Motivation)

  • 목표: DARPA의 ACE(Air Combat Evolution) 프로그램의 일환으로 공대공 전투 autonomy 고도화 및 신뢰성(Trust) 검증.
  • 근접 공중전(Dogfight/BFM)에 집중한 이유:
    • 현재 실전 배치는 단순 autopilot, 지형 회피 등 rule-based system에 머물러 있음.
    • 복잡한 전술 임무(적 방공망 제압, 호위, 요격 등)를 수행하려면 조종사의 기본 비행 기동(BFM) 숙달이 선행 필수 요건임.
    • 따라서 복잡 임무 전 단계로서 autonomous system의 신뢰성을 입증할 최적의 출발점으로 1 vs 1 Dogfight를 채택.
  • ADT(AlphaDogfight Trials):
    • 실물 항공기 실비행(Live flight) 이전에 위험 요소를 줄이기 위한 시뮬레이션 선행 대회.
    • 총 8개 팀 참가 (rule-based부터 end-to-end ML 방식까지 경쟁).
    • 고충실도(High-fidelity) F-16 비행 역학 model 환경에서 다각적 벤치마크 수행: DARPA baseline agents, 타 참가팀 agents, 인간 베테랑 조종사.

2. 핵심 제안 기법 (Core Methodology)

  • Hierarchical Reinforcement Learning (HRL):
    • 단일 end-to-end 학습의 불안정성이나 복잡한 교전 상태 처리 한계를 극복하기 위해 계층형 구조 도입.
  • Dynamic Context-aware Policy Selection:
    • 교전 상황의 dynamic context에 따라 여러 개의 specialized policies를 실시간으로 선택 및 전환하는 아키텍처 구축.

3. 주요 성과 (Key Empirical Results)

  • 대회 최종 성적: 8개 팀 중 최종 2위 달성.
  • 인간 전문가 대결: 미 공군(USAF) 최정예 F-16 비행교관과정(Weapons Instructor Course) 졸업생과의 실전 매치에서 5전 전승(5W - 0L) 기록.

쉬운 설명 :

비행기가 스스로 날아다니는 자율비행 기술은 지금도 있지만, 대부분 정해진 경로를 따라가거나 장애물을 피하는 단순 규칙(Rule) 수준에 멈춰 있습니다. 비행기들이 꼬리에 꼬리를 물고 싸우는 근접 공중전(Dogfight)은 전투기 조종사가 배우는 가장 기초적이면서도 순발력이 필요한 비행 기술입니다. 앞으로 더 어려운 임무(적 기지 파괴, 아군 호위 등)를 인공지능에 맡기려면, 이 기초적인 공중전부터 제대로 해낼 수 있어야 사람들이 인공지능을 믿을 수 있습니다.

그래서 미국 국방부(DARPA)가 실제 전투기에 AI를 태우기 전에, 고성능 F-16 시뮬레이터 안에서 공중전 대회를 열었습니다. 이 논문의 연구팀은 상황에 맞춰 전문화된 전략들을 골라 쓰는 계층형 강화학습(Hierarchical RL) 방식을 개발해 대회에 나갔고, 전체 8개 팀 중 2위를 차지함은 물론 미 공군 최고 실력의 베테랑 교관 파일럿과의 대결에서도 5대 0으로 완승을 거두었습니다.

 

 

 

 

II. RELATED WORK

더보기

1950년대 이래로 공중전을 autonomously 수행할 수 있는 algorithms를 구축하는 방법에 대한 연구가 진행되어 왔습니다. 일부 연구자들은 rule-based methods로 문제에 접근하여, 다양한 위치적 context에서 적용할 대응 기동을 공식화하기 위해 전문가 지식을 사용했습니다. 또 다른 탐구들은 공대공 시나리오를 계산적으로 해결해야 할 optimization problem으로 다양한 방식으로 체계화했습니다.

일부 연구는 이산적인 action 집합에 대해 효용 함수를 구축하는 game theory approaches에 의존하는 반면, 다른 approaches는 다양한 형태의 dynamic programming(DP)을 활용합니다. 이러한 논문 중 다수는 합리적인 시간 내에 거의 최적에 가까운 해에 도달하기 위해 environment와 algorithm의 복잡성 간에 상충 관계(trade-offs)를 설정합니다. 주목할 만한 연구로는 AFSIM environment에서 미 공군 무기 학교 졸업생을 격파할 수 있는 agent를 개발하기 위해 Genetic Fuzzy Trees를 사용한 사례가 있습니다.

보다 최근에는 deep reinforcement learning(RL)이 이 문제 영역에 적용되었습니다. 예를 들어, 한 연구는 15개의 discrete maneuvers 모음 중에서 선택하는 agent를 맞춤형 3-D environment에서 trained하여 인간을 격파할 수 있었습니다. 다른 연구는 AFSIM environment에서 다양한 learning algorithms와 시나리오를 평가했습니다. 전반적으로 조사된 많은 deep RL approaches는 충실도나 차원이 낮은 simulation environments를 활용하거나, action space를 high-level의 행동 또는 전술로 추상화했습니다.

ADT simulation environment는 다른 많은 연구들과 비교할 때 독보적으로 높은 충실도를 지닙니다. 이 environment는 6자유도(six degrees of freedom)를 갖춘 F-16 항공기의 비행 역학 model을 제공하며, 비행 제어 시스템으로 직접 입력되는 신호를 수용합니다. 이 model은 공기역학을 모델링하는 데 있어 매우 정밀하다고 널리 인정받는 open-source 소프트웨어인 JSBSim에서 구동됩니다. 본 연구에서는 이 environment에서 대단히 경쟁력 있는 전술을 보여주는 RL agent의 설계를 개략적으로 설명합니다.

 

 

Research Notes: Section II. RELATED WORK

1. 선행 연구 패러다임의 변천 및 한계 (Historical Context & Trade-offs)

  • Rule-based & Expert Knowledge (1950s~):
    • 특정 기하학적/위치 context에 대응하는 기동을 하드코딩. 동적 전투 상황에서의 확장성 부재.
  • Optimization, Game Theory & Dynamic Programming:
    • 공대공 교전을 최적화 문제로 정식화하거나 이산 행동 집합에 대한 utility function 정의.
    • 한계: 연산 복잡도 문제로 인해 simulation 환경의 단순화나 알고리즘 복잡도 간의 강한 타협(trade-offs)이 불가피했음.
  • Genetic Fuzzy Trees (AFSIM):
    • 미 공군 무기 학교 졸업생을 격파한 바 있으나 퍼지 로직 기반의 규칙 구조에 의존.
  • Deep Reinforcement Learning (최근 흐름):
    • 맞춤형 3D 환경(예: 15개 discrete 기동 선택 체계)이나 AFSIM에서 적용.
    • 핵심 한계 (Research Gap): 기존 DRL 연구 대다수는 저충실도/저차원 환경을 사용하거나, action space를 단순화된 high-level 기동 단위로 추상화하여 실제 비행 제어 역학을 반영하지 못함.

2. 본 연구 환경의 차별성 (Environment Distinction: ADT vs. Prior Works)

  • 초고충실도(Ultra-High Fidelity):
    • 단순화된 가상 환경이 아닌 정밀 공기역학 엔진인 JSBSim(open-source) 기반 구동.
  • 6자유도(6-DoF) 비행 역학 model:
    • 항공기의 병진 및 회전 운동을 모두 반영하는 완전한 F-16 물리 모델 제공.
  • 직접 제어 입력(Direct Flight Control Inputs):
    • 추상화된 high-level 매크로 기동 명령(예: '우회전', '루프')이 아닌, 실제 비행 제어 시스템(FCS)에 인가되는 저수준 제어 입력(stick, rudder, throttle 등)을 직접 action space로 수용.
  • 목표: 이러한 고충실도 및 연속 제어 환경의 복잡성을 극복하는 고성능 RL agent 설계.

쉬운 설명 :

비행기 공중전 AI는 1950년대부터 연구되어 왔습니다. 과거에는 전문가의 노하우를 그대로 코드로 짠 규칙 기반 방식이나, 수학적 계산을 줄이기 위해 상황을 아주 단순화한 모델들을 주로 썼습니다. 최근에는 딥러닝 기반 강화학습(RL)도 시도되었지만, 대부분 게임처럼 단순한 3D 환경에서 비행하거나 조종 명령도 '좌회전', '상승' 같은 몇 가지 정해진 큰 동작(버튼 누르기식)만 골라 쓰도록 제약을 두었습니다.

하지만 이번 DARPA 대회(ADT)의 환경은 완전히 다릅니다. 실제 비행기 설계에 쓰이는 정밀 물리 엔진(JSBSim)을 사용해 6자유도(앞뒤, 좌우, 상하 이동 및 모든 회전)를 완벽히 재현한 F-16 비행기를 다룹니다. AI가 단순 명령을 내리는 게 아니라 실제 조종사처럼 비행 조종간(스틱, 페달, 엔진 출력)을 직접 미세하게 조종해야 합니다. 이 논문은 이렇게 현실과 거의 똑같이 복잡하고 정밀한 시뮬레이션 환경에서 인간 최고수를 이길 수 있는 강화학습 구조를 만들어냈다는 점이 핵심입니다.

 

 

 

III. BACKGROUND

더보기

 

A. Reinforcement Learning

넓은 의미에서 agent는 센서를 통해 environment를 인지하고 actuator를 통해 해당 environment에 작용하는 모든 것으로 정의될 수 있습니다. reinforcement learning(RL) agent는 수치적인 reward signal을 극대화하기 위해 무엇을 해야 하는지, 어떤 actions를 취해야 하는지 학습하는 것을 목표로 합니다. reward signals는 environment에 의해 제공되며 학습은 시행착오를 통해 반복적인 방식으로 수행됩니다. 따라서 reinforcement learning은 supervised learning 및 unsupervised learning 모두와 다릅니다.

supervised learning은 외부 감독자가 제공하는 레이블이 지정된 예시들의 training set에서 수행됩니다. unsupervised learning은 레이블을 사용하지 않고 대신 데이터에서 숨겨진 구조를 찾는 것을 목표로 합니다. reinforcement learning은 학습 샘플에 레이블이 지정된다는 점에서 supervised learning과 유사하지만, agent가 학습함에 따라 simulation environment와의 상호작용을 기록함으로써 동적으로 수행된다는 차이가 있습니다.

reinforcement learning의 주요 과제 중 하나는 exploration과 exploitation 사이의 균형(trade-off)을 관리하는 것입니다. RL agent가 actions를 통해 environment와 상호작용함에 따라 결국 높은 reward를 반환하는 선택들을 학습하기 시작합니다. 자연스럽게 수신하는 reward를 극대화하기 위해 agent는 높은 rewards를 낳았던 actions를 선택함으로써 이미 학습한 것을 활용(exploit)해야 합니다.

그러나 optimal actions를 발견하기 위해 agent는 위험을 감수하고 현재의 최고 가치 actions보다 더 높은 rewards로 이어질 수 있는 새로운 actions를 탐색(explore)해야 합니다. 가장 널리 쓰이는 approach는 $\epsilon$-greedy 전략으로, 여기서 agent는 $0 < \epsilon < 1$ 확률로 무작위 action을 선택하거나, $1 - \epsilon$ 확률로 가장 높은 가치를 지닌 action을 탐욕적으로(greedily) 선택합니다. 직관적으로 agent는 초기에 더 많이 탐색해야 하며 training이 진행됨에 따라 더 많이 활용하기 시작해야 합니다.

그러나 최적의 탐색 방법을 아는 것은 단순하지 않고 environment에 따라 달라지며 여전히 활발한 연구 분야입니다. RL의 또 다른 흥미롭고 도전적인 측면은 actions가 즉각적인 rewards뿐만 아니라 후속 rewards에도 영향을 미칠 수 있다는 점입니다. 따라서 RL agent는 즉각적인 rewards와 지연된 rewards 사이의 균형을 맞추는 법을 배워야 합니다.

B. Markov Decision Processes

Markov decision process(MDP)는 순차적 의사결정 문제를 모델링하기 위한 수학적 형식론을 제공합니다. MDP는 상태 집합 $S$, 행동 집합 $A$, 전이 함수 $T$, 보상 함수 $R$로 구성되며, 튜플 $\langle S, A, T, R \rangle$을 형성합니다. 임의의 상태 $s \in S$가 주어졌을 때 action $a \in A$를 선택하면 전이 확률 $T(s, a, s') \in [0, 1]$을 통해 environment를 새로운 상태 $s' \in S$로 이끌고 reward $R(s, a)$를 반환합니다.

확률적 policy $\pi : S \rightarrow A$는 상태로부터 가능한 각 action을 선택할 확률로의 매핑이며, 여기서 $\pi(a\vert{}s)$는 상태 $s$가 주어졌을 때 action $a$를 선택할 확률을 나타냅니다. 목표는 가장 높은 기대 보상 합을 제공하는 optimal policy $\pi^*$를 찾는 것입니다.

$$\pi^* = \arg\max_{\pi} \mathbb{E}_{\pi} \left( \sum_{t}^{H} \gamma^t r_{t+1} \mid s_0 = s \right), \quad (1)$$

여기서 $\gamma \in [0, 1]$는 discount factor이고, $H$는 time horizon이며, $r_t$는 $R(s = s_t, a = a_t)$의 축약 표현입니다. value function은 policy $\pi$를 따를 때 상태 $s$에서의 기대 미래 reward로 정의됩니다:

$$V^{\pi}(s) = \mathbb{E}_{\pi} \left[ \sum_{t}^{H} \gamma^t r_{t+1} \mid s_0 = s \right].$$

작은 $\gamma$ 값은 agent가 단기적 rewards에 집중하도록 이끄는 반면, 더 큰 값은 장기적 rewards에 집중하도록 만듭니다. horizon $H$는 MDP에서의 스텝 수를 의미하며, $H = \infty$는 무한 horizon 문제를 나타냅니다. 만약 MDP가 특정 목표에서 종료된다면 이를 episodic task라고 부르며, 마지막 상태를 terminal이라 부르고 $1$에 가까운 $\gamma$ 값이 권장됩니다.

value function과 관련된 중요한 개념은 action-value function으로, 다음과 같이 정의됩니다.

$$Q^{\pi}(s, a) = \mathbb{E}_{\pi} \left( \sum_{t}^{H} \gamma^t r_{t+1} \mid s_0 = s, a_0 = a \right). \quad (2)$$

Q-function을 추정하는 것은 optimal policy를 계산하기 위해 전이 함수를 알 필요가 없으므로 model-free approach라고 하며, 많은 RL algorithms의 핵심 구성요소입니다.

environment의 완전한 model(즉, reward 및 전이 확률)을 사용할 수 있는 경우 Dynamic Programming(DP)을 사용하여 optimal policy 및 관련 optimal value function을 추정할 수 있습니다. 그렇지 않은 유한 horizon episodic tasks의 경우 Monte Carlo(MC) methods를 사용하여 기대 rewards를 추정할 수 있지만, value function을 추정하고 policy를 업데이트하기 위해 전체 에피소드를 시뮬레이션해야 하므로 수렴하는 데 방대한 양의 샘플이 필요할 수 있습니다.

RL에서 MDP는 전통적으로 temporal difference(TD)라고 불리는 approach를 사용하여 해결되며, 이 방식에서는 DP처럼 스텝별로, MC처럼 원시 데이터로부터 전이 함수를 요구하지 않고 value function을 직접 추정합니다.

C. Maximum Entropy Reinforcement Learning

앞서 논의한 바와 같이 학습 중 새로운 actions를 탐색하는 최적의 방법을 찾는 것은 단순하지 않습니다. maximum entropy RL 이론은 이 특별한 과제를 해결하기 위한 원리적 방식을 제공하며, 최근 여러 RL 발전의 핵심 요소였습니다.

표준 MDP 문제에서와 마찬가지로 maximum entropy RL의 목표는 가장 높은 기대 보상 합을 제공하는 optimal policy $\pi^*$를 찾는 것이지만, 추가적으로 방문한 각 상태의 entropy를 극대화하는 것을 목표로 합니다.

$$\pi^* = \arg\max_{\pi} \mathbb{E}_{\pi} \left( \sum_{t}^{H} r_{t+1} + \alpha \mathcal{H}(\pi) \mid s_0 = s \right), \quad (3)$$

여기서 $\alpha$는 optimal policy의 확률성을 제어하는 temperature parameter이며, $\mathcal{H}(\pi)$는 policy의 entropy를 나타냅니다. 이것의 이면에 있는 직관은 가장 다양한 actions 분포를 제공하면서 동시에 가장 높은 누적 reward를 반환하는 policy를 찾는 것이며, 이것이 궁극적으로 exploration을 촉진합니다.

흥미롭게도 이 approach는 상태별(state-wise) exploitation과 exploration 간의 균형을 가능하게 합니다. 높은 reward를 갖는 상태에 대해서는 낮은 entropy policy가 허용되는 반면, 낮은 reward를 갖는 상태에 대해서는 높은 entropy policies가 선호되어 더 큰 exploration으로 이어집니다.

수식에서 discount factor $\gamma$는 maximum entropy의 경우 표현식이 더 복잡해지기 때문에 단순화를 위해 생략되었습니다. 그러나 무한 horizon 문제의 수렴을 위해 필요하며, 우리의 최종 algorithm에 포함되어 있습니다.

Maximum entropy RL은 개념적 및 실용적 이점을 지닙니다. entropy 항은 policy가 더 넓게 탐색하도록 유도하며, 준최적(near-optimal) 행동도 가능하게 합니다. 예를 들어 agent는 exploration을 제한하는 단일 action보다 동일하게 매력적인 두 action(더 높은 entropy) 쪽으로 편향을 둘 것입니다. 실제 적용에 있어서 개선된 exploration과 더 빠른 학습이 많은 선행 연구에서 보고되었습니다.

D. Actor-Critic Methods

RL 문헌에는 value-based 및 policy-based methods라는 두 가지 주요 agent training algorithms 유형이 있습니다. 첫 번째 그룹에는 Q-learning 및 deep Q-networks(DQN)와 같은 algorithms가 있으며, 이들 방식에서는 먼저 TD를 사용하여 각 Q-functions를 계산함으로써 optimal policies를 추정합니다.

DQN에서는 고차원 state spaces에 걸쳐 비선형 Q-function approximators로 deep neural networks(DNN)가 사용됩니다. Q-function으로부터 optimal policy를 계산하는 것은 이산적인 경우에는 직관적이지만, continuous action space에서는 추가적인 optimization 단계가 수반되므로 비실용적일 수 있습니다.

policy-based methods에서는 objective function을 정의하고 파라미터를 통해 이를 극대화함으로써 optimal policy를 직접 추정합니다. 따라서 파라미터를 반복적으로 업데이트하기 위해 gradients 계산이 수반되므로 policy gradient methods로도 알려져 있습니다. 이 범주에는 REINFORCE, deterministic policy gradient(DPG), trust region policy optimization(TRPO), proximal policy optimization(PPO) 및 기타 다수가 포함됩니다.

Actor-Critic(AC)은 value-based 및 policy-based approaches의 장점을 결합한 policy gradient method입니다. 파라메트릭 policy model은 actor로 알려져 있으며 actions를 선택하는 역할을 담당합니다. 반면 추정된 value function은 actor가 수행한 actions를 비판(평가)하는 critic입니다.

REINFORCE와 같은 표준 policy gradient methods에서는 전체 에피소드를 실행(rolling-out)하여 얻은 실제 누적 reward $G_t$로 policy 분포를 가중하여 model 파라미터를 업데이트합니다:

$$\theta \leftarrow \theta + \eta \gamma^t G_t \nabla_{\theta} \ln \pi_{\theta}(a_t \mid s_t)$$

여기서 $\theta$는 model 파라미터를 나타냅니다. Actor-critic methods에서는 특정 변형에 따라 가중치 $G_t$가 $Q(s, a)$, $V(s)$, 또는 advantage function $A(s, a) = Q(s, a) - V(s)$로 대체됩니다. 중요하게도 이러한 수정을 통해 policy와 value-function 파라미터를 반복적이고 효율적으로 업데이트할 수 있습니다.

Deep deterministic policy gradient(DDPG)는 가장 인기 있고 성공적인 AC methods 중 하나입니다. DDPG는 두 개의 neural networks(policy 및 value-function)를 추정하는 model-free 및 off-policy method(파라미터 업데이트가 현재 policy와 무관한 샘플을 사용하여 수행됨)입니다. DQN methods와 마찬가지로 DDPG는 파라미터 업데이트를 안정화하기 위해 replay buffer를 사용하지만 continuous action spaces를 가진 policies를 학습하며, 다음 섹션에서 제시되는 soft actor-critic과 밀접한 관련이 있습니다.

E. Soft Actor-Critic

Soft Actor-Critic(SAC)은 가장 성공적인 maximum entropy 기반 methods 중 하나이며, 생성 이후 대부분의 RL 라이브러리에서 일반적인 baseline algorithm이 되었고, 많은 environments에서 DDPG 및 PPO와 같은 state-of-the-art methods를 능가했습니다.

DDPG approach와 마찬가지로 SAC은 policy와 value functions가 neural networks를 사용하여 근사되는 model-free 및 off-policy method이지만, 추가적으로 soft Q-learning과 유사하게 exploration을 장려하는 policy entropy 항을 objective function에 통합합니다. SAC은 DDPG에 비해 sample efficient하고 안정적인 method로 알려져 있습니다.

수식 (3)에 표현된 바와 같이, SAC policy/actor는 특정 상태에서 기대 누적 reward와 action entropy를 극대화하는 목표로 trained됩니다. critic은 soft Q-function이며 Bellman equation에 따라 다음과 같이 표현됩니다:

$$Q(s_t, a_t) = r_t + \gamma \mathbb{E}_{\rho_{\pi}(s)} [V(s_{t+1})], \quad (4)$$

여기서 $\rho_{\pi}(s)$는 policy $\pi(a\vert{}s)$에 의해 유도된 state marginal을 나타내며, soft value function은 Q-function에 의해 파라미터화됩니다:

$$V(s_{t+1}) = \mathbb{E}_{a_t \sim \pi} [Q(s_{t+1}, a_{t+1}) - \alpha \log \pi(a_{t+1} \mid s_{t+1})]. \quad (5)$$

soft Q-function은 예측된 state-action values와 관측된 state-action values 사이의 평균 제곱 오차로 주어지는 다음 objective function을 최소화하도록 trained됩니다:

$$J_Q = \mathbb{E}_{(s_t, a_t) \sim \mathcal{D}} \left[ \frac{1}{2} \left( Q(s_t, a_t) - (r_t + \gamma \mathbb{E}_{\rho_{\pi}(s)} [\bar{V}(s_{t+1})]) \right)^2 \right], \quad (6)$$

여기서 $(s_t, a_t) \sim \mathcal{D}$는 replay buffer에서 샘플링된 state-action을 나타내며, $\bar{V}$는 target value function입니다.

마지막으로 policy는 policy와 지수화된(exponentiated) state-action value function 사이의 KL-divergence를 최소화함으로써 업데이트되며(이는 수렴을 보장함), 다음과 같이 표현될 수 있습니다:

$$J_{\pi} = \mathbb{E}_{s_t \sim \mathcal{D}} [\mathbb{E}_{a_t \sim \pi} [\alpha \log \pi(a_t \mid s_t) - Q(s_t, a_t)]], \quad (7)$$

여기서 핵심 아이디어는 action 분포와 state-action 분포 사이의 발산(divergence)을 최소화하는 것입니다.

SAC algorithm은 초기 논문에서 제시된 바와 같이 environment, reward scale 및 training stage에 따라 $\alpha$ temperature 변화에 민감합니다. 이 문제를 해결하기 위해 동일한 저자들에 의해 temperature parameter를 자동으로 조정하는 중요한 개선책이 제안되었습니다.

이제 문제는 maximum entropy RL optimization으로 정식화되지만 최소 entropy 제약 조건을 충족해야 합니다. 따라서 optimization은 기대 누적 return을 극대화하면서 동시에 기대 entropy를 최소화하는 dual objective approach를 사용하여 수행됩니다.

실제로는 앞서 설명한 대로 soft Q-function과 policy networks가 업데이트되며, $\alpha$ temperature function은 다음 objective를 갖는 neural network에 의해 근사됩니다:

$$J_{\alpha} = \mathbb{E}_{a_t \sim \pi_t} [-\alpha \log \pi_t(a_t \mid s_t) - \alpha \mathcal{H}_0], \quad (8)$$

여기서 $\mathcal{H}_0$는 원하는 최소 기대 entropy입니다. 자세한 내용은 관련 논문에서 확인할 수 있습니다. SAC algorithm은 다음 단계로 요약될 수 있습니다:

Algorithm 1: Soft Actor Critic

Q, policy 및 $\alpha$ network parameters 초기화;

target Q-network weights 초기화;

replay buffer $\mathcal{D}$ 초기화;

각 episode마다 반복:

각 environment step마다 반복:

policy $\pi(a_t\vert{}s_t)$로부터 action 샘플링,

environment로부터 다음 상태 $s_{t+1}$ 및 reward $r_t$ 획득,

그리고 튜플 $(s_t, a_t, r_t, s_{t+1})$을 $\mathcal{D}$에 추가;

종료

각 gradient step마다 반복:

$\mathcal{D}$로부터 batch memories를 샘플링하고

Q-network(수식 6), policy(수식 7),

temperature parameter $\alpha$(수식 8),

그리고 target network weights 업데이트(soft-update).

종료

종료

F. Hierarchical Reinforcement Learning

복잡한 작업을 더 작은 하위 작업으로 나누는 것은 고전적인 분할 정복(divide-and-conquer) algorithms부터 action planning의 하위 목표 생성에 이르기까지 많은 approaches의 핵심입니다. RL에서 상태 시퀀스의 temporal abstraction은 문제를 semi-Markov Decision Process(SMDP)로 다루는 데 사용됩니다. 기본적으로 핵심 아이디어는 primitive actions로 구성된 macro-actions(routines)를 정의하는 것이며, 이를 통해 다양한 수준의 추상화 단계에서 agent를 모델링할 수 있습니다.

이러한 approach는 hierarchical RL로 알려져 있으며, 인간과 동물의 학습이 갖는 계층적 구조와 유사성을 지니고, option-learning, universal value functions, option-critic, FeUdal networks, HIRO로 알려진 data-efficient hierarchical RL 등 RL 분야의 중요한 발전을 이끌어 냈습니다. hierarchical RL을 사용하는 주요 이점은 transfer learning(이전에 학습된 기술과 하위 작업을 새로운 작업에서 재사용), scalability(큰 문제를 더 작은 문제로 분해하여 고차원 state spaces에서 발생하는 차원의 저주 방지) 및 generalization(더 작은 하위 작업의 조합을 통해 새로운 기술 생성을 가능하게 하여 과도한 전문화 방지)입니다.

policy selector를 사용하는 우리의 approach는 options learning algorithms와 유사하며, 새로운 작업을 수행하기 위해 sub-policies가 계층적으로 구성되는 선행 연구의 methods와 밀접한 관련이 있습니다. 해당 연구에서 sub-policies는 유사한 environments이지만 서로 다른 tasks에서 pre-trained된 primitives입니다.

우리의 policy selector(선행 연구의 master policy에 해당)는 low-level policies라 부르는 pre-trained된 일련의 specialized policies가 주어졌을 때 global reward를 최적화하도록 학습합니다. 그러나 meta-learning에 중점을 두었던 이전 연구와 달리, 우리의 주된 목표는 low-level policies 사이를 동적으로 전환함으로써 서로 다른 상대들에 맞서 최적으로 dogfight를 수행하는 법을 배우는 것입니다.

추가적으로 environment와 작업의 복잡성을 고려하여 우리는 policy selector와 sub-policies의 training을 번갈아 반복하지 않습니다. 즉, policy selector를 training하는 동안 sub-policy agents의 파라미터는 업데이트되지 않습니다.

 

 

 

 

Research Notes: Section III. BACKGROUND (Comprehensive Summary)

A. Reinforcement Learning (기초 학습 프레임워크)

  • 상호작용 패러다임:
    • Agent는 센서를 통해 상태를 관측하고 Actuator를 통해 Action을 수행하며, 환경이 피드백하는 스칼라 Reward signal을 최대화하도록 시행착오(Trial-and-error)를 통해 학습.
    • Supervised/Unsupervised와의 본질적 차이: 고정 데이터셋 기반이 아닌, 시뮬레이션 상호작용 과정에서 상태-행동-보상 튜플이 동적으로 수집 및 레이블링됨.
  • Exploration vs. Exploitation Trade-off:
    • 기존 고보상 행동을 선택(Exploit)하는 것과 더 우수한 잠재적 행동을 발견(Explore)하는 것 간의 본질적 충돌.
    • $\epsilon$-greedy 방식(확률 $\epsilon$으로 무작위 탐색, $1-\epsilon$으로 탐욕적 선택)의 한계: 탐색 스케줄링이 휴리스틱하며, 환경 복잡도에 따라 비효율적임.
  • Delayed Reward 문제: 현재의 기동(Action)이 즉각적인 결과뿐 아니라 장기적인 전투 궤적과 기하학적 위치 우위에 영향을 미치므로, 단기-장기 보상 간의 최적 상충 관계 학습이 필수적임.

B. Markov Decision Processes (MDP 정식화)

  • 수학적 정의: 튜플 $\langle S, A, T, R \rangle$ (상태 공간 $S$, 행동 공간 $A$, 상태 전이 확률 $T(s, a, s')$, 보상 함수 $R(s, a)$).
  • 목표 함수 및 Value Functions:
    • 최적 Policy $\pi^*$:
    • $$\pi^* = \arg\max_{\pi} \mathbb{E}_{\pi} \left( \sum_{t}^{H} \gamma^t r_{t+1} \mid s_0 = s \right)$$
    • 상태 가치 함수 $V^{\pi}(s)$ 및 행동 가치 함수 $Q^{\pi}(s, a)$:
    • $$Q^{\pi}(s, a) = \mathbb{E}_{\pi} \left( \sum_{t}^{H} \gamma^t r_{t+1} \mid s_0 = s, a_0 = a \right)$$
  • 해법 및 모델 특성:
    • Model-Free: 환경 전이 확률 $T$를 사전에 명시적으로 알 필요 없이 샘플 경로로부터 직접 Q-function을 추정.
    • DP vs. MC vs. TD:
      • DP: 환경 전이 확률의 완전한 모델이 필요하여 고차원 공중전 환경에 적용 불가능.
      • MC: 에피소드 종료 시점까지 전체 궤적을 롤아웃해야 하므로 분산이 크고 수렴에 방대한 샘플 필요.
      • TD(Temporal Difference): 원시 데이터(MC의 장점)로부터 스텝 단위 부트스트래핑(DP의 장점)으로 가치 함수를 효율적으로 추정.

C. Maximum Entropy Reinforcement Learning (최대 엔트로피 RL)

  • 목적 함수 확장:
    • 단순 누적 보상 극대화에 Policy 엔트로피 $\mathcal{H}(\pi)$ 극대화 항을 결합:
    • $$\pi^* = \arg\max_{\pi} \mathbb{E}_{\pi} \left( \sum_{t}^{H} r_{t+1} + \alpha \mathcal{H}(\pi) \mid s_0 = s \right)$$
  • 핵심 메커니즘 및 장점:
    • 온도 파라미터 $\alpha$: 최적 정책의 무작위성/탐색성을 제어.
    • 상태 적응형 탐색 (State-wise balance):
      • 불확실하거나 보상이 낮은 위험/모호한 상태: 높은 엔트로피를 부여해 다양한 비행 궤적을 넓게 탐색.
      • 목표 격추 각도 등 명확한 고보상 상태: 낮은 엔트로피로 최적 제어 행동을 집중 수행(Exploitation).
    • Multimodal Policy 유지: 보상이 유사한 두 개 이상의 전술적 기동(예: 좌선회 vs. 우선회)이 있을 때 한쪽으로 조기 수렴하지 않고 다양한 대응 옵션을 보존.

D. Actor-Critic Methods (연속 제어 해법)

  • Value-based vs. Policy-based의 한계:
    • DQN 등 Value-based: $a^* = \arg\max_a Q(s, a)$ 계산 시, F-16 조종간/러더/스로틀과 같은 고차원 Continuous Action Space에서 매 스텝 최적화 연산이 요구되어 실시간 제어가 불가능.
    • REINFORCE 등 Policy-based: 완전한 에피소드 누적 보상 $G_t$로 가중치를 갱신하여 그라디언트 분산이 극심하고 수렴 속도가 느림.
  • Actor-Critic (AC) 통합:
    • Actor $\pi_\theta(a\vert{}s)$: 행동을 생성하는 파라메트릭 정책 모델.
    • Critic $Q(s, a)$ 또는 $V(s)$: Actor가 취한 행동을 평가하는 가치 함수.
    • 이점: $G_t$ 대신 Critic의 평가값($Q, V$, 또는 Advantage $A = Q - V$)을 사용하여 매 스텝마다 낮은 분산으로 파라미터를 효율적으로 업데이트.
  • DDPG의 특징과 한계:
    • Model-free, Off-policy 방식으로 Replay Buffer를 사용하여 표본 효율성을 높였으나, 하이퍼파라미터에 극도로 민감하고 국소 최적해(Local optima)에 빠지기 쉬움.

E. Soft Actor-Critic (SAC - 핵심 알고리즘)

  • 구조적 우수성:
    • Off-policy + Actor-Critic 구조에 Maximum Entropy 이론을 융합하여 DDPG의 불안정성과 PPO의 상대적 표본 비효율성을 극복.
  • 수학적 공식화:
    • Soft Bellman Equation:
      $$V(s_{t+1}) = \mathbb{E}_{a_{t+1} \sim \pi} [Q(s_{t+1}, a_{t+1}) - \alpha \log \pi(a_{t+1} \mid s_{t+1})]$$
    • $$Q(s_t, a_t) = r_t + \gamma \mathbb{E}_{\rho_{\pi}(s)} [V(s_{t+1})]$$
    • Critic 손실 함수 $J_Q$: Target 네트워크 $\bar{V}$를 사용한 MSE 손실 최소화.
    • Actor 손실 함수 $J_\pi$: KL-Divergence 최소화를 통해 Q-값 극대화 및 정책 엔트로피 극대화 달성:
    • $$J_{\pi} = \mathbb{E}_{s_t \sim \mathcal{D}} [\mathbb{E}_{a_t \sim \pi} [\alpha \log \pi(a_t \mid s_t) - Q(s_t, a_t)]]$$
  • 자동 온도 조정 기법 (Automated Temperature Tuning):
    • 고정된 $\alpha$는 보상 스케일 및 학습 단계에 지나치게 민감함.
    • 최소 기대 엔트로피 제약 조건($\mathcal{H}_0$)을 만족하는 Dual Objective 최적화를 통해 $\alpha$를 동적으로 업데이트:
    • $$J_{\alpha} = \mathbb{E}_{a_t \sim \pi_t} [-\alpha \log \pi_t(a_t \mid s_t) - \alpha \mathcal{H}_0]$$

F. Hierarchical Reinforcement Learning (HRL 및 제안 시스템 구조)

  • HRL 프레임워크 (Semi-Markov Decision Process):
    • 원시 물리 제어 입력(Primitive actions) 위에 시간적 추상화(Temporal abstraction)를 적용하여 Macro-action 단위를 정의함으로써 고차원 연속 제어 환경의 차원의 저주를 완화.
    • Transfer Learning, Scalability, Generalization 확보.
  • 기존 연구(Options, Meta-learning 등) 대비 본 논문의 구조적 차별점:
    1. Policy Architecture:
      • 상위 레벨: Policy Selector (Master Policy).
      • 하위 레벨: 특정 임무/기동에 특화되어 사전에 개별 훈련된 Low-level Policies.
    2. 목적의 차별성:
      • 기존 메타러닝 연구는 '새로운 미지의 태스크에 빠르게 적응'하는 것이 목표였으나, 본 연구는 '다양한 적대적 상대 및 실시간 교전 Context 변화에 맞춰 최적의 하위 전술을 동적으로 스위칭'하는 데 초점.
    3. 훈련 파이프라인의 완전 분리 (Decoupled Training):
      • 통상적인 HRL은 Selector와 하위 Policy를 번갈아 가며(Alternating) 공동 최적화함.
      • 본 연구는 F-16 6자유도 비행 환경의 극심한 복잡성과 발산 위험을 차단하기 위해, 하위 Low-level Policies 훈련을 완료한 뒤 가중치를 완전히 고정(Freeze)함.
      • 상위 Policy Selector는 고정된 하위 전술들 사이를 전환하며 Global Reward만 독립적으로 최적화하도록 설계.

쉬운 설명 :

Section III은 공중전 AI를 만들기 위해 필요한 수학적/공학적 이론들을 차근차근 짚어줍니다.

  1. 강화학습과 MDP (A, B):
  2. 비행 시뮬레이터 속에서 AI가 시행착오를 겪으며 보상을 최대화하는 행동을 배웁니다. 지금 취한 회피 기동이 10초 뒤 격추 성공이나 추락으로 이어지기 때문에, 눈앞의 이득과 먼 미래의 결과를 연결해 가치를 계산하는 temporal difference(TD) 방식을 기반으로 삼습니다.
  3. 최대 엔트로피 RL과 연속 제어의 난제 (C, D):
  4. 전투기는 스틱을 미세하게 당기고 스로틀을 밟아야 하는 정밀 연속 제어가 필요하므로, 조종 행동을 결정하는 'Actor'와 이를 평가하는 'Critic'으로 역할을 나눈 Actor-Critic 방식을 씁니다. 이때 AI가 늘 뻔한 비행 패턴에 갇히지 않도록, 높은 점수를 내면서도 최대한 다양하고 예측하기 어려운 기동(엔트로피)을 시도하게 만드는 이론을 적용합니다.
  5. Soft Actor-Critic, SAC (E):
  6. 위 이론을 가장 안정적으로 구현한 핵심 엔진이 SAC입니다. AI가 얼마나 새로운 탐색을 할지 결정하는 민감한 수치($\alpha$)를 상황에 맞게 신경망이 스스로 조절하도록 만들어, 방대한 비행 데이터 속에서도 흔들리지 않고 매우 빠르고 안정적으로 학습합니다.
  7. 계층형 구조, HRL (F):그래서 역할을 둘로 쪼갰습니다:
    • 하위 정책들: 급선회, 고속 이탈 등 특정 기동만 완벽히 수행하는 특수 기술들을 미리 따로 학습시켜 단단하게 얼려둡니다.
    • 상위 선택기: 교전 상황을 보며 "지금은 회피 기술", "지금은 추격 기술"처럼 상황에 맞는 최적의 하위 기술로 스위치만 켜주게 합니다.
    위아래를 복잡하게 동시에 학습시키지 않고 분리(Decoupling)함으로써, 실제 전투기 수준의 극도로 정밀한 시뮬레이션 환경에서도 AI가 고장 나지 않고 최고의 공중전 성능을 내도록 만들었습니다.
  8. 하지만 아무리 SAC이 뛰어나도, "비행기 물리 엔진 제어"부터 "적기 요격 전술"까지 신경망 하나로 한 번에 배우게 하면 환경이 너무 복잡해 학습이 터져버립니다.