관리 메뉴

AI바라기의 인공지능

LLM : 논문 리뷰 : STaR: Self-Taught Reasoner Bootstrapping Reasoning With Reasoning 본문

논문리뷰

LLM : 논문 리뷰 : STaR: Self-Taught Reasoner Bootstrapping Reasoning With Reasoning

AI바라기 2026. 9. 16. 13:30

용어 설명

  • STaR (Self-Taught Reasoner): LLM이 스스로 rationale(추론 과정)을 생성하고, 정답 여부에 따라 필터링된 데이터셋으로 자기 자신을 반복적으로 fine-tuning하여 추론 능력을 점진적으로 부트스트래핑(bootstrapping)하는 프레임워크.
  • Rationale / Scratchpad: 최종 answer를 도출하기 전에 모델이 생성하는 중간 단계의 step-by-step reasoning(연쇄적 사고 과정) 텍스트.
  • Rationalization (사후 정당화/역추론): 모델이 문제를 틀렸을 때, 정답(ground-truth answer)을 힌트(hint)로 제공하여 모델이 정답으로부터 역방향으로 추론(reason backward)하여 올바른 rationale을 생성하도록 유도하는 기법.
  • Drift: 반복적인 self-training 과정에서 생성된 rationale의 스타일이나 내용이 초기 demonstration(few-shot prompt)의 형식과 기준에서 점차 벗어나는 현상.
  • Expert Iteration (ExIt): 강화학습(RL) 기반 기법으로, 탐색(search)을 통해 찾은 해를 이용해 imitation learning으로 apprentice(학습자)를 개선하고 점진적으로 모델을 강화하는 반복 학습 방식 (STaR의 이론적 모태).
  • Faithfulness: 모델이 겉으로 출력한 rationale(설명)이 모델의 내부 실제 연산/추론 프로세스를 얼마나 진실되게 반영하고 있는지를 나타내는 척도.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • Rationale 기반의 추론(예: Chain-of-Thought)은 성능 향상에 유효하지만, 수만 개의 고품질 rationale을 수작업이나 템플릿으로 구축하는 것은 막대한 비용이 들고 확장성이 없음.
    • 반면 few-shot prompt 방식은 정답 레이블이 대량으로 존재하는 dataset을 직접 지도학습(fine-tuning)한 모델보다 성능이 크게 뒤처짐.
  • 새로운 접근 방식 제시:
    • 대규모의 "rationale이 없는 문제-정답 쌍"과 소수의 "few-shot rationale 예시"만을 활용하여, 모델이 생성한 reasoning으로 모델 자체를 fine-tuning하는 자기 지도형 반복 루프(Bootstrapping) 체계를 제안.
    • 특히 단순 필터링 시 실패한 문제로부터는 학습 신호를 얻지 못하는 구조적 한계를 극복하기 위해 정답을 힌트로 주어 rationale을 역생성하는 Rationalization 기법을 최초 도입.

Key Contributions & Novelty

  • STaR (Self-Taught Reasoner) 프레임워크 제안:
    • 외부의 rationale correctness 검증자(verifier)나 사람의 개입 없이, 오직 최종 answer의 정답 여부만을 판별 신호(reward)로 삼아 reasoning 능력을 bootstrapping하는 루프 구축.
    • Novelty: LLM 자체의 language modeling capacity를 활용해 모델이 스스로 학습 데이터를 생성하고 자가 개선(self-improve)을 달성하는 선구적 메커니즘.
  • Rationalization 메커니즘 고안:
    • 모델이 맞히지 못한 문제에 대해 정답을 힌트로 입력(add_hint)하여 정답 기반의 rationale을 역생성한 뒤, 학습 단계에서는 힌트를 제거하고 마치 모델이 자발적으로 reasoning한 것처럼 data를 구성하여 fine-tuning에 활용.
    • Novelty: 미해결 고난도 문제에 대한 training signal 부재 문제를 해결하고, exploration space를 넓혀 학습 정체(saturation)를 방지.
  • RL Policy Gradient와의 이론적 연결:
    • STaR를 이산 잠재 변수 모델(latent variable model) 상에서 greedy decoding과 배치 업데이트를 적용한 강화학습 policy gradient의 근사 기법으로 해석 제시.
    • Rationalization을 hint-augmented proposal distribution에서 샘플링하는 off-policy 추정치로 이론화.

Experimental Highlights

  • 실험 환경 및 모델:
    • Base model: GPT-J (6B parameters)
    • Tasks & Datasets: Symbolic Arithmetic (n-digit addition), CommonsenseQA (CQA, 상식 추론), GSM8K (초등 수학 문장제 문제).
  • CommonsenseQA (CQA) 결과:
    • Few-shot CoT GPT-J (36.6%) 대비 STaR without rationalization은 68.8%, STaR with rationalization은 72.5% 로 비약적 상승.
    • 전체 데이터를 direct answer로 학습한 GPT-J Direct Finetuned(60.0%)를 크게 능가.
    • 30배 더 큰 모델인 GPT-3 Direct Finetuned (73.0%)에 근접하는 성능 달성 (72.5% vs 73.0%).
    • LaMDA 137B의 Few-shot CoT(55.6%)를 월등히 상회.
  • Arithmetic (기호 추론) 결과:
    • 2-digit 덧셈의 Few-shot accuracy는 1% 미만이었으나, rationalization 1회 적용 후 32%로 급상승, 최종 16 iterations 후 89.5% 달성 (non-rationale baseline 76.3% 대비 대폭 향상).
    • 학습 과정에서 전혀 보지 못한 9자리, 10자리 덧셈 문제에서도 out-of-distribution 일반화 능력 검증.
  • GSM8K 결과:
    • Few-shot CoT (3.1%), Direct Finetuned (5.8%) 대비 STaR with rationalization은 10.7% 로 두 배 가까운 성능 도출.
  • Human Evaluation:
    • Prolific 평가자 대상 선호도 조사 결과, 참가자들은 Few-shot rationale 대비 STaR 생성 rationale을 30% 더 선호(p = .039), 기존 인간 작성 rationale 대비 74% 더 선호(p < .001).

Limitations and Future Work

  • 초기 모델 크기 및 성능 의존성:
    • 초기 iteration에서 최소한의 유효 rationale을 생성해야 하므로 기본 reasoning 역량이 전제되어야 함 (실제 실험에서 GPT-2급 소형 모델은 bootstrapping 시작조차 실패).
  • 높은 Chance Performance(찍기) 환경의 노이즈:
    • Binary decision(Yes/No)이나 선택지가 적은 task의 경우, 우연히 정답을 맞힌 잘못된 reasoning(spurious rationale)이 필터링을 통과하여 학습 데이터를 오염시킬 위험 존재.
  • Faithfulness(신뢰성) 검증의 한계:
    • 생성된 rationale이 겉보기에 논리적이더라도 모델의 실제 내부 연산 과정을 정직하게 반영하는지(post-hoc rationalization 여부) 완벽히 보장할 수 없음.
  • Future Work:
    • 정답 레이블이 없는 dataset에서 consistency(다수결) 기법과 결합한 비지도 STaR 확장 연구.
    • 다양한 hinting 방식의 일반화 및 RL objective와의 정밀한 수학적 연결 규명.

Overall Summary

이 논문은 고비용의 인간 레이블 rationale 없이도 사전 학습된 대형 언어 모델이 스스로 reasoning 과정을 생성하고 검증하여 성능을 극대화하는 STaR (Self-Taught Reasoner) 프레임워크를 제안합니다. 모델이 문제를 틀렸을 때 정답을 역으로 주입해 추론을 유도하는 Rationalization 기법을 통해 실패한 예시에서도 풍부한 학습 신호를 추출해 냅니다. 실험을 통해 6B 크기의 GPT-J 모델만으로도 30배 더 큰 GPT-3 및 137B LaMDA의 성능을 위협하거나 능가할 수 있음을 증명하며, LLM이 외부 데이터의 추가 없이 자기 자신의 생성 능력만으로 스스로를 진화시키는 자가 학습(self-improvement) 패러다임의 가능성을 확립했습니다.


쉬운 설명

이 논문은 **"스스로 오답 노트를 만들고 해설지를 보며 공부법을 터득하는 똑똑한 학생의 자습 방식"**과 같습니다.
학생(LLM)이 혼자서 연습문제를 풀 때, 풀이 과정(rationale)을 직접 써가며 문제를 풉니다.

  1. 우연이든 실력이든 맞힌 문제의 풀이법은 좋은 공식으로 외워둡니다 (Filtering & Fine-tuning).
  2. 반면 틀린 문제는 그냥 버리지 않고, 뒤편의 **정답(Hint)을 슬쩍 먼저 본 뒤 "아, 이 정답이 나오려면 중간에 이런 생각을 거쳤어야 했구나!" 하고 풀이 과정을 거꾸로 역추론(Rationalization)**해 냅니다.
  3. 그러고는 정답 힌트를 봤다는 사실은 싹 지운 채, 자신이 완벽하게 풀어낸 풀이인 것처럼 오답 노트에 정리하여 반복 학습합니다.
    이 자습 과정을 수차례 반복하자, 기초 실력만 겨우 있던 학생이 혼자 힘으로 대형 학원의 족집게 과외를 받은 최상위권 학생(초대형 모델) 수준의 추론력을 갖추게 되는 원리입니다.