언어 모델 강화를 위한 확장 가능한 강화 학습 알고리즘 GSPO 공개
새로운 강화 학습 알고리즘 GSPO가 언어 모델의 학습 안정성, 효율성, 성능을 향상한다. 시퀀스 수준 최적화를 통해 기존 GRPO의 불안정성을 해결하고, MoE 모델 학습 및 RL 인프라를 간소화한다.
새로운 강화 학습(RL) 알고리즘인 그룹 시퀀스 정책 최적화(GSPO)가 언어 모델의 확장성을 높이고 안정적인 학습을 가능하게 한다. GSPO는 기존 RL 알고리즘과 달리 시퀀스 우도(sequence likelihood)를 기반으로 중요도 비율을 정의하고, 시퀀스 수준의 클리핑, 보상, 최적화를 수행하는 것이 특징이다. 이러한 접근 방식은 학습 효율성과 성능을 크게 향상하며, 특히 대규모 혼합 전문가(MoE) 모델의 RL 학습에서 안정성을 제공한다. GSPO는 최신 Qwen3 모델(Instruct, Coder, Thinking)의 뛰어난 성능에 기여한 핵심 알고리즘으로 알려졌다.
기존 강화 학습 알고리즘, 특히 GRPO와 같은 방식은 장기간 학습 시 심각한 불안정성 문제를 겪으며, 이는 되돌릴 수 없는 모델 붕괴로 이어져 컴퓨팅 자원 증가에도 불구하고 성능 향상을 저해하는 한계가 있었다. 언어 모델의 추론 및 문제 해결 능력을 강화하기 위해 RL을 확장하려면 안정적이고 견고한 학습 역학을 유지하는 것이 필수적이다. GSPO는 이러한 기존 알고리즘의 불안정성 문제를 해결하고, RL 학습의 확장성을 성공적으로 구현하기 위해 개발되었다.
GSPO의 최적화 목표는 이전 정책($\pi_{\theta_\mathrm{old}}$)으로 샘플링된 응답 그룹($\{y_i\}_{i=1}^G$)과 각 응답의 그룹 상대적 이점($\widehat{A}_{i}$)을 활용하여 현재 정책($\pi_\theta$)을 최적화하는 것이다. 여기서 중요도 비율 $s_i(\theta)$는 시퀀스 우도에 기반하며, 분산을 줄이고 수치 범위를 통일하기 위해 길이 정규화가 적용된다. 이는 토큰 수준이 아닌 시퀀스 전체의 맥락에서 학습 신호를 처리하여 기존 방식의 노이즈를 줄이고 효율성을 높이는 데 기여한다.
GSPO의 성능은 Qwen3-30B-A3B-Base 모델을 콜드 스타트(cold-start) 방식으로 미세 조정하여 GRPO와 비교하는 실험을 통해 검증되었다. AIME'24, LiveCodeBench, CodeForces 벤치마크에서 GSPO는 GRPO 대비 현저히 높은 학습 효율성을 보였으며, 동일한 학습 비용으로 더 나은 성능을 달성했다. 특히 GSPO는 학습 컴퓨팅 자원을 늘리고, 쿼리 세트를 정기적으로 업데이트하며, 생성 길이를 확장함으로써 지속적인 성능 향상을 이끌어낼 수 있음을 입증했다. 흥미로운 점은 GSPO가 GRPO보다 두 자릿수 높은 비율의 토큰을 클리핑했음에도 불구하고 더 높은 학습 효율성을 보였다는 것이다. 이는 GRPO의 토큰 수준 최적화 목표가 노이즈가 많고 비효율적임을 시사한다.
GSPO는 MoE 모델의 강화 학습에 특히 중요한 이점을 제공한다. 기존 GRPO 알고리즘을 MoE 모델에 적용할 경우, 전문가 활성화의 변동성으로 인해 RL 학습이 제대로 수렴하지 못하는 문제가 있었다. 이를 해결하기 위해 '라우팅 리플레이(Routing Replay)' 학습 전략이 사용되었는데, 이는 이전 정책에서 활성화된 전문가를 캐싱하고 중요도 비율 계산 시 이 라우팅 패턴을 재현하는 방식이다. 그러나 라우팅 리플레이는 추가적인 메모리 및 통신 오버헤드를 발생시키고 MoE 모델의 실제 용량을 제한할 수 있었다.
GSPO는 라우팅 리플레이 전략에 대한 의존성을 완전히 제거한다. GSPO는 개별 토큰 우도에 민감하지 않고 시퀀스 수준 우도에만 집중하기 때문에, 라우팅 리플레이와 같은 인프라 집약적인 해결책이 필요 없다. 이는 학습 과정을 간소화하고 안정화하며, MoE 모델이 최대 용량을 활용할 수 있도록 돕는다. 또한, GSPO는 토큰 수준이 아닌 시퀀스 수준 우도를 최적화에 사용하므로 정밀도 불일치에 훨씬 더 강건하다. 따라서 추론 엔진에서 반환된 우도를 학습 엔진에서 재계산할 필요 없이 직접 최적화에 사용할 수 있어, 부분 롤아웃, 다중 턴 RL, 학습-추론 분리 프레임워크와 같은 시나리오에서 RL 인프라를 크게 단순화할 수 있다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
GSPO: Towards Scalable Reinforcement Learning for Language Models
원문 발행: 2025-07-27 16:00:00
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.